Search (43 results, page 2 of 3)

Lewandowski, D.: Perspektiven eines Open Web Index (2016) 0.01
```
0.009443234 = product of:
  0.037772935 = sum of:
    0.037772935 = weight(_text_:und in 3935) [ClassicSimilarity], result of:
      0.037772935 = score(doc=3935,freq=6.0), product of:
        0.12713796 = queryWeight, product of:
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.057323597 = queryNorm
        0.29710194 = fieldWeight in 3935, product of:
          2.4494898 = tf(freq=6.0), with freq of:
            6.0 = termFreq=6.0
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.0546875 = fieldNorm(doc=3935)
  0.25 = coord(1/4)
```
Abstract

Der Suchmaschinenmarkt wird seit vielen Jahren von nur einer einzigen Suchmaschine, Google, dominiert. Es wurde mittlerweile erkannt, dass diese Situation nicht wünschenswert ist. Wir sprechen nun über mögliche Lösungen. Der Artikel diskutiert unterschiedliche Lösungsansätze und fokussiert dabei auf die Idee einen Offenen Web-Index (OWI), der als öffentliche Infrastruktur verfügbar gemacht werden soll. Die Grundidee ist die Trennung von Datenbestand (Index) und darauf aufsetzenden Diensten, welche in großer Zahl in privater Initiative betrieben werden können. Es geht also darum, die Basis für Vielfalt zu schaffen.

Source

Information - Wissenschaft und Praxis. 67(2016) H.1, S.15-21
Lewandowski, D.: Mit welchen Kennzahlen lässt sich die Qualität von Suchmaschinen messen? (2007) 0.01
```
0.009346376 = product of:
  0.037385505 = sum of:
    0.037385505 = weight(_text_:und in 1378) [ClassicSimilarity], result of:
      0.037385505 = score(doc=1378,freq=8.0), product of:
        0.12713796 = queryWeight, product of:
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.057323597 = queryNorm
        0.29405463 = fieldWeight in 1378, product of:
          2.828427 = tf(freq=8.0), with freq of:
            8.0 = termFreq=8.0
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.046875 = fieldNorm(doc=1378)
  0.25 = coord(1/4)
```
Abstract

Suchmaschinen bilden den bedeutendsten Zugang zu den im World Wide Web verfügbaren Informationen und haben andere Zugänge zu diesem Informationsbestand (wie etwa Internetverzeichnisse) weitgehend verdrängt. Der Suchmaschinenmarkt ist stark konzentriert; nur wenige Anbieter mit eigener Technologie bieten selbst Endnutzerlösungen an und lizenzieren ihre Technologie an die bekannten Web-Portale wie AOL oder T-Online. Die im vorliegenden Kapitel dargestellten Kennzahlen zur Messung der Qualität von Suchmaschinen basieren einerseits auf Erkenntnissen über den State of the Art der Suchmaschinentechnologie, andererseits stehen sie im Kontext eines umfassenderen Modells der Qualitätsmessung für Web-Suchmaschinen. Die besondere Bedeutung von Erkenntnissen über die Qualität der bestehenden Suchmaschinen ergibt sich einerseits aus ihrer Bedeutung für die Weiterentwicklung der Suchmaschinentechnologie. Qualitätsuntersuchungen geben Hinweise auf die Schwachstellen der Suchmaschinen im Allgemeinen und die ihrer Ranking-Algorithmen im Besonderen. Letztere sind als zentral für die Ergebnisqualität anzusehen und bilden den >Kern< der technologischen Leistungsfähigkeit einer jeden Suchmaschine.
Lewandowski, D.: ¬Die Macht der Suchmaschinen und ihr Einfluss auf unsere Entscheidungen (2014) 0.01
```
0.009346376 = product of:
  0.037385505 = sum of:
    0.037385505 = weight(_text_:und in 2491) [ClassicSimilarity], result of:
      0.037385505 = score(doc=2491,freq=8.0), product of:
        0.12713796 = queryWeight, product of:
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.057323597 = queryNorm
        0.29405463 = fieldWeight in 2491, product of:
          2.828427 = tf(freq=8.0), with freq of:
            8.0 = termFreq=8.0
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.046875 = fieldNorm(doc=2491)
  0.25 = coord(1/4)
```
Abstract

Wenn man die Recherche in Suchmaschinen als Vorbereitung einer Entscheidung betrachtet, kommt diesen Suchwerkzeugen aufgrund der Masse der an sie gestellten Anfragen eine nicht zu unterschätzende Bedeutung zu. Macht haben Suchmaschinen vor allem dadurch, dass sie entscheiden, was ein Nutzer zu seiner Suchanfrage zu sehen bekommt, verstärkt durch die Entscheidung, an welcher Stelle und in welcher Darstellungsform die Ergebnisse angezeigt werden. Im Suchprozess gibt es zahlreiche Stellen, an denen das Design der Suchmaschine die Entscheidung des Nutzers für oder gegen bestimmte Ergebnisse beeinflusst. Zusammen mit der externen Beeinflussung der Suchergebnisse durch sog. Suchmaschinenoptimierung ergibt sich eine Steuerung der Nutzer hin zu bestimmten Ergebnissen und Ergebnisformen. Der Artikel zeigt, wo Suchmaschinen Einfluss auf unsere Entscheidungsvorbereitung bzw. Entscheidungsfindung nehmen, an welchen Punkten dem durch einen bewussteren Umgang mit den Suchmaschinen entgegengewirkt werden kann, aber auch wo die Grenzen der eigenen Entscheidungsmöglichkeiten liegen.

Source

Information - Wissenschaft und Praxis. 65(2014) H.4/5, S.231-238

Lewandowski, D.; Spree, U.: ¬Die Forschungsgruppe Search Studies an der HAW Hamburg (2019) 0.01

0.009346376 = product of:
  0.037385505 = sum of:
    0.037385505 = weight(_text_:und in 21) [ClassicSimilarity], result of:
      0.037385505 = score(doc=21,freq=2.0), product of:
        0.12713796 = queryWeight, product of:
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.057323597 = queryNorm
        0.29405463 = fieldWeight in 21, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.09375 = fieldNorm(doc=21)
  0.25 = coord(1/4)

Source: Information - Wissenschaft und Praxis. 70(2019) H.1, S.1-2

Lewandowski, D.: Alles nur noch Google? : Entwicklungen im Bereich der WWW-Suchmaschinen (2002) 0.01
```
0.008811849 = product of:
  0.035247397 = sum of:
    0.035247397 = weight(_text_:und in 1997) [ClassicSimilarity], result of:
      0.035247397 = score(doc=1997,freq=4.0), product of:
        0.12713796 = queryWeight, product of:
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.057323597 = queryNorm
        0.2772374 = fieldWeight in 1997, product of:
          2.0 = tf(freq=4.0), with freq of:
            4.0 = termFreq=4.0
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.0625 = fieldNorm(doc=1997)
  0.25 = coord(1/4)
```
Abstract

"Alle benutzen Google". So läßt sich kurz und prägnant die Entwicklung im Bereich der WWW-Suche in der letzten Zeit auf den Punkt bringen. Durch gute Suchergebnisse und eine schlichte, ausgesprochen gut bedienbare Benutzerschnittstelle hat sich Google als die Suchmaschine für alle Zwecke etabliert. Im Zuge dieser Entwicklung fanden größere Veränderungen auf dem Markt statt: Einige Bewerber mussten ihre Suchwerkzeuge aufgeben, neue Firmen haben dafür die Herausforderung angenommen, dem Benutzer noch bessere Ergebnisse oder wenigsten innovative Features zu bieten
Lewandowski, D.: Web Information Retrieval (2005) 0.01
```
0.008811849 = product of:
  0.035247397 = sum of:
    0.035247397 = weight(_text_:und in 5028) [ClassicSimilarity], result of:
      0.035247397 = score(doc=5028,freq=16.0), product of:
        0.12713796 = queryWeight, product of:
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.057323597 = queryNorm
        0.2772374 = fieldWeight in 5028, product of:
          4.0 = tf(freq=16.0), with freq of:
            16.0 = termFreq=16.0
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.03125 = fieldNorm(doc=5028)
  0.25 = coord(1/4)
```
Abstract

WebInformationRetrieval hat sich als gesonderter Forschungsbereich herausgebildet. Neben den im klassischen Information Retrieval behandelten Fragen ergeben sich durch die Eigenheiten des Web neue und zusätzliche Forschungsfragen. Die Unterschiede zwischen Information Retrieval und Web Information Retrieval werden diskutiert. Derzweite Teil des Aufsatzes gibt einen Überblick über die Forschungsliteratur der letzten zwei Jahre. Dieser Aufsatz gibt einen Überblick über den Stand der Forschung im Bereich Web Information Retrieval. Im ersten Teil werden die besonderen Probleme, die sich in diesem Bereich ergeben, anhand einer Gegenüberstellung mit dem "klassischen" Information Retrieval erläutert. Der weitere Text diskutiert die wichtigste in den letzten Jahren erschienene Literatur zum Thema, wobei ein Schwerpunkt auf die - so vorhanden-deutschsprachige Literatur gelegt wird. Der Schwerpunkt liegt auf Literatur aus den Jahren 2003 und 2004. Zum einen zeigt sich in dem betrachteten Forschungsfeld eine schnelle Entwicklung, so dass viele ältere Untersuchungen nur noch einen historischen bzw. methodischen Wert haben; andererseits existieren umfassende ältere Reviewartikel (s. v.a. Rasmussen 2003). Schon bei der Durchsicht der Literatur wird allerdings deutlich, dass zu einigen Themenfeldern keine oder nur wenig deutschsprachige Literatur vorhanden ist. Leider ist dies aber nicht nur darauf zurückzuführen, dass die Autoren aus den deutschsprachigen Ländern ihre Ergebnisse in englischer Sprache publizieren. Vielmehr wird deutlich, dass in diesen Ländern nur wenig Forschung im Suchmaschinen-Bereich stattfindet. Insbesondere zu sprachspezifischen Problemen von Web-Suchmaschinen fehlen Untersuchungen. Ein weiteres Problem der Forschung im Suchmaschinen-Bereich liegt in der Tatsache begründet, dass diese zu einem großen Teil innerhalb von Unternehmen stattfindet, welche sich scheuen, die Ergebnisse in großem Umfang zu publizieren, da sie fürchten, die Konkurrenz könnte von solchen Veröffentlichungen profitieren. So finden sich etwa auch Vergleichszahlen über einzelne Suchmaschinen oft nur innerhalb von Vorträgen oder Präsentationen von Firmenvertretern (z.B. Singhal 2004; Dean 2004). Das Hauptaugenmerk dieses Artikels liegt auf der Frage, inwieweit Suchmaschinen in der Lage sind, die im Web vorhanden Inhalte zu indexieren, mit welchen Methoden sie dies tun und ob bzw. wie sie ihre Ziele erreichen. Ausgenommen bleiben damit explizit Fragen der Effizienz bei der Erschließung des Web und der Skalierbarkeit von Suchmaschinen. Anders formuliert: Diese Übersicht orientiert sich an klassisch informationswissenschaftlichen Fragen und spart die eher im Bereich der Informatik diskutierten Fragen weitgehend aus.
Eine regelmäßige Übersicht neuer US-Patente und US-Patentanmeldungen im Bereich Information Retrieval bietet die News-Seite Resourceshelf (www.resourceshelf.com).

Source

Information - Wissenschaft und Praxis. 56(2005) H.1, S.5-12
Lewandowski, D.: Query understanding (2011) 0.01
```
0.008811849 = product of:
  0.035247397 = sum of:
    0.035247397 = weight(_text_:und in 1344) [ClassicSimilarity], result of:
      0.035247397 = score(doc=1344,freq=4.0), product of:
        0.12713796 = queryWeight, product of:
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.057323597 = queryNorm
        0.2772374 = fieldWeight in 1344, product of:
          2.0 = tf(freq=4.0), with freq of:
            4.0 = termFreq=4.0
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.0625 = fieldNorm(doc=1344)
  0.25 = coord(1/4)
```
Abstract

In diesem Kapitel wird beschrieben, wie Suchmaschinen Suchanfragen interpretieren können, um letztendlich den Nutzern besser auf ihren Kontext zugeschnittene Ergebnisse liefern zu können. Nach einer Diskussion der Notwendigkeit und der Einsatzmöglichkeiten des Query Understanding wird aufgezeigt, auf welcher Datenbasis und an welchen Ansatzpunkten Suchanfragen interpretiert werden können. Dann erfolgt eine Erläuterung der Interpretationsmöglichkeiten anhand der Suchanfragen-Facetten von Calderon-Benavides et al. (2010), welcher sich eine Diskussion der Verfahren zur Ermittlung der Facetten anschließt.
Haring, M.; Rudaev, A.; Lewandowski, D.: Google & Co. : wie die "Search Studies" an der HAW Hamburg unserem Nutzungsverhalten auf den Zahn fühlen: Blickpunkt angewandte Forschung (2022) 0.01
```
0.008811849 = product of:
  0.035247397 = sum of:
    0.035247397 = weight(_text_:und in 1631) [ClassicSimilarity], result of:
      0.035247397 = score(doc=1631,freq=4.0), product of:
        0.12713796 = queryWeight, product of:
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.057323597 = queryNorm
        0.2772374 = fieldWeight in 1631, product of:
          2.0 = tf(freq=4.0), with freq of:
            4.0 = termFreq=4.0
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.0625 = fieldNorm(doc=1631)
  0.25 = coord(1/4)
```
Abstract

Die Forschungsgruppe Search Studies forscht an der HAW Hamburg zur Nutzung kommerzieller Suchmaschinen, zur Suchmaschinenoptimierung und zum Relevance Assessment von Suchmaschinen. Der Leiter der Forschungsgruppe, Prof. Dr. Dirk Lewandowski, stand für ein Interview zu seiner Tätigkeit und der seines Teams, sowie seiner Lehre an der HAW Hamburg zur Verfügung. Sollten wir Informationen aus dem Internet vertrauen oder ist Vorsicht angebracht?
Lewandowski, D.: Suchmaschine im Betriebssystem (2005) 0.01
```
0.0081780795 = product of:
  0.032712318 = sum of:
    0.032712318 = weight(_text_:und in 4438) [ClassicSimilarity], result of:
      0.032712318 = score(doc=4438,freq=18.0), product of:
        0.12713796 = queryWeight, product of:
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.057323597 = queryNorm
        0.2572978 = fieldWeight in 4438, product of:
          4.2426405 = tf(freq=18.0), with freq of:
            18.0 = termFreq=18.0
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.02734375 = fieldNorm(doc=4438)
  0.25 = coord(1/4)
```
Content

"Bei der Vielzahl der angebotenen Werkzeuge fällt die Entscheidung schwer. Schließlich braucht man ein solches Tool lediglich, um die auf dem eigenen Rechner vorhandenen Dateien durchsuchbar zu machen. Warum benötigt man überhaupt ein Zusatzprogramm? Die Antwort lautet, dass die gängigen Betriebssysteme mangelhaft sind: Wer die Dateisuche zum Beispiel in Windows einmal benutzt hat, möchte dies am liebsten nie wieder tun. Die Dateien des eigenen Rechners sind nicht indiziert, so dass die gesamte Festplatte bei jeder Suchanfrage durchsucht werden muss. Die Suche dauert lange und erfasst in der Standardeinstellung nur die Dateinamen, nicht den Inhalt der Dateien. Seit längerem haben sowohl Microsoft als auch Apple angekündigt, damit in künftigen Versionen ihrer Betriebssysteme Schluss zu machen. Während der Start der neuen Windows-Version "Longhorn" in weiter Ferne liegt, hat die neueste Version von Apples OS X ("Tiger") mit dem prominent platzierten Suchtool "Spotlight" eine Desktop-Suche integriert. Diese durchsucht schnell Dokumente, Ordner, Kontakte, Lesezeichen und E-Mails. Voraussetzung ist allerdings, dass man für EMails und Internet auch die Apple-eigenen Programme verwendet. Eine Kombination von Desktop- und Web-Suche ist (zumindest bisher) nicht realisiert. Die Anwendung zeigt jedoch, wie sich die Suche direkt ins Betriebssystem integrieren lässt. Ähnliches dürfte von Microsoft zu erwarten sein. Da die Suche in Zukunft zu einem integralen Bestandteil der Arbeitsumgebung wird und damit die Unterschiede zwischen der Suche auf dem eigenen Rechner und der Suche im Web verschwimmen, stellen die in die Betriebssysteme integrierten Suchfunktionen eine Konkurrenz für die Suchmaschinen dar. Diese reagieren, indem sie eigene Suchtools anbieten und damit rechnen, dass sich die Nutzer so an diese gewöhnen, dass sie sie trotz der vorinstallierten Konkurrenz weiter benutzen. Dazu müssen sie allerdings einen Zusatznutzen bieten. Die Einführung der Google-Desktop-Suche (siehe Password 11 /2004) hat diese Art von Suchwerkzeug schlagartig bekannt gemacht. Seitdem hat sich auf dem Markt einiges getan. Nach dem Privatnutzer haben die Anbieter die Unternehmenskunden in den Blick gneommen. So wendet sich eine neue Version des Google-Tools speziell an diese Nutzergruppe. Auch sie ist kostenlos und kann nach vorheriger Registrierung unter http://desktop.google.com/enterprise heruntergeladen werden.
Wichtig bei einer Entscheidung für ein bestimmtes Suchtool ist der den individuellen Bedürfnissen angepasste Funktionsumfang. Neben der Dateisuche, die alle Programme für die gängigen Formate bewerkstelligen, sollte beispielsweise geprüft werden, welche E-Mail-Formate unterstützt werden. Am wenigsten Probleme hat man wie auch sonst, wenn man nur die Standardsoftware von Microsoft verwendet - deren Dateiformate werden von allen Suchtools unterstützt. Verwendet man aber Programme mit "exotischeren" Dateiformaten oder möchte man beispielsweise Protokolle aus dem Instant Messaging durchsuchen, so wird die Auswahl der Programme deutlich eingeschränkt. Vor der Installation eines Programms sollte man also genau prüfen, ob es den eigenen Anforderungen genügt. Hilfreich ist die umfassende und aktuelle Übersicht des "Suchberaters" Goebel Group unter http://www.goebelgroup.com/desktopmatrix.htm. In dieser Übersicht sind die Preise der einzelnen Tools angegeben. Denn vor allem die von den großen Web-Suchmaschinen angebotenen Werkzeuge sind kostenlos. Mächtigere Programme kosten Geld - auch das sollte man im Umfeld der von den Suchmaschinen repräsentierten Kostenlos-Kultur nicht vergessen. Letztlich sollte der individuelle Nutzen für die Wahl entscheidend sein."
Lewandowski, D.: Web Information Retrieval : Technologien zur Informationssuche im Internet (2005) 0.01
```
0.007942894 = product of:
  0.031771574 = sum of:
    0.031771574 = weight(_text_:und in 622) [ClassicSimilarity], result of:
      0.031771574 = score(doc=622,freq=52.0), product of:
        0.12713796 = queryWeight, product of:
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.057323597 = queryNorm
        0.2498984 = fieldWeight in 622, product of:
          7.2111025 = tf(freq=52.0), with freq of:
            52.0 = termFreq=52.0
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.015625 = fieldNorm(doc=622)
  0.25 = coord(1/4)
```
Abstract

Verfahren des Information Retrieval haben in den letzten Jahren eine enorme Bedeutung erlangt. Während diese Verfahren jahrzehntelang nur Einsatz in spezialisierten Datenbanken fanden, haben sie durch das Aufkommen von Suchmaschinen im World Wide Web mittlerweile eine zentrale Bedeutung in der Informationsversorgung eingenommen. Verfahren des Web Information Retrieval entscheiden darüber, welche Informationen von Nutzern gefunden werden; man spricht auch von einer "Gatekeeper"-Funktion der Suchmaschinen. Diese sind zum bedeutendsten Rechercheinstrument sowohl im privaten, beruflichen als auch wissenschaftlichen Bereich avanciert. Google, die berühmteste der "Information-Retrieval-Firmen", ist fast täglich in den Schlagzeilen zu finden. Immer neue Innovationen (nicht nur dieses Anbieters) zeigen die Web-Suche als dynamisches Feld. Vor allem wird durch die zahlreichen Neuerungen der letzten Jahre, teilweise erst der letzten Monate, deutlich, dass die Suche im Web trotz ihrer mittlerweile fast zehnjährigen Geschichte erst am Anfang steht. Dass dem Web Information Retrieval eine hohe Bedeutung zugemessen wird, zeigt sich auch im wachsenden Interesse kommerzieller Unternehmen an diesem Thema. Ein Blick auf die Sponsorenliste der letztjährigen Konferenz der ACM Special Interest Group on Information Retrieval mag dies verdeutlichen: Neben den wichtigen Suchmaschinen-Anbietern Google, Microsoft, Yahoo und Ask Jeeves finden sich auch Großunternehmen wie IBM, Canon und Sharp. Auch in der gesellschaftlichen Diskussion sind die Suchmaschinen angekommen: Es findet gegenwärtig eine Diskussion um die "Google-Gesellschaft" statt, wobei gefragt wird, inwieweit ein einzelner Anbieter bzw. wenige Anbieter darüber entscheiden sollten, welche Informationen beim Nutzer angelangen. In dieser Hinsicht befassen sich inzwischen auch politische Parteien mit dem Thema. So publizierte etwa die Gründe Bundestagsfraktion ein Diskussionspapier unter dem Titel "Suchmaschinen: Tore zum Netz", in welchem unter anderem die Rolle der Suchmaschinen beim Zugang zu Informationen und Probleme des Datenschutzes bei der Suchmaschinennutzung angesprochen werden.
Die vorliegende Arbeit setzt auf einer eher technischen Ebene an und bietet die Grundlagen für das Verständnis der Funktionsweise und der Defizite von Web-Suchmaschinen. Während zum klassischen Information Retrieval eine breite Auswahl an Literatur vorliegt, gibt es bisher kein Werk, welches eine umfassende Darstellung des Web Information Retrieval mit seinen Unterscheidungen und Besonderheiten gegenüber dem "klassischen" Information Retrieval bietet. Monographien zum Thema Suchmaschinen behandeln vor allem deren Suchfunktionen oder konzentrieren sich allein auf algorithmische Aspekte des Web Information Retrieval. Die Forschungslitertaur liegt zum überwältigenden Teil nur in englischer Sprache vor; die Forschung selbst findet zu einem großen Teil in den USA statt. Aus diesem Grund werden Spezifika anderer Sprachen als des Englischen sowie Besonderheiten auf nationaler oder gar kontinentaler Ebene vernachlässigt. Die Konsequenzen, die sich aus den Besonderheiten des Web Information Re¬trieval ergeben, wurden bisher nur unzureichend erkannt. Suchmaschinen orientieren sich noch stark am klassischen Information Retrieval, wenn auch teils eigene Rankingkriterien gefunden wurden, vor allem die Ergänzung der klassischen Faktoren durch eine Art der Qualitätsbewertung der indexierten Dokumente. Die Arbeit soll aufzeigen, welche Schritte nötig sind, um Web Information Retrieval vor allem auch in Hinblick auf die Charakteristika der Suchmaschinen-Nutzer effektiv zu gestalten. Die Verfahren des klassischen Information Retrieval versagen hier, da sie einerseits von einer gepflegten Dokumentenkollektion, andererseits von einem geschulten Nutzer ausgehen. Suchmaschinen haben mit Problemen des sog. Index-Spamming zu kämpfen: Hierbei werden (oft in kommerziellem Interesse) inhaltlich wertlose Dokumente erstellt, die in den Trefferlisten der Suchmaschinen auf den vorderen Rängen angezeigt werden sollen, um Nutzer auf eine bestimmte Webseite zu lenken. Zwar existieren Verfahren, die ein solches Spamming verhindern sollen, allerdings können auch diese das Problem lediglich eindämmen, nicht aber verhindern. Das Problem ließe sich wenigstens zum Teil durch die Nutzer lösen, wenn diese gezielte Suchanfragen stellen würden, die solche irrelevanten Treffer ausschließen würden. Allerdings zeigt die Nutzerforschung einheitlich, dass das Wissen der Nutzer über die von ihnen verwendeten Suchmaschinen ausgesprochen gering ist; dies gilt sowohl für ihre Kenntnisse der Funktionsweise der Suchmaschinen als auch die Kenntnis der Suchfunktionen.
Die Arbeit konzentriert sich neben der Darstellung des Forschungsstands im Bereich des Web Information Retrieval auf einen nutzerzentrierten Ansatz des Aufbaus von Suchmaschinen, der sich aus dem Retrieval in klassischen Datenbanken herleitet. Als zentral für eine erfolgreiche Recherche wird dabei die Möglichkeit der gezielten Beschränkung der Recherche durch den Nutzer gesehen; die wichtigsten Faktoren sind hierbei die Einschränkung nach Aktualität, Qualität und die verbesserte Dokumentauswahl aufgrund einer erweiterten Dokumentrepräsentation. Alle drei Möglichkeiten sind in bisher verfügbaren Suchmaschinen nicht zufrieden stellend implementiert. Ein Problem bei der Bearbeitung des Themas ergab sich aus der Tatsache, dass die Forschung im Bereich Web Information Retrieval zu einem großen Teil bei den Anbietern selbst stattfindet, die darauf bedacht sind, ihre Erkenntnisse nicht zu veröffentlichen und damit der Konkurrenz zu überlassen. Viele Forschungsergebnisse können daher nur anhand der fertiggestellten Anwendungen rekonstruiert werden; hilfreich waren in manchen Fällen auch die von den Suchmaschinenbetreibern angemeldeten Patente, die für die vorliegende Arbeit ausgewertet wurden. Insgesamt zeigt sich, dass eine neue Form des Information Retrieval entstanden ist. Ziele des klassischen Information Retrieval wie die Vollständigkeit der Treffermenge verlieren ob der schieren Masse der zurückgegebenen Treffer an Bedeutung; dafür werden Faktoren der Qualitätsbewertung der Dokumente immer wichtiger. Das Web Information Retrieval setzt auf dem klassischen Information Retrieval auf und erweitert dieses wo nötig. Das Ziel bleibt aber weitgehend das gleiche: Dem Nutzer die für die Befriedigung seines Informationsbedürfnisses besten Ergebnisse zu liefern. Neben der Informationswissenschaft findet die Information-Retrieval-Forschung hauptsächlich in der Informatik statt. Der informationswissenschaftlichen Forschung kommt die Aufgabe zu, den stark technik-zentrierten Ansatz der Informatik um einen "Blick fürs Ganze" zu erweitern und insbesondere die Bedürfnisse der Nutzer in ihren Ansatz einzubinden. Aufgrund der enormen Bedeutung des Web Information Retrieval, welches in den klassischen informationswissenschaftlichen Bereich fällt, ergibt sich für die Informationswissenschaft auch die Chance, sich in diesem Thema gegenüber anderen Disziplinen zu profilieren. Zum Aufbau der Arbeit Die Arbeit lässt sich grob in zwei Hauptteile gliedern: Der erste Teil (Kap. 2-10) beschreibt den Bereich Web Information Retrieval mit allen seinen Besonderheiten in Abgrenzung zum klassischen Information Retrieval; der zweite Teil (Kap. 11-13) stellt anhand der Ergebnisse des ersten Teils einen nutzerzentrierten Ansatz der Rechercheverfeinerung in mehreren Schritten vor.

Content

Inhalt: 1 Einleitung 2 Forschungsumfeld 2.1 Suchmaschinen-Markt 2.2 Formen der Suche im WWW 2.3 Aufbau algorithmischer Suchmaschinen 2.4 Abfragesprachen 2.5 Arten von Suchanfragen 2.6 Nutzerstudien 2.7 Forschungsbereiche 3 Die Größe des Web und seine Abdeckung durch Suchmaschinen 3.1 Die Größe des indexierbaren Web 3.2 Die Struktur des Web 3.3 Crawling 3.4 Aktualität der Suchmaschinen 3.5 Das Invisible Web 4 Strukturinformationen 4.1 Strukturierungsgrad von Dokumenten 4.2 Strukturinformationen in den im Web gängigen Dokumenten 4.3 Trennung von Navigation, Layout und Inhalt 4.4 Repräsentation der Dokumente in den Datenbanken der Suchmaschinen 5 Klassische Verfahren des Information Retrieval und ihre Anwendung bei WWW-Suchmaschinen 5.1 Unterschiede zwischen klassischem Information Retrieval und Web Information Retrieval 5.2 Kontrolliertes Vokabular 5.3 Kriterien für die Aufnahme in den Datenbestand 5.4 Modelle des Information Retrieval 6 Ranking 6.1 Rankingfaktoren 6.2 Messbarkeit von Relevanz 6.3 Grundsätzliche Probleme des Relevance Ranking in Suchmaschinen
7 Informationsstatistische und informationslinguistische Verfahren 7.1 Textstatistische Verfahren 7.2 Nutzungsstatistische Verfahren 7.3 Informationslinguistische Verfahren 8 Linktopologische Rankingverfahren 8.1 Grundlagen linktopologischer Rankingverfahren: Science Citation Indexing 8.2 PageRank 8.3 Kleinbergs HITS 8.4 Hilltop 8.5 Evaluierung linktopologischer Verfahren 8.6 Problembereiche linktopologischer Rankingverfahren 8.7 Fazit linktopologische Verfahren 9 Retrievaltests 9.1 Aufbau und Nutzen von Retrievaltests 9.2 Aufbau und Ergebnisse ausgewählter Retrievaltests 9.3 Kritik an Retrievaltests 10 Verfahren der intuitiven Benutzerführung 10.1 Relevance Feedback 10.2 Vorschläge zur Erweiterung und Einschränkung der Suchanfrage 10.3 Klassifikation und Thesaurus 10.4 Clusterbildung 11 Aktualität 11.1 Bedeutung der Beschränkung nach der Aktualität der Dokumente 11.2 Funktionsfähigkeit der Datumsbeschränkung in Suchmaschinen 11.3 Möglichkeiten der Ermittlung von Datumsangaben in Web-Dokumenten 11.4 Aktualitätsfaktoren im Ranking 11.5 Spezialisierte Suchmaschinen für Nachrichten 11.6 Auswahl der gewünschten Aktualität durch den Nutzer 12 Qualität 12.1 Bedeutung der Beschränkung nach der Qualität der Dokumente 12.2 Qualitätsbeschränkungen bei der Recherche in Datenbank-Hosts 12.3 Identifizierung von Top-Quellen im WWW 12.4 Manuelle Einbindung von Top-Quellen 12.5 Automatisierte Einbindung von Invisible-Web-Quellen 12.6 Einbindung von Web-Verzeichnissen in Suchmaschinen 13 Verbesserung der Dokumentrepräsentation 13.1 Beschränkung auf den Inhaltsteil der Dokumente 13.2 Erweiterungen der Dokumentrepräsentation 13.3 Ersatz für die Nicht-Verwendbarkeit generischer Top-Level-Domains 13.4 Aufbereitung der Suchergebnisse in den Trefferlisten 14 Fazit und Ausblick 15 Literaturverzeichnis

Footnote

Zugl. Diss. Univ. Düsseldorf, Inst. für Sprache und Information, Abt. Informationswissenschaft
Rez. in: Information - Wissenschaft und Praxis. 56(2005) H.7, S.393-394 (J. Griesbaum): "... , das Buch wird seinem Titel und dem formulierten Anspruch sehr gut gerecht. Die 248 Seiten umfängliche Publikation leistet eine umfassende und, für den deutschsprachigen Raum, einzigartige State-of-the-Art-Analyse der Verfahren und auch der Defizite von Suchmaschinen im Internet. Dabei beschränkt sich Lewandowski nicht auf eine technikzentrierte Beschreibung aktueller Retrievalansätze, sondern akzentuiert ebenso deutlich auch die Problemfelder bei der Nutzung von Suchmaschinen. Dieser nutzerzentrierte Ansatz kommt vor allem im konzeptionellen Teil der Arbeit zum Tragen, der das Ziel verfolgt, Suchmaschinennutzern verbesserte Rechercheoptionen zu verschaffen. Angesichts der nur in geringem Maße vorhandenen Recherchekenntnisse der Nutzer liegt die Herausforderung vor allem darin, solche verbesserten Recherchemöglichkeiten derart auszugestalten, dass sie sich in realen Suchkontexten auch tatsächlich auswirken und nicht etwa wie die meist als "Erweitere Suche" bezeichneten Anfragemasken ein kaum beachtetes Dasein fristen. Der Verfasser konzipiert in diesem wichtigen Forschungsfeld neue Ansätze, um die Oualität des Information Retrievals zu verbessern. ... "

Lewandowski, D.: Desktop-Suche, Shortcuts, SMS (2004) 0.01

0.0077886474 = product of:
  0.03115459 = sum of:
    0.03115459 = weight(_text_:und in 4287) [ClassicSimilarity], result of:
      0.03115459 = score(doc=4287,freq=2.0), product of:
        0.12713796 = queryWeight, product of:
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.057323597 = queryNorm
        0.24504554 = fieldWeight in 4287, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.078125 = fieldNorm(doc=4287)
  0.25 = coord(1/4)

Abstract: Google hat im Oktober wieder neue Funktionen vorgestellt. Die bedeutendste davon ist die Desktopsuche (http://desktop.google.com), die EMails, Office-Dokumente und bereits besuchte Webseiten durchsucht. - Auf der deutschen Google-Seite wurden neue Shortcuts integriert. Schließlich gibt es in den "Google Labs" eine neue Suche per SMS.

Lewandowski, D.: Neue Themen der Informationswissenschaft sind nicht zu erkennen (2004) 0.01

0.0077886474 = product of:
  0.03115459 = sum of:
    0.03115459 = weight(_text_:und in 4292) [ClassicSimilarity], result of:
      0.03115459 = score(doc=4292,freq=2.0), product of:
        0.12713796 = queryWeight, product of:
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.057323597 = queryNorm
        0.24504554 = fieldWeight in 4292, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.078125 = fieldNorm(doc=4292)
  0.25 = coord(1/4)

Abstract: Anfang Oktober fand in Chur in der Schweiz das 9. Internationale Symposium für Informationswissenschaft (kurz: ISI) statt. 180 Teilnehmer waren angereist, um etwa 35 Vorträge anzuhören, zahlreiche Posterpräsentationen zu besichtigen und natürlich auch, um Kontakte mit den anderen Teilnehmern zu knüpfen.

Lewandowski, D.: Spezialsuche für wissenschaftliche Informationen (2004) 0.01

0.0077886474 = product of:
  0.03115459 = sum of:
    0.03115459 = weight(_text_:und in 4298) [ClassicSimilarity], result of:
      0.03115459 = score(doc=4298,freq=2.0), product of:
        0.12713796 = queryWeight, product of:
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.057323597 = queryNorm
        0.24504554 = fieldWeight in 4298, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.078125 = fieldNorm(doc=4298)
  0.25 = coord(1/4)

Abstract: Google bietet unter http://scholar.google.com/ eine spezielle Suche für wissenschaftliche Inhalte an. Im Gegensatz zu Systemen wie CiteSeer, die sich auf ein Fachgebiet beschränken, strebt Google die Erfassung aller wissenschaftlichen Inhalte an und arbeitet auch mit den Wissenschaftsverlagen zusammen, um deren Inhalte mit aufnehmen zu können.

Lewandowski, D.: Start der eigenen Suchmaschine als Beta-Version (2004) 0.01

0.0077886474 = product of:
  0.03115459 = sum of:
    0.03115459 = weight(_text_:und in 4299) [ClassicSimilarity], result of:
      0.03115459 = score(doc=4299,freq=2.0), product of:
        0.12713796 = queryWeight, product of:
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.057323597 = queryNorm
        0.24504554 = fieldWeight in 4299, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.078125 = fieldNorm(doc=4299)
  0.25 = coord(1/4)

Abstract: Microsoft hat im November nach einer langen Phase der Ankündigungen eine Beta-Version seiner selbst entwickelten Suchmaschine freigeschaltet (http://beta.search.msn.de). Die Qualität der Suchergebnisse ist nach ersten Tests als gut zu bewerten. Erfreulich, dass auf dem von Yahoo und vor allem Google dominierten Markt nun wenigstens ein dritter Player Fuß fassen wird.

Lewandowski, D.: Freiwillige Selbstkontrolle, Stärkung "alternativer Suchmaschinen" : Suchmaschinen und Politik (2005) 0.01

0.0077886474 = product of:
  0.03115459 = sum of:
    0.03115459 = weight(_text_:und in 4374) [ClassicSimilarity], result of:
      0.03115459 = score(doc=4374,freq=2.0), product of:
        0.12713796 = queryWeight, product of:
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.057323597 = queryNorm
        0.24504554 = fieldWeight in 4374, product of:
          1.4142135 = tf(freq=2.0), with freq of:
            2.0 = termFreq=2.0
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.078125 = fieldNorm(doc=4374)
  0.25 = coord(1/4)

Lewandowski, D.: Zusammenarbeit von Google, Yahoo und Microsoft (2005) 0.01
```
0.0077103674 = product of:
  0.03084147 = sum of:
    0.03084147 = weight(_text_:und in 4378) [ClassicSimilarity], result of:
      0.03084147 = score(doc=4378,freq=16.0), product of:
        0.12713796 = queryWeight, product of:
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.057323597 = queryNorm
        0.24258271 = fieldWeight in 4378, product of:
          4.0 = tf(freq=16.0), with freq of:
            16.0 = termFreq=16.0
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.02734375 = fieldNorm(doc=4378)
  0.25 = coord(1/4)
```
Abstract

Im Kampf gegen die Vermüllung ihrer Trefferlisten haben sich die Konkurrenten Google, Microsoft und Yahoo darauf geeinigt, ein neues Attribut für die Verlinkung von Webseiten auszuwerten. Dies könnte ein erster Schritt zu weniger Spam und einer weiteren Zusammenarbeit dergroßen Suchmaschinen sein.

Content

"Alle drei Suchmaschinen werden künftig das neue "Nofollow"-Attribut unterstützen. Dieses kennzeichnet, dass der damit ausgezeichnete Link nicht von Suchmaschinen verfolgt werden soll. Der Hintergrund dafür ist die automatisierte Vermüllung von Gästebüchern, Foren und Weblogs. Bisher werden solche Links ebenso in das Ranking mit einberechnet wie jeder andere Link auch. Die Links sind für die Suchmaschinen von großer Bedeutung, da sie als eine Stimme für eine Seite gezählt werden, d.h. es wird angenommen, dass ein Link eine Empfehlung für diejenige Seite ist, auf die verlinkt wird. Vereinfacht bedeutet dies, dass Suchmaschinen oftverlinkte Seiten auf höheren Rangplätzen zeigen als weniger verlinkte Seiten. Diese Berechnung wird durch automatisch erzeugte Links ad absurdum geführt. Um die Anzahl der Links auf ihre Seiten zu erhöhen, greifen Spammer immer mehr Foren, Gästebücher und Weblogs an und hinterlassen in diesen Hinweise auf ihre Seiten. Mit dem neuen Attribut ist es möglich, sämtliche Links beispielsweise in einem Gästebuch so auszuzeichnen, dass sie von den Suchmaschinen nicht mehr beachtet werden. Die Nicht-Beachtung äußert sich auf mehreren Ebenen: - Die Links werden von den Suchmaschinen nicht mehr verfolgt. Dies bedeutet, dass diejenigen Seiten, auf die verlinkt wird, unter Umständen nicht mehr in den Index der Suchmaschinen aufgenommen werden. Allerdings dürfte dieser Fall in der Praxis nur selten auftauchen, da von nahezu allen Seiten angenommen werden kann, dass sie auch auf konventionelle Weise verlinkt sind. - Die entsprechend ausgezeichneten Links werden nicht in die Kalkulation des Rankings mit einbezogen. Dadurch soll verhindert werden, dass die entsprechend verlinkten Seiten aufgrund ihrer vermeintlichen Popularität auf den vorderen Plätzen der Trefferlisten auftauchen. - Auch die Ankertexte, also der in den meisten Web-Browsern blau unterstrichene Text, wird bei diesen Links nicht ausgewertet Die Ankertexte dienen den Suchmaschinen, den Text der indexierten Dokumente durch weitere Wörter anzureichern, die das Dokument beschreiben, aber nur in externen Dokumenten vorkommen. Letztlich bedeutet das Setzen eines "Nofollow"-Attributs also nicht, dass die Zielseite schlecht beurteilt wird. Zumindest sehen dies die Suchmaschinen-Betreiber nicht vor. Um Links mit dem "Nofollow"-Attribut anzulegen, muss folgende Syntax verwendetwerden: <a href="http://www. server.de/seite.html" rel="nofollow">Ankertext</a>. Gegenüber anderen Links unterscheiden sich diese nur durch das hier hervorgehobene Attribut. Es erscheint wenig sinnvoll, manuell solche Links anzulegen. Sobald man aber den Besuchern einer Website erlaubt, selbst Inhalte mit Links anzulegen, ist der (automatisierte) Einsatz sinnvoll. Auch diese neue Initiative der großen Suchmaschinen wird die Spam-Flut in den Trefferlisten nicht verhindern, wohl aber ein wenig mindern. Bemerkenswert ist die Tatsache, dass die drei großen Suchmaschinen diesmal an einem Strang ziehen: Dies könnte als ein erster Schritt gesehen werden, dass die Suchmaschinen sich tatsächlich als Branche begreifen und die Notwendigkeit erkannt haben, gemeinsame Regeln und Standards zu schaffen. Bleibt die Frage, wieso die vierte der größeren (US-)Suchmaschinen, Ask Jeeves, nicht mit dabei ist. Diese lässt knapp verlauten, dass man in der eigenen Suchmaschine das Problem nicht in dem Maße hätte wie Google oder Yahoo. Man werde ein anderes Verfahren einsetzen, um die Wertigkeit von Links zu berechnen."
Lewandowski, D.; Womser-Hacker, C.: Information seeking behaviour (2023) 0.01
```
0.0077103674 = product of:
  0.03084147 = sum of:
    0.03084147 = weight(_text_:und in 1817) [ClassicSimilarity], result of:
      0.03084147 = score(doc=1817,freq=4.0), product of:
        0.12713796 = queryWeight, product of:
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.057323597 = queryNorm
        0.24258271 = fieldWeight in 1817, product of:
          2.0 = tf(freq=4.0), with freq of:
            4.0 = termFreq=4.0
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.0546875 = fieldNorm(doc=1817)
  0.25 = coord(1/4)
```
Abstract

Die Vielzahl der Publikationen zeigt, dass Information Seeking Behaviour (ISB) bzw. Informationssuchverhalten in der informationswissenschaftlichen Forschung als relevantes Thema angesehen wird. ISB versteht sich als Unterkategorie von Information Behaviour (IB) bzw. Informationsverhalten, das jegliches menschliches Verhalten mit Bezug zu Wissen und Information umfasst, also z. B. auch Informationsvermeidung oder passives Informationsverhalten. ISB hingegen wurde anfänglich meist als bewusster Prozess verstanden, um sich aufgrund einer festgestellten Wissenslücke Information zu beschaffen. Information Seeking wird als eine alltägliche Aktivität angesehen, die meist dann auftritt, wenn eine informationell unterbestimmte Handlung durchgeführt werden soll

Source

Grundlagen der Informationswissenschaft. Hrsg.: Rainer Kuhlen, Dirk Lewandowski, Wolfgang Semar und Christa Womser-Hacker. 7., völlig neu gefasste Ausg
Lewandowski, D.: Wikipedia in großen Suchmaschinen (2005) 0.01
```
0.0072856126 = product of:
  0.02914245 = sum of:
    0.02914245 = weight(_text_:und in 4576) [ClassicSimilarity], result of:
      0.02914245 = score(doc=4576,freq=28.0), product of:
        0.12713796 = queryWeight, product of:
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.057323597 = queryNorm
        0.22921911 = fieldWeight in 4576, product of:
          5.2915025 = tf(freq=28.0), with freq of:
            28.0 = termFreq=28.0
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.01953125 = fieldNorm(doc=4576)
  0.25 = coord(1/4)
```
Abstract

Die großen Suchmaschinen Google und Yahoo setzen beide auf die Inhalte des freien Nachschlagewerks Wikipedia. Sie wollen die Inhalte bei entsprechenden Anfragen prominent platziert vor der eigentlichen Trefferliste anzeigen. Google verwendet sie auch, um an die Suchmaschine gestellte Fragen zu beantworten. Damit gewinnt die nicht unumstrittene Freiwilligen-Enzyklopädie weiter an Bedeutung.

Content

"Google hat im April die aus dem US-Angebot bekannte bekannte Funktion der Begriffsdefinitionen für die deutschsprachige Seite vorgestellt. Leitet man eine Anfrage mit "definiere" ein, so wird an erster Stelle (noch vor der regulären Trefferliste) eine Definition des entsprechenden Begriffs angezeigt. Zwar werden andere Quellen aus dem offenen Web eingebunden, es zeigt sich aber, dass die Wikipedia-Einträge an erster Stelle platziert sind. Es wird jeweils der erste Abschnitt aus dem Wikipedia-Artikel präsentiert, der vollständige Text kann über einen Link abgerufen werden. Klickt man die Oberschrift "Definitionen von ... im Web" an, bekommt man, wenn vorhanden, weitere Treffer aus anderen Quellen angezeigt. Ein Beispiel zeigt die Bandbreite der Definitionen: Die Suche nach einer Definition für Glück ergibt neben dem ausführlichen Wikipedia-Artikel unter anderem Treffer von skat.com ("Faktor, der beim Skatspiel nicht wegzudenken ist") und von jesubotschaft.de. Hier muss sich Google (wieder einmal) den Vorwurf gefallen lassen, nicht die Autoritäten, also die hochwertigsten Quellen einzubeziehen, sondern irgendwelche, die (vermeintlich) etwas zum Thema zu melden haben. Eine weitere Einbindung der Wikipedia-Quellen wird bereits auf Googles US-Site getestet: Stellt man der Suchmaschine eine Frage (und nicht wenige Suchmaschinennutzer tun dies tatsächlich!), so bekommt man mit etwas Glück direkt eine Antwort angezeigt, zum Beispiel auf die Frage "Who is David Bowie?" die Antwort: "is a British rock and roll musician, actor, and artist who has had a profound influence an rock". Unter jedem Treffer ist ein Link auf die Quelle angegeben. Die Informationen kommen nicht nur aus der Wikipedia, sondern zum Beispiel auch aus dem World Fact Book (bei geographischen Anfragen) oder von Seiten wie "Pub Quiz Help". Die aus den Webseiten gezogenen Exzerpte sind von unterschiedlicher Qualität: Fragt man nach (populären) Zahlenangaben wie etwa der Höhe des Mount Everest, funktioniert es gut, bei den Fragen nach Personen wird manchmal ein etwas unpassender Teil des Artikels angezeigt, so dass man sich auf den vollständigen Artikel weiterklicken muss. Bislang geht Yahoo einen anderen Weg als Google. Gibt man in der US-amerikanischen Version Begriffe ein, die auf ein klassisches "Nachschlage-Bedürfnis" hindeuten, wird ähnlich wie bei Google mit den Definitionen ein "Shortcut" angezeigt (Password 2/2004 und 11 /2004). Die Quellen dort sind allerdings direkt in das Yahoo-Angebot eingebaut, d.h. man verlässt nicht das Yahoo-Portal, wenn man sich die vollständigen Artikel ansehen möchte. Und die Quellen wirken wesentlich vertrauenerweckender: Die Enzyklopädie-Einträge kommen aus der Columbia Electronic Encyclopedia. Sucht man nach Ländernamen, so bekommt man Treffer aus dem World Fact Book, "the U.S. government's complete geographical handbook". Nun hat Yahoo angekündigt, die Einträge aus der Wikipedia bei solchen Anfragen prominent platziert anzeigen zu wollen. Bisher sind allerdings nur einzelne Beispiele zu sehen: Gibt man beim französischen Ableger von Yahoo einen Ländernamen ein, so wird bereits ein Treffer aus der Wikipedia angezeigt. Des weiteren stellt Yahoo den Betreibern der Wikipedia Serverplatz zur Verfügung. Es wird jedoch betont, dass dies nicht das Ende der Gespräche zwischen Wikipedia und Google bedeute.
Mit der sehr umfangreichen Wikipedia bietet sich für die Suchmaschinenbetreiber eine Möglichkeit, durch die manuelle Einbindung einer einzigen Quelle vermeintlich alle Fragen kompetent abzudecken. Der bisher zumindest bei Yahoo betriebene technische Aufwand, verschiedene Quellen (für die man als Suchmaschinenbetreiber vielleicht sogar bezahlen muss!) einzubinden und trotzdem nicht auf jede Frage eine schnelle Antwort liefern zu können, kann gespart werden. Letztlich stellt sich allerdings die Frage nach der Qualität der Treffer aus Wikipedia. Die Wikipedia wird von Freiwilligen erstellt, wobei es sich nicht um eine geschlossene Gruppe handelt. Vielmehr wird jeder Internet-Nutzer dazu eingeladen, sich an der Erstellung der Enzyklopädie zu beteiligen. Artikel werden gemeinschaftlich erarbeitet und sollen so dem Ideal nach mit der Zeit immer besser werden. Gibt es aktuelle Entwicklungen, so können diese direkt in die Artikel eingebunden werden. Es ist aber zu fragen, ob die Artikel durchweg die von einem Nachschlagewerk zu erwartende Qualität liefern können. Sicherlich gibt es in der Wikipedia sehr gute Artikel. Allerdings gibt es auch einen großen Anteil von schlechten, unsystematischen und fragwürdigen Eintragungen. Ein Blick auf das "Portal Bibliothek, Information, Dokumentation" zeigt exemplarisch einige Schwachstellen: Zunächst ist das Portal unvollständig. Das ist verständlich und wäre nicht besonders schlimm, wenn dies für den Nutzer immer ersichtlich wäre. Zwar ist dies klar, wenn zu einem Begriff kein Artikel angezeigt wird. Artikel, die sich noch in einem "frühen Stadium" befinden (und deshalb noch nicht oder nur marginal überarbeitet wurden), sind jedoch nicht als solche gekennzeichnet. Sie können deshalb, insbesondere wenn Suchmaschinen an prominenter Stelle auf sie verweisen, in ihrer Qualität leicht mit Einträgen aus echten Enzyklopädien verwechselt werden. Viele Nutzer werden ihnen damit eine vergleichbare Autorität zumessen. Ein weiterer Kritikpunkt betrifft den unsystematische Aufbau der Wikipedia. Wieder ein Beispiel aus dem Portal BID: Ein Artikel zum Booleschen Retrieval ist nicht vorhanden, wohl aber zum Erweiterten Booleschen Retrieval. Dieser besteht hauptsächlich aus einer Ansammlung von Formeln und hat damit wenig mit einem enzyklopädischen Artikel zu tun.
Eine Enzyklopädie sollte etwas über die Bedeutung der behandelten Themen aussagen. Klassisch bekommen die wichtigeren Themen längere Artikel, die weniger wichtigen entsprechend kürzere. Die Wikipedia gibt hier keine Orientierung: Alle Themen scheinen gleich bedeutend zu sein, zumindest drückt sich die Bedeutung nicht in der Länge aus. So ist der Artikel über den Computerspiel-Helden Super Mario, bei dem man sich ja schon generell fragen darf, was er in einer Enzyklopädie zu suchen hat, ca. 30.000 Zeichen lang, der über Gerhard Schröder nur 17.000. Was bedeutet die zumindest zu hinterfragende Qualität der Wikipedia und ihre Einbindung in die Suchmaschinen für den Such maschinen-Nutzer? Der Kernpunkt wurde bereits erwähnt: Die Nutzer werden der Wikipedia eine Autorität beimessen, die diese nicht hat. Die Suchmaschinen unterstützen mit der Einbindung die Annahme, die Wikipedia könne die Qualität und Orientierung einer echten Enzyklopädie bieten. Die Suchmaschinen wären besser beraten, verstärkt auf die Einbindung geprüfter, hochwertiger Quellen zu setzen. Einen solchen Ansatz verfolgt MSN mit der Einbindung der hauseigenen Encarta-Enzyklopädie. Deren Nutzung ist immerhin für jeden Nutzer zwei Stunden lang kostenlos, dann muss bezahlt werden."

Lewandowski, D.: Bewertung von linktopologischen Verfahren als bestimmender Ranking-Faktor bei WWW Suchmaschinen (2006) 0.01

0.006608886 = product of:
  0.026435545 = sum of:
    0.026435545 = weight(_text_:und in 892) [ClassicSimilarity], result of:
      0.026435545 = score(doc=892,freq=4.0), product of:
        0.12713796 = queryWeight, product of:
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.057323597 = queryNorm
        0.20792803 = fieldWeight in 892, product of:
          2.0 = tf(freq=4.0), with freq of:
            4.0 = termFreq=4.0
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.046875 = fieldNorm(doc=892)
  0.25 = coord(1/4)

Source: Wissensorganisation und Verantwortung: Gesellschaftliche, ökonomische und technische Aspekte. Proceedings der 9. Tagung der Deutschen Sektion der Internationalen Gesellschaft für Wissensorganisation Duisburg, 5.-7. November 2004. Hrsg. von H.P. Ohly u.a

Lewandowski, D.: Suchmaschinen (2023) 0.01
```
0.006608886 = product of:
  0.026435545 = sum of:
    0.026435545 = weight(_text_:und in 1794) [ClassicSimilarity], result of:
      0.026435545 = score(doc=1794,freq=4.0), product of:
        0.12713796 = queryWeight, product of:
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.057323597 = queryNorm
        0.20792803 = fieldWeight in 1794, product of:
          2.0 = tf(freq=4.0), with freq of:
            4.0 = termFreq=4.0
          2.217899 = idf(docFreq=13141, maxDocs=44421)
          0.046875 = fieldNorm(doc=1794)
  0.25 = coord(1/4)
```
Abstract

Eine Suchmaschine (auch: Web-Suchmaschine, Universalsuchmaschine) ist ein Computersystem, das Inhalte aus dem World Wide Web (WWW) mittels Crawling erfasst und über eine Benutzerschnittstelle durchsuchbar macht, wobei die Ergebnisse in einer nach systemseitig angenommener Relevanz geordneten Darstellung aufgeführt werden. Dies bedeutet, dass Suchmaschinen im Gegensatz zu anderen Informationssystemen nicht auf einem klar abgegrenzten Datenbestand aufbauen, sondern diesen aus den verstreut vorliegenden Dokumenten des WWW zusammenstellen. Dieser Datenbestand wird über eine Benutzerschnittstelle zugänglich gemacht, die so gestaltet ist, dass die Suchmaschine von Laien problemlos genutzt werden kann. Die zu einer Suchanfrage ausgegebenen Treffer werden so sortiert, dass den Nutzenden die aus Systemsicht relevantesten Dokumente zuerst angezeigt werden. Dabei handelt es sich um komplexe Bewertungsverfahren, denen zahlreiche Annahmen über die Relevanz von Dokumenten in Bezug auf Suchanfragen zugrunde liegen.

Source

Grundlagen der Informationswissenschaft. Hrsg.: Rainer Kuhlen, Dirk Lewandowski, Wolfgang Semar und Christa Womser-Hacker. 7., völlig neu gefasste Ausg

Search (43 results, page 2 of 3)

Authors

Years

Languages

Types

Themes

Subjects

Classifications