Posts tonen met het label Search. Alle posts tonen
Posts tonen met het label Search. Alle posts tonen

zondag, juli 03, 2005

Ablogger goes engels door de vissen van Babel

Dit las ik op Cyberjournalist: [quote]"U kunt CyberJournalist.net in 12 verschillende talen nu lezen, dankzij de Vertaling van de Vissen van Babel van SYSTRAN. De vertaling is niet perfect, maar hopelijk zal het helpen de plaats voor een breder publiek toegankelijker maken."[/quote] Het gaat hier over Babelfish, het vertaalprogramma van Altavista. Bablefish vertaalt ook van het Nederlands naar het Engels. Dus voortaan kun je ablogger in het Engels lezen. De link staat hiernaast, bij gebrek aan een betere vertaler, want de huidige Googletranslator werkt (nog) niet voor het Nederlands. Er komt een nieuwe aan, zoals je kunt lezen op Google Blogoscoped. Google maakt hierbij gebruik van - de door mensen vertaalde - documenten van de VN. De Googlemachines vergelijken de documenten. Uit de gevonden patronen worden regels afgeleid om teksten in een willekeurige taal te vertalen.

donderdag, juni 30, 2005

Google video, multimedian en Blinkx

Het valt me op dat google video zo ad-hoc-erig lijkt opgezet. Het uploadproces was onduidelijk, volgens erwin. Ook is het volgens Battelle niet duidelijk hoe het materiaal beschermd is en of een uploader geld krijgt of zelfs moet betalen. Daarnaast is er weinig geautomatiseerd, getuige deze uitspraken van Battelle op zijn blog: [quote]"I neglected to mention that all the video in the "free" category has been "human scanned" for adult content and copyright violations, I'm told by a good source." "The video will be searchable via the meta data provided by the submission process (no, there's no PageRank for video, yet)."[/quote] Niet echt des Googles. Dat er meer mogelijk is dan het doorzoeken van metadata en handmatig scannen, wordt duidelijk bij Multimedian, een Nederlands high-tech, high science initiatief met een budget van 35 miljoen. Op de site staan allerlei projecten met als doel multimediale data zoals bv nieuwsarchieven te ontsluiten. Bij concurrent blinkx zijn video's (en sinds kort podcasts) al wel volledig doorzoekbaar obv spraakherkenning en videoanalyse.

dinsdag, juni 28, 2005

zoekmachine manipulaties

shmoogle.gifDe oratie van Nico van Eijk, bijzonder hoogleraar Media- en Telecommunicatierecht aan de Universiteit van Amsterdam, die onlangs te gast was in radio-online, staat online (pdf). In zijn oratie pleit hij ervoor om de werkwijze van zoekmachines, op zijn minst, transparant te maken want de zoekresultaten van bv Google worden op verschillende manieren gemanipuleerd. Leuk leesvoer voor geinteresseerden in zoekmachines. Wie manipuleren volgens hem de zoekmachines: [list] [*]Zoekmachines. Allereerst worden de resultaten bepaald door de algoritmes van de zoekmachines zoals bv pagerank van Google. Daarnaast filteren zoekmachines bewust de resulaten die in sommige landen verboden zijn. Zo verwijderen Google en Yahoo bronnen die de Chinese overheid bekritiseren uit de resultaten bij zoekvragen uit China. [*]Aanbieders van Informatie. Zij kunnen hun plaatsing in de zoekmachines verbeteren met al dan niet illegale techieken als 'spamdexing', 'cloaking', 'linkfarming', 'webrings', 'redirects

donderdag, maart 24, 2005

Aladin vs Brainboost vs Google Answers

brainboost.gifOeps, ik heb gisteren per ongeluk een stomme vraag gesteld aan al@din, de zoekmachine van Bibliotheek.nl. Nadat ik op de verzendknop had gedrukt, kwam ik er pas achter dat bibliothecarissen de vragen beantwoorden. Hopelijk steken ze niet te veel tijd in mijn vraag. Aladin heeft wel wat weg van Google Answers. Net als bij Google zijn eenmaal beantwoordde vragen beschikbaar voor anderen, maar Al@din is gratis voor de 'eerste vragensteller'. Heel toevallig, stuitte ik gisteren op een andere zoekmachine die vragen beantwoordt zonder menselijke tussenkomst: de Brainboost Answering Engine. Ik heb gelijk gevraagd of Brainboost Aladin kent: What is aladin?.

dinsdag, maart 15, 2005

Europa's antwoord op Google

De universiteit van Glasgow verspreidt het bericht dat haar onderzoekers een zoekmachine hebben ontwikkeld die de concurrentie aankan met Google. Terrier (Terabyte Retriever), de naam van deze machine, is al 3 jaar in ontwikkeling met geld van EPSRC. Het schijnt al in gebruik te zijn op de intranets van verschillende Europese instellingen. Professor Keith van Rijsbergen, hoofd van de information retrieval groep vertelt over Terrier in Research Information: [quote]"Terrier is a better engine than Google, if you measure it, but it not so much better that people are going to say forget about Google and start using Terrier"[...]"Google gives a kind of universal feedback from the connectivity of the web. But you don't always want the most popular site. Some very important work is often very badly connected to the outside world, and people want to find it. The feedback I am talking about is personalised. What guidance does Google give you on changing your query? One of our aims is to build systems that incorporate relevance feedback."[/quote] In de Terrier Wiki is meer informatie te vinden maar die is nogal geeky. Terrier is open source software. Versie 1.01 is hier te downloaden.

dinsdag, februari 22, 2005

mspace, een semantische webbrowser

mspace.gifMeer dan Google en beter dan Itunes, zo kondigt het mspace-team van de Universiteit of Southampton haar vinding aan. Mspace is een browser voor het semantische web. Je kunt met deze browser vanuit allerlei invalshoeken (dimensies) en via willekeurige paden naar informatie kijken. Op de site staat een showcase voor muziek. Je start bij een genre, vervolgens zoom je in op bv klassieke muziek. Via klassieke muziek ga je door naar de door jouw gewenste categorie bv componisten, muziekinstrumenten, artiesten, etc. De wijze om via verschillende manieren door informatie te drillen komt, zo op het eerste gezicht, overeen met OLAP oftwel multidimensionale analyse (zie bv Cognos Powerplay). Deze techniek, afkomstig uit de Business Intelligence wereld, is al weer zo'n 30 jaar oud. Maar voor OLAP moet de informatie eerst geschikt gemaakt worden voor analyse. Het nieuwe aan mspace is, dat ze werkt met 'ongestructureerde' en niet-voorgekookte informatie.

zaterdag, januari 29, 2005

Vloeibare informatie

Webpagina's waarop ieder woord een hyperlink is. Is dat de toekomst van het web? Volgens Dougland Engelbert wel. Op de liquid information project website heeft hij een demo van de CNN-website, om een idee te krijgen van zijn bedoelingen. [quote]"But this is only the beginning, Hegland insisted. The Liquid Information project has much grander aims. Eventually, users would be allowed to process information in any way imaginable. For example, if readers prefer The New York Times to Wired News, or Fox News to AlterNet, they will be able to add subsets of preferred sites to hyperword menus."[/quote] (via Wired) Het heeft wel iets weg van de tags(hype) van Technorati en del.icio.us. Handig, die woorden of categorieen waar je doorheen kunt browsen, maar ze zijn nooit specifiek genoeg. Wat moet je nu met de tag music en 8000 hits? 1 woord is vaak niet genoeg om de juiste informatie te vinden. Dat clusteren en categoriseren kun je toch beter over laten aan zoekmachines? Blinkx pakt het slimmer aan. Deze zoekmachine scant het document (mail, webpagina, officedocument, etc.) dat je leest en levert, 'on the fly', gerelateerde informatie, gebaseerd op de inhoud van het document en niet op grond van een enkel woord, zonder enige context. Bovendien clustert Blinkx informatie naar categorieen en daar komt geen handmatig ingevoerde tag aan te pas.

woensdag, januari 12, 2005

Technorati 2.0

whitelabel.gifDe winnaar en runner ups van de Technorati developerscontest zijn bekend. De meest innovatieve toepassing van de Technorati API is: GovTrack.us, een web 2.0 toepassing om het Amerikaanse Congress te controleren. Govtrack volgt alle weblogs die schrijven over de activiteiten van het Congress. Ook heel fraai is whitelabel.org dat een sidebar met technoraticommentaar op de BBC newssites toevoegt. Mijn favoriet is de touchgraph integratie met Technorati, waarmee je relaties tussen blogs kunt visualiseren

maandag, januari 10, 2005

zoekresultaten Clusteren

clusty.gif In Businessweek staat een verhaal over de te-volgen strategie van Clusty, de redelijk briljante metazoekmachine van Vivisimo die zoekresultaten clustert naar bron, onderwerp, product, grootte van het plaatje, etc. De clustering hangt af van de zoekcategorie. Volgens sommige analisten moet Clusty, wil ze een mainstream zoekmachine worden, allereerst een niche opzoeken. Kansrijke niches zijn reizen, medicijnen en gezondheidszorg. Nadat Clusty een trouw publiek heeft opgebouwd, kan ze de strijd aan met de grote zoekjongens als Google, Yahoo, Microsoft en AOL. Volgens Valdez-Perez, oprichter van Vivismo, is er nu al genoeg ruimte voor een nieuwe zoekdienst voor het grote publiek. Zijn strategie is erop gericht om licenties van Clusty te verkopen aan grote consumentenwebsites. De haast van Valdez-Perez is wel te begrijpen want de technologische voorsprong van Clusty is niet zo heel erg groot. Op web 2.0 maakte Norvig, directeur zoekkwaliteit van Google, bekend dat ook Google een project is gestart om zoekresultaten te clusteren. Het project, genaamd 'named entities abstraction' is erop gericht om meerdere betekenissen van woorden te begrijpen.

dinsdag, december 14, 2004

Aggregatie en Google

Misschien een eigenzinnige gedachte[s]n[/s]-ex[s]c[/s]ercitie, maar waar blijft Google toch met nieuws/zoekaggregatie via RSS? Leuk dat Google suggest maar het is zo web 1.0 terwijl rss-aggregatiediensten het web overspoelen. Bekijk maar eens de ppt van The shifted librarian . Zelfs deze lijst is al niet meer compleet. Blogpulse en het geheimzinnige Rojo zijn de nieuwste spruiten aan de web 2.0 boom.

zaterdag, november 13, 2004

Niches in de zoekmarkt

Je moet wel een rasoptimist zijn of een superieure techniek hebben om in een markt waar Google alleenheerser is, een zoekmachine te beginnen. Toch wemelt het op het internet van de zoekmachinestartups. Begrijpen wat er op the string coffee Table, een weblog over de stringtheorie, staat, lijkt me een makkelijker opgave dan concurreren met Google. Misschien dat de bedrijfjes wel een betere of verfijndere zoektechnologie in huis hebben dan de Pageranktruc maar tegen de marketing-, reken- en indexeringskracht van Google kunnen nog maar weinig internetbedrijven opboksen. Amazon met het hele fraaie A9 en Microsoft search maken nog enige kans. Forbes bespreekt 8 van die Google Wannabes. De meest originele van het stel is manyone, dat nog in Beta is. Geen zoekmachine, maar een nieuw soort browse-ervaring om door het heelal te surfen of het Barrier Reef onder water te verkennen. Die anderen moeten afwachten of een grote jongen hun zoektechnologie interessant genoeg vindt om over te nemen. Of ze moeten op zoek naar een niche in de markt. Is er al een zoekmachine die niches vindt?

donderdag, november 11, 2004

10 X 10

Leuker dan Topix, Googlenews of MSN beta news. Nieuws van het afgelopen uur in 100 woorden en 100 plaatjes, gemaakt door Jonathan J. Harris. Via een tekst-analyse van de rss-feeds van de BBC, NYT en Reuters scant het programma de 100 belangrijkste woorden en de bijbehorende foto's. Ingenieus en mooi. (via Marc's voice)

dinsdag, oktober 26, 2004

RFID camera

Op vakantie hebben ongetwijfeld tientallen touristen mij onbedoeld gefilmd en gefotografeerd. Helaas krijg je die foto's zelf nooit te zien. Waarschijnlijk word ik zelfs weggephotoshopped. Dat doe ik wel, als het even kan, met ongewenste touristen die mijn plaatje van authentieke locals in hun natuurlijke habitat of mijn national geographic waardige shot van een historisch hoogtepunt, verpesten. (zie foto: zoek de tourist) Op vakantie kwam ik op het volkomen nutteloze idee dat het mij aardig lijkt om te kunnen zoeken op foto's waar ik op sta. Een grove manier om dit te achterhalen is als digitale camera's in de exif-info van de foto's, naast datum en tijd, ook de coordinaten van de plaats waar de foto is genomen, zouden vastleggen. Dit soort toestellen zijn te koop. Het nadeel is dat ook jij moet bijhouden waar je bent geweest en wanneer. Daarvoor zou je wel gps-trackers hebben. Of als je op die tijd en plaats ook foto's hebt genomen dan zou je de exinfo kunnen matchen op tijd en plaats. Beetje omslachtig. Het werkt misschien beter met RFID. Als we toch mensen voor medische doeleinden gaan implanteren met rfid-chips

zaterdag, september 25, 2004

My Google

google_kaltix.gifMaandenlang stond ab logger nummer 1 met de zoekterm 'Priorij van Sion' in Google.nl. Sinds een aantal weken kom ik niet verder dan een lousy 34e plaats, achter sites met de meest vreemde theorieen over de priorij. Bij de kwaliteit van mijn post kun je nog vraagtekens zetten maar voor mij is het evident dat de mysterydatabase (shoot, komen ze weer hoger in de ranking) niet boven stukjes van de Groene, NRC en Trouw hoort. Het resultaat is te begrijpen. Het is snel afgelopen met Google als ze voor ons gaat bepalen welke sites bovenaan staan in de zoekresultaten op basis van een subjectieve beoordeling van de inhoud. Toch wordt Google news van iets dergelijks beschuldigd. Google news schijnt een lichte bias te hebben voor rechtse nieuwssites. Het lijkt vooral een taalkundige kwestie te zijn. Het is nog een onbedoelde feature maar het idee om ook bij Google News mijn persoonlijke/politieke voorkeuren op te geven spreekt me wel aan. Bij de zoekmachine kan dat al een beetje. De gepersonaliseerde Google search op 'priorij van sion' levert bewonderenswaardig goed mijn voorkeuren op. De wikipedia staat bovenaan, gevolgd door NRC. Helaas staat ab logger nog steeds op pagina 3. Het resultaat zal ongetwijfeld nog beter worden als ze in Mountain View mijn surfgedrag, verzameld via de advanced googlebar options, gaan gebruiken. Zo langzamerhand biedt Google alles wat een internetter nodig heeft; een wordprocessor(Blogger), een foto-album (Picasa), gepersonaliseerde en gespecialiseerde zoekfuncties en binnenkort e-mail (Gmail), een browser (Gbrowser) en instantmessaging (hello of Jabber?). Ik mis nog een Google music, Google movies en een Google Books. Als Google zo door gaat wordt de discussie over Linux of Windows op de desktop overbodig. De desktop draait op Linux bij Google. In feite zou een terminal en breedband voor de meeste thuisgebruikers voldoende moeten zijn. Wie weet wordt Larry Allison's visie over de netwerkcomputer alsnog bewaarheid. Het gebruikelijke agressieve antwoord van Microsoft is tot nu toe uitgebleven. Of vlucht Microsoft in de huiskamermultimedia met media center en de Xbox en de kantoortoepassingen (office)? Nu WinFs is komen te vervallen zal Windows, op beveiligingspatches na, de komende 4 jaar niet veranderen. Dat is met concurrenten als Google en Linux veel te lang.

woensdag, september 22, 2004

Infojunkietools

RSS is een van de betere uitvindingen van de laatste tijd op het internet. Wat een tijdsbesparing levert dat op. Of zou het moeten opleveren want de gewonnen tijd gebruik je natuurlijk om nog meer sites te scoren. Na rssreader voor sharpreader te hebben omgeruild neem ik regelmatig wat extra nieuwsshots met de ingebouwde Feedster zoekfunctie. Een aantal onderwerpen volg ik met de feeds van mijn favoriete nieuwsdealer topix.net. Met het succes onstaan de eerste initiatieven om geld met RSS te verdienen. Zesser verwijst naar blender en Battelle filosofeert over een aantal businessmodellen met RSS. Naast RSS houd ik, heel ouderwets, via dagelijkse Google newsalerts mijn nieuwsgehalte op peil. Vooral om nieuws te scoren dat niet uit de blogosphere afkomstig is. Die emailalerts vervuilen al snel de inbox als je ze niet dagelijks bijhoudt. Het is geen geniale tip maar ik heb voor iedere alert een mapje aangemaakt en een rule om ze naar dat mapje te verplaatsen. Zo komen Cyber en science fiction netjes in een mapje terecht waar ik ze regelmatig scan op interessante nieuwsfeitjes. Het is grappig om te zien hoe zo'n nieuwsfeitje of meme zich vaak langzaam en soms snel via andere sites over de wereld verspreidt.

dinsdag, juli 20, 2004

Blinkx

blinkx-logo.jpgGuardian Unlimited verhaalt over de onstaansgeschiedenis en de werking van een veelbelovende nieuwe zoekmachine, Blinx. Er is al een heuse hype rondom Blinkx aan het ontstaan die is begonnen met een post op het weblog van Om Malik. De zoekmachien is nog in beta, maar biedt al een paar hele bruikbare vernieuwingen. Het zoekt webpagina's, nieuws, weblogs en video's op het web en documenten op je harde schijf, de heilige graal van de gevestigde zoekmachines. Het nestelt zich in je browser, acrobat en office. Via een klein taakbalkje geeft Blinkx passende zoekresultaten bij datgene wat je aan het lezen bent. Het maakt niet uit of het email, een office-document, een pdf of een webpagina is. Bovendien visualiseert Blinkx in de breedbandversie de resultaten en heeft het een nieuwe vorm van clustering.

zaterdag, mei 22, 2004

Scopeware en de cyberbody

Op het moment dat Google een dienst aankondigt om prive pc's te doorzoeken gaat bij Mirror Worlds Technologies, Inc. de stekker eruit. Hun product, Scopeware vision was een van de meest innovatieve zoekprogramma's op de desktop. Alle bestanden zoals foto's, mp3s, email, office-documenten en RSS presenteert Scopware Vision in een visuele, chronologische stroom, een 'lifestream'. Zo zouden we verlost worden van het juk van de windowsfolders. Dr. David Gelernter, professor aan de Yale Universiteit, is de bedenker. Het idee is te vergelijken met een weblog. Ook met een weblog bewaar je de posts op basis van een tijdlijn. Je hoeft je niet druk te maken in welke map je een post hebt opgeslagen. Via een simpele zoekactie kun je de informatie weer terugvinden zonder door alle mappen en submappen op je webserver te bladeren. De gegenereerde lijst op basis van de zoekterm of onderwerp is een 'lifestream'. Zo'n lifestream is dynamisch en ligt niet vast een hierarchische mappenstructuur.

donderdag, mei 13, 2004

Mr Knowitall

cse_logo_80x133.gif Google is los. Het bedrijf kondigt het ene na het andere nieuwtje aan. Blogger is vernieuwd (nu ook met Atom feeds), het Google Blog is geintroduceerd, Google AdSense krijgt naast tekst, ook beeldadvertenties en AdWords verbetert de service voor grote adverteerders (1). Bovendien kaapt Google Usenet en heeft ze Usenet voorzien van Atom feeds (2). New Scientist heeft nog een nieuwtje over Google. De Universiteit van Washington ontwikkelt KnowItAll, een zoekmachine die lijstjes maakt. Dat kan handig zijn als je bv alle Nederlandstalige popmuzikanten van de jaren '70 tot heden, wilt opvragen. Dat is nu nog niet mogelijk volgens Etzioni, een van de bedenkers, omdat de machine nog geen natuurlijke taal herkent. Maar er zijn al vragen te stellen als 'list actors'. DARPA ('list terrorists' ?) en Google zijn de sponsoren van het KnowItAll-project. Dit is de KnowItAll - Database Web Interface (1. via Marie Jose Klaver 2. via Micro Persuasion)

woensdag, mei 05, 2004

Superbieb

In Business week een interview met Larry Page, een van de oprichters van Google. Google's doel: "Understand Everything". Het woord superlibrary is gevallen! Conspiracy theorists start your engines! http://www.google.com/blog/ (van Ben Hammersley's Dangerous Precedent) Dit is de toekomstvisie die ik met die linkjes probeer duidelijk te maken; Via foto- en videomobieltjes zetten wij, bloggers, binnenkort alles, wat ons 'buiten op straat' interesseert, op het web. Dat wordt naast o.a. email en sms en weer geindexeerd door Google. Als die informatie voor anderen interessant genoeg is, willen ze daarvoor eventueel betalen en via een nog te realiseren systeem van Google komt dat geld weer bij de 'dataleverancier' terecht. Google wordt de Central Intelligence Corporation (CIC) uit Snowcrash. Dit klinkt misschien enger dan het zal zijn.

zondag, april 25, 2004

Google wordt persoonlijk

Uit het interview van Steve Gillmor met Google's Sergey Brin komt duidelijk naar voren dat Google de data van Gmail aan de andere diensten wil koppelen (zie de vorige post over Gmail). Ik had het ook raar gevonden als ze dat niet gingen doen. Brin noemt 2 voorbeelden: Als je zoekt met Google krijg je bij de resultaten te zien of je nieuwe mail hebt ontvangen. Hetzelfde gebeurt als je aanlogt bij Orkut. Met die gekoppelde data kan Google marketingtechnisch veel meer doen dan alleen het personaliseren van advertenties in email en "you've got mail" alerts. Misschien weer iets vernieuwends want naast de nieuwste technologie beheersen ze ook het marketingvak erg goed. Google is viraal geintroduceerd; van contentads had, tot Google ermee kwam, nog nooit iemand gehoord; Orkut is gebracht als een exclusieve dienst voor de internetelite waar je alleen op invitatie bij mag, met als gevolg dat iedereen er bij wil en Gmail bleek toch geen 1 aprilgrap te zijn.