Visar inlägg med etikett Bing. Visa alla inlägg
Visar inlägg med etikett Bing. Visa alla inlägg

Lerigt Google-vatten gör att massor av manuellt surfande krävs

2015-06-16

Komplettering: Jag ser att Northwestern rent av länkat till Plos one artikeln. Kanske var det rent av till nackdel? Ibland är det ej så men andra gånger tycks det för djupa-sidor ex. universitet vara till nackdel därför att de ej propageras färskt.


Här finns Clearpond: clearpond.northwestern.edu. Data relaterat likhet i "ljud" (och tycks det gående in morfologiskt i mening av att jag anar att man kanske härledde relaterat morfologiskt - kanske) och hur tätt andra ord med i "ljud-mening" hög likhet (similarity) ligger runt resp. ord. Men hur hittar vi information om formatet deras datafil har när man upptäcker att gammal nedladdning av artiklar publicerade om datat, hemsidan datafilerna låg på, resp. datafilerna saknade denna information? Hur kan detta problem lösas med Google? Går det alls att lösa om mer än att hitta universitets-sida med filerna krävs? Eller klarar sökmotorn rent av att peka ut en sida där informationen jag behöver finns?


Söker vi information om en samling data om ljud i engelskan (och holländska resp. något mer om jag minns rätt) gäller det att lägga till database i sökningen snarare än något relaterat språkljud om man ska komma rätt. I exemplen nedan är jag mest fascinerad av att den ej förstår sambandet mellan databasens centralitet i form av närmare officiell plats filerna finns på och artikeln publicerad i Plos One. Självklart kanske man ej ser värdet att riktat utnyttja deras publicering i XML (som jag själv absolut inte skulle föreslå är enklare än att parsa ut samma information från deras HTML-sidor: Tvärtom håller jag för Plos XML representationen som bökigare p.g.a. av implicita rekursiva konstruktioner svåra att se enkelt slut på medan givetvis slöare parsning som XML troligt för de flesta är för dyrt om man vill extrahera data från "alla" journaler man når via nätet) men det är ju väldigt svårt att undvika nära nog standardformat för hur skribenter anges bland journalerna (även om jag tycker mig minnas någon med något underligt krävande en aktivitet för att såväl se författarnas hemvinst som att få den i sidan som ej inkluderade en ganska uppenbar länk att begripa).


Hur kan detta ej vara en jämförbar relation (enklast att förstå vad som gör det underligt från att ofta nog anges rent av e-post-adresserna explicit till författarna) med de kanske överanvända länk-konstruktionerna för att härleda samband och distribuera flow i trust-modeller?


En effekt av att förstått samband om vi antar en tolknings-begriplighet av Plos artikeln är att oavsett relevant information hos Norwestern University om Clearpond hade man begripigt att kanske koncept relaterade språkets ord och deras "ljud" varit mer relevanta söktermer än just databas (databas står på sidan därför att datarepresentationen finns där). Istället för databas hade en mängd koncept varit jämförbara och hade jag ej vetat att det hela hette Clearpond hade jag kanske försökt kombinera en mängd av dessa med relevanta ord rörande vad jag vill ha i datat.


Att istället träffa på journalartikeln är inte alls bra. För automatiserad analys är det enormt enklare att reda ut vad för datarepresentation de pekar på (jag gör det själv ibland off-line från arbetsdator som kan sådant när givit upp för hand på internet-datorerna) heter och var de finns åtminstone när färska. Senare över tiden flyttas de runt. Ofta pekas de heller inte någonsin ut explicit i själva artikeln utan ligger i bilagorna i form av noteringar eller att hitta via mer allmänna url. Dessa bilagor kan ha nästan vilket dokument-format som helst och underligt gäller att även om artiklarna ofta finns att få (normalt så) som PDF är det hos flera vanligt med DOC-format (orsaken bör vara att journalerna prioriterade utseende gör artiklarna estetiskt från förenklade dokument-representationer på ett standardformat medan författarna sitter med Linux ofta inom vissa ämnesområden och annars med Windows vilka båda ger enkla möjligheter som typiskt i kontorsmiljö till de vanligaste Microsoft DOC besläktade formatet vilka journalhusen klarar att läsa). Så ett sökresultat där jag hamnar på journal-artikel kan vara bara frustrerande: Jag vet att det jag behöver finns men ser inte ens om det är data författarna i dumhet sitter och okynneshåller på för sig själva, är data som en gång funnits på webben men försvunnit, finns fortfarande men ej är angivet var o.s.v.


Att såväl Google som Bing ej spindlar dom stora universiteten djupt längre (en hel del av äldre material kommer ej längre synligt och med början kanske någon gång 2014 tidigt för Google märker de ej eller hanterar ej sidor som flyttats runt hos dem när djupt ner: Omflyttning har hos dessa varit vanliga eftersom de allt mer prioriterat upp branding där hemsidorna allt mer fått som primära motivation att hantera potentiella studenter medan material för befintliga studenter, kontaktytor för forskare m.m. tryckts bakåt ibland via särskilda kanaler med skilda domän-namn).


Så får att uppmuntra Google såväl som Bing ska sådana begränsningar vi ser exempel på här korrekt ses och uttryckas hånfullt. Någon som gör så här kan inte mycket. Vidare för att skapa ett ekonomiskt incitament gör vi slutsatsen att detta knappast bådar gott för medarbetarnas optionsprogram. Mer balanserat tror jag dock vi ser ett allmänt problem där man allt mer ger upp inför mycket data genom att skära analystid snarare än att förbättra grundläggande algoritmer. Relationer från ex. journalartiklar ej överdrivet många år bakåt i tiden går för att tydliggöra detta göra ut från en ensam dator på någon vecka utan att ex. behöva bygga kontinuerliga BDB-prepresentation istället endast använda RAM-minne och hash-tabeller: Det tar lite tid men även på begränsad dator enormt snabbare än takten journalartiklar publiceras i. Har man som "regel" att alltid spindla allt sida per sida istället för att bulka ner data och hantera snabb access på samma dator (eller jämförbart) så blir det så klart ibland väldigt dyrt att göra analys av sådant som dåligt klaras genom vad man direkt kan propagera vidare där sett (som länkar m.m. av 1-stegs-natur ej krävande slutsatser).


I den ordning jag sökte. Första två - tre är som jag valde att söka själv testande medan övriga mer var vad jag gjorde för att skärmdumparna skulle visa det jag önskade. Notera att förståelse av konceptet Clearpond saknas vilket annars (och jämförbart för massor av skapelser) hade kunnat givit relevanta sökresultat ersättande konstigheterna nu givna med sidor som förklarar vad CSV är. Ingen koncept-förståelse som hade kunnat gjort gissningar på att vilken ZIP-fil som helst med Clearpond data fungerat verkar finnas. Så det gäller om man tror sig minnas att när man en gång själv laddade ner dem förra gången (men saknade information om formatet på CSV-filen d.v.s. vad varje fält innehåller för data vilket inte riktigt är samma sak som att jag inte förstår att CSV "officlet" normalt är "," separerad ibland med fältet inneslutna av fnuttar men praktiskt oftast i vad som kallas för CSV-filer gjorda av aktörer bland universiteten när genererade av särskilda program snarare än Excell-applikationer istället är tab-separerade - ibland namngivna TSV istället för CSV men oftast CSV). Kanske är det många som laddar ner data likt det i Clearpond och begriper vad varje fält betyder men ej att det är komma separerat? Eller fastnar på att ej begripa att det är komma-separerat? Är det så folk söker då? Eller söker de på CSV + Wikipedia oftast kanske?

clearpond + format csv file Inget relevant resultat alls. Clearpond ej med överhuvudtaget d.v.s. ingen förståelse av vad Clearpond är i mening av sådant som att tillhörande något som kallas Clearpond finns data och datat är publicerat och i CSV-format. Detta förvånar mig som företeelse allmänt därför att som diskuterat tidigare är det enkelt att bygga kunnande om.

clearpond + tsv + site:edu Vi verifierar att den heller - i ev. brist på förståelse likhet csv och tsv - ej heller klarar denna sökning. Inget resultat alls.

clearpond + zip + site:edu Här får vi nu Clearpond på position ett. Zip är angivet på sidan som länkar till zip-filer. D.v.s. just data som ges direkt spindlande sidan utan behov av någon egentlig analys.

Förstår den vad Clearpond är? Inget av dessa resultat pekar på det. I några fall får vi träffar på Plos one artikeln men ej datarepresentationen på hemsidan hos universitet som skapat det hela och gjort huvuddelen av arbetet med den representationen.

clearpond + sound
clearpond + speech
clearpond + speech sounds
clearpond + similarity

Medan clearpond + database går bra precis som zip gjorde.

Av detta lär vi oss att det är bättre att söka på diverse olika filformat, förkortningar för databas-format från export m.m. hellre än information som beskriver vad datat är och gör. Därför står det ej på exakt samma sida som filerna finns att ladda ner alternativt att sidan ligger med mycket meningsfull url-struktur ej djupt hos universitet (ex. ej djupt är en ej gammal subdomän - gamla universitets-subdomäner hos de stora fungerar dock jämförbart eller ibland bättre än deras www-subdomän).


Dock för att jämföra med webcam diplomati presterar Google bättre än Bing gjorde (se Hans förklarar världen: Vad är ""microphone" resp. "webcam" diplomati? - Även om jag i detta inlägg såväl som detta försökte vara komiskt är sökresultatet Bing direkt från den förråade verklighet som förutom att skrämma slag på känsliga personer som jag helt säkert inte är alltid helt stabilt i nivå kunskap nödvändig för att tolka vettigt kontra vad barn har - Dessutom även om barn eller ungdomar klarar att tolka översta sökresultatet kanske det distraherar från ex. ett skolarbete relaterat diplomati man sökte information till). Vi förstår från resp. exempel (de ovan resp. det med Bing) att flexibel tolkning av vad begrepp avser går att få till lika dåligt som att ha låtit bli.



Även om Bing har inställningar relaterade risk för pornografiskt-material vill jag nog mena att när barn ska rekommenderas sökmotor är i allmänhet Google fortfarande "säkrare": Dessutom även om Bing numera inte alls avviker lika mycket i defekter är Google's defekter ofta som här när jag möter dem mer relaterade "kunskaps-djupa tråkig användning" medan Bing kan bli underlig på sätt som barn kanske inte alltid rätt begriper att tolka.


Skärmdumpar av sökresultaten

Vilka jag vill ta till vana att alltid ta med eftersom jag så smått börjat samla till ett bild-corpus för den här typen bildfiler med text i. Det finns en hel del data jag hittat i oftast PDF-filer där bild-dumpar ligger inkluderade snarare än direkt tolkningsbart data att ta ut till text-format. Oavsett om jag tvingas skriva något själv för sådant eller behöver testa något färdigt (det senare känns väldigt mycket mer motiverat än göra kod bildanalys själv) vill ha jag några hundra med data lika tydligt avgränsat som söktermer och är riktiga ord men som typiskt inte är just meningar eftersom jag inte vill råka på ett program som verkar bättre än det är så länge saker är vanligt språk men underpresterar senare när man använder det på riktigt på stora tabeller med ex. en massa ord med tillhörande mätvärden.



















Bing vs Google: Högvärdes (sökmotor) sökningar III: Gaming

2015-04-04

Inledande diskussion en särskild sökning betraktar vi några områden intressanta när Google och Bing jämförs relaterat några av de idag mindre använda men värdefulla tekniker analys sidor och tolkning sökkoncept vi kan önska se när resp. börjar använda märkbart såväl som andra faktorer som kan tänkas ta upp Bing's marknadsandelar till nära Google.


Vi använder exempel-sökningen för att etablera några av de abstrakta resp. konkreta faktorer intressanta att följa upp via fler sökningar, statistik från andra källor resp. data mining av artiklar, konferenser m.m. resp. aktörs medarbetare uttrycks sig i.


Tidigare publicerat

Relaterat flera av diskussionerna ej länkat direkt där jag refererade fenomen (jämför också diskussion påverkan från språkmodell N-gram i skattningar Google index medan nedan diskuterades N-gram modeller närmare hantering av sökorden):


Bing kvalitativt bättre än Google för vissa former sökningar (inkl. bland de mest ekonomiskt värdefulla) RESP. Funktioner för sökning grafer jag vill se hos Google och/eller Bing

Information i SERP: Tillståndsinformation sökmotor resp. läsare / sökare

Översätta sökord: Se och särskilja kultur, grupper av personer och upparbetat representera människor

Google googlar med Google-NGRAM: Antalet indexerade sidor fel (2013-02-10)

Sökmotorer: Bedömning relevans och likhet mellan koncept och människor

Vad har Google, Microsoft m.fl. egentligen för beräkningsutrymme per användare? För kontext-hantering och prediktion av sökningar

......
Tänkbart är Microsoft Bing! på väg att bli stark (2014-02-07)

Bing! i Kina: Att approximera effekt med antal länkar (2014-02-17)


Video Gaming: Mycket värdefull bransch för sökmotorer

Förr i alla fall var gaming industri omsättande pengar - direktförsäljning av utbyggnader m.m. ekonomi lurande av ungdomarna såväl pengar som mer problematiskt läxtid (föräldrarnas fel: Ungdomar skriker efter struktur där spel och dobbel hör till någon vecka på sommarlovet) - såväl med en mycket internetanvändande publik.


Bättre perception av förändring intresse och preferenser är dessutom vad som kan ge sökmotorer möjlighet att kapitalisera bättre på de som söker i ämnet än andra aktörer kanske klarar lika troligt lika snabbt. Det är en fråga vi kanske återvänder till i ev. uppföljande inlägg när jag kontrollerat statistik för relevanta sökkoncept om jag har tillräckligt relevanta i min samling (jag tror men lär kontrollera mer att dom publika kanaler för indikationer Google har såväl som mindre aktörer jag prövat ej här tillför värde nog för att om jag saknar uppgifter sökkoncept ej bättre använder andra former av statistik som förändring uttryck nyheter, bloggar m.m. Dessa källor är ofta normaliserade i relativ mening och utsträckning i tid resp. sökord till begränsat värde för att se ev. förändrings-predikterande värde eller är mycket värre bygger på väldigt lite statistik utan att det framgår bra alls).


Låt oss därför göra en mini-test utan seriös bredd prövande Google resp. Bing i just denna bransch samtidigt som vi försöker få lite känsla av om någon av dem börjat "små-resonera" (den uppmärksammade kan ha noterat att jag av och till prövar dem vilket ibland givit någon postning här kring något noterat: Men ännu ej vad jag är intresserad av att om så märka).


Vi väljer en kundgrupp jag kan föreställa mig finns (Varför skulle jag vara unik?) såväl som jämfört med ungdomar och yngre vuxna med jämförbar eller bättre betalningsförmåga såväl som oftare havande barn man kanske söker presenter till. Sökningen:


generation later doom suitable 40 years old fully inexperienced games later than doom

Jag märkte säg ett eller två år sedan att Google gick närmare att (som jag upplevde det) utnyttja n-gram modeller på sökorden man skriver in i en språkmodell. Detta följde en tid (ej omedelbart) efter att Google N-gram publicerades:


I exemplet Doom Doom Doom har smoothing satts till 50. Som vi förstår från resultatet används smoothing ej för att hanterade saknande frekvenser när någon söker på orden utan tänker jag snarare bara för att ändra frekvenserna på n-gram man redan har riktiga mätvärden för. Frågan är vad man tänker sig att förändringarna särskilt om antalet reduceras från höga frekvenser som i flera ofta använda algoritmer "sparande" för koncept man ej hade i corpus tog vägen? Läsande ngrams/info inser jag att smoothing nog avsåg ritande av grafen och ej frekvenserna: Tyckte väl att det var funktion lite väl långsam om gjord bra att ha så här.


Första resultatet jag gjorde för att testa vad jag trodde var N-gram-smoothing ej alls intressant:



Intressantare sökning där Doom 1 fick ersätta Doom: Det senare ordet har så hög frekvens att det ej går att jämföra med Doom 3. Doom 1 lär ju vara samma sak som Doom oftast så det blir lite samma sak när vi tolkar orden i alla fall även om nu frekvensen är helt annorlunda. Se även att RA2 och Yuris tycks konvergera.




Det ger en till väg att tolka sökorden kompletterande vektormodeller av dokument: D.v.s. ordens ordning relativt varandra i statistik mening kan utnyttjas. Ett bra värde Google har som kan vara nära relaterat detta är identifikation av dokument (ex. journalartiklar, böcker m.m. med generisk titel) genom att förstå att sökningen just avser ett dokument med en viss titel eller med en viss under-titel (eller liknande) man kommer ihåg oavsett vilken sajt som publicerat dokumentet (journaler kan ex. ta betalt för att läsa artiklar samtidigt som universiteten har rättigheter utnyttjade att publicera en kopia av artikeln på sin hemsida).


I den mån detta fortfarande gäller är sökningar likt mitt exempel mycket svårare att bedöma utefter just detta jämfört med titlar. Titlarna med grundstatistik språkmodell dominerar över en udda lite slarvigt skriven mening. De många åren gör att den relativa skillnaden i statistik-meningen motsvarande ex. normaliserad frekvens och variation (entropin) gör skillnaden ännu värre: En titel för ex. en forsknings- eller nyhetsartikel kan uttryckas som titel på en mängd dokument medan min sökning kan vara vad Google innan aldrig sett med inte otroligt ej perfekt vanliga övergångar mellan delar av meningen till nästa ord.


Dessutom adderar språkmodellen i sig i mening av ngram-statistiken (sannolikheten för hela mitt menings-chunks) inte något särskilt värde för tolkning av vad jag avser för specifika meningar med mindre än att lite dyrare parsning och statistik tolkning görs. Ingenting jag märkt pekar på att Google gör särskilt mycket alls relaterad sådan tolkning jämförbart med en mer krävande modell av språk och mening.


Hur är det med domän och url när det gäller ranking?

Alternativ datakälla och informations-resurs till Google ngrams och Microsoft Ngram är bl.a. ngrams.info med COCA som är en av de lite mer kända resurserna även om jag här valde ut den endast p.g.a. likheten i domän med Google's URL resp. påverkar ranking såväl som resp. kraftiga länkning från betrodda resurser. Jag tycker att det är lite bra att Google ligger före COCA: Google Ngrams (books.google.com/ngrams/info) är kostnadsfritt (korrekt beteende) medan COCA's prismodell (skulle kosta migpengar) alltid känts fealtig för mig och då ska man inte ranka alls (jag betalar ej för statistik och vill därför ej heller hitta detta).

I övrigt har jag inte försökt följa ev. påverkan. Traditionellt har ju Google värderat detta. Propagerar man index framåt i tiden delvis åtminstone förstörande kan jag tänka mig att det är en sak som kan medverka till att man föredrar att behålla en ungefärligt (hög värdering men kanske mer eller mindre hög) jämförbar värdering fortsatt alltid framåt i tiden fortsatt så länge det känns som onödigt arbete att röra runt med datapunkter man ser ett värde i som de fördes över till nästa tidpunkt.


Har Microsoft common sense? Begriper de egentligen något alls?

Möjligt har Bing också en utmaning här: Men jag har ännu inte Bing-känsla nog för att våga mig på att spekulera även om jag åtminstone har viss koll på vilka common sense (ett av dem tror jag att jag diskuterade också just noterande att Microsoft prövat den lite förutom övrig diskussion här längre bak: Concept net) , teknikområden inom information retrieval, och intressen deras medarbetare runt Bing av och till visat intresse för relaterat konferenser m.fl. nörd-ansamlingar från olika företag och universitet för att lära av varandra och hoppas jag motivera upp varandra sunt söka visa vem som är den brutalare programmeraren och algoritm-tänkaren.

Google köpte upp en aktör för några år sedan relaterad common sense. Jag spekulerar att implementationen av datasystemet för graf-representation av koncepten med deras mening var hela värdet de sökte. Själva datavärdet av Freebase var när jag sist tittade på det ej på nivå där det är värt besväret att utnyttja om man kombinerar med några till stora databaser med enkelt vetande. Och jag tror ju inte riktigt på att det kommer bli Facebook-Coolt eller trendigt att sitta och sortera in föremål m.m. i olika ämneskategorier: Inte på nivå med att addera något ens för koncept annars ej i annat common sense (d.v.s. jag ser ungefär jämförbart värde användning av det med att automatiskt identifiera mening via statistisk- och lingvistisk-analys - Är det manuellt vill jag nog och tror att kanske Google tänker liknande ha mycket bra sample man kan börja algoritmer för att sedan ta ut automatiserat allmänt från språk från ex. som test- och träningsdata).


Stark och lätt lösning på mitt sökproblem: "Strategy of the Third Line of Warriors"

Problem: Lämpligt spel ej osunt i krav på joysticks eller tangentbords-kombination eller överdrivet "grafiskt" mer som Doom men lite senare. Här finns därför en enkel lösning när uppföljning på Doom namngiven ex. Doom 2. Emellertid spelar där nu sannolikheten in för om jag kanske avser också Doom 2 men efter alla år skriver dem på samma sätt. Missar sökmotorerna här kan jag förtydliga sökningen men det är intelligens där förståelse av vad jag önskar såväl som vetskap nog att väga in sådant vi är intresserade av i diverse sökningar jag lär göra av och till nu även om jag inte säkert diskuterar alla eller ens någon här (Doom varande kanske världens mest firade dataspel - vad tillochmed jag efter så många år minns - måste ju vara gigantisk big business idag med mängder av Doom-spel, Doom-filmer, Doom-prylar så jag vill inte lova bort någon insikt jag kan få istället för att låta den göra mig rik).


Strategy of the Third Line of Warriors är möjligt när entitet vi betraktar (ex. fienden som ställt upp sig fullt synligt i rader efter varandra på ett fält inför slaget) visar sin inbördes-ordning som en öppen label. Vi kan också jämföra med polis och brandkår på samma plats vid samma tidpunkt. Dataspel och film är två områden som i titlar kan uppvisa detta: Ghost Busters, Ghost Busters II m.m. Det går att utnyttja detta rent regelstyrt så väl med statistiska modeller (Bayesian probability är det enkla och välfungerande alternativet att utgå från här).


Google ger också förslag på Doom III redan på position två. Det bör tror jag säkert - men utan att följa upp emellertid väldigt trygg från allmän Google känsla i det - att Doom III är det sista eller i ord-gram mening det sista nära refererat som Doom (ex. just "Doom III") liggande senare i tiden med en försvarlig mängd referenser i datatidningar, bloggar m.m. Det är om så nästan helt säkert detta snarare än att Google klarar att fundera ut att jag nog spelade Doom II men ändå skrev Doom (det lär visa sig framöver när jag prövat mer: Just den förmågan är dock mycket intressant särskilt när vi antar ingen kunskap i form av sparat kontext om mig - Klarar man denna typ av resonemang bra är det generellt tungt i värde samtidigt som det är svårt med troligt stor distans till konkurrenter).


Strategy of the Third Line of Warriors är här vad som kan ha gjort all analys såväl som inlärning statistiska modeller mycket enkelt för särskilt Wikipedia. Och med besläktade enkla principer för regelnära analys vad som kan maskera sig som sofistikerade mycket mer generella algoritmer. Vi ska därför varken för Google eller Bing tolka in för mycket i förslaget Doom III.



Microsoft Bing röstar med sin sökresultats-länk också på lösningsförslag Doom III men redan på på plats ett:



Att Bing väljer Doom III före Doom gällande ett Wikipedia resultat stämmer bra för hur jag typiskt föredrar sökresultat om jag sökt på långa meningar ej överrensstämmande med en titel på ett dokument jag vet existerar och vill hitta i sin helhet att läsa kostnadsfritt (generellt som delvis diskuterat i Bing kvalitativt bättre än Google för vissa former sökningar (inkl. bland de mest ekonomiskt värdefulla) RESP. Funktioner för sökning grafer jag vill se hos Google och/eller Bing
också high value område för sökmotorer).


Jag vill här ofta gärna att ett koncept likt Doom ska tolkas närmare en ämneskategori och att resultaten ska gå mer exakt från övrigt jag skrivit: Och om jag ännu över-optimistiskt vill testa om de börjar begripa mer som vanligt nu "komplex" mening med koppling till statistik människa (ex. det senare här åldern resp. "generationer" implicit på dataspel) kan jag pröva en sökning som dena.


Åtminstone periodvis har jag upplevt Google ger problematiska sökningar för jämförbara sökningar. Problemet har varit Wikipedia: Vissa perioder (och kanske är detta problem inte längre aktuellt) var det för en del sökningar nära nog omöjligt att med normalt besvär få bort träffar till stora delar irrelevanta som jag vill minnas (postningar bakåt med exempel finns som jag vill minnas det).


Vad är ett Doom 3? Trendig retro att felsortera med musik- och film-CD samlingen eller konvenansisk defekt från dålig uppfostran och för lite matematik och klassisk litteratur i skolan?

Vi går nu in och tar reda på vad en Doom 3 är (en indikerar väl kanske CD-skivan med spelet och tillhörande instruktionsbok: "Det ligger en Doom 3 bland mina musik-CD / Blueray-filmer", Erik tog med ett Doom III för att visa skolkamraterna hur cool han är med den senaste inne-prylen.).


Även om jag ej försöker besvara frågan är det ibland värt att fundera lite över vad koncept också när en självklar named entity likt ett dataspel eller person är mer än det. Uttrycker de implicita ämnen? Är det givet att den som begriper Doom 3 även lägger något av vetande man i Wikipedia snarare hittar på sidan för Doom via aktivering av hjärnans nätverk när begreppet ska förklaras för någon som ej prövat detta dataspel någon gång? Och sker kanske liknande effekter redan från att läsa en titel eller vad vi vill ha sagt skrivande sökordet Doom 3? Ej frågor 100% lätta att leda rätt till mål (Och jag skulle verkligen önska att någon av dessa två sökmotorer rekommenderat ett spelbart alternativ: Gratis och kanske mer en generation mellan Doom 3 och Doom 2 så det är begripligt hur det fungerar men ej så faktiskt: Man ska tvingat ha tiotals år av dataspelande för att alls få det nöje yngre generationer tycks kunna ta för givet) men vad vi framöver kanske återvänder till.


Doom mer topp än Doom 3

För hur jag kan tänka mig att jag skulle försöka implementera en princip själv med om kodande en sökmotor likt dessa när befintlig statistik sökningar saknas är att förstå Doom som såväl ett dataspel (named entity) och ett abstrakt ämne sträckande sig över fler Doom-dataspel, Doom-kloner, och kanske en bit in eller som fuzzy-"undrrums-liknande-koncept" till FPS (first-person-shooter: Dataspel jämförbara med soldier on battlefield där flera krigar ex. lag tränande samarbete och annat nyttigt kanske som en belöning efter att gjort läxorna i en studiegrupp eller arbetat över).


Wikipedia sida för äldsta dataspelet är det mest ämnestunga Doom-konceptet: Det är högre upp än Doom 3. Värde detta ger är oftare fler länkar till allmänt material, enkla vägar att hitta till mer specialiserade sidor (ex. Wikipedia sida för Doom 3 eller en extern resurs), abstrakta historiska diskussioner och jämförbart i och runt ämnet med inte sällan idag ett stort antal referenser om man behöver djupare vetande.


Bing saknar äldsta Doom-dataspelet topp tio: Bra eller dåligt?

Att Bing saknar Wikipedia sida för första Doom dataspelet som är det mest övergripande ämneskoncept tunga sidan kan möjligen peka på en svaghet om en generell egenhet.


Att Bing ej hade med Doom sidan i Wikipedia topp-tio kan emellertid tänkbart vara sund strategi. De tycks ha större variation mot smalare representationer oavsett som senare diskuterat säkrande upp med för mig felaktiga ämnen eller som för Doom-ämnet en smalare färskare spel-release resp. något skandal-relaterat. Det kanske fungerar bra för dom att växa via? Att bedöma ett sådant värde har jag ingen statistik som jag kan tänka mig säger något alls om annat än när återigen kör mitt Symbol Mind dagligen igen och kopplingar till förändring av koncept uttryckta i nyheter och bloggar kan ge indikationer om någon bas-förståelse av "personligheter" mer rörliga i preferens sökmotor kan etableras.


Statistik sökning (antal som söker efter något och tids-relaterade sökningar) är ytterst scarce och svårt att få tag i: Men kompletterar potentiellt potent när sökmotorer ska förstås

Rörande statistik sökningar har jag ej hämtat upp min råstatistik med statistik över sökningar på sökmotorer (aktuellt i databaser ligger det kombinerat till en gemensam representation med andra källor) från arkiv på USB-diskar. Men lär ta upp det till efterföljande diskussioner i kommande inlägg för där aktuella sökningar (och denna om jag har statistik för sökkoncepten).


Statistik faktiska sökningar och än mer hur en sökning predikteras eller predikterar en annan sökning är emellertid ytterst scarce. Mycket tidsödande att få tag i såväl som mer begränsat i antal sökkoncept såväl som storleken totalt med den tillgång och förmåga att övertyga (jag betalar aldrig för statistik: Så ska något alls ges tillbaka är det primärt statistik jag har eller någon annan information). Även data som säljs har ett mer begränsat värde än vi kan ha vant oss vid att förvänta från annan statistik koncept. Flera riktade aktörer säljer dessutom statistik som ej är vad vi här önskar eller för den delen tillför (som jag bedömde det för de tre ungefär största för bl.a. "toolbar-statistik") med en kvalitet och trovärdighet som gjorde data värt att inkludera till gemensam representation för "statistik sökord" över alla kanaler.


Om [Försöker skriva meningen kul vilket bör förklaras för alla läsare som har problem med tråkighet så att man inte ödslar tid på tolkningen.] någon release (ny version av videospelet) eller Washington Power-Pack (en utbyggnad ibland kostande massor med som kan ge ett gammalt trött dataspel nya förmågor att roa publiken drama ganska ofta samman tryckt till intensiv intensitet på några minuter på teven antenn-sladds-ingång videospelet kopplats till) varit aktuell för perioder jag har data (minns ej och vet ej säkert att jag har ens år för allt data: En del sämre gammalt data idag knappt vad man om inte ganska begränsat i mängd jämfört med andra datakällor jag använt totalt skulle våga värdera för de viktsystem jag byggt från dessa samples för användning närmare aktuell för analys händelser just nu fullt ut så att säga: Mycket Buzz-words folk hört på jobbet eller uttrycker någon ganska snuskig perversation de har som kan vara ganska års-beroende eller ännu smalare: Musiker NN naken kanske inte är lika hett 15 år senare när hennes karriär är över och hon hunnit slitits ner av droger, festande och trafikolyckor m.m. karma-balanserat kända personer ibland drabbas av).


Förutom sådant gammalt sökmotor-data har toolbar-statistik från också de största aktörerna problem stora utmaningar här. Frekvenser, ålder m.m. är inte trovärdigt och var problematiken ligger även om kanske tydligt relaterat åldern behöver inte ha bara en gemensam förklaring som att man stoppar in antal från andra former av mätningar an gör för att fylla på data av en typ där man är inarbetad och känd. Andra orsaker kan också vara fallet men är svårt att bedöma. Även om bl.a. auto-surfande inte är vad som direkt är den större risken just här för mig i alla fall: Sådant är ju en form av skattning av värde indirekt mot sökord (men man måste så klart på vettig nivå klara att separera det från andra former av data för att inte bara bli underligt fel). För en mindre aktör bl.a. förutom möjligt eget data (uttryckt så) upplevde jag att man för några sökord stoppat in egna siffror utan någon trolig mätning: Kanske att man fått betalt för att ta upp statistik för något mot kund man välkänt har eller övertygat någon om sådant skulle ha ett värde och fått betalt för att göra det (eller att aktören startades upp specifikt för att göra just detta.kanske bara för ett fåtal sökord med ett särskilt syfte relaterat någon och något). Jag såg inga politiska exempel jag tyckte var troligt aktuella exempel på den typen av manipulation.


Min statistik har totalt för sökord inte ett antal typer eller token-frekvenser i närheten av jämförbarhet med vad jag har för språk generellt. Men lite har jag (jag vågar inte säga fler än 100 000 här för fler-grams sökningar: Det var ett tag sedan jag tittade bland sample-området som denna statistik hör till för mig och som jag använder det faktiskt är det kombinerat en mängd källor i databaserna jag använder och finns istället som rådata externa usb-diskar att återkomma till kanske om några dagar rörande statistik Doom m.m. när jag ska ta upp en del annat data ) :-D


Är Bing svag för skandaler, romantik och trender? Är det smart eller bara vulgärt?

Amerikanen vet vi från stereotyper nog starkare några årtioenden bakåt allra minst kan vara såväl som lite övermotiverad / smart i affärer resp. vulgär i och runt allt i kultur som fodrar en traditionell värde-transferering av en korrekt centralitet och/eller att man investerar några år på en särskild lite dyrare skola där man prioriterar ex. klassisk musik eller litteratur djupare för att etablera möjlighet att diskriminera det vulgära från det intressanta.


Och kanske är Bing smart. Eller om de bara är en vulgära amerikanen som kommer och försöker prångla ut information vi från äldre länder ogärna läser medan de försöker rättstava sönder författare och konstnärer välkända sedan många hundra år (att söka på konst eller en författare - annat än de givet vulgära i vilket fall likt de flesta moderna romanförfattare - är självklart ej del av konvenans möjlig att visa eller tala om i ett socialt sammanhang: Jag kan inte förstå hur någon ens kan tänka sig att göra sådant - Så lätt illamående man blir bara av att tänka sig en vulgär amerikan som sitter och söker på en fin engelsk författare som John Updike eller defekt i varje sammanhang privat eller oartigt i allt socialt surfande "fakta" om Updike i strunt som Wikipedia istället för att vi från gamla fina kulturer läsa honom, förstå honom än mer med en biografi betryggande skriven av den som kan uttrycka djupet det ytliga inte hinner se upptagna med att förstöra och felförstå ytan: För updike såklart en Britt från England med samma fina engelska bakgrund som Updike hade).


Är nu Bing den smarta eller vulgära amerikanen - eller kanske rent av den fin-kulturella Updike-britten när de prioriterar trendigare innehåll? Kanske uttrycker de något av Updikes Haren (talande kultur så att ev. läsande amerikan ej förstår vad vi säger)? Min känsla är att det kanske en aning mindre tråkiga innehållet med distans lite kortare till "nöjen", det ibland upplevt trendigare med kortare temporal reward discounting skala framåt m.m. (jag vill inte skriva vulgärt här eftersom jag haft nytta av detta själv när jag sökt teveserier) Ett upplever jag resultat för exempel-sökningen jag kan tänka mig kan visa sig vara relaterad en sådan ev. värdering är:


Video game controversies - Wikipedia, …Översätt den här sidan
en.wikipedia.org/wiki/Video_game_controversies
... playing of violent video games than ... 40 in Tennessee, killing a 45-year-old man and ... a link to video games, which was later ...
Background · Theories of negative ... · Censorship and regulation

Controversies är koncept inte särskilt svårt att följa indikationer relaterad emotionell kraft tänkbart - intressant att ranka upp om så - predikterande intresse gärna såväl publicering som sökning (även publicering viktigare därför att färskt innehåll när emotionellt intensivt är kraftigare gemensamt: Kändisar nakna tillsammans med droger, politiker som uttryckt sig anti-gay eller rasistiskt eller verkar indikerad i myt-skandal o.s.v. Saker folk bryr sig i men inte sällan just när det inträffar). Också vad som kan visa sig ha stabila grundvikter som håller över tiden där kontextuellt eller tidsberoende mer är att controversies i datakvalitet runt studier människans DNA fortfarande är feta-skandaler men som ingen mer än folk som lärt sig att de måste förklara för maskin såväl som människa vad de egentligen pratar ens hört talas om.


Om Bing gör emotionell värdering intresserar det mig. Området har jag utmärkt viktstöd för själv och när inarbetat som där roar det mig när jag har behov att hantera självbild och självförtroende att jämföra med någon som närmare i tiden börjat med det (det är en av de kanske två mest stabila viktsystem jag har lösningar för oavsett om det gäller endast intensitet med förståelse av att fler dimensioner ej ska fodras för att dra snabba slutsatser eller om polaritet över ett mindre antal basdimensioner krävs eller upp till många fler indikationer om än då av mycket mer varierad kvalitet: Danger, Hate, Positive, Unknown m.fl. är några exempel på självförklarande ämnen medan ett ex. på mer abstrakt inkluderande mer manuellt arbete data såväl som egen-logik är Marching Up avsett för att ta indikationer på den intensitet som föregår uttryck av mänsklig aktivitet i grupp av typ krig, invasion, allmänna kravaller m.m. i kontrast till Gracefull Cute för allt internets och nyheternas gulliga läsar-fiskande).


Fler exempel som teveserier, film (innehåll möjligen ibland oftare otillåtet publicerat indexerat) och erotik gavs i Bing kvalitativt bättre än Google för vissa former sökningar (inkl. bland de mest ekonomiskt värdefulla) RESP. Funktioner för sökning grafer jag vill se hos Google och/eller Bing
. Och som sagt tror jag inte Microsoft tar marknadsandelar av Google genom att vara finkulturell: Innehåll med högre upplevt värde där "hål" kontra efterfrågat finns hos Google är kraftfullt oavsett om det nu är långfilmer, teveserier, böcker eller vad helst nästan.


Google har här (tråkigt istället för ytligt ämne men varken bättre eller sämre för det: Solid besparing per access artikel) värde i åtminstone ett område jämfört med Bing: Det är mycket lättare att med Google's koncept (Scholar och WWW) hitta hela artiklar publicerade i journaler. Länkar till sådana hos Microsoft Academic går för ofta bara till förlagets sida när access kostar pengar samtidigt som länkar till hela artikeln hos universitet när de finns ofta inte lägre fungerar.


Doom i Wikipedia har fyra stycken ord

Besläktat redan diskuterade möjligheter att utnyttja språkmodeller för att förstå att identifiera titlar (och uttryck nära existerande titlar vilket n-gram modeller oavsett om bara ord på slutet eller enstaka eller felskrivna ord skiljer oss från hela titeln fungerar mycket bra för: Ett av få områden n-gram modeller verkligt dominerar med endast ord utan hänsyn fonetiskt, grammatik, eller något alls i övrigt - förutom ev. lite kring ord om felstavningar ska tas men jag tror det normalt enklare görs separerat) är hur vi värderar koncept explicit eller som här när analyserat kanske närmare optimalt "lite" indirekt eller implicit givet från en mening snarare än mer explicit som i exemplet:


Doom AND "over aged player" AND "Fairtraid certified" AND "unskilled gamer" AND game with doom likeness AND amusing

Rörande Wikipedia-sidan Doom (1993 video game) noterar vi den längre titeln än den Doom 3 / Doom III (se att Wikipedia ger kandidater på möjliga "synonymer" / "rättstavningar" m.m. via sina redirects) har. Vi vet att Google har statistik och algoritmer för att aktivt utnyttja detta för att identifiera mellan titlar och sökningar. Det kanske gör dem mer benägna att korrekt värdera Doom som sökkoncept i titel med förståelse av att det bör ha approximativt (tänkt enklast för tomma sidor d.v.s. ingen hänsyn i övrigt till innehållet) samma vikt som om i en trovärdig representation likt Wikipedia skriven med bara Doom.


Just för Wikipedia är detta trivialt: Dominant källa till rankningsbart innehåll och excellent källa för att bygga vetskap om världen. Parenteser i titlar är en av flera enkla regler för hur Wikipedia-titlar tolkas effektivt.


Tråkigt nog som det lär visa sig i kommande jämförelser för andra ämnen har resp. Google och Bing det från samma teknikområde lätt omvända problemet: När stor andel av många givna koncept är relevanta utnyttjas de sämre. Svårighet att förstå hur de förehåller sig till varandra är fallet för resp. Det fungerar säkert ändå acceptabelt för de flesta därför man vänjer sig med att hur man tror att det behöver fungera utan att tänka på vilken enorm begränsning det är. Emellertid är relaterat detta en utmaning vid sidan om teknik för att klara det frågan hur man kan få gränssnitt att ta emot data effektivt här utan att det blir komplext: Ev. är det svårt när folk lärt sig söka förutsättande detta att ändra medan annat än antagligen ej lär sig att använda särskilda funktioner. För dyrare sökningar som tar lång tid prospekterande djupt är det emellertid värdefull parametrisering. Trivialt från koncepten här kan det tänkbart vara bra att veta om vi avser dataspelet Doom resp. ämnet Doom om vi skriver Doom + Doom.


Doom + Doom o.s.v. vet jag Google förr i alla fall tveklöst gjorde något med. Men vars ev. värde ej framgick för mig. Jag minns att jag tyckte mig se vad det var som gav effekten men kommer ej alls ihåg vad (och inget tänkbart presenterar sig från allmän kunskap). Tveklöst icke att man klarade tillsammans med ev. föregående sökning (kanske Doom AND Doom AND Doom efter Doom AND Doom) genom att om rimligt bedöma förhållanden och möjliga alternativa distanser mellan koncepten utanför motsvarande vektor- eller språkmodeller av dokument och sökord.


Bing har tror jag mindre preferens för den enklare sekventiella parser-relaterade tolkning Google gillar (men Microsofts intresse för n-gram statistik var ju från publicering data känd föregripande Google Ngram) och utnyttjar som diskuterat identifierande titlar. Jag vill (men har ännu inte riktigt Bing vana nog att vara kategorisk) tolka några resultat mot slutet av topp tio säkrande upp med med flera alternativa tolkningar av ämnet jag avser att de säkrar upp sig lite väl mycket för att förutom identifikation av motsvarande koncept vi kan se i en vektor-modell av dokument också använda en språkmodell med annat än låga n i n-gram (ty min sökning tappar när vi ej klarar att tolka ut i övrigt mycket densitet och total mening om den ska ses som ord i en vektor-modell: 40 år öppnar ju ex. för att jag kanske känner the doom närmande sig och behöver börja titta över alternativ sjukhusvård så man är redo när kroppen börjar falla sönder):


Pension Pulse: Will Longevity Risk Doom …Översätt den här sidan
pensionpulse.blogspot.com/2015/02/will-longevity-risk-doom...
2015-02-18 · ... who can now expect to live an additional 21.6 years, two years longer than in the old ... than anyone in the past 40 years ... than at any later ...
[...]
Health - The Telegraph - Telegraph …Översätt den här sidan
www.telegraph.co.uk › News
Get the latest health news and wellbeing advice from the Telegraph, ... A dialysis patient who received a kidney transplant 25 years ago is ... rather than referred ...

Är Blogspot.com affärskritisk plattform för Bing's affärsmodell? Kanske

Förra året menade jag att prioritera bloggar m.fl. innehållsleverantörer (ex. sajter för att spara och publicera filmklipp där värdet Bing tagit som diskuterat i också kanske kan ge värden här) i sökresultat är en väg för Bing att etablera i den om alls troligare lugna förändringen sig som en jämförbart med Google stor sökmotor.


Personer som endast söker antar vi vara mindre rörliga medan innehållsleverantören prioriterande trafik intresserar sig för hur de rankar på sökmotorerna. Bättre stöd för sökning på sajt m.m. är vägar Bing kan fånga upp dessa med när de följer upp trafik Bing kan ha levererat. Därmed får man stabila kopplingar till fler personer såväl som en större synlighet mot innehållsleverantörernas läsare (ex. via sökning på sajten).


Möjligen (går ej att bedöma nu från endast en av de första två test-sökningarna) kanske vi ser något av detta. Relaterat är ju också att större variation kan ge Bing värde genom att visa var innehålls-typer värda pengar och trafik finns ännu dåligt fångande av dom såväl som ännu större aktörer i mängd statistik: Trots alla tjänster tror jag nog Google som ett ex. kan missa mycket nytt med trafik under i alla fall ibland långa tidsperioder. Men för dem redan dominerande betyder det mycket mindre. För Bing är det möjlighet att följa nytt för att ta marknadsandelar.

Bing kvalitativt bättre än Google för vissa former sökningar (inkl. bland de mest ekonomiskt värdefulla) RESP. Funktioner för sökning grafer jag vill se hos Google och/eller Bing

2015-04-03

Så väl utvecklare inom IT och psykologer är ytterst roade av bildigenkänning i AI relativt många andra områden (upplever jag). Och kanske att många ger sig på möjligen mer avancerad - åtminstone långsammare relativt hårdvaran - bildanalys (ansiktsdrag m.m.) innan möjligen enklare men mer användbara områden (För mig: Men det tycks oftare för mig visa sig bra - Välkänt bra för mig är bra medan bra för dig inte alltid är bra för mig).


Att söka grafer och diagram är ett område där man kan tycka att bättre stöd borde finnas i sökmotorer. Google har ju som ett exempel utvecklat en mycket ambitiös (när den kom i alla fall: Idag gissar jag att mer jämförbart finns) för att beskriva i "html-liknande-språk" för hemsida eller liknande vilken graf man ska visa. Och Microsoft har ju utvecklat applikationer för att göra grafer m.m. dokument-relaterat sedan bra länge nu. Grafer givet den enorma låga variansen / höga redundansen utanför grafen med närmast binär förändring i kurvans avgränsning borde ju dessutom vara enkelt att analysera effektivt: Givet att åtminstone Google sparar bilderna på servrar lär det knappast bli mycket dyrare att göra heller.


Idag sökte jag på contextual diversity då jag ville få en snabb överblick av vilka beräknings-former man skattar effekten via (från besläktade mätningar eller direkt i resultaten slutsats: Ex. linjär typiskt illustrerande eller kanske S vänd åt vänster lite beroende på o.s.v.).


Söker jag grafer kopplade till data vill jag inte hamna på bilder praktiskt normalt orealistiska: Överdrivet mjuka, närmare perfekta likt genererade av en funktion. Dessa är antingen överdrivet illustrerande där normal förändring tagits bort, defekter i studien ej hanterats enklare att fǻ en bild av (vilket jag snarast brukar använda som en av tre - fyra snabba indikationer relativt antal människor man mätt på när aktuellt för vilken ungefärlig budget man rört sig: Grovt varför det fungerar väl kan de tänkbart intresserade ganska enkelt förstå genom att jämföra studier kulturellt i medicin kontra i data: Bra med annat). Det kan också handla om bilder som förklarar en princip: Detta är mycket vanligt i referens- och läroböcker - Och möjligen inte helt bra genom att vänja studenter med det orealistiska och från det kanske till att medverka till en kultur där data förvanskas i lab-rapporter m.m. för att spara tid.


Sökande på contextual diversity hamnar jag på grafen nedan. Spekulerande - p.s.s. jag filtrerar för att slippa besöka - ser jag respons-tid d.v.s. ej otroligt om relevant mätningar på människa. Grafen tror jag starkt är antingen illustrerande en princip uttryckt i en formel för att generera data eller kraftigt borttagande outliers. Det kan också vara responstid relaterat IT mätt med konstant last, konstant bandvidd o.s.v.



Här skulle jag se värde i att kunna parametrisera Google till om jag vill att funktions-identifierande grafer "orealistiskt korrekta" (ex. önskande se andra förslag på hur learning curve kan uttryckas i formel) eller att jag vill se realistiska seriösa studier illustrerande data från människor eller annat som naturligt normalt aldrig har "grafer utan underligheter".


Nu använde jag Google som exempel därför att jag normalt använder dem. Jag kan uppleva att Google Scholar saknar mycket jag skulle vilja ha men jag är van att använda den och Google samtidigt som ingenting som avgörande skiljer sig i kvalitet uppåt för forskning (någon har jag tyckt bättre rörande något medan Google haft andra värden mer avgörande: Stort index och länkande PDF eller liknande för studier mycket oftare än någon jag prövat - då i alla fall - till hela studien och om saknad har ofta Google WWW hela studien).


Dock passar jag på att säga att Microsoft Bing sedan jag sist för kanske ett halv-årsedan noterade förbättringar ganska tydliga vid flera tillfällig användning jag gjort sista månaden är riktigt ordentligt bättre nu. För många WWW-sökningar forskning på nivå Google ungefär: För några bätte.


För att söka filmklipp jag är intresserad av: Teveserier och film är Bing tydligt bättre än Google. Google ger ofta träffar på Youtube som numera ofta är gigantiska redundanta filer med bara en konstruerad filmruta upprepad utnyttjad för driva trafik till andra sajter via länkning. Eller en liten mini-teve mindre än fönstret för filmklippet jag ej står ut med att titta på.


Samtidigt har Google aldrig varit bra på att ge varierade träffar för filmklipps-innehåll där kommersiella aktörer finns engagerade i att erbjuda innehåll d.v.s. innehåll man kan spekulera oftare för sajter jag föredrar - gratis - är otillåten dublicering och visning av upphovsrättsskyddat innehåll. Jag ar tidigare i flera inlägg från början av processen till idag diskuterat den moraliska frågan här där jag tills för några år sedan föredrog att ej annat än mycket sällan konsumera innehåll ev. otillåtet. Men jag kom drivet dels av upplevt värde samt den enorma variation internet har idag där jag ej kan avgöra vad som troligt har korrekta rättigheter eller inte längre samtidigt som ägare numera bör ha rutin för att effektivt hantera dessa frågor (sedan har jag noterat att de idag inte utnyttjar även när de satsar regelbunden budget på hantering utnyttjar någon av de mest effektiva tekniker kända för mig för att identifiera innehållet: Ofta snarare än direkt kommer de till att se innehållet månader upp till flera år efter att en aktör varit aktiv). till att ej filtrera mig.


Oavsett moraliska frågor är detta innehåll vad jag är helt säker på normalt hör till det med störst värde för den som söker information. Därmed potentiellt vad som kan driva förändring i preferens sökmotor lättare (Google har nu varit dominant länge: Inlärning och rutin gör förändring trögt så detta är lite små-intressant).


Jag experimenterade vid två tillfällen även med en annan typ av sökning välkänd för att ha högt kortsiktigt upplevt värde: Explicit "romantiskt" innehåll. Jag kunde uppleva att Bing hade bredare variation och mycket mer här. Mycket tänkbart lider Google här av index-generationer passeerande påverkan från bakåt i tiden såväl som black-lists från åren när Google behövde vara mer exkluderande aktiva för att hantera SEO. Jag tror att Google förstörande har fört index rörande page-ranking liknande faktorer framåt i tiden utan att normalt någonsin gå bakåt genom åren för att återberäkna länkning m.m. som då skedde.


Rörande förändringar Google har jag märkt en del mindre utan att aktivt titta efter något. Inget har varit riktigt avgörande för upplevelse sista månaderna vad jag minns men ej heller att jag reagerat positivt på något. Sist började de laborera med synonymer vilket gjorde att jag fick börja söka mer arbetsamt först tittande på fler sidor och ibland ge upp på termer (exempel publicerade då finns här om man söker sig bakåt). Och sedan behöva förändra hur jag sökte på termer: Använda citationstecken ibland - oftast fungerande men inte alltid tycktes det - och oftare lägga till kombinationer inom citationstecken.


Jag tror nog därför att Microsoft Bing förbättringarna kan visa sig vara en stimulerande kul och bra faktor inte bara för Bing's användare utan dessutom Google's personal och dom som söker information hos dem. Utan konkurrens med stora marknadsandelar som för en ung bransch upplevs stabila alltid där blir saker lätt tråkigt utan den för människan ibland bra drivande kreativitet ett rovdjur eller en konkurrerande person eller grupp kan stimulera fram. Synonym-förändringen kändes för mig verkligen som ett mer än normalt tecken på behov av detta: Det var om man ska göra sådant så mycket mindre än jag kände rimligt förväntad av någon som har Google's statistik över sökningar, hemsidor m.m. Så helt unik grupp av användare kan jag i all rimlighet inte vara för att så mycket ska gå så irriterande för så många av mina sökningar. Och åtminstone för den gruppen går sådant här att göra utan problematiken. Jag tror att en del möjligheter kan framgå de diskussioner jag publicerat ganska nyligen om base-form för ord och frekvenser (eller om inte så relaterat området med en del indikationer åtminstone pekande på statistiska samband kända spelande roll i semantisk resp. andra former av tänkbar priming från studier människa vilket mycket troligt är en del av en vettig utgångspunkt förutom statistik sökningar för att experimentera fram funktionella omskrivningar: Ex. för vissa typer av priming är semantisk priming väldigt dominerande annan form av "priming" man kan föreställa sig skulle kunna vara fallet men har väldigt liten effekt om någon: Google är ett så stort företag att jag brukar känna det tryggare att ge lite tips så här - och litet besvär här där jag nyligen läst över igen dom här resultaten etablerade särskilt från senare 1970-talet till 1990-talet med mycket kvalitet och bättre förståelse från kanske 2004 från studierna jag tittat på - om man kritiserar dem men så är jag också kanske lite lättskrämd av stora aktörer): En bra introduktion om området är nytt och den jag började från är Neurolinguistics: An Introduction to Spoken Language Processing and its (om än som ofta för ämnet såväl som relaterat psykologi väldigt fokuserade på substantivet med föga intresse adjektiv och verb).


Microsoft efter år kändes det för mig mest göra sökmotor för att ha en sådan också känns lite hungriga nu. Kanske feltolkar jag det därför jag har inte erfarenhet om hur snabbt kvalitet går att bygga för en given hårdvara för så stor indexering dessa sökmotorer arbetar med eller vet hur mycket hårdvara de har. Men det känns lite så ändå. Ibland är sådant lätt kulturellt drivet också (folk från kulturer som börjat bevisa och visa upp resultat inom ex. teknik men oftare från tidigare år betraktade - som de upplever det implicit - lite sämre tycks ibland prestera bättre än oftare än normalt: Ex. folk från Kina inom IT) men sådant värde bör gynna såväl Microsoft som Google.


En del jag tagit upp tidigare har ju "flaggat" lätt för att Microsoft gjorde ett ärligt försök. Samtidigt kändes det för mig att för ett så stort och rikt företag "förfettat" - lite förslöat" - av stabila inarbetade affärer i mycket drivet kundnära från partners (oavsett OS eller konsultaffärer / utveckling system) medan nya versioner OS inte är vad man gör från en månad till en annan rörande något (traditionellt i alla fall) för att direkt möta något behov eller visa konkurrenterna vilket företag som nu såväl som förra året är störst och bäst. Det senare var jag inte främmande för att tänka kunde avgöra det här: Man försöker ett tag men så kanske det mest blir någon ny plug-in till Microsoft OS av det som blir viktigt eller något intern-tekniskt kring OS vs Internet-api:er medan övriga frågor blir långsammare därför att nya index alltid är lite långsamt att bygga. Därför är jag desto mer imponerad här: Är det här allmän förändring Microsoft från hur jag upplevt saker medan jag fortfarande använde dem (där jag gick från supporter - men föga inriktad som folk ibland blir kring någon teknik - som bör framgå i vad publicerat i IDG's tidningar dom åren när Microsoft 2000 Server var stabil till att uppleva att den förändring till stabilitet de då började på helt försvann efterföljande år och ej p.s.s. gick att säga var möjlig att konfigurera och sätta upp tillsammans med kompletterande inkapslande system till mycket trovärdig säkerhet - är det ännu mer imponerande.


Stor respekt här faktiskt. Förändring från tjockt-företag mest små-slipa lite på gamla affärer medan saker blir lite sämre i annat i samma takt till vad som kan gå upp i ett nytt teknikområde där man först presterat flera år sämre än branschledande är sällsynt. Sådant är ju svårt också för oss som individer. Kan peka på om mer lokaliserat Bing att Microsoft haft mycket tur med rekrytering kompetens och / eller management.

Information i SERP: Tillståndsinformation sökmotor resp. läsare / sökare

2014-05-19

Låt oss diskutera sökninginternet - kanske närmare perspektiv sökmotor resp. entiteter betraktande generell tillståndsinformation synlig - utan särskilt mål annat än att uttrycka vad en SERP är för läsaren av sökresultatet.


Koncept. Vad vi skriver i sökrutan.


Mer fokus på hur det ser relaterat tillståndsinformation det motsvarar även när tillståndsinformationen är reducerad sammmanfattad över annat.


  • 1. Vikter och skattningar: NGRAM- och språkmodeller
    • 1.1. Antal resultat för koncept
    • 1.2. Antal sökningar på koncept
    • 1.3. Antalet läsare av allt i resp. sökresultat
    • 1.4. Antal dollar / kr för koncept
    • 1.5. Abstrakta värden (kronor vi ej enkelt kan handla för)
  • 2. "Rubrikerna" i SERP
    • 2.1. Rekursion och arbetsminne
    • 2.2. Snippet
  • 3. Rekommenderade sökningar
  • 4. Volym sökningar igen: Bing - Google

1. Vikter och skattningar: NGRAM- och språkmodeller

Vi konstaterar först att vi har tre grundläggande variabler för två mycket ofta använda både i information direkt läsbar för den söker eller den som påverkar vad synligt via kanaler för reklam.


1.1. Antal resultat för koncept

För index över koncept i ett tidsfönster ej äldre än T[1] och ej yngre än T[2]: Hur troligt / vanligt relativt alla index över samma tidsfönster är att något relevant publicerats.

1.1.1.a För ett tidsfönster gäller att resultat publicerade inom det kan argumenteras ha ett minsta antal läsare approximativt samma som antalet artiklar i tidsfönster. Därför att skribenten har läst resp. innehåll själv.

1.1.1.b Ett problemområde blir tydligt när tidsfönstret expanderar genom att ökat fönster tenderar (tycks det för mig) göra det mindre trivialt att filtrera ut innehåll publicerat av datasystem för innehåll och presentation (jämför alla sidor i en webbutik dynamiskt formade utifrån olika perspektiv som en spindel ibland kan ta ut fler i antal än webbutik troligt haft totalt antal människo-sidvisningar).

1.1.1.c Normalt tidsfönster för sökmotorer som Google och Bing för webben allmänt är många år. Antal indikerade skattas troligen ofta från motsvarande en språkmodell ev. härrörande från hur data är organiserat (en försvarlig andel sökningar görs troligt över en ganska lång tidsperiod inte av mer än en eller ett fåtal: möjligt är det exakta antalet träffar vad som fodrar att någon vandrar bakåt görande resultaten behövda vilka kanske inte ens innan "fuzzy" därifrån framåt kanske finns beräknade i index).


1.2. Antal sökningar på koncept

För index över koncept i ett tidsfönster ej äldre än T[1] och ej yngre än T[2]: Hur troligt / vanligt relativt alla index över samma tidsfönster är att någon söker på koncept.

1.2.1 Emedan antal resultat ofta publiceras med en indikation tillsammans med SERP anges detta typiskt inte och är inte helt trivialt att få vettiga skattningar av också när ganska grova antal söks (eller snarast dessa medan det kanske rent av är enklare att få söka förändringar givet en utgångspunkt).


1.2.2. För primitiver / grundteorier för hur sökresultat kan beräknas gäller för huvuddelen i domän av query model ( P(Q) ) att man snarast undviker att använda faktiska värden för sannolikheten avseende respektive sökning. Vi kan ju annars tänka oss att när sannolikheten för ett resultat i SERP ska beräknas betraktat som ett där antal koncept lokaliserade givet koncept Q att trafik för del-koncept i koncept resp. lokaliserade koncept kan användas som vikt.


1.2.3. Skattande värden för query volum via flera i sig begränsade källor - och delvis ej direkt från sökmotorer - är det ganska tydligt att just för användningen typisk i 1.2.2. är kanske datakvaliteten för de flesta inte sådan att man vinner särskilt på att använda skattningar av query volym (andra former av vikter och modeller kan tillföra tydligt värde).


1.3. Antalet läsare av allt i resp. sökresultat

Från 1.1. och 1.2:


För tidsfönster p.s.s. som tidigare kan vi för allt indexerat förenklat skatta totalta antalet läsare som summan av de som söker och de som skriver.

1.3.1. Ovan under förutsättning att trafik som når resp. i övrigt är försumbart alt. att summan i övrigt implict kan ge en skattning av trafiken i övrigt.


1.3.2. För stora entiteter med många läsare för innehåll i index är det mycket tänktbart att när de länkar (ex. för en del innehåll hos några av internets tio största tidningar på engelska förekommer ibland länkar till varandra för referens) att det ger märkbar påverkan.


1.3.3. Över en webb med en mängd läsare uttryckande en respons via bloggar, sociala media m.m. är det tänkbart att det också ger påverkan via trafik av andra. Trafiken resp. skribent skapande sådan respons (säg när vi kan klara att se dem entydiga d.v.s. en människa gör respons på en plats) är jag ganska trygg skattas vettigt från query volum om man har den och tror jag men vet ej säkert hur väl och var större avvikelser kommer från mängden innehåll publicerat större entiteter stationära uttryck läsare är kända för.


1.3.4. Mängden länkar enligt 1.3.2 och 1.3.3. tycks bedömt från data jag läser in vara tämligen begränsat i mängd träffande ett sannolikt index relativt det antal som kan argumenteras representeras av endast skribenterna av respons i sig. D.v.s. utgår vi från att ingen läser deras respons mer än dom själva och att de faktiskt besökt och läst vad de länkar är det ändå en ganska begränsad mängd trafik givet mängden respons-data jag samplat (säg från några testperioder totalt cirka 100 GB rss- och atom-strömmar med en försvarlig andel av kända bloggtjänster där default är att hela strömmen publicerat). D.v.s. "ganska" mycket data krävs här resp. alt. att en vettigt korrekt trafikskattning av vilka respons-entiteter som kanske avviker uppåt för vilken trafik de ger.


1.3.5. Jag tror eller lutar åt att för de flesta som söker skattningar av respons att det enklare och kanske ofta korrektare är att söka sampla väldigt många entiteter troligt beskrivna en individ vardera och betrakta dem tillsammans snarare än att när tidsfönster är tämligen smalt (säg från någon timme upp till ett par veckor för nyheter) ge hög andel eller alls beakta rekursiva trafik-skattningar för resp. respons-entitet. D.v.s. en riktigt hög andel Twitter, Google Plus, Wordpress.com-blogg,Blogger-blogg,Tumblr.com-blog-community-grunka o.s.v. är enklar att komma rätt med i "laplace-smoothing" viktning om vi kan ta väldigt många entiteter.


1.4. Antal dollar / kr för koncept

Vad jag egentligen menar här avstår jag bättre från att försöka ge en entydig definition av eftersom jag ännu inte byggt viktsystem klart för det. Vi kan emellertid konstatera vad känt både före och efter "internet".


1.4.1. Vi antar en "modell-sökmotor" som endast visar produkter och har full vetskap om antalet som söker. Priset för resp. produkt har ej ett självklart linjärt förhållandet till antalet som söker. Söker en miljon personer på car är kanske inte produkten överst som är bäst en bil utan kanske en bok eller annan informationsresurs om det. Tydligare indikation koncept om att vi är intresserade att köpa - "buy car" + "volvo 240" + "cheap" + "police auction" + "used in diamond_OR_gold hit and run" - bilen tänker jag har färr som söker på det men kan tänkas göra dyrare produkt i form av en bil till försäljning mer sannolikt genererande värde.


1.4.2. Förhållanet pris, trafik och koncept håller ej heller över SERP utan varierar med position och kan vara mer eller mindre varierade beroende på sökord.


1.4.3. För läsaren av sökresultat framgår priset för resp. resultat men ej hur mycket de genererar i intäkt. Värde manifest resp. latent existerar.


1.4.4. Priset är manifest och är vad vi löst kan jämföra med mer allmänna begrepp som status. Informationen - eller enklare variansen - är dock praktiskt styrande för alla sådana jämförelser över en SERP. Detta genom att ett högre latent värde för manifesta värden associerade status när konverterande till valuta gäller för typiskt tio resultat per sida att enstaka sådana stoppas in brett över koncept där mycket entydig statistik är vek för eller där det redan visat löna sig. Är variansen för ett manifest värde indikerande tänkbar status emellertid låg medan vi skattar query volumen hög är det dock kanske troligare dollar-status associerat.


1.4.5. P.s.s. enligt 1.4.4. existerar låg-pris paketeringar där ev. status är mindre associerad till att realisera värdet av det. Ex. en bok, sekundär informationsresurs i form av hemsida o.s.v.


För index över koncept i ett tidsfönster ej äldre än T[1] och ej yngre än T[2]: Hur troligt / vanligt relativt alla index över samma tidsfönster är att någon söker på koncept.

1.5. Abstrakta värden (kronor vi ej enkelt kan handla för)

1.5.1. Försök att uttrycka sådana värden - ofta näraliggande uttryck av den större flock personer på nätet - börjar bli ganska vanligt. Längre tillbaka var ett fåtal annat än ovanliga (bl.a. Google PR och Alexa ranking). Numera försöker sökmotorer oftare addera information om sådant som recensioner, tweets och jämförbart.


1.5.2. Att uttrycka både dessa "reaktioner" och "vad" som uttryckt dem är tämligen svårt redan i visuellt utrymme. Och ännu svårare (tror jag) i tolkning av vilka som gjort dem och vad de är i meningsfull "flock-mening" för den som söker.


1.5.3. Status och andra värden associerat flock behöver ju komma med en förståelse av vad den underliggande valutan är. Är det en valuta person som söker informationen är intresserad av alls? Och på vilken nivå växlar den in för denne. En del personer värderar information mer från en viss flock och mindre eller rent av negativt från en annan.


1.5.4. Är sådan association vad som svårligen framgår eller kanske inte ens går att enkelt se faller uttrycken ner till enklare standard-uttryck utan "brand power" från flock. Kostnaden för att betrakta det föreligger fortfarande och behöver utan extra hjälp av "brand power" drivas av en historik av värde av att utnyttjat det troligare närmare konkret och rationellt bedömt än mer abstrakta värden, upplevda känslor eller default donerat värde oavsett resultat av att stämma närmare en flock vi gillar.


1.5.5. Att skapa uttryck av dessa reaktioner utan att addera en problematisk nivå av kostnad innan ev. värde levereras användare kan därför vara väldigt svårt.


1.5.6. Bättre mer framarbetade uttryck utifrån en mängd responer är självklart möjligt men kräver värdering av de underliggande responserna. Av upplever jag ordentligt att döma av vad jag ser praktiskt sökande själv ligger en stor utmaning för sökmotorerna här. Tänkbart är det primära värdet för dem just nu av att visa dom enlare reaktionerna att lära sig att värdera dem (ex. filtrerande ut sådant som recensioner egentligen gjorda eller beställda av den som säljer en associerad produkt).


1.5.7. Utmaningen i sådan värdering kan jämföras med möjligheten att värdera en länk som en besökare för varje entitet vi tror är en individ. Men skillnaden att vi antagligen har ordentligt färre responser från denna grupp att värdera jämfört med hur många som är en "elegantare" / "smutsigare" (från mitt perspektiv tar jag verkligen ingen ställning: både riktiga och köpta recensioner är bra data att analysera byggande information om värden associerade koncept från olika perspektiv och jag har föga problem att särskilja dem - och i enstaka manuella kontroller byggt från etablering erfarenhet längre bak kan jag ganska ofta rent av se vilken entitet som gör marknadsföringen och ibland troligare skrivit det).


2. "Rubrikerna" i SERP

Vi har information i SERP uttryckt för resp. resultat. Denna kan vara mer av vad jag bredare kallar DO och vi enklare här ser som "rubriker" eller i "fetstil". Vidare vad jag kallar DESCRIBE - givet ett DO vad som sätter kontext för koncept i DO och vars tolkning och förståelse styrs och påverkas från primacy effect av aktuellt DO - och typiskt för sökresultat snippets.


2.1. Rekursion och arbetsminne


2.1.1.1. Vi vi enkelt och effektivt skummande tar in i arbetsminne är en funktion av uppmärksamhet / motivation / exakthet vi är beredda att investera för visuell yta och dess visuella komplexitet. Desto mindre uppmärksamhet / motivation / exakthet ju hårdare skummare vi efter tydliga träffar med hög "vikt / potens" (ex. i vissa sammanhang brand power tillsammans med starkt emotionellt uttryck likt fiktiva rubrik och första rad snippet: Google VP stabbed Microsoft CEO with sword in new release of computer game).


2.1.1.2. Resp. där behandlat läggs i kontextuellt pågående motsvarande direkt vad vi ser i en vanlig scen i vardagen. Av betydelse, understrykt och av typ vi specifikt söker läggs i arbetsminne.


2.1.1.3. Vi kan göra switch av kontext pågående i arbetsminne. Är det kontextuella avståndet kortare kommer det med lägre kostnad och vad vi sökande information av allt att döma från mycket nvända kommersiella produkter är beredda att göra. Några exempel:


  • Andra resultat - ex. nyheter - i webbsökning.
    1. Presenterande resultat i SERP av en viss typ. Jämför hur Google bl.a. söker föra in resultat av typ nyheter eller sociala media i webbsökning.
    2. Jag spekulerar att det tänkbart är dyrare switch än övriga men värdet är ju också en funktion av antalet som faktiskt söker just information av denna sort resp. typ resp. hur väl de klarar att hitta samma innehåll allmänt i webbsökning annars och/eller kommer rätt via användning ex. Google News.
    3. Dyrare därför att vår organisation av långsiktig vetskap om hur här relevant koncept förhåller sig varandra - tänkbart underliggande och åtminstone påverkande hur arbetsminne är funktionellt - är topologiskt organiserat via närhet av dem. D.v.s. den närmare topologiska motsvarigheten i spatiell mening är ex. förhållandet "nyhet" eller "webbresultat" d.v.s. ungefär det samma över ett ganska få typer. Medan distansen koncepten kommer tendera att vara större mot det större flertalets intresse (troligare irrelevant i perspektiv av en genomsnittlig sökare).
    4. Störning för större flertalet totalt givet relativt få insprängda resultat enkla att "aldrig se" eller betrakta är tänkbart lågt jämfört med värde för dem som faktiskt söker något av typen enligt två eller är allmänt prospekterande. Kostnaden switch är med andra ord vad vi kan lära oss att undvika.
  • Enklare att resonera om är rekursiva uttryck av mer exakt information.
    1. Givet ett resultat bland tio på en sida - låt oss jämföra det med en rubrik på nivå 1 - kan vi för det ge mer information. Konstruktionen används bl.a. av Amazon.
    2. Besläktat ofta utnyttjad är att länka föreslagna andra sökresultat vilket vi dock inte avser här.
    3. Istället avser vi när denna mer exakta information ges på samma sida i form av visuellt associerad information motsvarande en rubrik nivå större än ett (helt normalt underliggande ev. med mindre font eller annan visuell paketering som gör att det stör mindre för den som ej var alls intresserad av nivå ett).
    4. Läsaren ser information på nivå ett för ett resultat. Det intresserar denne. Informationen på nivå två filtreras ej bort för detta resultat och switch till ett mer exakt kontext sker: informationen nivå två går in i arbetsminne.
    5. "Vi" (jag) kallar denna operation för rekursivt innåt. När besläktat i organisation information är upp - associerat men bredar i vad som avses - och ner - associerat smalare mer exkat - i thesaurus och för båda från ett troligt perspektiv av vad som avses avgränsat av koncept vi utgår från.
    6. Gör vi därefter rekursivt uttåt återkommer vi föregående nivå. Förkastades mer exakt som ej ledande till avslut påverkar de ej i introduktion av något nytt i det arbetsminne vi återkommer till. Även om det gäller när vi tänker oss biologiskt modell av arbetsminne påverkad av organisation koncept i långtidsminne - vilket menar jag är ytterst rimligt eftersom denna organisation uppenbart påverkar och styr hur vi resonerar och laborerar med vad aktiverat i arbetsminne - gäller att viss post-aktivitet kan inverka. En aktivering av något ointressant i ett uttryckt rekursivt innåt kan tänkas inverka när vi ser något annat efterföljande om än mindre troligt än något direkt tillsammans med sådant resultat.

2.1.2. Den visuella naturen av 2.1.1 ligger nära perfektion när det kan uttryckas organiserat jämförbart men när rekursivt ovanför ej störande visuellt. Ex. listor ungefär motsvarande ranking från 1 till 10 på nivån ovanför. Antalet behöver emellertid vara fler där historiken bakom tio resultat tänkbart blev möjligt och standard delvis därför att två visuella centraliteter togs ut efter varandra genom ett pagedown förr när upplösningen på datorer var annorlunda. Vidare ligger belastning redan givet från koppling till kontext rekursivt ovanför. Tänkbart (jag vet inte exakt var nivån ligger) cirka fem objekt.


2.2. Snippet

2.2.1. Sökresultat organiserar sig dock ej enligt 2.1.1 och 2.1.2 som vanligast där det normala istället är the snippet. Denna ger dels uttryck som är av DESCRIBE mot aktuellts resultatts DO (här titel) med koncept från sökningen styrande vilket DESCRIBE som plockas ut från sidan vanligen markerat med fetstil. Jag finner det lätt problematiskt att enkelt passa in det i mitt resonemangssystem av DO och DESCRIBE. Det är från tror jag troligare ren DESCRIBE (ex. brödtext i en artikel) men agerar här DO i den mån läsaren betraktar informationen och därefter går vidare och läser hela artikeln (d.v.s. kommer påverka vår förväntan om vad vi där kommer läsa) men ger ju också om vi ej gör det en DESCRIBE för direkt i SERP uttryckt DO:


2.2.1.1 När betraktar snippet som DESCRIBE av aktuellt DO i sökresultat läst men ej resulterande av att läsaren går vidare till sida (låt oss anta en person som sitter och läser några sidor SERP:ar) gäller att "vetskap", "tolkningsrymd" för DO kommer påverkas av resp. DESCRIBE. Personen bygger en viss förväntan / vetskap om vad en viss DO i ett sökresultat vanligen har för DESCRIBE i snippet.


2.2.1.2. Och över många sökresultat vilka koncept i DESCRIBE som oftare associerade till koncepten i resp. DO. Kanske rent av föranledande en särskild sökning. Eller inverkande på hur sannolikt personen väljer en rekommenderad besläktad sökning.


2.2.1.3. Dispergensen mellan snippet - från "transformation" DESCRIBE till DO - och rekommenderad besläktad sökning är dock ganska tydlig. Möjligen är ev. påverkan närmare en känsla av att "bottnat" ut vad ett sökresultat kan ge för att hamna rätt.


2.2.1.4. Det tycks för mig att åtminstone för Google är mer eller mindre det ändå syftet och värde av snippet att visa kontext sökorden förekommer utan mer "sofistikerade" metoder för association till besläktade manifesta eller latenta koncept troligare använda för att peka vidare till andra sökningar.


3. Rekommenderade sökningar

Sist betraktar vi dom rekommenderade sökningarna och vi kan där inkludera vad som direkt ges i rekommendationer i input-fältet. En försvarlig mängd standard-algoritmer ofta välkända innan i andra praktiska områden inom clustering av data av olika slag (inte minst just ord eller flergram eller entiteter av olika slag) finns. Mer praktiskt näraliggande den som söker kan vi dock konstatera att:


3.1. Dessa rekommendationer kan vara uttryck för rekursivt innåt. Givet koncept A kan vi föreslås koncept A + B där A + B kommer med ett antagande av att A ger en yttre avgränsning med ett antagande om en eller ett fåtal övergripande "ämnen" där B (som vi tänker oss kan erbjudas i ett fåtal vanligare alternativ) uttrycker en mer exakt aspekt av resp. sådant antagande.


För exemplet nedan från Google tycks ngram-modell användas där resp. adderat "sub-koncept" (ngram som kan adderas från listan) antagligen speglar sannolikhet från publicerat innehåll ev. med preferens mot en typ som antas bättre passande. Emellertid kan jag också tänka mig att sannolikhet från faktiska sökningar påverkar i den mån de finns. I sista exemplet där tipspayload söks - d.v.s. troligt väldigt osannolikt både över allt publicerat innehåll resp. vad folk söker på - faller förslagen ner till att föreslå resp. ord.



Thesaurus och liknande organisationer används också ofta. Näraliggande fortsatt med Google som exempel är definition av ett koncept motsvarande koncept sökt som bedöms troligare vara vad sökt eller vanligare uttryckt indikation om att man betraktar koncept möjliggörande sådan användning både här och i övrigt. Ett enkelt exempel är när vi i samma organisation också har entiteter (jämför ex. med Yago m.m. byggt från Wikipedia) och mer troligt hamnar rätt i förslag när en specifik artikel, bok eller film söks där man kanske inte minns hela titeln. Likt Library of Congress nedan:



Min erfarenhet från perspektiv sökande information pekar ganska tydligt på att storlek index och/eller mängd sökningar att analysera kan addera ordentligt värde oavsett om artiklar, böcker, film eller annat söks där man inte fullt minns vad det egentligen heter. Library of Congress koncept ovan till ganska stora delar byggda av ngram-modeller från titlarna är där praktiskt sämre för mig än Googels mycket blandade approach.


4. Volym sökningar igen: Bing - Google

Här har jag dessutom av och till nyligen funnit en spännande förändring i det relativa värde Bing leverar jämfört med Google. Längre bak presterande den för mig och många andra ganska dåligt. Sedan ett par år har Microsoft uppenbart bedömt bl.a. från artiklar publicerade såväl som presentationer (av och till riktigt ambitiösa såväl som användbara sammafattningar: ) gjort ett mycket ambitiöst arbete för att bygga långsiktigt grundvärde. Även om effekt av det nog var märkbart var det fram till nyligen inte på nivå att det egentligen motiverar mig att av och till försöka den.


Sedan kanske några månader nu märker jag emellertid att det kan prestera när jag inte på vettig tid får Google att visa vad jag vill hitta. Ett exempel är identifikation av sidan relateratMongoDB länkad i Sydsudan: Vapenvila efter inte avgörs av politisk förmåga och för resp. sida kraft att se dom egna problemen speglade hos "dom andra" (2014-05-12). Det var ej i URL den sida jag sökte men jag är övertygad om att det var exakt det innehåll jag sökte (vilket gör det mer intressant).


Orsaken torde ligga i att aktuellt stycke data hos Google är noterad på domän mycket kraftigare associerad MongoDB. Troligt den jag tyckte mig minnas att jag läst den på: antingen www.mongodb.org eller nära associerad. Men där som vanligt är - eller default bedömd från organisation plattformar publicering - uttryckt underliggande artiklarna ev. med pagination över kommentarer samtidigt som mängden sidor därifrån relaterat MongoDB är "enormt". Samma data publicerat andra sajter kan ändå konkurrera med det obefintliga resultatet från den MongoDB-tyngre sajten.


Den tänktbart mer styrande faktorn i vad som avgör skillnaden mellan Bing och Google när vi lämnar den MongoDB-tunga sajten med kamrater:



Kan tänkas komma ner till för Google-styrande verkan:


1. Eventuellt vikter relaterade till tidigare uttryckta långt bakåt i vår lista här:


"1.2.3. Skattande värden för query volum via flera i sig begränsade källor - och delvis ej direkt från sökmotorer - är det ganska tydligt att just för användningen typisk i 1.2.2. är kanske datakvaliteten för de flesta inte sådan att man vinner särskilt på att använda skattningar av query volym (andra former av vikter och modeller kan tillföra tydligt värde)."


Eller vad som motsvarar det. Likt hur jag såg att antingen Google eller Microsoft (minns jag rätt Google) patenterat något kring att beräkna similarity via de sökresultat man redan har i SERP:ar för att hjälpa surfaren till besläktade sökningar kan man så klart börja skatta länkar från egen trafik såväl som förr kanske mer trafik från länkar. Viss risk för "rundgång" - eller "stående vågor" - eller vad ska kalla det finns kanske ibland.


2. Och oavsett exakt vad som ger vikten tidigare diskuterat för Wikipedia-koncept i:



Där det som ett uttryckt av det kan vara oerhört svårt att söka information om Wikipedia, Wikimedia, Mediawiki m.m. Istället föreslås uppslagssidor i Wikipedia. Expansion av tillåtna egenskaper i vad relevant entitet publicerat ordentligt tilltagen där det mer exakta avgränsade område utanför det inte får plats.


Här är Vietnam vårt Wikipedia. Om vikten är trafik är det givetvis tilltalande attraktivt data att ha en av få riktigt feta samlingarna av men det är inte alltid trivialt att tänka sig mer exakt hur man bör låta det styra. Kanske (jag är inte riktigt säker på vad som egentligen sker: ids inte betrakta det överdrivet) föranleder större tyngd Vietnam i trafik en för min målsättning sökande irrationell expansion av vilka egenskaper relaterade Vietnam som tillåts visas där avgränsning från närmare relaterat MongoDB ej orkar inverka tillräckligt.