Visar inlägg med etikett Bing!. Visa alla inlägg
Visar inlägg med etikett Bing!. Visa alla inlägg

Bing! i Kina: Att approximera effekt med antal länkar

2014-02-17

Värt att reflektera för:



Är att Microsoft förklaring kanske är korrekt. Bing! för webbsökning var sist jag betraktande den för vissa typ-mängder av länkar till resurser tämligen känslig för antal d.v.s. att effekt samlad för ett antal länkar är benäget att komma närmare än tänkt konvergens endast påverkad av antalet länkar.


Rörande mängd jag noterade (och om jag minns rätt även för bildsökningen) tittande på ett antal sökord (utan att själv sökt påverka sökresultaten) var bl.a. en faktor identifierande detta DNS-namn och liggande känt indexerad av Bing! (vilket tryggast sker när länk vid denna tid i alla fall var mer eller mindre på startsida när det gällde små-sajter och/eller relativt nya: men p.s.s. också möjligt styrande också på stora sajter varierat utifrån också andra faktorer).


Praktiskt innebärande att man mycket väl om viss budget för att etablera sajter med dessa tillsammans med andra faktorer kan styra resultaten enklare än man kanske är van vid från andra sökmotorer.


Samtidigt ska tydligt understrykas att jag inte vet om det går att definiera idag samma "enkla" (för en entitet relativt low-competence men med ett antal - relativt få faktiskt - datorer resp. görlighet sätta upp DNS-namn samt applicera övriga ej refererade faktorer) mängd effekt-länkar. Vidare också att jag aldrig värderat Bing! vad jag minns rörande Kina och ej heller här. Men det är kanske värt att se möjligheten att en förklaring oavsett hur man definierar defekt kan vara relativt enkel påverkan utifrån snarare än Microsoft är moraliskt vekt relativt vinst alternativt är korrupt via agerande hos enskilda utanför riktlinjer eller att företag alt. enskilda av varierade orsaker är rädda för den kinesiska diktaturen och därmed lätt kan styras.


Vidare mer än att se möjligheten till påverkan här är den möjlig allmänt för många andra lösningar på nätet. Och särskilt att observera när styrande faktorer är onormalt effektiva för en aktör likt kommunistpartiet i Kina kontrollerande en stat men utanför sådana aktörer är svåra och/eller ekonomiskt ineffektiva för andra aktörer (särskilt SEO-branschen som ju ibland kan filtrera upp kvalitet på inverkande faktörer genom att benäget utnyttja dem). Jag upplevde för ett antal år sedan detta som ev. fallet rörande en del sökresultat på om jag kommer ihåg rätt. Det balanserade sig emellertid inte allt för långt efter varefter jag ej minns att jag där noterat fler problem (men har heller inte kontrollerat detta på ett antal år). Tänkbart är dock Google fortfarande ganska observant här. Minns jag rätt finns det diskuterat här långt tillbaka.


Man bör kanske se dessa frågor industriellt i kontext av samarbete mellan stora aktörer som en grundstruktur och från det söka inkludera fler.


Att generellt samarbeta diktatur rörande dessa frågor är på samma sätt som att leverera sådant som hård- eller mjukvara övervakning nätet eller något relaterat sådana frågor eller leverera tjänster eller kompetens ex. marketing ytterst olämpligt och vad jag hoppas att man för att minska risken för liknande problem understrykande möjlighet är aktörer man generellt ska juridiskt hindra från att alls leverera i eller relaterat företag agerande Kina när transformationen till demokrati är klar.

Tänkbart är Microsoft Bing! på väg att bli stark

2014-02-07

Förhoppningsvis stark nog att vara bättre i områden jag upplever att andra sökmotorer stör med dåliga prestationer när jag söker information. I områden där dom jag är van att arbeta med fungerar bra kan det vara det samma: inlärd vana betyder mycket.


Ett problem med Google är att det tycks ha blivit potent upplärd av mitt sökkontext bakåt på att presentera PDF-dokument av studier. Men har samtidigt problem att förstå när jag söker kunskap resp. något konkret ex. ett dataset rörande något. Samma problem är kanske mer allmänt utanför individuellt kontext ex. när man söker vetskap och kunskap eller diskussioner om koncept ytterst näraliggande Wikipedia (men inte nödvändigtvis inkludera det som sökord) där Google åtminstone sist det var aktuellt och innan det har en fascinerande kärlek för att presentera ditt och datt det hittat på uppslagssidor i Wikipedia.


För dataset+"query+logs" när toppen baserats där några undantag delvis baserade på vad jag sökt nyligen vid flera tillfällen (ex. query logs AOL nu hittade) är det snart nog huvudsakligen PDF-artiklar.


Ett försök med Bing! gav sökresultat jag upplevde bättre blandat på första sidan (50 resultat) som jag önskade här. Intressantare är intrycket att kvalitetet och Bing's förmåga att bedöma koncept-rymder där man rör sig med både konkreta företeelser likt dataset, relaterade artiklar, tema sidor, inom ett ganska krävande område i kunskap blivit bättre. Dessa områden är ju delvis lättare uttryckande just tydlig kunskap att använda (ex. abstract och olika samlingar av data ofta ganska kunskapsavgränsade vid universitet). Viss komplexitet ligger ju dock här som för människor att lära och förstå nyanser. Hur väl nyanser hanteras får jag låta vara osagt tills jag ev. prövar söka mer med den.


Kanske har man klarat att skapa värde av Microsoft Academic Search som en mer stabil kontinuerligt uppdaterad datakälla med just sådan information man lättare kan få korrekt från flera källor såväl som att engagera resp. individ på deras temasida att hantera defekter rörande kanske namn-sammanblandning:



Academic sökning tycks i sig tämligen inriktad väl innanför sitt område - möjligen kanske vilket ev. är att föredra praktiskt egentligen med viss preferens mot hård-vetenskap och det mer datavetenskapliga snarare än de humanistiska ämnena. Ev. kanske följande två sökningar är ex. på vad man görande fler bättre kan se tydligt:



Rapporter, artiklar, analyser ex. romaner tenderar att minska avgränsning till vad som går att avgränsa men jag är inte alls säker på att det har betydelse och om värde inte kommer med andra problem. Förstår man hemvist för många koncept går ju associationerna att formas till kontext och lagrande samlat gör en hel del enklare (givetvis för en resursstark aktör med stor park av datorer och en mängd personer som kan sitta och över- eller under-arbeta olika specialiserade lösningar kanske man inte ser samma värde).


För värdet av att söka snarare i Academic gäller för mig att unique selling point är direkt klickbara pdf-filer som går direkt till artikeln läsbar utan kostnad eller registrering. Det har förr fungerat dåligt med många döda länkar (jämför gärna med CiteSeerX som tycks inspirerat eller inspirerats eller båda riktningar i en del möjligt eller gemensamma tankar) vilket för Google Scholar idag fungerar excellent med få problem. Ett bra koncept CiteSeerx haft - trots problem döda-länkar - är gissar jag (om ej givna av författarna) att utgå från bot-access vid journal för att få artikeln att jämföra fram korrekt samma hos universiteten eller någon av de sajter författarna gärna postar dem.


Alla pdf-länkar jag klickade på idag fungerade.


Spontant vill jag gissa på ökad kvalitet. Och om som jag vill att jag prövar söka mer med Bing! rörande avgränsade ämnen kanske det kommer visa sig stämma.

Vad har Google, Microsoft m.fl. egentligen för beräkningsutrymme per användare? För kontext-hantering och prediktion av sökningar

2013-09-02

Om vi ex. tänker bibehållande sökordskontext kan jag se en del intressanta värden för att ta ut kontextuella sökord från upparbetat sammanhang i olika tidsperspektiv mer än eller kompletterande ex. gamla sökord som dyker upp inverkande sökresultat (vilket i alla fall för mig bedömt en sökmotor på nätet - Google) ger en del intressanta saker hittande mötespunkterna man inte behöver ha sökt direkt efter.


Praktiskt inser jag att jag inte riktigt har referensramar vad en större budget ger för praktiskt uttrymme att uttrycka tillståndsinformation för annat än ett fåtal användare. Är det t.ex. praktiskt görligt att ha en tillståndsrymd säg på minst 10 000 (mindre bra egentligen) upp till optimalt gärna närmare 100 000 koncept med säg fem till tio instanser för pågående, tillstånd över tiden, predikterande gissande sökningar som kommer för att verifiera o.s.v.?


Jag kan lätt uppleva att det i nuvarande implementation lätt tynger min dator men det behöver kanske inte säga särskilt mycket vad vettig hårdvara och mer hårdvarunära implementation klarar att prestera (nuvarande kod är Perl men förutom split och Filehandle anrop skriven för 1-1 portning C utan konkurrerande-process problem ej abstraherat).


Det var ju inte riktigt utvecklat för det här utan mer med tankar applikationer rörande riktade sökning i ett mer riktat non-public sammanhang resp. uttrycka tillstånd för entiteter man önskar avbilda så att säga över tiden. Men det är ju egentligen sammansak. Uttrycka vad vi söker efter med språk motsvarande representationen och följa upp det från hur väl man kan prediktera sökningssammanhang som kommer från tillstånd för att indikera antingen vettig on-going eller emergence när intresse förändras.


Men oavsett hur elegant det kan tyckas: långsamt. I min dator. Hur det är med mer hårdvarunära praktiskt har jag som inget referenssystem för.


Något lite personligt i alla fall fascinerande är att jag kan se lite ytlig kanske likhet mellan domänen av sådana här tillstånd med hur man (jag alltså) skapar en mindre föränderlig utgångsmängd att använda för att ta in vad som händer och sker nytt i datamängden.


LSA och allt liknande är ju så mycket antingen ett område - eller över allt språk så intet-sägande med mycket av små-underliga missar. Oavsett algoritmerna där jag ligger en bit från LSA sökande ge möjlighet att kunna beräkna similarity friare från kontext utan att behöva räkna om eller korrekt utnyttjande grunddata - handlar en del i grunddatat så att säga innan ex. adderande in news stories on-going om det personliga engagemanget så att säga. För att få det bra oavsett hur non-exact and science det verkar att välja ut datakällor från behov för att få en god balans. Jag tog ex. nyligen görande en mycket större P ( A | B ) matris för kontext några gig av data framtagit för att bygga Wordnet-sense detektion (ex. associations-matriser med dimensions-reduktion o.sv.) för att täcka upp en del lite udda associationer men samtidigt introducerande en del tyckte jag (och med vetskap om att jag regelmässigt nära nog utan undantag ser sådant numera) skräp förskjutande saker till vad jag ser kommer ge problem när man lägger på news stories växande fel i värsta fall - vad jag såg troligen åtminstone balanserande skjutande på ev. hantering via kompletterande corpus påverkande konkurrerande: alla plos-artiklar publicerade resp. filer med ungefär kategori-relationer över ett större antal mycket smala specialistområden särskilt prioriterat ekonomisk vetenskap, lingvistik, cognitive science, äldre generationer från 1930-, 1960-tal och 1970-tal ungefär av icke-vetenskaplig psykologi (Freud o.s.v.), miitary intelligence, image analys och liknande områden.


Att ta ett stort stycke data och processa in är bra värde. Ger bredd i associationer adderande konkret värde också när av typ Google Ngram härrörande från lokalt-meningskontext för koncept associationer. Men det förutsätter verkligen att det kommer tillsammans med andra datakällor för vad vi faktiskt söker vilket kanske lättare illustrerar samma sak som ovan ev. lite otdyligt uttryckt. Pågående från vad som kommer nytt i nyheter är det vad som bäst sköter sig själv givetvis men för att klara områden utan att genomsnittets tjocka mitt gör intelligensen dum eller underlig divergerande när den ska fungera i sammanhang vi kanske inte vanligen motsvarande talar om till vardags behöver man känna på datat själv kanske lite som att se ytan på det även om sådan känsla verkligen är snabbt öveergående när man fått till det.


Ofta dimensionsreducerar man ju sådant här data. Men därmed kommer ju begränsningen. Ser vi det enkelt motsvarande vad vi ex. gör med varians-maximering eller olika varianter av t-test, entropi m.m. förutsätter det ju att vi klarar att säga vad variansen är för olika begrepp och or såväl hur de förekommer med varandra. Givetvis ganska stabilt funktionellt särskilt i data av skolbokstyp mindre ofta tydligt föränderligt. Men i nyhetsvärden är det tydligare hur mening och sammanhang för koncept ganska snabbt förändras.


En motrörelse finns förvisso: "meningsfulla titlar" på webbsidor istället för titlar som klarar att tala till oss i så många fler dimensioner än att uttrycka sökord närmare sträng-similarity.


P.s.s. när vi söker webben efter data vet vi knappast särskilt ofta om området är lite mer komplicerat (snarare än bara önska få upp lite Wikipedia-liknande sidor) vad som är det optimala sökorden. I tolkning konceptuellt liknande hur vi tolkar och förstår "talande" nyhetstitlar av sök-kontext eller enskilda ord finns en likhet inte på något sätt trivial men intressant.


Ganska nyligen lade jag ett inte helt trivialt i tid eller utmaning (om än inte teoretiskt varande ett välstuderat område) på att skapa ett undersystem för att tolka språk i grammatik och syntax o.s.v. i natural language processing. Sådan tolkning har jag aldrig sett associerat vad vi diskuterat här adderar särskilt mycket relativt kostnad (inte ens i närheten).


Däremot är det ytterst potent i tolkningsområden bredare intressant när vi processerar nyheter, händelser m.m. i data för att förstå och tolka sociala strukturer och interaktionen mellan människor. Vad X gör här, och var vi kommer då, och påverkande B o.s.v. Personligen tyckte jag följande studie nyligen publicerad Plos One var enormt komiskt illustrerande just det:



Kanske väl illustrerat redan i sammanfattningen:


"From the symbolic dynamics of these elements, the courtship-generating language was determined with extreme confidence (significance level > 0.95). The languages categorization in terms of position in Chomsky’s hierarchical language classification allows to compare Drosophila’s body language not only with computer’s compiler languages, but also with human-spoken languages. Drosophila’s body language emerges to be at least as powerful as the languages spoken by humans."

Men självklart tänker vi oss ett mindre flock-styrt djur ej talande till andra motsvarande vad nyheter till sin natur helt handlar om organiserande vad att göra, punkter, händelser o.s.v. är det ungefär samma sak. Uttryck och förståelse och känsla av sammanhanget för olika platser i sammanfattad rymd inte krävande att vi trösklar igenom alla händelser vi upplevt i en plats är däremot mindre grammatiskt - mer konstnärligt eller kanske fotokonst eller musik-drivet.


En scen eller bakgrund (eller musik) vi adderar händelser just nu eller som vi minns från förr (eller adderande lyrik ovanpå musiken: korrektare egentligen applicerande musik till pågående händelser eller ett sammanhang där vi gör något då lyrik ofta ligger ganska konceptuellt konvergerande närmare än alltid vara särskilt berättande).


Vad jag verkligen kunde önska vore dock något enklare färdigt rörande basdata och enklare sammanförda statistiska mått till en dokumentmängd för att slippa det ganska tunga i corpus bearbetning. Något Bing att köpa om man hade pengar (men snarare mer realistiskt i kraftigt ekonomiskt problematiska företag med upparbetad big index arbetet). Även om jag själv inte direkt sitter och bygger ICA liknande associationer är resultatet av hela den familjen såväl som faktoranalys och PCA väldigt lätt att sunt ta som indata för att skapa utgångspunkter. För mig ger Bing! kraftig känsla av ett ganska (rent av gott och) gediget arbete i grundteori och detaljer ungefär jämförbart med allt annat men saknande det jag tror har krävts och kommer krävas konkurrerande lösningar som har ett tänk ovanför (även om kanske skillnaden minskat en del ev. mindre relaterat just Microsoft). I mer Hans-ekonomi-sammanhang vad man skulle se som vad man kan önska sälja och inte överdriver pris för. Bra kvalitet: likt en god bruksbil lite rostig kanske och inte kommande med något från de övre-prisklasserna men inte något allvarligt fel i vad man gjort. Mer arbete att addera ovanpå. Praktiskt här behöver dock Microsoft bäst är jag övertygad om Bing! som koncept inte alls bara som webbsökmotor utan mer för stöd långsiktigt mot alla produkter även om de kanske inte självklart egentligen behöver göra indexering och logik runt det själva.


Möjligen störs man en del här av personligt intresse. "Mindre" eller "mer" än att tanka applikation sökning naturligt är jag egentligen mer road av vad det säger om oss kollektivt just för hur det inverkar lite framöver. Oavsett vad egentligen gäller att representerar vi vetande handlar det alltid om sökning. Konceptet att webbsökning är big business tror jag dock inte riktigt på i innovativa områden (varande dock ingen direkt praktisk affärsexpert där). Känns väldigt uppdelat med svåra områden runt om närmare revenue (annonsering o.s.v.). Riktade mer kompensdrivna segment är givetvis mer intressant och indikerande möjlighet kanske (såväl som svårighet) underligt under-utnyttjat i affärsområden jämfört med besläktade områden ex. inom applikationer närmare politisk-analys och strategiska-resonemangssystem (military intelligence o.s.v).


Vi kom ifrån min egentliga fråga men mycket matnyttigt att tänka igenom själv i alla fall. Och vi avslutar med följande tanke:


Medan stora andelar av webbsökning handlar om att få befintligt dokumenterat / vetskap eller få reda på var något finns. Handlar nyhetssökning dels om vad som sker just nu men också med det som utgångspunkt om vad som kommer inträffa. Optimalt vill vi egentligen söka framtiden även om det praktiskt inte går (vad jag vet i alla fall). Drivande brett kommer det ofta ner till intensiva kanske lite oroande nyheter. Men i seriösa sammanhang vill vi ju ha användbara hypoteser.

Microsoft Bing! Quality assurance problem och helt avstannad utveckling framåt förutom hantering spam

2013-08-21

Följande upp det nya Bo-konceptet Sunny Vitahuset publicerat på Twitter, Youtube, blogg m.m. tittade jag hur det märktes på Bing!.


Nyfiken på om de anti-spam-lösningar och indexeringslösningar vågar och/eller orkar ta upp så snabba volym och rekommendations-indikationer visade sig inte Obamas nyköpta hundvalp alls. Däremot i video-sökningen fanns en försvarlig andel pornografi (jag tror inte det är relevant sökresultat för Sunny oavsett filtreringsnivå: porgrafi-konsumenten har ofta gissar jag inget problem med att addera tydliga cue words t.ex. kvinna gör något i informations-domän pornografi.


www.bing.com/videos/search?q=sunny&qpvt=sunny&FORM=VDRE

Fortfarande vad jag från tumbnails gissar är pornografi också med strikt-filter.


Exakt vad problemet så återkommande lite varstans egentligen ligger har jag funderat över genom åren. Ett möjligt svar jag reflekterade över nyligen efter att ha träffat på deras EntityCube och läst vad de publicerat om den är:


  • Vi betraktar idéerna runt kuben man diskuterar i artiklarna.
  • Varje algoritm eller kocnept är by the book.
  • Väölända stabila algoritmer.
  • Ett tämligen pedantiskt noggrant helhetstänk.

När jag tänker på det tycker jag mig minnas något publicerat av Microsoft relaterat något NIST projekt där de om jag minns rätt använt Concept net <(MIT) till något. Samma sak by the book.


Menoavsett hur stabila och goda algoritmer det är - kanske rent av som cosinus similarity - med i de flesta referensböcker räcker det inte i sådana här sammanhang. De kan vara funktionella detaljer också om de normalt även i sådana avgränsningar behöver ses som utgångspunkt att ta upp oavsett om det är något teoretiskt nyare, mer avancerat, mer kostnadskrävande i CPU o.s.v. adderande innovation eller om det snarare handlar om föga avancera, kanske inte alls eleganta, rent av tämligen smutsiga extra filter lösningar för att skjuta ner "underligt" innehåll vi kanske trivialt kan ta det mesta av med bara ord-mönster indexering men som vår statistiska nät förvirras av.


Det är lite som de sär koncepten som komponenter och försöker bygga med lite som Visual Basic men givetvis ändå praktiskt helt annorlunda. Och visst det är klart det går bra med egentligen vilken referensbok som helst i domänen statistisk language processing och hyggligt indata men då får ju inte top-end.


Samma sak med ata. Oerhört vackert och elegant tänk att se kompletterande värden Twitter, webb m.m. Men lite samma sak där verkar man tänka först och hela vägen parallella datakällor man ser lite p.s.s. Det rekommenderas och förklarar indirekt eller direkt vad man avsåg. Men lämnar man standardalgoritmer och standard-datakällor som primära utgångspunkten måste man ju i verkligen om man ska nå längre än vad du får med ett par referensböcker, stora resurser och väldigt nogranna och potenta systemutvecklare (för det är fortfarande ett förbannat svårt område): med en idé vad folk egentligen gör, tänker och agerar när de "rekommenderar" i resp. kanal.


Det skiljer sig radikalt mellan olika publiceringskanaler. Och radikalt beroende av vilken roll också grovt pbulicist har. En marketing inriktad pornograf gör ju en helt annan sak än en gammal tänkt som gör retweets på sina barn-barns- låg-kvalitativa teckningar de fotograferat och ingen människa egentligen vill se hgre i sina sökresultat därför.


Refererar vi en just en referensresurs i ett Tweet som ej är en summering av något mer genomarbetat gäller ju givetvis att mindre tid i genomsnitt investerats i att välja den d.v.s. har mindre quality assurance och större bias Wikipedia m.m.


Utan det tror jag inte för ett ögonblick att någon stabilt får ut rankningsvärde av Facebook eller Twitter adderande kvalitetsdimensioner till andra rankningsfaktorer. Det kan verka fungera men regelmässigt falerar det no doubt utan mer och skämmer ut en stor brand värde-påverkande billboard produkt som Bing!.


Man börjar med människan: Vad vi gör när vi publicerar eller rekommenderar. Vad vi gör när vi letar information. Och tar eller skapar de algoritmer och modeller vi behöver närmare sökmotorn från det.


Rörande just spam på webbsökningen gäller att de numera har mindre problem upplever jag med uppenbart inte vad jag söker efter alls (jämför problemet ovan för video-sökningen). Men i övrigt upplever jag inte att sökresultaten någonsin på år nu blivit kvalitativt bättre i övrigt. Relativt upplevelse av domänen i övrigt står de still.


Om förklaringen stämmer med verkligheten bakom det kan jag ine säkert veta. Och även om så är det ganska underligt. Ev. någon management strategi med områdes-smal rekrytering. Deras visuella ide med bilder på startsidan gillar jag dock liksom en del andra sådana komponenter. Men oavsett elegans tror jag inte att det är dom långsiktiga barriärer Microsoft borde ha byggt redan här för att vara något värdeskapande för ägarna över åren som kommer (om det någonsin varit det).


Microsoft köp av Yahoos! sökmotor var kanske sunt i någon revenue-dimension men jag tror inte att det just adderade något av vad Microsoft kanske behöver nära själva algoritmerna och modellerna. Det är kanske oftare mindre företag mer teknik-inriktade på något nytt. Men även där behöver man ju bäst tror jag en övergripande modell för att kunna resonera om var man kan få värde av sådana köp.


Omvänt kan man ju fundera vad egentligen en fet computer-grid med mycket av rå-statistik är värt för dig när din tid är knapp. Ganska mycket av och till. Från det perspektivet är Bing! mycket attraktiv och fanns möjlighet hade jag gärna köpt det för att få det klart i en stabil-struktur och rullat över annat via bit för bit mellan-lager framför det förvandlande det till en grovare datakälla. Själv i den domänen är jag i deen svårlösligt lite jobbiga riktningarna mellan hash-tabeller i Perl för visst data tagande för lång tid i den dagliga uppdateringen relativt minsta antal nyheter - tappar kontinuerligt ungefär relativt världes tid 2 - 3 timmar dagligen för att boota upp och Perl är riktigt snabb runt dom här operationerna så jag har inte ens prövat en c-portningen - jag initialt för versionen vill indexera dagligen eller välja databaslösningar vilka för Mysql och postgres på min utveclingdata inte hinner med i närheten av ens samma dag att ta in samma mängd nyheter.


Jag vill ha hela Bing! grid:en med allt data.


Men det börjar väl bli dags att surfa in på DELL och se vad prisvärt men snabbt kring sådant här man kan hitta. Helst vill jag ha något med fullständigt brutalt med hyggligt snabbt ram läggande sig som mellan-lager eller nästan helt istället för hårddiskar. Men förra gången jag handlade verkade indexering av minnet vara brutalt begränsat under vad jag ungefär ville ha. D.v.s. cluster krävs ganska tidigt.