Visar inlägg med etikett Sökordsstatistik. Visa alla inlägg
Visar inlägg med etikett Sökordsstatistik. Visa alla inlägg

Kvinnosyn: Att lära sig förstå query-statistik hellre än att feltolka hela världen

2013-10-23

När det gäller alla data-typer, kanaler, populationer m.m. är det om vi vill dra slutsatser om världen ofta nödvändigt att göra ett tämligen gediget arbete för att korrekt begripa dem. Ibland finns vägledning i filtrerad referenslitteratur, andra gånger oftare för smalare eller mer specialiserade områden huvudsakligen i studier och inte sällan när vi är nära praktiska tillämpningar som försöker vara bättre än konkurrenter krävs att man gör arbetet själv.


När det nu gäller Google's sökordsförslag - under förutsättning att det skapas av query-statistik - finns föga möjlighet att från dom exempel Metro-gav och som någon representant för en under-del av FN upprörde sig dra någon slutsats om vilken kvinnosyn populationerna som genererat statistiken i genomsnitt har och ännu längre ifrån (understrykande att vi just tappat gigantiska mängder information: ex. givet att för normalfördelning om vi antar det får vi mängden information följande Shannon såväl som Fisher från ln ( variansen ) eller när så lämpligt normaliserat vi någon konstant-faktor).


D.v.s. vi vet inte om statistiken pekar på att dom som sökt på termerna vill ex. ha kvnnor i hemmet. Ett konkret exempel illustrerar svårigheten:


  • En metod trivial att se är möjlig och därför mycket vanlig inom alla möjliga engagerade frågor är att söka runt på diverse som ger träffar på bloggar, forum m.m. man tänker sig oftast placerar en hos "fienden" (ganska ofta blir det komiskt fel vi några gånger genom åren här illustrerat och som jag första gången gjorde edukativt (hittande på en term) på svenska med gamla äta-marsvins-inlägget på en av min första bloggar liggande på Wordpress.com - ytliga text-cues, ids inte läsa allt, skriver några hat-rader och surfar vidare till nästa åsikts-divergerad fiende att försöka texta-sönder).
  • Vidare för så pass åsikts-avgränsade och illustrativa ngram som i exemplen behöver vi givetvis inte ha något liknande föregående. Vi har naturligt en mängd helt icke-sociala informationssökande användningsområden. Ex. ta reda på hur ngrammen uttrycker sig i olika länder.
  • Rörande exempel på föregående gäller att statistiken för queries knappast för resp. ngram Google ger förslag på motsvarar 1-1 hits på sökrod. Själva språkets kreativitet gör detta oerhört svårt att göra och också när vi faktiskt kan göra det typiskt för användning liknande (exakt samma faktiskt) och ytterst välstuderat sedan många år inom natural länge pocessing, statistisk parsning o.s.v. sökordsförslagen sämre resultat utan vi skapar en språkmodell över ngram med ett maximalt n satt någonstans (där en del från andra sammanhang pekar på att Google har sitt längsta n satt till fem vilket också en del studier pekar på ungefär är där det fortfarande ger utökat värde att öka på - och även om jag menar att det är fel när vi lämnar ord till ord i meningar ex. betrakta titel, under-titel, bildtext m.fl. flexibla komponenter - tycks det väl i alla fall rimligt att gränsen ligger ungefär vid fem och ännu mer expanderar kostnaden gigantiskt för varje utökning av n redan i och med och växande mer med tre gram som nog får anses mycket). Några lämpliga startpunkter kring det (och också om utan att i detalj läst just dessa sidor dessa ämnen regelmässigt i Wikipedia uttrycks i stora delar i det specialiserade språket matematik kan man söka vidare runt ämnen för andra beskrivningar gissar jag eftersom principerna är tämligen triviala):
  • Därmed gäller att vi inte riktigt kan påstå att förslagen är direkt drivna ett till ett av just kombinationen vi ser. Av och till kommer resultaten utnyttjat (också om det generellt för språkmodeller är mindre aktuellt och snarast är vad vi söker skatta fram av kortare kombinationer av ord men för queries såväl som kategorier ex. i Wikipedia verkligt) sökords-kombinationer inkluderande aktuellt förslag men som är längre i totalt antal ord. Ex. Firefighters from X o.s.v. adderande till firefighters from m.m. indirekt tillsammans med associationen över mycket mer språk mellan firefighters och from. Också om jag ej tror det är fallet för något av exemplen jag såg i Metro.

Sökordsförslagen kan därför lika gärna (egentligen korrektare inte lika gärna därför vi kan inte säga något om åsikter eller värderingar från resultaten här som är meningsfullt) indikera intresse och engagemang för att kvinnan ej ska ha rösträtt som att de borde ha rösträtt (för länder där de nu saknar den eller annnan rättighet mannen har: det ska noteras att rättigheterna oftare när formaliserat går delvis hand-i-hand för män och kvinnor ex. relaterat flera länder i direkt geo-närhet i Persiska viken).


Om nu noggranhet i detaljer, datakälla o.s.v. är särskilt viktigt för FN's framgångar på det här området kan jag svårligen bedöma. Mycket möjligt adderar synlighet när möjlighet lika mycket oavsett korrekthet eller inte. Men mycket relevant över alla frågor är jag tämligen övertygad om att ett ganska betydande samband finns till vilka kostnader resultat har över en längre tid.


Vidare men där jag är ganska osäker på om det betyder något för sådant här tillämpningsnära i expert-områden ligger viss genrell fördumning i att som princip eller från förutsättning tolka verklighet från hur man ser på en övergripande fråga ej relaterat riktigt hur den motsvaras i aktuell situation. Man kan tänka sig att det leder till problematiska - ibland rent av dyra - fel-beslut. Mindre exakta politiska frågor kan det givetvis ha betydelse vilket understryker ex- betydelsen av evidensbaserad-medicin. Givetvis kan man argumentera att bland de få områden det är närmare givet att FN presterat konkret värde hittar vi just inom medicin där de evidens-baserade modellerna har tung tradition (bekämpning av Malaria inte minst).

Hans-faktor i smoothing konverger Eulers-konstant som funktion av antalet typer

2013-09-28

Lätt irrterad såg jag en lösning på problemet jag inte fann i färdig algoritm föranledande Snabb och mycket acceptabel smoothing för särskilda användningsområden inom natural language processing (2013-09-27) skapelsen när jag sökte rörande nästa steg sättande värde-typ-beroendet (där det tycks fungera väl med log antal av dessa typer utan att behöva blanda in antal för första och sista typen i storleksordning) i:



Där vad refererat "This is called Smith-Devine prediction (1985)." i formel (7) när utvecklad i uttryck (8) i avsnitt "Enhancement of Smith-Devine law" ger oss att vad "Hans-faktor" konvergerar mot - som man också ser ganska tydligt som funktion av sample-storleken - är Eulers-konstant. Notera för hur Hans-faktor används att vi beräknar ett minus faktorn (den konvergerar just ett minus Eulers).


När sample expanderar tender som den samplings-metod och identifikation av koncept bestående av flera ord, ord o.s.v. allt mer approximera väl utan behov annan hänsyn än endast antalet typer enligt formel och blir på det sättet en allt bättre approximation. För Hans-konstant var ju dock ett delbehov att värdera upp mindre samples något mer varande oftare utvalda därför att det ansetts viktiga varande expert på något eller balanserande en annars möjligen likartad världsbild från stora mycket kvalitativa färdiga data (likt Biomedcentral.com alla artiklar med dess journaler färdigt för nedladdning i stora xml-filer med ett antal mindre journal-hus också med öppen publicering som ett begränsat cirka 40 MB sample från Mdpi.com).


Jag är väl egentligen ej klar över ännu om viktning med värde-ranking om funktionell räcker förutom normalisering [0,1]. Eventuellt kanske omräkning som funktion för P(A,B) som funktion av P(A) och P(B) tvingas till (vilka jag om så ogillar precis som den omfattande stopp-listan men knappast heller där att något direkt tydligt omedelbart problem ges av det). Men jag gissar att det nog ej krävs (och om så kanske snaare som funktion av P(A) resp. P(B) alt. mindre troligt men kanske tillräckligt reducerande problem med små-värden för antingen A eller B maximum om division känns som ett mer tidseffektiv alternativ än här kanske lite bättre lösningar givet att vi antagligen har "ett antal" fall där varken A eller B förekommer förutom i ett P(A,B) givet att vi nu såg A med B sorterade som typen snarare än mängden av alla hittade typer A och B. Men verkligen att det ofta nog fungerar bättre för mig tycker jag att pröva lite erkännande att jag inte så mycket härledde Hans-konstant som att notera den när jag sorterade några små-filer i en Excell-liknande applikation i Star office: en osund färdighet som kommer efter några år tagande in diverse liknande data för att sortera från max till min för att upptäcka ev. problem och reflektera hur man normaliserar det).


Även om det kan tyckas lite långsökt bara från detta tror jag med diverse annat från annat att det uttrycker när vi här ser det i språket hur vi organsierar våra biologiska neuronnät där i många delar överföring svåäl som topologiska-relationer exponentiellt avtagande förhållanden finns. Och vi noterar också dess användning inom bildanalysen ex. i COSINE INTEGRAL IMAGES FOR FAST SPATIAL AND RANGE FILTERING. Jag har väl också sedan något år eller så egentligen accepterat att det snarast troligare handlar om cosinus-transformationerna (ex. snabba approximationer av vourier) än wavelet dr de senare kanske snarare är en omväg (jag var ganska övertygad om waveletäs innan det: varande upplevde jag elegantare för rum- och tidsberoende men vid den tiden hade jag heller inte prövat dem på större datamängder).


Och Laplace transform där ev. om jag minns rätt egentligen inte behövt plåga mig med dem på väldigt många år praktiskt att vi kanske kan se kopplingen till exponentiella fördelningar inom sannolikhet.


Intressant är givetvis också användning inom extremvärdesteori (och där aktuella fördelningar). Det är ju vad vi har när mängden typer som för språk fortsätter att växa ju mer vi samplar och troligt med fler tidigare aldrig sedda kombinationer tillkommande dagligen i vad dom humana-språk-genererings-noderna skapar på Twitter, Plos m.m. vi kan läsa in för att förbättra våra modeller. Ej väldigt otroligt alls har jag nod-språkgenererande här gjort just det.


Därmed inte sagt att jag just tror att något särskilt i naturen grundläggande finns just med Eulers-konstant. Den återkommande här har nog mer med våra approximationer eller ideal för sett att avbilda. Även om jag relaterat det egentligen själv alltid upplevt dom logaritmiska uttrycken - ex. relaterat dopamin-decay i våra biologiska neuronnät - som troligare (utan att själv försökt skatta det från verkligt data rörande belöning, inlärning, prediktion runt det från alla ap-försök med josbildningar m..m. utan edast språk) snarare än dom hyperbola-funktionerna. Inlärningsbias från att alltid ha använt dem och säkert aldrig en hyperbol sedan universitet kan ha inverkat där misstänker jag också (i någon mening bör det väl ändå tycker jag komma ner till nedbrytning av dom kemiska substanserna via enzym-system och det är ju domäner man också precis som informationsteori och språkanalys ligger i uttryck nära dom logaritmiska decay-funktionerna).


P.s.s. noterar vi citateet "The information entropy of the Weibull and Lévy distributions, and, implicitly, of the chi-squared distribution for one or two degrees of freedom." i Wikipedia. Och ytterst relevant här gäller - med viss risk att jag något mindre eller större fel i detalj - att betraktar vi uttrycket (jämför gärna den ev. skalning mot P(A) och P(B) att skillnaden mellan information rörande dessa och P(A,B) ex. användande Shannons-uttryck för information med:


H(A) + H(B) - H(A,B)


, där vi när vi multicerar värdet med antalet utfall samt ungefär 1.386 får vi Chi2-värdet för att avgöra om hypotesen att A och B är oberoende är rätt eller fel. Gamma distribution är förövrigt anpassningsbar skattande mänsklig-inlärning även om jag prövande fördelningsfunktioner på värden skattade med olika former av vikter (mina upp och ner m.m. görande det mer noggrant på de tio viktigaste) finns flera andra fungerande ungefär lika bra. Men kopplingen informationsteori gör det ganska tydligare såväl som att rent visuellt kan se hur vi kan forma både inlärningskurvan och sigmoid-kruva såväl som mängden typer när sample-storlek växter.

Snabb och mycket acceptabel smoothing för särskilda användningsområden inom natural language processing

2013-09-27

I NLP görs tror jag smoothing nästan huvudsakligen när P ( A givet B ) utifrån relativa frekvenser skattas. Antag emellertid att vi önskar betrakta P ( A,B) där vi vill se "A,B" som en symbol i sig och där utan att ordning har betydelse.


Antag vidare att vi skattar förekomst från olika corpus varierade i storlek, varierade i exakt vad vi samplar (jfr samförekomst i titel rörande detektion av fler-gram och/eller ord respektive samförekomst i taggar för artiklar i journaler).


Vidare gäller att vi ej vill se varje sample som vad vi sparar särskilt för enskild användning men samtidigt heller inte vill kasta bort den expertis det kan representera. Korrekt praktiskt har varje sample gjorts utvalt för att förstärkta där det ses meningsfullt i en övergripande grundläggande språkmodell i meningen hur språk speglas ner ex. i similarity-operationer eller när stöd där saknas rörande nya relationer (vi antar att vad vi här skapar byggs kontinuerligt vidare men smalare i typdokument som skattas: endast gårdagens nyheter fortlöpande vi uppdaterar med).


Vi har endast från resp. sample sannolikheterna att utgå från - därför att dessa filer är elegant samlat i en katalog på en snabb-hårddisk medan filer med själva antalen ligger spridda över tre eller fyra hårddiskar och skulle ta ej trivial tid att kopiera över till snabb-hårddisk - och önskar ej att mycket stora sample ex. från alla artiklars titlar i BMC och NIH eller United Nations dokument avseende olika rubriker skattat sekundär ej ska bestraffas för mängden typer oavsett per värde eller ngram ska reduceras abnormt (ca 8 - 16 GB styck) - eller internt Wikipedia-refererar-annan-artikel på antagligen cirka 40 GB eller mer (ej sammanfört en fil så det enkelt att räkna ut). Samtidigt vill vi ge erkännande åt att sample typiskt när optimalt rörande denna faktor ungefär 40 - 80 MB, och med medvetenhet om att vissa små-sample i mycket är mycket sämre värt än allt annat men just i sina unika områden kan addera visst värde.


Smoothing-målet här skiljer sig inte bara rörande detta från mer traditionell tillämpning där diverse mer eller mindre acceptabla algoritmer finns (vanligen med inte bättre koppling till distribution av typerna, token-antalet, eller informationsteori än grovt tumskattande på nivå med vad man själv kan komma fram till ex. lite linjärt skattande mellan antalen för saknande värde-antals-räknande och därefter beräkna lutning igen mellan resp. antal och humpa till något som oavsett hur föga optimalt med all trolighet är bättre fungerande än vad man "naturligt" får om man gör tämligen små samples), utan också genom därför att vi vill göra smoothing effektivt d.v.s. helst göra maximalt än beräkning per värde fortlöpande från givna värden snarare än att tröskla igenom varje rank eller kolumn.


Själva koncepten bakom tror jag alla vanliga smoothing algoritmer för traditionell användning ger oss att det rimligen är möjligt (jfr exemplet ovan för Good-Turing humpande med linjära log-skattningar i varje bak - rimligen görligt samlat ungeäfär lika bra som funktion av resp. faktiskt värde för resp. ngram-symbol).


Jag hade stora problem att se en bra lösning på det. En tyckte jag säre lösning jag annars använt fler år är att skatta från bl.a. max-värdet vilket när resp. mängd förekommande typer varierar relativt lite är funktionellt.


Efter reflekterande detta av och till flera veckor faktiskt där jag fått förkasta två lösningar jag var trygg nog i från små-tester att beräkna in (d.v.s. får räkna bort igen) hittade jag en vikt relativt funktionell rörande egentligen allt tycks det också om jag räknar med att behöva efter sammanförande av värde normalisera så att sannolikheterna summerar "rätt", förutom kanske 50 - 70 sample corpus behöva införa en extra där sannolikheterna för resp. PAB beräknas av PA * PB på hela, för att trycka ner outliers i små-corpus ej förekommande i övriga, samt ev. någon mer viktoperation (inte otroligt funktion av types avseende värden snarare än ngram-kombinationerna).


Vi börjar med att beräkna Hans-Faktor vilken är:


( 2 * ln ( ln ( types_ngram_kombination ) / ln 2 ) / ln 2 ) / ( ln ( types_ngram_kombination ) / ln ) )


Där vad vi dividerar med möjligen - även om jag ej tror det för Hans-faktor - kan vara kopplat en tidigare vikt (exakt samma) som tas bort fortlöpande på värden efteråt (lätt att tänka fel kring sådant tycker jag praktiskt och jag brukar få pröva upplever jag). Men jag tror divisionen ska vara där.


Detta ger ett värde som ungefär börjar på 0.39 för samples i storlek av cirka 300 - 400 MB (och om jag minns rätt neråt 0.32 för riktigt stora sample men som nu är utelämnade då jag ej är säker på att alla fått sina värden sammanförda vilka möjligen ställer skattningen av types ifråga vilket jag ej kontrollerat). Och cirka 0.52830 för det minsta samplet på endast 2.2 MB.


Hans-faktor utnyttjar vi därefter som smoothing-faktor. Önskar vi att kombinera väldigt få samples är det vettigare att använda den på detta sätt genom att styra hur mycket vi låter själva anpassningen av värdet vs. ursprungligt värde påverka. Här är emellertid utifrån våra särskilda krav viktigare att vi först (innan de indikerade senare operationer jag utgår från att behöva göra) att saker ligger i jämförbar magnitud utan att abnormt nervärdera stora samples (jfr Google 5-gram, NIH, UN m.fl. större) eller kasta bort expertkunskapen i mindre riktade sample (ex. Citeseer-X, DOE, NAP (alltid värd ett besök och givet samspel finanserande beställarroller d.v.s. the Congress, kvalitativt-oberoende och budget oavsett hur liten många andra datakällor rörande rå-dokument-storlek ett bra värde för långsamma faktorer vi kan önska få med kombinationer runt), Reuters välkända sample avseende endast titel- men ej ett parallellt jag gjorde själv spindlande som snarast hör till de stora om ej i närheten av UN m.m. - avseende endast titel medan om vi jag tagit ingress eller brödtext där hade de varit abnormt stora så klart - eller ännu mindre Google 5-gram men endast avseende rader uttryckta endast med stora bokstäver eller Eurostat's definitions-system avseende rubriker, underrubriker resp. varje stycke för resp. definition oberoende för resp.).


Vi gör nu brutalt hård - mycket mycket hårdare än jag hade tänkt och absolut egentligen inte gärna vill göra därför viss användning förlorar på det för övrigt lika gärna kan göras vid användning - filtrering på stopp-ord. Detta därför att en faktor jag tar in är min gamla vana att låta max-värdet påverka. Givet att datakällornas typ varierar mellan rubriker, ingress, brödtext, taggar, interna referenser Wikipedia, referenser science-articles m.m. varierar naturlig förekomst av stopp-ord ordentligt. De flesta stoppord ex. is, for m.m. är i vissa av dess typer av datakällor abnormt vanliga vs. ex. i taggar. Skalar vi som funktion av maximalt värde fas-förskjuter det brutalt out-of-sync mellan dessa d.v.s. stopp-filtrering på några hundra ord.


Därefter blir ev. kvarvarande naturliga out-liers missade under sample synliga (ex. emerican + ämnesområde för yrkesorganisation inom subområde i medicin vars journaler vi samplat). De bör väl bäst hanteras om man inte som jag tänker pröva om om PAB * PAB hanterar det nedtryckt men ändå speglande den samhällspåverkan och i kunskapsförvaltning dessa organisationer när värda att sampla kan argumenteras ha.


För implicit-etablerande för-smoothing finns också samples speglande de viktigare användningsområden det hela förbereds för. Ex. är en av alla sample ett falskt sample utnyttjande samförekomst i vänner i Blue light d.v.s. just där de färdiga värdena hanteras. Bättre hade jag egentligen antagligen där viktigast med Blue light intensity men eftersom Blue light precis uppdaterats från optimerat tämligen liten till stor (kanske 100 000 typer tlll för första två värdesiffror 11 miljoner) var det ej gjort och praktiskt tämligen tidsödande om en ej på nivå med detta. Det gör nu små-värden på alla kombinationer som förekommer där och trots att varje relation oviktat förekommer exakt en gång varierar de något därför att det är samförekomsten mellan vänner resp. nod har (indirekt en väldigt förenklad similarity-operation).


Blue light sample får Hans-faktor på 0.409666347738257 vilket eftersom endast beroende av typer - ej summa - endast speglar antalet kombinationer beaktade. Det avviker från hur jag egentligen hade önskat det med kanske större bestraffning neråt naturligt från början förväntat både av den och kanske 4 - 6 andra "smoothing-samples" där vikt av förekomst-antal är mindre viktigt än att relationen skapande ett PAB sample faktiskt förekommer verksamhets-, forsknings-, eller dyligt styrande i något ekonomiskt kostande eller predikterande sammanhang även om vi ej kan ge det ett viktvärde.


Kanske kan vi kalla denna implicit-etablerande smoothing för modern-fast-internet-smoothin? Mer styrt av övriga smoothing sample än just Blue light. De gör ju ett avsevärt bättre uttryck över en tänkt fördelning än mycket annat när vi för varje sådant kan se att det är en värde med "kontinuerlig-värde-vikt-mening" vettigt styrande tillämpningsområdets fördelningsfunktioner (ex. information retrivial givande en preferens större än rent skattade kombinationer därför att vi vet att det är tydligt samhällsinverkande faktorer och som därför förr eller senare ger avtryck i ex. nyheter - när något gått fel där - ex. dataregister lagar för myndigheter).


För varje sample identifierar vi nu max-värdet. För varje värde vi önskar vikta - till korrekt samarbetsgemensamt magnitud-språk - dividerar vi med max-värdet. Eftersom vi vill ge viss - i alla fall lätt grovt skattad - preferens till mindre sample därför att dessa typiskt bär större vetskap (jämför gärna med hur vi för samma bl.a. behöver reducera antalet tydligare ör ej uttryckt per relativ-frekvens i närmare traditioell användning därför att symboler / typer ej är resp. kombination: mycket enklare men mindre flexibelt användbart) multiplicerar vi med (1 - Hans-faktor) d.v.s.


(1 - Hans-faktor) P (nuvarande kombination ) / P (största sannolikhet över i resp. sample förekommande samples)


Notera ovan skillnaden mot om vi snarare görande det för färre sample-grupper och utan pre-sample-smoothing-filerna låter det värdera mot original-värde eller om vi så vill i distans från ett. Hade vi gjort så hade antagligen något del-moment efterföljande reducerats men hade kanske - tycks så för mig - minskat värdet av vår implicita-smoothing genom att sample stora kombinationsrymder inkluderande ex. i nyheter oftare mindre vanliga kombinationer men i själva samhällsstrukturens kunskapsbevarande representerande en viktig faktor fortlöpande påverkande nyheter vi ser givande bättre fördelning på smoothing ovanliga kombinationer mellan ovanliga A och B.


Och oavsett hur praktiskt tycks det elegant fungerande utgångspunkt bör vi räkna och utgå från att en faktor funktion av värde-förekomsterna (d.v.s. närmare entropi som funktionellt mer "core-human" än som indirekt approximerat via dess uttryck i vårt språk via ordens samförekomst) krävs.


Samt no doubt at all en vid sidan om totala antalet samples värdering med varandra till ett värde - bland dessa ej mer värderat än något annat - skattat PA * PB för att få bort abnorma out-liers topp 10 - 50 000 (givetvis oerhört beroende på sample-storlek: det tycks för mig att det praktiskt från att små-tittat manuellt i några mindre filer normalt snarast slutar att vara problem egentligen snarare topp tio till 20 bland de minsta och kanske aldrig är det när vi går över 40 - 60 MB men vi förlorar ej något om jag ej tänker fel på att anta att det sträcker sig ner åt 5% för genomsnittlig storlek på filerna d.v.s. 500 MB ungefär och topp 10 000 - 50 000) för resp. sample,


Hur som helst bra värden och mycket snabbt jämfört med de alt. genom att kombinera flera smoothing och back-tracking algoritmer mer anpassade ex. statistiska parsers för språk.


Sådant här bökigt brukar jag vara jag genom svagheter i min personlighet finna svårt att dela när jag löst när så konkret. Men här upplever jag vis av erfarenhet att en hel del för-viktande jag plockar bort antagligen påverkat en del i viktfunktionerna vilket korrekt utvecklande för ev. person att lösa samma sak bör ge åtminstone rätt utgångspunkt för en del personliga utmaningen hoppas jag. Problemlösning är endast korrekt samhällsbyggande långsiktigt när en sund utmaning och arbetsinsats finns och här finns helt säkert mycket lokalt beroende misstänker jag färdigt att explodera för mig nästa gång jag gör det såväl tillämpning här.

Förslag sökord: Wikimedia eller Wikipedia

2013-06-10

Lite längre bakåt diskuterade jag och gav en enkel modell-förklaring från intensitet i rå-aktivtet resp. emotionellt nära reward eller risk som utmärkt klarar att förklara resp. generera språk typiskt för personer i psykotiska tillstånd närmare poolen schizofreni kanske snarare än mani (jag har tittat mindre på det senare i ex. men generering där bör vara annorlunda särskilt rörande balansen mellan risk och möjlighet där vi vid mani hela tiden går framåt längs tydliga spår som konvergerar falskt överdrivet medan vi vid schizofreniska psykoser har akivitet som tenderar att kunna divergera utåt i många riktningar utan att orka till stabila tydliga konvergenser som räcker för att ge feedback i sin tur avslutande spridd aktivitet med ej lika troliga möjligheter).


En del av detta kommer från att kontext lokalt i en neural-omgivning tenderar att få större betydelse relativt samband från större avstånd än normalt. D.v.s. mest typiskt att signalering via "GABA-relaterade" feedback system om att stänga av aktivitet ej värderas lika mycket som aktivitet från neuronerna direkt bakom om att fortsätta lokalt att söka lösningen.


På samma sätt onormalt styrande blir när vi i direkt närhet framåt har en i sig ex. emotionellt potentiell nod men som för aktuell situation saknar kontextuell mening. Genom att aktivitet hela tiden tolkas högre aktiverande från neuronerna bakom jämfört med signalering från längre avstånd blir ju just den feedback som finns för att ej varaktigt aktivera sådana neuroner reducerad.


Senaste dagarna har jag sökt och skrivit mycket om Wikimedia som mjukvaruplattform. När vi här fortsätter diskussionen i Är Google's ontologi Freebase mer noggrant installerad och användning hos stora konkurrenten istället för dom själva? För att försöka begripa samband mellan sökord om möjligheterna att från en mängd sökord i dimensioner av ex.


  • Sökord direkt i sökfältet.
  • Sökningar och sökkoncept arrangerande på andra sätt bakåt utefter en eller flera för det aktuella dimensioner (ex. tid, tid normaliserad mot vår naturliga sökhastighet relativt förmåga att indikerat visa att vi kommit fram, andel associerade små-kontroller irrelevant, nyhetshastighet globalt, förändringar globalt i världen m.m.).
  • Aktuellt i världen, förändringar just nu aktiverade för koncept i världen, globala relationer ändrade i aktuell tid.
  • Globala långsamt ändrade stabilare bas-bedömningar av koncept och deras samband och betydelser d.v.s. som en del (av fyra större viktiga grupper) de common sense lösningar diskuterade refererad postning.
  • Hemsidor, bloggar, krönikor, artiklar, tweets m.m. associerat relaterat som hörande till samma person som söker. D.v.s. när vi vet att person A som söker också har blogg B kan vi göra tolkningar av koncepten indikerade i sökningen med en gigantiskt större statistisk pay-load till vad som avses. Jämför gärna med vektor-modeller av detektion av ämnen, likhet mellan en artikel och olika ämnen m.m. Också om de typiska algoritmerna för det oavsett mer än väl för detta tillräckligt korrekta ej är snabba nog för nära nog alla större tillämpningr. Jämförbara i effekt men snabbare algoritmer finns dock. Jag har ex. en skapad från koncept inom olika områden som antagligen skulle prestera acceptabelt för sökords-betydelse skattad från kortare Tweets och ännu bättre blogg-texter lite längre med en tydlig rubrik.

I exempel-bilden från Google ser vi dock en inkorrekt tolkning av vad jag avser. Vad som hamnat fel är troligt:



  • Wikipedia jämfört med Wikimedia bedöms som enskilda koncept utan relationer.
  • Relationer vi kan tänka oss möjligen bedömts som att Wikipedia ev. är en troligare källa än Wikimedia när Wikimedia beskrivits reduceras till att koncepten bedöms oberoende av relationer enskilt ett endast inverkande på konceptens förhållande. D.v.s. relationerna uttrycker ej den rymd aktuell eller meningsfull för sökfrågan.

Troligt har problematiken föregående indikerat förvärrats av att:


  • Resp. koncept har praktiskt definierats om där Wikipedia konceptet relativt Wikimedia konceptets förstärkts ännu mer men fortfarande utan att relationer som gör annat än att ej påverka distans till kontext för sökning etablerats.
  • Fler-grammen runt radera många poster kan vi föreställa oss är en fråga som oftare diskuteras runt Wikipedia.
  • Där kan dom frågorna också just vara infekterade och ske med hög intensitet.
  • D.v.s. de förstärker antar vi tolkningen av Wikipedia istället för Wikimedia men utan hänsyn till aktivitet på längre avstånd som kan avgöra trovärdigt om verkligen ett helt nytt koncept ej direkt bland sök-koncepten ska aktiveras upp.
  • Vi kan också se en grupp av faktorer man kan begränsa dessa tolkningar via jag vet är ganska funktionella i andra sammanhang krävande mindre av stora kontext: När ett koncept är väldigt potent oftare är det meningsfullt att via mass-dimensionella rum bedöma hur utspritt det är. Ett koncept som wikipedia vidrör hela världen inom alla områden. Det är ytterst abstrakt och tolkningar till det är troligt i varje fall som här ex. emotionell intensitet också finns eller nu aktuell från typ av intensitets-skattning till meningsfullhet. Men är de dimensioner aktuella i den lokala tolkningen verkligen vad som ger oss meningsfullhet skattad från dess similarity?
  • Med cosinus similarity, LSA, Kohoonen m.m. där dimensionsrymderna skattas fasta i antal och man söker just de allmänt oftare fungerande bedömningsdimensionerna så nej likheten kommer ej vara möjlig väg att reducera bort dessa fel.
  • Om vi istället kan aktivera och skapa dimensionsrummet anpassat från varje aktuell situation - i perspektiv från här mindre sökningen som var personen står som tillstånd - så blir detta just möjligt.
  • Irrelevanta dimensioner påverkar ej och Wikipedia blir tvärtom ett koncept föga relevant relativt Wikimedia.

Ett sätt när man söker avgränsade mindre specialistområden för att praktiskt få bort dom här problemen hos Google är att använda minus-operatorn applicerat mot sajter som överdrivet associeras in i sökresultaten.


Tråkigt nog var jag emellertid nära nog färdig att sluta använda Google som primär söktjänst när problemen med ex. ovan var som värst därför att Google dessutom förslöar sökningar och kastar upp person-verifieringsfönster när man reducerar riktat till domän-samband flera gånger. Det i sig är föga problem praktiskt. Problemet är emellertid att de inte alltid genererar korrekt html-kod - alternativt att en tjänst som ligger framför Google ej klarar av att hantera Google's SSL-sessioner när de gör redirect till dynamiskt skapade sidor som bryter mot grammatiken för sök-urlernas uppbyggnad - resulterande i att endast bilden med siffror och bokstäver som ska visas upp kommer på sidan därför att denna passerar utanför SSL (som konfigurerat för mig). Inte i teknisk-felskapelse som när ett stort IT-företag när de hade något form av driftproblem och skickade mig till en felsida defekt i URL plötsligt skickade mig ett server-certifikat (ej inkluderande någon privat-del av protokollet utan normalt för en webbserver men ej deras) från en samarbetspartner de har i säkerhetsfrågor och nätverk - och ej ett certifikat avsett för internet utan genererat och boot-strapat för deras privata-näts säkra kommunikation d.v.s. snarare än att göra sig sunt besvär med åtminstone en topp-ca man boot-strappar hos klienterna har man suttit och boot-strappat upp varje server resulterande i att ingen bra snabb metod finns för att snabbt med hög trovärdighet stoppa problem om ensilda entiteter angrips och ger ifrån sig privata nycklar. Vidare gäller att certifikatet i sig kan vara möjlig väg till de privata nycklarna. Detta är praktiskt möjligt troligare just för privata nät med hög trafik därför att man där mindre ofta gärna går in och petar runt med konfigurationerna. Certifikat skapade med algoritmer från längre tillbaka med kända (om än normalt oftare praktiskt trots det inte helt enkla att utnyttja). Just här hade det varit elegant om det ex. hade varit MD5 använd men så var icke fallet utan om än inte det alternativ jag tror är vanligare just nu hos entiteter som ser det som ledstjärna att ha mest potenta hash-konfiguration stödd så mer än väl långt innanför vad som krävs för praktiskt fungerande säkerhet.


Väldigt typiskt för Google satt man och prövade konceptet som irriterade mig ganska länge men ändå med marginal med kanske fyra veckor innan man ger upp och byter tjänst så slutar dom. Det är en styrka och värde jag tror företag allmänt vinner mycket på om man klarar. Förmåga att kreativt pröva för att lära. Förmåga att identifiera när ett koncept ej fungerar riktigt bra för kunden och korrigera det. Gäller dessutom ofta upplever jag deras andra tjänster och applikationer (med en del områden där Google konstant genom åren haft också andra problem: ex. hör Blogger inte riktigt till det område man klarat mest fascinerande finns problem som konkret reducerar värdet onödigt relativt bl.a. Wordpress möjligheterna för Google att få revenue via deras i plattform direkt adderade möjligheter till Adsense-annonsering).


I någon mening kan vi ju numera också se Google som en aktör som försöker etablera ett ramverk och gränssnitt för hela internet mot resp. användare. Det bör just etablera en mängd alternativa datakällor som kan etablera meningsfullt kontext för sökningarna. Att man ej klarat mer genom åren trots att man ibland visst kan uppleva sig märka en del är lite underligt tycker jag. Kanske relaterat att sökningen är en så enormt viktig grundaffär och skapad nära grundare och andra tidiga aktörer med en etablerad kultur och preferens relativt algortimer? Oavsett orsak är argumentet att det hela fungerat bra som affär ännu inte otroligt inverkande men ej heller säkert relevant eftersom större förändringar i preferens för många användare kan realiseras väldigt binärt: ena året är en tjänst dominerande sedan år. Nästa har behöver de göra sig av med halva personalen och fyra andra har delat upp 70% av deras marknad.

Givealink.org: Att ta ut taggar och statistik för webbsidor

2012-12-06

Antingen tror jag i , Google: Kvalitetsproblem och Statistik samförekomst koncept: Enkel metod för att förstärka värdet statistik från generellt språk ger vid tillämpning inom specialistområden eller Abstrakta och konkreta koncept (diskussion: "The semantic richness of abstract concepts") nämnde jag kort Givealink.org som bl.a. Indiana University är involverade i.


Potentiellt intressant är att de gör datat tillgängligt under en creative commonslicens. En del till deras information kompletterande frågor och tydliggörande finns nedan från e-post med en av medarbetarna för den forskningsinstitution vid universitet som driver projektet. Notera också den sista frågan jag precis e-postade och ej fått svar på och om någon har tips om liknande (i bredare mening) data tillgängligt ex. något liknande statistik sökord för webbsökningar över ett helt språkområde eller liknande eller jämförbart stort med Flickr över en innehållstyp eller publikationstyp vilken som helst så kommentera gärna här eller e-posta.


"On Wed, Dec 5, 2012 at 7:08 PM, Hans Husman husman.hans at_at gmail.com wrote:

Hi again Fil,

Would you know if your Givealink.org have the data in a CSV file for
download besides the API, or knew who to email to ask about it?

Best regards, and happy December
Hans"

Svar:


"2012/12/6 Fil Menczer [...] indiana.edu:
Dear Hans,

We only provide the GiveALink data through the API. The database is
quite large and complex, with many relationships (hundreds of millions
of page-page similarity links, for instance), so I am afraid that it
is not feasible to share the data in flat files. We might be able to
share a small sample of the data in a CSV file, if you specify exactly
what data you are after. In this case, please contact my student
Dimitar Nikolov (in cc).

Thank you and best wishes,
-Fil"

Mitt svar:


"No problem,

The size you indicate anyhow show it is probably worth the time taking
1/2 day or so programming the api-download.

It is mostly the co-occurancs between tag concepts that interrest me
and not by anyway association between them and the URL.

Also the association between tag words and a title heading either by
the human user or the actual web page. Is the later collected by the
service ready or do I need to do a fetch myself? If the later I might
also for news papers, articles and reference web pages try to take out
the association between the co-occurance vector of tags and the
overall article. Is it much such type of content regarding serious
knowledge and issues or is it mostly "popular culture"?

Thanks for your help anyway. I do feel you perform good and useful
projects in your area in the practical dimension even something for
other universitites to take inspiration from as research strategy.

Best regards
Hans Husman"

Och så den sista frågan jag skickade efter om statistik över hur API:et används också publiceras:


"PS

Another question: Do you save and publish statistics of the requests to the API? Such statistics if big enough would be quite interresting also. It is in a broader meaning general harder if you aren't Google or Bing and have a lot of search requests to get that sort of feedback to content.

If not would you be able to do so in the future with logs of today if you for example got financing for another Phd student or such?

Best regards
Hans"

På tema av den sista frågan gör jag för egen del när jag hämtar ut större datamängder en försvarlig mängd whitening i request trots att det kostar ordentligt i extra-tid. Ex, körande en mängd relationer från en datakälla jag förkastat p.g.a. inkorrekt extrahering eller lågkvalitet samtidigt. Dels ger det statistik jag ändå har användning av potentiellt längre fram eller för sammanfattande värden, och vidare ökar det kostnadskomplexiteten att analysera dina requests ordentligt. Sista större insamlingen körde jag ex. tror jag 500 000 relationer (ev. att endast cirka 75 000- 3000 000 gick klart d.v.s. i så fall totalt ca 1 miljoner förfrågningar inräknande koncepten utan relationerna +/- några hundra tusen) ej i övrigt data från en misslyckad dataimport från Google's nyligen inköpta Freebase.


Något verkligt behov av att göra på det sättet tror jag sällan är fallet ens när analys är möjligt. För egen del betvivlar jag ens att ett problem skulle existera om förfrågningar publicerades men vi kan också se det som en god vana och också att även om ett problem ej finns med att det analyseras kan ju ett värde ligga i att någon som har motiv att göra det ödslar tid på överdrivet mycket irrelevant data.


På samma tema förvånar det mig egentligen (lite i alla fall) att Google tar betalt för att göra förfrågningar. Även om vissa typer gäller för vad som annars kan stärka konkurrenter olämpligt gäller det inte mycket annat liknande data där statistiken förfrågningarna i sig rimligen borde kunna förstärka deras ännu misstänker jag mindre lönsamma applikationsssatsningar och cloud-koncept ungefär som sökordsstatistiken förstärkt deras Adwords- och Adsense-affär. Ev. är de fåtal (åtminstone som fanns förr när jag prövade api:et ett par dagar innan jag tröttnade på att gå in i gränsen för antal requests) antal fria förfrågningar tillräcklig för att ge dem balanserad statistik? Eller tillräckligt för utveckling av kunskapsdomänen om hur sådan statistik används (vilket är önskar jag i alla fall lätt avundsjukt kring möjligheten är ett smärtsamt stort problem när man väl har sådan statistik). Allmänt gäller dessutom att Google:s api:er relaterat sådant här är väldigt funktionsdrivet specifika för dem förtådda och accepterade tillämpningar ex. sajtsökningar initierad av en surfare snarare än att gemöjlighet till kreativitet i business-2-business utanför redan välkända lösningar (när man inte vill betala för datat och även då begränsat). Praktiskt begränsande torde alla möjliga affärsmodeller relaterade att tjäna pengar på Google:s befintliga affärsmodeller genom att stoppa in data i Google och/eller tappa ut data från Google vara men för komplext data och data ej relaterat ranking tror jag dom är överdrivet försiktiga.


Givealink.org: Mer om tjänsten

Bra teoretisk introduktion:


GiveALink: Mining a Semantic Network of Bookmarks for Web Search and Recommendation (PDF)


Här hittas nyheter m.m. publicerat av Indiana University om Givealink.org:


cnets.indiana.edu om Givealink.org