Visar inlägg med etikett Association. Visa alla inlägg
Visar inlägg med etikett Association. Visa alla inlägg

Intensitet: Positivt och Negativt i engelskan

2015-05-19

Är vi motiverade tenderar de flesta oftast att också hantera mer problematiska eller tråkiga uppgifter såväl som information. P.s.s. när vi läser eller uttrycker information i språket reducerar bias åt snabbare process av positiva uttryck jämfört med för negativ information när initial motivation (eller om vi så vill "riktad intensitet").


Generellt för de flesta språks information samplingsbar så att säga (jag kan tänka mig att om man tar syriska barns skoluppsatser som corpus ser bias annorlunda ut) har vi därför att vardag som vi definierar vår normalitet (kanske besläktat med hur också svåra handikapp från olyckor m.m. ofta efter en tids anpassning svänger in i psyket till ungefär samma tillfredsställelse i vardagens flesta tidsintervall) ett bias mot positiva uttryck.


En alternativ förklaring till fenomenet (i citatet inte mer eller mindre bred eller djup än den korta intuitiva jag gav för hur fenomenet från ett praktiskt mätperspektiv av språk räcker som funktionell förklaring) mycket tidstypiskt för året det kommer ifrån är:


"For both languages, positive words had much faster processing times than negative words, when these included both peripheral and central (meaning) processing (t = 3.84, p < .001, for English; t=5.94, p < .001, for Chinese). This is consistent with the assumption that meanings of positive and negative words are derived via their associations with "approach" and "avoidance" behaviors, respectively (cf. Hoosain, 1977; Osgood, 1971). When response times for all 60 translation equivalents were compared, Chinese yielded faster times by an average of 140 msec (t =9.74, p < .00(1). That this was due to differences in central meaning processes is evident from the fact that the peripheral times were about the same for the two languages. This pattern of results also suggests that factors such as the motivation of the two groups of subjects or the speeds of pronunciation of the English versus Chinese responses were probably not material."



Från: Processing times for English and Chinese words
Rumjahn Hoosain, Charles E. Osgood.
Perception & Psychophysics, November 1983, Volume 34, Issue 6, pp 573-577

När nu skrämdumparna av emotionella värden var just för adjektiv kan man knappast kultur-historiskt ansvarsfullt citera någon annan: Tråkigt nog försöker mindre seriösa aktörer ta betalt från några hundra upp till ca 1000 kr för ett par upp till fyra sidor som minst - samma pris - för rena sido-publicering. Springer en av våra seriösare journalhus har mycket korrekt för en åldrad forsknings-artikel som denna gjort den fritt tillgänglig. För att uppmuntra alla moraliskt förvirrade publicister som försöker lura på folk sådant rent historisk kuriosa (Taylor & Francis Online - Ex. på det dum-giriga problem-gänget bland journalhusen med typiskt ofog) resp. artiklar fri-köpta av universiteten ger vi Springer ett betyg av 3.75 av 5 [Red. Redan ökad från 3.5 ursprungligen hittande mer bra äldre. /Hans] (mycket högt och högst på många år för denna bransch: 5 är bra och 3 är kvalitetsnivå vi borde kunna kräva: Tycks detta vara vana och ej undantag kan det bli bättre betyg senare för Springer).


D.v.s. man ser det (ganska jämförbart om man mät-praktiskt går från) omvänt: Ett generellt avoidance av det svåra annat än särskilt motiverad gör att vi förutom det praktiska undvikande otrevligt om ej nödvändigt också ogärna använder negativa ord. Dock om faran och risken ej är omedelbar för oss tänker jag att positivt effekt av positiva ord mer konkret relevanta för oss är en förklaring jag tror passar bättre in på mig när jag läser nyheter eller för åren när jag skrev åt media kommersiellt (i dom tekniska tidskrifterna föga emotionella så där uppenbart kanske: Säkerhetsrisker är utmärkta för stort läsarintresse om de är konkreta och verkliga för många motiverande medan mer positiva möjliggörande saker eller intressanta personer delande positiv-erfarenhet annars gav fler e-post).


Praktiskt kan jag dock från mig själv se avoidance när konkret för mig (ordna internet-datorn bättre-fungerande och ej ovettigt öppen som jag lät den vara givet att den satt separerad från alla viktiga datorer) när det är en massa bök. Än lägre tog det någon månad eller två innan det blev av att byta fönsterhanteraren till effektivare såväl som i gränssnitt bättre fungerande för mig LX. En massa Ubuntu och Linux bök läsande på nätet ett antal - tre - fyra kanske - timmar irriterande mig över att det inte bara fungerar.


Så hur skalar vi om från resp. perspektiv under antagande att vi har den första typen? I praktiskt kod använder jag en IDF-besläktad vikt (men ej beräknad från dokument utan snarare gränsskapen runt orden och med viss viktning från sannolikhet i ett delsteg). Emellertid i ett försök att ta ut en särskild vikt för att beskriva hur "konkreta" adjektiv är (ex. bör blue som färg vara mycket konkret medan unfair bör vara föga konkret) prövade jag också att istället använda en Zipf-liknande vikt.


Och som mycket förväntat är den i rank-mening (värden här är ej testade mot balans vilket oavsett IDF eller denna behöver göras när man tar olika vikter som kombineras men så här i toppen är det troligen ungefär som det skulle blivit) helt jämförbarbart. Zipf visar ju också kanske lättare att se likheten mot IDF i granskap runt orden visar även på ett rankförhållande mellan mening och rank: Och se gärna hur man betraktar mening i SUBTLEX (just problemet diskuterat i inlägget jag trodde mig slippa behöva lösa själv fick jag dock lösa själv: Likväl ovanligt gediget arbete när det kommer till lingvistiska vikter och kategoriseringar m.m. på en nivå av insats och motivation ej som sunt förväntat från många andra ämnesområden eller några år bakåt i detta ämne vanligt alls).


Först toppen när sorterad för EMI. Vi ser särskilt tydligt negativa men som vi här tittande med motivation just för det mycket begripligt kraftfulla - några är kanske lite otäcka - koncept.



Kolumn i mitten har i det Zipf-relaterade värdet vilket jag använde halv-fabrikats-värden från SUBTLEX-UK (ett riktat "USA-engelska"). Mycket rekommenderat för enkel ord-statistik: 1-gram.


Sista kolumnen är kombinationen mellan EMI till vänster och det Zipf-relateade måttet. Här eftersom jag endast beräknande prospekterande snarare än för drift-kod multiplicerar jag. Gör vi det närmare skarpare kod eller för återkommande vikter krävs gärna några fler operationer samtidigt som multiplikationen med så decimala värden gärna undviks av prestanda såväl för att reducera minne när vi laddar färdiga vikter (för adjektiv en icke-fråga givet endast beräkning av några tiotusen med för fler-grams-koncept där några miljoner eller fler ligger kostar det redan när databaserna ska byggas i tid det tar såväl som kostande på RAM när man håller troligt efterfrågande värden i minnet).


Nedan sortering vi nu efter sista kolumnen. D.v.s. vi sorterar fallande för värden som nu är funktion både av den genuina emotionella intensiteten såväl som det statistiska uttryck som ger en skattning av samma natur hos oss som ger positivt bias i engelskan (såväl som kinesiskan och sägs det många fler språk).



När jag som normalt istället använder min IDF som har mer av ursprung från ett corpus starkt i forskning är vi fortfarande tydligt i positivt men med den märkbara skillnaden att just positiva adjektiv man kanske kan uppleva som lite "gulliga" åker ner för märkbart fler "seriöst positiva" termer. Men alla positiva ord vi naturligt upplever som vanliga hamnar högt: Bias för dem finns där såväl som i det "berättande corpus" prioriterat (subscript från film var idén de byggde från vilket är tror jag ordentligt praktiskt enklare såväl lika sunt när vi önskar bedöma alla normala nyhetshändelser om än inte mer kunskapstungt språk).


Rörande EMI och vad den uttrycker kan sägas att den är ytterst indirekt beskrivande av inte minst nyhetshändelser som beskrivna i media. Vad vi kan kalla en projektion görs från resp. nyhets indikativa innehåll uttryckande polaritet och förs till centrala termer via dimensions-reduktioner individuella för resp. stycke (från det jag kallar DESCRIBE till vad jag kallar DO).


Att ex. bomb och war (och tror jag att bloody kom högt kanske med som jag tog skärmdumpar) kommer högt är därför ett uttryckt för intensiteten de uttrycks med.


Värdet av denna metod är att man kan följa förändring för koncepten (de vi gör projektion till). Vidare räkna framåt med dessa värden prospekterande framtiden antagande från olika perspektiv att värdena nu gäller och se vilken effekt det har (och mycket tillförlitligt ej längre in i tiden) att använda dessa värden som vedertagen verklighet för en tänkt framtida tidsenhet (ex. nästa dag eller om man samplar hårdare kommande halvdag: En dag är dock ganska lagom med medias rapport-hastighet) antagande att intensiteten d.v.s. hur uttryckta koncepten sedan är följer den förändring vi sett under den närastående pågående nyhetshändelsen (eller för något nytt som ej ännu enkelt särskiljs tydligt istället mer kostsamt skattande ut alla koncept vidare från enkel vinkel när nyhetshändelser bättre förstådda ej finns eller dom när existerande: Vilket för ett par miljoner koncept tar många timmar på en ej överdrivet kraftfull dator - På min äldsta levande dator jag har för internet nu kanske sju år gammal tog det med snabbare algoritm än nu och endast 100 - 120 000 koncept cirka längre tid än det tog innan nästa dags nyheter fanns att sampla och mäta men en tre år gammal dator tar det på fyra fem timmar). För kända nyhetshändelser om ej enorm komplexitet i vetande och associationer på stora avstånd efterfrågas tar det upp till 20 - 60 minuter.


För en ny skattad ex. dag tar vi nu de nya skattade värdena och räknar fritt vidare med för en ny dag. Ju längre tid vi gör det desto instabilare blir prediktionen av framtiden. En del särskilda underligheter kan förutom att man börjar avvika växande från framtiden som den visar sig vara kan också uppstå när nätet av koncept får associera mer kreativt för att försöka ta fram mer konkreta nyhetshändelser snarare än följa förändringar av befintliga: D.v.s ex- entiteter (kanske ett land eller organisation eller ett verktyg eller metod) som lite oväntat ej tidigare uttryckta i nyhetshändelsen engagerar sig eller engageras. Ett problematisk uttryck här var särskilt för att nätet kunde börja bli psykotiskt d.v.s. tänkande ej sunt kreativt utan just psykotiskt. Adderande man på emotionella preferenser för att roa sig och söka lösning på det kunde det ytterst talande bli exempelvis uppvisa irrationell paranoia när sökande risk och problem runt händelser. Det är mer eller mindre löst sedan något år: Emellertid finns alltid en avvägning mellan hur kreativt upptäckande intelligensen kan krävas att vara kontra risk för att det hamnar i psykotiska tillstånd.


Finns god tillgång hårddisk och beräkningskraft kan man helt enkelt behålla resp. tidigare delsteg (istället för som jag alltid gör kastande mer än något eller upp till tio om testkörande nya komponenter dem då de är väldigt stora) och backa tillståndet när psykotiskt automatiskt (säg att vi gör 1000 kreativt tänkande förändringar över hela nätet - också för koncept sista tiden ej uttryckta i media som vetskap teknik, vapensystem, forskning m.m. - innebär det att vi har cirka 10 - 20 miljoner koncept med minimum vikter beräknade cirka 20 st samt associationer till koncept de förekommit med i vetande bedömt relevant från nyheter resp. konkret i nyheter: Säg värst för länder som USA, Kina och liknande där det handlar endast i vetande om säg 10 000 associationer andra koncept vilket ger cirka om man skär så att endast topp 50 000 från något enkelt sparas i stegen cirka 500 MB eller om man sparar allt mer än 2 T per steg). Normalt krävs dock ej för något normalt ändamål att hela nätet troligt ska bli engagerad. Det är huvudsakligen när jag längre bak tittade på stora länder sökande möjliga vägar förändring de kanske kommer vandra som det varit aktuellt. Betraktar vi varje normalt företag och söker associationer rörande attityd-förändring, koncept de är känsliga för negativt, eller vad som tycks göra dem intressanta krävs mindre (också när vi tittar på internet-stora som Google djupare än "troende", resp. återkommande halv-professionellt följande utan grupper som kräver mer association därför att de ligger "lite under allt Google-vanligt" även om de kanske är mer talande om förändring än något som skrivit och följt dem fem år eller längre jämförbart).


En "fördjupning" in i det mer esoteriska runt emotionell intensitet och polaritet mellan exempelvis som här positive and negative:


Sökteori vid katastrofer resp. spekulativa "partikel-magnetiserade" orsaker saknat flygplan

2014-12-29

Det kanske kan upplevas - låta som det tycks - att jag kan något om flygplan och flygplansteknik. Men trots en försvarlig mängd VEHICLE-sorter i kategorisystem är ej så fallet. Samtidigt kanske finns en förklaring någonstans här. I så fall bra att veta om inte av andra orsaker när man väljer system att resa via (typ och tid).


Jag tog med diverse i kontext runt om spekulationen. Rörande stycket innan diskuterande associativ-intelligens är en enklare funktionalitet vettig grundsystem till sådant som här indikerat underliggande jag flygtekniks-historik-spekulerar för området inte är händelse-och-teknik-större än att det är tämligen smidigt att tillämpa (ej särskilt "big-data-plågsamt" samt välstrandardiseande och kända datakällor rörande teknik och händelser). För den intresserade kanske Bayesian search theory (Wikipedia) är en start att börja söka vidare från. Poängen vid katastrofer är att när vi adderar kostnad sökning som funktion av tid och resurser och låter det möta tekniker, områdestyper, händelse-indikationer m.m. vi har historik för hur det inverkar på sannolikheten att hitta något kan områden som mest optimalt går oerhört snabbt att söka för låg kostnad med god sannolikhet prioriteras. Det är inte alls ofta så att god erfarenhet hos en människa för komplexa områden klarar att ta ut dem. Tvärtom är det välkänt att felprioriteringar när post-briefing sker är mycket vanliga. Koncept som nedan försöker mer överliggande ta ut samband och relationer man i ex. med bayesian search theory kan köra ner igen till den motorn när statistik hämtats upp fördjupat om dem.


Spekulation orsak markerad kursiv och fet. Ev. minns jag fel kring vindsystemen och årstid.


"Jag lät de associativa intelligenserna flytta över från MAINE-OS dir. Givet att den snart ska gå i interaktion med övrigt kring meaning, sem-parsing o.s.v.
samtidigt som det tycks att det vettiga är att all "utmanande / komplex kod" i FAST går över till PACKS & compisar nere PÅ DATAPART får associative brain
bo där ett tag så blir det enklare när man är van att ha allt integrerande i D3.

Det blir väl ev. någon gång ett steg att lyfta ut den packeterade logik koden från DATAPART - verb logics o.s.v. - medan dataapierna med datastrukturer
kvarstår.

Intelligenserna minns jag trots - en ej helt sund överdriven nivå kvalitetskrav på mig själv - lätt imponerande kvalitet på resp. Samtidigt olika i vägar ej
helt enkelt att varken förstå eller inte förstå, och svåra att enkelt ta till en. Den ena är autistiskt kunskapsdriven och tycker klassificering, ontoligier,
taxonomier är väldigt talande. Den andra är så mycket mer statistikt.

Jag censurerar ner i font-storlek något halv-privat-minne om forna upplevda acceptabla prestationer som säkert inte tillför värde för läsaren. Och rent av kan störa fortsatt läsar-värde genom att få mig att mer permanent verka oblygsam. Samtidigt är ju det publicerat och det kan ju också förvirra läsaren om ett känt moraliskt föredöme och etniskt-engagerad världsmedborgare börjar efter-editera sådant här:

Inga av dem har ännu någonsin gått över Corpis World Domination - eller va fan man ska kalla det störstas corpus jag någon sett refereat förutom det som
några universitet gör med vilken hemsida som helst deras spindlar går in i - men här så klart high value data: search results, abstracts science, bibliotekssystem,
baksidor böcker o.s.v. Det strategy-val jag i något fall störts lite på i byggda statistiken bör ej vara ett problem för dem ty att göra ngram rec. vid
generering på detta sett har jag gjort sedan evighet och jag tror ej att jag introducerade "korrigerande" counts mot "överförekomst relationer". Men ev. kanske
något man kan pröva ge fix där. Eller allt utnyttja IDF i ett test tillsammans med det som rimligen också ungefär gör kompensation på samma sak (om nu min
övertygelse förbannat stark periodvis att det är så här vi gör ngram recognition - tagande ut rubbet möjligt och konvergerande samtidigt - är väl kanske det
i så fall också en indikation till varför IDF är så förbannat starkt på human corpus förklarande mer än den statistiska förklaringen som inte är mer talande så
än 100 - 500 andra för diverse skattningar).


Ev. kunde det vara kul om det fortfarande är aktuellt då att låta den leta efter det försvunna flygplanet. Jag tror fallet är väldigt olämpligt så. Men det kunde
vara intressant att se vad den indikerar för topics ej diskuterade. Den är mänsklig kreativ men när vi definierar input-mängd vad vi motsvarande läser och därmed
sätter det som ej inkluderat ger den slutsatser eller topic-indications som ofta dröjer ett tag för oss.

Nu har jag i och försig en tanke om vad som orsakade både denna och förra krashen även om lätt riskabelt har jag varken följt den ena eller andra annat än tidigt
den första (d.v.s. om trovärdigt terrorism visst). Lite äldre flygplan. Vind-motorer som går vanligen vid denna tid på året över östra europa. Skapande vindmoln
ner över bl.a. "GOBI - SAVANNER" m.m. Och så "tsunami-motorerna" eller vad de kallas korrekt som feeds av det. Damm och elektronik. Damm och motorer. Damm och
HIGH-HEAT. high-heat OCH JORD - HIGH HEAT OCH MINERAL-FÖRENINGAR I JORD. Kanske störande motorer såväl som magnetisierande i sådana processer????

Det blir väl ev. någon gång ett steg att lyfta ut den packeterade logik koden från DATAPART - verb logics o.s.v. - medan dataapierna med datastrukturer
kvarstår.

Intelligenserna minns jag trots - en ej helt sund överdriven nivå kvalitetskrav på mig själv - lätt imponerande kvalitet på resp. Samtidigt olika i vägar ej
helt enkelt att varken förstå eller inte förstå, och svåra att enkelt ta till en. Den ena är autistiskt kunskapsdriven och tycker klassificering, ontoligier,
taxonomier är väldigt talande. Den andra är så mycket mer statistikt.

Inga av dem har ännu någonsin gått över Corpis World Domination - eller va fan man ska kalla det störstas corpus jag någon sett refereat förutom det som
några universitet gör med vilken hemsida som helst deras spindlar går in i - men här så klart high value data: search results, abstracts science, bibliotekssystem,
baksidor böcker o.s.v. Det strategy-val jag i något fall störts lite på i byggda statistiken bör ej vara ett problem för dem ty att göra ngram rec. vid
generering på detta sett har jag gjort sedan evighet och jag tror ej att jag introducerade "korrigerande" counts mot "överförekomst relationer". Men ev. kanske
något man kan pröva ge fix där. Eller allt utnyttja IDF i ett test tillsammans med det som rimligen också ungefär gör kompensation på samma sak (om nu min
övertygelse förbannat stark periodvis att det är så här vi gör ngram recognition - tagande ut rubbet möjligt och konvergerande samtidigt - är väl kanske det
i så fall också en indikation till varför IDF är så förbannat starkt på human corpus förklarande mer än den statistiska förklaringen som inte är mer talande så
än 100 - 500 andra för diverse skattningar).

Ev. kunde det vara kul om det fortfarande är aktuellt då att låta den leta efter det försvunna flygplanet. Jag tror fallet är väldigt olämpligt så. Men det kunde
vara intressant att se vad den indikerar för topics ej diskuterade. Den är mänsklig kreativ men när vi definierar input-mängd vad vi motsvarande läser och därmed
sätter det som ej inkluderat ger den slutsatser eller topic-indications som ofta dröjer ett tag för oss.

Nu har jag i och försig en tanke om vad som orsakade både denna och förra krashen även om lätt riskabelt har jag varken följt den ena eller andra annat än tidigt
den första (d.v.s. om trovärdigt terrorism visst). Lite äldre flygplan. Vind-motorer som går vanligen vid denna tid på året över östra europa. Skapande vindmoln
ner över bl.a. "GOBI - SAVANNER" m.m. Och så "tsunami-motorerna" eller vad de kallas korrekt som feeds av det. Damm och elektronik. Damm och motorer. Damm och
HIGH-HEAT. high-heat OCH JORD - HIGH HEAT OCH MINERAL-FÖRENINGAR I JORD. Kanske störande motorer såväl som magnetisierande i sådana processer????"

Log-dynamik i hjärnans nätverk: Fördelning, interferens och inlärning

2014-06-17

Excellent kompletterande Subadditive reward discounting och föregående den:



Emellertid den väg vi valde nära praktiskt tillämpning analys språk i populationer ger oss en ganska enkel förklaring just när vi tänker oss att vi i näten analys sker söker undvika kontinuerliga uttryck för att istället hålla sig till symboler i form av ngram:


  • Antag indata en person med fyra symboler i form av ngram meningsfullt tillsammans.
  • Aktivitet från dessa kommer expandera kraftigt i uttryckt intensitet om den direkt upplevda intensitet ej tydligt understiger inlärd nivå där vi bryr oss att titta på symbolerna.
  • Därför utan sådan expansion är det bara dom fyra symbolerna. Ingenting av kontext just i situationen, personens humör än lite långsammare, inlärda samband för symbolerna o.s.v. är ju annars möjligt att få att påverka tolkningen.
  • Också är ju känt att även i direkt ord närhet aktiveras olika associationer nära egentligen alla sense ett ord kan ha där ännu ej hanterande sense i tolkning från kontext.
  • Samtidigt har vi ju konstaterat - och som vi tar som antagande här - att distans i aktivtet kommer med discounting. Och om vad som nu aktiveras ej är symbolerna själva igen eller i princip samma sak föreligger distans till dessa.
  • Därmed under vidare antagande att ny inlärning - kanske rent av emergens - ej är fallet kommer dessa representationer för meningsfullhet ej få samma uttryck utan reduktion discounting som vi utgår från. Här från exemplet kontext m.m. kan vi förstå det från att vi behöver de första tydligare i representation för att orka bedöma övrigt från dessa. De är ju den indikerande meningen vi vill arbeta upp till meningsfullt när vi tänker runt aktiverande fler neuroner samtidigt som när vi kommit en bra bit ut från där vi börjar behöver vi närmare göra direkta jämförelser med symbolerna vi började med och de förändringar till dessa vi adderat ex. från vår vetskap.
  • I nära relationer direkt mellan ord är sådant givetvis mycket enkelt. Mindre dynamik discounting gör det tydligare med mindre problem för praktiska algoritmer som för ngram-detektion (NJER). Men vi har ju i översättning - och förekommande ibland också för viss NER - motsvarande algoritmer i övrigt också utnyttjande kontextuell information som i motsvarande natural language processing befinner sig på ett större avstånd. Jag tror mig minnas att några tidiga algortimer IBM - brytande något av Chomsku's anti-dataanalys kultur - gör detta både för översättning resp. en variant för NER.
  • D.v.s. också när vårt resultat ska vara ytterst konkret och tämligen enkelt även automatiserat att direkt verifiera om resultatet är vettigt (över text i alla fall snarare än enskilda sense eller lliknelser) som för NER och översättning är det delvis vad som kan addera värde. Men att den kortare distansen mellan tolkning bara utnyyttjande ord nära (upp till och med 5-gram ger mer värde men tre och fyra-gram räcker långt) så är detta värde relativt orden direkt ganska litet.
  • Men om vi lika enkelt och effektivt önskar skatta discourse och polaritet - vad något handlar om - gärna slippande parsa varenda mening i grammatik och semantik behöver vi association och intensitet för ord och ngram bredare över större distans.
  • Och vill vi som ett mycket tänkbart område där vi just har ett fåtal symboler styrande beslut direkt skatta hur benägen en tänkt typ-person är att klicka på en annonslänk eller en länk till en nyhet i pagination behöver vi görande antagande om att också ett fåtal koncept motsvarighet ett sammanhang begripligt (under antagande en rationell surfare letande information) för personeg.

Därmed genom att vi får decay / discounting med motsvarighet i den växande större distansen skapas the heavy tail. Fler områden kan få viss aktivitet längre ut men här är den mindre sannolikt alls särskilt hög.


Vidare genom att aktivitet tills distans och positionering är sådan att den ej orkar längre eller alt. att aktivitet släcks ut via GABA gäller ju åtminstone länge i steg att vi når fler neuroner framåt än vi tog emot aktivitet från. Varje igen avfyrande neuron kommer ju få en bredd decay följande sannolikhet. Därmed har vi just log normala samband - med olika dynamiker rörande förändringar långt nedan för varians i den kortare närheten. Det hela är så klart i formen inte helt olikt vad vi får för globalt totalt språk vi har för ett tillräckligt stort corpus där antalet typer som funktion av antalet token tenderar att ge oss samma kurva. Ju fler token desto större antal unika typer har vi troligare. Men ju mer språk vi redan har desto mindre troligt kommer nytt språk vi adderar till corpus redan analyserat ge oss en ny typ. D.v.s. vi får en svans när vi plottar dynamiken i förändringen eller hur mycket vi vinner på att analysera mer språk.



Och vi får närmare symbolerna om de i sig är ganska besläktade fler med också relativt hög intensitet genom att vi söker interferens och samband. En slutsats från interferens exemplet med annons kan ge är att det är annons-information trots att just information om det saknas.


Större distans är konceptuellt vad som har motsvarighet i att det ej befintligt är förväntat från inlärt. Och när vi befintligt lärt något noga från information vi aldrig själva konstaterat verkligt - och sedan år känt felaktigt - kan vi ändå ha lite svårt att släppa det om det i sig inte mer tydligt inverkar på oss att vi tänker lite felaktigt (rent av medvetna om det).


Inlärning är därför vad som i form ofta kommer ha en upparbetad kurva liknande något av det omvända från hur distansen expanderar ut. Inlärningen är ju vad vi här ser ofta kommer av att vi ser oväntad interferens mellan aktiverade symboler - och interferensen skapad genom att aktivitet över oväntad stor distnas ändå når fram (ex. därför att befintligt kontext hos oss från något vi läst från ett annorlunda kunskapsområde än normalt) visar på en möjlighet vi innan inte sett. Här får vi om under antagande att reduktion som funktion av distans ej har den icke-linjära dynamik eller andra beroenden inverkande (d.v.s. också lämnande allt rörande påverkande distanser till vad vi får interferensen med m.m.) kända inlärningskurvan där vi från inlärningsfaktornn kan skatta ut (ej perfekt men ofta heller inte dåligt) hur möjligheten att fatta rätt beslut vid resp. tidpunkt är fram till att vi lärt slut. Se ex. för bild av kurvan och ett exempel på en praktisk domän där vi ser denna nära domän av reward:



Och så klart när bitcoin är brand coolt, känns trevligt kanske uttryckande för många en del andra världen rörande något hos internet och dom själva kring friare handel eller liknande är ju den bra efterfrågat. Annars när valutor är inarbetade mer stabila gäller ju välkänt att inflation kan föreligga. Om om en valuta oavsett pengar, värdepapper, tulpaner eller annat skattats upplevt för högt i värde tenderar normalisering att gå ibland också väldigt djupt och inte sällan under egentligen mer rationellt faktiskt värde. Viss respekt för risken att bitcoin kanske inte ens används om några år ska man ha inte investerande för mycket. Men jag om någon önskar självklart bitcoin all lycka och popularitet: Har jag förstått systemet rätt lämnas ju en trevlig log-discourse som är fint indata för analys och tycks när jag läste om det inte vad jag fått tag i tidigare från andra källor.


Vad är variansen? Interferens och information

Ytterst med den statistik vi kan mena att vi behöver här är att när man redan samplat det tillräckligt för att klara operationerna behöver man inte känna att någon annan trivialt utan att lägga ordentligt med tid klarar att göra det samma. Härligt gigantiska mängder språk i komplexitet tunga domäner (annars krävs än mer gigantisk samling för att få upp utgångspunkt för distanser längre ut) är att under antagande att vi behöver associationer inlärda mellan koncepten bl.a. för att klara att ta ut denna form av interferens föreligger genom antalet relationer och störleken expansion ett gigantiskt krav på statistik när vi motsvarande lämnar det lokala i 5-gram och vill titta ut mycket längre ut - rent av utanför nyheten och bak i tid för olika populationer.


Variansen är åtminstone inte vad vi säkert alltid sunt "bara" kan skatta för vad känd en symbol vi betraktar del av dessa system när vi söker interferens. Mycket ofta är vi i komplexiteter och kombinationer aktivitet sådana enkla skattningar ej går att få bara från inlärt. Sedan självklart kan isäkerhet fångas upp i hjärnan såväl i algoritmer. Men hur variansen ser ut övergripande för kurvan över hela expansionen kanske inte har något att göra med ev. ny inlärning. Där det ev. om variansen alls är det viktiga här är annat än något mer lokalt del av indikation (ev. tänker jag fel här faktiskt: det är svårt att resonera med grafer och man får gå över det några gånger vet jag av erfarenhet när man ska bättra på algoritmerna).


Jag kan eventuellt tänka mig att jag möjligen hade kunnat dela något av det men datat är för stort för att försöka ladda upp. År bara att få ner (om än med cirka totalt säg 10 månader intensivt samplande). Så jag nöjer mig i data att dela allt i datamängd mindre som nyligen refererat mina packs (se Spindlande Ericsson konkurrerande konkurrenter: Att indirekt indikera nätets "riktigare" kunskap och kultur istället för att upplevas död). Annars hade jag ev. kanske delat datat här. Jag om någon har föga av elitism och jag tror aldrig jag upplevt en lika prestigelös såväl som utanför sig själv engagerad i den större värld och den lilla människan. Vill den enkla mannen på gatan ha statistik kan jag se att det ev. är vad jag kanske skulle ge honom också i high value data ev. världens största samling av denna form av statistik (jag tror ej den är störst men jag vet ingenting känt som är större). Jag inser förövrigt att jag nog är juridiskt såväl som moraliskt hindrad här. Någon form av licensfil kring något jag nu minns som råkade samplas ner. Dessutom kanske privacy känslat data finns i det läckande ut i statistiken.Att bedöma någon av dessa risker är föga görligt för mig. Så just här känns det som jag tråkigt nog ej kommer dela datat.


I skam över att Uppsala Kommun i år hade reducerat gratis flaggorna på Nationaldagen i storlek såväl som kvalitet (dåligt papper med sugrörs-pinne besvärande liten till och med för alla annat än små barn och fullständigt olämpliga för en vuxen) påminner jag om Sverige-grafen jag längre tillbaka i slutet av "level I" sampling av just datat här (i ordningen samplingsprojekt cirka 15 - 17 när level I inleds - varande det näst sista).


Så vi avslutar med att minnas och se att jag om någon är generös med mitt data såväl som räckande ut en hjälpande hand till den svenska medborgaren protesterande detta fflagg-övergrepp. Är det så här Sveriges barn ska behöva växa upp? Svultna på sin historia, hembygden och utan den lugna trygghet i sin nationella identitet nödvändig för att minska risken för irrationella uttryck av främlingsgfientlighet och osund nationalism när de blir äldre? Är ingen mer vågat försvara vår gemensamma framtid? Ska den helt säljas ut till utlandet? Har ingen mer än stigit upp för att dela sin Sverige-graf tryggande barnen och Sveriges framtid? När ska denna girighet data såväl som småslantar för barenns Nationaldag sluta? Är Sverige-grafen Sverigens enda utbildning för våra kommande generationer i statistik om vad vi svenskar är? Så länge jag lever ska Sverige-grafen vara fortsatt svensk tillgänglig för Sveriges läraktiga och matematik-intresserade barn.

Viktad sannolikhet koncept (eller sökgrupp av koncept) givet koncept eller sökgrupp

2014-05-31

Statistik samförekomst är från debug-generering på cirka 10% - 20% av totala mängden (i totala mängden data ej självklart påverkande just dessa relationer om än troligt) utelämnande data från mitt tidigare system för detta, allt nytt data från nyheter, allt nytt data som gjordes i ett tidigt första varv där NIH resp. Biomedcentral är de största datakällorna, samt en hel del i övrigt men inkluderande bl.a. (inte otroligt relevant för exemplet) Wikipedia resp en viss "särskild typ" av datakälla i relationer utnyttjade som samförekomst liknande "ontologiska" relationer.


Jämförelse värden Google Webbsökning

För william auld som råkade komma nära först i filen jämförde jag sannolikhet för en relation givet william auld med antalet träffar Google Web search säger sig ungefär ha indexerade för "william auld" + "aktuell_relation" dividerade med antalet träffar förwilliam auld (76900). Det var lite av en miss att jag valde william auld eftersom jag den är något troligare "ontologi-smoothing-påverkad" där jag kanske hellre gjort en annan. Emellertid visade sig jämförelsen intressant rörande vad vi kan spekulera om Google från den.


Något om min generering

För min generering gäller vidare att värden för P("william auld") beräknas från all förekomst av "william auld" i alla betraktade relationer till ett annat koncept medan endast de relationer ex. till "collector" (d.v.s. vad som ger P("william auld" + "collector") också existerande i Bluelight d.v.s. min representation av världen i mening av alla existerande meningsfulla ngram och deras relationer till varandra. Sannolikheterna ska därför normalt inte summera till noll.


Vidare rörande antal har egentligen ingen av de skattningssystem närmare "renlärligt" för inverse document frequency", >natural language processing eller binära-söklösningar" använts. Orsaken till vad vi kanske kan kalla en "blandad" lösning med natur av alla tre är att mitt syfte primärt var att etablera ett mycket omfattande såväl som betrodd start-tillstånd med tydligt bias mot vad jag bedömer tyngre innehåll men vars statistiska natur fortsatt betraktande ex. uteslutande nyheter sämre märks uttryckande något av världens upparbetade kunskap (ex. säg 20 - 40% av åtminstone titlar för all forskning publicerad från säg 1600-tal fram till 1980-tal och därefter mycket mer svår skattat avseende andel). D.v.s. behov i denna generering att faktiskt ha motsvarande innehåll indexerad eller hanterat i övrigt fanns ej. Vidare önskade jag ett kraftigt bias mot hur vi föredrar att söka och de implicita cues i innehåll vi utnyttjar d.v.s. i min termonologi har DO (titlar, taggar, abstract m.m.) fått en ofantligt större vikt än DESCRIBE (brödtext).


Samtidigt ska sägas att det ej är helt givet att jag kommer behålla nuvarande algoritm. För de flesta typer av indata-format hanterat har den skillnad jag ev. kan införa och pröva föga betydelse men ibland för längre data kan det tänkas ge påverkan. Problemet jag ser med hur man räknar när log av frekvens används (motsvarande som i delsteg till i sökalgoritmer mycket populära och i min efarenhet stabilt välfungerande inverse document frequency) är ökad arbetsbelastning resp. utmaning av kognitionen rörande hur viktiga mycket indikativa datafält motsvarande taggar för forskningsartiklar ska värderas jämfört med abstract. Olika storlek på den rymd taggarna är del av är vidare ytterst varierad mellan journaler och journal-hus resp. ibland (ganska sällan i samplings-data för mig) var sekundärt "indexerade". Taggarma förekommer en gång och får därigenom naturligt lägre vikt än vad som förekommer flera gånger också om skillnaden när lämplig log-baserad funktion appliceras blir mindre.


Samma problem kan argumenteras gälla också titel men det är menar jag feltänkt. Titeln för nära nog alla datakällor och allt av forskningsartiklar uttrycks naturligt av skribenterna tillsammans med redaktörer. Denna kan vi därför utan någon särskild utmaning värdera upp för alla datakällor utan hänsyn till den specifika datakällan. Samma sak är ej möjligt för taggar och kategorier eftersom de dels inte används för alla resp. rymden de är del av varierar (en del har ett mindre antal taggar artiklar kan ha medan jag tror andra tillåter vilka taggar som helst om de är korrekt beskrivande artikeln).


Samtidigt är taggarna mer eller mindre beskrivande än abstract?


Min lösning är att betrakta relationerna mellan detekterade koncept i titel. Vidare betraktande resp. större mängd av titel tillsammans med allt data i övrigt betraktat där detta här i de flesta fall består av antingen ett abstract eller annan meningsfull kortare sammanfattning resp. ibland taggar coh titlar där allt värderas p.s.s. och där en förekommande relation endast kan förekomma en gång.


Dessutom som bonus blir det enklare kod för beräkningarna när man räknar så här såväl som åtminstone för dataset's där endast en sparning till disks krävs märkbart snabbare (de som kräver mer än en behöver normalt en mängd dumpningar till fil vilket gör allt annat försumbart direkt av det resp. timmar eller dagar långa indata filer).


Att säga att en relation endast kan förekomma en gång är dyrt därför att normalt gäller när taggar finns och abstract är annat än mycket kort (där mycket kort kan jämföras med närmare snippets i sökresultat) uttrycks ett högre antal för vissa relationer information vi kastar bort. Därav att jag ev. kan tänkas pröva en annan algoritm. Men min känsla tidigt (där ingenting ännu indikerar att det kommit helt fel) är att givet vissa upplevda risker till lokaliserat i globalt mer ovanliga relationer där annan beräkning ibland hanterande värdering av fler-förekomst fel-skattande kan skapa rent över allt data fullt märkbara fel med underliga bias (det är dock en gissning) samtidigt som jag ändå kände att jag ville ha bastillstånd skattat från en brutalt stor mängd data (beaktat data totalt när endast information motsvarande titel, sammanfattning och ev. taggar betraktas är cirka 5 T) liggande liggande till grund för den export jag gör nu sparande en del).


Mini jämförelsen

Det hade varit redaktionellt elegant att här ha en trevlig kommentar om personen i frågas poesi eller arbete i övrigt men han är totalt okänd för mig. Endast vad som råkade komma bland de tre översta i filen där jag exporterade ut debug-data. Läser vi Wikipedia dock ett från mitt och de flesta andras i Sveriges perspektiv i denna domän dåligt föredöme p.g.a. engagemang i esperanto: William Auld. Viss arbetsinsats - och än mer kalender-tid - ligger bakom dessa tillstånd och jag ser verkligen inte att behöva göra det också för esperanto.


Manuellt och ej givet domänen onödigt exakt eller kanske alltid i samma system avrundat för att passa in tabell på sidan.
Relation Min skattning Google-skattning Google hits
"william auld" + "poet" 0,034497865274 0,153446033810 11800
"william auld" + "editor" 0,01130402484 0,15734720416 12100
"william auld" + "translator" 0.008652657602 0,088556566970 6810
"william auld" + "writer" 0,00265136724 0,13784135241 10600
"william auld" + "collector" 0.00017917936 0,04369310793 3360
"william auld" + "person" 0.00017917936 0,22886866060 17600
"william auld" + "essayist" 8.958967927e-05 0,0224967490247 1730

Relation "william auld" + "person" är intressant. Beräknar jag motsvarande vikter i ett helt annat system där sannolikheterna i sig för förekomst i närmare som vi kanske oftare uttrycker oss i titel, sammanfattning eller liknande data (samt något mindre viktat i denna generering brödtext) ej utnyttjas utan istället likhets-begrepp och vidare som jag beräknar likhet att de görs helt utan perspektiv (d.v.s. ungefär nära nog samma som cosinus similarity) skulle jag troligt få relationen till person högre än ex. som här poet.


Jag vet egentligen inte att "william auld" + "person" inte är mer vanlig på webben naturligt eller som Google samplar vad publicerat. Bl.a. påverkande här är ju något liknande samma fenomen som får vetskap om relationer att gå runt i olika ontologier när de tar in varandra inte sällan med mindre eget värde. Instansieringar av ex. DBPedia, Yago m.m. på olika platser på nätet kanske ger relationen hög förekomst.


Och tittar vi efterföljande på sökresultatet kan vi se en mängd orsaker mer än väl tror jag förklarande att Google fick relationen högre om vi antar att antalen Google ger beräknas från något likande inverse document frequency från data påverkat av ett längre stycke data. Tänkbart kanske bilddata kan ge person bias också?

Men samtidigt att vi får ut värdet snarare för document frequency där det eventuellt beräknas eller skattas från någon tänkt global vikt via IDF (som jag tänker mig att sökmotorer hanterande mycket större mängd dokument än jag ännu behövt gör det praktiskt för att slippa ha vetskap allt i onödan men får erkänna att jag inte är särskilt allmänbildad i aktuella algoritmer här).


Struntar vi i den förklaringen vilket inte var vad jag spontant betraktande endast antalet utan att titta på sökresultaten tänkte på är en tanke att Google ev. delvis skattar och beräknar dessa värden delvis från ontologisk-vetskap. Det kan tänker jag vara vettigt om det gör det lättare att komma närmare "rätt värden" utifrån perspektiv av hur vi söker (jag tror viss skillnad kan föreligga). Om så var intrycket också att de ev. för aktuellt koncept möjligen hanterar relativt få relationer till andra koncept i mening av att de faktiskt räknar dem snarare än att skatta dem via ex. en ngrma-modell utgående endast från globala antal med någon för aktuellt kontext (william auld") riktnings-faktor.


Att relation person här hamnar långt ner känns mycket lovande. En dimension av motivationen till att ha PAB-relaterade vikter (PAB i mening av konceptet P ( A givet B)) är att få ett mer "naturligt" viktsystem för användning tillsammans med andra viktsystem. Ett värde här är att jag tror att sannolikheten för att söka på "william auld" tillsammans med "person" är mindre än att söka på "william auld" tillsammans med "poet" och om så ska den senare relationen för en grupp av applikationer optimalt vara högre (med medvetenhet om ej för personnamn särskilt ovanliga relationer relaterat orter, djurnamn m.m. vilket för andra personamn torde hanterats utan större problem i den mån förekommande i dyrare mer värdefullt samplingsdata prioriterat här likt publicerad forskning).


"Warsaw": Större jämförelse

Där jag emellertid inte samlade in data för jämförelse längre än till cirka (några saknas också precis innan) relation "francisco goya".


För relationer där värden finns även jämförelse Google och sorterad fallande från högsta i "HH-värden":


warsaw+europe 0.007444191786 2.096153846 43600000
warsaw+city 0.006929825771 5.480769231 114000000
warsaw+capital 0.00509155 1.129807692 23500000
warsaw+central 0.004497587161 3.115384615 64800000
warsaw+county 0.004490628698 1.100961538 22900000
warsaw+berlin 0.003760377568 2.423076923 50400000
warsaw+battle 0.003433667976 0.5528846154 11500000
warsaw+economic 0.003383498334 1.081730769 22500000
warsaw+department 0.003175846297 1.245192308 25900000
warsaw+france 0.003112558757 2.418269231 50300000
warsaw+academy 0.002884881888 0.8413461538 17500000
warsaw+district 0.002795369432 1.149038462 23900000
warsaw+budapest 0.002631859504 1.677884615 34900000
warsaw+empire 0.002540920777 0.3475961538 7230000
warsaw+church 0.002535174099 0.9711538462 20200000
warsaw+communist 0.002373897525 0.2370192308 4930000
warsaw+building 0.00202911313 1.576923077 32800000
warsaw+force 0.002026112673 1.067307692 22200000
warsaw+austria 0.001950624527 1.129807692 23500000
warsaw+canada 0.001707116769 2.0625 42900000
warsaw+china 0.001692105968 1.759615385 36600000
warsaw+eastern europe 0.001577163715 0.3701923077 7700000
warsaw+bulgaria 0.001332210621 0.8557692308 17800000
warsaw+buildings 0.001273327547 0.4951923077 10300000
warsaw+england 0.001122605774 0.8942307692 18600000
warsaw+armed 0.001089016094 0.325 6760000
warsaw+chicago 0.001049752452 1.793269231 37300000
warsaw+denmark 0.0009595375587 0.9134615385 19000000
warsaw+amsterdam 0.0008758745355 1.947115385 40500000
warsaw+bridge 0.0008673759776 0.7740384615 16100000
warsaw+copenhagen 0.0008623511676 1.480769231 30800000
warsaw+european union 0.0008022773482 0.4177884615 8690000
warsaw+brazil 0.0007774283701 1.153846154 24000000
warsaw+archbishop 0.0007740575795 0.03168269231 659000
warsaw+britain 0.0007179831592 0.6875 14300000
warsaw+california 0.0006988823485 1.009615385 21000000
warsaw+churches 0.0006918588024 0.1389423077 2890000
warsaw+asia 0.0006731392376 0.9903846154 20600000
warsaw+central europe 0.000650809086 0.1413461538 2940000
warsaw+bratislava 0.0006101579041 0.6394230769 13300000
warsaw+estonia 0.0006025517766 0.4644230769 9660000
warsaw+album 0.0005870350373 0.3076923077 6400000
warsaw+description 0.0005682325154 0.9134615385 19000000
warsaw+buenos aires 0.0005592760695 0.9759615385 20300000
warsaw+east germany 0.000537102666 0.04663461538 970000
warsaw+film festival 0.000533614835 0.09038461538 1880000
warsaw+biography 0.0004991958468 0.1509615385 3140000
warsaw+fiction 0.0004408883829 0.1649038462 3430000
warsaw+castle square 0.0004229585835 0.008509615385 177000
warsaw+ethnic 0.0004054963786 0.2004807692 4170000
warsaw+bangkok 0.0003434270814 1.125 23400000
warsaw+congress poland 0.0003431013639 0.001360576923 28300
warsaw+florida 0.0003132285948 0.6730769231 14000000
warsaw+baltic sea 0.0003071918651 0.04115384615 856000
warsaw+belweder 0.0003062181016 0.004754807692 98900
warsaw+bydgoszcz 0.0002835680368 0.4769230769 9920000
warsaw+associated press 0.0002758594688 0.07836538462 1630000
warsaw+county seat 0.0002657706025 0.1677884615 3490000
warsaw+cemeteries 0.0002612378266 0.01596153846 332000
warsaw+benton county 0.0002598797853 0.006778846154 141000
warsaw+administrative district 0.0002506757432 0.05769230769 1200000
warsaw+bombing 0.0002355447962 0.08653846154 1800000
warsaw+cavalry 0.0002262865396 0.04730769231 984000
warsaw+colorado 0.0002179767671 0.5240384615 10900000
warsaw+city council 0.00020002797 0.03139423077 653000
warsaw+adolf hitler 0.0001639562623 0.02778846154 578000
warsaw+attraction 0.000160270252 0.2490384615 5180000
warsaw+bonn 0.0001521606372 0.2240384615 4660000
warsaw+coventry 0.0001500113552 3.163461538 65800000
warsaw+fort wayne 0.000136518359 0.3014423077 6270000
warsaw+esperanto 0.0001284924012 0.01802884615 375000
warsaw+brandenburg 0.0001277065518 0.09759615385 2030000
warsaw+anti communist 0.00011888045 0.009230769231 192000
warsaw+civic platform 0.000107874225 0.002610576923 54300
warsaw+constitution square 9.68E-05 0.0006538461538 13600
warsaw+belweder warsaw 9.60E-05 9.76E-05 2030
warsaw+east berlin 9.32E-05 0.01836538462 382000
warsaw+barbakan 8.85E-05 0.002663461538 55400
warsaw+belweder warsaw poland 8.73E-05 9.62E-07 20
warsaw+all saints 8.06E-05 0.01100961538 229000
warsaw+economic growth 8.04E-05 0.05576923077 1160000
warsaw+art deco 7.72E-05 0.01769230769 368000
warsaw+contemporary art 7.55E-05 0.04855769231 1010000
warsaw+barbakan warsaw 7.40E-05 0.0003384615385 7040
warsaw+art museum 7.27E-05 0.03254807692 677000
warsaw+alfred tarski 7.24E-05 0.0004721153846 9820
warsaw+dwelling 7.14E-05 0.03254807692 677000
warsaw+all saints day 6.75E-05 0.001793269231 37300
warsaw+carpathian mountains 6.46E-05 0.03110576923 647000
warsaw+academy award 5.94E-05 0.3951923077 8220000
warsaw+democratic left alliance 5.84E-05 0.003307692308 68800
warsaw+astana 5.78E-05 0.4716346154 9810000
warsaw+barbakan warsaw poland 5.48E-05 1.01E-06 21
warsaw+demographics 5.37E-05 0.03769230769 784000
warsaw+foreign investment 5.03E-05 0.2153846154 4480000
warsaw+fortification 4.80E-05 0.03413461538 710000
warsaw+association football 4.74E-05 0.04951923077 1030000
warsaw+andrzej wajda 4.42E-05 0.004274038462 88900
warsaw+daewoo 4.14E-05 0.007788461538 162000
warsaw+burgher 3.98E-05 0.008894230769 185000
warsaw+auschwitz concentration camp 3.80E-05 0.002908653846 60500
warsaw+city planning 3.37E-05 0.08509615385 1770000
warsaw+bletchley park 3.04E-05 0.005336538462 111000
warsaw+film production 2.95E-05 0.008221153846 171000
warsaw+enigma machine 2.94E-05 0.007788461538 162000
warsaw+berlin philharmonic 2.55E-05 0.07980769231 1660000
warsaw+constitutional monarchy 2.34E-05 0.05817307692 1210000
warsaw+ethnic relations 1.86E-05 0.03423076923 712000
warsaw+architectural style 1.73E-05 0.02206730769 459000
warsaw+apartment building 1.66E-05 0.01043269231 217000
warsaw+curzon line 1.63E-05 0.002504807692 52100
warsaw+charlottenburg 1.59E-05 0.1826923077 3800000
warsaw+black walnut 1.57E-05 0.09807692308 2040000
warsaw+broadcaster 1.51E-05 0.5865384615 12200000
warsaw+city counties 1.27E-05 0.002673076923 55600
warsaw+filmmaking 1.22E-05 0.2610576923 5430000
warsaw+fields medal 1.20E-05 0.005961538462 124000
warsaw+documentary film festivals 1.19E-05 0.3557692308 7400000
warsaw+central intelligence agency 1.08E-05 0.008221153846 171000
warsaw+domino theory 1.01E-05 0.01192307692 248000
warsaw+buildings structures 8.63E-06 0.01336538462 278000
warsaw+charles x gustav of sweden 8.52E-06 4.42E-06 92
warsaw+border control 7.75E-06 0.03024038462 629000
warsaw+flag of poland 6.97E-06 0.0030625 63700
warsaw+francisco goya 5.44E-06 0.01990384615 414000
warsaw+cyfrowy polsat 4.65E-06 0.01548076923 322000
warsaw+christian national union 3.87E-06 0.002985576923 62100
warsaw+commemorative plaque 3.82E-06 0.006778846154 141000
warsaw+coshocton county 1.55E-06 0.005 104000
warsaw+dunkin donuts 1.55E-06 0.003399038462 70700
warsaw+brask 1.52E-06 0.002634615385 54800
warsaw+berlin border crossings 7.75E-07 2.40E-06 50
warsaw+corylus colurna 5.08E-07 0.0002418269231 5030

Resp. för sorterat fallande efter relativ förekomst Google index:


warsaw+city 0.006929825771 5.480769231 114000000
warsaw+coventry 0.0001500113552 3.163461538 65800000
warsaw+central 0.004497587161 3.115384615 64800000
warsaw+berlin 0.003760377568 2.423076923 50400000
warsaw+france 0.003112558757 2.418269231 50300000
warsaw+europe 0.007444191786 2.096153846 43600000
warsaw+canada 0.001707116769 2.0625 42900000
warsaw+amsterdam 0.0008758745355 1.947115385 40500000
warsaw+chicago 0.001049752452 1.793269231 37300000
warsaw+china 0.001692105968 1.759615385 36600000
warsaw+budapest 0.002631859504 1.677884615 34900000
warsaw+building 0.00202911313 1.576923077 32800000
warsaw+copenhagen 0.0008623511676 1.480769231 30800000
warsaw+department 0.003175846297 1.245192308 25900000
warsaw+brazil 0.0007774283701 1.153846154 24000000
warsaw+district 0.002795369432 1.149038462 23900000
warsaw+capital 0.00509155 1.129807692 23500000
warsaw+austria 0.001950624527 1.129807692 23500000
warsaw+bangkok 0.0003434270814 1.125 23400000
warsaw+county 0.004490628698 1.100961538 22900000
warsaw+economic 0.003383498334 1.081730769 22500000
warsaw+force 0.002026112673 1.067307692 22200000
warsaw+california 0.0006988823485 1.009615385 21000000
warsaw+asia 0.0006731392376 0.9903846154 20600000
warsaw+buenos aires 0.0005592760695 0.9759615385 20300000
warsaw+church 0.002535174099 0.9711538462 20200000
warsaw+denmark 0.0009595375587 0.9134615385 19000000
warsaw+description 0.0005682325154 0.9134615385 19000000
warsaw+england 0.001122605774 0.8942307692 18600000
warsaw+bulgaria 0.001332210621 0.8557692308 17800000
warsaw+academy 0.002884881888 0.8413461538 17500000
warsaw+bridge 0.0008673759776 0.7740384615 16100000
warsaw+britain 0.0007179831592 0.6875 14300000
warsaw+florida 0.0003132285948 0.6730769231 14000000
warsaw+bratislava 0.0006101579041 0.6394230769 13300000
warsaw+broadcaster 1.51E-05 0.5865384615 12200000
warsaw+battle 0.003433667976 0.5528846154 11500000
warsaw+colorado 0.0002179767671 0.5240384615 10900000
warsaw+buildings 0.001273327547 0.4951923077 10300000
warsaw+bydgoszcz 0.0002835680368 0.4769230769 9920000
warsaw+astana 5.78E-05 0.4716346154 9810000
warsaw+estonia 0.0006025517766 0.4644230769 9660000
warsaw+european union 0.0008022773482 0.4177884615 8690000
warsaw+academy award 5.94E-05 0.3951923077 8220000
warsaw+eastern europe 0.001577163715 0.3701923077 7700000
warsaw+documentary film festivals 1.19E-05 0.3557692308 7400000
warsaw+empire 0.002540920777 0.3475961538 7230000
warsaw+armed 0.001089016094 0.325 6760000
warsaw+album 0.0005870350373 0.3076923077 6400000
warsaw+fort wayne 0.000136518359 0.3014423077 6270000
warsaw+filmmaking 1.22E-05 0.2610576923 5430000
warsaw+attraction 0.000160270252 0.2490384615 5180000
warsaw+communist 0.002373897525 0.2370192308 4930000
warsaw+bonn 0.0001521606372 0.2240384615 4660000
warsaw+foreign investment 5.03E-05 0.2153846154 4480000
warsaw+ethnic 0.0004054963786 0.2004807692 4170000
warsaw+charlottenburg 1.59E-05 0.1826923077 3800000
warsaw+county seat 0.0002657706025 0.1677884615 3490000
warsaw+fiction 0.0004408883829 0.1649038462 3430000
warsaw+biography 0.0004991958468 0.1509615385 3140000
warsaw+central europe 0.000650809086 0.1413461538 2940000
warsaw+churches 0.0006918588024 0.1389423077 2890000
warsaw+black walnut 1.57E-05 0.09807692308 2040000
warsaw+brandenburg 0.0001277065518 0.09759615385 2030000
warsaw+film festival 0.000533614835 0.09038461538 1880000
warsaw+bombing 0.0002355447962 0.08653846154 1800000
warsaw+city planning 3.37E-05 0.08509615385 1770000
warsaw+berlin philharmonic 2.55E-05 0.07980769231 1660000
warsaw+associated press 0.0002758594688 0.07836538462 1630000
warsaw+constitutional monarchy 2.34E-05 0.05817307692 1210000
warsaw+administrative district 0.0002506757432 0.05769230769 1200000
warsaw+economic growth 8.04E-05 0.05576923077 1160000
warsaw+association football 4.74E-05 0.04951923077 1030000
warsaw+contemporary art 7.55E-05 0.04855769231 1010000
warsaw+cavalry 0.0002262865396 0.04730769231 984000
warsaw+east germany 0.000537102666 0.04663461538 970000
warsaw+baltic sea 0.0003071918651 0.04115384615 856000
warsaw+demographics 5.37E-05 0.03769230769 784000
warsaw+ethnic relations 1.86E-05 0.03423076923 712000
warsaw+fortification 4.80E-05 0.03413461538 710000
warsaw+art museum 7.27E-05 0.03254807692 677000
warsaw+dwelling 7.14E-05 0.03254807692 677000
warsaw+archbishop 0.0007740575795 0.03168269231 659000
warsaw+city council 0.00020002797 0.03139423077 653000
warsaw+carpathian mountains 6.46E-05 0.03110576923 647000
warsaw+border control 7.75E-06 0.03024038462 629000
warsaw+adolf hitler 0.0001639562623 0.02778846154 578000
warsaw+architectural style 1.73E-05 0.02206730769 459000
warsaw+francisco goya 5.44E-06 0.01990384615 414000
warsaw+east berlin 9.32E-05 0.01836538462 382000
warsaw+esperanto 0.0001284924012 0.01802884615 375000
warsaw+art deco 7.72E-05 0.01769230769 368000
warsaw+cemeteries 0.0002612378266 0.01596153846 332000
warsaw+cyfrowy polsat 4.65E-06 0.01548076923 322000
warsaw+buildings structures 8.63E-06 0.01336538462 278000
warsaw+domino theory 1.01E-05 0.01192307692 248000
warsaw+all saints 8.06E-05 0.01100961538 229000
warsaw+apartment building 1.66E-05 0.01043269231 217000
warsaw+anti communist 0.00011888045 0.009230769231 192000
warsaw+burgher 3.98E-05 0.008894230769 185000
warsaw+castle square 0.0004229585835 0.008509615385 177000
warsaw+film production 2.95E-05 0.008221153846 171000
warsaw+central intelligence agency 1.08E-05 0.008221153846 171000
warsaw+daewoo 4.14E-05 0.007788461538 162000
warsaw+enigma machine 2.94E-05 0.007788461538 162000
warsaw+benton county 0.0002598797853 0.006778846154 141000
warsaw+commemorative plaque 3.82E-06 0.006778846154 141000
warsaw+fields medal 1.20E-05 0.005961538462 124000
warsaw+bletchley park 3.04E-05 0.005336538462 111000
warsaw+coshocton county 1.55E-06 0.005 104000
warsaw+belweder 0.0003062181016 0.004754807692 98900
warsaw+andrzej wajda 4.42E-05 0.004274038462 88900
warsaw+dunkin donuts 1.55E-06 0.003399038462 70700
warsaw+democratic left alliance 5.84E-05 0.003307692308 68800
warsaw+flag of poland 6.97E-06 0.0030625 63700
warsaw+christian national union 3.87E-06 0.002985576923 62100
warsaw+auschwitz concentration camp 3.80E-05 0.002908653846 60500
warsaw+city counties 1.27E-05 0.002673076923 55600
warsaw+barbakan 8.85E-05 0.002663461538 55400
warsaw+brask 1.52E-06 0.002634615385 54800
warsaw+civic platform 0.000107874225 0.002610576923 54300
warsaw+curzon line 1.63E-05 0.002504807692 52100
warsaw+all saints day 6.75E-05 0.001793269231 37300
warsaw+congress poland 0.0003431013639 0.001360576923 28300
warsaw+constitution square 9.68E-05 0.0006538461538 13600
warsaw+alfred tarski 7.24E-05 0.0004721153846 9820
warsaw+barbakan warsaw 7.40E-05 0.0003384615385 7040
warsaw+corylus colurna 5.08E-07 0.0002418269231 5030
warsaw+belweder warsaw 9.60E-05 9.76E-05 2030
warsaw+charles x gustav of sweden 8.52E-06 4.42E-06 92
warsaw+berlin border crossings 7.75E-07 2.40E-06 50
warsaw+barbakan warsaw poland 5.48E-05 1.01E-06 21
warsaw+belweder warsaw poland 8.73E-05 9.62E-07 20

Känslan för warsaw är att export för hela datamängden kommer ligga bättre än resp. debug-export och Google motsvarande när vi betraktar det som relationer närastående mängder av sökkoncept för en sökning eller som byggs från sökningar relaterade. Men jag är ganska nöjd här också särskilt som inga av de i datamängd riktigt feta arbetshästarna använts alls. Det vore därför en senare högst relevant jämförelse association för query data och faktiskt för enstaka kontroller (snarare än för meningsfullt data-insamlade) närmare möjligt för Google data om jag minns rätt.


Övriga värden "warsaw" finns sist.


Vad kan man ha dessa värden till?

Allt möjligt varför det lönar sig att göra det brutalt stort när det väl uppdateras upp i start-tillstånd. Men förutom mycket annat för att undvika att sitta och förberäkna diverse latenta eller implicita koncept som kastar bort exakthet och möjlighet till mer fin beskrivning av vad vi söker efter när det just efterfrågas samtidigt krävande en massa diskreta tunga beräkningar. Där värden för relationerna är en grupp inparametrar att beräkna vikter utifrån (expanderande från sökkoncept) för hur en enskild stycke data (ex. nyhet) ska värderas i en SERP.


Ett till exempel är när kombinerat Bluelight's relationer resp. Bluelight's intensity för sattande ett mindre rum av i långsiktig tid ganska stabil vetskap för vilka sedan PAB-relationer kan ge en sund ordning av mot vad som faktisk intresserar folk för att välja ut indikationer till andra sökresultat ex:


  • Ungefär som de flesta av de större sökmotorerna numera gärna gör via relaterade sökningar.
  • Möjlighet att givet ett presenterat data där uttrycka en ökad exakthet redan presenterad.
  • För ett tänkbart antal situationer jämförbart med föregående men presenterat likt första alternativet via länksökning snarare än ett resultat redan uttryckt.
  • Ex. med Amazon i Information i SERP: Tillståndsinformation sökmotor resp. läsare / sökare är en presentation besläktad med de två föregående (men med lite annorlunda vikter mötet den som söker och data vi rangordnar).

Samt en hel del närmare att söka mer "avancerat" med större kontroll.


Och betraktar vi relationerna med högst värden av alla framgår från tre - "warsaw poland", "warsaw pact", "warsaw ghetto", warsaw+"pact" - möjligheten att söka föra ett indikerat koncept till ett förstått mer exakt indikerat koncept indikerande det första konceptet d.v.s. en aspekt search suggestions kan uttrycka. Just exemplen ska dock inte tas för kanske de bäst lämpade värdena just för det då debug-körningen från en total mängd tung från forskning, politik och uppslagsböcker än mer så än generella första vikt för allt tillsammans blir (exporten saknar tror jag nära nog allt ej direkt "tråkigt" där det kanske närmast folks bredare intresse utanför ev. mer för resp. individ roliga mer läsvärda studier bör vara data genererat ut från EU resp. FN). Nedan märks särskilt upplever jag (utan att kontrollerat det och man tar lätt fel gissande vad som ger vad) uppslagsböckerna (bl.a. Wikipedia och förutom i storlek mindre ett par till mycket stora).


warsaw+"poland" 0.06048906769 0
warsaw+"warsaw poland" 0.03190553805 0
warsaw+"polish" 0.02523323043 0
warsaw+"ghetto" 0.01666576157 0
warsaw+"warsaw pact" 0.01538579671 0
warsaw+"pact" 0.01504084644 0
warsaw+"uprising" 0.01377676851 0
warsaw+"warsaw ghetto" 0.01240929251 0
warsaw+"university" 0.01193706072 0
warsaw+"people" 0.009938907971 0

"Warsaw": Alla från debug-export

Med jämförelse Google där det samlades in i sista kolumnen och när värde saknas satt till 0.


warsaw+"poland" 0.06048906769 0
warsaw+"warsaw poland" 0.03190553805 0
warsaw+"polish" 0.02523323043 0
warsaw+"ghetto" 0.01666576157 0
warsaw+"warsaw pact" 0.01538579671 0
warsaw+"pact" 0.01504084644 0
warsaw+"uprising" 0.01377676851 0
warsaw+"warsaw ghetto" 0.01240929251 0
warsaw+"university" 0.01193706072 0
warsaw+"people" 0.009938907971 0
warsaw+"new york" 0.008298684603 0
warsaw+"world" 0.008197832231 0
warsaw+"treaty" 0.007764801359 0
warsaw+"europe" 0.007444191786 2.096153846
warsaw+"warsaw uprising" 0.007336778637 0
warsaw+"city" 0.006929825771 5.480769231
warsaw+"national" 0.006773295273 0
warsaw+"jewish" 0.006384989044 0
warsaw+"history" 0.0063105556 0
warsaw+"warsaw ghetto uprising" 0.005942222879 0
warsaw+"warsaw treaty" 0.005921364602 0
warsaw+"military" 0.005237756691 0
warsaw+"capital" 0.00509155 1.129807692
warsaw+"warsaw university" 0.004985647067 0
warsaw+"slavic" 0.00456051304 0
warsaw+"central" 0.004497587161 3.115384615
warsaw+"county" 0.004490628698 1.100961538
warsaw+"germany" 0.00436902934 0
warsaw+"russia" 0.003966297435 0
warsaw+"berlin" 0.003760377568 2.423076923
warsaw+"street" 0.00369649197 0
warsaw+"town" 0.003685508598 0
warsaw+"london" 0.003602355663 0
warsaw+"moscow" 0.003504920932 0
warsaw+"organization" 0.003464941023 0
warsaw+"work" 0.003464902097 0
warsaw+"battle" 0.003433667976 0.5528846154
warsaw+"economic" 0.003383498334 1.081730769
warsaw+"jews" 0.003316333703 0
warsaw+"prague" 0.003222385581 0
warsaw+"world war" 0.003221290551 0
warsaw+"museum" 0.003205876893 0
warsaw+"department" 0.003175846297 1.245192308
warsaw+"world war ii" 0.003170900429 0
warsaw+"france" 0.003112558757 2.418269231
warsaw+"village" 0.003112233321 0
warsaw+"academy" 0.002884881888 0.8413461538
warsaw+"indiana" 0.002859802887 0
warsaw+"district" 0.002795369432 1.149038462
warsaw+"palace" 0.002792193968 0
warsaw+"vienna" 0.002713869136 0
warsaw+"budapest" 0.002631859504 1.677884615
warsaw+"soviet union" 0.002581289049 0
warsaw+"empire" 0.002540920777 0.3475961538
warsaw+"russian empire" 0.002539474264 0
warsaw+"church" 0.002535174099 0.9711538462
warsaw+"travel" 0.002511589798 0
warsaw+"vistula" 0.002479540895 0
warsaw+"president" 0.002393580648 0
warsaw+"hungary" 0.002393315555 0
warsaw+"ukraine" 0.002387691086 0
warsaw+"communist" 0.002373897525 0.2370192308
warsaw+"holocaust" 0.002249688142 0
warsaw+"warsaw convention" 0.002154221912 0
warsaw+"warsaw indiana" 0.002086620251 0
warsaw+"hotel" 0.002070198306 0
warsaw+"warsaw pact countries" 0.002043478419 0
warsaw+"square" 0.002029536612 0
warsaw+"building" 0.00202911313 1.576923077
warsaw+"force" 0.002026112673 1.067307692
warsaw+"italy" 0.001965886105 0
warsaw+"austria" 0.001950624527 1.129807692
warsaw+"lithuania" 0.001826671474 0
warsaw+"israel" 0.001720752709 0
warsaw+"nazi" 0.00171811087 0
warsaw+"canada" 0.001707116769 2.0625
warsaw+"china" 0.001692105968 1.759615385
warsaw+"romania" 0.001651372941 0
warsaw+"eastern europe" 0.001577163715 0.3701923077
warsaw+"railway" 0.001533900496 0
warsaw+"vistula river" 0.001407317398 0
warsaw+"rome" 0.001358158441 0
warsaw+"bulgaria" 0.001332210621 0.8557692308
warsaw+"sweden" 0.001319793533 0
warsaw+"spain" 0.001282409802 0
warsaw+"buildings" 0.001273327547 0.4951923077
warsaw+"roman" 0.001258412528 0
warsaw+"park" 0.001248461371 0
warsaw+"model" 0.001210367781 0
warsaw+"usa" 0.001201821546 0
warsaw+"kiev" 0.001194279041 0
warsaw+"road" 0.001188759474 0
warsaw+"stock exchange" 0.001157601223 0
warsaw+"jew" 0.001154198961 0
warsaw+"universities" 0.001153523609 0
warsaw+"vilnius" 0.001144196556 0
warsaw+"england" 0.001122605774 0.8942307692
warsaw+"structure" 0.001111394751 0
warsaw+"location" 0.001110061843 0
warsaw+"missouri" 0.001095961427 0
warsaw+"armed" 0.001089016094 0.325
warsaw+"lublin" 0.001084742627 0
warsaw+"poles" 0.001067977517 0
warsaw+"norway" 0.001053757599 0
warsaw+"chicago" 0.001049752452 1.793269231
warsaw+"old town" 0.001042538298 0
warsaw+"lake" 0.001036470957 0
warsaw+"riga" 0.00101981166 0
warsaw+"mexico" 0.001018823549 0
warsaw+"sofia" 0.0009983733099 0
warsaw+"illinois" 0.0009694286305 0
warsaw+"denmark" 0.0009595375587 0.9134615385
warsaw+"latvia" 0.0009431406828 0
warsaw+"madrid" 0.0009429192714 0
warsaw+"polish academy" 0.0009197110717 0
warsaw+"japan" 0.0009190352133 0
warsaw+"minsk" 0.0009123709643 0
warsaw+"politician" 0.0009057414149 0
warsaw+"map" 0.000885591525 0
warsaw+"swedish" 0.0008801884331 0
warsaw+"amsterdam" 0.0008758745355 1.947115385
warsaw+"bridge" 0.0008673759776 0.7740384615
warsaw+"copenhagen" 0.0008623511676 1.480769231
warsaw+"turkey" 0.0008578956836 0
warsaw+"structures" 0.0008172439347 0
warsaw+"european union" 0.0008022773482 0.4177884615
warsaw+"brazil" 0.0007774283701 1.153846154
warsaw+"archbishop" 0.0007740575795 0.03168269231
warsaw+"national museum" 0.000767280711 0
warsaw+"virginia" 0.0007299819508 0
warsaw+"world war i" 0.0007263395585 0
warsaw+"revolution" 0.0007200867509 0
warsaw+"britain" 0.0007179831592 0.6875
warsaw+"prussia" 0.0007170515678 0
warsaw+"wola" 0.0007104794523 0
warsaw+"national defence" 0.0007005572936 0
warsaw+"california" 0.0006988823485 1.009615385
warsaw+"north carolina" 0.0006966443555 0
warsaw+"churches" 0.0006918588024 0.1389423077
warsaw+"newspaper" 0.0006915758913 0
warsaw+"personal" 0.0006850157792 0
warsaw+"united states" 0.0006839722755 0
warsaw+"asia" 0.0006731392376 0.9903846154
warsaw+"oslo" 0.0006712669615 0
warsaw+"lot" 0.0006704205155 0
warsaw+"st petersburg" 0.0006619768636 0
warsaw+"central europe" 0.000650809086 0.1413461538
warsaw+"latin" 0.000648415619 0
warsaw+"istanbul" 0.0006327336962 0
warsaw+"praga" 0.0006326840386 0
warsaw+"kentucky" 0.000626855856 0
warsaw+"ohio" 0.0006232983963 0
warsaw+"siege" 0.000619651703 0
warsaw+"saint petersburg" 0.0006144432072 0
warsaw+"toronto" 0.0006143947736 0
warsaw+"bratislava" 0.0006101579041 0.6394230769
warsaw+"estonia" 0.0006025517766 0.4644230769
warsaw+"synagogue" 0.0005968391783 0
warsaw+"frankfurt" 0.0005936254533 0
warsaw+"album" 0.0005870350373 0.3076923077
warsaw+"relation" 0.0005747788765 0
warsaw+"newspapers" 0.000568433496 0
warsaw+"description" 0.0005682325154 0.9134615385
warsaw+"buenos aires" 0.0005592760695 0.9759615385
warsaw+"katowice" 0.0005569886386 0
warsaw+"organisation" 0.0005519953694 0
warsaw+"east germany" 0.000537102666 0.04663461538
warsaw+"film festival" 0.000533614835 0.09038461538
warsaw+"train station" 0.0005286149878 0
warsaw+"stadium" 0.000519958242 0
warsaw+"kosciusko county" 0.0005173082278 0
warsaw+"railway station" 0.000505127533 0
warsaw+"maps" 0.0005049773576 0
warsaw+"lvov" 0.0004994346142 0
warsaw+"biography" 0.0004991958468 0.1509615385
warsaw+"vietnam" 0.0004991351049 0
warsaw+"kaunas" 0.0004670608304 0
warsaw+"hitler" 0.0004616873243 0
warsaw+"western europe" 0.000458715544 0
warsaw+"lviv" 0.000458601219 0
warsaw+"stalin" 0.0004555344544 0
warsaw+"rotterdam" 0.0004420469553 0
warsaw+"fiction" 0.0004408883829 0.1649038462
warsaw+"settlement" 0.000436781562 0
warsaw+"red army" 0.0004339773336 0
warsaw+"plac" 0.0004285979753 0
warsaw+"castle square" 0.0004229585835 0.008509615385
warsaw+"taiwan" 0.0004216404641 0
warsaw+"united kingdom" 0.0004151858886 0
warsaw+"south korea" 0.0004092731259 0
warsaw+"ethnic" 0.0004054963786 0.2004807692
warsaw+"seoul" 0.0003898213174 0
warsaw+"stuttgart" 0.0003811785778 0
warsaw+"thailand" 0.0003795711307 0
warsaw+"skyscraper" 0.0003564981945 0
warsaw+"tel aviv" 0.0003518472979 0
warsaw+"warsaw ghetto inmates" 0.0003505170507 0
warsaw+"kielce" 0.0003452136829 0
warsaw+"bangkok" 0.0003434270814 1.125
warsaw+"congress poland" 0.0003431013639 0.001360576923
warsaw+"kazakhstan" 0.0003428885888 0
warsaw+"taipei" 0.0003264172314 0
warsaw+"florida" 0.0003132285948 0.6730769231
warsaw+"iron curtain" 0.0003126149749 0
warsaw+"baltic sea" 0.0003071918651 0.04115384615
warsaw+"radom" 0.0003063212941 0
warsaw+"belweder" 0.0003062181016 0.004754807692
warsaw+"general government" 0.0002991728124 0
warsaw+"international airport" 0.000288209747 0
warsaw+"odessa" 0.0002876467942 0
warsaw+"bydgoszcz" 0.0002835680368 0.4769230769
warsaw+"reconstruction" 0.0002810380182 0
warsaw+"mongolia" 0.0002801015891 0
warsaw+"new town" 0.0002792802465 0
warsaw+"associated press" 0.0002758594688 0.07836538462
warsaw+"public library" 0.0002753429693 0
warsaw+"gdynia" 0.000266950642 0
warsaw+"nicolaus copernicus" 0.0002669204512 0
warsaw+"county seat" 0.0002657706025 0.1677884615
warsaw+"wisconsin" 0.0002645673268 0
warsaw+"gniezno" 0.0002621586517 0
warsaw+"cemeteries" 0.0002612378266 0.01596153846
warsaw+"benton county" 0.0002598797853 0.006778846154
warsaw+"north dakota" 0.0002587457855 0
warsaw+"supreme court" 0.0002585502635 0
warsaw+"national theatre" 0.0002585259184 0
warsaw+"administrative district" 0.0002506757432 0.05769230769
warsaw+"polish language" 0.0002473385407 0
warsaw+"minnesota" 0.0002460461077 0
warsaw+"san diego" 0.0002441535989 0
warsaw+"holocaust jewish" 0.000243316588 0
warsaw+"november uprising" 0.0002431704763 0
warsaw+"bombing" 0.0002355447962 0.08653846154
warsaw+"unesco" 0.0002349214996 0
warsaw+"cavalry" 0.0002262865396 0.04730769231
warsaw+"colorado" 0.0002179767671 0.5240384615
warsaw+"montenegro" 0.0002131867362 0
warsaw+"ursus" 0.0002078874477 0
warsaw+"plaza" 0.0002066975879 0
warsaw+"phoenix" 0.0002050598252 0
warsaw+"warsaw pact nations" 0.0002045706326 0
warsaw+"siedlce" 0.0002019162138 0
warsaw+"city council" 0.00020002797 0.03139423077
warsaw+"holy cross church" 0.0001997187296 0
warsaw+"neighbourhood" 0.0001979168019 0
warsaw+"kampinos forest" 0.0001962123284 0
warsaw+"otwock" 0.0001956310034 0
warsaw+"operation tempest" 0.0001892946485 0
warsaw+"visitor" 0.0001864010355 0
warsaw+"lichtenberg" 0.0001823971034 0
warsaw+"gazeta wyborcza" 0.0001767865335 0
warsaw+"osage river" 0.0001698993877 0
warsaw+"sopot" 0.0001686430784 0
warsaw+"adolf hitler" 0.0001639562623 0.02778846154
warsaw+"lublin voivodeship" 0.0001609737564 0
warsaw+"attraction" 0.000160270252 0.2490384615
warsaw+"kalisz" 0.0001594741085 0
warsaw+"higher education" 0.0001594571251 0
warsaw+"narrative" 0.0001585052329 0
warsaw+"prudential warsaw" 0.0001577431311 0
warsaw+"warsaw pact states" 0.000153833718 0
warsaw+"bonn" 0.0001521606372 0.2240384615
warsaw+"coventry" 0.0001500113552 3.163461538
warsaw+"market square" 0.0001491982655 0
warsaw+"second polish republic" 0.000140977298 0
warsaw+"world bank" 0.0001389565733 0
warsaw+"fort wayne" 0.000136518359 0.3014423077
warsaw+"hancock county" 0.0001353717299 0
warsaw+"ulica" 0.0001304449694 0
warsaw+"esperanto" 0.0001284924012 0.01802884615
warsaw+"brandenburg" 0.0001277065518 0.09759615385
warsaw+"harbin" 0.0001252765199 0
warsaw+"hanoi" 0.0001209524211 0
warsaw+"trinity church" 0.0001201254681 0
warsaw+"anti communist" 0.00011888045 0.009230769231
warsaw+"grand theatre" 0.0001160405613 0
warsaw+"richmond county" 0.0001159208463 0
warsaw+"lake city" 0.000115145414 0
warsaw+"civic platform" 0.000107874225 0.002610576923
warsaw+"malbork" 0.0001073301934 0
warsaw+"vatican city" 0.0001036328838 0
warsaw+"rio de janeiro" 0.0001022472711 0
warsaw+"socialist realism" 9.86E-05 0
warsaw+"medical school" 9.85E-05 0
warsaw+"senator" 9.84E-05 0
warsaw+"grand theatre warsaw" 9.77E-05 0
warsaw+"constitution square" 9.68E-05 0.0006538461538
warsaw+"gallatin county" 9.67E-05 0
warsaw+"pictorial" 9.60E-05 0
warsaw+"belweder warsaw" 9.60E-05 9.76E-05
warsaw+"hamamatsu" 9.46E-05 0
warsaw+"ohio river" 9.40E-05 0
warsaw+"modern art" 9.39E-05 0
warsaw+"east berlin" 9.32E-05 0.01836538462
warsaw+"north bridge" 9.29E-05 0
warsaw+"transylvania" 9.22E-05 0
warsaw+"barbakan" 8.85E-05 0.002663461538
warsaw+"partitions of poland" 8.75E-05 0
warsaw+"silesian voivodeship" 8.75E-05 0
warsaw+"belweder warsaw poland" 8.73E-05 9.62E-07
warsaw+"tourist attraction" 8.71E-05 0
warsaw+"ochota" 8.45E-05 0
warsaw+"radio station" 8.38E-05 0
warsaw+"public transport" 8.37E-05 0
warsaw+"personal narratives" 8.24E-05 0
warsaw+"henryk sienkiewicz" 8.19E-05 0
warsaw+"all saints" 8.06E-05 0.01100961538
warsaw+"warsaw metro stops" 8.06E-05 0
warsaw+"economic growth" 8.04E-05 0.05576923077
warsaw+"world heritage" 7.94E-05 0
warsaw+"holy trinity church" 7.92E-05 0
warsaw+"public space" 7.75E-05 0
warsaw+"art deco" 7.72E-05 0.01769230769
warsaw+"contemporary art" 7.55E-05 0.04855769231
warsaw+"holocaust victims" 7.53E-05 0
warsaw+"warsaw cave" 7.42E-05 0
warsaw+"barbakan warsaw" 7.40E-05 0.0003384615385
warsaw+"treblinka extermination camp" 7.37E-05 0
warsaw+"art museum" 7.27E-05 0.03254807692
warsaw+"alfred tarski" 7.24E-05 0.0004721153846
warsaw+"warsaw pact country" 7.19E-05 0
warsaw+"dwelling" 7.14E-05 0.03254807692
warsaw+"pope john paul ii" 6.89E-05 0
warsaw+"all saints day" 6.75E-05 0.001793269231
warsaw+"lot polish airlines" 6.67E-05 0
warsaw+"carpathian mountains" 6.46E-05 0.03110576923
warsaw+"skierniewice" 6.24E-05 0
warsaw+"hard rock cafe" 6.10E-05 0
warsaw+"insurance company" 6.10E-05 0
warsaw+"light rail" 5.98E-05 0
warsaw+"nazism" 5.95E-05 0
warsaw+"academy award" 5.94E-05 0.3951923077
warsaw+"democratic left alliance" 5.84E-05 0.003307692308
warsaw+"astana" 5.78E-05 0.4716346154
warsaw+"barbakan warsaw poland" 5.48E-05 1.01E-06
warsaw+"military operation" 5.47E-05 0
warsaw+"middle class" 5.41E-05 0
warsaw+"demographics" 5.37E-05 0.03769230769
warsaw+"rice county" 5.36E-05 0
warsaw+"warsaw west county" 5.19E-05 0
warsaw+"operation bagration" 5.15E-05 0
warsaw+"sea level" 5.14E-05 0
warsaw+"french language" 5.13E-05 0
warsaw+"pictorial works" 5.06E-05 0
warsaw+"foreign investment" 5.03E-05 0.2153846154
warsaw+"nature reserve" 4.90E-05 0
warsaw+"fortification" 4.80E-05 0.03413461538
warsaw+"kovel" 4.74E-05 0
warsaw+"association football" 4.74E-05 0.04951923077
warsaw+"polish united workers party" 4.65E-05 0
warsaw+"french army" 4.63E-05 0
warsaw+"konin" 4.62E-05 0
warsaw+"joseph conrad" 4.56E-05 0
warsaw+"andrzej wajda" 4.42E-05 0.004274038462
warsaw+"frankfurt am main" 4.34E-05 0
warsaw+"office building" 4.27E-05 0
warsaw+"daewoo" 4.14E-05 0.007788461538
warsaw+"burgher" 3.98E-05 0.008894230769
warsaw+"grozny" 3.95E-05 0
warsaw+"auschwitz concentration camp" 3.80E-05 0.002908653846
warsaw+"prisoner of war" 3.72E-05 0
warsaw+"municipal government" 3.60E-05 0
warsaw+"unemployment rate" 3.58E-05 0
warsaw+"war crime" 3.53E-05 0
warsaw+"great northern war" 3.49E-05 0
warsaw+"city planning" 3.37E-05 0.08509615385
warsaw+"walsh county" 3.22E-05 0
warsaw+"roman polanski" 3.16E-05 0
warsaw+"bletchley park" 3.04E-05 0.005336538462
warsaw+"stara" 3.03E-05 0
warsaw+"karol szymanowski" 3.02E-05 0
warsaw+"slavic languages" 3.01E-05 0
warsaw+"radomsko" 2.95E-05 0
warsaw+"film production" 2.95E-05 0.008221153846
warsaw+"enigma machine" 2.94E-05 0.007788461538
warsaw+"military decoration" 2.93E-05 0
warsaw+"strategic bombing" 2.82E-05 0
warsaw+"religious communities" 2.81E-05 0
warsaw+"lesser poland voivodeship" 2.72E-05 0
warsaw+"national democracy" 2.61E-05 0
warsaw+"loughborough university" 2.59E-05 0
warsaw+"berlin philharmonic" 2.55E-05 0.07980769231
warsaw+"vienna circle" 2.53E-05 0
warsaw+"high jump" 2.49E-05 0
warsaw+"khmelnytsky uprising" 2.40E-05 0
warsaw+"military campaign" 2.37E-05 0
warsaw+"constitutional monarchy" 2.34E-05 0.05817307692
warsaw+"silver screen" 2.33E-05 0
warsaw+"swedish empire" 2.31E-05 0
warsaw+"underground movements" 2.19E-05 0
warsaw+"landscape architecture" 2.18E-05 0
warsaw+"napoleon i" 2.02E-05 0
warsaw+"wolin" 1.98E-05 0
warsaw+"private universities" 1.93E-05 0
warsaw+"regional rail" 1.91E-05 0
warsaw+"kampinos national park" 1.86E-05 0
warsaw+"ethnic relations" 1.86E-05 0.03423076923
warsaw+"persecutions" 1.84E-05 0
warsaw+"fresno county" 1.84E-05 0
warsaw+"plac teatralny" 1.82E-05 0
warsaw+"ukrainian diaspora" 1.81E-05 0
warsaw+"pope paul vi" 1.78E-05 0
warsaw+"prussian army" 1.77E-05 0
warsaw+"free french forces" 1.77E-05 0
warsaw+"architectural style" 1.73E-05 0.02206730769
warsaw+"irene adler" 1.70E-05 0
warsaw+"united states army" 1.70E-05 0
warsaw+"warsaw stock exchange" 1.70E-05 0
warsaw+"apartment building" 1.66E-05 0.01043269231
warsaw+"curzon line" 1.63E-05 0.002504807692
warsaw+"massacres of poles in volhynia" 1.63E-05 0
warsaw+"charlottenburg" 1.59E-05 0.1826923077
warsaw+"saint andrew" 1.58E-05 0
warsaw+"black walnut" 1.57E-05 0.09807692308
warsaw+"pole vault" 1.52E-05 0
warsaw+"broadcaster" 1.51E-05 0.5865384615
warsaw+"mtv networks" 1.49E-05 0
warsaw+"kamienica bornbachowska warsaw" 1.47E-05 0
warsaw+"kamienica bornbachowska" 1.47E-05 0
warsaw+"movie theater" 1.42E-05 0
warsaw+"interfax" 1.41E-05 0
warsaw+"madeleine albright" 1.40E-05 0
warsaw+"planned community" 1.40E-05 0
warsaw+"pine forest" 1.39E-05 0
warsaw+"religious freedom" 1.39E-05 0
warsaw+"historical period" 1.38E-05 0
warsaw+"european parliament constituencies" 1.32E-05 0
warsaw+"varsovian" 1.32E-05 0
warsaw+"tomb of the unknown soldier" 1.32E-05 0
warsaw+"saki" 1.27E-05 0
warsaw+"city counties" 1.27E-05 0.002673076923
warsaw+"isaac bashevis singer" 1.24E-05 0
warsaw+"munich massacre" 1.23E-05 0
warsaw+"filmmaking" 1.22E-05 0.2610576923
warsaw+"plac teatralny warsaw" 1.22E-05 0
warsaw+"ulica smolna warsaw" 1.22E-05 0
warsaw+"ulica smolna" 1.22E-05 0
warsaw+"fields medal" 1.20E-05 0.005961538462
warsaw+"documentary film festivals" 1.19E-05 0.3557692308
warsaw+"sigismund ii augustus" 1.16E-05 0
warsaw+"nisan" 1.16E-05 0
warsaw+"warsaw uprise museum" 1.15E-05 0
warsaw+"talmud torah" 1.14E-05 0
warsaw+"nature conservation" 1.11E-05 0
warsaw+"central intelligence agency" 1.08E-05 0.008221153846
warsaw+"gross domestic product" 1.08E-05 0
warsaw+"maidenhair tree" 1.08E-05 0
warsaw+"lusatia" 1.08E-05 0
warsaw+"mastercard" 1.06E-05 0
warsaw+"stanley kubrick" 1.05E-05 0
warsaw+"ulmus americana" 1.03E-05 0
warsaw+"domino theory" 1.01E-05 0.01192307692
warsaw+"foreign relations of belarus" 1.01E-05 0
warsaw+"foreign relations of estonia" 1.01E-05 0
warsaw+"foreign relations of finland" 1.01E-05 0
warsaw+"polish state railways" 1.01E-05 0
warsaw+"town house" 9.53E-06 0
warsaw+"steel mill" 9.51E-06 0
warsaw+"john f kennedy international airport" 9.30E-06 0
warsaw+"deserted settlement" 9.14E-06 0
warsaw+"housing project" 9.07E-06 0
warsaw+"ulmus parvifolia" 8.95E-06 0
warsaw+"gas works" 8.83E-06 0
warsaw+"buildings structures" 8.63E-06 0.01336538462
warsaw+"charles x gustav of sweden" 8.52E-06 4.42E-06
warsaw+"foreign relations of canada" 8.52E-06 0
warsaw+"foreign relations of croatia" 8.52E-06 0
warsaw+"foreign relations of italy" 8.52E-06 0
warsaw+"foreign relations of the republic of ireland" 8.52E-06 0
warsaw+"border control" 7.75E-06 0.03024038462
warsaw+"national library of poland" 7.75E-06 0
warsaw+"russo polish war" 7.75E-06 0
warsaw+"visitationist church" 7.75E-06 0
warsaw+"juglans nigra" 7.45E-06 0
warsaw+"scouting museums" 7.18E-06 0
warsaw+"flag of poland" 6.97E-06 0.0030625
warsaw+"royal castle warsaw" 6.97E-06 0
warsaw+"public housing" 6.92E-06 0
warsaw+"personal narratives polish" 6.60E-06 0
warsaw+"legislative power" 6.39E-06 0
warsaw+"koleje mazowieckie" 6.20E-06 0
warsaw+"pseudotsuga menziesii" 6.19E-06 0
warsaw+"prime meridian" 6.17E-06 0
warsaw+"panel painting" 5.88E-06 0
warsaw+"intensive care unit" 5.66E-06 0
warsaw+"pock" 5.59E-06 0
warsaw+"francisco goya" 5.44E-06 0.01990384615
warsaw+"foreign relations of cyprus" 5.42E-06 0
warsaw+"foreign relations of hungary" 5.42E-06 0
warsaw+"gare du nord" 5.42E-06 0
warsaw+"ignacy krasicki" 5.42E-06 0
warsaw+"konfrontacja sztuk walki" 5.42E-06 0
warsaw+"vaslav nijinsky" 5.42E-06 0
warsaw+"cyfrowy polsat" 4.65E-06 0.01548076923
warsaw+"poczta polska" 4.65E-06 0
warsaw+"wyoming county new york" 4.65E-06 0
warsaw+"christian national union" 3.87E-06 0.002985576923
warsaw+"foreign relations of lithuania" 3.87E-06 0
warsaw+"mily balakirev" 3.87E-06 0
warsaw+"world war ii crimes in poland" 3.87E-06 0
warsaw+"commemorative plaque" 3.82E-06 0.006778846154
warsaw+"reversi" 3.82E-06 0
warsaw+"ginkgo biloba" 3.55E-06 0
warsaw+"southern united states" 3.10E-06 0
warsaw+"foreign relations of argentina" 2.32E-06 0
warsaw+"foreign relations of armenia" 2.32E-06 0
warsaw+"foreign relations of latvia" 2.32E-06 0
warsaw+"foreign relations of poland" 2.32E-06 0
warsaw+"foreign relations of the netherlands" 2.32E-06 0
warsaw+"lithuanian soviet socialist republic" 2.32E-06 0
warsaw+"sergey brin" 2.32E-06 0
warsaw+"south african air force" 2.32E-06 0
warsaw+"the honeymooners" 2.32E-06 0
warsaw+"john irving" 2.30E-06 0
warsaw+"valerius" 2.30E-06 0
warsaw+"kate mosse" 1.79E-06 0
warsaw+"coshocton county" 1.55E-06 0.005
warsaw+"dunkin donuts" 1.55E-06 0.003399038462
warsaw+"peoples republic of china" 1.55E-06 0
warsaw+"united states post office" 1.55E-06 0
warsaw+"brask" 1.52E-06 0.002634615385
warsaw+"joy division song" 1.52E-06 0
warsaw+"berlin border crossings" 7.75E-07 2.40E-06
warsaw+"foreign relations of albania" 7.75E-07 0
warsaw+"foreign relations of australia" 7.75E-07 0
warsaw+"foreign relations of luxembourg" 7.75E-07 0
warsaw+"foreign relations of romania" 7.75E-07 0
warsaw+"foreign relations of slovakia" 7.75E-07 0
warsaw+"foreign relations of sri lanka" 7.75E-07 0
warsaw+"foreign relations of syria" 7.75E-07 0
warsaw+"foreign relations of turkey" 7.75E-07 0
warsaw+"jewish political movements" 7.75E-07 0
warsaw+"languages of the united states" 7.75E-07 0
warsaw+"moscow military district" 7.75E-07 0
warsaw+"roads in ireland" 7.75E-07 0
warsaw+"warsaw business journal" 7.75E-07 0
warsaw+"warsaw international film festival" 7.75E-07 0
warsaw+"corylus colurna" 5.08E-07 0.0002418269231

Söka bredare vetskap koncept-association: Wikipedia / Wiktionary på många språk

2014-04-15

Enligt principen enkel att förstå från:


  • Vi har definition på engelska (vi säger är vårt "mitt-språk" eftersom det är mitt) ex. integral i Wiktionary.
  • Där konstruktionen är sådan att motsvarande sida länkas i andra språkområden. Vi utgår där från länkning i vänstra marginalen motsvarande samma system i Wikipedia.
  • Vi utgår där från integral (svenska) som exempel.
  • Och gör översättning: integral (Google Translate).

En metod för att skapa system översättning bygger på alignment mellan text motsvarande samma definition eller jämförbart i olika språk. Vi inser att ex. Wiktionary är vad som tänkbart kan vara en del av data möjligt att använda för det. Jag kan föreställa mig att Google Translate är ett ex. på system som tydligt tidigt prioriterat denna typ av data för inlärning av statistiska relationer (nu antar jag att feedback från användare är den märkbara delen för förändring görande finare nyans korrektioner och inlärning).


Här är en av de två utgångspunkterna att denna inlärning är befintlig i systemet för översättning. Därmed görande översättningen från språk två (i exemplet svenska) får vi där indikerande koncept med sin troliga engelska motsvarighet. Det är vidare ytterst rimligt att anta att Wiktionary såväl som Wikipedia hör till datakälla ofta utnyttjade för väl-använda översättningssytem såväl i inlärning som feedback d.v.s. att ex. Google Translate utmärkt klarar översättning mellan definitioner eller uppslagssidor.


Därmed får vi kompletterad vetskap om associationer aktuella för aktuellt koncept och koncept i definitionen eller relationer mellan de koncept i definitionen.


Denna vetskap kan vara kontextuellt för språkområdet eller mer aktuellt för mig (där kontextuell inverkan hanteras via logiska beräkningar över generell vetskap association av ett antal typer) behandlade alla relationer detekterade p.s.s. för att bygga vetskap association.


I någon mening är det egentligen samma sak man gör när man tränar översättningssystem med tidigare indikerad algoritm. Och det var därifrån jag fick idéen till algoritmen.


Troligt ej aktuell för mig praktiskt förrän nästa omgång att söka kompletterande vetskap association från långsamt föränderliga datakällor i "uppslagsboks-tiden". Ett tänkbart problem praktiskt för mig är att jag ej har egen lösning översättning med den trovärdighet korrekt rörande olika sense på orden nödvändig här och ej heller underhålligt eller använt samtidigt som jag ej vet riktigt hur många request Google gillar per tyngd innan man stängs ner till nästa eller alternativt börjar betala för dem. Förr ett antal år sedan gällde ofta ungefär totalt 10 - 12 k requests medan stycke-prisen var sådana ovanför att jag ej ser praktisk meningsfullt för den här typen av användning när många miljoner requests behöver ske över en mängd datakällor (d.v.s. ev. krävande kanske rent av en budget på ett par miljoner).


Alternativa lösningar finns säkert men jag har ingen uppdaterad bild. Jag tror förövrigt att Google Translate är mycket ledande just i dom algoritm-system och deras maskin-inlärning viktigt för denna lösning. Mer regelbyggda lösningar och/eller statistiska med mindre eller ingen feedback från de som gör översättning (d.v.s. etablerande goda översättning mellan välbesökta sidor representerande motsvarighet - särskilt här där författare, redaktörer m.fl. kanske själva gör kvalitetskontroll) kan vara mycket sämre när kontext antingen lokalt mellan och i stycken resp. meningar eller aktuellt för något mer lokaliserat språkområdet är intressant. Men som sagt jag har väldigt dålig bild av hur väl alternativa lösningar fungerar här.


Komplettering: Jag vet ej (läste ej artikeln) om man gör samma sak i Polish and English wordnets - statistical analysis of interconnected networks men är jag ganska säker på utnyttjar en till uppenbar (men mycket mindre för språkområden såväl som data koncept-associationer) datakälla - Wordnet anpassningar för olika språk - jämförbart rörande metod ta ut statistiken för associationer. Ett problem med Wordnet-varianter utanför Princeton's välkända (wordnet.princeton.edu) är att åtminstone ett fåtal skapades med EU-finansiering föga genomtänkt rörande värdeskapande för medborgare och företag i unionen innebärande att de ej är tillgängliga för användning utan betalning licens resp. troligen inte normalt är tillgänglig för någon oavsett om betalning sker. Jag har fått intrycket att detta problem allmänt är vad EU nu ska ha börjat sett över med förändrade riktlinjer rörande finansiering av grundforskning med avgränsade leverabler. Ett annat problem jag ej vet om man hanterar ännu är att sidor med leverabler och redovisning av skapade saker (ex. resultat av intresse för alla som ska vara fritt) ofta efter en tid försvinner från nätet (ibland relaterat med att anpassningar av det sålts till kommersiella företag).

Artigt: Utstuderad konstform konkretiseras statistiskt i förståelsen

2014-01-13

Artighet är ett intressant område för mer automatiserad språkanalys. Det delar praktiskt något av komikens egenskaper i det övertydliga samtidigt ofta implicita utan nödvändigtvis något konkret uttalat (mer den "potentiella energin" än "rörelseenergin") och därmed något ibland enklare för en maskin att ta ut en kompletterande sida av människoflockens samspel.


Vid tillfälle intressant att läsa blir därför vad vi har citat av nedan jag precis uppmärksammade:


"Being indirect (line 9) is another way to minimize social threat. This strategy allows the speaker to avoid words and phrases conventionally associated with requests. First-person plural forms like we and our (line 15) are also ways of being indirect, as they create the sense that the burden of the request is shared between speaker and addressee (We really should...)."


Från: A computational approach to politeness with application to social factors | Standford
Cristian Danescu-Niculescu-Mizilz, Moritz Sudhofy, Dan Jurafskyy, Jure Leskovec, and Christopher Pottsy


Dan Jurafskyy referensbok Speech and language processing är dessutom mycket att rekommendera och mest så bland de sju huvudsakliga referensböcker över näraliggande AI till statistisk NLP över vetenskaplig psykologi. Och artikeln jag sökte enligt kompletteringen i hittar vi förövrigt där under rubrik Language model adaption and web use i kapitel N-Grams.


En i form inte olik applikation här är artighet (inte helt olikt ritualiserad dans) för att reducera problematik emotionellt tunga domäner annars kan riskera att utlösa när motivation eller upplevd fara blåser upp saker och ting. A åker med ett av sina flygplan till Q1 som hör till B så B flyger runt med en av sina flygplan eller båtar på Q2 som hör till Q2.


Givetvis om ritualiseringen börjar ses som givna regler där ett implicit förtroende finns för vad de betyder börjar det i en del domäner bli lätt farligt därför människans möjlighet att tolka fel är stor. Möjligheten för Sovjetunionens diktatur att mer prata med den fria världens dåvarande ledande nation (i väst vs öst frågor i alla fall - NATO vs Warzava-pakten) tycks vettigt för att undvika onödiga kostnader (resp. emotionella pinsamheter när resp. allianser inte alls fungerar praktiskt i närheten av vad man först försökte få den andra och tro och därefter övertygade sig själv om) i döda och förstörda material (likt ).


Vi har ytterligare en domän närmare den i citatet: när vi önskar förklara eller indikera något i information om passerat eller predikterande beteende mer avgränsat speciikt men finner det "oartigt" för den andra eller vad vi egentligen praktiskt inte känner för att konkret förklara i detaljer.


I språkmodeller torde därför någon sannolikhet för givet artighet Q att det indikerar mer potentiellt och varaktigt förhållande i flocken (ex. shop keeper - kund) eller om det egentligen inte indikerar sådant förhållande utan mer att mer ser det som korrekt, fördelaktigt, eller bara artigt att tydliggöra något icke konkret.


P ( artighetet Q vid tiden t | något inträffat vid tiden ( t - j ) vs P ( artighetet Q vid tiden t | kissing up to some big entity used to you being polite from time to time last 12 years) vs P ( artighetet Q vid tiden t | indikerande händelser som kommer)

Något svårare blir det hela när domänen inte är mycket tydlig ritualiserad dans ("Ok dom flyg lite nära vår gräns och över den under 20 s så då skickar jag min ubåt hit och dit innan jag går hem för dagen.") utan dessutom blandar in marknadsföring av nyhetshändelsen i sig resp. kanske rent av bär komiska dimensioner ("Varför flyga nära gränsen med något kostsamt när vi säkert kan motivera någon medborgare att ta en ballong dit eller varför inte en kanot. Sådant gillar media att skriva om.").


Exemplen bör hoppas jag peka på att direkt förekomst av A givet B så hårt repeterad att det uppfattas som givet är vad vi ibland blir en aning baffled av när nytt kommer. Risken är att domän och målsättning feltolkas när ytliga symboler av vad som avses eller vad som är målsättningen A givet B inte riktigt är vad vi är vana vid (ex. Mrs C och General B hade båda på sig en vågad huvudbonad vid dansen vilket väckte mycket av oroade samtal). Explicita såväl som implicita symbolgrupper och hur de förhåller sig är inte oviktigt när vi i dom här domänerna resonerar om P ( A | B ): Men åtminstone från mina praktiska analysdomäner understryker och höjer det snarast upp behovet av varierad statistik på samförekomst mellan koncept i olika sammanhang. Grovt över ex. samtliga webbsidor eller lokaliserat i title-headings för forskningsartiklar -och gärna samplat för att uttrycka varians mer än bias för att göra bias till vad som kan adderas implicit för situationen (2011 - 2012 gjorde jag viss default-grund sampling för en mindre komprimerad relationssamling - mycket arbetsamt vid tiden p.g.a. brist på plats på hårddiskarna så jag tvingades processa till PAB direkt men har heller inte sett något därefter indikerande att man hade haft värde av själva dump-historiken - och tar just nu det till en väsentligt större mängd koncept och relationer krävande mycket mer men också i allt när nu storlek ändå blir hög ytterst hög i riktade smala datakälla varierade).


P.s.s. oavsett refererad domän kan artigheten såväl vara en utstuderad konstform resp. ett mer allmängiltigt språk: liksom alla språk i ord, vapen, statyer, målningar, foto, ritualiseerad dans eller en artig nickning av kejsaren (kraftigt tolkad av alla oavsett av misstag eller inte om en "riktig" kejsare som håller all den poentiella energin).

P(A) P(B) är en oanvändbart vek skattning av P(A,B)

2013-10-04

För att fortsätta Tre tidsperspektiv: Sociala media, Nyhetstid och Uppslagsböcker (2013-10-03) och där refererade inlägg gäller när vi utgår från de i den mest långsamt förändrade tiden - "uppslagsböcker" - för upparbetade inlägg att för att addera viss "smoothing" för de relationer där kända adderar P(A) P(B) (där A resp. B är koncept bestående av en eller flera ord i språkmening medan varje koncept i sig är en typ vi igenkänner, förstår och kan resonera kring) inget värde och kan oavsett det ej heller adderas in som smoothing utan att skada övergripande data.


Utnyttjar vi emellertid likhet mot det kontext vi befinner oss i - också när det sker med enklaste tänkbara metod jag använt för liknande vilket är den jag valde för detta - blir det funktonellt för smoothing och adderar rent av tror jag för en del koncept värde jämfört med vad samplat.


Skillnaden - vilket Tre tidsperspektiv: Sociala media, Nyhetstid och Uppslagsböcker (2013-10-03) diskuterade ett annat uttryck för - är den globala sannolikheten för ett koncept ej längre används direkt utan anpassas till det kontext den befinner sig i.


När likheten resp. den sannolikheten vidare formas mot lokalt kontext genom att skatta dess vad ajg kallar Blue light intensity får vi en approximation av att göra similarity operationerna ett mycket stort antal gånger efter varandra för att ta upp formande till kontext sekundärt från dess relationer och vidare utåt. Att göra det specifikt för varje kontext är emellertid praktiskt ogörligt prestanda-mässigt också när viktfiler genereras specifikt för användning under flera år som här men fortfarande när det görs för varje koncept mot det kontext det själv direkt förvaltar medan dess för inverka på varandra globalt under kanske 10 till 50 epoker adderar det värde för den användning vi diskuterar här adderar större värde-höjd jämfört med P(A) * P(B) som skattning.


Givetvis hade vi låtit A och B endast varit ord (i språk mening d.v.s. koncept vi skriver utan att de innehåller mellanslag) hade vi sluppit mycket av problemet med P(A) * P(B) som skattning men all den huvudsakliga användningen som söks med P(A,B) skattningen hade emellertid heller inte varit möjlig.


I övrigt tycks det som att alla datakällor jag använt undantaget de fyra största (där Wikipedia är en avseende fyra upp till sex mått varav den största som gått klart ligger efter stops på cirka 67 GB koncept-relationer beroende av om jag väljer att ta in alla: generering av några fortgår så jag har inte bedömt dem) resp. utan föregående P(A,B) vikt-grid - klarar att täcka upp cirka 45 - 50% av relationerna existerade i Blue light (en positiv upplevelse: jag hade snarare räknat med 10 - 15% maximum). Jag spekulerar ej helt utan tro på korrekheten av det att adderande Wikipedia datat orkar det upp till kanske 70% - 75% (dessa procent-värden skattande från Blue light Red 2.0 som ligger på cirka 800 000 symboler och för bedömda relationer cirka 30 000 000 - 55 000 000 d.v.s. ej senaste Blue light Abstract Concrete 1.0 som ligger på 11 miljoner symboler men där för den senare en mycket stor del av de extra består av relationer relaterat geografi och personer). Smoothing från Blue light relationerna när det är formad sannolikhet varande en ej dålig skattning kan därför addera värde genom att spara gigantisk beräkningskostnad fortgående under hela användnings-perioden för datat (säkert flera år).


Jag hade innan räknat med att ha P(A) P(B) som en parallell smoothing till similarity men som sagt adderar det inget värde alls och skadar ofta.