Visar inlägg med etikett Textanalys. Visa alla inlägg
Visar inlägg med etikett Textanalys. Visa alla inlägg

Den viktigaste relevanta repetitionen för data mining och intelligens i politiskt prediktion gömd i det implicita

2013-02-20


Ett urdrag och sammanfattning av längre artikelserie planerad till denna vecka i Nyfiken vital - Människans språk.


En av de mest - personligt - betydelsefulla artiklar jag läst de sista fyra åren är Information, Communication, and Meaning, George A. Miller (jag lämnar som övning till läsaren att försöka hitta på nätet om alls där) där han i sammanfattning föregriper informationsteorin inom de kognitiva psykologin ändå framtill idag (praktiskt ex. rörande image analysis av fmri rörande tester med i hans tidiga arbete närmare informationsanalysen vid mer "manuella" psykologiska tester). Miller var ju också en av de tidiga stora tänkarna och grundläggarna till den kognitiva psykologin, psykolingvistiken och informationsvetenskapen.


Närmare slutet av artikeln skriver Miller:


"It is resonable to asky why we are so redundant. The answer lies in the fact that redundancy is an unsurrance against mistakes. [Jämför gärna också med risk management förövrigt varande det områden där jag mötte informationsteorin först.]. The only way to catch an error is to repeat. Redundant information is an autoatic mistake-catcher built into all natural languages. Of course, if there is no chance of error, then there is no need for redundancy. The large amount of redundancy that we seem to insist on reflects our basic ineffeiciency as information-handling systems. Compared with the thousands or millions of bits per second that electronic devices can handle [...] can chariably be called puny [Miller var förövrigt först med att notera 5 - 7 "gränsen" för arbetsminne vilket är en bra utgångspunkt för att bättre förstå vad han avser]. By making our languages redundant we are able to decrease the rate, Hx(y), to a point where we can cope with what is being said."

När vi ska lära oss sekvenser "utantill" vilket är mycket nära de konkreta försök Millers förklaring avser är detta när det pekats ut med "enkla" formler klart för oss lätt att uppleva lite självklart.


Vår kunskap, vårt intresse och hur vi tänker och känner styr allt övergripande

Övergripande inte bara för individen över intressen, kunskap, humör, vad han eller hon läser m.m. utan också vänner han möter före eller efter idéer utbyts med.


När kunskapen konkret samverkar för uttrycka de komplexa som går långt utanför varje enskilt dokument eller ens alla av våra största välkända corpus. Är vi inte längre i den givna enkla sekvensen vi upprepar tills vi lärt den.


Ungefärlig förståelse av vad t.ex. Stockholm eller en kemisk reagens gör. Dessutom när meningsfull relevans finns samverkar våra konkreta objekt med vad vi redan är, vet och informationen vi fortsatt tar in.


Denna implicita repetition mer kontinuerlig där delar av relationer mellan många koncept kan förstärkas, skapas eller offras för effektivisering via prouning (lättsam sammanfattning pruning inkl. relaterat med referenser The Brain and Consciousness) går långt utanför de vanliga (men likväl innebär verklig praktisk-utmaning) discourse modeller som analysera data nära enskilda meningar i en text normalt använda för att extrahera förståelse från text. Det är väsensskilt genom att dessa i sig inte går att ta vidare till analys av implicit repetition (även om datat de ger givetvis är användbart) därför att deras algoritmer växer icke-linjär i komplexitet.


Snarare är deras ev. motsvarighet i vår kognition just att tolka informationen vi just nu tar in energieffektivt medan andra annorlunda utmaningar kräver att man tänker ytterst annorlunda för att kunna se utan att dränkas i det vansinne i dimensioner enormt komplexa datamängder skapar. Hela det praktiska området för hur vi i det konkreta extraherar enklare data från enskilda dokument finns utmärkt sammanfattat i Speech and Language Processing, Dan Jurafsky och James H. Martinm resp. kompletterat ex. T. Givón två Syntax I och II, eller någon av ett flertal liknande böcker kan ge lite fördjupat perspektiv från en annan vetenskapstradition kompletterande. Att extrahera data bra är även om det ligger utanför huvudintresset här nog så viktigt för att få in data att behandla och av ett idag mycket omfattande referensbibliotek över hela området menar på det allvarligaste att rekommenderad bok är den viktigaste att ha att slå i upp kring allt praktiskt.


Mitt ex. av Speech and Language Processing klarar att visualisera sitt verkliga värde i hur brutalt sliten den hunnit bli på kanske 1.5 år. Klicka för att förstora bilderna.


Relevans i military och business intelligence: Darpa och FBI

Dessa två perspektiv - implicit resp. närmare sekventieull redundans - kan vi fundera över när vi tittar på ex. Darpa's senaste projekt relaterat språkanalys eller tidigare FBI's upphandling för text mining av bloggar, sociala media, forum, instant messaging och allt i övrigt tänkbart över tiden att bli aktuellt i gigantiska internet corpus med ständigt "nya" tekniker och lösningar (själv sorterar jag fortfarande sociala media som antingen mer nära forum eller eg. ganska likt bloggar men med kortare text).


Tittar på vi text och mening vi hittar på internet: hur mycket värdefull konkret information hittar vi troligt direkt (om vi antar att korrektheten för sådant gör det energieffektivt att följa upp den allmänt)? En del del konkret värde finns: Inte minst bara vilka entiteter (ex. personer, organisationer, företag) som har relationer med varandra. Däremot givetvis ingen faktisk kunskap vi bättre extraherar från utvalda datakällor mer än internet generellt.


Och det explicita är vi när vi uttrycker oss oftare också mer noggranna med. Alternativt slarviga där det egentligen betyder föga. Att du ändå behöver tänka efter och sätta koncentrationskraft eller är i affekt.


Båda polerna kan påverka mottagarens värdering av oss (ex. hans är tråkig och berättar aldrig något intressant och hans skämtteckningar är fyllda med racial slures om tyskar och danskar: ska svenskarna aldrig komma över sin historia när du nu vann och tog hela Skåne. Både arg och uttråkad.)


Människan blir enklare mänsklig när flocken växer (lagom)

Tänker vi oss säkert intressant för de som söker reward i pengar implicita eller explicita läckor om företagsaffärer genom analys av information på nätet publicerat av sotra populationer är det föga normalt adderande något inte redan jämförbara eller bättre metoder finns för (ekonomin för en region eller bransch är en annan sak bl.a. därför att vi kan ta ut indikationer av innovation och hur väl sådana orkar tas emot av kund och allt där emellan vilket konkret når väldigt långt med ex. bara med ryggrad i patentansökningar). Ett till ex. jämförbart med patentansökningarna är dataanalysen som får en allt större viktigare roll inom biomedicin: Google: Kvalitetsproblem och Statistik samförekomst koncept: Enkel metod för att förstärka värdet statistik från generellt språk ger vid tillämpning inom specialistområden


Däremot att söka den implicita repetitionen eller de emotionella uttrycken relativt händelser vi objektivt kan beräkna korrelation till (t.ex. förändring av företagsledning) kan vara funktionellt (jag har aldrig prövat det på ett större företag i väsentlig skala men däremot en del 2011 och tidigt 2012 inom det politiska inte utan värde även med då snarast prototyper testande praktiska implementationer) - eller mer vågat (möjligt omoraliskt och ej vad jag själva skulle göra automatiserat) som koncept kanske addera informationskanaler in i populationen för att addera motsvarande priming koncept och mäta reaktionen ("All the people here in Uppsala says Google is afraid of Microsoft and noone really anyway does anything at Google but watching the stock news. How does that make you feel being the new Google CEO and one of the founders? Please anser in a RSS-feed indicated in the meta-data of this page. Thank you, and good luck with your great blog I always read almost daily.").


Praktiskt värde begränsas dock i mängden vi betraktar. Ju större population vi meningsfullt kan avgränsa desto mindre exaktare blir det men samtidigt mer troligt korrekt i det mindre vi kan se. Analyserar vi den lokala livsmedelsbutikens medarbetares bloggar efter implicita uttryck säger det föga troligt något om en ev. kommande upphetsande rea utan troligare något från familjelivet. För däremot t.ex. samtliga politiker i Sverige ev. inkl. tjänstemän som publiceras är det görligt, eller p.s.s. i mer intressant lämpligt i det engelska språkområdet.


Största utmaningen: Tidens hastighet har lite med klockan att göra - Förändringen av intensiteten för språk och händelser är tiden

Ytterligare en begränsning i analys praktiskt och teoretiskt åtminstone så långt jag klarat att se är görligheten att synkronisera hastigheten på tiden in i framtiden när vi predikterat för en punkt nu eller i historien. Utmaningen är att hastigheten här i den mening av hur vi upplever det är relativt ungefär hastigheten saker sker med rent allmänt och inte bara just vad vi analyserar och följer. Finns motivation runt det senare blir fenomenet av och till väldigt märkbart också utan textanalys över stora populationer när olika entiteter försöker överrösta varandra över den kollektiva gemensamma kommunikationskanalyen media, TV, reklam, dagligt tal, tidningar m.m. representerar.


Vi som är åldrade och närmare oss 40 år minns ju också Sverige före internet och fler än två tevekanaler när en populär teve-serie kunde få landet att tystna i fascination över något annorlunda (innan televisionen blev nedring av upprörda medborgare oroade över amerikansk post-Vietnamkrigs-kultur-imperialism, fördumning av the common man of the street man nu hade monopol för att hjälpa att komma rätt, otäcka rednecks i ständigt återkommande serier säsong på säsong utan att folkförflyttningen från hemmet i byn till staden någonsin blev klart, eller radhusområdenas psykologiska-extrempunkter i dramatiserade trivialiteter koncentrerade till extrem hastighet, eller det vulgära Carola uttryckte musikaliskt och kanske på fler sätt: strunt i brist på bättre förutom kanske Onedin-linjen jag som tio åring tyckte var hade många goda artistiska värden).


Att också prediktera sådant brett d.v.s. gå utanför just vårt intresse över kanske i "värsta" fall närmare en miljon koncept är dock mycket mer beräkningskrävande samtidigt som det kraftigt ökar risken för att fel ska propagera från områden där vi inte har riktigt lika bra data (vår kapacitet för mining är ju också begränsad). Samtidigt som sådant om vi håller det separerat i varje ny verklig tidpunkt är typ av data att kontrollera vad vi fortlöpande predikterar mot när det ej tillräckligt tydligt kan verifieras upp till den punkten.


När vi begränsar vad vi analyserar finns risk för nasty surprise

P.s.s. kan sådant när vi ej insett att det ska ses överraska oss. Det blev ju fallet ganska nyligen när revolutionen i Syrien bröt ut som tidigt inte alls fanns på min karta. Om något var det där bara lite mur framför Persien (iran men just sett lite flexiblare över gränserna följande kulturhistorien). Tid är klurigt precis som när vi är upptagna fokuserat själva på något. Vi märker inte tydligt att den behöver passera och kanske missar en buss.


Det störde mig oerhört mycket vid tillfället därför att det var en så fin kedja innan från Syd-Sudan och framåt. Libyen var ju också verkligen så lyckat: viktigt för både Arabvärlden och Västerlandet på väldigt många sätt. Det är konkret viktigt att Libyen lyckas bra i år. Att börja rätt är gör allt enklare därefter. Syrien riskerar att inte bli annat än det otäcka exemplet. Worst-case när diktaturens upplevda huvud i vansinne inte klarar att röra sig. En varning för andra diktaturer ej så förtappade att de hellre förstör hela sitt land för att hindra vad alla utom han själv vill kunna göra. Libyen är mycket mer om saker inte går sämre än nu: En viktig möstespunkt med Västerlandet. Ett ex. på att det går att ta ett förtryckt folk till ett stabilt land. I år är Libyen viktigt.


"Hx(y) can be thought of as the additional information we can expect from each new word in the sequence. Thus Hx(y) is closely related to the rate at which informationen is generated by the source: it measures the average number of bits per unit (per word)".

George A. Miller

Relevans - om vi alls ska förenkla ett begrepp som också måste inkludera vår förmåga att ställa intressanta frågor d.v.s. en kreativ-process där vi ser möjlighet i data att söka djupare utan behov av detektions-baserade regler - behöver därför om det ska vara mer än analys av indata vara vad man kan verifiera ur quality assurance mening på andra sätt än att endast jämföra det med listor av givet korrekta nyckelfakta. Sådana har vi ju redan, och oavsett hur intressant att ta ut bredare, behöver vi för det implicita mäta relevans genom datats förmåga att prediktera världen i konkret mening.


I prediktion är det som för mig verkligen ett privilegium att prestigelöst av och till våg referera det här samtidigt som jag vankligen sedan 2010 påminner om utmaningen synknronisering innebär. Konkret just nu är det "ett antal" månader sedan jag tappat asiatiska publikationer i någon bredd annat än vad jag själv noterat. En känsla jag har sedan någon månad är dock att jag kanske snarast bedömer tiden som för långsam. Jag upplever det inte som fel att mena att det är en karaktärs-defekt hos mig att jag inte vettigt sett till att jag har bandbredd och några till datorer men det är lätt för mig upplever jag att komma i ineffektivt arbete när jag splittrar upp oavsett hur egentligen trivialt det är att lösa för att sampla parallellt.



Relaterat



En till populärvetenskaplig ej länkad i brödtexteb och mer praktiskt användbar guide utan krav på förkunskaper är CIA:s genomarbetade översikt om hur attityder, bias, faktorer relaterat perception, information m.m. påverkar bedömningar vi gör.



Läsvärd är inte minst Chapter 13 Hindsight Biases in Evaluation of Intelligence Reporting och det är värt också att tänka till om hur detta bias tenderar att påverka bedömningar som görs i populationer och när det får betydelse. Kognitiva bias har den styra att vi kan kvantisera dem för populationer d.v.s. uttrycka hur närmare med vilken sannolikhet populationen är till ett beslut (vilken hastighet de fattar beslutet med). Vill man experimentera lite men inte är över-ambitiös i vilket fall man kan göra väldigt spännande saker räcker det bra att när någonr eagerar på en news event berättar du steg för steg att de redan insett det långt tidigare. Inte allt på en gång. Utan bit för bit med små-steg där de första stämmer näras nog helt med verkligheten. Därefter är ni tillsammans på markov-vandring där det bara handlar om att ingenting ska signalera nytt, fara, oväntat, unknown o.s.v. för då söks nu referenspunkt. När det vandrats ett tag har stabila minnen skapats ganska så. Ta också chansen att addera lite vetskap att de är skickliga på ett område de kan men kanske inte direkt överpresterat i tidigare. Korrekt och utan problematik för experimentet ber du om tillstånd en månad i förväg men utan detaljer relaterat metodik. Utanför det är det möjligen rent av olagligt.

Because: Underskattat ord

2013-02-14

Jag har varit oförmögen att hitta någon som riktigt prioriterat because den uppmärksamhet ordet mycket möjligt förtjänar. Speech and Language Processing ger oss det mest grundläggande:


"For extracting coherence relations, we rely on cue phrases called connectives, which are often conjunctions or adverbs, and which give us a cue to the coherence relations that hold between segments. For example, the connective because strongly suggests the EXPLANATION relation in [...]."


Speech and Language Processing: An Introduction to Natural Language Processing, Computational Linguistics, and Speech Recognition
S. 727.


Prentice Hall Series in Artificial Intelligence
Pearson international edition
Authors Dan Jurafsky, James H. Martin
Edition 2, illustrated
Publisher Prentice Hall, 2008
ISBN 0135041961, 9780135041963
Length 1024 pages


Men visar som vi kommer till en begränsning i Hobbs coherence relations för EXPLANATION.


Statistical language processing är ju väl inarbetat med olika varianter av markov-modeller, maximum / minimal entropy / informatin modeller, bayesian decision networks m.m. Det samma gäller neuroscience bl.a. för att tolka och förstå avbildningar av avbildningarna. Samtidigt tror jag inte någon modell försökt att mer allmängiltigt ta konsekvensen av markov-antagandena från perspektiv av den som uttalar information d.v.s. här använder ordet because.


Vi noterar först att strukturen grovt-förenklat ungefär följer:


    [Beskrivning / fakta / påstående] because [Påstående som kan inkludera det mesta]

Vad vi söker avbilda med markov-modellerna följer väl arbetsminne också rörande kända beskrivningar. Känt är ju också att kontext just nu, humör, tidigare nära-liggande men utanför egentligt kontext m.m. inverkar på hur vi förklarar saker och ting också när det är helt irrelevant.


Det känns därför som en vettig hypotes att det sätt vi hellre bör betrakta because om vi ska använda informationen det ger till att:


  • Skatta ett tillstånd hos den som uttalar.
  • Ex. givet känd kontext och skattning av nuvarande markov-tillstånd.
  • Försöka skatta fram (tillsammans med givetvis mycket liknande information) preferenser bakomliggande rörande värderingar m.m.

Vara vad som indikerar information som följer markov-antagandet p.s.s. allt annat. D.v.s. förklaringen som ges byggs med stark preferens på det aktiverade tillståndet givet kontext medan kunskap, idéer, attityder m.m. närmare vad vi kan kalla långtidsminne påverkar i den det är relevant aktiverat.


Jämför gärna med hindsight bias som jag tror följer nära nog samma mekanism (i den mening att bedömer att samma algoritmer och metodik används där för att söka likartade skattningar). Aktuellt vid hindsight bias är informationen just då starkt aktuellt, och för att praktiskt försöka undvika dess effekt måste vi gå bakåt i våra anteckningar och aktivera upp efter bästa förmåga minnen och förutsättningar (en anledning till att jag försökt bibehålla också emotionella loggar med musik på Hans Husman om Prylar).


Se gärna också Sampling bias i Scholarpedia. Sampling bias beskriver givetvis också detta. D.v.s. att förklara världen från det data vi ser just nu men där detta data inte är riktigt lämpat för det. En förklaring är att vi låtit vårt tillstånd och våra egna idéer påverka hur data samlats in. Vi passerar då från ett markov-tillstånd med detta bias till ett tillstånd där vi bedömer det. Eftersom vi "lider" av markov-antagandets värld styrt av vad vi står med föregående tillstånd som indata är förklaring because ger vad som bekräftar vårt bias snarare än att säga sampling bias.


"Sampling bias means that the samples of a stochastic variable that are collected to determine its distribution are selected incorrectly and do not represent the true distribution because of non-random reasons. Let us consider a specific example: we might want to predict the outcome of a presidential election by means of an opinion poll. Asking 1000 voters about their voting intentions can give a pretty accurate prediction of the likely winner, but only if our sample of 1000 voters is 'representative' of the electorate as a whole (i.e. unbiased). If we only poll the opinion of, 1000 white middle class college students, then the views of many important parts of the electorate as a whole (ethnic minorities, elderly people, blue-collar workers) are likely to be underrepresented in the sample, and our ability to predict the outcome of the election from that sample is reduced."

Givetvis är det i praktiska värdet because kan ge inte förklaringen i sig utan vilket markov-tillstånd givet den nod vi står på som förklaringen indikerar också finns, och de associationer mellan dem och föregående tillstånd, och kontext. Vad som ges via because är vad personen med aktivt hindsight bias själv skattar kan vara ett tillstånd innan som givit vad som sägs innan because.


Förutom konkret-analys-värde i den mån de intresserar är det också ett fint test av de vanligaste algoritm-grupperna i dom här sammanhangen. Och det är väl kanske så att en lösning av ex. Kullbacks divergence, bayes-sats (lättsamt utan just någon matematik annat än lite för syns skull: Statistiska språkmodeller
med klass | Uppsala Universitet
) i någon variant, distribuerad similarity m.m. inte räcker riktigt till (jag kombinerar flera av varianter av de två sista med ytterligare en form av algoritm men har inte trots många försök av och till sett att Kullbacks divergence någonsin presterar bättre än varianter av bayes sats om än inte mycket sämre heller: kanske är dennes preferens mot chi-2-fördelningar för H(x) termen inte helt optimalt som approximation av språket i dom här sammanhangen).


Emellertid har jag inte tillämpat indikerade lösnings-modellen nämnd på specifikt because vilket var orsaken till att jag sökte efter vad som redan kunde ha varit dokumenterat. Det är ju praktiskt en fråga om because med dess tillstånd ska hanteras särskilt ner till Drifting thoughts och Dreamer eller om det kanske inte tillför större värde än att det ändå blir inkluderat utan särskild behandling.

Sunt förnuft i common sense: Problem 2

2012-11-09

I Att förstå mening: Mitt sunda förnuft dominerar helt övrigas känslor indikerades en mycket vanlig praktiskt begränsande egenskap relaterat både data och algoritmer i alla vanliga publicerade common sense system. Den lika vanliga begränsningen vi diskuterar här är mer fascinerande och är inte vad jag själv fullt klarat att lösa på den tid jag varit beredd att investera i det.


Ett exempel på common sense är förståelse av att en hund är ett djur. Att en hund är ett djur hör dock till praktiskt trivial common sense för människor. Det hör till en faktor så enkelt grundläggande så mycket i vår vardag att det knappast inverkar på något beslut tidskostnad investeras i.


Denna egenskap hos människa motsvarar i algoritmer kanske tydligast gruppen inverse document frequence där principen är att vanliga egenskaper är mindre betydelsefulla för att diskriminera mellan två subjekt med aktuella mängd egenskaper. Eftersom djur är en egenskap hos båda subjekten nästan 100% alla fall när den ena är ett djur (ej inkluderande bildanalys ex. relaterat nyhetsanalys m.fl. system där dock indikerade IDS-algoritmer och ej heller common sense i denna mening är aktuellt) saknar det värde.


Ingenting hittills är ett problem med common sense eller i sig en teoretisk eller praktisk utmaning. Tvärtom är båda att förstå att hundar är djur och att reducera det som diskriminerande egenskap exempel på två grupper av för de flesta mycket välfungerande lösningar i common sense.


Emellertid betrakta nu hur vi arbetar med enheter och särskilt SI-enheter inom fysik och annan naturvetenskap. Är meter, sekunder m.fl. grundläggande enheter vi bygger upp mer komplexa enheter av mindre diskriminerande? Nej de är bättre diskriminerande därför att de möjliggör förståelse av hur olika "mättyper" och "mått" förhåller sig till varandra.


Varför har vi inte riktigt samma situation för common sense exemplen innan? En orsak är att vad vi indikerar med symboler som hund och djur bär mening och betydelse som påverkas av andra symboler i deras närhet. Vidare bär de information som ej bara påverkar deras egen betydelse utan också både påverkar tolkningen av föregående och efterföljande symboler.


Vidare är de varken helt enheten och heller inte helt mätvärdet. D.v.s. varken hund eller djur är en enhet motsvarande meter och sekunder, och det är heller inte ett mätvärde där en gemensam enhet har etablerats.


Även om en hel del numeriska värden med enheter (eller enhetslösa med gemensam magnitud och jämförbarhet) finns etablerade och är vanligt använda (inkl. t.ex. information, entropi m.m.) är de varken vad som ersätter common sense i betydelsen att vi förstår att en relation mellan hund och djur finns, eller direkt ersätter IDF (därmed inte sagt att man inte kan förklara och demonstrera varför IDF är en fungerande egenskap från informationsteorin).


Riktigt vad det gemensamma mätvärdet är mellan djur och växter är heller inte självklart. En biolog skulle kanske peka på cell-typen vilken skiljer sig mellan djur och växter. Dels skiljer den sig i övergripande struktur visuellt enkelt att se i ett också mycket billigt mikroskåp. Dessutom övergripande cellen och allt annat finns en enorm skillnad i information som är flera billioner gånger större än mellan två växter resp. mellan två djur.


Från vår fiktiva biologs svar inser vi en möjlig förklaring av det hela. Från tolkningen av vad vi ser och hör i praktiska egenskaper från upplevelsen i vår omvärld och dess förändring lär vi oss identifiera olika enheter diskriminerande, och via reinforced learning från kollektivt språk sätter vi sedan beteckningar på dess.


Den gemensamma enheten motsvarande meter finns därför inte relaterat diskriminerbarhet. Istället ligger den gemensamma enhet motsvarande och som vi kan vara intresserade att hitta indikerande det praktiska värdet av att kunna diskriminera d.v.s. hur objekten påverkar förutsättningar för händelser och inverkar på varandra.


Det bäst dokumenterande och använda systemet för det har ingenting med informationsteori, common sense, textanalys eller bildanalys utan är just fysikens lagar och enheter. Dessa i common sense är ungefär motsvarande människor enklare grundläggande förståelse av sådant. Vad är större? Vad är längre? Vad är bredare? Vad är tyngre att lyfta? Vad sitter hårdare fast?


Vidare i inlärning relaterat till mest grundläggande den investering i fysisk energi vi är beredda eller kan göra vad ansträngningen att ex. bygga skydd mot väder eller vind eller skapa en enorm staty som stärker en evåldshärskare resp. ett helt folks värdering av dom själva motsvarar i upplevd belöning d.v.s. den faktor som påverkar och styr reinforced learning.


Hur vi betecknar i kollektivt språk för vad vi kan diskriminera är också just vad vi lär via reinforced learning. Kompabilitet i resonerande system handlar dels om värderingen i reinforced learning för symbolen relativt individen och flocken och avviker någon för mycket från normala avvägningar upplever vi direkt underligt och ofta blir konsekvensen av att gemensamma resoneringssystem ej är fungerande för dessa personer att de i bästa fall skapar visst kaos och i värsta fall orsakar våldsbrott eller mord när vi tänker oss mest tydligast för sociopatiska personlighetsdrag. I den fysiska sidan samspelande med reward handlar det om mätetal existerar och kan jämföras med varandra. Vi är dock alla beredda att acceptera reinforced som vägandes tyngre än de senare där egentligen mest just fysiker och liknande där flockstatus är kraftigt relaterat till att försvara det senare mer objektivt värde i upplevd moral eller konkreta pengar värderas. Gynnar det vår överlevnad att offra till Apollon istället för att hylla det moderna vetenskapliga paradigmet mår vi inte sämre av det även om det kanske långsiktigt missgynnar våra förutsättningar för tillgång läkemedel, en energi, tillgång föda och rent vatten. Att se och förstå det rationella och objektivt korrektare värdet av det vetenskapliga paradigmet fodras praktiskt styrande just att man som samhälle etablerar viss tro och kollektivt språk där det uttrycks och upprepas.


Grundskolans huvudsakliga värde, och den viktiga poängen med att separera religiösa trosföreställningar från skolan ligger just i att etablera detta. Att för mig ärligast säga att detta just handlar om motsvarande den indoktrinering kyrkan förr gjorde upplever jag inte problematiskt, även om jag kanske skulle undvika att göra det i sammanhang där fler läser mig.


Värdet i skolan av naturvetenskapen och matematik är dock inte för de flesta lever huvudsakligen relaterat att lära sig arbeta med grundläggande fysik utan att etablera det rationella paradigmet (och på ungefär motsvarande nivå och också före kunskapens värde i sig att stärka hjärnans förmåga att tänka och dra slutsatser genom att träna den vilket stärker prestationen i arbeta oavsett om endast begränsande delar av kunskapen används: träning av intelligens).


Den andra gruppen av värden grundskolan etablerar är just möjlighet att använda vårt kollektiva språk: läsa, skriva och förstå fler ord. D.v.s. mest centralt i språkundervisningen men också en del av matematik och naturvetenskap. I matematik kanske mest lika att lära sig ett andra språk medan komponenten i naturvetenskap har likhet med common sense - sunt förnuft - att begripa vad vanliga ord inom fysik ungefär betyder och etablera en reward association till dem (ex. fysik är tråkigt och ingenting jag vill jobba med eller jag gillar att känna mig torterad så jag tror jag ska bygga en stor matematisk modell att tortera mig med flera år för att bevisa något imaginärt för mig själv).


Men praktiskt hur löste jag denna common sense? Approximativt på tre nivåer av dimensioner. Den närmast hur vi tänker i fysisk mening söker ge en approximation av om dimensioner för två saker vi kan avse med en beteckning är jämförbara med varandra genom att ha deras enheter etablerade. Med enheter etablerade avser här vilka enheter som bygger upp enheten för ett möjligt mätvärde om de inkluderar en given begränsad mängd av de grundläggande i SI-systemet samt "antal" resp. att de ej betraktas rörande deras förhållande med varandra d.v.s. både längd och area representeras med meter och både hastighet och acceleration betecknas med meter per sekund. Motivationen för representationen är att vi i common sense dels modell-teoretiskt önskar hålla oss till de dimensioner modell indikerar att människan först tenderar (eller kanske alltid av biologiska orsaker) lär sig först samt relaterat statistiskt analys att vi önskar vad som för en normal människa inkluderar 99% av vad de situationer, händelser och objekt de möter i vardagen. De enheter inkluderade i HH-SI-units är därför endast åtta stycken.


System två inkluderar fler enheter och i princip alla vanligt använda inom fysiken. Det är därmed också mindre exakt i vad vi kan klara att resonera runt dem, och typiskt givet dataextraktionen från bl.a. Wikipedia kommer inkludera något fler fel. För hantering av fel har det enhetssystem för detta tagit från DBPedia kompletterats med en direkt extraktion jag gjorde själv från Wikipedias infoboxar för redundans.


På nivå tre arbetar vi också med sekundära enheter relaterat hur vi arbetar med nivå ett och nivå tre enheter i information. D.v.s. att ett subjekt är naturligt relativt subjektets reward och subjektets natur att illustrera visuellt ger oss en enhet. Att något har städer betraktas också som en enhet. Detta system ligger parallellt och är i ursprungligt data separerat system för att etablera vad något är, uttrycka kategorier o.s.v. och bygger på samma data som nivå ett och nivå två för enheter d.v.s. till 70% Wikipedias infoboxar (inkl. DBPedia, Concept net m.m. som är byggt för allt data relaterat dimensioner på just Wikipedias infoboxarna och oavsett andra åtgärder i resp. projekt nära nog helt i värde resp. datafel ungefär motsvarande varandra - Yago relaterat har dock DBPedia väsentligt fler fel - men inte helt redundanta varande avseende i typer av fel man fått in i sitt data) och 30% ett antal andra datakällor.


Praktisk målsättning är att för en nyhetshändelse, en scen (ex. bild eller händelser på en tidslinje men om så ändå begränsat i tidsintervall motsvarande en situation fryst i en bild) eller jämförbart ska vi kunna från delarnas dimensioner förstå vad som kan ha inträffat och vad som kan tänkas inträffa. D.v.s. väsentligt utan orimliga eller övernaturliga slutsatser.


Att som vanligare i common sense nöja sig med named entities och typ-indikerande relationer är vad jag ser som mindre lämpligt som långsiktig målsättning. Ännu just nu gäller dock att systemet med enheter mindre oftare adderar värde som innebär en väsentlig skillnad från vad som hade uppnåtts utan det. Orsaken till det är dock att systemet bäst etableras stegvis från stora grupperingar och bredare regler med motsvarande "låg inverse document frequency" men med få fel över tiden till det mer exakta som värderas högre och där fel och problem med algoritmer resp. data upptäckts på vägen motsvarande uppskattar jag cirka tre månaders arbete totalt kanske planerat till med nuvarande prioritetshastighet på detta ändå mindre viktiga delsystem tre till fyra år.