Visar inlägg med etikett Business Intelligence. Visa alla inlägg
Visar inlägg med etikett Business Intelligence. Visa alla inlägg

Vektorer för n-gram, entiteter och fraser skapade ad-hoc från vektorer ord

2016-09-04

Tidigare publicerat:


kan upplevas skilja ut sig som lite högre värde att läsa än genomsnitt just för den aktuella frågan:



För översikt över området composition sista åren läser vi mest effektivt just Baroni. Frågan är emellertid om inte själva den tillämpningsdomän som ligger kanske närmast till uppenbar gör att man hamnar i fel utgångspunkt till problemet.


Istället för att fråga sig vilken till metod ej redan jämförbar som finns och hur man tränar eller i detalj annan väg skapar den praktisk kanske man kan se fler möjligheter genom att reflektera hur man kombinerar bäst för att optimera mängden information man arbetar upp från text samlat analyserat över tiden:


  • Propagerar och samlar upp värdet ex. frasen som sig bidrar med i form av information.
  • Propagerar värdet av vektor-representationen - kanske en av flera där man egentlig mening propagerar resp. av dessa också - och gärna när kombinerat föregående hjälper dem att uttrycka ut mer av sin information bättre. De tenderar för alla vanliga metoder ha mer värde än normalt praktiskt kommer ut. Om än kanske inte på nivå - eller ens i närheten med - själva bitlängden av av de 399 - 1299 32 eller tror jag säkert ofta 64-bitars flyttal har: 2^(1200 * 64) men för lite perspektiv på vad mer än själva positionen som ryms.

1. Utnyttjandet av endast ett ord ger oss om ingenting mer frekvensen som funktion av tiden och kontext. Praktiskt nog får jag säga att om vår vektor-representationen orden är skapad som typiskt LSA görs och vi i upparbetning skapar upp nya vektorer så att säga (jfr SOM) ger det indirekt högre prioritet på det språk som intresserar oss med mindre prioritet på udda ord vilka ofta tycks för mig både på egen och andras gjorda så här över-värderas. Ty själva tiden arbete på ordets representation oavsett att mer data tillförts ökar. Emedan vanliga men för oss intet-sägande ord tydliggörs allt mer som varande just detta.


2. För en noun-fras sig en entitet på ett eller flera ord även om vi ej antar hantering ordning (ex. som för ngram-modeller utifrån position eller kontext av föregående ord eller mer esoteriskt / nytt via någon av de metoder med utgångspunkt extrahering och komprimering / dim-red. till vektorer som finns) resp. ord givet omedelbart kontext av entitet som n-gram med övriga ord i denna.


3. För relationer mer i mer mening av ontologi / thesaurus eller i dokument från koncept ex. i titel undersida till upparbetat eller skapat kontext från huvudtitel + abstract + taggar (och / eller vanligare men upplever jag för välkända journaler adderande värde men ej lika bra som informationsbehandling titel och abstrakt - dock bättre numera för de flesta journaler avseende taggar) just relationen koncept-2 givet / inom / samtidigt koncept-1


4- Mer konkret relaterat Baroni's ett adjektiv verkande på ett noun kanske vi här frågar oss hur vi tar information effektivt från mest verkningsfulla adjektiv för att samla och bearbeta till vetskap om resp. adjektiv. Vilket kanske visar på andra möjligheter möjligen mer effektiva. Jag har här varit mindre engagerad givet att jag tidigt konstaterade att jag kan använda EMI som viktning av ord (där adjektiv tenderar att mindre ofta ha datakvalitet EMI sämre än en god bit ovanför genomsnittet alla ord, och får erkänna att jag i denna punkt snarare tar befintlig metod ej utnyttjande dessa vektor-representationer som exempel. Viktning emotionell intensitet eller jämförbart mått konceptuellt föga relaterat approximationen av position i det semantiskt illustrerande rummet är också relaterat diskussionen om olika typer av distanser i Ett alternativt förhållande relaterat distans mellan vektorer eller det multi-modala i bild tillsammans med ord (där jag nog tror att vi åren som kommer blir trygga i att vi alltid har en gemensam representation aktiverad där emellertid nivån av bidrag från kärna visuellt eller motsvarande som bara läsande ordet samtidigt kan variera från hur vi tar in konceptet: ex. bild eller ord, såväl som koncept - görande ex. inte bara en bild samtidigt relevant förstärkande utan även ett mer illustrativt visuellt text-språk förstärkande upplevelse såväl som att förståelse bild resp. ord kan störas av dålig information i resp.): Multimodal Distributional Semantics. För resp. ord gäller ju oavsett semantiska vektorer att arketypisk riktnings-mening denna verkar på styrande tolkning mening i övrigt finns: More indikerar mer av mer medan less ligger i motsatt riktning. Viss semantisk interferens är nu emellertid fallet för många adjektiv ej lika "rena" i hur de bidrar till mening som more och less: Kallande nu något känt rött eller något rött i en bild som green:ish kan inducera störande interferens eller alt. vara fullt naturligt om givet kontext över resp. är grön-politik: D.v.s. vi kan även här se en riktning som kan gå positivt eller negativt / Upp eller ner / Mer eller mindre.


Detta besvarar väl i och för sig inte hur man bäst kombinerar ord till ex. noun-fraser eller entiteter. Men jag upplevde att själva processen som sådan rangordnade flera metoder jag prövade.

En till kommentar allmänt för vad jag läst i domänen är att jag tror man ej fullt ser skillnaden i effektens utsträckning mellan de två enklaste operatorerna för kombination: Elementvis addition resp. multiplikation.


Resp. ensam (och oavsett vad som ofta sägs är de var för sig ensamma vad som kräver mer vid sidan om ex. kontext-beroende vikter, kombinationer av olika slag eller något, om ej prestera mycket sämre än vad som är möjligt med den information som konkret finns i vektorerna skapade med de vanligaste systemen: Många jämförelser är uppenbart defunct här) kan man först reflektera och pröva att generera sorterat de mest lika ordvektorerna till de kombinerande vektorerna.


Vilket ger mest relevant additionen möjlighet att grovt kvantifiera utan att behöva ge sig in i direkt ockult matematik varje hederlig kristen man ej ska behöva resp. som förstärks från uppenbar elementvis likhet ( två stora i genomsnitt / L2-normaliserat blir stort ) resp. "hastigheten" över kombinationer av att man smetar ut och medelvärdesbildar meningen till vad när det första ej bra räcker till gör det svårare att se skillnaden i mening.


Klustrar vi förövrigt resp. för entiteter flergram är jag inte främmande för att man tidigare och enklare upplever additionen mer naturlig. Men det tycks också som vi kan beroende på hur vi hanterar multiplikationens parametrar via ex. power kan få ut fler även om de gärna naturligt kommer tendera att bli de smalare eller något av det minsta gemensamma troligare (säg lite överdrivet för flera metoder att skapa vektorerna vi arbetar med: Men om vi säg har också feedback tillbaka från långt borta andra sidan via ex. folding där utsmetning redan sker kanske en bra sak???).


En fråga relaterat själva riktningen föreligger också betraktat elementvis. Egentligen borde jag kanske bäst avstå från resonemanget här. Mycket möjligt att jag tänker fel där flera andra saker inverkar när testar praktiskt. Men säg att vi nu har vektorerna ortogonala över resp. position vektorerna i mening av att man faktiskt effektivt där har en motsvarighet i reducerad korrelation mellan dem (konceptet att de är icke korrelerade stämmer emellertid inte i någon tillämpad mening på NLP: Tvärtom kvantiserbar redan flergram-s entiteter kanske ej orelaterat här). Men detta har nu skett givet antagande och operationer på indatat medan vad vi opererar på tenderar att skilja ut sig. PMI är ej en dålig operation skapande vektorer - eller för den delen andra definitioner av mutual information: Troligen är de alla ungefär det samma - eller för den delen mått som inverse document frequence som vikt skapande vektor-representationer av dokument-fragment (jfr discourse-förändring) upp till hela dokument eller större (jfr information retrieval). Enskilt element utan absolut-belopp mellan säg 0.2 och -0.1 en position får vi position riktning medan vi för multiplikationen hamnar negativt. Differensen till det 0 som när över alla jag ej tryggt ser om man borde praktiskt hantera som definierat konkret 0 eller se odefinierat är ej den samma:


1. Söker vi generera ut närmaste ord-vektorer snarare än vektorer av kombinationer jämförbara i typ (det senare är kritiskt just för multiplikation eftersom magnituden förändras radikalt för varje multiplikation redan elementvis medan det fungerar hyggligt för resp. jämförelser flergram till ord eller ord till flergram representationer: Skapar vi ex. upp representationer från flergram över något ämne får vi om t.ex. topologiskt sorterade SOM ett uttryck av ordets förekomst över de flergram som påverkat skapat av resp. dimensions typiskt närmaste koncept som godtyckliga entiteter och flergram: Jfr mutual i mutual information som påverkat en dimension uttryckande information science såväl som några runt ekonomi via sådant som mutual trust. Men som sagt ej riktigt bra) får vi ta ner magnituden till samma som för orden. Den metod uppenbar för mig för detta (osäker om best practise) är via kombination två ord kvadratroten eller egentligen en konstant a som är något mindre än 0.5 (försöks beräkning av default a för alla kombinationer utan hänsyn resp. ord gav 0.4: Från inlärning av hantering två-gram redan skapande vektorerna vs. skapade ord. Nivån torde motsvara förlusten information via operationerna i worst-case punkterna givet att jag ej vid träningen värderade orden från förekomst globalt corpus utan allt värderades lika). Sign lyfter vi ut så att säga: Sign * ( abs ( x(i) * y (i) )^a ).


2. P.s.s. sätt - eller lite jämförbart i koncept snarare - som att vi i en språkmodell kan skatta sannolikheten av ord A givet ord B med P(A) * P(B) (approximerar P ( A | B ) hanterande dem som oberoende d.v.s. lekande att allt verkligt i språket om sambanden mellan orden ej finns: Allt är en apa som pekar på banan och ev. samband mellan sådant är mätbart bara i så fall flera peka på banan efter varandra) gäller att representation A multiplicerat över vektorn med B vid generering närmast ord-vektorer (givet magnitud hanterat) approximerar de närmaste för två-grammet skapat direkt till vektor-representation (om också korrekt viktade via a eller något specifikt).


3. Medan additionen normaliserar approximerar den gemensamma mängden närmaste koncept genererade följande viktningen av resp. ord och resp. ords uttryck i varje dimension.


Är dimensionerna - positionerna resp. vektor för resp. ord - meningsfulla som för mig kan man också se en del skillnader genom att skära dimensioner / mening man ej är intresserad av. Är vi ej intresserade av mening relaterat länder vi opererar på som har att göra med personer, sociologi m.m. använder vi dem ej - och om vi är relativt mer intresserade av mening relaterat filmindustri resp. litteratur värderar vi upp dem. En ökad förlust i diskriminerbarhet för just särskilt fågram eller ord, och helst då mycket allmänna koncept så som ord med många meningar eller samband blir fallet växande snabbare tycks för mig (men ej noggrant kontrollerat) vid multiplikationen medan vi för additionen kan särskilt när båda är hyggligt breda starta lite grovare men ibland vinna utan särskilt utvalt för orden när vi smalnar av saker. Detta kan dock varierar ordentligt och är också svårt att se eftersom vi redan i ett fåtal dimensioner har ordentligt med information.


Accepterar vi konceptet av representation av koncept från koncept de är relaterade via - ofta i dessa sammanhang från orden i deras närhet corps - kan vi för resp. genererade närmaste förekommande till orden såväl begränsa värden genom att för topp N tro att de gemensamma eller snarare om ej N är litet värderade i kombinationen (rank eller likhet kanske) se dessa som beskrivande det gemensamma konceptet. Vilket absolut inte är dåligt på något sätt. Eller ta konsekvensen av att vi redan där är i en dyr metod vi normalt ej vill göra utan gör något särskilt viktigt och generera resp. ord från genereringen och utifrån lämplig värdering från resp. A och B först till resp. först genererade ord vidare till de från dessa genererade orden värdera de sista. P ( ord typ sist genererat | ord som genererade tillsammans med något kontext kanske bara alla ord eller något som kom med A och B).


Gör vi nu detta för en kombination likt A och B högst verklig och gärna mer än ett tre-gram (ty när orden är fyra eller fler i specialistområden är de väldigt talande med få "noise-problem"). Och är trygg i hur vi exakt gör en generering som ovan. Är det en till väg att resonera och jämföra kombinerande operationer för composition. Genererar de bättre eller sämre från kombinationen? Praktiskt är det kanske enklare när man fortfarande väljer operation om man kan utnyttja vektorerna för orden (men jag tror att det kanske begränsar lite men det är möjligt att sätt att kombinera jag ej fick över enkelt så kanske lätt hittas av någon annan: Jag hade mindre av vetskap algebra återupplivad här och såg därför kritiskt värde av att kunna göra praktiska kontroller verifierande att jag begrep koncepten tillräckligt rätt):


Jag har här ska sägas noterat att för konceptet första lagret jämförbara om än ej exakt det samma (snarare klassificering) sett att man sätter andra kombinerande metoder klassificering som övre gräns men verkligen att man där resonerar felaktigt i beviset för det (genom att tänka sig om jag minns rätt nu att vi ska ta de närmaste grannarna från en fixt-punkt d.v.s. accepterande hela problemet med centroider som gör dem så begränsade medan vi snarare här tar det antal punkter som beskriver flexibelt och när att välja mellan finns godtyckligt beskrivande vad som perfekt särskiljer ex. två ytor: Precisionen hårdvaran resp. antal koncept i rymden begränsar och inget i övrigt givet oändlig beräkningstid per fysisk tid).


Vidare rörande viktning ord i koncept kan sägas att vi givetvis kan göra något motsvarande IDF men användande koncepten om en stor mängd är kända istället för dokumenten. Emellertid räcker sambanden från NGRAM-modeller i språkmodeller parsning eller ljud till text m.m. utmärkt med eller utan sådana metoder (lite vilket som beroende på hur man vill göra det). Oavsett med eller utan gäller att samlar vi upp information från förekomsterna löpande eller för träning får vi för ev. representation som fritt får påverkas av ord, två-gram o.s.v. så länge meningsfulla koncept, entiteter, fraser eller motsvarande ett naturligt mått av hur semantiskt ordet eller flergrammet är i mening av resulterande "rymd": Denna tenderar att praktiskt ha stora likheter med IDF i magnituden / vektorlängden / amplituden på vågen eller hur vi gör / ser på det avseende likheten mellan vektorn vi börjar med och representationen vi slutar med eller har upparbetat vid punkten. Flergram tenderar under förutsättning någon addition sker med eller utan multiplikation (just nu men kan komma att ändra det kombinerar jag med båda men multiplicerar aldrig fler än två ord i resp. som istället efter övriga operationer mellan summeras). MI-liknande relationer av typen värdera förekomsten av konceptet (d.v.s. det enskilda ordet förekommande just i konceptet ex. mutual i mutual information och / eller mer påkostat läggande något mer till förutom orden som ett övergripande kontext eller för sense) d.v.w. någon variant typiskt av P (konceptet) / P(ordet) fungerar också väl särskilt för ord med operator-liknande funktion som in, of m.m. (medan konceptet av stopp-listning känns oerhört slösaktigt med den information som faktiskt finns i resp. ordvektor skapad med typiska metoder oavsett hur svår den är att få fram bra utan att tappa beräkningseffektiviteten dimensionsreduktionen gav) - för längre koncept kanske snarast först per resp. mest arketypiskt förekommande koncept d.v.s. för mig mest aktuellt för Wikipedia-kategorier (jfr People from Sweden working [...] in movie industry borned 1987 för att hitta på en illustrerande principen).


Att se IDF som en vikt indikerande hur semantiskt tydligt ett ord är i en värld motsvarande att vi för mängden koncept aktuella totalt tränar upp en representation där alla koncept är lika sannolika stämmer praktiskt väl med vad det senare ger i amplitud.


Slutligen rörande såväl upparbetning information som potentiella problem compositioner gäller att vektor-representationer skapade såväl via algoritmer i domän neuronnät som LSA m.fl. (alla vanliga) tenderar att ha säkerhetsdefekter skapade från defekter i hantering corpus:



Smoothing som del av algoritmerna tycks lura sig för samtliga när mindre information finns för något men där informationen som finns är mycket bearbetbar i effekt den omedelbart ger (eller hur man ska uttrycka det utan att behöva sitta med resp. algoritm här och följa exempel på effekt vilket jag ej gjort för mer än en av det oavsett konstaterat det för färdiga representationer som Word2Vec, Stanfords-algoritm, ett par ev. tre varianter bag-of-word, LSA m.fl.). Upparbetning från tar dock väldigt snabbt potentiellt bort problematiken: Jag kan fortfarande se problem-koncepten komma upp som liggande högst på vissa indikations-värden så som (om jag nu minns rätt på vilken mest så) summan av sitt resp. per dimension bidrag till variansen ( (x(i) - medelvärdet av x )**2 / ( summan av det samma för alla x ) ) före (ej kontrollerat efteråt än för någon men konstaterat ej visande jämförbart som vektor-indata vid generering närmaste grannar kommande för högt) innan medelvärde subtraherats följt av division av varians resp. dim (där resp. är redan innan mycket jämförbar med varandra magnitud) och slutligen softmax där softmax gjordes just relaterat detta som extra säkerhetsåtgärd mot udda svamp-arter knappt förekommande text förutom enstaka Wikipedia-listningar, samt vissa gambling-koncept (och jag kan tillräckligt från SEO-domänen ej bara från dataanalysen för att kunna känna lite men utan att klara sätta fingret riktigt på vad jag ser det från vem vi har i ett par av dem för en LSA-representation).


Utan detta eller något annat kan dessa koncept när man har vetskap om dem existerande och systematiskt sökt var de visar sig irrationellt starka defekt användas mycket praktiskt förstörande data. D.v.s. vid säg dataanalys ej med en existerande angripare eller om man är en sökmotor användande resp. LSA och Word2Vec samt ontologiska relationer mellan koncept (lite som Wordnet) ge defekta sökresultat kommande högt utan att ha ex. gambling-koncept (dock ej av mig konstaterat testande här då jag var mer intresserad av att hantera problemen med Wikipedia koncept då det är en så stark datakälla för all överskådlig framtid) utan att ha något sådant koncept alls. Det senare kanske kan utlösa kontroll i sig eller tas automatiskt men det omvända gäller självklart också. Mest typiskt för SEO-skapade satellit-länk-sajter relaterade hasardspel är att de innehåller just ord som casio, gambling eller liknande: Att betvivla någon manuellt oavsett effekt donerande vidare att de någonsin blir manuellt kontrollerade utan det.


Också konstaterat vektor-representation skapat för först länkad artikel (vilken jag tror för de flesta är ett något lite - alla är egentligen på det stora hela samma om seriöst gjorda - oavsett av vem eller metod: Skillnaden upplever jag i den praktiska användningen är mindre än ibland indikerat i studier - Det är som inte värde på den nivån som betyder så mycket jämfört med algoritmerna där det används om ej kanske något helt trivialt som en enkel information retrieval algoritm eller liknande med rena standardlösningar utan behov ambition över det: Och kanske ofta inte ens där så det ex. klarar som värde översätta skillnad sökresultat någon märker kvalitetsskillnad av). Word2vec tror jag också ej är den bästa spontant att välja. Stanfords Glove minns jag att jag prövade och upplevde bra default (även om jag ej använde den länge alls så hade jag kanske gjort det om ej hårddisk-systemet där jag hade den avmonterades av mig och ej var aktuellt bara för den att ta upp igen). Vilka ord inkluderade om behov i specialistområde eller språk finns är av betydelse. Gällande Stanford tycker jag att de kan rekommenderas också därför att jag över åren sett att de seriöst långsiktigt hanterat sina lite tyngre programvaror eller data-koncept delade:



Jag bedömer förövrigt att 300 dimensioner ger en ganska stabil resistens mot problematiken säkerhetsdefekterna jfr säg 400, 500 eller stör.

Sökteori vid katastrofer resp. spekulativa "partikel-magnetiserade" orsaker saknat flygplan

2014-12-29

Det kanske kan upplevas - låta som det tycks - att jag kan något om flygplan och flygplansteknik. Men trots en försvarlig mängd VEHICLE-sorter i kategorisystem är ej så fallet. Samtidigt kanske finns en förklaring någonstans här. I så fall bra att veta om inte av andra orsaker när man väljer system att resa via (typ och tid).


Jag tog med diverse i kontext runt om spekulationen. Rörande stycket innan diskuterande associativ-intelligens är en enklare funktionalitet vettig grundsystem till sådant som här indikerat underliggande jag flygtekniks-historik-spekulerar för området inte är händelse-och-teknik-större än att det är tämligen smidigt att tillämpa (ej särskilt "big-data-plågsamt" samt välstrandardiseande och kända datakällor rörande teknik och händelser). För den intresserade kanske Bayesian search theory (Wikipedia) är en start att börja söka vidare från. Poängen vid katastrofer är att när vi adderar kostnad sökning som funktion av tid och resurser och låter det möta tekniker, områdestyper, händelse-indikationer m.m. vi har historik för hur det inverkar på sannolikheten att hitta något kan områden som mest optimalt går oerhört snabbt att söka för låg kostnad med god sannolikhet prioriteras. Det är inte alls ofta så att god erfarenhet hos en människa för komplexa områden klarar att ta ut dem. Tvärtom är det välkänt att felprioriteringar när post-briefing sker är mycket vanliga. Koncept som nedan försöker mer överliggande ta ut samband och relationer man i ex. med bayesian search theory kan köra ner igen till den motorn när statistik hämtats upp fördjupat om dem.


Spekulation orsak markerad kursiv och fet. Ev. minns jag fel kring vindsystemen och årstid.


"Jag lät de associativa intelligenserna flytta över från MAINE-OS dir. Givet att den snart ska gå i interaktion med övrigt kring meaning, sem-parsing o.s.v.
samtidigt som det tycks att det vettiga är att all "utmanande / komplex kod" i FAST går över till PACKS & compisar nere PÅ DATAPART får associative brain
bo där ett tag så blir det enklare när man är van att ha allt integrerande i D3.

Det blir väl ev. någon gång ett steg att lyfta ut den packeterade logik koden från DATAPART - verb logics o.s.v. - medan dataapierna med datastrukturer
kvarstår.

Intelligenserna minns jag trots - en ej helt sund överdriven nivå kvalitetskrav på mig själv - lätt imponerande kvalitet på resp. Samtidigt olika i vägar ej
helt enkelt att varken förstå eller inte förstå, och svåra att enkelt ta till en. Den ena är autistiskt kunskapsdriven och tycker klassificering, ontoligier,
taxonomier är väldigt talande. Den andra är så mycket mer statistikt.

Jag censurerar ner i font-storlek något halv-privat-minne om forna upplevda acceptabla prestationer som säkert inte tillför värde för läsaren. Och rent av kan störa fortsatt läsar-värde genom att få mig att mer permanent verka oblygsam. Samtidigt är ju det publicerat och det kan ju också förvirra läsaren om ett känt moraliskt föredöme och etniskt-engagerad världsmedborgare börjar efter-editera sådant här:

Inga av dem har ännu någonsin gått över Corpis World Domination - eller va fan man ska kalla det störstas corpus jag någon sett refereat förutom det som
några universitet gör med vilken hemsida som helst deras spindlar går in i - men här så klart high value data: search results, abstracts science, bibliotekssystem,
baksidor böcker o.s.v. Det strategy-val jag i något fall störts lite på i byggda statistiken bör ej vara ett problem för dem ty att göra ngram rec. vid
generering på detta sett har jag gjort sedan evighet och jag tror ej att jag introducerade "korrigerande" counts mot "överförekomst relationer". Men ev. kanske
något man kan pröva ge fix där. Eller allt utnyttja IDF i ett test tillsammans med det som rimligen också ungefär gör kompensation på samma sak (om nu min
övertygelse förbannat stark periodvis att det är så här vi gör ngram recognition - tagande ut rubbet möjligt och konvergerande samtidigt - är väl kanske det
i så fall också en indikation till varför IDF är så förbannat starkt på human corpus förklarande mer än den statistiska förklaringen som inte är mer talande så
än 100 - 500 andra för diverse skattningar).


Ev. kunde det vara kul om det fortfarande är aktuellt då att låta den leta efter det försvunna flygplanet. Jag tror fallet är väldigt olämpligt så. Men det kunde
vara intressant att se vad den indikerar för topics ej diskuterade. Den är mänsklig kreativ men när vi definierar input-mängd vad vi motsvarande läser och därmed
sätter det som ej inkluderat ger den slutsatser eller topic-indications som ofta dröjer ett tag för oss.

Nu har jag i och försig en tanke om vad som orsakade både denna och förra krashen även om lätt riskabelt har jag varken följt den ena eller andra annat än tidigt
den första (d.v.s. om trovärdigt terrorism visst). Lite äldre flygplan. Vind-motorer som går vanligen vid denna tid på året över östra europa. Skapande vindmoln
ner över bl.a. "GOBI - SAVANNER" m.m. Och så "tsunami-motorerna" eller vad de kallas korrekt som feeds av det. Damm och elektronik. Damm och motorer. Damm och
HIGH-HEAT. high-heat OCH JORD - HIGH HEAT OCH MINERAL-FÖRENINGAR I JORD. Kanske störande motorer såväl som magnetisierande i sådana processer????

Det blir väl ev. någon gång ett steg att lyfta ut den packeterade logik koden från DATAPART - verb logics o.s.v. - medan dataapierna med datastrukturer
kvarstår.

Intelligenserna minns jag trots - en ej helt sund överdriven nivå kvalitetskrav på mig själv - lätt imponerande kvalitet på resp. Samtidigt olika i vägar ej
helt enkelt att varken förstå eller inte förstå, och svåra att enkelt ta till en. Den ena är autistiskt kunskapsdriven och tycker klassificering, ontoligier,
taxonomier är väldigt talande. Den andra är så mycket mer statistikt.

Inga av dem har ännu någonsin gått över Corpis World Domination - eller va fan man ska kalla det störstas corpus jag någon sett refereat förutom det som
några universitet gör med vilken hemsida som helst deras spindlar går in i - men här så klart high value data: search results, abstracts science, bibliotekssystem,
baksidor böcker o.s.v. Det strategy-val jag i något fall störts lite på i byggda statistiken bör ej vara ett problem för dem ty att göra ngram rec. vid
generering på detta sett har jag gjort sedan evighet och jag tror ej att jag introducerade "korrigerande" counts mot "överförekomst relationer". Men ev. kanske
något man kan pröva ge fix där. Eller allt utnyttja IDF i ett test tillsammans med det som rimligen också ungefär gör kompensation på samma sak (om nu min
övertygelse förbannat stark periodvis att det är så här vi gör ngram recognition - tagande ut rubbet möjligt och konvergerande samtidigt - är väl kanske det
i så fall också en indikation till varför IDF är så förbannat starkt på human corpus förklarande mer än den statistiska förklaringen som inte är mer talande så
än 100 - 500 andra för diverse skattningar).

Ev. kunde det vara kul om det fortfarande är aktuellt då att låta den leta efter det försvunna flygplanet. Jag tror fallet är väldigt olämpligt så. Men det kunde
vara intressant att se vad den indikerar för topics ej diskuterade. Den är mänsklig kreativ men när vi definierar input-mängd vad vi motsvarande läser och därmed
sätter det som ej inkluderat ger den slutsatser eller topic-indications som ofta dröjer ett tag för oss.

Nu har jag i och försig en tanke om vad som orsakade både denna och förra krashen även om lätt riskabelt har jag varken följt den ena eller andra annat än tidigt
den första (d.v.s. om trovärdigt terrorism visst). Lite äldre flygplan. Vind-motorer som går vanligen vid denna tid på året över östra europa. Skapande vindmoln
ner över bl.a. "GOBI - SAVANNER" m.m. Och så "tsunami-motorerna" eller vad de kallas korrekt som feeds av det. Damm och elektronik. Damm och motorer. Damm och
HIGH-HEAT. high-heat OCH JORD - HIGH HEAT OCH MINERAL-FÖRENINGAR I JORD. Kanske störande motorer såväl som magnetisierande i sådana processer????"

Statistisk analys av PDF-dokument: Omvandling till text och extraktion metadata från fil resp. databaser

2013-12-09

Tidigare exempel extraktion metadata resp. diskussion möjligheter analys kompletteras här med en första version av ett enkelt liten program (själva basfunktionerna var för sig tog cirka fyra timmar att skriva men mer samlat till praktiskt funktionellt kontinuerligt nedladdande och analyserande) för analys pdf-dokument, omvandling till text, och sammanförande med meta-data i separerade databaser (ex. OID).


Tidigare i ämnet:



Exempel: WWW

Referenser till webb-sidor är säkert ett mer naturligt hemvant exempel på "anslutningar" från dokumentet till aktörer, personer, information m.m. som betraktat över många fler kan säga något mer allmänt om organisationen. Nedan från ADA554030 några st. identifierade:


__FUNCTION_WORKING PDF_TO_TEXT_LOGIC
__PDF_FILE_NAME ADA554030.pdf
__IN_DIR_GIVEN C:\PTOOLS\SAMPLER\DTIC\PDF\
__PAGES 156
__WWW_CONNECTIONS www.china.org.cn/english/features/dengxiaoping/103389.htm GlobalSecurity.org mearsheimer.uchicago.edu/pdfs/A0034b.pdf www www.cfr.org www.stanleyfoundation.org
__EASY_JOURNAL_CONNECTIONS_EX_DOI 

I kontext av Google och ranking är egentligen prioritering och utnyttjande av länkar ganska annorlunda (som man oftare ser på deras algoritmer externt även om jag är tämligen säker på att association nära denna mening också är en av många möjligheter kring länkar som utnyttjas förutom koncept-beskrivning ankartext, prioritering spindling, page ranking, implicit association mellan koncept på resp. sida om länken såväl som kanske statistisk-modeller med något av flera alternativ liknande Bayesian yin yang för ett implicit samspel effektivt skattat och förr ev. en del nu övergivet för annat som förståelse av association mellan felskrivningar, begrepp för samma sak inom olika expertområden o.s.v. och vad de avser resp. relevans-kontroll om Google någonsin haft det senare tydligt tidigare än sista åren där jag tror feedback från hur själva sökresultaten fungerar med användaren används idag resp. för expertområden via riktade datakällor - datat i Google Scholar lär väl vara vad som ger många möjligheter med endast lite metadata om journalernas inriktning och författarnas association över tiden till mer övergripande områden).


Vad vi är huvudsaklingen är intresserade av här är ju mindre att säga något om indikerade dokument så mycket som prfererenser och association mellan entiteter och deras delar. Mer Google-liknande-analys är nog mindre vad man kanske valt för denna form av pdf-dokument varande relativt intet-sägande om vi vill analysera mycket snabbt (få, sällan ankartext, ofta presenterade i ex. fotnoter längst ner på sidan medan både den presentationen och fotnoterna är vådligt felområde via omvandling till text - åtminstone för mig även om jag sett att bättre teknik används av en hel del nu bl.a. Google och möjligen vad som bl.a. utvecklades av NSA och tillgängligt enligt Classification of Machine-Printed and Handwritten Text for Document Images såväl gissar jag teknik ganska väsentligt för stora delar av dokumenten DTIC publicerat vilka ofta är dåliga fotostat-kopier av ex. gamla datautskrifter eller maskinskriven text: själva problemet vi ser tydligare i omvandlingen till text är ju att det visuella lätt feltolkas med ord av avbrytna av och till i särskilt visuellt intensiva delar som huvudrubrik, författare m.m. positionerat kreativt fritt över en sida).


Exempel: Versionshistorik

Samtliga pdf-moduler jag prövade är ofullständiga i förmåga att identifiera åtminstone här konkret intressant information. Även om jag inte prövats Adobe's stöd misstänker jag lätt att det är väsentligt mer fullständigt men också riktigt dyrare i beräkningskostad (XML vara upplevt vackert graf-rätt men är samtidigt vad som tenderar att kosta brutalt i minne och cpu antingen på begränsad hårdvara eller när vi trådar upp flera processer och där kollisioner mellan processer som oväntat samtidigt åker på något överdrivet stort och komplext XML-träd kan bli svårt problematiskt om man försökt utnyttja hårdvaran närmare dess övre gräns).


Ett bra exempel är att historiken över hur pdf-dokument ADA554030 (att referera dokument med ID känns mycket rätt här) utvecklats steg för steg inte alls kommer med:


<xmpMM:History>

    <rdf:Seq>

     <rdf:li

      stEvt:action="saved"

      stEvt:instanceID="xmp.iid:62851626731AE011A09ECC9ACC76B452"

      stEvt:when="2011-01-07T15:00:21-06:00"

      stEvt:softwareAgent="Adobe Photoshop CS4 Windows"

      stEvt:changed="/"/>

     <rdf:li

      stEvt:action="saved"

      stEvt:instanceID="xmp.iid:EED3050E561EE0119927C84E9CB8197E"

      stEvt:when="2011-01-12T08:12:57-06:00"

      stEvt:softwareAgent="Adobe Photoshop CS4 Windows"

      stEvt:changed="/"/>

     <rdf:li

      stEvt:action="saved"

      stEvt:instanceID="xmp.iid:11BA444CC627E0119987A6F9DFDA4467"

      stEvt:when="2011-01-24T15:54:48-06:00"

      stEvt:softwareAgent="Adobe Photoshop CS4 Windows"

      stEvt:changed="/"/>

     <rdf:li

      stEvt:action="saved"

      stEvt:instanceID="xmp.iid:09357E023B64E011895EA90A7558D10D"

      stEvt:when="2011-04-11T12:57:22-05:00"

      stEvt:softwareAgent="Adobe Photoshop CS4 Windows"

      stEvt:changed="/"/>

     <rdf:li

      stEvt:action="saved"

      stEvt:instanceID="xmp.iid:0A357E023B64E011895EA90A7558D10D"

      stEvt:when="2011-04-11T12:57:22-05:00"

      stEvt:softwareAgent="Adobe Photoshop CS4 Windows"

      stEvt:changed="/"/>

     <rdf:li

      stEvt:action="saved"

      stEvt:instanceID="xmp.iid:0EB62AC83565E011990DE0CB345F06A5"

      stEvt:when="2011-04-12T14:34:21-05:00"

      stEvt:softwareAgent="Adobe Photoshop CS4 Windows"

      stEvt:changed="/"/>

     <rdf:li

      stEvt:action="saved"

      stEvt:instanceID="xmp.iid:FF5769E5CE65E011B575D54F7DC87B53"

      stEvt:when="2011-04-13T08:06:50-05:00"

      stEvt:softwareAgent="Adobe Photoshop CS4 Windows"

      stEvt:changed="/"/>

     <rdf:li

      stEvt:action="saved"

      stEvt:instanceID="xmp.iid:005869E5CE65E011B575D54F7DC87B53"

      stEvt:when="2011-04-13T08:08:32-05:00"

      stEvt:softwareAgent="Adobe Photoshop CS4 Windows"

      stEvt:changed="/"/>

    </rdf:Seq>

   </xmpMM:History>

Ett till exempel där närmiljö i integration andra format framgår (och som vi ska se därefter ganska brett samarbetande olika former av media-komponenter):


<xmpMM:History>
    <rdf:Seq>
     <rdf:li
      stEvt:action="saved"
      stEvt:instanceID="xmp.iid:F77F117407206811871FB2ED4E37AE08"
      stEvt:when="2011-01-14T12:11:33-05:00"
      stEvt:softwareAgent="Adobe Illustrator CS5"
      stEvt:changed="/"/>
     <rdf:li
      stEvt:action="saved"
      stEvt:instanceID="xmp.iid:01801174072068118C14E72FBDC50C68"
      stEvt:when="2011-06-28T14:07:30-04:00"
      stEvt:softwareAgent="Adobe Illustrator CS5"
      stEvt:changed="/"/>
     <rdf:li
      stEvt:action="converted"
      stEvt:parameters="from application/postscript to application/vnd.adobe.illustrator"/>
     <rdf:li
      stEvt:action="saved"
      stEvt:instanceID="xmp.iid:F77F1174072068118083E0155A4A0A32"
      stEvt:when="2011-06-28T14:13-04:00"
      stEvt:softwareAgent="Adobe Illustrator CS5"
      stEvt:changed="/"/>
     <rdf:li
      stEvt:action="saved"
      stEvt:instanceID="xmp.iid:351C424C262068118F62BE1AEC87ECB3"
      stEvt:when="2011-08-24T15:36:22-05:00"
      stEvt:softwareAgent="Adobe Photoshop CS5 Macintosh"
      stEvt:changed="/"/>
     <rdf:li
      stEvt:action="converted"
      stEvt:parameters="from image/tiff to application/vnd.adobe.photoshop"/>
     <rdf:li
      stEvt:action="derived"
      stEvt:parameters="converted from image/tiff to application/vnd.adobe.photoshop"/>
     <rdf:li
      stEvt:action="saved"
      stEvt:instanceID="xmp.iid:361C424C262068118F62BE1AEC87ECB3"
      stEvt:when="2011-08-24T15:36:22-05:00"
      stEvt:softwareAgent="Adobe Photoshop CS5 Macintosh"
      stEvt:changed="/"/>
     <rdf:li
      stEvt:action="saved"
      stEvt:instanceID="xmp.iid:371C424C262068118F62BE1AEC87ECB3"
      stEvt:when="2011-08-24T15:36:35-05:00"
      stEvt:softwareAgent="Adobe Photoshop CS5 Macintosh"
      stEvt:changed="/"/>
     <rdf:li
      stEvt:action="converted"
      stEvt:parameters="from application/vnd.adobe.photoshop to image/tiff"/>
     <rdf:li
      stEvt:action="derived"
      stEvt:parameters="converted from application/vnd.adobe.photoshop to image/tiff"/>
     <rdf:li
      stEvt:action="saved"
      stEvt:instanceID="xmp.iid:381C424C262068118F62BE1AEC87ECB3"
      stEvt:when="2011-08-24T15:36:35-05:00"
      stEvt:softwareAgent="Adobe Photoshop CS5 Macintosh"
      stEvt:changed="/"/>
    </rdf:Seq>
   </xmpMM:History>

Exempel: Integration mjukvara - Kultur och säkerhet

En mer uppenbar fråga kring risk och värde att stämpla dokument med de programvaror som används är att det kan indikera trovärdigt vad som används fortfarande vid en tidpunkt längre fram också om så långt indikerat tidigare säkra. D.v.s. berätta hur organisationen tänkbart kan angripas.


Navigating complex buildings: cognition, neuroscience and architectural design (University College of London, bok-kapitel, Dalton) - vilket dessutom är en till Riktad information - Navigation: Förstärkt i spatiell organisation excellent komplettering både ganska praktiskt men med visst djup och referenser vidare - ger ett lättsamt exempel på båda om vi nu väljer att tro Microsoft Word som mer säkerhetsdefekt trolig resp. att Macintosh nog ibland är ett kulturellt val oavsett om preferens inom tekniksegment (en del applikationer inom moving pictures för att skapa om jag minns rätt) eller att något uttrycks fullt mindre av conformity ej onödigt komplext i konfiguration känns bättre om man arbetar kreativt ganska ointressad av annan bredare vanliga kontorsapplikationer.


__FUNCTION_WORKING METADATA_LOGIC
__PDF_FILE_NAME navigating_complex_buildings.pdf
__IN_DIR_GIVEN c:\PTOOLS\PDF\pmid\
__METADATA_FIELD ModDate D:20100602114653-04'00'
__METADATA_FIELD CreationDate D:20100529222217+01'00'
__METADATA_FIELD Producer Mac OS X 10.4.11 Quartz PDFContext
__METADATA_FIELD Creator Word
__METADATA_FIELD Author Ruth
__METADATA_FIELD Title Microsoft Word - Dalton_Spiers_Hoelscher.rtf
__DOCUMENT_ID_UID_CONNECTIONS

Och så en till kulturella preferenser (även om jag inte alls betvivlar att tex, post-script m.m. har en försvarlig mängd ej dokumenterande säkerhetsdefekter bara i befintlig kod: komplicerade standarder med komplex parsning). Latex är fortfarande idag stort i delar av forskningsvärlden (mer så i de mer tillämpade delarna inom data och fysik snarare än ex. forskning inom medicinsk eller kemi).


__FUNCTION_WORKING METADATA_LOGIC
__PDF_FILE_NAME hanford.pdf
__IN_DIR_GIVEN c:\PTOOLS\PDF\pmid\
__METADATA_FIELD ModDate D:20111121131055-05'00'
__METADATA_FIELD CreationDate D:20111121131055-05'00'
__METADATA_FIELD Producer MiKTeX pdfTeX-1.40.11
__METADATA_FIELD Creator TeX
__DOCUMENT_ID_UID_CONNECTIONS
__XMP_META_DATA_HH_EXTRACTION __START
__XMP_META_DATA_HH_EXTRACTION __END

Vidare besläktat meda båda föregående exempel på vad vi kan se kan det ge indikationer om preferens open source (mjukvara snarare än metadata promiskiöst delat för andras analys) liksom benägenhet eller möjlighet att budgetera inköp mer front-end nya koncept (längre fram indikeras nog mindre inressant här när något är vanligt: vad vi syftar är mer webb-baserade lösningar i dokumenthantering, sökning m.m.).


Exempel: ID för media-komponenter och dokument

Förutom WWW-kopplingar valde jag att ta ut PMID (National institutes of healths ID för journal-artiklar i deras för forskningsområdet helt dominerande databas med applikationer sökning m.m.) resp. DOI (brett använd namngivning av journalartiklar för betalande aktörer: dx.doi.org kan från DOI namnet föra dig vidare till sidan där artikeln finns. Och slutligen referenser till unika objekt XML-dokumentet i sig gör (d.v.s. potentiellt ett helt för applikationen lokalt kontext om ej hanterat i ett övergripande system för organisationen). Fler finns man kan ta ut med PMID och DOI är mycket stora och inte ointressanta om man för en större samling av dokument ex. vill komma ifrån att i övrigt riktat parsa och analysera referenser och istället behanda det som vilken sida som helst (vilket man nog ofta vill för dokument-samlingar likt DTIC jag tar ner just nu mer totalt där dokumenten kommer från många generationer resp. där referenser filtrerat av och till kan dyka upp i separata dokument):


Nedan några typiska ID för delar av PDF-filen (eller avseende hela den i någon instans):


__FUNCTION_WORKING METADATA_LOGIC
__PDF_FILE_NAME a569695.pdf
__IN_DIR_GIVEN c:\PTOOLS\PDF\
__METADATA_FIELD ModDate D:20130321040825-04'00'
__METADATA_FIELD CreationDate D:20120530205500-04'00'
__METADATA_FIELD Producer iText 5.0.4 (c) 1T3XT BVBA
__DOCUMENT_ID_UID_CONNECTIONS uuid:b3d384ac-d60e-4945-82e9-8b6e47f48eba uuid:3e6c776a-3058-4aee-856b-2ff7247c779f

Uppenbart ovan är att jag valt att inte ta med något sammanhang alls för dem. Möjlig användning för att söka samband tenderar ju att reducera probelmatik med ovsäentligt och vidare oavsett om vi refererar externt eller om någon refererar oss är det ett samband. Dock om vi vill se djupare i dem när hittade (för association jag bedömer intressantare tror jag övergripande att man når så långt man kan utan annan kunskap alls om dem: jämför med vad likheter i termonologi kan indikea om likhet i kultur eller expertområde mellan entiteter) bör åtminstone själv-refererande för dokumentet särskiljas varför jag också tar med delar av själva XML-koden (när vi vill förstå kopplingar specifikt mellan två entiteter). Känslan jag har att med minde än att man överdrivet tittar på standarden och ändå riskerar att komma fel är praktisk användning för träffar nog utmärkta för att vettigt begipa vad som är helt eller delvis självrefererande (eller praktiskt så avgränsat ex. dator med pgoramvaror) resp. vad som via indikerat XML resp. uttrycket kan vara mer generellt dokument-id format i något sammanhang.


Emellertid för ev. behov finns resp. dokument id eftersom mer basal xml-kod sparas (praktiskt som extraktionen tycks fungera - jag är nu ingen expert på PDF så finns praktiskt prövande kändes tidseffektivt - tas all XML läsbar med medan jag valde bort delvis parsad struktur för att spara håddisk vilket jag från början också hade med temporärt via DATA::DUMPER på objektet för pdf-filen):


<x:xmpmeta x:xmptk="Adobe XMP Core 5.2-c001 63.139439, 2010/09/27-13:37:26        " xmlns:x="adobe:ns:meta/">
   <rdf:RDF xmlns:rdf="http://www.w3.org/1999/02/22-rdf-syntax-ns#">
      <rdf:Description rdf:about="" xmlns:xmp="http://ns.adobe.com/xap/1.0/">
         <xmp:ModifyDate>2013-03-21T04:08:25-04:00</xmp:ModifyDate>
         <xmp:CreateDate>2012-05-30T20:55:00-04:00</xmp:CreateDate>
         <xmp:MetadataDate>2013-03-21T04:08:25-04:00</xmp:MetadataDate>
      </rdf:Description>
      <rdf:Description rdf:about="" xmlns:dc="http://purl.org/dc/elements/1.1/">
         <dc:format>application/pdf</dc:format>
      </rdf:Description>
      <rdf:Description rdf:about="" xmlns:xmpMM="http://ns.adobe.com/xap/1.0/mm/">
         <xmpMM:DocumentID>uuid:b3d384ac-d60e-4945-82e9-8b6e47f48eba</xmpMM:DocumentID>
         <xmpMM:InstanceID>uuid:3e6c776a-3058-4aee-856b-2ff7247c779f</xmpMM:InstanceID>
      </rdf:Description>
   </rdf:RDF>
</x:xmpmeta>

En försvarlig mängd av det för moderna kameror, dokumentsystem m.m. typiska formatet för att ge media producerat en unik identifierare. Exemplet nedan från samma som nummer två med versionshistorik tidigare:


__DOCUMENT_ID_UID_CONNECTIONS uuid:5B20892493BFDB11914A8590D31508C8 xmp.did:714C3D9B56AAE011B1AA9CA76A9EC25B xmp.did:724C3D9B56AAE011B1AA9CA76A9EC25B xmp.did:734C3D9B56AAE011B1AA9CA76A9EC25B xmp.did:F77F1174072068118083E0155A4A0A32 xmp.did:FB7F1174072068118083E0155A4A0A32 xmp.iid:006035250D2068118F628C890978B148 xmp.iid:008011740720681197A5820352CD19F2 xmp.iid:016035250D2068118F628C890978B148 xmp.iid:01801174072068118083C809E165E027 xmp.iid:01801174072068118C14E6A624D85812 xmp.iid:01801174072068118C14E72FBDC50C68 xmp.iid:026035250D2068118F628C890978B148 xmp.iid:02801174072068118C14D5EDF20B39EA xmp.iid:03801174072068118C14D5EDF20B39EA xmp.iid:04801174072068118C14D5EDF20B39EA xmp.iid:05801174072068118C14E72FBDC50C68 xmp.iid:321C424C262068118F62BE1AEC87ECB3 xmp.iid:331C424C262068118F62BE1AEC87ECB3 xmp.iid:341C424C262068118F62BE1AEC87ECB3 xmp.iid:351C424C262068118F62BE1AEC87ECB3 xmp.iid:361C424C262068118F62BE1AEC87ECB3 xmp.iid:371C424C262068118F62BE1AEC87ECB3 xmp.iid:381C424C262068118F62BE1AEC87ECB3 xmp.iid:624FA1CF212068118F62BE1AEC87ECB3 xmp.iid:634FA1CF212068118F62BE1AEC87ECB3 xmp.iid:644FA1CF212068118F62BE1AEC87ECB3 xmp.iid:654FA1CF212068118F62BE1AEC87ECB3 xmp.iid:664FA1CF212068118F62BE1AEC87ECB3 xmp.iid:674FA1CF212068118F62BE1AEC87ECB3 xmp.iid:684FA1CF212068118F62BE1AEC87ECB3 xmp.iid:694FA1CF212068118F62BE1AEC87ECB3 xmp.iid:6A4FA1CF212068118F62BE1AEC87ECB3 xmp.iid:6B4FA1CF212068118F62BE1AEC87ECB3 xmp.iid:6C4FA1CF212068118F62BE1AEC87ECB3 xmp.iid:714C3D9B56AAE011B1AA9CA76A9EC25B xmp.iid:724C3D9B56AAE011B1AA9CA76A9EC25B xmp.iid:734C3D9B56AAE011B1AA9CA76A9EC25B xmp.iid:B1D0A6060F2068118F62BE1AEC87ECB3 xmp.iid:B2D0A6060F2068118F62BE1AEC87ECB3 xmp.iid:F77F1174072068118083E0155A4A0A32 xmp.iid:F77F1174072068118083E5C6D079A5EF xmp.iid:F77F117407206811871FB2ED4E37AE08 xmp.iid:F77F117407206811B84094BC3C7FBB8B xmp.iid:F77F117407206811BA4A8DBC7C9B7B1F xmp.iid:F87F117407206811B84094BC3C7FBB8B xmp.iid:F87F117407206811BA4A8DBC7C9B7B1F xmp.iid:F97F117407206811BA4A8DBC7C9B7B1F xmp.iid:FB7F1174072068118083E0155A4A0A32

Vad som gör dessa intressanta rent allmänt (ej analyserat för ex. alls) kan tyckas svårbegripligt men jämför vi med vad vi menade att www-länkarna kunde berätta blir det kanske tydligare. Vi kan se propagering, samarbete, copyright-problematik eller oftare bara odefinierat lånat m.m. när enskilda indikationer dyker upp i flera dokument. Min erfarenhet av PDF är här ännu minst sagt begränsad men min allmänna känsla är att det utanför kontext där viss standardiserad användning fövantas eller är normalt är det kanske inte den mest intressanta källan innan man börjar laborera på riktigt stora mängder av dokument (vilket ju inte sällan redan kan vara motierat av andra tyngre orsaker där detta kommer gratis på köpet: statistiskanalys, indexering m.m.). Likväl är träffar åtminstone inte vad som inte inträffar för större organisationer på inte allt för många besläktade dokument (där en del om jag tolkar konceptet och PDF rätt i alla fall hittades för NATO relaterat mer prospekterande resonerande om forskning och teknik långt ifrån något alls känsligt och helt publikt men i alla fall vad jag ej förväntat på relativt få dokument).


Detta är en motsatt sida av det värde (utanför det kanske ofta mer primära att kunna organisera information man äger som stor organisation) i informationssäkerhet och kontroll av flöde in och ut eller mellan personer i företaget. I koncept av intrusion detection kan vi jämföra med "Snowden-detektor / sensor" diskuterad där vi enkelt kan se det som att själva förekomsten av vissa media-dokument via deras identifierade kan vara binärt förbjudet för en viss person, ligga längre från dennes normala användning, eller bygga upp mot något troligt problematiskt (ex. om många tusen dokument ej relaterade systemadministration identifieras på en medarbetares PDA när han vid den dagliga utpasseringen lämnar den till säkerhetspersonalen för kontroll som konsekvens av att ha en arbetsuppgift med odefinierat höga rättigheter i datanätverket).


Men likartat kan andra ibland beroende på lösning dra slutsatser (vi kan tänkas oss att varje instans adderar in något slumpmässigt för unikt värde via en ID-fabrik någonstans men heller inte det behöver utesluta analys här helt: hur snabbt förändras entropi över tiden? hur mycket nytt resp. gammalt i kontext av en person är aktuellt?). Förutom att skapa ett fascinerande problemområde med felaktiga format eftersom det tror jag kan behöva hanteras med reaktion för att systemet ska kännas betryggande i denna form av hantering (ett dokument existerande uttryckande säkerhetsfunktion men felaktigt d.v.s. potentiellt förfalskad är ju en ganska tung indikation om angrepp men förstås dyr att hantera om någon sitter och för in defekta saker av och till för att ockupera resurser i organisationen: dock finns ju det problemet besläktat i alla fall också utan identifiera via falska mail m.m.).


Exempel: OID och innehåll

I exakthet i domän av sammanfattad information om innehållet och dess organisation i ett kunskapssystem är många andra system utanfö själva pdf-dokumentet oftare mer talande. Nedan har vi data uttryckt, sparat och gjorts tillgängligt i en standard nu ganska vanlig för fakta-dokument, journal-artiklar m.m.



Också använd för att publicera och distribuera det kanske mer välkända id för bl.a. journal-artiklar: DOI. En tysk databas var där praktiskt enkel och välfungerande för mig medan jag ännu har att få helt klart för mig hur jag effektivsas kan få ner DOI för alla vetenskapliga journalers artiklar beskrivna samt gärna fångar ny publicering utan att behöva besöka dem alla regelbundet (i den mån det alls går: en del mediehus är ganska introverta också när det gäller titel, abstract, doi m.m. och tycks göra en hel del svår-tillgängligt):



Men jag undviker gärna att i onödan lära mig sådant i detalj innan det är nödvändigt (jag spindlar och analyserar annat just nu): det finns så mycket lika viktigt och stort men inom annat. Förutom kompletthet är det tilltalande att försöka få huvuddelen publicerat i segment vi analyserar som en domän eftersom det underlättar hur vi resonerar med statistiska modeller (eller också teoretiskt förenklat sampla dem gärna nära när det går slumpmässigt - risk bias och preferens finns ju dessutom med andra metoder om än kanske lättare att resonera om när befintligt data för detektion finns).


Just för metadata neda är det från Department of Defence, US del för att hantera kunskap, forskning m.m. information man etablerat på olika nivåer genom åren för att göra det lättare att ta fram nya värden från dem (kanske se samband mellan dokument om indirekta behov, var en lösning finns att anpassa i ennan försvarsgren, upptäcka nya innnovationer m.m.), ej dubbel-arbeta saker och ting o.s.v.



Rörande mängd och exakthet finns inget unikt jämfört med normalt för journal-artiklar publicerade idag på nätet: jämförbart metadata, ofta möjligt att spindla eller ta ner på annat sätt o.s.v. Dock finns också en mängd äldre studier, utredningar m.m. med början tidigt under 1900-talet och där känner jag ej till metadata tillsammans med dokument ens i närheten i möjlighet om vi ex. vill följa utveckling av koncept eller fånga upp koncept-associationer lika viktiga idag men mindre diskuterade och uttalade i modern litteratur därför att vetskap tas som givet etablerad redan i grundutbildning. Längre bak och särskilt vissa tidsperioder kan emellertid oftare endast ha meta-informationen (möjligen gäller det oftare 1960-talet än 1950-talet även om jag inte säkert vet eftersom jag fortfarande tar ner deras pdf:er resp. databas med metadata).


Det ska också sägas att samlingen av dokument och vetandet representerat i dom publika tjänsterna är omfattande och för många områden en mycket välfungerande databas och funktion för att hitta forskning över längre tidsperioder. För flera segment tycker jag att den fungerar enklare för att hitta vad önskat snabbare. Det gäller dock en del områden (bildanalys finns ex. mycket publicerat för) medan andra områden kan vara mindre intressanta för en försvarsorganisation att direkt finansiera eller bevaka för återpublicering.


Nedan ett exempel från 1949 existerande både som dokument ADA297559 och beskrivet med metadata:


____________________________________________________________________
__FUNCTION_WORKING FUNCTION_MANAGER
__URL http://www.dtic.mil/cgi-bin/GetTRDoc?Location=U2&doc=GetTRDoc.pdf&AD=ADA297559
____________________________________________________________________
__FUNCTION_WORKING OID_HARVESTING_BY_ACCESS_NUMBER
<Citation type="tr">
<AccessionNumber>ADA297559</AccessionNumber>
<CitationStatus code="">ACTIVE</CitationStatus>
<CitationClassification code="">UNCLASSIFIED</CitationClassification>
<CorporateAuthor>TECHNICAL INFORMATION SERVICE (AEC) OAK RIDGE TN</CorporateAuthor>
<UnclassifiedTitle>Manual of Instruments and Controls for the Brookhaven Nuclear Reactor. Book 3. Volume 1.</UnclassifiedTitle>
<TitleClassification code="">UNCLASSIFIED</TitleClassification>
<ReportDate>MAY 1949</ReportDate>
<PaginationOrMediaCount>167</PaginationOrMediaCount>
<PaginationCode>0</PaginationCode>
<ItemCost>14.60</ItemCost>
<ReportNumber nonPunctuated="AECM4415">AEC-M-4415</ReportNumber>
<MonitorAcronym nonPunctuated="XF">XF</MonitorAcronym>
<MonitorSeries nonPunctuated="XD">XD</MonitorSeries>
<ReportClassification code="">UNCLASSIFIED</ReportClassification>
<DistributionCode code="01">APPROVED FOR PUBLIC RELEASE</DistributionCode>
<DescriptorClassification code="">UNCLASSIFIED</DescriptorClassification>
<AbstractClassification code="">UNCLASSIFIED</AbstractClassification>
<InitialInventory>0001</InitialInventory>
<SourceSeries>1</SourceSeries>
<SourceCode>342750</SourceCode>
<GeopoliticalCode>4702</GeopoliticalCode>
<OrganizationTypeCode code="Z">INDEPENDENT FEDERAL AGENCIES</OrganizationTypeCode>
<DocumentLocation code="1">DTIC AND NTIS</DocumentLocation>
<Abstract>The instruments and controls for the Brookhaven Nuclear Reactor have evolved from a development program whose objective was, among others, to create a research facility. Throughout this program it has been clear that the ultimate arrangement of instruments and controls can not be fixed in advance of actual operation. The ultimate arrangement will depend in large measure on the research activity to take place in the future. It has been necessary, therefore, to provide a wide range of instrument capabilities and a large number of control functions.            Underlying this primary objective of creating a versatile research facility is the associated requirement that the reactor be safe. The requirements for safety are in some ways as varied and complex as those of research. In some instances they are dominant.            Exemplifying the flexibility and versatility of the reactor  instrumentation are electronic instruments of advanced design for measuring power at extremely low levels, indicating and recording the rate of rise of power level over a wide range of power, and regulating power at  preset levels. Exemplifying the variety of safety devices are instruments for monitoring power level detected by ionization chambers, by neutron  thermopiles, and by graphite and metal-cartridge thermocouples. Devices  which monitor the operability of equipment also contribute to the safety  of the reactor.   (KAR)  p.7</Abstract>
<Descriptor>*USER MANUALS</Descriptor>
<Descriptor>*POWER LEVELS</Descriptor>
<Descriptor>*NUCLEAR REACTORS</Descriptor>
<Descriptor>*POWER MEASUREMENT</Descriptor>
<Descriptor>CONTROL</Descriptor>
<Descriptor>MEASUREMENT</Descriptor>
<Descriptor>MONITORING</Descriptor>
<Descriptor>ELECTRONIC EQUIPMENT</Descriptor>
<Descriptor>GRAPHITE</Descriptor>
<Descriptor>IONIZATION CHAMBERS</Descriptor>
<Descriptor>LOW LEVEL</Descriptor>
<Descriptor>INSTRUMENTATION</Descriptor>
<Descriptor>RECORDING SYSTEMS</Descriptor>
<Descriptor>RANGE(EXTREMES)</Descriptor>
<Descriptor>INDICATORS</Descriptor>
<Descriptor>NEUTRONS</Descriptor>
<Descriptor>SAFETY EQUIPMENT</Descriptor>
<Descriptor>THERMOPILES.</Descriptor>
<FieldsAndGroups code="180501">Nuclear Fission Reactors(power)</FieldsAndGroups>
<SBIHoldingSymbol>NPS</SBIHoldingSymbol>
<handle>http://handle.dtic.mil/100.2/ADA297559</handle>
<PdfFileSize>12 MB</PdfFileSize>
</Citation>

Exempel: Text är bättre

Analyserar vi språk i text snarare än bilderna, visuell presentation m.m. vill vi just helst bara ha texten. Det sparar minne vid analystillfällen, beräkningskostnad för att ta fram den och utrymme på hårddisken (PDF dokument kan av och till mer än stora vara gigantiska om de inkluderar en mängd föga komprimerade bilder).


Med de lösninga jag använder nu (och tror jag mycket vanliga även om system säkert kan vara bättre och sämre här varierat med kostnad i utveckling och processande av vad visuell-information betyder) med av och till feltolkningar på visuellt mer komplexa sidor (önskar man ta kostnad för det och det tror jag ej är aktuellt här med något värde för mig kan det mesta om inte nära nog alla dessa fel fås bort i efterhand via bl.a. ngram-detektion, förståelse av hur url:er, standard information som doi, pmid m.m. skrivs och åtminstone enklare parsning med Natural language processing av meningar för att förstå om en radbrytning kombinerat punkt är en förkortning avhuggen eller meningsslut på rad ovanför: dyrt i beräkningstid när det handlar om miljoner dokument - en god skattning är att cirka 10 - 15 miljoner täcker upp en god andel av viktig publicerad forskning tillgänglig i pdf-format på nätet och cirka två miljoner en god andel av väsentligt från dom senaste åren när det handlar om journal-artiklar - där jag initialt ser cirka två till 25 miljoner som en lagom nivå för titel, abstrakt m.m. och bredare analys hela dokumenten för särskilda områden scarce i inlärda relationer eller särskilt viktiga vid någon tidpunkt).


__FUNCTION_WORKING PDF_TO_TEXT_LOGIC
__PDF_FILE_NAME ADA297559.pdf
__IN_DIR_GIVEN C:\PTOOLS\SAMPLER\DTIC\PDF\
__PAGES 167
__WWW_CONNECTIONS 
__EASY_JOURNAL_CONNECTIONS_EX_DOI 
__PAGE 1
UNCLASSIFIED
OJ
UNCLASSIFIED
M-4415
Subject Category: INSTRUMENTATION
UNITED STATES ATOMIC ENERGY COMMISSION
MANUAL OF INSTRUMENTS AND CONTROLS FOR THE BROOKHAVEN NUCLEAR REACTOR. BOOK 3, VOLUME I
r
KJ31SEm;a!BBanBI!! ^lM|
vUG.U6Jl9.9_a
biM& W''
?s^^M^^ ^Bm^asi^^^s^sf t^i^sz^,
May 1949
Servomechanisms Laboratory Massachusetts Institute of Technology Cambridge, Massachusetts
Jackson and Moreland Engineers New York, New York
Technical Information Extension, Oak Ridge, Tennessee
' %  ' ~ '1--"-" %  """ *
DTIS Q UALTrYlNSFEClED3
______________END_PAGE______________
__PAGE 2
Date Declassified: January 13, 1956.
LEGAL NOTICE
This report was prepared as an account of Government sponsored work. Neither the United States, nor the Commission, nor any person acting on behalf of the Commission:
A. Makes any warranty or representation, express or implied, with respect to the ac- curacy, completeness, or usefulness of the information contained in this report, or that the use of any information, apparatus, method, or process disclosed in this report may not in- fringe privately owned rights; or
B. Assumes any liabilities with respect to the use of, or for damages resulting from the use of any information, apparatus, method, or process disclosed in this report.
As used in the above, "person acting on behalf of the Commission" includes any em- ployee or contractor of the Commission to the extent that such employee or contractor prepares, handles or distributes, or provides access to, any information pursuant to his em- ployment or contract with the Commission.
This report has available copy.
been reproduced directly from the best
Issuance of this document does not constitute authority for declassification of classified material of the same or similar content and title by the same authors.
Printed in USA, Charge $1.00. Available from the Office of Technical Services, Department of Commerce, Wash- ington 25, D. C.
AEC, Oak Eidge, Tenn.
______________END_PAGE______________

Ytterst tilltalande gäller normalt att innehållsförteckning, tabeller över figurer m.m. liknande översätts till text utmärkt för journal-artiklar. Ex. från samma dokument:


__PAGE 6
CONTENTS VOLUME I
Page
9. Coarse Rod-Position Indicators - Component Description 3.35
10. Hod-Position Recorders 3.44
11. Parts List - Instrument Pinion Support Assembly
6546DN048 (For Regulating Hods) 3.47
12. Parts List - Instrument Pinion Support Assembly
6546DN047 (for Emergency Rods) 3.47
13. Parts List - Regulating-Rod Position Transmitter
Assembly 6546M030 3.49
14. Parts List - Regulating-Rod Position Indicating Unit
6546LN006 3 . 5 2
15. Parts List - ilmergency-Rod Position Transmitter
Assembly 6546EN029 3.56
16. Parts List - Kmergency-Rod Position Indicating Unit
6546BH001 3 . 5 9
17. Parts List - Coarse Rod-Position Indien tor
654&SN018 and 6546i.NQ19 3 . 6 2
18. Reference Drawings 3.65
19. Engineering Report References, D.l.C 6546, td.l.T, . . 3.65
______________END_PAGE______________
__PAGE 7

Ett till exempel från ADA297788 med tekniska data såväl som några referenser. Resultatet är varken bra eller dålig men knappast problematiskt för normal textanalys.


__PAGE 20
 fill
XJaxium Temperature Observed
2120  C to 2510 C
^-12"
30 lbs to 89 lbs
cci 4
20 lbs to 98 lbs
*2
10 cu it to 450 cu fir.
"Boron Analysis
 00 ppm to  10 (spec)
Total Ash
1 ppm to 17 ppm
gOMMAR T OF OPERATIONAL DATA
Adc kbjj  TO AEVI  AL "RIMS 11 " 1
Maximum Tariatian, Average* Range
2250 - 2400 C 60  =  65 lbs 40 = 50 lbs 100 - 300 cu ft  03 -  06 ppm 1  to 8  ppm
As the runs were made for production purposes no attempt to control the variables ms made  So correlation between the variables and the purity obtained can be drawn from the operational data 
&f Majority of the runs fall within these ranges
ABHSKBEC *C" BIBLIOGRAPHY
1. Neumark, H  R , Trans. Electrochem. Soc. 9jL, 367, (19*1-7)
2. Sermon, G. T. United Carbon Products Co. Report Ho  3 (19^7)
3. Sermon, G. T., "16OO MA Powsr Installation on 22 M Line", United Carbon Products Co. Report Ho. 13, (19*&)
4* Bodden, C. J. Richmond, M. S., National Bureau of Standards unpublished report, "Determination of Small Amounts of Boron in Project Materials".
5. Sermon, G. T., "Heating Tests in Granular Resistance Furnaces for preparing High Purity Graphite", united Carbon Products Company Report Ho. 6, (19*1-7)
19
______________END_PAGE______________

Översätta sökord: Se och särskilja kultur, grupper av personer och upparbetat representera människor

2013-09-03

Vill jag särskilja en amerikan från en britt är något ofta för många fall och många personer enkelt koncept att ta några egenskaper brutalt jämförande en amerikan med en amerikan och visa versa intet-sägande (motsvarande med bl.a. normalfördelning låg varians) ex. talande engelska, bor i Nordamerika, gillar bankaffärer i Mellanöstern med liberala tankar om affärernas frihet överbryggande andra avstånd och konflikter i världen, har en inhemsk teve-kanal som kallas för BBC, huvudstaden heter Washington o.s.v. sorterat mellan var och en.


Omvänt vill jag särskilja dem för var för sig är det självklart föga funktionellt med faktorer föga varierade. Dom är ju mer bättre använt filtrerande bort ex. fransmän, svenskar m.fl. boende ex. i ett geo-område vi försöker dra britter (förslags med återläggning så England inte börjar krympa i befolkning) från för att särskilja och sortera i olika grupper med preferenser som intresserar oss eller kanske för att optimera en tjänst de använder (rätt sökresultat, bäst kryddade hamburgare eller vad nu aktuellt).


Det gemensamma konceptet är ju inarbetat demonstrerat i stora affärskoncept på webben tämligen funktionellt som ett genomsnitt. Att analysera ex. ankartext på länkar, stora text-corpus so Google NGRAM och oerhört mycket mer (inte minst för att ge kontrast till bl.a. Google indikerat föregående stora delar av språkanalysens och informationsteorins ofta sedan länge använda och för sitt ganska välfungerande algoritmer jfr diskussion Bing!).


Centraliteten säger i sig ingenting mer än just det. Per definition har vi just valt bort andra nyanser. Förvisso kan de vara vad som andra lösningar adderar eller att "centralitets-distributionerna" / "common everday man or woman surface sense" är en utgångspunkt eller del av andra algoritmer.


Återvänder vi till min mer privata reflektion jag råkade addera i Vad har Google, Microsoft m.fl. egentligen för beräkningsutrymme per användare? För kontext-hantering och prediktion av sökningar (2013-09-02) rörande sökkoncept webb och nyheter gäller ju att vad som avgör om detta alls ger mer än ett tydligt genomsnitt eller ett vettigt mycket funktionellt sökresultat (jfr stor händelse just nu eller givet nära genomgående hos dom som söker att de vill få förklarat vad koncept X egentligen innebär) vad som endast förutom genosnittet kan skattas (vad jag inser) genom:


  • Direkt i aktuell sökning givna koncept (vad vi skriver närmare enkel ordförståelse eller flerord ex. Google men med associerad "bakgrund" ex. divergens mellan love and hate jfr större gamla konflikter) resp. direkta sökkoncept i ord och ngrams-koncept konvergerande i ordförståelsen till ex. ett namn eller motsvarande översättande via vettig transformation till sidor (trivialt men nog så föredömligt optimerande sökmotorernas arbete vara 1 - 1 till ex. en Wikipedia sida med ex. samma titel och hundra tusentals länkar med kontext av varierade sökord runt om kring det).
  • Vi har en temporal divergens avvikande från vår inarbetade centralitet men möjlig att skatta rimligt snabbt över hela populationen. D.v.s. samma utsmetade genomsnitt men nu mycket smalare i tids-dimensionen och troligt mer volativ.
  • Vi kan vi andra parameter associerade riktade eller skattade från vem som söker förstå vad dennes genomsnitt är som kulturell hemvist (ex. person A med flera goda vänner i bankvärlden och lätt intresserad av politik i alla möjliga områden såväl som ekonomi - kanske revisor, journalist eller politiker eller dokusåpa-stjärna i den mån vi kan se det och det troligare påverkar vår tolkning av vad personen skriver).

Eftersom jag nu spontant skrev mer än tänkt i Vad har Google, Microsoft m.fl. egentligen för beräkningsutrymme per användare? För kontext-hantering och prediktion av sökningar (2013-09-02) men fullföljande och publicerande för egen bearbetning enkelt ha det kvar utan blandande in min laptop jag ser som throw-away lokalt förklarar kanske resonemangen och exemplen ovan enklare vad jag avser med kontext.


Även om vi ovan egentligen gör och får resultat i färre områden än vad som var aktuellt i det diskuterade konceptet nästan direkt från början och jag insåg efter vad jag skrev tidigare (säkert som resultat av den bearbetningen) att söker man mer avsmalnad tolkning ut från sökorden närmare individuellt fångande egentligen individens centralitet kan man självklart dra ner antalet dimensioner ordentligt. Det är ju bara preferenser per individ.


Begränsningen är samma för exemplet med amerikaner och britter: det fångar mest likheten och när var avvikande har betydelse blir det lätt lite fel. Söker jag sedan evigheter med stor preferens för att få PDF-dokument i mina sökresultat är det givetvis en enkel lösning att dra upp det som faktor. Men av och till kanske jag inte söker artiklar från journaler åter-publicerade av universitet utan ex. corpus och datafiler. Är nu preferensen för PDF vad som ej orkar i en lösning att uttrycka variation från mitt kontext direkt med dom sökningarna och runt om så är det tämligen kört att få dom träffar man önskar med mindre än att man kan title (och motsvarande starka koncept enkelt översätta till sökord rada upp väldigt nära just vad man söker).


Det gjorde jag nyligen för att hitta tillbaka till corpus.byu.edu - Web Corpus / Statistics i motsvarande sökresultat som site:edu -intitle:pdf large web corpus. Men söker jag mer kreativt prospekterande utforskande efter bra data jag ej har i områden där jag gärna vill ha mer klart för att spara arbete just nu redan ansträngande datorresurserna med annan grundanalys är det svårare.


Faktiskt även kontext-switchande mer till mitt sluga sök-mindset utnyttjande erfarenheter av sökmotorer från alla möjliga perspektiv (även om jag nu aldrig tagit betalt för länkar eller någonsin förr när jag tog en del uppdrag i området utnyttjande egna sajter utan snarare kompletterande andra lösningar kunderna köpte eller hade med det mer eleganta ex. skapande värden riktade för att få universitets-länkar, eller länkar branschföreningar eller government - där Sverige är väldigt svårt men på engelska webben med konkret värde kan det gå även om det kan kräva att du hjälper till att få på plats några WLAN-hubbar hos svenska myndigheter om du ska få den tungt betrodda NSA-länken nära deras startsida &ld;- skämtande) var det svårt med mindre än att se till att min historik ej påverkade utnyttjande annan dator (men att logga ut från Google antar jag fungerar lika ba).


Exemplen illustrerar utmaningen. Därmed inte sagt att det behöver vara lätt. Skrivand här så här ges ju den abstrakta formen. I konkret implementationer och modeller kan det rent av antar jag varierat med resurser tämligen utmanande krävande ganska mycket av och till. Det är ganska ofta i domänen inte alltid ens triviala lösningar praktiskt ens när välkända enkla gamla algoritmer är vad man kanske kan nöja sig med som initialt filter därför att det är alltid så mycket data.


För mig precis som jag tidigare skrev kan jag heller inte riktigt skatta hur svårt därför att jag insåg att jag saknar referenssystem för vad som är normal basnivå på cpu-tid och lika mycket minne som är möjligt att lägga per användare. Vad orkar en invant kompetent hårdvaru- och mjukvaru-optimerande entitet egentligen i kostnad per användare i mängd minne och beräkning? Vektorer med tusen dimesnioner? Eller hellre minst tio tusen i magnitud? Eller för närmare magi i avbildning flera hundra tusen (där tar det verkligen kraft).


Av och till inte helt orelaterat kanske tänker jag på alla pay-load av ytlig men bred datakunskap stat m.fl. tryckte ut för ett antal år sedan när jag var barn. Före webb var ett koncept och långt innan hem-pc. Mycket om problemet samkörning, lagar om personregister m.m. I uppdateringarna av grunddata jag gjorde nu tror jag antalet personer med namn och enkla fakta som födelsedatum, kön, nationalitet, födelsehemvist m.m. hamnade på cirka 500 - 900 000 (efter att jag skar ned brutalt för att hålla nere tiden det tar att också föra in för presentation där MediaWiki utnyttjas).


Nu är ingenting där brytande mot aktuella lagstiftningar runt register - ej heller några andra - men vi ser en kontrast fortfarande kanske varierat tydlig mot förr (indikerande kanske flera emergence görande stora mängder inarbetade centralitets-vikter värdelösa ofta ganska snabbt) på var vi tar som naturligt att någonsin dator har och vad det innebär och upplevs. När Staten och Storföretagen hade Stordatorer med vi övriga kanske hade en Vic-64 med bandstation för kassetband var personregister av den här storleken väldigt ovanligt d.v.s. stor kontrast. Idag inte särskilt ovanligt för som här kända personer från historien eller nulevande (politiker, skådespelare m.m.) huvudsakligen genererade från Wikipedia text.


Gigantiskt personregister redo för samkörning öppet publicerat på webben

    För att inte oroa känsliga läsare (jag vill ju inte att en för medarbetarna engagerad Obama ska ringa och försökande projiserande medkänsla med att deras myndighet NSA har det tufft redan utan att behöva läsa att folk lite varstans i världen i bara vad som publicerat hundra-tal kanske bygger större common sense representationer än känt indikerat från något finansierat från den kultursfären)i onödan indikerande Wikipedia ex. samkörd med Commons (också Wikimedia stiftelsen och kulturen men inriktat lagra bilder m.fl. informationsuttryck som mer komponent-baserat används i uppslagssidor.)

Och ett antar jag uppenbart svar på tekniska grundförutsättningar som hjälper oss att ta en bredare bild av en kultur ner till mindre grupper, eller blandade kulturer, eller städer, eller en enskild person, för att riktat se vad någon egentligen söker efter eller vill veta eller söka prediktera andra ongitiva eller emotionella preferenser om vad nästa steg blir eller önskas bli ligger om något ännu närmare 1980-talets rädsla för personregistret och samkörningen (jag samkör hej-vilt över många tusen dimensioner och för riktade områden ett ganska betydande antal datakällor) men det är värt att komma ihåg att vi kan fortfarande moraliskt såväl som juridiskt gå över dom gamla lagarna.


Inte helt orelaterat mer än vad en individ skriver ser jag egentligen bara ett typiskt namn-exempel resp. postnummer som tillför värde i kontext och som sådana minst sagt obetydliga annat än väldigt tidigt. Valfrihet och förståelse av vad ex. en sökmotor lagrar är ju vettigt. Jag ser heller inget problem att kunna garantera att allt data förstörs utan propagerat data som ej försvinner globala tillstånd. Andra applikationer mindre vanliga mindre troliga för egendel men väl så intressanta och indikativa kanske för åren som kommer är dock uttryckande tillstånd för personer, företag m.m. Mining så bra data vi kan och skattande en förenklad liten kognitiv grunka som i något sammanhang förklarar lite hur dom tänker och resonerar eller tänker göra. Ser vi det som problematiskt - och det kan det vara och är tror jag ofta i sammanhang mer dolda rörande hur man får tag i data och vad man gör med det - är det ändå inte helt enkelt att se bra metoder för att begränsa riskerna. Så stora mängder data är redan i vår globala gemensamma kultur i vardagligt språk genom åren. Vanligen sägande ingenting för ingen bryr sig. Men av och till för intressanta personer värda besväret att följa vad de uttryckt genom åren kanske man lär sig saker problematiska för enskilda aktörer att förstå i bredd eller avsmalnat.


Egentligen tvivlar jag på något egentligt samhällsproblem annat än kanske övergående. Viss vaksamhet kanske mot mer problematiska men resursstarka entiteter som söker icke-definierat inflytande är väl dock kanske sunt. Jag vet dock med säkerhet att t.ex. Kina trots alla sina resurser helt saknar något i närheten av att approximera personer för påverkan o.s.v. Och rörande Iran m.m. betvivlar jag det starkt även om jag egentligen vet tämligen lite om något kring deras forskning och satsningar runt data- och kognitiva modeller.


Min bakgrund under så många år i risk management och infomationssäkerhet ger mig dock en i centralitetens märkbara påverkan för de flesta väldigt överdriven preferens för att se oftast ganska esoteriska risker. Mest troligt utan varje verklighet samhällspåverkande eller kanske ens mindre (utanför traditionella domäner i konkreta fakta hittade snarare än att likt sökorden aldrig skrivna men som vi ser från en personlighet vi skattar).

Wikipedias slash-notation: Läsarvärde via större tydlighet med konstnärligt lättförståliga titlar

2013-08-20

Är givetvis ett helt funktionellt system och kanske väl upplever jag spontant uttrycka vad som är konceptets - när brand name för kändare kombinationsläkemedel ej spelar in - centralitet:


"Since no international convention exists to guide naming of standard combination drugs, this policy encourages the use of page titles containing the active constituents separated by the slash ("/") character. For example, the standard combination of isosorbide dinitrate and hydralazine, used to treat congestive heart failure in African Americans, is described in the page Isosorbide dinitrate/hydralazine."

Från: Wikipedia:Naming conventions (technical restrictions) | Wikipedia.org

Sedan när man nu fått indikation om riktning på en del mängd där man träffar på den här notationen kan man ju föreslå ett alternativt system jag tror förenklar för många Wikipedia-skribenter såväl som att ge intressanta möjligheter för projektets betydande plattformsutvecklande delar.


Intresset kring infoboxarna och vad de indikerar och ger möjlighet i datavmining är ju mycket diskuterat sedan år. Men är ju till sin natur ytterst konkretiserade fakta. För fallet ovan gäller ju delvis det men vad man egentligen söker uttrycker därför att det just är titel (i min termonologi vad jag ibland kan kalla dom yttersta do-symbolerna som ger primacy effect om vad vi förväntar oss att artikeln handlar om) viktigast ju att indikera övergripande koncept snarare än egentligen just kombinationen av substanser. Det är i ex. fallet att det överrensstämmer troligare oftare med varandra.


Vi kan förstå det kanske tydligare om vi tänker oss att biverkningar t.ex. för sidan Paracetamol/metoclopramide (jag just noterade kastades av min import som ej förstått resp. dessutom därför att jag tillsvidare också kastar allt med slash) där tänkbart (och jag föreslår absolut ingen notation för Wikipedia här) Biverkningar från Paracetamol/metoclopramide kan vara funktionellt.


Just uttrycket mellan symbolerna som skapar dessa koncept tror jag många engagerade i Wikipedia kan uppleva intressantare än t.ex. fakta-boxarna lite varierat med personlighet. Det är kanske något närmare den kreativa personligheten (som ser det bättre åtminstone tror jag jämförbart med förmåga att sätta titlar på löpsedlar för ovanliga nyheter ej standardmässiga men med potential) samtidigt som viss struktur på det kan vara gynnsamt i en uppslagsbok.


Något litet enkelt sub-språk till engelskan ungefär rekommenderat för det resp. kanske underrubriker på sikt kan vara ett alternativ. Med dom vanliga PP opertorerna i engelskan - ex. in, of, before ... - d.v.s. dess språkforms lösning för att uttrycka absoluta och/eller relativa mängd-förhållande resp. förhållande mellan mängder avvikande i dimensioner (eller så upplever jag själv att man enklast ser på PP) av typ relevanta för att tala och överleva (ex. händelser fiktiva eller spekulativa om framtiden, nu resp. hände tidigare, a är innanför b, a är del av b, a kommer före b, a agerar för b, a representerar b o.s.v.). Det är ju dessutom vad som är väldigt enkelt att illustrera visuellt som ju många bra sammanställningar finns av från den kognitiva-lingvistiken.


För ex. skulle man då standardisera på en operator för att uttrycka blandning som skapar en helhet tillsammans men där det är viktigt att veta vad som blandats (kanske bäst just kring läkemedel m.m. som kan påverka hälsa och är därmed känsligare mer udda avgränsat med egen term just här).


I allmänhet är samma operatorer för andra förhållanden enklare och passande med färre tecken - och tror jag regelmässigt enkelt att göra med hög likhet hur vi använder PP operatorerna i dagligt språk. Ex. Stockholm during World War IV in domain space:fiction men med indikationen av dimensionsrummet fiktion antagligen funktionellt med Wikipedias befintliga parentes notation.


Värdet för projektets-engagerade är ett nytt område att engagera sig inte redan inmutat av diverse kulturbärare. Ökad tydlighet för läsarna med mindre risk felnavigering kan säkert uppnås på sikt. Och signifikanta värden för mig med flera som av och till gör datamining på Wikipedia finns: Konkret reducerad cpu-tid, minnes-åtkomst och parsnings-kostnad med mer standardiserat.


På samma tema inför jag här på bloggen Up and Go operatorn innebärande att jag tilldelar via mer eller mindre ansträngd införsäljning. Agenten vi tilldelar uppgiften anges enligt Up and Go: Wikipedia Sub-culture. Kanske inför jag på sikt en ett mål för värde-riktningen bakomliggande inlägg ex. Up and Go: Wikipedia Sub-culture - Hans Value. Därmed inte jag rekommenderar samma notation för Wikipedia. Taggar och titlar är ju olika relativt läsarens användning.


Wikipedia har förövrigt samma egenskap diskuterad i jämförelsen mellan Google och Microsoft i Välkomnad till Windows: Hur störd bild av vem som äger vad skapade Linux (2013-08-19). Helt säkert av besläktade orsaker om än för Wikipedia kulturen troligt mindre maskinellt och mer via brutal head count vandrnde runt webben. Jag har genom åren goda erfarenheter av att indikera potentiella värden.

Semantic MediaWiki: Abstrahera properties till en konkret och unik entitet ||

2013-08-07

Kompletterande Semantic MediaWiki: Abstrahera properties till en konkret och unik entitet bör understrykas att det praktiskt är ett mycket begränsat antal konkreta typer möjligt eller ens vettigt att representera som här motsvarande instansierade med en övergripande "datatyp" likt GEOID.


För ett mindre antal mycket entydiga såväl som potentiellt betydelsefulla beroende på exakt vilket i vilket kontext tyckte jag att det var vettigt. Förutom GEOID inte minst GEO POLITICAL, GLOBAL POLITICAL, PERSON och ett antal till liknande. Motsvarande med mindre i domän av potentiellt agentativ också för egenskaper relaterade närmare språket ex. substantiv, adjektiv o.s.v.


Utanför det kan vi ju se hur vi kan uttrycka dem flexibla properties som uttrycker värden eller kategorier för vad dom är. Att jämföra med HAS_GEO_FEATURE i bilden till Semantic MediaWiki: Abstrahera properties till en konkret och unik entitet.


En relevant - tid mycket substansiell skillnad - är att för typer som GEOID ligger riktad quality assurance inte p.s.s. enkelt möjligt när man skapar upp tusentals typer från kategorisystem.


Utanför dessa mycket riktade typer - ex. GEOID eller PERSON - ska vi ju heller inte utgå att vi på samma "nivå av komplexitet" i kategorisystemet (osäker vad det refereras som allmänt men säg typens upplösning eller i termer jag använt tidigare dess Blue light intensity när vi istället är i abstrakta koncept istället för som här konkreta entiteter) att en instansierad entit alltid nödvändigtvis är unikt tillhörande en typ. Skapar vi nu personer unikt kan vi ju föra ner ökad exakthet bl.a. i HAS_ROLE, HAS_CITIZENSHIP m.m. men flexibelt över övriga inkluderande många tusen gör man det svårligen.


Det är korrekt att tolka core-typerna till vad vi i nyheter har som de vanligaste entiteterna definierande utanför abstrakta koncept vad vi konvergerar meningen till rörande domän, agentativa, potentiellt agentativa (ex. påverkade av vad beskrivet och kan komma att reagera på det) o.s.v. Liksom dom typiska verktygen vilka modifierar potentiellt eller konkrent agentativ entitets förmåga att agera rörande kostnad och energi-åtgång (jfr hur tillgång till kapital, yxa m.m. kan inverka på vår förmåga att hugga ner ett träd).

Semantic MediaWiki: Abstrahera properties till en konkret och unik entitet

Adderande ett presentationslager runt om algoritmer och statistiska lager riktat mot ett fåtal applikationer relaterade att få en "bild" av vad som sker nu, kan komma att ske och vad detekterat som motsvarar "komponenter" i ett perspektiv beskrivet tyckte jag WikiMedia var ett visst vågat alternativ som affärssystem men ändå beprövat i mass-data.


Data i lagret består därmed av representationer mer konstanta som länder, personer, företag, varumärken, kemiska föreningar m.m. vi kan givet en enkelt beskriven parameter kan säga har en unik representation. För att underlätta särskilt detta avgränsat (men förhoppningsvis utan att göra händelser och statistiska över tiden föränderliga uttryck som åtminstone initialt går in i samma databas när det gäller presentation onödigt slöa vid presentation) utan att kräva att jag behöver utveckla något lade jag på Semantic-mediawiki.org. Det tycktes bra då jag inte direkt är en expert på SQL-databaser även om jag svårligen sedan detta påbörjas kan påstå att jag inte kan det. Mitt intryck av Semantic Mediawiki är att så länge vi riktat står vilken view användare kan ta ut är den funktionell. Ger vi användare möjlighet att vandra runt fritt är den som förvantat riskabel därför att får cpu och minneskrävande förfrågningar blir möjliga överskridande det mindre antal sekunder som är rimlig svarstid (under förstått att faktisk funktion nödvändig klarar när riktat beskrivet underskrida orimlig komplexitet i ögonblicket eller sett till att det är förberett vilket vissa möjligheter finns i systemet men troligen för ej föränderliga data vad man lämpligen tittar på möjligheter att populera som direkt förberedda värden för).


Jag kan emellertid uppleva viss osäkerhet när det kommer till att populera in några hundra tusen till miljoner entiteter. För entiteter som i någon mening går att beskriva som unika geografiska sådana valde jag att populera dem helt utan någon presentation i sig:



Och hellre när presentation sker se det som att vi ex. från en av maximalt två PREF_LABEL uttrycka datatyperna som satta från en GEOID-sida.


Tänket övergripande betraktat från perspektiv av en kund till plattform snarare än ev. gränssnitt mot endast användare av yttre funktioner är att det abstrakta koncetet sätts centralt där möjliga instansieringar i konkret mening presenteras underliggande (i Wiki-syntax efter slash) kategoriserat efter de mer väsentliga grupperna:


  • Grupperat efter de händelse-analyserande mer väsentliga som personer, geografiska entiteter, geo political, global political, vapen, items o.s.v.
  • Och kompletterand mot semantisk och det språkliga mycket närmare - direkt i - natural language processing av enskilda meningar dv.s.s. bland annat nouns, verbs o.s.v.

I det söker jag eferlikna primacy effect vad känt hjärna för att inte onödigt i presentationslagret addera komplexitet i utveckling för mig genom att avdrifta från konkret modell.


Så från ex. ett abstrakt-koncept i benämner china kan vi ha en eller flera geo-representation där de relevanta för geoid enligt bilden tar ut värden från "geoid-sidan" med rätt motsvarande geoid. Kanske vad man upplever som lite av en omväg - jag vill gärna tycka så - men poängen med det införda systemet med Semantic Mediawiki är att underlätta och jag tror att det här är ett vettigt sätt att abstrahera konceptet för properties som kan bindas till något konkret: att låta det bli en konkret sida.


Enligt det koncetet är ex. nästan alla med ett fåtal named relations relaterade Kina som geopolitisk-aktör ej representerat för GEOID utan hamnar i instansieringen för denna unika form som får referera det GEOID som det motsvarar.

Så byter vi dörr: Att vingla till där vi faller heller än att ligga utslagen

2013-07-28

Förutom snart nog klassiska beviset för Monte Hall problemets tilltalande förklaring av vår verklighet - kanske längre ifrån vad vi spontant gärna vill se också är en del av det mänskliga - med dess utgångspunkt statistiken och sannolikhetsläran roade jag mig med ett mer "abstrakt" än strikt eller noga i härledningar m.m. från informationsteorin (finns från 2010 eller 2011 tror jag):



En tredje väg att förklara närmare intition i en tänkt mång-dimensionell värld är att vi behöver definiera dom dimensioner vi utgår från både för att göra vägen verklig för oss och "världen" (d.v.s. vi definierar verkande dimensioner som vad därmed definierande vägen). P.s.s. innan en population, subkultur, företag eller vad som helst väljer att gå vägen och faktiskt konkret lyckas med den finns den sällan för oss.


Väljer vi nu att definiera om världens dimensioner till att inkludera möjligheten kan vi visst se det tidigt. Mer än så kan vi kanske ibland göra väg farbar för dem. I en större värld vad som inte behöver vara mer än att vi ser vägen och går den liksom många andra.


Har dörr två brunnit upp är det bästa om vi redan tagit oss en titt på den tredje dörren. Och vem vet? Kanske är den vägen bättre än den väg vi redan nästan börjat vandra ned för? Byter vi dörr är det förändring och i människans värld med så kraftfullt fungerande modeller baserade på markov-antaganden vad vi i flock och person tenderar att skatta från världen där vi står. Så om vi rör oss i den mångdimensionella världen av flockar av människor varför skulle vi inte byta? Mer en språklig-visualitet än ett bevis eller ens matematiskt argument men inte utan värde att reflektera över.


Praktiskt konkret verkligt många gånger oftare innebär att vi definierar om världen att vi ser vad vi innan inte såg d.v.s. vi stirrar oss inte blind på den värld som dog.


Jämför gärna med hur många (relativt vad man tycker är vettigt för mentalt sunda personer i övrigt) i Sverige definierat en flock-tillhörighet och fört emotionell kraft och pay-load från det så brett att vi fortfarande tills för ett fåtal år sedan av och till kunde se ganska seriösa försvar av den Nordkoreanska diktaturen.


Med mindre än de får någon form av ekonomiskt ersättning därifrån vilket verkligen är att betvivla är det svårt att se vilken värde det ger personen och om man vågar ifrågasätta det inlärda vad de heller inte han se att utgångspunkten ger någon annan. Möjligen rent av lite skada för ganska många om än försvinnande liten jämfört med det mer konkreta där som att kommentera ut tusentals till att dö i lerjorden krävande med mankraft för att förstöra jorden ytterligare eller värre.


Det finns en kognitiv kostnad att förändra vårt perspektiv. Att flytta kostnad för att ta in den information som ger oss indikationer och hellre läsa och tycka vad vi har lust tills där indikerat är en delvis funktionell väg. I den organiserade gruppen föreligger givetvis sedan av och till en pedagogisk utmaning. I ett demokratiskt system är det senare vad vi inte ska stressa upp oss över som problem. Den större gruppen tenderar om än benägen att hålla kvar perspektiv till att komma mer rätt än det mesta i övrigt om man ger det lite tid (jämför t.ex. 1900-talets utveckling i Europa och Nordamerika med övriga världen).


I kroppen kan det ofta växla approximativt binärt eller vad vi upplever som det (emergence). En upparbetad potential som orkar till att växla fler och fler mer märkbart i kollektivt språk och därigenom om vi så vill utlösande förändringen i övrigt. Att se andra göra eller tycka är väldigt starkt när det är nytt, i relativ ögonblicket innan diskret steg för steg växande, och intensivt är potent.


Ett cyniskt kanske lite pessmimistiskt sätt att uttrycka det på är att vi står där vi faller: . Tills vi går därifrån eller står kvar.