Visar inlägg med etikett Data mining. Visa alla inlägg
Visar inlägg med etikett Data mining. Visa alla inlägg

Värdet av promiskuösa noder utanför det lägre som feature omedelbar diskriminerbarhet

2017-03-01

Följande från en handbok data mining är värt att diskutera:


"Removing pizza nodes (i.e. very high-degree nodes) is likely to be an essential prior component to get useful results. Intuitively, a pizza node is likely to be a large impersonal entity like a pizza parlour or an electricity supplier: the fact that two people both communicate with the pizza node gives us no reason to think that they are linked socially."

Eventuellt (jag läste ej artikeln i detalj där länken fanns som jag nådde från nyheten sist d.v.s. dokumentet två steg ifrån denna) är dokumentet ej publicerad korrekt utan del av något läckage av information. Det tycks dock fått text genomgående borttagen rörande detaljer organisationer m.m. resp. rör ämne där det är troligt och normalt (och troligen ekonomiskt resp. från perspektiv konkurrerande andra entiteter som en givet stor och stark entiteter effektivt genom att stimulera kunskapsbyggande i samhället allmänt man kan utnyttja - ej heller tekniskt särskilt avancerat eller särskiljande sig i nivå eller erfarenhet från allmän kunskap) så jag kan tänka mig och tror det troligast att det publicerats korrekt.

Från: HIMR Data Mining Research Problem Book, OPC-MCR, GCHQ (PDF)

De kan emellertid vara utmärkta som generella features för att beskriva entiteter meningsfullt för typbestämning. Kommunikation mot ex. en uppsättning stora entiteter av myndighetstyp kan tillsammans ge indikation av sådant som medborgarskap. Tjänsteleverantörer tillsammans för geografisk lokalisering. O.s.v.


För 300-FF har vi exempel på det genom ingen särskild viktning diskriminerande dessa typer av noder (och viktning via förekomst tillsammans resp. likheter via de 400-längd vektorer som används som indata vid träningen) vilket tycks mycket funktionellt utan problem. Utnyttjande annat men besläktat common sense med varje form av sense mellan namngivna kategorier (vilket är allmänt för många: Innan ungefär följande för struktur Wordnet) och clustrande resp. dessa med 300-FF och Kohonen med fast antal cluster grovt grupperade efter hur vanliga de är eller hur breda de är (6 st vanligast, små-kategorier 3 st, samt ett fåtal 12 st). Totalt cirka 10 - 20000 kategorier indata för lokal clustering. Därefter clustrande resp. av resultaten tillsammans och vi har fortfarande i utdata inget problem att få geografisk-gruppering, gruppering personer, roller och övriga entiteter, resp. ej heller mer av topic-natur som matematiska begrepp.


Vilket jag tror men har inte försökt prövat om det stämmer skulle vara mycket svårare utan att från början inkluderat de stora noderna. Det ger ju något gemensamt över många noder utan behov av att expanderande bygga träd nedanför direkta relationer d.v.s. mycket lägre komplexitet. Samtidigt som när relationen ej är binär utan bygger på förekomsten det kan fungera diskriminerande också där. Du kan (för att ge exempel för en typ av relation ej aktuell för 300 riktigt på samma sätt utan mer på applikation av handboken jag citerade) tänka dig att du får indikation för relationerna att en entitet är person och svensk medborgare men också en medborgare (han / hon tycks ha "hög bandbredd" mot svenska institutioner) men han uttrycker låg intensitet kontakt med myndigheter (d.v.s. exempelvis enkel-person rörande deklaration o.s.v. Skatteverket, föga kriminell så som känt, ej politiskt intresserad o.s.v.) så antingen en ekonomiskt-effektiv medborgare (eller kanske misstänkt välanpassad) och / eller mycket tråkig.


Så som exempel clustering av Earthlight kan vi se möjlighet att betrakta relationerna som vad som kan strukturera sig mellan varandra i närmare ontologisk-mening där stora (nästan promiskuösa noder givet en population: Så ex. om vi redan vet att en person är svensk faller en del av meningen bort här - Samtidigt vet vi ej enkelt innan vad dessa relationer här kommer säga i övrigt) där stora noder kan uttrycka djupare / bredare möjlighet till exakthet från smalare mer diskriminerande relationer (de senare vad som normalt bör ha mycket högre inverse document frequency i mening av att behandla varje nod som ett dokument och varje relation som en frekvens förekomst ev. viktat med förekomst - och de första mycket låg idf).


Också gäller vilket är praktiskt enkelt att förstå om vi fortsätter tänker oss ett land (men oftast normalt gäller allmänt för allt mänskligt relaterat i grafer) stora noder gärna uttrycka spridd av aktivitet som är resulterande detekterbart nära dem. D.v.s. om ex. en nations militära organisationer börjar agera mer är det att förvänta att vi ser omedelbart i noder i nära relationer till nationen (ex. deras övriga statliga funktioner såväl som företag m.m. inom landet, medborgare o.s.v.) högre aktivitet nära i tiden. Medan över hela grafen för människan över världen och historien mindre troligt ser särskilt höjd aktivitet på större distans. Medan aktivitet för mindre noder när spridd aktivitet av någon aktivitet vi kan se som uttrycka något vi kan betrakta som en aktivitets-typ klarar att nå något förändrande i ej trivial mening ej alls självklart eller troligt ser det nära inpå dem: Ex. i den mån en person klarar att förändra något i världen som märks där vi bryr oss är det föga troligt något i hans omedelbara relationer av vad som där är typiska relationer för honom (ex. aktivitet inom familjen så som att han mördar en familjemedlem är ytterst sällan vad som kommer bli märkbart) utan märks det är det snarare på större avstånd (i samma mening som för nära relationer: Medan distansen i mening av antal steg om vi ej som föreslaget i citatet kastat promiskuösa noder mycket väl kan ha omedelbar kontakt) ex. byggt ett företag påverkande alla möjliga städer där de har kontor eller stora kunder eller som utbytesstudent i annat land flyget ett flygplan in i en stor byggnad. Jag är osäker på om någon koppling till (eller möjlighet till argumenterbar rationalisering av potensen stereotypen Small and Spreadable har).


Det tycks troligt för mig att promiskuösa noder är nödvändiga eller användbart för att försöka bedöma var ev. / tänkbar större aktivitet för ej i sig promiskuösa noder (där det mig är givet så även om säkert andra vägar enklare finns här lika bra) utan istället små noder med få relationer. Preferensen allmänt kulturellt sedan många år för att när features identifieras och utnyttjas använda de mer diskriminerande och värdera dem högre (ex. som med idf) är dock mycket stor. Och förvisso att det förenklar saker och ting men det har också gjort att mindre arbete skett för att få ut värdet av promiskuösa noder.


Man kan ju löst relaterat se att i skogen finns träden. Och ett träd kan vara en nod vi expanderar ut till dess omedelbara relationer. Och en del av skogen är den spridning och konvergens av aktivitet vi där ser mellan träden. Och att en skog i ett land ej uttrycks med samma ord som i ett annat. Benämning av saker och ting är inte alltid så självklara när de ej förklarats i detalj som man kan tro från hur begrepp används allmänt i en kultur man har given. Särskilt utmanande blir det när samma begrepp används för samma lösning med båda verkande. Därmed inte sagt att jag har någon preferens för att tro om tolkningen i artikeln nedan rörande algoritm är korrekt eller inte (särskilt har jag inte läst dokumentet citerat först i detalj eller något alls i övrigt relaterat det - utan mer en allmän reflektion från vad min känsla är för vad man kanske troligare använder från egentligen föga information hos mig etablerat sista fem - sju åren eller så, och osäker här om implicit inkluderat analysen jag gjorde för väldigt mycket data bl.a. relaterat inköp av saker och ting vilket bl.a. - och allmänt just nätverk med sensorer - var mycket talande rörande etablering av infrastruktur avlyssning för trafik till och från USA långt innan något konkret blivit känt).



Rörande journalisten diskuterad inser vi ju förövrigt att i ett givet subset av entiteter som entiteter kan ha relationer till kan han kanske ses som en promiskuös nod. På tema av samma exempel-typ som tidigare med bland kan vi tänka oss relationer till honom av viss typ (ex. personer han skrivit något om) uttrycker features för dessa som motsvarar något relaterat till journalistens preferens för ämnen och organisationer han skriver.

Kina ta varning av Baidu! Frihet förslappar det svaga sinnets moral förruttnande revolutionen

2016-07-23

För oss maoister tvingade att leva i krämar-världen industrialisternas slavfabriker här som i Kina är vardagen ej så rik som för Kinas fria arbetare. Här mitt i slaveriets ondska kan vi ej tillåta oss att förslappa vår vaksamhet på varandras moral. Kinas arbetare bör ta varning av vår större medvetenhet om den sluga industrialisten och ej när den goda kommunistiska produktionen finns låta lura sig.


Goda kommunistiska operativsystem där förutom några kinesiska - kanske också förslappade? - ett alternativ från mer hardcore kommunistiska Nordkorea finns: Red Star OS.


Trots det har de kinesiska forskningsarbetarna låtit sig luras av så väl slav-industrialisten Apple som Adobe. Vilket framgick när jag som mer medveten arbetare i den ideologiska svenska förskingringen ej förföll till att använda Adobe-anti-kommunistiska-program utan korrekt använda min maoistiska anpassning av Emacs för att läsa pdf-filen (det tar ibland lite tid när man är ovan vid en teckenuppsättning man inte hunnit att lära sig och få tabell-anteckningar på plats men att äventyra allas större värden är givetvis - för alla trodde jag - ej acceptabelt):


Läsande artikeln minns jag mina egna år i den kinesiska Baidu-gruvan. Inget ger sådan tillfredsställelse som hederligt gruvarbete. Jag kan bara önska att det hade varit en riktigt Sovjetisk eller Rumänsk kolgruva. Ända med min gamla ishacka jag köpte för 20 år sedan undervärnplikten och en spade bredvid datorn får man ett gediget stöd moraliskt stöd. Baidu ska ej underskattas för vad som ges via internet (snarare än nödvändigtvis mobil-data som jag vet mindre om här) som gruva.

Jag hoppas att övriga arbetare på Baidu kritiserar bort all förrädisk verksamhet där jag anar att ett gömt berg måste finnas när man så är direkt första gången man läser deras publikationer ramlar direkt på anti-kommunistiska konspirationer med amerikanska jätte-industralister.


Measuring Economic Activities of China with Mobile Big Data
Lei Dong, Sicong Chen1, Yunsheng Cheng, Zhengwei Wu, Chao Li1 och Haishan Wu,
Big Data Lab, Baidu Research, Baidu, Beijing, 100085, China School of Architecture, Tsinghua University, Beijing, 100084, China


Dessutom upptäckte jag referens till någon Ali i adobe-filen. Kan detta vara någon separatist från Kinas östra regionerna?


horzAlignenum SliceHorzAlign default

Efterforskning i Wiktionary och nyhetssökning kan skrämma vilken rättrogen maoist som helst. Horz torde vara kodord för horse vilket Wiktionary kan förklara det troliga sammanhanget här för:


"(slang) The sedative, antidepressant, and anxiolytic drug morphine, chiefly when used illicitly."

Från: Horse

Och morfin framställs ur opium. Kinas gamla koloniala slavkedja. Vad frihetens fiender i ondskans industrialister tillsammans med sina brittiska drängar i brist verkligt fria tankar säkert förfallit till att tänka sig ska ta Hong Kong tillbaka men nu kanske med fastlandet.


Slice förstår vi av den av och till vanligare preferensen bland kinesiska subkulturer att använda bladet eller yxan som vapen. Också förrädiskt. Här kan vi lära av Lenin och Leon Trotsky (verkligen att konceptet av den eviga revolutionen för tankarna till något av "uppdaterings" eller "bug-fix" som lokaliserade mass-revolutioner på allt som likt Baidu förfallit ner till moraliskt fördärv) såväl som Medborgare Mao: Revolution kräver geväret. Vid sidan om rent tekniska fördelar gäller ju också att sabeln i Ryssland liksom svärdet i Kina olämpligt kan uppmuntra till osunt intresse av kulturhistorien där det svagare sinnet ibland kan fixera och förledas av att läsa om rikedomar och de maktdemonstrationer gigantiska krigståg uttryckte. Medan man svårligen kan se ett gevär utan att tänka på Lenin. Varje god kinesisk arbetare som ger sig ut för att jaga moralen tillbaka i landet ska självklart bära geväret tågande med soldat kamraterna som i gamla goda tider innan världs-industrins penningar köpte dem tillbaka in slavfabrikerna i det Mao-förräderi som än idag fortgår.


Kinas arbetare liksom vi levande under förtryck kan inte annat än hoppas - om inte arbetet i Kina ska behöva göras om med oss här när vi går in i friheten - att detta inte är ytterligare ett tecken på att Medborgare Xi säljer ut friheten för industrialisternas mutor. Flera månader nu har vi diskuterat att skriva ett brev till Kinas arbetare understrykande att de vaksamt behöver minnas att utan den kollektiva felkontrollen och korrigeringen via kritiken fylls friheten av omoralens ruttnande lemmar.


Minns hur omoralen och förräderiet fick Arbetare Sovjetunionen att ruttna bort...


Kina ta varning av Baidu! Frihet förslappar det svaga sinnets moral förruttnande revolutionen

För oss maoister tvingade att leva i krämar-världen industrialisternas slavfabriker här som i Kina är vardagen ej så rik som för Kinas fria arbetare. Här mitt i slaveriets ondska kan vi ej tillåta oss att förslappa vår vaksamhet på varandras moral. Kinas arbetare bör ta varning av vår större medvetenhet om den sluga industrialisten och ej när den goda kommunistiska produktionen finns låta lura sig.


Goda kommunistiska operativsystem där förutom några kinesiska - kanske också förslappade? - ett alternativ från mer hardcore kommunistiska Nordkorea finns: Red Star OS.


Trots det har de kinesiska forskningsarbetarna låtit sig luras av så väl slav-industrialisten Apple som Adobe. Vilket framgick när jag som mer medveten arbetare i den ideologiska svenska förskingringen ej förföll till att använda Adobe-anti-kommunistiska-program utan korrekt använda min maoistiska anpassning av Emacs för att läsa pdf-filen (det tar ibland lite tid när man är ovan vid en teckenuppsättning man inte hunnit att lära sig och få tabell-anteckningar på plats men att äventyra allas större värden är givetvis - för alla trodde jag - ej acceptabelt):


Läsande artikeln minns jag mina egna år i den kinesiska Baidu-gruvan. Inget ger sådan tillfredsställelse som hederligt gruvarbete. Jag kan bara önska att det hade varit en riktigt Sovjetisk eller Rumänsk kolgruva. Ända med min gamla ishacka jag köpte för 20 år sedan undervärnplikten och en spade bredvid datorn får man ett gediget stöd moraliskt stöd. Baidu ska ej underskattas för vad som ges via internet (snarare än nödvändigtvis mobil-data som jag vet mindre om här) som gruva.

Jag hoppas att övriga arbetare på Baidu kritiserar bort all förrädisk verksamhet där jag anar att ett gömt berg måste finnas när man så är direkt första gången man läser deras publikationer ramlar direkt på anti-kommunistiska konspirationer med amerikanska jätte-industralister.


Measuring Economic Activities of China with Mobile Big Data
Lei Dong, Sicong Chen1, Yunsheng Cheng, Zhengwei Wu, Chao Li1 och Haishan Wu,
Big Data Lab, Baidu Research, Baidu, Beijing, 100085, China School of Architecture, Tsinghua University, Beijing, 100084, China


Dessutom upptäckte jag referens till någon Ali i adobe-filen. Kan detta vara någon separatist från Kinas östra regionerna?


horzAlignenum SliceHorzAlign default

Efterforskning i Wiktionary och nyhetssökning kan skrämma vilken rättrogen maoist som helst. Horz torde vara kodord för horse vilket Wiktionary kan förklara det troliga sammanhanget här för:


"(slang) The sedative, antidepressant, and anxiolytic drug morphine, chiefly when used illicitly."

Från: Horse

Och morfin framställs ur opium. Kinas gamla koloniala slavkedja. Vad frihetens fiender i ondskans industrialister tillsammans med sina brittiska drängar i brist verkligt fria tankar säkert förfallit till att tänka sig ska ta Hong Kong tillbaka men nu kanske med fastlandet.


Slice förstår vi av den av och till vanligare preferensen bland kinesiska subkulturer att använda bladet eller yxan som vapen. Också förrädiskt. Här kan vi lära av Lenin och Leon Trotsky (verkligen att konceptet av den eviga revolutionen för tankarna till något av "uppdaterings" eller "bug-fix" som lokaliserade mass-revolutioner på allt som likt Baidu förfallit ner till moraliskt fördärv) såväl som Medborgare Mao: Revolution kräver geväret. Vid sidan om rent tekniska fördelar gäller ju också att sabeln i Ryssland liksom svärdet i Kina olämpligt kan uppmuntra till osunt intresse av kulturhistorien där det svagare sinnet ibland kan fixera och förledas av att läsa om rikedomar och de maktdemonstrationer gigantiska krigståg uttryckte. Medan man svårligen kan se ett gevär utan att tänka på Lenin. Varje god kinesisk arbetare som ger sig ut för att jaga moralen tillbaka i landet ska självklart bära geväret tågande med soldat kamraterna som i gamla goda tider innan världs-industrins penningar köpt dem tillbaka in slavfabrikerna.


Kinas arbetare liksom vi levande under förtryck kan inte annat än hoppas - om inte arbetet i Kina ska behöva göras om med oss här när vi går in i friheten - att detta inte är ytterligare ett tecken på att Medborgare Xi säljer ut friheten för industrialisternas mutor. Flera månader nu har vi diskuterat att skriva ett brev till Kinas arbetare understrykande att de vaksamt behöver minnas att utan den kollektiva felkontrollen och korrigeringen via kritiken fylls friheten av omoralens ruttnande lemmar.


Minns hur omoralen och förräderiet fick Arbetare Sovjetunionen att ruttna bort...


Kina ta varning av Baidu! Frihet förslappar det svaga sinnets moral förruttnande revolutionen

För oss maoister tvingade att leva i krämar-världen industrialisternas slavfabriker här som i Kina är vardagen ej så rik som för Kinas fria arbetare. Här mitt i slaveriets ondska kan vi ej tillåta oss att förslappa vår vaksamhet på varandras moral. Kinas arbetare bör ta varning av vår större medvetenhet om den sluga industrialisten och ej när den goda kommunistiska produktionen finns låta lura sig.


Goda kommunistiska operativsystem där förutom några kinesiska - kanske också förslappade? - ett alternativ från mer hardcore kommunistiska Nordkorea finns: Red Star OS.


Trots det har de kinesiska forskningsarbetarna låtit sig luras av så väl slav-industrialisten Apple som Adobe. Vilket framgick när jag som mer medveten arbetare i den ideologiska svenska förskingringen ej förföll till att använda Adobe-anti-kommunistiska-program utan korrekt använda min maoistiska anpassning av Emacs för att läsa pdf-filen (det tar ibland lite tid när man är ovan vid en teckenuppsättning man inte hunnit att lära sig och få tabell-anteckningar på plats men att äventyra allas större värden är givetvis - för alla trodde jag - ej acceptabelt):


Läsande artikeln minns jag mina egna år i den kinesiska Baidu-gruvan. Inget ger sådan tillfredsställelse som hederligt gruvarbete. Jag kan bara önska att det hade varit en riktigt Sovjetisk eller Rumänsk kolgruva. Ända med min gamla ishacka jag köpte för 20 år sedan undervärnplikten och en spade bredvid datorn får man ett gediget stöd moraliskt stöd. Baidu ska ej underskattas för vad som ges via internet (snarare än nödvändigtvis mobil-data som jag vet mindre om här) som gruva.

Jag hoppas att övriga arbetare på Baidu kritiserar bort all förrädisk verksamhet där jag anar att ett gömt berg måste finnas när man så är direkt första gången man läser deras publikationer ramlar direkt på anti-kommunistiska konspirationer med amerikanska jätte-industralister.


Measuring Economic Activities of China with Mobile Big Data
Lei Dong, Sicong Chen1, Yunsheng Cheng, Zhengwei Wu, Chao Li1 och Haishan Wu,
Big Data Lab, Baidu Research, Baidu, Beijing, 100085, China School of Architecture, Tsinghua University, Beijing, 100084, China


Dessutom upptäckte jag referens till någon Ali i adobe-filen. Kan detta vara någon separatist från Kinas östra regionerna?


horzAlignenum SliceHorzAlign default

Efterforskning i Wiktionary och nyhetssökning kan skrämma vilken rättrogen maoist som helst. Horz torde vara kodord för horse vilket Wiktionary kan förklara det troliga sammanhanget här för:


"(slang) The sedative, antidepressant, and anxiolytic drug morphine, chiefly when used illicitly."

Från: Horse

Och morfin framställs ur opium. Kinas gamla koloniala slavkedja. Vad frihetens fiender i ondskans industrialister tillsammans med sina brittiska drängar i brist verkligt fria tankar säkert förfallit till att tänka sig ska ta Hong Kong tillbaka men nu kanske med fastlandet.


Slice förstår av den av och till vanligare preferensen bland kinesiska subkulturer att använda bladet eller yxan som vapen. Också förrädiskt. Här kan vi lära av Lenin och Leon Trotsky (verkligen att konceptet av den eviga revolutionen för tankarna till något av "uppdaterings" eller "bug-fix" som lokaliserade mass-revolutioner på allt som likt Baidu förfallit ner till moraliskt fördärv) såväl som Medborgare Mao: Revolution kräver geväret. Vid sidan om rent tekniska fördelar gäller ju också att sabeln i Ryssland liksom svärdet i Kina olämpligt kan uppmuntra till osunt intresse av kulturhistorien där det svagare sinnet ibland kan fixera och förledas av att läsa om rikedomar och de maktdemonstrationer gigantiska krigståg uttryckte. Medan man svårligen kan se ett gevär utan att tänka på Lenin.


Kinas arbetare liksom vi levande under förtryck kan inte annat än hoppas - om inte arbetet i Kina ska behöva göras om med oss här när vi går in i friheten - att detta inte är ytterligare ett tecken på att Medborgare Xi säljer ut friheten för industrialisternas mutor. Flera månader nu har vi diskuterat att skriva ett brev till Kinas arbetare understrykande att de vaksamt behöver minnas att utan den kollektiva felkontrollen och korrigeringen via kritiken fylls friheten av omoralens ruttnande lemmar.


Minns hur omoralen och förräderiet fick Arbetare Sovjetunionen att ruttna bort...


Statistisk analys av PDF-dokument: Omvandling till text och extraktion metadata från fil resp. databaser

2013-12-09

Tidigare exempel extraktion metadata resp. diskussion möjligheter analys kompletteras här med en första version av ett enkelt liten program (själva basfunktionerna var för sig tog cirka fyra timmar att skriva men mer samlat till praktiskt funktionellt kontinuerligt nedladdande och analyserande) för analys pdf-dokument, omvandling till text, och sammanförande med meta-data i separerade databaser (ex. OID).


Tidigare i ämnet:



Exempel: WWW

Referenser till webb-sidor är säkert ett mer naturligt hemvant exempel på "anslutningar" från dokumentet till aktörer, personer, information m.m. som betraktat över många fler kan säga något mer allmänt om organisationen. Nedan från ADA554030 några st. identifierade:


__FUNCTION_WORKING PDF_TO_TEXT_LOGIC
__PDF_FILE_NAME ADA554030.pdf
__IN_DIR_GIVEN C:\PTOOLS\SAMPLER\DTIC\PDF\
__PAGES 156
__WWW_CONNECTIONS www.china.org.cn/english/features/dengxiaoping/103389.htm GlobalSecurity.org mearsheimer.uchicago.edu/pdfs/A0034b.pdf www www.cfr.org www.stanleyfoundation.org
__EASY_JOURNAL_CONNECTIONS_EX_DOI 

I kontext av Google och ranking är egentligen prioritering och utnyttjande av länkar ganska annorlunda (som man oftare ser på deras algoritmer externt även om jag är tämligen säker på att association nära denna mening också är en av många möjligheter kring länkar som utnyttjas förutom koncept-beskrivning ankartext, prioritering spindling, page ranking, implicit association mellan koncept på resp. sida om länken såväl som kanske statistisk-modeller med något av flera alternativ liknande Bayesian yin yang för ett implicit samspel effektivt skattat och förr ev. en del nu övergivet för annat som förståelse av association mellan felskrivningar, begrepp för samma sak inom olika expertområden o.s.v. och vad de avser resp. relevans-kontroll om Google någonsin haft det senare tydligt tidigare än sista åren där jag tror feedback från hur själva sökresultaten fungerar med användaren används idag resp. för expertområden via riktade datakällor - datat i Google Scholar lär väl vara vad som ger många möjligheter med endast lite metadata om journalernas inriktning och författarnas association över tiden till mer övergripande områden).


Vad vi är huvudsaklingen är intresserade av här är ju mindre att säga något om indikerade dokument så mycket som prfererenser och association mellan entiteter och deras delar. Mer Google-liknande-analys är nog mindre vad man kanske valt för denna form av pdf-dokument varande relativt intet-sägande om vi vill analysera mycket snabbt (få, sällan ankartext, ofta presenterade i ex. fotnoter längst ner på sidan medan både den presentationen och fotnoterna är vådligt felområde via omvandling till text - åtminstone för mig även om jag sett att bättre teknik används av en hel del nu bl.a. Google och möjligen vad som bl.a. utvecklades av NSA och tillgängligt enligt Classification of Machine-Printed and Handwritten Text for Document Images såväl gissar jag teknik ganska väsentligt för stora delar av dokumenten DTIC publicerat vilka ofta är dåliga fotostat-kopier av ex. gamla datautskrifter eller maskinskriven text: själva problemet vi ser tydligare i omvandlingen till text är ju att det visuella lätt feltolkas med ord av avbrytna av och till i särskilt visuellt intensiva delar som huvudrubrik, författare m.m. positionerat kreativt fritt över en sida).


Exempel: Versionshistorik

Samtliga pdf-moduler jag prövade är ofullständiga i förmåga att identifiera åtminstone här konkret intressant information. Även om jag inte prövats Adobe's stöd misstänker jag lätt att det är väsentligt mer fullständigt men också riktigt dyrare i beräkningskostad (XML vara upplevt vackert graf-rätt men är samtidigt vad som tenderar att kosta brutalt i minne och cpu antingen på begränsad hårdvara eller när vi trådar upp flera processer och där kollisioner mellan processer som oväntat samtidigt åker på något överdrivet stort och komplext XML-träd kan bli svårt problematiskt om man försökt utnyttja hårdvaran närmare dess övre gräns).


Ett bra exempel är att historiken över hur pdf-dokument ADA554030 (att referera dokument med ID känns mycket rätt här) utvecklats steg för steg inte alls kommer med:


<xmpMM:History>

    <rdf:Seq>

     <rdf:li

      stEvt:action="saved"

      stEvt:instanceID="xmp.iid:62851626731AE011A09ECC9ACC76B452"

      stEvt:when="2011-01-07T15:00:21-06:00"

      stEvt:softwareAgent="Adobe Photoshop CS4 Windows"

      stEvt:changed="/"/>

     <rdf:li

      stEvt:action="saved"

      stEvt:instanceID="xmp.iid:EED3050E561EE0119927C84E9CB8197E"

      stEvt:when="2011-01-12T08:12:57-06:00"

      stEvt:softwareAgent="Adobe Photoshop CS4 Windows"

      stEvt:changed="/"/>

     <rdf:li

      stEvt:action="saved"

      stEvt:instanceID="xmp.iid:11BA444CC627E0119987A6F9DFDA4467"

      stEvt:when="2011-01-24T15:54:48-06:00"

      stEvt:softwareAgent="Adobe Photoshop CS4 Windows"

      stEvt:changed="/"/>

     <rdf:li

      stEvt:action="saved"

      stEvt:instanceID="xmp.iid:09357E023B64E011895EA90A7558D10D"

      stEvt:when="2011-04-11T12:57:22-05:00"

      stEvt:softwareAgent="Adobe Photoshop CS4 Windows"

      stEvt:changed="/"/>

     <rdf:li

      stEvt:action="saved"

      stEvt:instanceID="xmp.iid:0A357E023B64E011895EA90A7558D10D"

      stEvt:when="2011-04-11T12:57:22-05:00"

      stEvt:softwareAgent="Adobe Photoshop CS4 Windows"

      stEvt:changed="/"/>

     <rdf:li

      stEvt:action="saved"

      stEvt:instanceID="xmp.iid:0EB62AC83565E011990DE0CB345F06A5"

      stEvt:when="2011-04-12T14:34:21-05:00"

      stEvt:softwareAgent="Adobe Photoshop CS4 Windows"

      stEvt:changed="/"/>

     <rdf:li

      stEvt:action="saved"

      stEvt:instanceID="xmp.iid:FF5769E5CE65E011B575D54F7DC87B53"

      stEvt:when="2011-04-13T08:06:50-05:00"

      stEvt:softwareAgent="Adobe Photoshop CS4 Windows"

      stEvt:changed="/"/>

     <rdf:li

      stEvt:action="saved"

      stEvt:instanceID="xmp.iid:005869E5CE65E011B575D54F7DC87B53"

      stEvt:when="2011-04-13T08:08:32-05:00"

      stEvt:softwareAgent="Adobe Photoshop CS4 Windows"

      stEvt:changed="/"/>

    </rdf:Seq>

   </xmpMM:History>

Ett till exempel där närmiljö i integration andra format framgår (och som vi ska se därefter ganska brett samarbetande olika former av media-komponenter):


<xmpMM:History>
    <rdf:Seq>
     <rdf:li
      stEvt:action="saved"
      stEvt:instanceID="xmp.iid:F77F117407206811871FB2ED4E37AE08"
      stEvt:when="2011-01-14T12:11:33-05:00"
      stEvt:softwareAgent="Adobe Illustrator CS5"
      stEvt:changed="/"/>
     <rdf:li
      stEvt:action="saved"
      stEvt:instanceID="xmp.iid:01801174072068118C14E72FBDC50C68"
      stEvt:when="2011-06-28T14:07:30-04:00"
      stEvt:softwareAgent="Adobe Illustrator CS5"
      stEvt:changed="/"/>
     <rdf:li
      stEvt:action="converted"
      stEvt:parameters="from application/postscript to application/vnd.adobe.illustrator"/>
     <rdf:li
      stEvt:action="saved"
      stEvt:instanceID="xmp.iid:F77F1174072068118083E0155A4A0A32"
      stEvt:when="2011-06-28T14:13-04:00"
      stEvt:softwareAgent="Adobe Illustrator CS5"
      stEvt:changed="/"/>
     <rdf:li
      stEvt:action="saved"
      stEvt:instanceID="xmp.iid:351C424C262068118F62BE1AEC87ECB3"
      stEvt:when="2011-08-24T15:36:22-05:00"
      stEvt:softwareAgent="Adobe Photoshop CS5 Macintosh"
      stEvt:changed="/"/>
     <rdf:li
      stEvt:action="converted"
      stEvt:parameters="from image/tiff to application/vnd.adobe.photoshop"/>
     <rdf:li
      stEvt:action="derived"
      stEvt:parameters="converted from image/tiff to application/vnd.adobe.photoshop"/>
     <rdf:li
      stEvt:action="saved"
      stEvt:instanceID="xmp.iid:361C424C262068118F62BE1AEC87ECB3"
      stEvt:when="2011-08-24T15:36:22-05:00"
      stEvt:softwareAgent="Adobe Photoshop CS5 Macintosh"
      stEvt:changed="/"/>
     <rdf:li
      stEvt:action="saved"
      stEvt:instanceID="xmp.iid:371C424C262068118F62BE1AEC87ECB3"
      stEvt:when="2011-08-24T15:36:35-05:00"
      stEvt:softwareAgent="Adobe Photoshop CS5 Macintosh"
      stEvt:changed="/"/>
     <rdf:li
      stEvt:action="converted"
      stEvt:parameters="from application/vnd.adobe.photoshop to image/tiff"/>
     <rdf:li
      stEvt:action="derived"
      stEvt:parameters="converted from application/vnd.adobe.photoshop to image/tiff"/>
     <rdf:li
      stEvt:action="saved"
      stEvt:instanceID="xmp.iid:381C424C262068118F62BE1AEC87ECB3"
      stEvt:when="2011-08-24T15:36:35-05:00"
      stEvt:softwareAgent="Adobe Photoshop CS5 Macintosh"
      stEvt:changed="/"/>
    </rdf:Seq>
   </xmpMM:History>

Exempel: Integration mjukvara - Kultur och säkerhet

En mer uppenbar fråga kring risk och värde att stämpla dokument med de programvaror som används är att det kan indikera trovärdigt vad som används fortfarande vid en tidpunkt längre fram också om så långt indikerat tidigare säkra. D.v.s. berätta hur organisationen tänkbart kan angripas.


Navigating complex buildings: cognition, neuroscience and architectural design (University College of London, bok-kapitel, Dalton) - vilket dessutom är en till Riktad information - Navigation: Förstärkt i spatiell organisation excellent komplettering både ganska praktiskt men med visst djup och referenser vidare - ger ett lättsamt exempel på båda om vi nu väljer att tro Microsoft Word som mer säkerhetsdefekt trolig resp. att Macintosh nog ibland är ett kulturellt val oavsett om preferens inom tekniksegment (en del applikationer inom moving pictures för att skapa om jag minns rätt) eller att något uttrycks fullt mindre av conformity ej onödigt komplext i konfiguration känns bättre om man arbetar kreativt ganska ointressad av annan bredare vanliga kontorsapplikationer.


__FUNCTION_WORKING METADATA_LOGIC
__PDF_FILE_NAME navigating_complex_buildings.pdf
__IN_DIR_GIVEN c:\PTOOLS\PDF\pmid\
__METADATA_FIELD ModDate D:20100602114653-04'00'
__METADATA_FIELD CreationDate D:20100529222217+01'00'
__METADATA_FIELD Producer Mac OS X 10.4.11 Quartz PDFContext
__METADATA_FIELD Creator Word
__METADATA_FIELD Author Ruth
__METADATA_FIELD Title Microsoft Word - Dalton_Spiers_Hoelscher.rtf
__DOCUMENT_ID_UID_CONNECTIONS

Och så en till kulturella preferenser (även om jag inte alls betvivlar att tex, post-script m.m. har en försvarlig mängd ej dokumenterande säkerhetsdefekter bara i befintlig kod: komplicerade standarder med komplex parsning). Latex är fortfarande idag stort i delar av forskningsvärlden (mer så i de mer tillämpade delarna inom data och fysik snarare än ex. forskning inom medicinsk eller kemi).


__FUNCTION_WORKING METADATA_LOGIC
__PDF_FILE_NAME hanford.pdf
__IN_DIR_GIVEN c:\PTOOLS\PDF\pmid\
__METADATA_FIELD ModDate D:20111121131055-05'00'
__METADATA_FIELD CreationDate D:20111121131055-05'00'
__METADATA_FIELD Producer MiKTeX pdfTeX-1.40.11
__METADATA_FIELD Creator TeX
__DOCUMENT_ID_UID_CONNECTIONS
__XMP_META_DATA_HH_EXTRACTION __START
__XMP_META_DATA_HH_EXTRACTION __END

Vidare besläktat meda båda föregående exempel på vad vi kan se kan det ge indikationer om preferens open source (mjukvara snarare än metadata promiskiöst delat för andras analys) liksom benägenhet eller möjlighet att budgetera inköp mer front-end nya koncept (längre fram indikeras nog mindre inressant här när något är vanligt: vad vi syftar är mer webb-baserade lösningar i dokumenthantering, sökning m.m.).


Exempel: ID för media-komponenter och dokument

Förutom WWW-kopplingar valde jag att ta ut PMID (National institutes of healths ID för journal-artiklar i deras för forskningsområdet helt dominerande databas med applikationer sökning m.m.) resp. DOI (brett använd namngivning av journalartiklar för betalande aktörer: dx.doi.org kan från DOI namnet föra dig vidare till sidan där artikeln finns. Och slutligen referenser till unika objekt XML-dokumentet i sig gör (d.v.s. potentiellt ett helt för applikationen lokalt kontext om ej hanterat i ett övergripande system för organisationen). Fler finns man kan ta ut med PMID och DOI är mycket stora och inte ointressanta om man för en större samling av dokument ex. vill komma ifrån att i övrigt riktat parsa och analysera referenser och istället behanda det som vilken sida som helst (vilket man nog ofta vill för dokument-samlingar likt DTIC jag tar ner just nu mer totalt där dokumenten kommer från många generationer resp. där referenser filtrerat av och till kan dyka upp i separata dokument):


Nedan några typiska ID för delar av PDF-filen (eller avseende hela den i någon instans):


__FUNCTION_WORKING METADATA_LOGIC
__PDF_FILE_NAME a569695.pdf
__IN_DIR_GIVEN c:\PTOOLS\PDF\
__METADATA_FIELD ModDate D:20130321040825-04'00'
__METADATA_FIELD CreationDate D:20120530205500-04'00'
__METADATA_FIELD Producer iText 5.0.4 (c) 1T3XT BVBA
__DOCUMENT_ID_UID_CONNECTIONS uuid:b3d384ac-d60e-4945-82e9-8b6e47f48eba uuid:3e6c776a-3058-4aee-856b-2ff7247c779f

Uppenbart ovan är att jag valt att inte ta med något sammanhang alls för dem. Möjlig användning för att söka samband tenderar ju att reducera probelmatik med ovsäentligt och vidare oavsett om vi refererar externt eller om någon refererar oss är det ett samband. Dock om vi vill se djupare i dem när hittade (för association jag bedömer intressantare tror jag övergripande att man når så långt man kan utan annan kunskap alls om dem: jämför med vad likheter i termonologi kan indikea om likhet i kultur eller expertområde mellan entiteter) bör åtminstone själv-refererande för dokumentet särskiljas varför jag också tar med delar av själva XML-koden (när vi vill förstå kopplingar specifikt mellan två entiteter). Känslan jag har att med minde än att man överdrivet tittar på standarden och ändå riskerar att komma fel är praktisk användning för träffar nog utmärkta för att vettigt begipa vad som är helt eller delvis självrefererande (eller praktiskt så avgränsat ex. dator med pgoramvaror) resp. vad som via indikerat XML resp. uttrycket kan vara mer generellt dokument-id format i något sammanhang.


Emellertid för ev. behov finns resp. dokument id eftersom mer basal xml-kod sparas (praktiskt som extraktionen tycks fungera - jag är nu ingen expert på PDF så finns praktiskt prövande kändes tidseffektivt - tas all XML läsbar med medan jag valde bort delvis parsad struktur för att spara håddisk vilket jag från början också hade med temporärt via DATA::DUMPER på objektet för pdf-filen):


<x:xmpmeta x:xmptk="Adobe XMP Core 5.2-c001 63.139439, 2010/09/27-13:37:26        " xmlns:x="adobe:ns:meta/">
   <rdf:RDF xmlns:rdf="http://www.w3.org/1999/02/22-rdf-syntax-ns#">
      <rdf:Description rdf:about="" xmlns:xmp="http://ns.adobe.com/xap/1.0/">
         <xmp:ModifyDate>2013-03-21T04:08:25-04:00</xmp:ModifyDate>
         <xmp:CreateDate>2012-05-30T20:55:00-04:00</xmp:CreateDate>
         <xmp:MetadataDate>2013-03-21T04:08:25-04:00</xmp:MetadataDate>
      </rdf:Description>
      <rdf:Description rdf:about="" xmlns:dc="http://purl.org/dc/elements/1.1/">
         <dc:format>application/pdf</dc:format>
      </rdf:Description>
      <rdf:Description rdf:about="" xmlns:xmpMM="http://ns.adobe.com/xap/1.0/mm/">
         <xmpMM:DocumentID>uuid:b3d384ac-d60e-4945-82e9-8b6e47f48eba</xmpMM:DocumentID>
         <xmpMM:InstanceID>uuid:3e6c776a-3058-4aee-856b-2ff7247c779f</xmpMM:InstanceID>
      </rdf:Description>
   </rdf:RDF>
</x:xmpmeta>

En försvarlig mängd av det för moderna kameror, dokumentsystem m.m. typiska formatet för att ge media producerat en unik identifierare. Exemplet nedan från samma som nummer två med versionshistorik tidigare:


__DOCUMENT_ID_UID_CONNECTIONS uuid:5B20892493BFDB11914A8590D31508C8 xmp.did:714C3D9B56AAE011B1AA9CA76A9EC25B xmp.did:724C3D9B56AAE011B1AA9CA76A9EC25B xmp.did:734C3D9B56AAE011B1AA9CA76A9EC25B xmp.did:F77F1174072068118083E0155A4A0A32 xmp.did:FB7F1174072068118083E0155A4A0A32 xmp.iid:006035250D2068118F628C890978B148 xmp.iid:008011740720681197A5820352CD19F2 xmp.iid:016035250D2068118F628C890978B148 xmp.iid:01801174072068118083C809E165E027 xmp.iid:01801174072068118C14E6A624D85812 xmp.iid:01801174072068118C14E72FBDC50C68 xmp.iid:026035250D2068118F628C890978B148 xmp.iid:02801174072068118C14D5EDF20B39EA xmp.iid:03801174072068118C14D5EDF20B39EA xmp.iid:04801174072068118C14D5EDF20B39EA xmp.iid:05801174072068118C14E72FBDC50C68 xmp.iid:321C424C262068118F62BE1AEC87ECB3 xmp.iid:331C424C262068118F62BE1AEC87ECB3 xmp.iid:341C424C262068118F62BE1AEC87ECB3 xmp.iid:351C424C262068118F62BE1AEC87ECB3 xmp.iid:361C424C262068118F62BE1AEC87ECB3 xmp.iid:371C424C262068118F62BE1AEC87ECB3 xmp.iid:381C424C262068118F62BE1AEC87ECB3 xmp.iid:624FA1CF212068118F62BE1AEC87ECB3 xmp.iid:634FA1CF212068118F62BE1AEC87ECB3 xmp.iid:644FA1CF212068118F62BE1AEC87ECB3 xmp.iid:654FA1CF212068118F62BE1AEC87ECB3 xmp.iid:664FA1CF212068118F62BE1AEC87ECB3 xmp.iid:674FA1CF212068118F62BE1AEC87ECB3 xmp.iid:684FA1CF212068118F62BE1AEC87ECB3 xmp.iid:694FA1CF212068118F62BE1AEC87ECB3 xmp.iid:6A4FA1CF212068118F62BE1AEC87ECB3 xmp.iid:6B4FA1CF212068118F62BE1AEC87ECB3 xmp.iid:6C4FA1CF212068118F62BE1AEC87ECB3 xmp.iid:714C3D9B56AAE011B1AA9CA76A9EC25B xmp.iid:724C3D9B56AAE011B1AA9CA76A9EC25B xmp.iid:734C3D9B56AAE011B1AA9CA76A9EC25B xmp.iid:B1D0A6060F2068118F62BE1AEC87ECB3 xmp.iid:B2D0A6060F2068118F62BE1AEC87ECB3 xmp.iid:F77F1174072068118083E0155A4A0A32 xmp.iid:F77F1174072068118083E5C6D079A5EF xmp.iid:F77F117407206811871FB2ED4E37AE08 xmp.iid:F77F117407206811B84094BC3C7FBB8B xmp.iid:F77F117407206811BA4A8DBC7C9B7B1F xmp.iid:F87F117407206811B84094BC3C7FBB8B xmp.iid:F87F117407206811BA4A8DBC7C9B7B1F xmp.iid:F97F117407206811BA4A8DBC7C9B7B1F xmp.iid:FB7F1174072068118083E0155A4A0A32

Vad som gör dessa intressanta rent allmänt (ej analyserat för ex. alls) kan tyckas svårbegripligt men jämför vi med vad vi menade att www-länkarna kunde berätta blir det kanske tydligare. Vi kan se propagering, samarbete, copyright-problematik eller oftare bara odefinierat lånat m.m. när enskilda indikationer dyker upp i flera dokument. Min erfarenhet av PDF är här ännu minst sagt begränsad men min allmänna känsla är att det utanför kontext där viss standardiserad användning fövantas eller är normalt är det kanske inte den mest intressanta källan innan man börjar laborera på riktigt stora mängder av dokument (vilket ju inte sällan redan kan vara motierat av andra tyngre orsaker där detta kommer gratis på köpet: statistiskanalys, indexering m.m.). Likväl är träffar åtminstone inte vad som inte inträffar för större organisationer på inte allt för många besläktade dokument (där en del om jag tolkar konceptet och PDF rätt i alla fall hittades för NATO relaterat mer prospekterande resonerande om forskning och teknik långt ifrån något alls känsligt och helt publikt men i alla fall vad jag ej förväntat på relativt få dokument).


Detta är en motsatt sida av det värde (utanför det kanske ofta mer primära att kunna organisera information man äger som stor organisation) i informationssäkerhet och kontroll av flöde in och ut eller mellan personer i företaget. I koncept av intrusion detection kan vi jämföra med "Snowden-detektor / sensor" diskuterad där vi enkelt kan se det som att själva förekomsten av vissa media-dokument via deras identifierade kan vara binärt förbjudet för en viss person, ligga längre från dennes normala användning, eller bygga upp mot något troligt problematiskt (ex. om många tusen dokument ej relaterade systemadministration identifieras på en medarbetares PDA när han vid den dagliga utpasseringen lämnar den till säkerhetspersonalen för kontroll som konsekvens av att ha en arbetsuppgift med odefinierat höga rättigheter i datanätverket).


Men likartat kan andra ibland beroende på lösning dra slutsatser (vi kan tänkas oss att varje instans adderar in något slumpmässigt för unikt värde via en ID-fabrik någonstans men heller inte det behöver utesluta analys här helt: hur snabbt förändras entropi över tiden? hur mycket nytt resp. gammalt i kontext av en person är aktuellt?). Förutom att skapa ett fascinerande problemområde med felaktiga format eftersom det tror jag kan behöva hanteras med reaktion för att systemet ska kännas betryggande i denna form av hantering (ett dokument existerande uttryckande säkerhetsfunktion men felaktigt d.v.s. potentiellt förfalskad är ju en ganska tung indikation om angrepp men förstås dyr att hantera om någon sitter och för in defekta saker av och till för att ockupera resurser i organisationen: dock finns ju det problemet besläktat i alla fall också utan identifiera via falska mail m.m.).


Exempel: OID och innehåll

I exakthet i domän av sammanfattad information om innehållet och dess organisation i ett kunskapssystem är många andra system utanfö själva pdf-dokumentet oftare mer talande. Nedan har vi data uttryckt, sparat och gjorts tillgängligt i en standard nu ganska vanlig för fakta-dokument, journal-artiklar m.m.



Också använd för att publicera och distribuera det kanske mer välkända id för bl.a. journal-artiklar: DOI. En tysk databas var där praktiskt enkel och välfungerande för mig medan jag ännu har att få helt klart för mig hur jag effektivsas kan få ner DOI för alla vetenskapliga journalers artiklar beskrivna samt gärna fångar ny publicering utan att behöva besöka dem alla regelbundet (i den mån det alls går: en del mediehus är ganska introverta också när det gäller titel, abstract, doi m.m. och tycks göra en hel del svår-tillgängligt):



Men jag undviker gärna att i onödan lära mig sådant i detalj innan det är nödvändigt (jag spindlar och analyserar annat just nu): det finns så mycket lika viktigt och stort men inom annat. Förutom kompletthet är det tilltalande att försöka få huvuddelen publicerat i segment vi analyserar som en domän eftersom det underlättar hur vi resonerar med statistiska modeller (eller också teoretiskt förenklat sampla dem gärna nära när det går slumpmässigt - risk bias och preferens finns ju dessutom med andra metoder om än kanske lättare att resonera om när befintligt data för detektion finns).


Just för metadata neda är det från Department of Defence, US del för att hantera kunskap, forskning m.m. information man etablerat på olika nivåer genom åren för att göra det lättare att ta fram nya värden från dem (kanske se samband mellan dokument om indirekta behov, var en lösning finns att anpassa i ennan försvarsgren, upptäcka nya innnovationer m.m.), ej dubbel-arbeta saker och ting o.s.v.



Rörande mängd och exakthet finns inget unikt jämfört med normalt för journal-artiklar publicerade idag på nätet: jämförbart metadata, ofta möjligt att spindla eller ta ner på annat sätt o.s.v. Dock finns också en mängd äldre studier, utredningar m.m. med början tidigt under 1900-talet och där känner jag ej till metadata tillsammans med dokument ens i närheten i möjlighet om vi ex. vill följa utveckling av koncept eller fånga upp koncept-associationer lika viktiga idag men mindre diskuterade och uttalade i modern litteratur därför att vetskap tas som givet etablerad redan i grundutbildning. Längre bak och särskilt vissa tidsperioder kan emellertid oftare endast ha meta-informationen (möjligen gäller det oftare 1960-talet än 1950-talet även om jag inte säkert vet eftersom jag fortfarande tar ner deras pdf:er resp. databas med metadata).


Det ska också sägas att samlingen av dokument och vetandet representerat i dom publika tjänsterna är omfattande och för många områden en mycket välfungerande databas och funktion för att hitta forskning över längre tidsperioder. För flera segment tycker jag att den fungerar enklare för att hitta vad önskat snabbare. Det gäller dock en del områden (bildanalys finns ex. mycket publicerat för) medan andra områden kan vara mindre intressanta för en försvarsorganisation att direkt finansiera eller bevaka för återpublicering.


Nedan ett exempel från 1949 existerande både som dokument ADA297559 och beskrivet med metadata:


____________________________________________________________________
__FUNCTION_WORKING FUNCTION_MANAGER
__URL http://www.dtic.mil/cgi-bin/GetTRDoc?Location=U2&doc=GetTRDoc.pdf&AD=ADA297559
____________________________________________________________________
__FUNCTION_WORKING OID_HARVESTING_BY_ACCESS_NUMBER
<Citation type="tr">
<AccessionNumber>ADA297559</AccessionNumber>
<CitationStatus code="">ACTIVE</CitationStatus>
<CitationClassification code="">UNCLASSIFIED</CitationClassification>
<CorporateAuthor>TECHNICAL INFORMATION SERVICE (AEC) OAK RIDGE TN</CorporateAuthor>
<UnclassifiedTitle>Manual of Instruments and Controls for the Brookhaven Nuclear Reactor. Book 3. Volume 1.</UnclassifiedTitle>
<TitleClassification code="">UNCLASSIFIED</TitleClassification>
<ReportDate>MAY 1949</ReportDate>
<PaginationOrMediaCount>167</PaginationOrMediaCount>
<PaginationCode>0</PaginationCode>
<ItemCost>14.60</ItemCost>
<ReportNumber nonPunctuated="AECM4415">AEC-M-4415</ReportNumber>
<MonitorAcronym nonPunctuated="XF">XF</MonitorAcronym>
<MonitorSeries nonPunctuated="XD">XD</MonitorSeries>
<ReportClassification code="">UNCLASSIFIED</ReportClassification>
<DistributionCode code="01">APPROVED FOR PUBLIC RELEASE</DistributionCode>
<DescriptorClassification code="">UNCLASSIFIED</DescriptorClassification>
<AbstractClassification code="">UNCLASSIFIED</AbstractClassification>
<InitialInventory>0001</InitialInventory>
<SourceSeries>1</SourceSeries>
<SourceCode>342750</SourceCode>
<GeopoliticalCode>4702</GeopoliticalCode>
<OrganizationTypeCode code="Z">INDEPENDENT FEDERAL AGENCIES</OrganizationTypeCode>
<DocumentLocation code="1">DTIC AND NTIS</DocumentLocation>
<Abstract>The instruments and controls for the Brookhaven Nuclear Reactor have evolved from a development program whose objective was, among others, to create a research facility. Throughout this program it has been clear that the ultimate arrangement of instruments and controls can not be fixed in advance of actual operation. The ultimate arrangement will depend in large measure on the research activity to take place in the future. It has been necessary, therefore, to provide a wide range of instrument capabilities and a large number of control functions.            Underlying this primary objective of creating a versatile research facility is the associated requirement that the reactor be safe. The requirements for safety are in some ways as varied and complex as those of research. In some instances they are dominant.            Exemplifying the flexibility and versatility of the reactor  instrumentation are electronic instruments of advanced design for measuring power at extremely low levels, indicating and recording the rate of rise of power level over a wide range of power, and regulating power at  preset levels. Exemplifying the variety of safety devices are instruments for monitoring power level detected by ionization chambers, by neutron  thermopiles, and by graphite and metal-cartridge thermocouples. Devices  which monitor the operability of equipment also contribute to the safety  of the reactor.   (KAR)  p.7</Abstract>
<Descriptor>*USER MANUALS</Descriptor>
<Descriptor>*POWER LEVELS</Descriptor>
<Descriptor>*NUCLEAR REACTORS</Descriptor>
<Descriptor>*POWER MEASUREMENT</Descriptor>
<Descriptor>CONTROL</Descriptor>
<Descriptor>MEASUREMENT</Descriptor>
<Descriptor>MONITORING</Descriptor>
<Descriptor>ELECTRONIC EQUIPMENT</Descriptor>
<Descriptor>GRAPHITE</Descriptor>
<Descriptor>IONIZATION CHAMBERS</Descriptor>
<Descriptor>LOW LEVEL</Descriptor>
<Descriptor>INSTRUMENTATION</Descriptor>
<Descriptor>RECORDING SYSTEMS</Descriptor>
<Descriptor>RANGE(EXTREMES)</Descriptor>
<Descriptor>INDICATORS</Descriptor>
<Descriptor>NEUTRONS</Descriptor>
<Descriptor>SAFETY EQUIPMENT</Descriptor>
<Descriptor>THERMOPILES.</Descriptor>
<FieldsAndGroups code="180501">Nuclear Fission Reactors(power)</FieldsAndGroups>
<SBIHoldingSymbol>NPS</SBIHoldingSymbol>
<handle>http://handle.dtic.mil/100.2/ADA297559</handle>
<PdfFileSize>12 MB</PdfFileSize>
</Citation>

Exempel: Text är bättre

Analyserar vi språk i text snarare än bilderna, visuell presentation m.m. vill vi just helst bara ha texten. Det sparar minne vid analystillfällen, beräkningskostnad för att ta fram den och utrymme på hårddisken (PDF dokument kan av och till mer än stora vara gigantiska om de inkluderar en mängd föga komprimerade bilder).


Med de lösninga jag använder nu (och tror jag mycket vanliga även om system säkert kan vara bättre och sämre här varierat med kostnad i utveckling och processande av vad visuell-information betyder) med av och till feltolkningar på visuellt mer komplexa sidor (önskar man ta kostnad för det och det tror jag ej är aktuellt här med något värde för mig kan det mesta om inte nära nog alla dessa fel fås bort i efterhand via bl.a. ngram-detektion, förståelse av hur url:er, standard information som doi, pmid m.m. skrivs och åtminstone enklare parsning med Natural language processing av meningar för att förstå om en radbrytning kombinerat punkt är en förkortning avhuggen eller meningsslut på rad ovanför: dyrt i beräkningstid när det handlar om miljoner dokument - en god skattning är att cirka 10 - 15 miljoner täcker upp en god andel av viktig publicerad forskning tillgänglig i pdf-format på nätet och cirka två miljoner en god andel av väsentligt från dom senaste åren när det handlar om journal-artiklar - där jag initialt ser cirka två till 25 miljoner som en lagom nivå för titel, abstrakt m.m. och bredare analys hela dokumenten för särskilda områden scarce i inlärda relationer eller särskilt viktiga vid någon tidpunkt).


__FUNCTION_WORKING PDF_TO_TEXT_LOGIC
__PDF_FILE_NAME ADA297559.pdf
__IN_DIR_GIVEN C:\PTOOLS\SAMPLER\DTIC\PDF\
__PAGES 167
__WWW_CONNECTIONS 
__EASY_JOURNAL_CONNECTIONS_EX_DOI 
__PAGE 1
UNCLASSIFIED
OJ
UNCLASSIFIED
M-4415
Subject Category: INSTRUMENTATION
UNITED STATES ATOMIC ENERGY COMMISSION
MANUAL OF INSTRUMENTS AND CONTROLS FOR THE BROOKHAVEN NUCLEAR REACTOR. BOOK 3, VOLUME I
r
KJ31SEm;a!BBanBI!! ^lM|
vUG.U6Jl9.9_a
biM& W''
?s^^M^^ ^Bm^asi^^^s^sf t^i^sz^,
May 1949
Servomechanisms Laboratory Massachusetts Institute of Technology Cambridge, Massachusetts
Jackson and Moreland Engineers New York, New York
Technical Information Extension, Oak Ridge, Tennessee
' %  ' ~ '1--"-" %  """ *
DTIS Q UALTrYlNSFEClED3
______________END_PAGE______________
__PAGE 2
Date Declassified: January 13, 1956.
LEGAL NOTICE
This report was prepared as an account of Government sponsored work. Neither the United States, nor the Commission, nor any person acting on behalf of the Commission:
A. Makes any warranty or representation, express or implied, with respect to the ac- curacy, completeness, or usefulness of the information contained in this report, or that the use of any information, apparatus, method, or process disclosed in this report may not in- fringe privately owned rights; or
B. Assumes any liabilities with respect to the use of, or for damages resulting from the use of any information, apparatus, method, or process disclosed in this report.
As used in the above, "person acting on behalf of the Commission" includes any em- ployee or contractor of the Commission to the extent that such employee or contractor prepares, handles or distributes, or provides access to, any information pursuant to his em- ployment or contract with the Commission.
This report has available copy.
been reproduced directly from the best
Issuance of this document does not constitute authority for declassification of classified material of the same or similar content and title by the same authors.
Printed in USA, Charge $1.00. Available from the Office of Technical Services, Department of Commerce, Wash- ington 25, D. C.
AEC, Oak Eidge, Tenn.
______________END_PAGE______________

Ytterst tilltalande gäller normalt att innehållsförteckning, tabeller över figurer m.m. liknande översätts till text utmärkt för journal-artiklar. Ex. från samma dokument:


__PAGE 6
CONTENTS VOLUME I
Page
9. Coarse Rod-Position Indicators - Component Description 3.35
10. Hod-Position Recorders 3.44
11. Parts List - Instrument Pinion Support Assembly
6546DN048 (For Regulating Hods) 3.47
12. Parts List - Instrument Pinion Support Assembly
6546DN047 (for Emergency Rods) 3.47
13. Parts List - Regulating-Rod Position Transmitter
Assembly 6546M030 3.49
14. Parts List - Regulating-Rod Position Indicating Unit
6546LN006 3 . 5 2
15. Parts List - ilmergency-Rod Position Transmitter
Assembly 6546EN029 3.56
16. Parts List - Kmergency-Rod Position Indicating Unit
6546BH001 3 . 5 9
17. Parts List - Coarse Rod-Position Indien tor
654&SN018 and 6546i.NQ19 3 . 6 2
18. Reference Drawings 3.65
19. Engineering Report References, D.l.C 6546, td.l.T, . . 3.65
______________END_PAGE______________
__PAGE 7

Ett till exempel från ADA297788 med tekniska data såväl som några referenser. Resultatet är varken bra eller dålig men knappast problematiskt för normal textanalys.


__PAGE 20
 fill
XJaxium Temperature Observed
2120  C to 2510 C
^-12"
30 lbs to 89 lbs
cci 4
20 lbs to 98 lbs
*2
10 cu it to 450 cu fir.
"Boron Analysis
 00 ppm to  10 (spec)
Total Ash
1 ppm to 17 ppm
gOMMAR T OF OPERATIONAL DATA
Adc kbjj  TO AEVI  AL "RIMS 11 " 1
Maximum Tariatian, Average* Range
2250 - 2400 C 60  =  65 lbs 40 = 50 lbs 100 - 300 cu ft  03 -  06 ppm 1  to 8  ppm
As the runs were made for production purposes no attempt to control the variables ms made  So correlation between the variables and the purity obtained can be drawn from the operational data 
&f Majority of the runs fall within these ranges
ABHSKBEC *C" BIBLIOGRAPHY
1. Neumark, H  R , Trans. Electrochem. Soc. 9jL, 367, (19*1-7)
2. Sermon, G. T. United Carbon Products Co. Report Ho  3 (19^7)
3. Sermon, G. T., "16OO MA Powsr Installation on 22 M Line", United Carbon Products Co. Report Ho. 13, (19*&)
4* Bodden, C. J. Richmond, M. S., National Bureau of Standards unpublished report, "Determination of Small Amounts of Boron in Project Materials".
5. Sermon, G. T., "Heating Tests in Granular Resistance Furnaces for preparing High Purity Graphite", united Carbon Products Company Report Ho. 6, (19*1-7)
19
______________END_PAGE______________

Världsbanken försvarar sin plats i världen

2013-10-10

Notera att citatet nedan är från beskrivningen av ett videoklipp (som auto-startar) hos Reuters:


"Reynolds Holding and Christopher Swann discuss how proposed cost cuts could make the World Bank a faster and more efficient lender and stronger competitor against rival sources of capital."

Från: Breakingviews: World Bank savings plan (2013-10-10) | Reuters

Problematiken här är att även om jag skulle kunna argumentera att vi alla skulle gynnas av att Världsbanken hade mer kapital att investera måste sådan argumentation bygga på vettig effektivitet. För att uppnå vettig effektivitet är ofta att ta några steg tillbaka av och till och gå över all verksamhet och skära bort eller förändra dåligt fungerande delar nödvändigt. Jag är väldigt övertygad om att en ordentlig genomgång - som kanske nu skett - med förändringar av problematiska områden just nu är väldigt motiverat hos Världsbanken givet att jag inte tycker något bakåt indikerat något liknande det så länge jag använt dem som datakälla.


Jag vill gärna se det här arbetet mindre som att Världsbanken reducerar och mer som de försöker försvara den roll de önskar att de haft och har men tappat sista åren. De inte sällan för befolkningen minst sagt problematiska investeringsaffärer olika länder givit sig in med Kina tycker jag är ett exempel på att Världsbanken är på väg att tappa sin plats i världen. Men jag vill också spekulera att hälsosam konkurrens med något för resp. aktuell landsbefolkning långsiktigt uppenbart sämre kanske kan sätta lite fart på Världsbanken att börja prestera växande allt bättre och att detta är ett gott tecken på det.


En känsla verksamhet hos dem utanför kärnverksamheten givit mig är också att man gärna startar upp i sig väldigt ambitiösa projekt där man mycket korrekt bibehåller grundläggande ambition såväl som ännu mer korrekt när det berör datakvalitet i områden som man föreställer sig är välkänt viktiga för dem allmänt i lugn takt små-förbättrar, men tenderar att övergripande paketera vad man skapat som i funktion, möjliga världen o.s.v. som färdigt enligt initialt definierat. Det huvudsakligen men ej uteslutande bedömt av att regelbundet från starten tappat data.worldbank.org på data. D.v.s. även om projekt-tänkandet det indikerar nog där som allmänt jämfört med egentligen all industri och annan verksamhet numera (och sedan säg 1995 - 2000 det helt dominerande tänket) så är det tror jag för en verksamhet likt Världsbanken meningsfullt att bibehålla ett mer traditionellt produkt-tänkande i förvaltningen av vad projekt levererar. Jag tvivlar på att sådant är kostnaden ens påverkande något mätbart och snarast ge bättre möjlighet till att lösningar i form av tjänster man skapar levererar värde som "för-räntar" sig riktigt ute i världen.


Specifikt kommenterande data.worldbank.org eftersom jag tog med det som exempel kunde jag första året konstatera en hel del fel i data liksom andra datakvalitets-problem. Egentligen inte tydligt mer än förväntat från liknande tjänster (inkl. ej i sig själva direkt indikerat "merging" andra källor med dessa angivna men implicit så ex. diverse från EU, OECD, WIPO m.m.). Samtidigt överraskade Världsbanken rörande det mot vad jag lärt mig förvänta kring sådant sista gången jag både tog ner färskt data och av olika orsaker tvingades se över datakvalitet genom att väldigt mycket verkade korrigerat. Självklart är det inte mer än vad vi ska kunna förvänta oss av aktörer med aktuella möjligheter rörande prioritet kvalitet och p.s.s. regelmässigt faktiskt investerar i just detta men jag upplever det ändå ganska tydligt bättre än genomsnitt.


Kommentaren rörande gott datakvalitets arbete i data.worldbank.org avser självklart inte ev. fel direkt propagerade från källorna till Världsbanken utan närmare merge defects och källor närmare samma "kultursfär".

Antal utan arbete i USA

Efter att endast läst Reuters rapportering är jag lite förvånad över uppgifterna:



Om något upplever jag behov av att ta mig en titt på om man ändrat något kring hur det beräknas. Kan man ha fått in något nytt med som ej brukar tas med?


Oavsett viss förvåning mycket korrekt att ta med just därför att jag snarare hade skattat det 10 - 30 000 färre. Det både understryker hur begränsade alla är rörande dessa faktorer (se ex. nyligen Vådligt jämföra USA's ekonomi idag med 1964) där jag inte alltid är ett undantag även om jag tror att en större medvetenhet hos mig hur begränsade många datakällor är i ett predikterande perspektiv minskar antalet onödiga fel liksom prediktioner man vågar sig på att göra. Tillsvidare nöjer jag mig att säga att jag varken tror på eller inte tror på dom här siffrorna - alternativt hur Reuters rapporterat dem.

Fler konvergenser P(A,B): Inför Smash and grab operation i domän TV-nätet

2013-09-30

Smoothing enligt tidigare verkade av allt att döma mycket funktionell när value-typer adderades men jag valde ändå en förenklad metod som ger mindre flexibilitet men är funktionellt för alla viktiga användningar och behåller tidigare mindre lösning för övriga därför att förenklingar käver en till läsning av alla datafiler jämfört med skattade jag åtta till tio nya för flexiblare lösning (vilket tar väldigt lång tid) inte minst därför att filerna måste styckas upp mycket mer för att gå att ha minne för beräkning.


Oavsett det roade jag mig nyligen att ta ner större data rörande musik-lyrik och tog ut samförekomst rent binärt per meningsnivå av allt utan hänsyn resp. musik-lyrik-frekvens eller annan sådan spearering o.s.v. och från det samlad P(A,B) skattning.


Vidare från den viktade jag samförekomsten med ej normaliserad addition av förekomst två mått på intresse i två nära besläktade perspektiv: publicerande och upplevande (skattat från data jag tog ev. 2011 eller 2012 via möjligheter som då fanns via api:er hos en tämligen branschledande tjänst rörande publicering "media-stycken" bl.a. ofta på temat musik och film) - och normaliserat i kommersiellt möte av dessa data samlat från "internet marketing". Där värde adderas in i "antal" när det finns till resp. koncept oavsett om konceptet består av ett ord eller flera (om flera utan hänsyn förekomst av färre ord jfr wash your dog tar ingen hänsyn till samma värden för your dog eller dog) för resp. av de två koncepten.


För alla sådana förekomster - utan hänsyn till ordningen för A och B - dividerar vi värdet med alla värden för resp. de förekommer med.


Detta konvergerar avseende värde-typer förekommande - avrundat o.s.v. - för sannolikhet havande värde i resp. i+1 enligt proportionellt ökande eller minskande för lutningen som all förekomst av koncept-perspektiv vi är minus förekomsten vi bedömer dividerat med förekomsten vi bedömer.


Vilket innebär - är jag tämligen säker på - indikerar (trots tämligen rundimentärt hanterande av mätvärdena prospketerande om de är värda att använda seriösare) att de genomgått påverkande smoothing av tjänsten innan levererat ut. Antagligen enligt någon variant av bionominala-fördelningar. Det är kanske lite intressant eftersom jag aldrig annars fått intrycket att samma aktör just använt dom algoritmerna associerat sökresultat för annat.


Oavsett vilket gäller att för värde association mellan säg angenämnt belönande och våldsamt eller otrevligt gäller regelmässigt att förenkla till det till spontant uppenbara positiv och negativ hör till vad som oavsett någon förekommande viktlösning publicerad eller de bättre jag gjort själv i övrigt levererar regelmässigt signifikant sämre än andra motsvarande sådana "mer eller mindre" som jag brukar kalla för mig grundläggande. Normalt verkande påverkande globala tillstånd i vad som är beräkningskrävande ser jag föga värde av att låta positiv och negativ påverka därför att man får det typiskt mycket mindre med ex. up och down och Blu lght intensity och vid ev. behov utnyttja det till utgångspunkt att applicera positiv och negativ på riktat rörande något avgränsat koncept eller en koppling sådan till annan. Musik-lyriken när vikter som här mycket nära det reward-drivna - d.v.s. vad vi ser värde att publicera för, betala för att driva trafik till resp. lyssna eller titta på utan att behöva betala - precis som förväntat tycks ge mycket intressanta och potentiellt mycket kvalitativa skattningar.


Jag hade inte just räknat med att aktuellt musik- och film-specifikt viktdata skulle hålla tillräcklig kvalitet. Det gjorde det heller inte första körningarna men efter transformation / projektion på det datat med up och down fick jag vad jag spontant bedömer som riktigt mycket bättre data än jag någonsin sett för positiv och negativ. Åtminstone när vi ser mer värde i vad vi vill använda positiv och negativ till i det ärligt praktiskt reward-drivna snarare än vad som känns korrekt att indikera när mätt och tillfrågad i forsknings-lab i psykologi-forskning eller för ännu sämre positiv och negativ data i eventuellt ofullständigt roterade frågor på Amazon mechanical turk (för att indirekt referera två av de oftare uppmärksammade viktsystemen relaterade positiv och negativ vilka båda inte spontant ser fel ut enkelt när man tittar på dem men ej levererar predikterande människa eller människor i beteende från språk oavsett om vi går fram eller bak i tiden).


Åtminstone för stora delar av datakällans möjligheter via extraktionsmetod jag använde tror jag att den är slut nu. Förr kunde vad publicerat-tjänsten tas ut till sekundära tjänster (ex. omvandlande ett filmklipp innehållande musik till mp-3 eller motsvarande) vilket gav SEO-driven marketing för den tredje ganska viktiga värde-dimensionen. Andra vägar att ersätta finns säkert och ännu bättre är antagligen att försöka för musik längre tillbaka i tiden ta vikter från försäljning, marknadsföringsbudget m.m. Praktiskt här och nu för mig ser jag emellertid inte att det är intressant som funktion av tidskosgtnaden. Både rörande automatisering tolkning av datakällor reward såväl som att från data byggt av människor direkt eller indirekt avseende hur titlar på lyrik-sidorna m.m. ser jag många i och för sig säkert intressant glada små utmaningar (definition glatt: ej iriterande på nivå att man kastar ett lagringsmedia ex. exterm-hårddisk i väggen för att i ögonblickets sanning inse att kostnad några få-tusen ny hårddisk mot att garantera att långsammare delar av personligheten aldrig självplågar sig med skit-datat igen är korrekt) men just tidsödande.


En allmän oavsett viktsystem mycket trygg brytpunkt är att de 10 000 - 14 000 vanligaste koncepten över alla jag tillåter (och ej nödvändigtvis inkluderande alla ord oavsett om vanligare all det minst vanliga av dessa) är tryggt utdata om det tillämpas i mina algoritmer för transformation och projektion vid analys enskilda nyheter d.v.s. i kontext av ett större sammanhang där för enskildas koncepts ev. felaktigheter reduceras. D.v.s. när vi gör projektion till denna topp från deras kontext i nyheten där kontext består av en mängd koncept vikterna tillämpas på. Jag bedömer att om man hanterar datat jag utgick från mycket seriösare än nu prospekterande - särskilt något vettigt genomtänkt istället för additionen - kan det orka fram till det (vilket just för positiv och negativ nära nog unikt för viktsystem jag förvaltar långsiktigt ej orkar stabilitet givande förskjutningar och fel när vi räknar framåt i tiden utan nytt data görande att vi inte självklart kan betrakta säg nedanför topp 1000 - 5000 mycket bättre eller sämre än data långt nedanför vilket gör det ganska svår använt i de lösningar jag valde att skapa med många fler dimensioner än normalt - konkret problematiskt blir effekten att mer sällsynt data vi annars vet stabiliserar sig över allt inträffande görande att vi praktiskt kan ta data från säg topp 50 000 till 100 000 ej nödvändigtvis gäller och filtrering istället måste ske innan data går in i nöten vilket jag saknar lösningar för avseende så pass specialiserade problem som positiv och negativ där ju gäller tror jag att kan man se dom problemen för filtrering kan man antagligen lösa vikterna direkt istället - om inte vetskap och förståelse av världen just nu och hur den utvecklar sig handlar mindre om data från närmaste dagar, veckor resp. månad och mer om många år för att få det vettigt om ens alls görligt).


Positivt överraskad av datat från filmklippstjänsten. Gör mig nästan lite motiverad att socialisera samhällen relaterat sajter och tjänster implicit driven användar-initierad publicering av värde-innehåll (jfr musik- och filmsajter som vid förfrågan tar bort filmen som kom på bio förra veckan när ombedda om nu någon noterar att den publicerats från sekundära sajter publicerande inbäddat i brist på sökfunktioner m.m.). Ett segment där jag förövrigt kan notera att gällande rapporter åtminstone från amerikanska myndigheter runt frågan sista två åren såväl som är mitt intryck arbetsmetodik hos copyright-ägare ej riktigt förstått vad verksamheten som genererar intäkter är eller hur man effektivt kan detektera publiceringen. Fascinerande nog kommer det relaterat "antal" ner till vad vi kan applicera typer och instansier på precis som för för språket: Typen "This is a movie" såväl som ett språk-koncept vs. där det refererats skapande fler instansier. Ju mindre ditt sample du bedömer antalet instansier från är desto större relativa skattningar får du rörande egentligen allt om smoothing ej sker. Både faktiskt förekomst relativt hela världen såväl som dina förluster samtidigt som det faktiska resultat i borttagande av publicering i samma utsträckning blir sämre. Metoden att t.ex. göra stora delar - ytterst verkligt funktionell för affären - tillgänglig och uppenbar enkel för de metoder ex. leverantörer filmbolag använder medan säg 70% ej riktigt framgår - trivialt ex- spindlande dem - är ett exempel på dom divergenser verkliga också bara för en typ avseende publicister snarare än för själva copyright-koncepten.


Mitt återupptagande av teve-tittande sista åren - på laptop med liten skärm - efter många år helt utan teve, och utan att någonsin använt en fildelningssajt eller liknande (mycket post-kulturellt min tid som mediekonsument på nätet) - har kanske som ej otroligt representerande nu i all verklighet ytterst stora och väsentliga grupper med ålders-centralitet förskjuten uppåt allt mer också från min ålder (jag var nog tror jag äldre än år rörande internet-konsumption av populärkultur) avseende värde-mängd ex. för de betal-tevetjänster som nu marknadsför (tar betalt och har ytterst relativt gratistjänsterna verkar det mycket långsam såväl som smalare publucering åtminstone utanför som jag minns det den största lagliga i USA när den fortfarande var det drivande konceptet) har gissar jag i mitt motstånd från att behöva lär mig något nytt för rent hobby-ändåmål (jfr fildelning, thor och allt vad det heter) levererat en till den direkta kommersiella mitten här för åren som kommer. I samma utsträckning reduceras tid ex. på Youtube varande tror jag mer typiskt för samma då i storlek mindre centralitet för de teknik-tröga men ekonomiskt intressantare konsument-grupperna närmaste åren bakåt.


Datakällor för vikt viktsystem ska - vad som är kvalitetsdrivande upp till tung-nivå för mig - vara vad man rent personligen ligger nära i vad man egentligen mäter och där helst själv tillämpar. Att direkt personligen förstå typ av datakälla gör att man lättare detekterar när den börjar tappa och det är dags att försöka hitta fler alternativ att bredda upp den med. En gång dominanta datakällor har dock ännu för mig aldrig ännu kommit att reduceras till annat än stora - det är snarast nytt-nytt som behöver tillkomma för dem - vilket jag tycker pressmeddelanden är ett bra exempel på. En mängd fler kanaler finns - flera generationer av nya sådana - men det är likväl en god grundkälla man ej vill ta bort från en nu större parallell-mängd (där förövrigt den första kompletteringen var en till äldre datakälla: rekryterings-annonser, och pressmeddelanden lades förövrigt ovanpå den vid tiden också etablerade i patentansökningar).

Rekommenderad bok: Speech and Language Processing

2013-02-14

Nedan en recension (med betyget 5) jag skrev på Google Books för boken Speech and Language Processing: An Introduction to Natural Language Processing, Computational Linguistics, and Speech Recognition | Google Books av Dan Jurafsky och James H. Martin (i samband med att jag var in för att ersätta mitt trasiga register med Books). Mer om boken på dess hemsida: SPEECH and LANGUAGE PROCESSING | University of Colorado Boulder. Och efter citatet av min recension kompletterat med två bilder av aktuell bok.


"I have a rather large reference library - very even large - and in it's most important area - the area regarding language, neurolinguistics, psychology, neuroscience, information science, semantics, syntax theory, human perception, signs, different languages, media, propaganda and so on containing in closer to indicated rather narrow (as I choose the books for this part) around 200 good quality books (and more not sorted with the rest but keept).


No book have I used so many times to look up things and that though I never (but perhaps a few) looked up anything in the chapters regarding speech processing (but a one or two pages regarding mahalanobis distance (as part of a sub project to a much bigger project unifing it as used in speech synth with it's use in mri and text mining and extraction).


The result is that the book is starting to fall to pieces though not yet two years ago. Almost all of the register is gone and in the front it start at 21.


Until I get a new one I will hence some times have to use Google Books to get the right pages.


Edit: I should though point out that I doubt it is a suitable book for a short course. Rather it would be suitable as part of perhaps three courses together with simpler more narrow books. If learned correctly that way it will provide years of happy productive language processing. If anything I find the idea of it used in an early course a bit amusing thinking of the hate and dislike the students would have for it.




Förr kunde jag av och till uppleva obehag när en uppskattad bok tog skada. Jag har emellertid accepterat den mycket mer konstruktiva utgångspunkten att böcker jag köper som verktyg använder jag som verktyg utan hänsyn till deras hälsa. Går böckerna åt så att säga är de användbara och jag köper ett nytt exemplar om så krävs. Det fungerar bra med min personlighet.

Ett till vetenskapligt och tekniskt vekt EU-projekt skämmer ut Europa

2012-12-29

Utelämnande problem i gränssnitt och oförmåga att hantera inställningar (ex. engelska och inte svenska) stabilt tillståndslöst och endast betraktande den tekniska utmaningen i nyhetsanalysen är Newsbrief.eu ett bra exempel på ett problem i EU man förr eller senare kommer behöva lösa eller acceptera divergens för ökad konkurrensförmåga.


Problemet vi diskuterar ska vi givetvis förvänta oss i orsakerna är organisatoriskt relaterat och i det betvivlar jag starkt att det är drivet av enskilda medarbetare. Därav ska vi inte utesluta att vi har likartade instanser av problemet i också väldigt annorlunda områden (ex. relaterat ekonomiskt samarbete i politik resp. i förvaltningen quality assurance och risk management av ländernas åtaganden resp. dom potentiella problem och risker samarbetet kan skapa för dem). Det vore dock en mycket mer omfattande uppgift än en ensam person ens heltid klarar att försöka bedöma över annat än ett fåtal områden EU berör.


Teknikområdet Newbrief rör är insamlande och analys av nyheter. Ett område jag utmärkt kan både genom att byggt modeller, arkitektur och genom att jag praktiskt gör nyhetsanalys. Det var relaterat det praktiska arbetet jag uppmärksammade tjänsten med viss förhoppning att den tillsammans med några likartade kunde minska ner antalet tidningar (och andra news providers) nyheter för analys samlas in i vilka när analysen går som mest brett handlar om tio tusentals källor. Det rör många fler news provider typer än Newsbrief är inriktat mot men kan den och liknande ersätta en stor andel av de typer som är mer traditionella tidningar är det troligt god optimering genom att de publicerar mycket mer per tidsenhet.



    Komplettering: Här är ett till strunt-projekt runt EU:s nyhetsnalys också på nivån vad ett par studenter troligen hade gjort bättre både i presentation och ännu mer analys (troligen användande en sund datakälla istället för Newsbrief's collocations för event-detektion vilket når långt innan det är dags att förstå API:et till Google Map för att få det att se korrekt seriöst och avancerat ut):

    Men hur är det man brukar säga runt militära-IT-projekt som inte klarat tillräckligt i tid och behöver mer budget? Put it on a map even if it isn't.



Samma typ av optimering har för affärsområden som är mer kundnära varit möjliga att optimera likartat genom att inhämtning av pressmeddelanden generellt snarare än företag som specifikt följs varit möjliga att ta tillräckliga stickprov av enklare från särskilda sajter som återpublicerar dessa.


Den tekniska lösningen relaterat dom pengar som spenderats på den här tjänsten är dock för området väldigt junior. Tittar vi på deras collocations där besläktade nyheter samlas fungerar man på samma nivå med när jag förra gången tittade på tjänsten, och här ligger man endast i att man klarar att samla news event besläktade nyheter med tekniska metoder som endast tycks bestå av att detektera upprepade mönster. Att en specialist-tidskrift adderande särskilt värde kring en event mindre redundant än större flertalet nyheter mer likartade använder annorlunda och ovanliga ord är att förvänta. Ingenting i närheten av att klara hantering av det märks. Faktiskt gissar jag att tjänsten egentligen inte "begriper" vad nyheterna handlar om utan endast detekterar ord eller ord-kombinationer.


Besläktat men tror jag för de flesta tänkbara användare mycket mindre av ett problem är att de endast tycks klara att analysera just text. D.v.s. att se samband i mening och betydelse mellan visuellt och skrivet ser vi inga tecken på. Det är dock endast intressant som indikation runt ribban man klarat att nå.


Den analys av nyheterna tjänsten presenterar motsvarar av allt att döma den tekniska nivå de ligger på. I statistik är koncept- och relationer-obefintliga, och i statistiska metoder handlar det om enskilda ngram (ungefär motsvarande den statistik Harvard och Google analyserade ut från världens "alla" böcker för att ge statistik att använda i språkmodeller för översättning, tolkning av tvetydiga ord - Avtrycken av Google och Harvard i böcker, nyheter och på internet - och nyligen uppdaterad: Ny Google Ngram annoterad: Klassbaserad prediktion i n-gram tycks möjlig.


För att använda uppgifterna om nyheter och nyhetshändelserna rationellt effektivt som ett verktyg inte minst tillämpat politiskt i EU, och i EU:s verksamhet ex. för att se möjligheter till bättre och mer effektiva lösningar och inte minst för att identifiera möjliga risker tidigt, räcker inte denna statistik. Faktiskt går det så vitt jag vet inte ens återanvända statistiken för mer avancerade tester därför att information kastats bort på vägen.


I övrigt gäller också att tjänsten inte i något verkar nått längre än NGRAM-detektion vilket är bare minimum om något. Vi kan t.ex. se att man indikerar personer som omtalats i nyhets-collocations men ex. inte där eller i övrigt i något indikerar att man klarar att se och förstå deras relationer med varandra, eller mer avancerat men helt inom vad vi borde kunna förvänta oss av en tjänst som denna om den ska vara ett betryggande tecken på att EU-folket har kvalitativa verktyg kunna ta godtyckliga collocations och/eller en eller flera av indikerande aktörer i dem och sätta dem i relation till utvalda ämnen, situationer och/eller aktörer ex. ett tekniskt fokusområde inom EU, ett land man har politiska relationer med, ett företag vars kontakter med verksamheten man vill förstå genom att se samband mellan deras produkter och de politiskt utformade reglerna.


Förutom att detta exempel liksom de tidigare här omskrivna inom EU:s forskning och innovationssatsningar i områden jag följer regelbundet ska man allvarligt reflektera över risken att dessa projekt mer än att slösa pengar faktiskt hindrar och stör innovation. De tenderar alla att uttrycka sig väldigt likartat, strukturera sina s.k. leverabler på webben på ungefär samma sätt, samarbeta mellan organisationer av olika typer och över landsgränser likartat men oavsett hur många år de håller på är tyngden på vad man presterar inte vad som rör sig framåt jämfört med aktörer utanför.


Excellent för att förklara vad det för mig tycks handla om är att jämföra med långsiktiga teknik- och forskningssatsningar inom militära-tillämpningar. Men med den viktiga skillnaden att oavsett hur många miljarder man slösat på dessa projekt genom åren här är det ändå inte vad som ens är jämförbart med den budget-nivå försvarsprojekt haft genom åren. Där kan det fungera bra ibland även om det i antal miljarder oftare misslyckas. En till viktig skillnad är att försvarssatsningar handlar om national security vilket gör dem speciella.


Saken här är att genom att EU startar upp nya projekt inom nära besläktade områden borde dessa röra sig framåt jämförbart med teknik området globalt även om EU-projekten var för sig inte levererar värde. Men det gör dom inte utan man tappar avstånd, och ännu mer - direkt pinsamt för mig som en av Europas många EU-finansiörer - märks det när de gör något praktiskt tekniskt tillämpat för egen användning.


Just här var ju nivån att man med ett par datorer inköpta för cirka 20 - 30 kkr utmärkt kan klara att sampla 5 - 10 ggr fler nyhetskällor än vad EU gör liksom att göra nyhetsanalys många gånger mer avancerad med inte mer än att köpa lämplig referensbok ex. Jurafskys och Martins utmärkta Speech and Language processing som trots några år gammal är svårslagen som referensbok. Gör man sedan besvär att följa aktuell forskning kan man ta det några gånger till uppåt eftersom hela forskningsområdet utanför EU (med ett mycket fåtal undantag) rör sig väldigt snabbt.


Ett praktiskt test man ganska enkelt kan göra av en aktörs förmåga till nyhetsanalys är att identifiera ett konkret problem hos dem av sådan typ att de rimligen korrigerar det alt. men omvänt indikerar ett värde. Mest triviala nivå är att indikera direkt i titel. Företag m.m. även utan egentligt stöd brukar klara detta genom att använda nyhetsbevakning på enklare tjänster eller sökmotorer. Tekniktunga entiteter klarar dock också att fånga upp detta när det ligger inlagt. När jag testade det på ett par större företag inom IT kunde jag ex. konstatera att den oftast ansett ledande av de två mycket riktigt noterade det snabbt. För den andra trots just i Sverige många fler medarbetare behövde det upp ungefär på titelnivå. Hur man skulle göra samma test mot en organisation som EU där aktuella områden ej är karriärs- eller ekonomiskt känsliga på sätt som skapar drivkraft vet jag inte. Märker man möjlig korruption kanske man kan pröva med det och se om motsvarande land börjar sabotera samarbetet för att motverka utredning de kanske misstänker är på väg. Men mer realistiskt går det inte för de bryr sig egentligen inte. Det är mycket mer av en egen värld där man själv definierar vad som är bra (det mesta man själva gör.


Vad som egentligen stör mig mest med det här mer än våra pengar som kastas bort på att addera dö-vikt på Europa är att det skämmer ut oss. Oavsett vad vi nu kan tycka om EU åligger det oss alla nu att göra något vettigt av det.


Här i ett forsknings- och tekniktyngt område blir vi utskämda liksom hela Europa nyligen (tills engagemang av bl.a. United Kingdom, Sverige och Frankrike delvis balanserade det) i en politisk fråga när Italiens dåvarande statschef inte bara snuddande vansinnigt utan fullt publikt fjantade runt med den nu avrättade tidigare diktatorn av Libyen, och enligt andra uppgifter utanför kamerorna betedde sig än mer olämpligt. Om något tycks EU-samarbetet hindra Europas länder från att uttrycka sitt ogillande. Man vill ju inte få det politiska arbetet ännu mer flyttat till politiskt lugna oväsentligheter adderande till vardagens alla särintressens inbillade behov och icke-behov, av att Italien saboterar annat arbete.


Oavsett risken att man stör ut faktisk innovation och slösar pengar, ser jag att EU bäst i projekt ser till att prestera kvalitet på sådana nivåer man påstår sig sträva mot för att säkra Europas långsiktiga förmåga till att hantera miljöförstöring och säkerställa ekonomisk tillväxt. Mycket hellre avstår man från projekt och gör färre vi kan uppleva som föredömen och som inte blir till skämt inom tekniska specialistområden runt om i världen.


Nu när jag skriver detta kom en till jämförelse av lite samma sak. Vi har dels politiska prioriteringar i EU relaterat miljöarbete samtidigt som deras interna hantering av lokaler och färdmedel ligger på nivån att man är beslutoförmögen att avsluta helt meningslös belastning på miljö och kapitalslöseri genom att sluta flytta folk fram och tillbaka mellan Brussel och Strasbourg.


Gällande projekt-leverablerna och deras redovisande kan vi jämföra med IT- och informationssäkerhet jag arbetade ganska många år med. En enkel grupp av säkerhetshål har identifierats och är allmänt kända. Tekniktung bedömning av värde förekommer knappt alls ej relaterat värde som ges till projektet eller indirekt runt dessa, och det går därför bra att prestera strunt så länge man gör sin webbsajt, samarbetar lite på också konkreta möten mer än elektroniskt, och publicerar ett antal välstrukturerade rapporter vid slutet (och färre vid stegpunkter) utan behov av tekniskt värde men i titlar o.s.v. uttryckande ungefär de leverabler man identifierade i början av projektet.


Det finns faktiskt ett typ-område där dessa projekt av och till har en eller annan medlem som över-presterar. Tråkigt nog hör detta typ-område till vad jag brukar betrakta som varningstecken på "fetma": mycket energi med få krav. Dessa projekt ska ju egentligen vara mer praktiskt inriktade med idéen om innovation längre fram. Området folk kan överprestera i hör dock till det filosofiskt långsiktigt också jämfört med universitet (som ganska ofta i dessa områden är ganska praktiska) - men helt opraktiskt oftast (alltid?) på nivån att alla vet att det är koncept som aldrig kommer ha värde men som är intresseranta att få berättade på mötena av någon känd väldigt duktig person man kan nätverka lite med.


Något fascinerande har det verkar för mig när jag följt projekt relaterat språkanalys - men ej vad jag försökt verifiera mer formellt - att när man tittar på Tyskland i detta (många andra part of whole delar i dessa områden brukar jag numera skära direkt utan att läsa annat än maskinellt) att vi kan se kulturskillnader som också motsvarar resp. forskningsinstitut övergripande. Max Planck som ett av flera exempel är ex. närmare egentlig målsättning i sådant här oftare praktiskt inriktade. Max Planck övergripande oavsett EU är också närmare praktiskt inriktade. Ett par andra tyska entiteter (båda för Tyskland mindre universitet) som är allmänt ytterst lärdoms-opraktiska - på nivåer av vad vi i Sverige så vitt jag vet som ett litet land saknar inom teknik och tillämpad forskning - inte presterat något i projekten jag kan tänka mig någonsin går att ta praktiskt och åtminstone flera gånger ungefär samma sak man presterat i andra projekt genom åren i eller utanför EU relaterat diverse specialintressen man har runt en eller annan tes.


Jämfört med andra områden där Spanien ju märks mer negativt avslutar jag med att peka på att dom jämfört med EU oftare är praktiskt inriktade i verklig mening (utanför dokumenten). Långt ifrån alltid är det vad jag tycker håller hög kvalitet men det har nästan alltid vad jag tror åtminstone byggt kunskap med hög meningsfull tillämpbarhet inom industri och forskning. Av och till har kvaliteten dessutom varit tycker jag hög och det är ovanligt för dessa projekt. Möjligen gäller detta också United Kingdom men det är där upplever jag mycket svårare att klara att avgränsa och rått tolka ut var EU-pengar börjar och slutar relativt annan finansiering (ibland vad som verkar mer vara vad universiteten lägger i en stor pott och sedan använder samlat). UK har dessutom en osund tradition i att publicera mindre av projektens verkliga leverabler. De sitter oftare och håller på vad de egentligen presterat genom att göra det bökigare att kringgå. Ett "lexikon" åtminstone delvis EU-finansierat jag nyligen fick visade sig föga förvånande helt motsvara den lite ovanligare idéen och koncept-idéen projektet och personerna haft och är som exempel mycket intressant men kanske symptomatiskt på samma sak bedömer jag helt meningslöst för praktisk tillämpad text mining och analys trots många års arbete. Det verkade inte ens skapat utifrån perspektivet att nå fram till det.


Sverige också nationellt ska se upp med detta så att det inte blir tradition här.
Praktiska leverabler och tillämpning är viktigt, och ännu viktigare är att sätter man sådana ska man se till att de kompetent blir bedömda av personer som verkligen kan området och som inte är direkt eller indirekt associerade (d.v.s. för Sverige när det ej handlar om småsummor att man tar någon från annat land eftersom universitet, myndigheter m.m. är oerhört personligt kors-kopplade som förväntat av ett litet land).