Visar inlägg med etikett PDF. Visa alla inlägg
Visar inlägg med etikett PDF. Visa alla inlägg

Côte d'Ivoire: En unicode falerad stat idag nästan bara känd för ständigt rapporterad tecken tortyr

2015-09-18
  • Vi motiverar upp folket i Burkina Faso med den kodnings-falerade staten Côte d'Ivoire som skräckexempel: Hur blir framtiden om diktaturen eller vad det blir plötsligt inför något udda franskt tecken som resulterar i att nästan allt skrivit om land på nätet berör data-defekter av olika slag.
  • Att våga lösa problem tillsammans med invandrarna istället åt eller mot dem: Dessutom ges ett fint exempel på hur man kan hantera problem med olika unicode-grupperingar runt om i världen när de märkt att du falerat i hur du kodat deras geo-region eller religion och dom är ute efter att koda tillbaka dig till sämre service eller tänkbart ned i graven (tecken-kodning är verkligen verksamhetskritiskt för vem som helst). Som bonus kommer vi utan extra åtgärd lärt oss ett kombinerat afrikanskt-/ arabiskt-språk när vi implementerat exempel-åtgärderna...
  • Mer data ger desto mer IT: Slutligen löser vi kodningsproblem med filer lättare genom att sätta Emacs artificiella intelligens under egen-hantering programmatiskt (mindre egen kod och inget problem av meta-m rätt kommande, rätt teckenkodning o.s.v.). En riktigt fet klassisk AI ger en gedigen lösning på allt tänkbart runt strängar och kodning.

När nu så mycket nyhetsintresse igen riktas (i "normaliserad" mening för franska Västafrika: D.v.s. lite mindre än många andra delar av världen för samma händelser) låt oss inte glömma Burkina Faso's grannland Cote d'Ivoire [sic].



Cote d'Ivoire är nationen som är själva varningssignalen på att problem runt unicode, mer komplexa filsystem, komprimering, databaser m.m. dykt upp.


Eller som denna i unicode falerade staten vill kalla sig: Côte d'Ivoire (dutten ovanför o är en περισπώμενος ‎- vi kan säkert ta för givet att det bara är att kopiera en lite grekisk-text i Blogger så blir det rätt i webbläsare efter publicering - d.v.s. något vi ritat runt något: Circumflex) Låt oss illustrera vad denna nation blivit känd för med några jämförelser i antal sökresultat jag får på Google.com för:


Överst i kombination med encoding varande nu både beskrivande vad unicode gör av alla tänkbara tecken som vad det är och vad standarden beskriver sig som:



Och så kommer Cote d'Ivoire:



I jämförelse med Sverige som inte försökt visa upp en till "IT-sida" genom att kalla sig Svärge (eller varför inte Svårge för att ge norrlänningarna med sitt svårmod lite utrymme):



Tillsammans med några mer eller mindre fungerande (eller om vi så vill periodvis i alla fall ganska trasiga unicode-stöd):



Det är bl.a. en iso-standard:



Och kallas SO/IEC 10646 för 16-bitars varianten (så många tecken hit eller dit ingen för troligt en försvarlig mängd ens använt i tryckt text innan krävs 16-bitar för att ge varje tecken en unik-representation: I kontrast med sju bitars ascii eller i ofta nog tillräckligt alfabet - [A-Za-z0-9 ]).



Och Wiktionary förklarar när vägen mot tecken-falerad stat började:


"Usage notes
The country was originally known in English as Ivory Coast, and corresponding translations in other languages. In October 1985 the government requested that the country be known as Côte d'Ivoire in every language. Read more at Wikipedia."

Från: C%C3%B4te_d%27Ivoire | Wiktionary


Nå mången minns nog detta land. Förutom ett känt test-fall gäller ju att åtminstone alla länder, alla större städer, alla befolkningsgrupper, alla patientgrupper, alla politiska partier och organisationer, alla språk, allt särskilt intresserat, allt "känsligt" rörande hur dom själva framställs, allt som inte kan tala för dom själva (d.v.s. behöver barn, döda, brottsoffer m.fl. utan möjlighet att verifiera representeras oavsett sunda begränsningar redan innan det ska den som representerar dem se till att representera dem korrekt eftersom de har sämre möjlighet att själva reagera) o.s.v. representerade vad man bör ha respekt att hantera rätt - Medan President Ôbama kan ta ett litet fel och om inte får antas själv eller via myndigheter kunna betala någon på ambassaden som sitter och Obama-korrekturläser post-publicering), och allt och alla som kan för dig bli "störande agiterade" ensamma eller i grupp (betar vi nyhetsuppmärksammat genom att reta upp alla halv- till helfnoskiga muslimska extremister är det klokt att de försöker mörda oss för något vi begriper snarare än något mer udda esoteriskt brott p.g.a. av felkodning av namn eller religiöst koncept så vi inte verkat helt okunniga rörande vad vi kritiserat).


Annars sitter någon (kanske jag för annat) och testar lite för att dom tycker att det är kul eller för att störa din viktiga applikationer med en massa upprörda innevånare från ett land i Västafrika (om det inte är finländare, ryssarna, japanerna, kineserna, allt indiskt o.s.v.) i stavningen ganska likt något du såg på skärmen men inte hittade i Wikipedia eller på nätet som visar sig ha invandrat sista 20 åren i betydande antal till Sverige så de kan irritera dig i person (du noterar att den afrikanska medarbetaren en underleverantör till din bostadsrättsförening använder har slutat att städa rätt utanför din dörr och tittande på honom genom dörrens öga ser du att han som sopar mot den dörr, när han är klar med din trappuppgång och du öppnar dörren noterar du en massa damm och smuts sopat mot just din dörr medan alla andra dörrar är rena. Du vet nu att du kodat något engagerat felaktigt. Kanske sa Emacs att det var - eller menade att det tolkades som - Mule medan det såg helt rätt ut. Rekommenderad åtgärd jag gjorde för att visa mig särskilt trevligt intresserad av kulturen o.s.v. och försöka luska ut om det satts upp någon som grupp lokalt rörande någon tecken-kodning eller liknande jag skrivit:


  • Vi lär oss lite Swahili. Mitt Afrika, Swahili, Vår biståndsminister och Spanskan i Österlandet / Väst (2011-08-31). Idag mer tillbaka i mitt gamla cyniska jag har jag nu svårt att se mig själv riktigt lägga märke till vad man råkat trampa på då eller efteråt. Men likväl ett intressant språk att ha tittat lite på även om danskdjävlar, finländare, tyskdjävlar eller fransmän ej ska förvänta sig att jag tänker lära mig något av deras språk).
  • Vi intresserar oss med vårt nya språk så långt vi nu lärt: Hakuna Matata: \152343\112343\252343\212343 ???

Svarar han eller hon i unicode är det signikant. Det drabbade mig här. Eftersom jag inte brytt mig i att förbereda något jag begrep vad jag sa adderade det på riskdimensionerna ännu mer. Mär jag försökte minnas vad han svarade med måste jag uppenbart kommit fel eftersom siffer-kodningen jag mindes han svarade med ej blev något meningsfullt när jag slog upp det. Kostade mycket av kompenserande kultur-engagerade åtgärder efterföljande redan dyra Swahili. Men jag var mindre cynisk dom här åren. Förövrigt har jag råkat ut med samma problem med Swahili. Man lär sig en del bra med från parlören ganska diffusa begrep om hur annat låter. Och pratar lite och får en massa svar som man inte begriper ett dugg av och som tycks bli som agiterat och motiverat när det blir tydligt att man inte begriper dem. Vad Lejonkungens härligt köttätande idyll med vegetariska alternativ helt missade att visa något av.


Mer av dåligt hantverk i hela området teckenkodning jag och andra hederliga IT-arbetare nu lider av

I kombination med en annan väldigt vanlig ISO-standard för tecken kodning (som jag ej lyckades köpa för 0 kr från Sis men jag såg något relaterat spännande runt Fortran som behov eller intresse tidigare att lära mig ännu ej presenterat sig för: Datorgrafi - Anpassning GKS-FORTRAN som jag nog ska spara till och ha roligt med när jag förtjänat något kul som dessutom säkert många gånger kommer visa sig värdefull att ha.


Hoppas att SIS gjort något runt iso-teckenkoderna och COBOL (1950-talets programmering mycket "bandmaskin" sekventiellt i hantering av indata och vad man idag när problematiskt att få ut datat från för portning till något modernt ibland hanterar genom att fotografera av skärmen med data (som i inlägg länkat föreslaget för ett system jag ej vet eller minns nu i alla fall vad det är byggt i) och köra in i bildanalys) och C-64 BASIC V2 också).



Faktiskt när man gör bildanalys på dokument med text blir hela frågan om "förslappade lyx-bokstäver" en felkälla på enorma magnituder. Minst fel får man när man bara håller sig till [A-Za-z0-9 ] samt punkter (rätt antal ungefär blanksteg är stort ej trivialt värde). Lösningar som försöker något mer än bara lite mer än så börjar ge sig på för alla jag sett föreslå rena orimligheter trots uppenbart i delar användande språkmodeller (hur vanligt nu matematiska uttryck tolkas vara: Troligen ej tolkas alls hos dem när de grekiska plötsligt dyker upp mellan ett par engelska ord). Minsta lilla defekt i avbildningen genom fotografering eller så jämförbart (eller en utmanande bakgrund till texten i en bildruta från ett filmklipp) får dem gärna att hamna fel. Ganska speciellt faktiskt eftersom man ändå hållit på en väldig massa ord med identifikation av bokstäver i text.


Återvänder vi här till Côte d'Ivoire gäller att en god språkmodell i tecken förekomst, kunskap om statistik frekvens för förekommande entiteter, samband för flergram mellan ord och kanske också hänsyn grammatik (även om jag tror för det sista att det inte ger så himla mycket för identifikation tecken).


Ett bra exempel på vardags-praktiskt fungerande såväl som ett gott råd till Côte d'Ivoire (och kanske Frankrike jag misstänksamt spekulerar bär en stor del av ansvaret för denna falerade unicode stat) har vi med Google resp. pdf-inskanningen på DTIC.mil (DTIC.mil använder Google COOP - eller vad de numera kallar det men i generation ungefär introducerad på sidan samtidigt med COOP tror jag) så vi kan samma lösning för samma dokument:



I sökresultatet:



Jag ar många gånger stört mig av hur ändå utmanande det kan vara att få över sådana här pdf-representationer av av-fotograferade till text. Helst skulle man vilja göra något som att bara markera allt och kopiera det. Om ens PDF-läsare visar bokstäverna rätt så borde man i all rimlighet få ut det rätt. Visst att det kan tortera dig många år att få flexibel mångsidighet runt unicode och allt besläktat att fungera vettigt runt indata du importerar men efter en fem år fungerar det ändå ganska vettigt i konvertering hit och dit även om av och till något på vägen falerar och man ej får den enkelhet görande det möjligt att kontrollera filerna manuellt direkt i Emacs eller annat lämpligt med rätt tecken genom att öppna dem utan råkar på diverse escape-tecken som vanligen vid problem (när jag oftare fick dem en tre år sedan) tog två bytes.


Ger vi oss på att kopiera titeln från vad nu för pdf-läsare Putty i Google Chrome har som default får vi:


A23 209 'areahandbook series!
COte d'Ivore 7
a country study,
-
0 DSTIWUh)
Distribution
f r STEMNTApprovcd uIlIc
UnlimitedI
release; 0

Konverterar vi PDF-dokumentet till text med pdftotext får vi faktiskt ett bättre resultat:



Egentligen oavsett vad jag senare kan ha skrivit om utmaningar m.m. för att lösa sådant här: Borde sådana här program egentligen inte bara fungera så man får något bra ut från dem? Jag och de flesta tycker nog det. Och det kan inte alltid vara att alla vi ska lösa problem en eller ett fåtal kunde lösa i sitt program. Det vore bara dålig tim-ekonomi och som uppskalad lösning vad som kan skada ekonomisk tillväxt och tar oss innan fordismen effektivisering av kundgrupper till standardiserade produkter effektivt tillverkade. Lite som att varje bostadsområde tillverkar en egen bil lite hur som helst beroende på vem som ska ha den.


Som man kan se från första sidan av PDF-dokumenten är en dimension av problematiken att man använder fonter i olika storlek och på olika sidor vilket är information om blanksteg m.m. konvertering ej utnyttjar (problemområdet i alla flexibilitet av vad vi skapar är emellertid knappast helt trivialt att göra nytta av i ett program som pdftotext även om man faktiskt kan hitta en del arbeten praktiskt och information tänkbart användbar om vi går mycket längre tillbaka i datahistorien till tiden när man arbetade man hålkort och önskade göra inläsning så snabb som möjlig och därför utnyttja samlad representation av sådant som grafer: Kanske. "Pikografering?").


Låt oss avsluta med ett citat från det översta sökresultatet jag tycker behandlar det hela väldigt ofullständigt men ändå en variant av hundra tusentals man troligen kan hitta när man söker på detta spännande IT-land:


"Java stores Strings internally as an array of chars, which are 16 bit unsigned values. This was based on an earlier Unicode standard that supported 64K characters.

Your String constant "Côte d'Ivoire" is in this format. If your character encoding on your XML document is correct then the String read from there will also be in the correct format. So possible errors are:

The XML document doesn't declare a character encoding;

The declared character encoding does not match the actual character encoding used.

Perhaps the XML string is being treated as US-ASCII instead of UTF-8. I would output both and eyeball them. If they look the same, compare them character by character to see where teh comparison fails. You may also want to compare the UTF8 encoding of your constant String to what's in the XML document:

byte[] bytes = "Côte d'Ivoire".getBytes("UTF-8");
It gets more complicated when you start getting into "supplementary characters". These are characters beyond the originally intended 64K ("code points" in Unicode parlance). See Supplementary Characters in the Java Platform. This isn't an issue with any of the characters you're using but it's worth noting for completeness."

Från: Comparing utf-8 strings in java | Stackoverflow.com


Ett mer korrekt svar är att antingen har vi "smutsiga strängar", "smutsiga XML-dokument" m.m. i någon okynnes kodning i vilket fall man tar reda på vilken den är och ŕensar bort den eller behåller den, eller kodar den i något större mer omfattande. Det är som PDF-dokument: Vi tittar hur de kodat sina tecken och omvandlar det när vi förstår det till vår representation. Sådan information är angiven i filerna så det är bara att titta efter (lite p.s.s. som NTFS innehåller information om filernas förehållande, vilka rättigheter de har, hur gamla de är m.m. Bara att titta efter i din fil-hanterare så vet du).


Komplettering: Lite surt att Blogger.com verkar klara av en περισπώμενος ovan för o. Det är på så många sätt så fel när en plattform för att hjälpa oss att skriva för läsaren saboterar en enkel avslutande illustration av själva problemet. Egentligen borde man kopiera en några GB stor binär-fil för att hjälpa Blogger rätt här men det är ju också fel att jag ska sitta och vänta på det att bli klart innan man får ett fint felmeddelande att göra skärmdump av.


Låt Emacs AI lösa det

Emacs bör tror jag vara den mest omfattande och avancerade artificiella intelligensen i klassisk mening som finns tillgänglig åtminstone kostnadsfritt (troligen rörande vad som rör själva de normala användningsområdena som stränghantering m.m. den mest avancerade). Det går att hitta oerhört mycket man kan komma åt programmatiskt utan att ens behöva tvinga sig lära sig Lisp. Och vi har dessutom av och till en försvarlig mängd kunskap (i annan mening än diverse lisp-script) som ex. kodnings-varianter. Nedan "completions" på värden att sätta set-selection-coding-system. Notera varianterna för dos, unix och mac och betänk att normalt sätter det hela rätt kodning för också "utmanade" filer och brukar efter "omsparning" för sådana utmanade filer ge resultat fungerande naturligt mycket väl med Linux-miljö (dock unicode går av och till defunct i något när ny versioner kommer oavsett Linux eller annat: Nu sedan några år ska man dock ej längre behöva ha problem att lösa själv längre även om man kanske bättre försiktigt uppdaterar stödet om man har behov av stora delar av det väldigt välfungerande: En indirekt effekt av detta är att stora delar av vad som diskuteras rörande problem med unicode i Linux såväl som bl.a. Perl idag är helt defunct därför att de rör väldigt tids-lokaliserade problem).


Possible completions are:
adobe-standard-encoding  adobe-standard-encoding-dos
adobe-standard-encoding-mac  adobe-standard-encoding-unix
alternativnyj  alternativnyj-dos
alternativnyj-mac  alternativnyj-unix
big5  big5-dos
big5-hkscs  big5-hkscs-dos
big5-hkscs-mac  big5-hkscs-unix
big5-mac  big5-unix
binary  chinese-big5
chinese-big5-dos  chinese-big5-hkscs
chinese-big5-hkscs-dos  chinese-big5-hkscs-mac
chinese-big5-hkscs-unix  chinese-big5-mac
chinese-big5-unix  chinese-gb18030
chinese-gb18030-dos  chinese-gb18030-mac
chinese-gb18030-unix  chinese-gbk
chinese-gbk-dos  chinese-gbk-mac
chinese-gbk-unix  chinese-hz
chinese-hz-dos  chinese-hz-mac
chinese-hz-unix  chinese-iso-7bit
chinese-iso-7bit-dos  chinese-iso-7bit-mac
chinese-iso-7bit-unix  chinese-iso-8bit
chinese-iso-8bit-dos  chinese-iso-8bit-mac
chinese-iso-8bit-unix  cn-big5
cn-big5-dos  cn-big5-hkscs
cn-big5-hkscs-dos  cn-big5-hkscs-mac
cn-big5-hkscs-unix  cn-big5-mac
cn-big5-unix  cn-gb
cn-gb-2312  cn-gb-2312-dos
cn-gb-2312-mac  cn-gb-2312-unix
cn-gb-dos  cn-gb-mac
cn-gb-unix  compound-text
compound-text-dos  compound-text-mac
compound-text-unix  compound-text-with-extensions
compound-text-with-extensions-dos  compound-text-with-extensions-mac
compound-text-with-extensions-unix  cp1047
cp1047-dos  cp1047-mac
cp1047-unix  cp1125
cp1125-dos  cp1125-mac
cp1125-unix  cp1250
cp1250-dos  cp1250-mac
cp1250-unix  cp1251
cp1251-dos  cp1251-mac
cp1251-unix  cp1252
cp1252-dos  cp1252-mac
cp1252-unix  cp1253
cp1253-dos  cp1253-mac
cp1253-unix  cp1254
cp1254-dos  cp1254-mac
cp1254-unix  cp1255
cp1255-dos  cp1255-mac
cp1255-unix  cp1256
cp1256-dos  cp1256-mac
cp1256-unix  cp1257
cp1257-dos  cp1257-mac
cp1257-unix  cp1258
cp1258-dos  cp1258-mac
cp1258-unix  cp437
cp437-dos  cp437-mac
cp437-unix  cp737
cp737-dos  cp737-mac
cp737-unix  cp850
cp850-dos  cp850-mac
cp850-unix  cp851
cp851-dos  cp851-mac
cp851-unix  cp852
cp852-dos  cp852-mac
cp852-unix  cp855
cp855-dos  cp855-mac
cp855-unix  cp857
cp857-dos  cp857-mac
cp857-unix  cp858
cp858-dos  cp858-mac
cp858-unix  cp860
cp860-dos  cp860-mac
cp860-unix  cp861
cp861-dos  cp861-mac
cp861-unix  cp862
cp862-dos  cp862-mac
cp862-unix  cp863
cp863-dos  cp863-mac
cp863-unix  cp865
cp865-dos  cp865-mac
cp865-unix  cp866
cp866-dos  cp866-mac
cp866-unix  cp866u
cp866u-dos  cp866u-mac
cp866u-unix  cp869
cp869-dos  cp869-mac
cp869-unix  cp874
cp874-dos  cp874-mac
cp874-unix  cp878
cp878-dos  cp878-mac
cp878-unix  cp932
cp932-dos  cp932-mac
cp932-unix  cp936
cp936-dos  cp936-mac
cp936-unix  cp949
cp949-dos  cp949-mac
cp949-unix  cp950
cp950-dos  cp950-mac
cp950-unix  ctext
ctext-dos  ctext-mac
ctext-no-compositions  ctext-no-compositions-dos
ctext-no-compositions-mac  ctext-no-compositions-unix
ctext-unix  ctext-with-extensions
ctext-with-extensions-dos  ctext-with-extensions-mac
ctext-with-extensions-unix  cyrillic-alternativnyj
cyrillic-alternativnyj-dos  cyrillic-alternativnyj-mac
cyrillic-alternativnyj-unix  cyrillic-iso-8bit
cyrillic-iso-8bit-dos  cyrillic-iso-8bit-mac
cyrillic-iso-8bit-unix  cyrillic-koi8
cyrillic-koi8-dos  cyrillic-koi8-mac
cyrillic-koi8-unix  devanagari
devanagari-dos  devanagari-mac
devanagari-unix  dos
ebcdic-uk  ebcdic-uk-dos
ebcdic-uk-mac  ebcdic-uk-unix
ebcdic-us  ebcdic-us-dos
ebcdic-us-mac  ebcdic-us-unix
emacs-internal  emacs-mule
emacs-mule-dos  emacs-mule-mac
emacs-mule-unix  euc-china
euc-china-dos  euc-china-mac
euc-china-unix  euc-cn
euc-cn-dos  euc-cn-mac
euc-cn-unix  euc-japan
euc-japan-1990  euc-japan-1990-dos
euc-japan-1990-mac  euc-japan-1990-unix
euc-japan-dos  euc-japan-mac
euc-japan-unix  euc-jis-2004
euc-jis-2004-dos  euc-jis-2004-mac
euc-jis-2004-unix  euc-jisx0213
euc-jisx0213-dos  euc-jisx0213-mac
euc-jisx0213-unix  euc-jp
euc-jp-dos  euc-jp-mac
euc-jp-unix  euc-korea
euc-korea-dos  euc-korea-mac
euc-korea-unix  euc-kr
euc-kr-dos  euc-kr-mac
euc-kr-unix  euc-taiwan
euc-taiwan-dos  euc-taiwan-mac
euc-taiwan-unix  euc-tw
euc-tw-dos  euc-tw-mac
euc-tw-unix  eucjp-ms
eucjp-ms-dos  eucjp-ms-mac
eucjp-ms-unix  gb18030
gb18030-dos  gb18030-mac
gb18030-unix  gb2312
gb2312-dos  gb2312-mac
gb2312-unix  gbk
gbk-dos  gbk-mac
gbk-unix  georgian-academy
georgian-academy-dos  georgian-academy-mac
georgian-academy-unix  georgian-ps
georgian-ps-dos  georgian-ps-mac
georgian-ps-unix  greek-iso-8bit
greek-iso-8bit-dos  greek-iso-8bit-mac
greek-iso-8bit-unix  hebrew-iso-8bit
hebrew-iso-8bit-dos  hebrew-iso-8bit-mac
hebrew-iso-8bit-unix  hp-roman8
hp-roman8-dos  hp-roman8-mac
hp-roman8-unix  hz
hz-dos  hz-gb-2312
hz-gb-2312-dos  hz-gb-2312-mac
hz-gb-2312-unix  hz-mac
hz-unix  ibm1047
ibm1047-dos  ibm1047-mac
ibm1047-unix  ibm437
ibm437-dos  ibm437-mac
ibm437-unix  ibm850
ibm850-dos  ibm850-mac
ibm850-unix  ibm851
ibm851-dos  ibm851-mac
ibm851-unix  ibm852
ibm852-dos  ibm852-mac
ibm852-unix  ibm855
ibm855-dos  ibm855-mac
ibm855-unix  ibm857
ibm857-dos  ibm857-mac
ibm857-unix  ibm860
ibm860-dos  ibm860-mac
ibm860-unix  ibm861
ibm861-dos  ibm861-mac
ibm861-unix  ibm862
ibm862-dos  ibm862-mac
ibm862-unix  ibm863
ibm863-dos  ibm863-mac
ibm863-unix  ibm865
ibm865-dos  ibm865-mac
ibm865-unix  ibm869
ibm869-dos  ibm869-mac
ibm869-unix  ibm874
ibm874-dos  ibm874-mac
ibm874-unix  in-is13194-devanagari
in-is13194-devanagari-dos  in-is13194-devanagari-mac
in-is13194-devanagari-unix  iso-2022-7bit
iso-2022-7bit-dos  iso-2022-7bit-lock
iso-2022-7bit-lock-dos  iso-2022-7bit-lock-mac
iso-2022-7bit-lock-ss2  iso-2022-7bit-lock-ss2-dos
iso-2022-7bit-lock-ss2-mac  iso-2022-7bit-lock-ss2-unix
iso-2022-7bit-lock-unix  iso-2022-7bit-mac
iso-2022-7bit-ss2  iso-2022-7bit-ss2-dos
iso-2022-7bit-ss2-mac  iso-2022-7bit-ss2-unix
iso-2022-7bit-unix  iso-2022-8bit-ss2
iso-2022-8bit-ss2-dos  iso-2022-8bit-ss2-mac
iso-2022-8bit-ss2-unix  iso-2022-cjk
iso-2022-cjk-dos  iso-2022-cjk-mac
iso-2022-cjk-unix  iso-2022-cn
iso-2022-cn-dos  iso-2022-cn-ext
iso-2022-cn-ext-dos  iso-2022-cn-ext-mac
iso-2022-cn-ext-unix  iso-2022-cn-mac
iso-2022-cn-unix  iso-2022-int-1
iso-2022-int-1-dos  iso-2022-int-1-mac
iso-2022-int-1-unix  iso-2022-jp
iso-2022-jp-1978-irv  iso-2022-jp-1978-irv-dos
iso-2022-jp-1978-irv-mac  iso-2022-jp-1978-irv-unix
iso-2022-jp-2  iso-2022-jp-2-dos
iso-2022-jp-2-mac  iso-2022-jp-2-unix
iso-2022-jp-2004  iso-2022-jp-2004-dos
iso-2022-jp-2004-mac  iso-2022-jp-2004-unix
iso-2022-jp-3  iso-2022-jp-3-dos
iso-2022-jp-3-mac  iso-2022-jp-3-unix
iso-2022-jp-dos  iso-2022-jp-mac
iso-2022-jp-unix  iso-2022-kr
iso-2022-kr-dos  iso-2022-kr-mac
iso-2022-kr-unix  iso-8859-1
iso-8859-1-dos  iso-8859-1-mac
iso-8859-1-unix  iso-8859-10
iso-8859-10-dos  iso-8859-10-mac
iso-8859-10-unix  iso-8859-11
iso-8859-11-dos  iso-8859-11-mac
iso-8859-11-unix  iso-8859-13
iso-8859-13-dos  iso-8859-13-mac
iso-8859-13-unix  iso-8859-14
iso-8859-14-dos  iso-8859-14-mac
iso-8859-14-unix  iso-8859-15
iso-8859-15-dos  iso-8859-15-mac
iso-8859-15-unix  iso-8859-16
iso-8859-16-dos  iso-8859-16-mac
iso-8859-16-unix  iso-8859-2
iso-8859-2-dos  iso-8859-2-mac
iso-8859-2-unix  iso-8859-3
iso-8859-3-dos  iso-8859-3-mac
iso-8859-3-unix  iso-8859-4
iso-8859-4-dos  iso-8859-4-mac
iso-8859-4-unix  iso-8859-5
iso-8859-5-dos  iso-8859-5-mac
iso-8859-5-unix  iso-8859-6
iso-8859-6-dos  iso-8859-6-mac
iso-8859-6-unix  iso-8859-7
iso-8859-7-dos  iso-8859-7-mac
iso-8859-7-unix  iso-8859-8
iso-8859-8-dos  iso-8859-8-e
iso-8859-8-e-dos  iso-8859-8-e-mac
iso-8859-8-e-unix  iso-8859-8-i
iso-8859-8-i-dos  iso-8859-8-i-mac
iso-8859-8-i-unix  iso-8859-8-mac
iso-8859-8-unix  iso-8859-9
iso-8859-9-dos  iso-8859-9-mac
iso-8859-9-unix  iso-latin-1
iso-latin-1-dos  iso-latin-1-mac
iso-latin-1-unix  iso-latin-10
iso-latin-10-dos  iso-latin-10-mac
iso-latin-10-unix  iso-latin-2
iso-latin-2-dos  iso-latin-2-mac
iso-latin-2-unix  iso-latin-3
iso-latin-3-dos  iso-latin-3-mac
iso-latin-3-unix  iso-latin-4
iso-latin-4-dos  iso-latin-4-mac
iso-latin-4-unix  iso-latin-5
iso-latin-5-dos  iso-latin-5-mac
iso-latin-5-unix  iso-latin-6
iso-latin-6-dos  iso-latin-6-mac
iso-latin-6-unix  iso-latin-7
iso-latin-7-dos  iso-latin-7-mac
iso-latin-7-unix  iso-latin-8
iso-latin-8-dos  iso-latin-8-mac
iso-latin-8-unix  iso-latin-9
iso-latin-9-dos  iso-latin-9-mac
iso-latin-9-unix  iso-safe
iso-safe-dos  iso-safe-mac
iso-safe-unix  japanese-cp932
japanese-cp932-dos  japanese-cp932-mac
japanese-cp932-unix  japanese-iso-7bit-1978-irv
japanese-iso-7bit-1978-irv-dos  japanese-iso-7bit-1978-irv-mac
japanese-iso-7bit-1978-irv-unix  japanese-iso-8bit
japanese-iso-8bit-dos  japanese-iso-8bit-mac
japanese-iso-8bit-unix  japanese-shift-jis
japanese-shift-jis-2004  japanese-shift-jis-2004-dos
japanese-shift-jis-2004-mac  japanese-shift-jis-2004-unix
japanese-shift-jis-dos  japanese-shift-jis-mac
japanese-shift-jis-unix  junet
junet-dos  junet-mac
junet-unix  koi8
koi8-dos  koi8-mac
koi8-r  koi8-r-dos
koi8-r-mac  koi8-r-unix
koi8-t  koi8-t-dos
koi8-t-mac  koi8-t-unix
koi8-u  koi8-u-dos
koi8-u-mac  koi8-u-unix
koi8-unix  korean-cp949
korean-cp949-dos  korean-cp949-mac
korean-cp949-unix  korean-iso-7bit-lock
korean-iso-7bit-lock-dos  korean-iso-7bit-lock-mac
korean-iso-7bit-lock-unix  korean-iso-8bit
korean-iso-8bit-dos  korean-iso-8bit-mac
korean-iso-8bit-unix  lao
lao-dos  lao-mac
lao-unix  latin-0
latin-0-dos  latin-0-mac
latin-0-unix  latin-1
latin-1-dos  latin-1-mac
latin-1-unix  latin-10
latin-10-dos  latin-10-mac
latin-10-unix  latin-2
latin-2-dos  latin-2-mac
latin-2-unix  latin-3
latin-3-dos  latin-3-mac
latin-3-unix  latin-4
latin-4-dos  latin-4-mac
latin-4-unix  latin-5
latin-5-dos  latin-5-mac
latin-5-unix  latin-6
latin-6-dos  latin-6-mac
latin-6-unix  latin-7
latin-7-dos  latin-7-mac
latin-7-unix  latin-8
latin-8-dos  latin-8-mac
latin-8-unix  latin-9
latin-9-dos  latin-9-mac
latin-9-unix  mac
mac-roman  mac-roman-dos
mac-roman-mac  mac-roman-unix
mik  mik-dos
mik-mac  mik-unix
mule-utf-8  mule-utf-8-dos
mule-utf-8-mac  mule-utf-8-unix
next  next-dos
next-mac  next-unix
no-conversion  no-conversion-multibyte
old-jis  old-jis-dos
old-jis-mac  old-jis-unix
pt154  pt154-dos
pt154-mac  pt154-unix
raw-text  raw-text-dos
raw-text-mac  raw-text-unix
roman8  roman8-dos
roman8-mac  roman8-unix
ruscii  ruscii-dos
ruscii-mac  ruscii-unix
shift_jis  shift_jis-2004
shift_jis-2004-dos  shift_jis-2004-mac
shift_jis-2004-unix  shift_jis-dos
shift_jis-mac  shift_jis-unix
sjis  sjis-dos
sjis-mac  sjis-unix
tcvn  tcvn-5712
tcvn-5712-dos  tcvn-5712-mac
tcvn-5712-unix  tcvn-dos
tcvn-mac  tcvn-unix
th-tis620  th-tis620-dos
th-tis620-mac  th-tis620-unix
thai-tis620  thai-tis620-dos
thai-tis620-mac  thai-tis620-unix
tibetan  tibetan-dos
tibetan-iso-8bit  tibetan-iso-8bit-dos
tibetan-iso-8bit-mac  tibetan-iso-8bit-unix
tibetan-mac  tibetan-unix
tis-620  tis-620-dos
tis-620-mac  tis-620-unix
tis620  tis620-dos
tis620-mac  tis620-unix
undecided  undecided-dos
undecided-mac  undecided-unix
unix  us-ascii
us-ascii-dos  us-ascii-mac
us-ascii-unix  utf-16
utf-16-be  utf-16-be-dos
utf-16-be-mac  utf-16-be-unix
utf-16-dos  utf-16-le
utf-16-le-dos  utf-16-le-mac
utf-16-le-unix  utf-16-mac
utf-16-unix  utf-16be
utf-16be-dos  utf-16be-mac
utf-16be-unix  utf-16be-with-signature
utf-16be-with-signature-dos  utf-16be-with-signature-mac
utf-16be-with-signature-unix  utf-16le
utf-16le-dos  utf-16le-mac
utf-16le-unix  utf-16le-with-signature
utf-16le-with-signature-dos  utf-16le-with-signature-mac
utf-16le-with-signature-unix  utf-7
utf-7-dos  utf-7-imap
utf-7-imap-dos  utf-7-imap-mac
utf-7-imap-unix  utf-7-mac
utf-7-unix  utf-8
utf-8-auto  utf-8-auto-dos
utf-8-auto-mac  utf-8-auto-unix
utf-8-dos  utf-8-emacs
utf-8-emacs-dos  utf-8-emacs-mac
utf-8-emacs-unix  utf-8-mac
utf-8-unix  utf-8-with-signature
utf-8-with-signature-dos  utf-8-with-signature-mac
utf-8-with-signature-unix  vietnamese-tcvn
vietnamese-tcvn-dos  vietnamese-tcvn-mac
vietnamese-tcvn-unix  vietnamese-viqr
vietnamese-viqr-dos  vietnamese-viqr-mac
vietnamese-viqr-unix  vietnamese-viscii
vietnamese-viscii-dos  vietnamese-viscii-mac
vietnamese-viscii-unix  vietnamese-vscii
vietnamese-vscii-dos  vietnamese-vscii-mac
vietnamese-vscii-unix  viqr
viqr-dos  viqr-mac
viqr-unix  viscii
viscii-dos  viscii-mac
viscii-unix  vscii
vscii-dos  vscii-mac
vscii-unix  windows-1250
windows-1250-dos  windows-1250-mac
windows-1250-unix  windows-1251
windows-1251-dos  windows-1251-mac
windows-1251-unix  windows-1252
windows-1252-dos  windows-1252-mac
windows-1252-unix  windows-1253
windows-1253-dos  windows-1253-mac
windows-1253-unix  windows-1254
windows-1254-dos  windows-1254-mac
windows-1254-unix  windows-1255
windows-1255-dos  windows-1255-mac
windows-1255-unix  windows-1256
windows-1256-dos  windows-1256-mac
windows-1256-unix  windows-1257
windows-1257-dos  windows-1257-mac
windows-1257-unix  windows-1258
windows-1258-dos  windows-1258-mac
windows-1258-unix  windows-936
windows-936-dos  windows-936-mac
windows-936-unix  x-ctext
x-ctext-dos  x-ctext-mac
x-ctext-unix  x-ctext-with-extensions
x-ctext-with-extensions-dos  x-ctext-with-extensions-mac
x-ctext-with-extensions-unix

PDF-filer: Utmaning säkerhet / Möjlighet analys - /bin/true och "säkerhet" i applikationslagret

2015-05-28

Ett kommand som visade sig göra:


"/bin/true is a command that returns 0 (a truth value in the shell).

Its purpose is to use in places in a shell script where you would normally use a literal such as "true" in a programming language, but where the shell will only take a command to run.

/bin/false is the opposite that non-zero (a false value in the shell)."

Från: What is /bin/true? | Stack Overflow

Sedan om det är helt stabilt att testa särskilt reducerade rättigheter genom att försöka köra det vet jag inte. Men något jag kan ha adderat för evigheter sedan själv tog PDF-läsaren passerande eller försökande gå utanför rättigheter. Den ska vara ganska sunt begränsat ändå (för normala ändamål vilket vi återvänder till) men något lite extra innan spar i alla fall ibland tänkbart besvärande upprepade försök att göra något.


Jag tror jag får se över det här med PDF och säkerhetsfrågorna och införa lite mer. Emellertid kom ej problem-filen alls från dokument-samlingar man hade kunnat tro (som stora reklamfinansierade samlingar av elektronifierade böcker) ej heller uppenbart någon aktör jag trackaserat men väl ett annat litet journalhus d.v.s. troligen något relaterat rester från författarna troligt irrelevanta mig.


En tanke jag får följa upp är att följande med en del konfigurations-förändringar räcker bra:


  • Fil i PDF-version reducerande till låg-version eller samma. Original behålls om det senare kanske krävs för ev-problem text-konvertering.
  • Ev. vid behov något som processar igenom dem buntvis och tar bort referenser mer flexibla. Eller om så bedöms nödvändigt men för bökigt istället bildkonvertering föregående (med dumt fil-format).

Vidare ska jag nog ta till-vana att innan mediet jag flyttar filer från internet-dator till andra datorer får bygga om sitt filformat oftare än nu. Normalt tilltalande enkel liten sak när den räcker i utrymme. Större (och de börjar bli överdrivet dator-kraftfulla tidigt som funktion av utrymme om man handlar idag) sitter mer eller mindre med OS-konstruktioner i olika nivåer med det lägsta latent eller implicit ibland och då ej görligt att nå via definierande gränssnitt (men kan vara så via ej-definierade i vilket man kan få saker under hela filsystemet och därmed större delarna av Linux säkerhetsmodell - Vidare stoppande in ex. USB-drivar, eller liggande som boot-bara eller tänkbart beroende på konfiguration bara om drive vaknar upp efter att vilat sig när du går in i katalogen initierar diverse nere i dess lilla dator).


Med en enklare dum-sak i kapacitet utmärkt för att flytta filer tror jag det räcker precis lagom att kasta om filsystemet av och till. Kanske till något annat tagande möjlighet att pröva i ej kritiskt alla dessa möjligheter kommandona i linux har som det aldrig när man ska bygga något viktigt blir av att noggrant sitta och jämföra bra alltid (jag har dock i större haft viss positiv upplevelse ej formellt kontrollerat för ett av senaste filsystemet Linux som söker skriva mer "buntvis" med något reducerat tillförlitlighet att det alltid sparas ned: Emellertid är det ej otroligt att man konfigurerar Linux "hårt" för prestanda att det ger ganska lite jämfört med andra situationer - Jag tycker mig märka värde när jag skriver radvis utan att skriva samlat).


Vidare tänkbart är att reducera ner rättigheter allmänt för delar av filsystemet och hålla dokumenten där. D.v.s. egentligen ej sätta upp en chmod-miljö vilket så sällan görs numera på normala installationer tror jag. Men andra nivåer av senare trust tycks ju ha adderas till Linux som jag ej någonsin tittat på i detalj. Särskilt kan man ju få den att ej acceptera exkverbarhet på ej betrodda fil-noder. Oftast märker jag ingenting av det: När jag märker det kan det driva mig till vansinne när något stort ex. packas upp på ej betrott filsystem kostande tid att flytta när det helt enkelt bestämmer sig för att ej acceptera något manipulerande det oavsett normala vägar för större rättigheter (jag använder ogärna sudo men det räcker inte alltid här - Och betryggande så). Jag tror det var generiskt i Linux snarare än något särskilt tredje-part eller som jag satt det själv.


Dock grundprincipen för tillförlitlighet här är att ta bort uttryck för vad angripare vill göra (d.v.s. skript-liknande konstruktioner i PDF-filen) och fördumma när tolken man använder. Ger lite redundans på båda sidor vilket nog är sunt (jfr uppdaterande kommande för konvertera version pdf-filer med ändring eller omvänt för pdf-läsare).


Tidigare PDF, parsning av PDF för att ta ut meta-information (kan addera värde kompletterande ex. statistiskt analys av innehållet m.m. eller berätta personliga detaljer om den som gjort dokumentet: Typiskt dock bara en massa "Microsoft-app-meta" och ADOBE motsvarande för andra applikationer som gör PDF-filer - huvudsakligen görande ingenting sida upp och sida ner i sista pdf-versionerna).



Relaterat meta pdf trodde jag förövrigt länge att en av de större aktörerna när det kommer till att skapa pdf-filer från papper fotograferade av dem: Men kanske filmar man av dom? Närmare? Vid tillfälle ska jag följa upp ev. upphandlingar o.sv.. då deras konvertering till PDF storligen imponerar på mig. Bara punkt-noise (små bläck-fläckar som ger problem men de är ju bland få saker jag tror att jag skulle klara att ta bort utan att göra alldeles för mycket bildanalys för vad man kan tycka att vilken pdf-läsare som helst idag skulle klara som standardfunktion istället för allt meningslöst strunt). Förresten kanske det närmare så som vanlig kopiering fungerade förr också när automatiserad. I enterprise Husman arbetar vi tekniskt korrekt i en mer andlig mening och ska det mot förmodas kopieras känns det rätt att förhand sitta och vända en massa papper (jag vet verkligen hur man kopierar idag smart egentligen: Kanske går lika bra med en iPad eller Symbian - iPhone vet jag finns men alla dom andra... ingen aning... Känns som dom här man hade 2000 fast i färg och utan pennan man behövde skrivaa med då mot skärmen... - som min gamla konstruktion).


Sedan självklart kan vi tänka oss att delar av vägen från källa och hit är kontrollerad och filen byts ut. En lätt lösning oavsett modifierande den på vägen eller förberedande den (det senare därför att går jag in på senaste artiklarna för Entropy som jag så ofta gör - och där kan jag förövrigt understryka att det helt säkert inte är något relaterat dem även om jag kanske inte till 100% om än nära skulle utesluta det för en del andra journalhus- en av de oftast besökta - tar en bunt pdf-filer eftersom de auto-laddar ner istället för att visas i webbläsaren).


Det lär väl visa sig snart nog tänker jag såväl som kanske mer precist än så. Allmänt känns det ganska bra faktiskt. Så blir det av att se till att kanalen från internet-dator inte ligger efter ett par år i vad som borde gjorts.



Jag ska ta och komplettera med en liten skärmdump när modifierad lager faller på det och läsaren går vidare och visar men indikerande felen (känns ganska lagom särskilt när man som jag satt och sorterade upp filerna delvis från position i katalogen ej "sparad" så slapp man öppnande upp en bunt för att se vilka jag hade gjort).


Cold War Symbols - Men smart energieffektivt i information

Klokt tror jag dessutom är att energi- och kostnadseffektivt understryka min krigiska natur och närmast maniskt energi och glädje jag kan ge min in i konflikter när mitt moralsystem så tillåter. Det ger vi med ett par skämtbilder resp. en strategiskt skiss indikerande viss konceptuell expertis och intresse. Jag är så moraliskt hindrande samtidigt som jag äskar en ordentligt fejd. Så jag välkomnar springande skrattande in i strid när möjlighet erbjuds kreativt tolkande nödvärnslagen. Moral för mig tvingar mig verkligen att tydligt varna för detta: Vi vill verkligen inte se världen skaka när bärsärsk-gläden förändrar själva fundamenten vi alla står på definierade om vad riktigt otäckt är till Hans.


Det kan glädjande nog hjälpa andras moral förutom att korrekt följa min moraliska rule of engagements: Genom att repellera brottslingen innan han angriper. Vi förstärker därför upp ytterligare med exempel på min bestialiska natur och djupare förståelse av den mest vulgära såväl som skadeverkande informationen: Ridicule.


Betänk om vi ska förenkla och vulgarisera vägen att ta komik till vapen - stickande rätt mot just ett utvalt vapen in i hjärnan förnedrande till självmord - att jag sätter mig med några namn och runt dem medvetet försöker hitta på otäcka skämt. Kanske som jag e-postar till deras man eller hustru eller jämförbart (praktiskt seriöst är sådant mycket mer komplext: det kräver framför allt en kod metodik och förståelse av vad komiken är och vad i den som skadar potent utan att besmitta omgivningen med osunda stereotyper och jämförbart). Typiskt för min törstande motivation efter detta språkets mest destruktiva vapen experimenterade jag på oskyldiga - godtyckligt valde jag ett par personer hos resp. kvällstidning och vid tillfälle hånade jag dem med komik. Det kändes lätt så frustrerat hindrad av moralsystem från värre skämt nästan tvingat att sparka på lite små-strunt nära man råkar springa in i.


Illustration och text-nedan är från ett standardverk om konflikt där jag var det centrala studium man baserade teorin från. Huvuddelen av alla konflikter - allt nu och historiskt värre än som de menar rationellt - förklaras av att jag eller någon som jag älskande konflikten såväl som omänskligt skicklig i att njuta den överdrivet stort och länge. Så menade man exempelvis att det gick till när The English och besläktade saxer franko-och nordisk-fierades: Först kom någon kanske genetiskt släkt med mig krigande sönder stora delar av Frankrike (vad innan där) tills en saxer uttryckte sig oartigt föranledande en myckenhet av nordiskt reflekterande och diktande innan slutligen Hastings rätt sagt någon gång cirka 1050 - 1070 (jag har erfarenhet av hur datum och tidsstämplar ser ut idag från ganska stora corpus för sådant som publicering böcker och artiklar i journal: Och jag tvivlar på att det var mer exakt på 1000-talet än idag) - inledande processen som åter balanserar naturen rätt.


"Hans karakteristiskt för hans natur fullt utvecklad emotionellt såväl som förmåga att förverkliga sin otäcka världsbild av konflikt och makt illustreras i bilden av hans korta tid i en lagsport: Basket. För honom upplevdes det naturligt att segra varaktigt och avgörande genom att förstöra fiendens infrastruktur: Så maniskt engagerad var han att han ej tog sig tid att fullt förstå vilken basket-korg som bäst skulle förstöras om det nu alls var fungerande i sporten." / Från The Beasts in the fog - The warrior personality theory of human conflict of war: A few natural highly skilled persons explains it all. En oberoende grupp av konfliktforskare, sociologer och psykologer sammanfattade mig med i vad som nu är det moderna standardverket av mänsklig konflikt. Mer om standarverket här: Vad är skillnaden när diktaturen faller stridande resp. ger upp? Mängden (2011-04-24).

Och så något mindre fokuserat metodik och ramverk vilket gav vissa uttryck av negativa stereotyper (korrekt att se mer som ett konstverk kanske?) :

Rätt på Ukraina tror jag. Vi inser från det att Ryssland vid denna tid ännu ej tekniskt potent samplade uttryck och information om konceptet Ryssland på nätet. Att det hela nu lugnar ner sig kan vara att denna och andra otäcka bilder skrämt Ryssland.

Något fint konstnärligt - varken mer eller mindre "besvärande" i problematiska stereotyper än konstverket ovan - Ryssland gjorde om Sverige (Stor prestige för oss: Ett erkännande andra länder ej fått):

Checklista: Säkerhetsåtgärder initierade

Check-kontroll för att slutföra:

  • Konfiguration dator.
  • Ändrade format på pdf.filerna.
  • Reducerande pdf-läsare.
  • Följa upp vad skrivet runt Ubuntu och sådant här.
  • Bygga om filssytem oftare på medium för förflyttning från internet-dator till annat.
  • Uttrycka min otäcka krigiska sida för att avskräcka.
  • Moraliskt korrekt - kompenserande för kanske crime against humanity senare om så tillåts delande erfarenhet så att andra kan dra nytta av.

Det ändå missat - förlåtligt när sista steget ändå var ganska begränsat - är humoring the women and children. D.v.s det finns ingen anledning att de ska oroa sig i onödan när de manliga nöjena vi Män endast fullt förstår ges möjlighet att uttryckas. Här var väl skämtteckningen med en så stor hammare och otrevligt ansiktsuttryck lite för otäckt för att passa yngre än 18 - 24 år beroende på emotionell stabilitet. Sådant är emellertid en viktig del av att hålla det artigt civiliserade på rätt nivå så att praktiskt värde och nöje ej rinner in i zoner där det kan besvära de mjukare och känsligare kvinnorna och yngre barn (eller äldre så om kvinnor självklart).

Kultiverade nöjen och avkopplad mat och kvinnligt sällskap när striden så tillåter ska ju heller pekande på egenvärde bäst inte reduceras i värde av onödig stress agitation i språk och ljudligt allmänt springande runt dig när du ska slappna av, ett irrationellt och högljutt språk, kanske hög-ljuda uttryck för oro o.s. stör ju och ej vad som lätt kan hanteras rationellt lika lite som här i en manlig dimension från vår mänskliga natur och den djupare mening och tyngd för flocken det Manliga är fundamentet till.

Artighet och kultur är vad vi gemensamt - vi Män och Kvinnor i resp. polaritet - byggt upp. Ett språk bevarande de lugnare ändå finare värden vi annars helt i onödan tappar. Att du oroar upp din fiendes kvinna med säg otäcka nyheter och bilder från kriget i vanliga allmän-media än korrekt mer seriösa kanaler vinner du ej striden med vad du vinner striden från eftersom otrevliga uttryck omvänt (oavsett om du eller han var skyldig till övertrampet för vad korrekt) kan agiterade upp och oroa din kvinna (samtidigt som slagkraft och kostnad av sådant är begränsat: Du kan ju hemma om får ljudligt helt enkelt gå ut och roa dig eller givet den attraktion krigare kommer med koppla av med någon annan kvinna: Om än onödigt och föga korrekt när det kan undvikas).

Artighet varar längst... Sker övertramp av någon ta dig gärna tid att undervisa även din fiende. Det vinner vi alla på.

Statistisk analys av PDF-dokument: Omvandling till text och extraktion metadata från fil resp. databaser

2013-12-09

Tidigare exempel extraktion metadata resp. diskussion möjligheter analys kompletteras här med en första version av ett enkelt liten program (själva basfunktionerna var för sig tog cirka fyra timmar att skriva men mer samlat till praktiskt funktionellt kontinuerligt nedladdande och analyserande) för analys pdf-dokument, omvandling till text, och sammanförande med meta-data i separerade databaser (ex. OID).


Tidigare i ämnet:



Exempel: WWW

Referenser till webb-sidor är säkert ett mer naturligt hemvant exempel på "anslutningar" från dokumentet till aktörer, personer, information m.m. som betraktat över många fler kan säga något mer allmänt om organisationen. Nedan från ADA554030 några st. identifierade:


__FUNCTION_WORKING PDF_TO_TEXT_LOGIC
__PDF_FILE_NAME ADA554030.pdf
__IN_DIR_GIVEN C:\PTOOLS\SAMPLER\DTIC\PDF\
__PAGES 156
__WWW_CONNECTIONS www.china.org.cn/english/features/dengxiaoping/103389.htm GlobalSecurity.org mearsheimer.uchicago.edu/pdfs/A0034b.pdf www www.cfr.org www.stanleyfoundation.org
__EASY_JOURNAL_CONNECTIONS_EX_DOI 

I kontext av Google och ranking är egentligen prioritering och utnyttjande av länkar ganska annorlunda (som man oftare ser på deras algoritmer externt även om jag är tämligen säker på att association nära denna mening också är en av många möjligheter kring länkar som utnyttjas förutom koncept-beskrivning ankartext, prioritering spindling, page ranking, implicit association mellan koncept på resp. sida om länken såväl som kanske statistisk-modeller med något av flera alternativ liknande Bayesian yin yang för ett implicit samspel effektivt skattat och förr ev. en del nu övergivet för annat som förståelse av association mellan felskrivningar, begrepp för samma sak inom olika expertområden o.s.v. och vad de avser resp. relevans-kontroll om Google någonsin haft det senare tydligt tidigare än sista åren där jag tror feedback från hur själva sökresultaten fungerar med användaren används idag resp. för expertområden via riktade datakällor - datat i Google Scholar lär väl vara vad som ger många möjligheter med endast lite metadata om journalernas inriktning och författarnas association över tiden till mer övergripande områden).


Vad vi är huvudsaklingen är intresserade av här är ju mindre att säga något om indikerade dokument så mycket som prfererenser och association mellan entiteter och deras delar. Mer Google-liknande-analys är nog mindre vad man kanske valt för denna form av pdf-dokument varande relativt intet-sägande om vi vill analysera mycket snabbt (få, sällan ankartext, ofta presenterade i ex. fotnoter längst ner på sidan medan både den presentationen och fotnoterna är vådligt felområde via omvandling till text - åtminstone för mig även om jag sett att bättre teknik används av en hel del nu bl.a. Google och möjligen vad som bl.a. utvecklades av NSA och tillgängligt enligt Classification of Machine-Printed and Handwritten Text for Document Images såväl gissar jag teknik ganska väsentligt för stora delar av dokumenten DTIC publicerat vilka ofta är dåliga fotostat-kopier av ex. gamla datautskrifter eller maskinskriven text: själva problemet vi ser tydligare i omvandlingen till text är ju att det visuella lätt feltolkas med ord av avbrytna av och till i särskilt visuellt intensiva delar som huvudrubrik, författare m.m. positionerat kreativt fritt över en sida).


Exempel: Versionshistorik

Samtliga pdf-moduler jag prövade är ofullständiga i förmåga att identifiera åtminstone här konkret intressant information. Även om jag inte prövats Adobe's stöd misstänker jag lätt att det är väsentligt mer fullständigt men också riktigt dyrare i beräkningskostad (XML vara upplevt vackert graf-rätt men är samtidigt vad som tenderar att kosta brutalt i minne och cpu antingen på begränsad hårdvara eller när vi trådar upp flera processer och där kollisioner mellan processer som oväntat samtidigt åker på något överdrivet stort och komplext XML-träd kan bli svårt problematiskt om man försökt utnyttja hårdvaran närmare dess övre gräns).


Ett bra exempel är att historiken över hur pdf-dokument ADA554030 (att referera dokument med ID känns mycket rätt här) utvecklats steg för steg inte alls kommer med:


<xmpMM:History>

    <rdf:Seq>

     <rdf:li

      stEvt:action="saved"

      stEvt:instanceID="xmp.iid:62851626731AE011A09ECC9ACC76B452"

      stEvt:when="2011-01-07T15:00:21-06:00"

      stEvt:softwareAgent="Adobe Photoshop CS4 Windows"

      stEvt:changed="/"/>

     <rdf:li

      stEvt:action="saved"

      stEvt:instanceID="xmp.iid:EED3050E561EE0119927C84E9CB8197E"

      stEvt:when="2011-01-12T08:12:57-06:00"

      stEvt:softwareAgent="Adobe Photoshop CS4 Windows"

      stEvt:changed="/"/>

     <rdf:li

      stEvt:action="saved"

      stEvt:instanceID="xmp.iid:11BA444CC627E0119987A6F9DFDA4467"

      stEvt:when="2011-01-24T15:54:48-06:00"

      stEvt:softwareAgent="Adobe Photoshop CS4 Windows"

      stEvt:changed="/"/>

     <rdf:li

      stEvt:action="saved"

      stEvt:instanceID="xmp.iid:09357E023B64E011895EA90A7558D10D"

      stEvt:when="2011-04-11T12:57:22-05:00"

      stEvt:softwareAgent="Adobe Photoshop CS4 Windows"

      stEvt:changed="/"/>

     <rdf:li

      stEvt:action="saved"

      stEvt:instanceID="xmp.iid:0A357E023B64E011895EA90A7558D10D"

      stEvt:when="2011-04-11T12:57:22-05:00"

      stEvt:softwareAgent="Adobe Photoshop CS4 Windows"

      stEvt:changed="/"/>

     <rdf:li

      stEvt:action="saved"

      stEvt:instanceID="xmp.iid:0EB62AC83565E011990DE0CB345F06A5"

      stEvt:when="2011-04-12T14:34:21-05:00"

      stEvt:softwareAgent="Adobe Photoshop CS4 Windows"

      stEvt:changed="/"/>

     <rdf:li

      stEvt:action="saved"

      stEvt:instanceID="xmp.iid:FF5769E5CE65E011B575D54F7DC87B53"

      stEvt:when="2011-04-13T08:06:50-05:00"

      stEvt:softwareAgent="Adobe Photoshop CS4 Windows"

      stEvt:changed="/"/>

     <rdf:li

      stEvt:action="saved"

      stEvt:instanceID="xmp.iid:005869E5CE65E011B575D54F7DC87B53"

      stEvt:when="2011-04-13T08:08:32-05:00"

      stEvt:softwareAgent="Adobe Photoshop CS4 Windows"

      stEvt:changed="/"/>

    </rdf:Seq>

   </xmpMM:History>

Ett till exempel där närmiljö i integration andra format framgår (och som vi ska se därefter ganska brett samarbetande olika former av media-komponenter):


<xmpMM:History>
    <rdf:Seq>
     <rdf:li
      stEvt:action="saved"
      stEvt:instanceID="xmp.iid:F77F117407206811871FB2ED4E37AE08"
      stEvt:when="2011-01-14T12:11:33-05:00"
      stEvt:softwareAgent="Adobe Illustrator CS5"
      stEvt:changed="/"/>
     <rdf:li
      stEvt:action="saved"
      stEvt:instanceID="xmp.iid:01801174072068118C14E72FBDC50C68"
      stEvt:when="2011-06-28T14:07:30-04:00"
      stEvt:softwareAgent="Adobe Illustrator CS5"
      stEvt:changed="/"/>
     <rdf:li
      stEvt:action="converted"
      stEvt:parameters="from application/postscript to application/vnd.adobe.illustrator"/>
     <rdf:li
      stEvt:action="saved"
      stEvt:instanceID="xmp.iid:F77F1174072068118083E0155A4A0A32"
      stEvt:when="2011-06-28T14:13-04:00"
      stEvt:softwareAgent="Adobe Illustrator CS5"
      stEvt:changed="/"/>
     <rdf:li
      stEvt:action="saved"
      stEvt:instanceID="xmp.iid:351C424C262068118F62BE1AEC87ECB3"
      stEvt:when="2011-08-24T15:36:22-05:00"
      stEvt:softwareAgent="Adobe Photoshop CS5 Macintosh"
      stEvt:changed="/"/>
     <rdf:li
      stEvt:action="converted"
      stEvt:parameters="from image/tiff to application/vnd.adobe.photoshop"/>
     <rdf:li
      stEvt:action="derived"
      stEvt:parameters="converted from image/tiff to application/vnd.adobe.photoshop"/>
     <rdf:li
      stEvt:action="saved"
      stEvt:instanceID="xmp.iid:361C424C262068118F62BE1AEC87ECB3"
      stEvt:when="2011-08-24T15:36:22-05:00"
      stEvt:softwareAgent="Adobe Photoshop CS5 Macintosh"
      stEvt:changed="/"/>
     <rdf:li
      stEvt:action="saved"
      stEvt:instanceID="xmp.iid:371C424C262068118F62BE1AEC87ECB3"
      stEvt:when="2011-08-24T15:36:35-05:00"
      stEvt:softwareAgent="Adobe Photoshop CS5 Macintosh"
      stEvt:changed="/"/>
     <rdf:li
      stEvt:action="converted"
      stEvt:parameters="from application/vnd.adobe.photoshop to image/tiff"/>
     <rdf:li
      stEvt:action="derived"
      stEvt:parameters="converted from application/vnd.adobe.photoshop to image/tiff"/>
     <rdf:li
      stEvt:action="saved"
      stEvt:instanceID="xmp.iid:381C424C262068118F62BE1AEC87ECB3"
      stEvt:when="2011-08-24T15:36:35-05:00"
      stEvt:softwareAgent="Adobe Photoshop CS5 Macintosh"
      stEvt:changed="/"/>
    </rdf:Seq>
   </xmpMM:History>

Exempel: Integration mjukvara - Kultur och säkerhet

En mer uppenbar fråga kring risk och värde att stämpla dokument med de programvaror som används är att det kan indikera trovärdigt vad som används fortfarande vid en tidpunkt längre fram också om så långt indikerat tidigare säkra. D.v.s. berätta hur organisationen tänkbart kan angripas.


Navigating complex buildings: cognition, neuroscience and architectural design (University College of London, bok-kapitel, Dalton) - vilket dessutom är en till Riktad information - Navigation: Förstärkt i spatiell organisation excellent komplettering både ganska praktiskt men med visst djup och referenser vidare - ger ett lättsamt exempel på båda om vi nu väljer att tro Microsoft Word som mer säkerhetsdefekt trolig resp. att Macintosh nog ibland är ett kulturellt val oavsett om preferens inom tekniksegment (en del applikationer inom moving pictures för att skapa om jag minns rätt) eller att något uttrycks fullt mindre av conformity ej onödigt komplext i konfiguration känns bättre om man arbetar kreativt ganska ointressad av annan bredare vanliga kontorsapplikationer.


__FUNCTION_WORKING METADATA_LOGIC
__PDF_FILE_NAME navigating_complex_buildings.pdf
__IN_DIR_GIVEN c:\PTOOLS\PDF\pmid\
__METADATA_FIELD ModDate D:20100602114653-04'00'
__METADATA_FIELD CreationDate D:20100529222217+01'00'
__METADATA_FIELD Producer Mac OS X 10.4.11 Quartz PDFContext
__METADATA_FIELD Creator Word
__METADATA_FIELD Author Ruth
__METADATA_FIELD Title Microsoft Word - Dalton_Spiers_Hoelscher.rtf
__DOCUMENT_ID_UID_CONNECTIONS

Och så en till kulturella preferenser (även om jag inte alls betvivlar att tex, post-script m.m. har en försvarlig mängd ej dokumenterande säkerhetsdefekter bara i befintlig kod: komplicerade standarder med komplex parsning). Latex är fortfarande idag stort i delar av forskningsvärlden (mer så i de mer tillämpade delarna inom data och fysik snarare än ex. forskning inom medicinsk eller kemi).


__FUNCTION_WORKING METADATA_LOGIC
__PDF_FILE_NAME hanford.pdf
__IN_DIR_GIVEN c:\PTOOLS\PDF\pmid\
__METADATA_FIELD ModDate D:20111121131055-05'00'
__METADATA_FIELD CreationDate D:20111121131055-05'00'
__METADATA_FIELD Producer MiKTeX pdfTeX-1.40.11
__METADATA_FIELD Creator TeX
__DOCUMENT_ID_UID_CONNECTIONS
__XMP_META_DATA_HH_EXTRACTION __START
__XMP_META_DATA_HH_EXTRACTION __END

Vidare besläktat meda båda föregående exempel på vad vi kan se kan det ge indikationer om preferens open source (mjukvara snarare än metadata promiskiöst delat för andras analys) liksom benägenhet eller möjlighet att budgetera inköp mer front-end nya koncept (längre fram indikeras nog mindre inressant här när något är vanligt: vad vi syftar är mer webb-baserade lösningar i dokumenthantering, sökning m.m.).


Exempel: ID för media-komponenter och dokument

Förutom WWW-kopplingar valde jag att ta ut PMID (National institutes of healths ID för journal-artiklar i deras för forskningsområdet helt dominerande databas med applikationer sökning m.m.) resp. DOI (brett använd namngivning av journalartiklar för betalande aktörer: dx.doi.org kan från DOI namnet föra dig vidare till sidan där artikeln finns. Och slutligen referenser till unika objekt XML-dokumentet i sig gör (d.v.s. potentiellt ett helt för applikationen lokalt kontext om ej hanterat i ett övergripande system för organisationen). Fler finns man kan ta ut med PMID och DOI är mycket stora och inte ointressanta om man för en större samling av dokument ex. vill komma ifrån att i övrigt riktat parsa och analysera referenser och istället behanda det som vilken sida som helst (vilket man nog ofta vill för dokument-samlingar likt DTIC jag tar ner just nu mer totalt där dokumenten kommer från många generationer resp. där referenser filtrerat av och till kan dyka upp i separata dokument):


Nedan några typiska ID för delar av PDF-filen (eller avseende hela den i någon instans):


__FUNCTION_WORKING METADATA_LOGIC
__PDF_FILE_NAME a569695.pdf
__IN_DIR_GIVEN c:\PTOOLS\PDF\
__METADATA_FIELD ModDate D:20130321040825-04'00'
__METADATA_FIELD CreationDate D:20120530205500-04'00'
__METADATA_FIELD Producer iText 5.0.4 (c) 1T3XT BVBA
__DOCUMENT_ID_UID_CONNECTIONS uuid:b3d384ac-d60e-4945-82e9-8b6e47f48eba uuid:3e6c776a-3058-4aee-856b-2ff7247c779f

Uppenbart ovan är att jag valt att inte ta med något sammanhang alls för dem. Möjlig användning för att söka samband tenderar ju att reducera probelmatik med ovsäentligt och vidare oavsett om vi refererar externt eller om någon refererar oss är det ett samband. Dock om vi vill se djupare i dem när hittade (för association jag bedömer intressantare tror jag övergripande att man når så långt man kan utan annan kunskap alls om dem: jämför med vad likheter i termonologi kan indikea om likhet i kultur eller expertområde mellan entiteter) bör åtminstone själv-refererande för dokumentet särskiljas varför jag också tar med delar av själva XML-koden (när vi vill förstå kopplingar specifikt mellan två entiteter). Känslan jag har att med minde än att man överdrivet tittar på standarden och ändå riskerar att komma fel är praktisk användning för träffar nog utmärkta för att vettigt begipa vad som är helt eller delvis självrefererande (eller praktiskt så avgränsat ex. dator med pgoramvaror) resp. vad som via indikerat XML resp. uttrycket kan vara mer generellt dokument-id format i något sammanhang.


Emellertid för ev. behov finns resp. dokument id eftersom mer basal xml-kod sparas (praktiskt som extraktionen tycks fungera - jag är nu ingen expert på PDF så finns praktiskt prövande kändes tidseffektivt - tas all XML läsbar med medan jag valde bort delvis parsad struktur för att spara håddisk vilket jag från början också hade med temporärt via DATA::DUMPER på objektet för pdf-filen):


<x:xmpmeta x:xmptk="Adobe XMP Core 5.2-c001 63.139439, 2010/09/27-13:37:26        " xmlns:x="adobe:ns:meta/">
   <rdf:RDF xmlns:rdf="http://www.w3.org/1999/02/22-rdf-syntax-ns#">
      <rdf:Description rdf:about="" xmlns:xmp="http://ns.adobe.com/xap/1.0/">
         <xmp:ModifyDate>2013-03-21T04:08:25-04:00</xmp:ModifyDate>
         <xmp:CreateDate>2012-05-30T20:55:00-04:00</xmp:CreateDate>
         <xmp:MetadataDate>2013-03-21T04:08:25-04:00</xmp:MetadataDate>
      </rdf:Description>
      <rdf:Description rdf:about="" xmlns:dc="http://purl.org/dc/elements/1.1/">
         <dc:format>application/pdf</dc:format>
      </rdf:Description>
      <rdf:Description rdf:about="" xmlns:xmpMM="http://ns.adobe.com/xap/1.0/mm/">
         <xmpMM:DocumentID>uuid:b3d384ac-d60e-4945-82e9-8b6e47f48eba</xmpMM:DocumentID>
         <xmpMM:InstanceID>uuid:3e6c776a-3058-4aee-856b-2ff7247c779f</xmpMM:InstanceID>
      </rdf:Description>
   </rdf:RDF>
</x:xmpmeta>

En försvarlig mängd av det för moderna kameror, dokumentsystem m.m. typiska formatet för att ge media producerat en unik identifierare. Exemplet nedan från samma som nummer två med versionshistorik tidigare:


__DOCUMENT_ID_UID_CONNECTIONS uuid:5B20892493BFDB11914A8590D31508C8 xmp.did:714C3D9B56AAE011B1AA9CA76A9EC25B xmp.did:724C3D9B56AAE011B1AA9CA76A9EC25B xmp.did:734C3D9B56AAE011B1AA9CA76A9EC25B xmp.did:F77F1174072068118083E0155A4A0A32 xmp.did:FB7F1174072068118083E0155A4A0A32 xmp.iid:006035250D2068118F628C890978B148 xmp.iid:008011740720681197A5820352CD19F2 xmp.iid:016035250D2068118F628C890978B148 xmp.iid:01801174072068118083C809E165E027 xmp.iid:01801174072068118C14E6A624D85812 xmp.iid:01801174072068118C14E72FBDC50C68 xmp.iid:026035250D2068118F628C890978B148 xmp.iid:02801174072068118C14D5EDF20B39EA xmp.iid:03801174072068118C14D5EDF20B39EA xmp.iid:04801174072068118C14D5EDF20B39EA xmp.iid:05801174072068118C14E72FBDC50C68 xmp.iid:321C424C262068118F62BE1AEC87ECB3 xmp.iid:331C424C262068118F62BE1AEC87ECB3 xmp.iid:341C424C262068118F62BE1AEC87ECB3 xmp.iid:351C424C262068118F62BE1AEC87ECB3 xmp.iid:361C424C262068118F62BE1AEC87ECB3 xmp.iid:371C424C262068118F62BE1AEC87ECB3 xmp.iid:381C424C262068118F62BE1AEC87ECB3 xmp.iid:624FA1CF212068118F62BE1AEC87ECB3 xmp.iid:634FA1CF212068118F62BE1AEC87ECB3 xmp.iid:644FA1CF212068118F62BE1AEC87ECB3 xmp.iid:654FA1CF212068118F62BE1AEC87ECB3 xmp.iid:664FA1CF212068118F62BE1AEC87ECB3 xmp.iid:674FA1CF212068118F62BE1AEC87ECB3 xmp.iid:684FA1CF212068118F62BE1AEC87ECB3 xmp.iid:694FA1CF212068118F62BE1AEC87ECB3 xmp.iid:6A4FA1CF212068118F62BE1AEC87ECB3 xmp.iid:6B4FA1CF212068118F62BE1AEC87ECB3 xmp.iid:6C4FA1CF212068118F62BE1AEC87ECB3 xmp.iid:714C3D9B56AAE011B1AA9CA76A9EC25B xmp.iid:724C3D9B56AAE011B1AA9CA76A9EC25B xmp.iid:734C3D9B56AAE011B1AA9CA76A9EC25B xmp.iid:B1D0A6060F2068118F62BE1AEC87ECB3 xmp.iid:B2D0A6060F2068118F62BE1AEC87ECB3 xmp.iid:F77F1174072068118083E0155A4A0A32 xmp.iid:F77F1174072068118083E5C6D079A5EF xmp.iid:F77F117407206811871FB2ED4E37AE08 xmp.iid:F77F117407206811B84094BC3C7FBB8B xmp.iid:F77F117407206811BA4A8DBC7C9B7B1F xmp.iid:F87F117407206811B84094BC3C7FBB8B xmp.iid:F87F117407206811BA4A8DBC7C9B7B1F xmp.iid:F97F117407206811BA4A8DBC7C9B7B1F xmp.iid:FB7F1174072068118083E0155A4A0A32

Vad som gör dessa intressanta rent allmänt (ej analyserat för ex. alls) kan tyckas svårbegripligt men jämför vi med vad vi menade att www-länkarna kunde berätta blir det kanske tydligare. Vi kan se propagering, samarbete, copyright-problematik eller oftare bara odefinierat lånat m.m. när enskilda indikationer dyker upp i flera dokument. Min erfarenhet av PDF är här ännu minst sagt begränsad men min allmänna känsla är att det utanför kontext där viss standardiserad användning fövantas eller är normalt är det kanske inte den mest intressanta källan innan man börjar laborera på riktigt stora mängder av dokument (vilket ju inte sällan redan kan vara motierat av andra tyngre orsaker där detta kommer gratis på köpet: statistiskanalys, indexering m.m.). Likväl är träffar åtminstone inte vad som inte inträffar för större organisationer på inte allt för många besläktade dokument (där en del om jag tolkar konceptet och PDF rätt i alla fall hittades för NATO relaterat mer prospekterande resonerande om forskning och teknik långt ifrån något alls känsligt och helt publikt men i alla fall vad jag ej förväntat på relativt få dokument).


Detta är en motsatt sida av det värde (utanför det kanske ofta mer primära att kunna organisera information man äger som stor organisation) i informationssäkerhet och kontroll av flöde in och ut eller mellan personer i företaget. I koncept av intrusion detection kan vi jämföra med "Snowden-detektor / sensor" diskuterad där vi enkelt kan se det som att själva förekomsten av vissa media-dokument via deras identifierade kan vara binärt förbjudet för en viss person, ligga längre från dennes normala användning, eller bygga upp mot något troligt problematiskt (ex. om många tusen dokument ej relaterade systemadministration identifieras på en medarbetares PDA när han vid den dagliga utpasseringen lämnar den till säkerhetspersonalen för kontroll som konsekvens av att ha en arbetsuppgift med odefinierat höga rättigheter i datanätverket).


Men likartat kan andra ibland beroende på lösning dra slutsatser (vi kan tänkas oss att varje instans adderar in något slumpmässigt för unikt värde via en ID-fabrik någonstans men heller inte det behöver utesluta analys här helt: hur snabbt förändras entropi över tiden? hur mycket nytt resp. gammalt i kontext av en person är aktuellt?). Förutom att skapa ett fascinerande problemområde med felaktiga format eftersom det tror jag kan behöva hanteras med reaktion för att systemet ska kännas betryggande i denna form av hantering (ett dokument existerande uttryckande säkerhetsfunktion men felaktigt d.v.s. potentiellt förfalskad är ju en ganska tung indikation om angrepp men förstås dyr att hantera om någon sitter och för in defekta saker av och till för att ockupera resurser i organisationen: dock finns ju det problemet besläktat i alla fall också utan identifiera via falska mail m.m.).


Exempel: OID och innehåll

I exakthet i domän av sammanfattad information om innehållet och dess organisation i ett kunskapssystem är många andra system utanfö själva pdf-dokumentet oftare mer talande. Nedan har vi data uttryckt, sparat och gjorts tillgängligt i en standard nu ganska vanlig för fakta-dokument, journal-artiklar m.m.



Också använd för att publicera och distribuera det kanske mer välkända id för bl.a. journal-artiklar: DOI. En tysk databas var där praktiskt enkel och välfungerande för mig medan jag ännu har att få helt klart för mig hur jag effektivsas kan få ner DOI för alla vetenskapliga journalers artiklar beskrivna samt gärna fångar ny publicering utan att behöva besöka dem alla regelbundet (i den mån det alls går: en del mediehus är ganska introverta också när det gäller titel, abstract, doi m.m. och tycks göra en hel del svår-tillgängligt):



Men jag undviker gärna att i onödan lära mig sådant i detalj innan det är nödvändigt (jag spindlar och analyserar annat just nu): det finns så mycket lika viktigt och stort men inom annat. Förutom kompletthet är det tilltalande att försöka få huvuddelen publicerat i segment vi analyserar som en domän eftersom det underlättar hur vi resonerar med statistiska modeller (eller också teoretiskt förenklat sampla dem gärna nära när det går slumpmässigt - risk bias och preferens finns ju dessutom med andra metoder om än kanske lättare att resonera om när befintligt data för detektion finns).


Just för metadata neda är det från Department of Defence, US del för att hantera kunskap, forskning m.m. information man etablerat på olika nivåer genom åren för att göra det lättare att ta fram nya värden från dem (kanske se samband mellan dokument om indirekta behov, var en lösning finns att anpassa i ennan försvarsgren, upptäcka nya innnovationer m.m.), ej dubbel-arbeta saker och ting o.s.v.



Rörande mängd och exakthet finns inget unikt jämfört med normalt för journal-artiklar publicerade idag på nätet: jämförbart metadata, ofta möjligt att spindla eller ta ner på annat sätt o.s.v. Dock finns också en mängd äldre studier, utredningar m.m. med början tidigt under 1900-talet och där känner jag ej till metadata tillsammans med dokument ens i närheten i möjlighet om vi ex. vill följa utveckling av koncept eller fånga upp koncept-associationer lika viktiga idag men mindre diskuterade och uttalade i modern litteratur därför att vetskap tas som givet etablerad redan i grundutbildning. Längre bak och särskilt vissa tidsperioder kan emellertid oftare endast ha meta-informationen (möjligen gäller det oftare 1960-talet än 1950-talet även om jag inte säkert vet eftersom jag fortfarande tar ner deras pdf:er resp. databas med metadata).


Det ska också sägas att samlingen av dokument och vetandet representerat i dom publika tjänsterna är omfattande och för många områden en mycket välfungerande databas och funktion för att hitta forskning över längre tidsperioder. För flera segment tycker jag att den fungerar enklare för att hitta vad önskat snabbare. Det gäller dock en del områden (bildanalys finns ex. mycket publicerat för) medan andra områden kan vara mindre intressanta för en försvarsorganisation att direkt finansiera eller bevaka för återpublicering.


Nedan ett exempel från 1949 existerande både som dokument ADA297559 och beskrivet med metadata:


____________________________________________________________________
__FUNCTION_WORKING FUNCTION_MANAGER
__URL http://www.dtic.mil/cgi-bin/GetTRDoc?Location=U2&doc=GetTRDoc.pdf&AD=ADA297559
____________________________________________________________________
__FUNCTION_WORKING OID_HARVESTING_BY_ACCESS_NUMBER
<Citation type="tr">
<AccessionNumber>ADA297559</AccessionNumber>
<CitationStatus code="">ACTIVE</CitationStatus>
<CitationClassification code="">UNCLASSIFIED</CitationClassification>
<CorporateAuthor>TECHNICAL INFORMATION SERVICE (AEC) OAK RIDGE TN</CorporateAuthor>
<UnclassifiedTitle>Manual of Instruments and Controls for the Brookhaven Nuclear Reactor. Book 3. Volume 1.</UnclassifiedTitle>
<TitleClassification code="">UNCLASSIFIED</TitleClassification>
<ReportDate>MAY 1949</ReportDate>
<PaginationOrMediaCount>167</PaginationOrMediaCount>
<PaginationCode>0</PaginationCode>
<ItemCost>14.60</ItemCost>
<ReportNumber nonPunctuated="AECM4415">AEC-M-4415</ReportNumber>
<MonitorAcronym nonPunctuated="XF">XF</MonitorAcronym>
<MonitorSeries nonPunctuated="XD">XD</MonitorSeries>
<ReportClassification code="">UNCLASSIFIED</ReportClassification>
<DistributionCode code="01">APPROVED FOR PUBLIC RELEASE</DistributionCode>
<DescriptorClassification code="">UNCLASSIFIED</DescriptorClassification>
<AbstractClassification code="">UNCLASSIFIED</AbstractClassification>
<InitialInventory>0001</InitialInventory>
<SourceSeries>1</SourceSeries>
<SourceCode>342750</SourceCode>
<GeopoliticalCode>4702</GeopoliticalCode>
<OrganizationTypeCode code="Z">INDEPENDENT FEDERAL AGENCIES</OrganizationTypeCode>
<DocumentLocation code="1">DTIC AND NTIS</DocumentLocation>
<Abstract>The instruments and controls for the Brookhaven Nuclear Reactor have evolved from a development program whose objective was, among others, to create a research facility. Throughout this program it has been clear that the ultimate arrangement of instruments and controls can not be fixed in advance of actual operation. The ultimate arrangement will depend in large measure on the research activity to take place in the future. It has been necessary, therefore, to provide a wide range of instrument capabilities and a large number of control functions.            Underlying this primary objective of creating a versatile research facility is the associated requirement that the reactor be safe. The requirements for safety are in some ways as varied and complex as those of research. In some instances they are dominant.            Exemplifying the flexibility and versatility of the reactor  instrumentation are electronic instruments of advanced design for measuring power at extremely low levels, indicating and recording the rate of rise of power level over a wide range of power, and regulating power at  preset levels. Exemplifying the variety of safety devices are instruments for monitoring power level detected by ionization chambers, by neutron  thermopiles, and by graphite and metal-cartridge thermocouples. Devices  which monitor the operability of equipment also contribute to the safety  of the reactor.   (KAR)  p.7</Abstract>
<Descriptor>*USER MANUALS</Descriptor>
<Descriptor>*POWER LEVELS</Descriptor>
<Descriptor>*NUCLEAR REACTORS</Descriptor>
<Descriptor>*POWER MEASUREMENT</Descriptor>
<Descriptor>CONTROL</Descriptor>
<Descriptor>MEASUREMENT</Descriptor>
<Descriptor>MONITORING</Descriptor>
<Descriptor>ELECTRONIC EQUIPMENT</Descriptor>
<Descriptor>GRAPHITE</Descriptor>
<Descriptor>IONIZATION CHAMBERS</Descriptor>
<Descriptor>LOW LEVEL</Descriptor>
<Descriptor>INSTRUMENTATION</Descriptor>
<Descriptor>RECORDING SYSTEMS</Descriptor>
<Descriptor>RANGE(EXTREMES)</Descriptor>
<Descriptor>INDICATORS</Descriptor>
<Descriptor>NEUTRONS</Descriptor>
<Descriptor>SAFETY EQUIPMENT</Descriptor>
<Descriptor>THERMOPILES.</Descriptor>
<FieldsAndGroups code="180501">Nuclear Fission Reactors(power)</FieldsAndGroups>
<SBIHoldingSymbol>NPS</SBIHoldingSymbol>
<handle>http://handle.dtic.mil/100.2/ADA297559</handle>
<PdfFileSize>12 MB</PdfFileSize>
</Citation>

Exempel: Text är bättre

Analyserar vi språk i text snarare än bilderna, visuell presentation m.m. vill vi just helst bara ha texten. Det sparar minne vid analystillfällen, beräkningskostnad för att ta fram den och utrymme på hårddisken (PDF dokument kan av och till mer än stora vara gigantiska om de inkluderar en mängd föga komprimerade bilder).


Med de lösninga jag använder nu (och tror jag mycket vanliga även om system säkert kan vara bättre och sämre här varierat med kostnad i utveckling och processande av vad visuell-information betyder) med av och till feltolkningar på visuellt mer komplexa sidor (önskar man ta kostnad för det och det tror jag ej är aktuellt här med något värde för mig kan det mesta om inte nära nog alla dessa fel fås bort i efterhand via bl.a. ngram-detektion, förståelse av hur url:er, standard information som doi, pmid m.m. skrivs och åtminstone enklare parsning med Natural language processing av meningar för att förstå om en radbrytning kombinerat punkt är en förkortning avhuggen eller meningsslut på rad ovanför: dyrt i beräkningstid när det handlar om miljoner dokument - en god skattning är att cirka 10 - 15 miljoner täcker upp en god andel av viktig publicerad forskning tillgänglig i pdf-format på nätet och cirka två miljoner en god andel av väsentligt från dom senaste åren när det handlar om journal-artiklar - där jag initialt ser cirka två till 25 miljoner som en lagom nivå för titel, abstrakt m.m. och bredare analys hela dokumenten för särskilda områden scarce i inlärda relationer eller särskilt viktiga vid någon tidpunkt).


__FUNCTION_WORKING PDF_TO_TEXT_LOGIC
__PDF_FILE_NAME ADA297559.pdf
__IN_DIR_GIVEN C:\PTOOLS\SAMPLER\DTIC\PDF\
__PAGES 167
__WWW_CONNECTIONS 
__EASY_JOURNAL_CONNECTIONS_EX_DOI 
__PAGE 1
UNCLASSIFIED
OJ
UNCLASSIFIED
M-4415
Subject Category: INSTRUMENTATION
UNITED STATES ATOMIC ENERGY COMMISSION
MANUAL OF INSTRUMENTS AND CONTROLS FOR THE BROOKHAVEN NUCLEAR REACTOR. BOOK 3, VOLUME I
r
KJ31SEm;a!BBanBI!! ^lM|
vUG.U6Jl9.9_a
biM& W''
?s^^M^^ ^Bm^asi^^^s^sf t^i^sz^,
May 1949
Servomechanisms Laboratory Massachusetts Institute of Technology Cambridge, Massachusetts
Jackson and Moreland Engineers New York, New York
Technical Information Extension, Oak Ridge, Tennessee
' %  ' ~ '1--"-" %  """ *
DTIS Q UALTrYlNSFEClED3
______________END_PAGE______________
__PAGE 2
Date Declassified: January 13, 1956.
LEGAL NOTICE
This report was prepared as an account of Government sponsored work. Neither the United States, nor the Commission, nor any person acting on behalf of the Commission:
A. Makes any warranty or representation, express or implied, with respect to the ac- curacy, completeness, or usefulness of the information contained in this report, or that the use of any information, apparatus, method, or process disclosed in this report may not in- fringe privately owned rights; or
B. Assumes any liabilities with respect to the use of, or for damages resulting from the use of any information, apparatus, method, or process disclosed in this report.
As used in the above, "person acting on behalf of the Commission" includes any em- ployee or contractor of the Commission to the extent that such employee or contractor prepares, handles or distributes, or provides access to, any information pursuant to his em- ployment or contract with the Commission.
This report has available copy.
been reproduced directly from the best
Issuance of this document does not constitute authority for declassification of classified material of the same or similar content and title by the same authors.
Printed in USA, Charge $1.00. Available from the Office of Technical Services, Department of Commerce, Wash- ington 25, D. C.
AEC, Oak Eidge, Tenn.
______________END_PAGE______________

Ytterst tilltalande gäller normalt att innehållsförteckning, tabeller över figurer m.m. liknande översätts till text utmärkt för journal-artiklar. Ex. från samma dokument:


__PAGE 6
CONTENTS VOLUME I
Page
9. Coarse Rod-Position Indicators - Component Description 3.35
10. Hod-Position Recorders 3.44
11. Parts List - Instrument Pinion Support Assembly
6546DN048 (For Regulating Hods) 3.47
12. Parts List - Instrument Pinion Support Assembly
6546DN047 (for Emergency Rods) 3.47
13. Parts List - Regulating-Rod Position Transmitter
Assembly 6546M030 3.49
14. Parts List - Regulating-Rod Position Indicating Unit
6546LN006 3 . 5 2
15. Parts List - ilmergency-Rod Position Transmitter
Assembly 6546EN029 3.56
16. Parts List - Kmergency-Rod Position Indicating Unit
6546BH001 3 . 5 9
17. Parts List - Coarse Rod-Position Indien tor
654&SN018 and 6546i.NQ19 3 . 6 2
18. Reference Drawings 3.65
19. Engineering Report References, D.l.C 6546, td.l.T, . . 3.65
______________END_PAGE______________
__PAGE 7

Ett till exempel från ADA297788 med tekniska data såväl som några referenser. Resultatet är varken bra eller dålig men knappast problematiskt för normal textanalys.


__PAGE 20
 fill
XJaxium Temperature Observed
2120  C to 2510 C
^-12"
30 lbs to 89 lbs
cci 4
20 lbs to 98 lbs
*2
10 cu it to 450 cu fir.
"Boron Analysis
 00 ppm to  10 (spec)
Total Ash
1 ppm to 17 ppm
gOMMAR T OF OPERATIONAL DATA
Adc kbjj  TO AEVI  AL "RIMS 11 " 1
Maximum Tariatian, Average* Range
2250 - 2400 C 60  =  65 lbs 40 = 50 lbs 100 - 300 cu ft  03 -  06 ppm 1  to 8  ppm
As the runs were made for production purposes no attempt to control the variables ms made  So correlation between the variables and the purity obtained can be drawn from the operational data 
&f Majority of the runs fall within these ranges
ABHSKBEC *C" BIBLIOGRAPHY
1. Neumark, H  R , Trans. Electrochem. Soc. 9jL, 367, (19*1-7)
2. Sermon, G. T. United Carbon Products Co. Report Ho  3 (19^7)
3. Sermon, G. T., "16OO MA Powsr Installation on 22 M Line", United Carbon Products Co. Report Ho. 13, (19*&)
4* Bodden, C. J. Richmond, M. S., National Bureau of Standards unpublished report, "Determination of Small Amounts of Boron in Project Materials".
5. Sermon, G. T., "Heating Tests in Granular Resistance Furnaces for preparing High Purity Graphite", united Carbon Products Company Report Ho. 6, (19*1-7)
19
______________END_PAGE______________

PDF: Säkerhetsrisk att angripare systematiskt analyserande stora mängder dokument

2013-05-09

En av de funktioner jag i särsklass haft störst nytta av från funktioner Google adderat genom åren till sökresultaten är quick view för PDF (och önskvärt vore det samma för PS: givet mängden bildformat webbläsarna klarar och nästan sedan starten divergensen från html-konceptets idé om att ej ha absoluta avstånd o.s.v. och att det är det basala skrivar-språket d.v.s. jag betvivlar licens-problem eller svårighet tolka - förstår jag inte problemet).


För mig nyligen försvann funktionen. Även om jag inte ska utesluta att det är inställnings-relaterat (inte heller har jag kontrollerat om det fortfarande är funktionellt ex. via Google Docs d.v.s. access Google cache av PDF-filen snarare än originalet) var den första associationen jag nu håller som mindre trolig att det var relaterat att funktionen ofta är funktionell för att nå filer man ej direkt har access till. Förklaringen vad jag kommer ihåg utan undantag (surfande dock regelmässigt journal-artiklar när det handlar om PDF) är:


  • Åtminstone för flera journal-hus att de vill ha bättre indexering av PDF-filerna och gör Google full access.
  • De stänger ej av cache av dessa eller generellt. Anmärkningsvärt möjligen indikerande ett pedagogiskt eller tekniskt problem med någon plattform hos publicist eller Google är att åtminstone ett större journal-hus har cache avstängt html men ej på PDF (ev. på annan subdomän mer för html inkluderande där särskilt sammanfattningar med väldigt långt historiskt kontext bakåt), och samma ger ej access via cache på flera domäner men åtminstone för de mer arkiv-liknande subdomänerna inkl. pdf finns den.

  • D.v.s. oavsett betallösning journal-huset tänker sig kan vi för fallet när PDF-filen existerar i cache åtminstone i meningen att den går att nå där via quick-view (om detta avviker i övrigt för cache vet jag inte).


Regelmässigt när vi når login-ruta hos journal är det ju vettigt att söka Google på titeln. Inte ovanligt har ex. universitet rätt att publicera artikeln i dess helhet och vi kan läsa den. Görande detta får vi också normalt upp sökträff journalen och kan där notera möjligheten, och beroende på moralisk-tolkning (jag tolkar detta som att de vanligen gjort detta helt medvetet för att relativt annat on-site ganska taffligt försök att få mer trafik och därmed accepterar läsare via denna kanal varande färre än vad de tror ska generera försäljningsaffärer via mer allmän söktrafik).

Emellertid såvida inte något varit direkt fel hos Google betvivlar jag nu förklaringen. För Google att direkt engagera sig i sådana fel-beslut (när det ev. är det) är ju små-dumt. Det gör det otydligt var deras ansvar börjar och slutar samtidigt som givet tämligen konservativt föränderliga idéer och lösningar med sällan något radikalt nytt (jfr de sista större för många år sedan med sitemap's via XML, och API-leverans, resp. Google:s administrationstjänst hos dom för det och andra enklare inställningar).

Så vad är förklaringen? Jag har också nyligen uppmärksammat att andra aktörer också skurit återpublicering PDF. Vi kan se relationer till dom samarbetsgrupper för informationssäkerhet inkluderande särskilt större företag med behov och bredare påverkan, myndigheter och inte sällan leverantörer som normalt inte bidragit särskilt konstruktivt alls i problemlösning (d.v.s. jag avser antivirusföretagen) som etablerades för ett antal år sedan under Bush II period vid makten.

Vilket problem kan vi ha i PDF som skulle föranleda detta? Säkerhetsdefekter öppnande upp läsarens dator betvivlar jag lätt här eftersom det normalt bör vara en uppdateringsfråga snarare än publicist-fråga.

Däremot om PDF på skapande sidan - antingen som troligast den som ursprungligen skapat dokument men ev. också den som återpublicerar - adderar information som inte förväntas eller förstås ska finnas där kan det innebära problem krävande sådant här. Ex. om filerna kan innehålla "pdf-lokala" lösenord möjliga att extrahera direkt eller indirekt (ex. indirekt svaga-hash för bruteforce-angrepp) inkluderas inser vi att om användarna återanvänder dem kan problemet vara enormt. Många aktörer här är ju ex. myndigheter m.m. Mycket annat liknande är också tänkbart och då jag inte kan något om formatet mer än att jag noterat att dess iso-ofta feltolkas regelmässigt vid kopiering ex. från Google quickview till dokument i Google Docs kan jag ingenting om det.

Inte heller har jag kontrollerat vad som kan ha publicerats. Mitt perspektiv på sådant här är att problematiken ej är associerat ett dokument-format eller tjänst utan allt publicerat sker denna mining på regelmässigt av olika aktörer. För återpublicerande aktörer att ta bort filerna kan vara mer relaterad att de inte ska riskeraa publicera vägar in att angripa ursprungligt publicerande trots att de kanske själva korrigerat problemet.