Visar inlägg med etikett Semantisk parser. Visa alla inlägg
Visar inlägg med etikett Semantisk parser. Visa alla inlägg

More eller Most? Kanske finns svaret hos barn (eller varför inte om någon mätt på dem vuxna gediget över 35 år för ålderns visdom)

2015-05-12

Experimenterade med mängd koncepten utifrån:



Ger vikt till mängd värde när jag utelämnar emotionell intensitet faktor vid sidan om "IDF-måttet" (men ej baserat just på dokument utan mer associationen till näraliggande ord) resp. ett entropi-liknande mått som funktion av sannolikheter more snarare än most som kommer högre. Jag kan förövrigt notera att läggande väsentlig vikt vid mer konceptuella nätverk vilka trots att ord som dessa numera finns med verkligen inte är avsedda att ta ut värden på (snarare mer som "brygg-noder" för att möjlighet till snabbare omräkningar i spridd via co-occurence förekomster) att koncept likt something m.fl. vi kan "skriva" om som ord_1-ord_2 prioriteras upp tydligt.


Jag prövade förövrigt att ej utnyttja mina mätvärden för sannolikheten. De hårdsamplades stort för att få goda mätvärden av mer konceptbetonade flergram som vetenskapsområden, personer, länder, orter m.m. vilka är väldigt scarce och därför har jag märkt lite i skal- och norm-mening relativt överdrivande vanliga ord jämfört med om vi kastar flergrammen och (också i all annan erfarenhet sundare rörande verb, adjektiv, adverb, PP och nouns som ej är personer m.m.) att för att testa det använda 1-gram värdena från:



Den var för denna användning - ej helt förvånande där jag säkert pekat på varför tidigare - inte riktigt perfekt. Medline N-gram är genererat från medicinska koncept och data följande tydlig ämne medicin såväl som medicinsk strukturering. Det gör att vi får medicinska koncept mer värderande än är riktigt önskvärt rörande mer funktionella allmänna ord. Rörande emellertid adjektiv och adverb är deras N-gram data möjligt beroende på vilken bredd man har ambition för vad man effektivt utnyttjar försöka vikta om mot ett mer allmänt språkligt koncept: Det är aktuellt för mig i alla fall givet att jag redan har kategoriserat upp dessa bl.a. just för medicin om än inte brutalt finmaskigt jämfört med komplexitets-nivå för mer allmänt använda adjektiv och adverb: post-opera. Ett exempel på mer konceptuell utmaning i tänkande där är hur kanske mer generella koncept och algoritmer relaterade temporala- (tids-) koncept bra går samman med det medicinska. Vi har några exempel på medicinska adjektiv och adverb från The Specialist just argumenterat havande en tidsdimension:


Ett akuttillstånd (en del-komponent där vi har en form av tidsdimension) som uppstått efter ett medicinskt tillstånd innebärande om jag minns rätt att blodkärl expanderar ut och kanske också läcker blod men oavsett det senare tänkbart reducerande normal funktionalitet allmänt. Och så tillståndet vi hamnat i: Blodbrist. Här är vi i närmare vad vi vill se som ett noun-koncept:

acute post-hemorrhagic anemia

Själva del-komponenten post-hemorrhagic är emellertid i sig "ensam" (jag skulle ovan inte vara främmande för att ta ut samlade vikter om de ej finns färdigt projiserade från tillräcklig relevant sampling parsa noun konceptet ovan som fras) och existerar i The Specialist (varande just brutalt komplett för allt medicisnkt) som egen representation:


{base=posthemorrhagic
spelling_variant=posthaemorrhagic
spelling_variant=post-hemorrhagic
spelling_variant=post-haemorrhagic
entry=E0049206
 cat=adj
 variants=inv
 position=attrib(3)
 position=pred
 stative
}

Det sena språket med fortfarande ganska nya koncept specialiserade för medicin ger oss att koncept ofta används oerhört återanvändande över adverb, adjektiv och verb. En indikation på det ovan ser vi i markering av stativ. Vi kan bild verb-varianten post-hemorrhaging (vilket vi ser stative indikationen om som tillräcklig indirekt referens mot i The Specialist).


Och föredömligt jämfört med ex. tidigare ej angivet emotionella kategorisering har vi varken ex. anti-white / anti-white americans saknande anti-black (och ej heller anti-black).


Tydligare släktskap över ordklasser:


{base=anteriorise
spelling_variant=anteriorize
entry=E0332530
 cat=verb
 variants=reg
 tran=np
 nominalization=anteriorisation|noun|E0232091
}


{base=anteriorisation
spelling_variant=anteriorization
entry=E0232091
 cat=noun
 variants=uncount
 compl=pphr(of,np)
 compl=pphr(by,np)
 nominalization_of=anteriorise|verb|E0332530
}


{base=anteriority
entry=E0523105
 cat=noun
 variants=uncount
 compl=pphr(of,np)
 nominalization_of=anterior|adj|E0009299
}

{base=anterior
spelling_variant=anteriour
entry=E0009299
 cat=adj
 variants=inv
 position=attrib(3)
 position=pred
 compl=pphr(to,np)
 stative
 nominalization=anteriority|noun|E0523105
 nominalization=
anteriorness
|noun|E0597130
}

{base=anteriority
entry=E0523105
 cat=noun
 variants=uncount
 compl=pphr(of,np)
 nominalization_of=anterior|adj|E0009299
}

{base=anteriorness
entry=E0597130
 cat=noun
 variants=uncount
 compl=pphr(of,np)
 nominalization_of=anterior|adj|E0009299
}

{base=anteriad
entry=E0009298
 cat=adv
 variants=inv
 modification_type=verb_modifier;locative
}

Och från det i bästa fall vad som ger meningsfull förståelse - eller bättre uttryckt indikationer för betydelsen till koncept som saphenous vein graft to the left anterior descending artery vi också har i The Specialist.



Vi får när vi räknar vidare i kontextuell-association ut från orden (från 3-gram filen) också som funktion av 1-gram sannoliketen ex. något cardio koncept (eller just cardio) mycket högt. Det är tveklöst som så ofta att man vinner märkbart här på att etablera en särskild statistik databas korrekt normaliserad och korrigerad för mängd-ord. Mycket möjligt kan vara mätvärden jag också för att pröva praktiskt utgår från för att normalisera ner till detta: Det mycket mer begränsat jag sett små-betraktande den ger en känsla av mycket hög kvalitet.


Helst vill jag inte använda min EMI som faktor här även om som välkänt emotionell-intensitet i ord är mycket påverkande faktor när vi läser särskilt titlar därför att:


  • För ett antal ord just relevanta kring våra "mängd-liknande" (set theory i en mer flummig subjektiv vardags-språk mening: ex. all hela mängden definierad av kontext, nothing den tomma mängden o.s.v.) ligger samplingen efter andra ord därför att de under ett par år låg som stopp-koncept därför att jag hade brist på dator-resurser (sådant växer exponent med mängden grund-symboler vi accepterar som vidare multiplikativt linjär med hur vanliga de är så a m.fl. gör skillnad att kasta). Jag hanterar inte det därför att det gav så oerhört mycket värde för övriga koncept relativt omräkningstid hanterande dessa ord att lägga på gamla statistik-db på det nya. Detta påverkar EMI men inte sannolikheter m.fl. mått (mer kostsam att beräkna p.g.a. av projektioner från olika regioner i samplade text-dokument till koncept).
  • Jag vill också ha ett till normaliseringsmått som är oberoende av EMI som används för fraserna för att bestraffa komplexitet från längd och där något ej utnyttjande heller grammatiska relationer resp. för dessa koncept ej heller ordlängd (det senare tillsammans med grammatiska ger för de stora mängderna ord ej som här i stor andel för undergruppen alla väldigt och jämfört korta: a, an, the, all, any o.s.v.

More ligger emellertid ovanför all vilket praktiskt tillsammans med en del annat pekar på att faktiskt ta viss hänsyn till om vi anger ett absolut mått eller en förändring.


Vidare är dessutom many - som man kan uppleva besläktad i all rimlighet med more och most: Ger kontext en jämförelsegrund där A är fler än B så är A relativt B många åtminstone vid något tröskelvärde fler.


Roar oss att lämna alla de senaste åren av publicerade journal-artiklar där universitets-medarbetare efter universitets-medarbetare ofta sitter och löser sedan evigheter väldokumenterade problem med lösningar i någon variant (eller exakt samma av och till) med en av preferenserna i dom statistiska modellerna med värden etablerade från mätning på skrivet språk och istället går tillbaka till psykologins (snarare än psykiatrins som vi har nu) guld-ålder i att etablera stora delar av den seriösa grundkunskap vi har (d.v.s. i den vetenskapliga psykologin snarare än flum-segmentet baserade på att forskare eller "medicinskt" medarbetare känner sig) gjordes mätningar på barn:


  • Barnen fick vid olika ålder förklara hur många av diverse ex. few, lot, some m.fl. var.
  • De få värden jag har ännu refererade (jag ska försöka leta rätt på fler och kanske med tur någon modern större studie) är inte ointressant.

Vid grades 10 - 11 börjar many ungefär (figuren i The psychology of thought and judgment är ej perfekt) kanske vid 26 st. Innan slutar lot som tycks börja ungefär vid 19. Innan ligger some (och det överraskade mig något: Ev. indikerande att jag ännu ej klar med dessa delar riktigt inte har perfekt känsla för orden eller lika troligt nästan att de förändrats lite i preferens över åren) som föregår several börjande "sent" på 14 - 15 (d.v.s. some är ganska vilket jag också upplevde kanske mer "förväntat" när man väl har sett det men inte direkt vad jag utan sett värdena skulle resonerat mig fram till).

Och several tillsammans med many är har det längsta intervallet aktiv. Kanske kan vi lite vågat uttrycka det som att more kanske faktiskt är mer än less också för längden på intervallen där de är aktiva. Innan som sista figuren i boken hade mer har vi few som liksom some är tämligen kort. Den ser ut att sluta på 7.

Innan man tittat mer på original-studien och mycket gärna senare kanske större resultat ska man verkligen inte tolka in för mycket i det här. Resultatet boken refererar är från 1948: Mycket gedigna arbetet gjordes också då även om jag upplever det som något av ett kvalitativt paradigm-skifte när vi går in i 1960-talet. Framför allt för studier med den här åldern kan de vara väldigt små. En förklaring till 1960-talets paradigm-skifte var hålkortet möjliggörande dataanalys av mer. Brotherton, Read och Pratt är referensen som jag p.g.a. brist på ljus ej utvecklar vidare.

Risken är att jag inte redan har artikeln lokalt i mina arkiv då det för mig tar ett stort steg upp i andel och mängd från och med 1960-talet (som förövrigt i relativt mening är vad jag bättre samplad än 1970-talet p.g.a. visst intresse för informationsteorin, AI, cybnernetiken o.s.v. - såväl som den vetenskapliga psykologin - 1970-talet är inte vad jag upplever riktigt presterade i dom symboliskt mer välkända insatserna jfr Wiener tidigare vad jag eller antagligen särskilt många andra har någon nytta idag oavsett hur i nöjes-mening läsvärda en och annan skildring är över hur Leary med kamrat överraskar en sovande influensa eller feber-sjuk kollega med en injektion - eller liknande - LSD för att "bota" honom: Mycket bra om ego men lite konkreta resultat man kan räkna med eller verifiera medan informationsteorin utvecklad under 1960-talet nådde oerhört långt jämfört med var den stor idag).

Datakvalitet inom lingvistik

The Specialist

Varande en korrekt team-player som bjuder till när en aktör som National Institute of Health skapar och fritt-delar en till excellent datasamling för språkanalys har jag i del två ovan letat upp några fel. Dessutom som en amerikanskt myndighet borde gilla stimulerar jag ju det amerikanska företaget Google's business genom att uppmuntra NIH till att använda Google Translate så att de upptäcker defekten såväl som några jag antagligen postat tidigare genom åren. En poäng för mig postande sådant här också är att jag är lite i det lilla intresserad av att notera något kring dom nya versionerna att ha kvar "loggat" så att säga så jag kan följa ungefärlig utveckling. Så mycket ambitiöst tidigt klingar gärna av vilket man vill så några år innan de helt lägger ner uppdatering. Dessutom är det typisk aktör som ger auto-genererade svar vilket jag inte ids hålla på med. De får nöja sig med att jag marknadsfört dem av och till mot svenska folket (vilket faktiskt är viktigt för dem: Budget numera tenderar att ibland vara scarce fodrande insatser att motivera nya koncept adderande till tidigare stöd).

Emotionell polaritet kan auto-skapat ge inkorrekta bias långt in i det socialt problematiska

Möjligt i dagarna ska jag dessutom posta en bunt underligheter - ej icke-typiska - för auto-tränat emotionellt data diverse aktörer genererar fram utan att läsa igenom det. Fascinerande i att feltänk kring vad de utgick från tidigt skapade en mängd koncept resp. koncept ej med vilket tillsammans gav en tämligen ett rasistiskt bias (bl.a. vilket är jätte-vanligt därför att man laborerar med väldigt små-corpus: För sådant här ska man göra stort. Genererande emotionell intensitet körde jag mot abnorma mängder data - inte några 100 MB eller vad det kan vara reviews från nätet utan flera tera-byte artiklar inom flera grupper för att få representativt data: Då slipper man att det vita amerikanska folket verkar mer rasistiskt än vad det faktiskt är). Så mycket mer där också. Det är svårt att komma ifrån att man behöver gå igenom allt man genererar upp manuellt. Och just denna - och om jag inte blandar samman den här - också använd sekundär i annan forskning av andra personer - havande så ovanligt mycket av just sådant här.

Efter en tio skärdumpar av diverse bl.a. runt det svarta och vita mänskliga lade jag den ifrån mig. Ej för jämförelse detekterande fel jag har i polaritet vad jag kände att jag ides med att handkontrollera (det har värde att handkontrollera annat faktiskt delvis därför att man alltid missar fel vidare därför att dessa system vanligen - eller alltid - är väldigt få med ganska få fler än ett par tusen kanske med den lite större externa jag sett havande cirka 10 - 12 000 koncept genererade via Amazon's mechnial-turk för enklare mätning på personer (som kvalitativt ligger kanske i mitten eller något under jämfört med kortare motsvarigheter jag gissar just varande kortare kanske handkontrollerades bättre).

Och det handlar verkligen inte i datat att bias är korrekt: Jag vet.

Fler emotionella problem associerade data från personer skapande emotionella kategori- och vikt-system

Ska man diskutera problem med dessa är ett till område jag själv delvis är för fallen till att ej hantera ut adverb och adjektiv separat (för min del är det nära nog förändrat nu): Man vinner på det vilket jag annat ända sedan jag läste Osgoods-arbeten från några år sedan. En av flera värden det ger är att man kan vara trygg i att eventuell "riktnings-preferens" man tillskriver ett adjektiv med en polaritets-indikation faktiskt håller (varande möjligen ej ett noun som resonerande riktning ej behöver vara funktionellt givande förväntad polaritet) samt även temporala-stabilitetsindikation hos adjektiven jag ej är säker riktigt håller på noun alltid när de också förekommer som adjektiv (d.v.s. adjektiv:ed som effekt av händelse, adjektiv:ing som en mer pågående polaritets-dynamik kanske i aktuell discourse o.s.v. upp till mest stabilt en tillskriven egenskap hos något Hans big weakness is that he cares to much about his readers / The weak Hans couldn't any longer as in his younger years lift the small Opel Cadet..

Dessutom - vilket jag ej provat - kan det vara möjligt att förutom mer frekvent omräkning av emotionell intensitet hos adjektiven (varande viktigare för att etablera bra värden på emotionell intensitet hos egentligen viktigare koncept som forskningsområden, företag m.m.) mycket möjligt göra det snabbare än när man gör det allmänt för alla koncept och ord detekterade som projektion av aktuella kontext är möjligt mot (om jag inte tänker fel: Jag hör verkligen till dom som behöver pröva sådant och prov-räkna i något eller några av praktiska användningsområdena såväl som manuellt titta på värden och områden jag är van att hålla ett öga på innan jag stabilt riktigt vet).

Att våga acceptera en moralisk och etisk risk för att försvara feminismen med min manliga dådkraft

Mindre korrekt för egen del har jag förövrigt tillsvidare tagit bort cirka 10 indikerade polaritets-koncept rörande bl.a. det "gender-politiska" även om de argumenterat korrekt kanske ska vara där de hamnande (bl.a. strong kategori): Det var väl som en ev. tillfällig åtgärd (jag ska följa upp det lite i data och kontrollera korrektheten djupare) inte 100% motiverat av övertygelse och moral utan mer en bild av någon kommande pinsamhet eller problematiskt kundkontakt rörande något kvinnlig marknadschef som inte alls tycker att ett par manliga relaterade koncept ensamma utan motsvarande kvinnligt bör ge mer boostade värden än när hon och andra kvinnor skriver det.

Generellt är det antagligen för särskilda svårbalanserade fall vad man lägger i konfiguration diskuterande dem i tillhörande böcker. Jag vill hur som helst varken rörande det gender-politiska, etniska-grupper eller dylikt ha några preferens-indikationer jag inte följt upp verkligen är korrekta från data och om så ha kontroll över dem dokumenterat. Det finns så mycket i egenheter i data där något område kan ha samplats mindre balanserat i egenheter svåra att övergripande innan se (som att vissa koncept används abnormt mycket en tidsperiod: Likt diverse idag föga accepterade benämningar på afro-amerikaner längre tillbaka inom sociologi, psykologi och politisk-forskning.

Hans skämtar: Självklart med undantag av grekerna där jag manuellt lade till lite negativt. Men herregud: Vi kan ju alla tänkas semestra där åren som kommer och någon dryg uppblåst bartender som byggts på sig less-service-mind efter att ha vunnit över EU är då inte vad jag vill behöva uppleva. Man vill ha dem motiverade - lite hungriga av alla skulder - såväl som submissive havande lärt sig att de betett sig i alla dom här åren och behöver göra bot med snabb service serverande billiga drinkar.

Undangömt - kanske skumma - Black-op data hos Missouri State University

Andra förklaringar än den jag gav kanske är tänkbara. Samtidigt när de så uppenbart generellt prioriterat webben och indikerar att man verkligen är kvalitetsmedveten måste man i all rimlighet kunna ta dem på allvar. Och det gör min förklaring att man mer lokaliserat försöker mörka kvalitetsproblem mycket tänkbar:

Det är ju också tråkigt för alla besökare att ödsla tid på att försöka reda ut varför filerna inte laddat ner. Och kanske behöva kasta bort tid med någon halv-management på pressavdelningen som knappt vet vilka grupper av forskare och institutioner man har (och jag vet: Havande skrivet många år om forskning i media har jag en god generell känsla av hur kontakt kring sådant här går till - Rapp och korrekt respons med lösning på rimlig tid inom några dagar gäller endast yngre forskare som precis publicerat något viktigt inför deras kommande fortsatta karriär: Annars är det slött, förvirrat med diverse personer som vet ingenting).

Och här tycker jag att det luktar lite. När data försvinner från diverse EU-finansierade projekt involverade ex. tyska-forskare (låtande sidor, arkiv m.m. dö bort projekt-levererar man enligt finansierings-villkor ska publicera) gäller snarast det omvända: Då vet man att det fanns något kanske praktiskt bra i datat. När amerikanerna som är mycket mer medvetna om betydelsen delande av studier såväl som data växt till de sista åren försvinner med sitt data är det ingenting som har riktigt värde i nivå med annat senare eller har problem.

Likväl vill jag se datat och om inte har jag förhoppning om ett konstant evigt problem man av och till kan använda som ex. rörande diverse företeelser. Något som annars ofta rörande IT-företag som bl.a. Google, Microsoft, IBM m.fl. blivit svårt sista åren där problem man ser möjlighet att få redaktionell-nytta av många år korrigeras sjukligt-otrevligt snabbt. Ibland inom timmar tänkbart p.g.a. av data mining de gör på webben.

Visst värde finns väl i att saker korrigeras men jag gillar också att ha lite problem hos stora aktörer att dra upp av och till genom åren. Utan att rationalisera varför så gillar det helt enkelt: Visar vem som egentligen är eller i alla fall borde vara The Big Dog.

Ett harmlöst nöje man förnekas p.g.a. av en dryga över-motiverade go-getters ska visa sig duktiga. Kanske bra för dom kan man tro: Men jag har alltid förr haft en känsla av att när det slutligen går upp för aktörer att de haft ett väsentligt problem som blivit som implicit känt över åren och folk haft roligt åt är moraliskt uppbyggligt för dem. Lär dem att kvalitet är viktigt och ska prioriteras något dessa över-aktiverade IT-företag går miste om.

Eller ärliga mindre cyniskt-komiskt är jag ganska imponerad. Det är inte om man gör automatiserad detektion av sådant bredare på webben (andra förklaring kanske också finns: Några av dessa har en hel del folk surfande åt dem. För Sverige blev det första för bra många år sedan två stycken åt Google medan det numera antagligen är fler (jag följer inte Google's organisation egentligen - och ej heller då rörande sådana positioner även om jag av och till följt rekrytering resp. folk som gått nära teknik resp. marknadspositioner högre upp). Och på engelska webben är de ganska många. Så förutom att följa upp kvalitet och kanske oftare att Adsense-partners följer riktlinjerna kan de ju också kanske ha i uppgift att hålla ett öga på vad folk är missnöjda med rörande Google. Medan det är för ett annat ej i listan indikerat också större IT-företag - och inte helt otroligt egentligen också Microsoft där jag i alla fall förr hade en hel del kontakt med ganska många arbetande i så fall Sverige som i Palo Alto även om de senare nog är pensionerade ny med tämligen generations-skiftad central press-organisation - är ganska troligt att de satt bevakning på att få meddelande om när jag skriver om dem) inte 100% trivialt.

Missouri State University har jag dock en fin känsla av att få ha flera år som kvalitetsproblems-exempel. Inte otroligt ska jag för att garantera att jag inte obalanserat är elak mot dum se till att mer bredare titta över data de publicerar, kanske referens-nätverk runt artiklar, finansierade forskningsprojekt m.m. Mycket troligt visar det sig att det är en gedigen bra aktör där problemet jag såg här var ett undantag kanske bara p.g.a. en IT-defekt. I så fall ska jag självklart dela det. Kanske kan bli något återkommande ett par gånger per kvartal att surfa runt och titta över vad de pysslar med när jag känner emotionellt-behov av att göra något bra för universitetsvärden.

Ibland kan jag känna mig som liten och osäker (jag tror det är ganska normalt): Att göra något engagerat bra för världen tycker jag kan hjälpa bra och särskilt som i Missouri State University: Varför inte publicera kvalitetsproblemen mer än bara ta bort data? (2015-05-12) våga ta dom komplexa och svåra men problematiska frågorna rätt in i "särskilda" kvalitetsproblem.

Det får mig att känna mig lugn och stark minst flera veckor ibland många månader när man riktigt fått möjlighet att trycka till något litet skit kvalitetsfel som tror sig vara för stor i annan kvalitet för att någon ska slå till felet rätt på näsbenet. Sedan jag skrev inlägget om Missouri State University har jag verkligen känt mig stark och kraftfullt uppåt: Dådkraftig. Ett bra tips för alla läsare om ni känner är svaga, osäkra eller trötta! Piggar verkligen upp.

Jag vill dock säga att även om jag valde att prioritera Missouri State University för att göra något bra för världen och samtidigt stärka upp mig själv gäller för tidigare refererade The Specialist och felet jag pekade på där att inte alls samma sak. Deras data är nära nog felfritt på nivåer ej jämförbart med något rörande språk. Allt rörande språk som kommit från National Institut of Health (kanske formad av den medicinska mer noggranna traditionen rörande data kontakt med myndigheter) är kvaliteten i mening av korrekt och precis helt lösa just de problem man avgränsat sig till i resp. delat (om än ingenting i övrigt vilket jag gillar: Hellre fullständiga kvalitetsmässiga föredömliga lösningar rörande det primära än små-delar kring annat som aldrig gjorts klart ej har sämre datakvalitet huggande en i ryggen om man bedömer kvalitet från det annars mer primära). Om något alls luktar sämre i National Institut of Health (som möjligen en del kanske mindre än nödvändigt dyra processer rörande godkännande av läkemedel) är det ingenting relaterat data de delar rörande lingvistik och deras ontologer.

Vad vi kan välja att säga att ett adjektiv är resp. att hantera spektrum av polaritet för olika kategorier av epitet samt kort om effekt-storlek för perceptions- resp. religions-nära epitet utifrån tidsstabilitet

2015-04-24

Jag har sedan flera år givit upp på att försöka få Google Docs att fungera för mig när det kommer till att sortera innehållet i motsvarande fil-kataloger. I all ärlighet gäller för mig allmänt att jag behöver vara ytterst noggrant generellt när det kommer till att sortera innehåll (där katalogstrukturer visat sig fungera bra): Utmanad kan vi säga. Där det alltid känns som för mycket arbeta för ögonblicket i gränssnittet (som åtminstone när man börjar med en historik känns minst samt bökigt). Sökfunktion m.m. man kanske kunde hoppas på är ganska rudimentära och inte vad jag någonsin märkt ens på nivå med Gmail som jag när använd aldrig tyckt löst problemet snabbare än normalt för andra e-post-klienter jag använt (Eudora + Windows ex. för en åtta - tio år sedan) via bläddring och sökning. Mängden innehåll att indexera vs antal sökningar man gör är föga otroligt förklaring nog till det: Säg att man får 50 - 70 e-post per dag och söker som jag mindre än 1 - 2 ggr per månad = Stor arbetsbelastning indexering hos Google för föga värde.


Hur som helst fungerar såväl Google (med min normala språk-filtrering till endast engelska avstängd) såväl Bing utmärkt för att söka bloggen så utan annan genomtänkt strukturering i taggar nu lika lite som förr mer än indikera mer allmänt beskrivande nyckelord publicerar jag ett par anteckningar egentligen uteslutande gjord för egen del (d.v.s. ta det för vad det är: Utmanande att läsa krävande mer än jag och många andra klarar av om vi inte skrivit det gör egen del sorterande tankar - För starka läsare lite bättre än vi andra).


Den första strukturerar upp (men avbryter när jag tyckte det var löst för att slutföra på en pappers-skriven punktlista mer TODO-direkt) resp. mer "exakt" typ av adjektiv i form av ex. bedömningar, kvaliteter m.m. tillsammans med vissa typer av mer substantiva indikationer (ex. titel, funktion o.s.v. President Hillary resp. Statsminister Eva i exempel använd).



Och den andra ger en motsvarighet för hur konvergens - i mening hur vi bygger inlärning av associerad polaritet till en entitet d.v.s. exempelvis vad vi tycker om dem - byggs i frasen (och för inlärning över en mängd motsvarande fraser) sker i hjärna om vi antar att det sker jämförbart (där jag från början delvis var inspirerad av en del känt kring denna inlärning och hur vi konvergerar in mot en entitet -ex. Hillary Clinton - avsedd givet ett kontext).


  • https://docs.google.com/drawings/d/1n7sOBZ9_UV6z3iYR5QlD3e1ioAC9-XsLGvEaewFaack/edit?usp=sharing
  • Det förklarades för mig nyligen att trots domänen samma för mig när jag skriver docs.google.com har det bytt namn till Drive: Jag trodde länge tills jag slutligen klagade på det att Google tyckte jag skrev för mycket innehåll privat istället för "att köra ut det på webben" [Red. Skämtar. /HH]. Men det hela har bytt namn till Drive: Mycket "upp-intensivt" koncept även om relevans-närhet motsvarande förväntad inlärning nog är ordentlig: Hade applikationen varit min hade jag lite fegare konservativt litat på värdet hos inlärd association hos "docs" från Lotus Notes, Microsoft Office o.s.v. Men "dokument-skrivande" är nu en ganska konservativ tillämpning för de flesta anar jag). Även om den andra vägen heller inte skulle förvåna mig kan jag tänka mig att man tappade varaktighet hos de användare man befintligt kan skatta användning från (spekulativt var kanske Google Docs inte enormt framgångsrikt från början: En lång väg när nästan alla har befintliga applikationer på datorn är ju förväntad och den kanske lugnare väg till något stort som det normala kanske kan gynnas av ett tråkigare namn: Mer skapa och skriva dokument än att köra runt i Google Drive klickande på små fyrkanter för filerna istället för förr de enklare filnamnen som jag med inlärt bias för hur jag vill ha det föregripande Google Docs kan känna).


Följande från den första länkade skapelsen kan vara värt att citera ut därför att jag tror att det kanske intuitivt kan visa på hur resp. olika grupper av adjektiv såväl som substantiv utnyttjade för att indikera roller, titlar, typ (ex. politiker) delvis kan fungera p.s.s. även om vad associerat substantiv generellt tycks (och för det överensstämmande med skapelse två länkad) av allt att döma är mer tidsstabilt. I citatet har vi bara de tre enklaste basala fallen när vi via bl.a. adjektiv kan tillskriva känsla och egenskaper till en entitet. Uppenbart får jag modifiera för att göra exemplen bättre snarare än citera.



1. NP

Green Party politician Katrin Göring-Eckardt suggested a new tax on the natural gas energy sector (instead of just mailing with the Russian ambassador) to help Putin to get motivated to handle "pussy riot" right instead of wrong.”

Ungefär som skissad som ovan (d.v.s. första länk).

2. "Katrin Göring-Eckardt is moral motivated 'green' politician."

D.v.s. vad vi kan se går att uttrycka jämförbart med formen i ett:

"The moral motivated 'green' politician Katrin Göring-Eckardt suggested a new tax on the oil energy sector"

Eller mer formellt:

"The moral motivated Green Party politician Katrin Göring-Eckardt suggested a ..."

"Putin thinking they just got a letter 'with conserns' baffled everyone by calling her and all of Germany a pussy."

3. “Katrin Göring-Eckardt is a green political person.” / “Katrin Göring-Eckardt is a green party member.”

Och här har vi ett segment av vad vi har en första skapelsen länkad. Till höger saknar vi namnet på entitet vi slutgiltigt konvergerar till i ett d.v.s. N. Men vi har en typ indikerar ex. här "green party member" eller motsvarande övriga exempel tänkbart: "Hillary Clinton is a president" / "Hillary Clinton is President of the United States" där vi för sista fallet noterar naturen / ursprunget / geografisk hemvist kommande gärna naturligt långt till höger med för många fall så självklart att vi ej behöver indikera det (hemflocken: vilka om fler än oss själva representerar vi / är vi motsvarande när påverkad av en frågan nyheten kan handla om).

Så här hanterar vi typen jämförbart med den större gruppen av titlar, typer, roller o.s.v. i första länkad skapelse.

Och rörande följande:

"Men här tänkbart konvergerar man i typ-fallet till YY och därefter till N.
Eller så görs konvergens precis som för fallet 1.

Det torde visa sig när man prövar konvergens på den."

Vet jag nu att jag har testat det jämförbara fallet redan sedan tidigt men minns ej vad som är det typiska fallet resp. om båda fallen varierat för olika större grupper av adjektiv behöver hanteras (jag tycker mig dock minnas att det sista är det korrekta fallet rörande eventuellt en kombination av adjektiv med ev. typ indikerad vilket särskiljer vissa tidsstabila fall som ska hanteras särskilt: Som konvergenser som går riktat in mot egenskaper medan mer av åsikter grovt angivet är vad som kan gå in globalt över alla sådana uttryckt vi samlar in över tiden).

Följande citat kan dessutom vara intressant att lyfta ut. Vad jag skriver är på sätt och viss både ytterst givet i vad exemplen pekar på (d.v.s. primärt återanvändning för att peka på emotionell mening med adjektiv som också har mening för exempelvis spatiell-utsträckning i rummet: Straight / crooked). Den spekulerade förklaring är just spekulativ och är överhuvudtaget givet här ändå väldigt få adjektiv i engelskan jämfört med antalet för vanliga adjektiv över godtyckligt "mer exakta" egenskaper mer eller mindre tidsstabila utnyttjade med en tydlig polaritet i mening mot positivt eller negativt när de utnyttjas för egenskaper tillskrivna människor. Och även om förklaringen tycks för mig elegant såväl som med personlig aktualitet rörande diverse beräkningar normalisering via komplexitet jag nyligen implementerad kod för vill jag nog peka på att en annan förklaring kanske är att de få-dimensionella adjektiven här helt enkelt är vanligare i såväl språk som när vi möter dem i faktiska situationer orsakande problem (kanske byggande något är det oftare så när det är viktigt att saker ska vara raka donerande en negativ upplevelse när grunkan vi hyvlat ändå visar sig krokig) :-)


Just att vi återanvänder dessa adjektiv ganska ofta för att uttrycka positivt eller negativt utan motsvarighet till meningen de kategoriseras till grupper i nedan är emellertid bra att ha sett. Det går som bör framgå i länkad skapelse ett indirekt att utnyttja genom återanvändning för faktiska i argumentation mer direkt accepterade egenskaper som dock också har förväntad spill-over på gemensam konvergens positiv och negativ: Så av och till när de hos aktörer köpande vissa ännu ganska mer sällsynta tjänster i argument ska man bäst små skratta lite (humor är ju särskild när det gäller sådant som egentligen inte riktigt stämmer så det är ett säkert sätt att möta den lite överdrivna argumentationen).


"För storlek, färg, form, smak m.m. finns ett komplexitets-beroende mellan få-dimensioner och lättare judgemental, resp. fler-dimensionell och troligare mer utvärderad mot kontext resp. oftare svårare att använda flexibelt.

1. Färg

1.1. Få-dimensionell.

Ex. Svart / Vit, Mörk / ljus.

1.2. Mång-dimensionell / Komplex. Här fortfarande relativt låg komplexitet som grovt skattat antal triviala typer (vanligaste färgerna: Säg färre än tio oavsett färg-teori runt kognition och nivå utveckling uttryckt i språk).

Ex. Grön, yellow, brown, red o.s.v.

2. Form.

1.1. Få-dimensionell

Ex. Straight, crooked, twisted, bent

Och i ett mellan-steg har vi två-dimensionella vilka sällan men av och till utnyttjas judgmental.

Ex: Square (ända ex. jag kom på så vi antar sällsynt även om jag inte minns att jag försökt kontrollera det).

Ex. "Hans blog post is fun and trendy. He is not a square. Hans is cool."

1.2. Många-dimensionell

Ex. Pyramidal, conical, oval, spherical

3. Taste

Allt här är få-dimensionellt därför att smaken i sig är så pass komplex att det likt ex. emotionella adjektiv
allmänt relativt få lönar sig för att försöka beskriva ett tillstånd.

Ex. Sweet, sour, salty, bitter, acid.

4. Tactile.

P.s.s. taste.

Ex. Rough, smooth, hard, soft, sharp, dull.


5. Storlek

Storlek som vi spontant vill bedöma det och tror jag för alla vanliga adjektiv är få-dimensionell. Minns jag
går vi (eller för barn flera åldrar i alla fall) ner till additivt kastande ut multiplikativa jämförelser så fort
jämförelse-situationen är ny.

Ex. Thick / thin, tall / short, big / small, long / short, "

Ett samlat exempel:


"People reasoning thin - not accepting cool Hans sharp arguments - could be thick and dull minded, moral crooked and short sighted."

"Smooth" argumenterat.


Och ett problematiskt område jämförbart med jag innan citatet löst pekade på är ett område som kan användas för lite mer optimerat språk (effekten ska heller inte överdrivas för många områden) är religion. Har vi nu en skapelse enormt tidsstabil finns en enkel väg att introducera jämförbart med vad jag primärt i länkad skiss hanterar i vad vi har långt till höger som ex. roller, funktioner, titlar, ämnestyper o.s.v. Sådana egenskaper vi där kan ta ut är starkt stereotypiska och när optimerat indikerat mer benägna att påverka relativt beredskap att hantera det som från allt övrigt språks centralitet förväntat. Att man lär barn koranen utantill tror jag nära besläktat detta är osunt. Emellertid går nu ibland vägar i båda riktningarna och samma argumentations-typ och sort går p.s.s. att vända på. Liksom mycket annat styr pågående språk och kultur resp. ofta när relaterat förändring budget och/eller motivation resp. kunskap. Vad som tycks vara en utmaning argumenterande i starka religiösa områden är preferens hos många att egentligen mindre argumentera för dom troende man gör till ämne utan mer för personer som liknar en själv. Perspektivet för effektivitet behöver dock vara just de troende man gör till ämne inkl. deras språk och den mening och association man lägger till begrepp.

Asymmetrisk krigföring: Koncept diskuterade media + Vägar att hitta mycket mer via

2015-02-08

KOncepten allmänt även lm jag inte vet om jag någonsin träffat på just informationen indirekt refererad är inte direkt okända:



Den intresserat uppmärksamma kan ha märkt att jag säg sista fyra åren av och till brukar peka på diverse från metoder och tankar associerade här när jag tycker det funktionellt som möjligheter för tänkbart mer "volativt" demokratiskt verkande aktörer.


En hel del här ligger i ett tankeperspektiv som utgångspunkt för strategiskt planering av serier av taktiska "realiseringar" där utgångspunkt är energieffektiv verkan. I västerländsk tradition brukar man referera till det som asymmetrisk krigföring men vi kan också välja termonologi och koncept från den mer "krigiska" sidan av taoismen av att följa och utnyttja "flodens" rörelse istället för att ödsla tid att gå emot den.


I all rimlighet för en diktatur involverande tämligen många på roller och nivå där man upplevs av folk åtminstone lokalt vara representerande för diktaturen. Bör tycker jag vantage point asymmetriskt konflikt tänkande vara motiverande faktor för att söka en lugnare transformation till demokrati. Vi vet att många i sådana grupper brukar gå åt under volativ våldsam transformation i försök att nå ett bättre samhälle. Samtidigt reduceras ju verkligen bekväma tillflyktsländer år från år. Syren, Nordkorea eller någon av by-hövdingar eller islamister kontrollerad liten bit av Libyen bör tycker jag inte vara vettiga alternativ att ens acceptera riskhantering görande behovet av nödvändigt oavsett alla möjligheter svårigheter att komma ut.



På samma tema i The National Interest finns Wake Up, America: China Is a Real Threat jag inte läste i detalj men tror jag fick en i alla fall övergripande bild av.


På temat av det perspektiv på konflikt man tar där - närhet geografiskt explicit eller implicit via intresseområden eller "derivatan" av implicit så att säga om naturresurser attraherar som aktuellt Kina påverkande entiteter man har implicita samarbeten med om än inte alltid så nära geopolitiska samarbetspartners som Japan och Sydkorea - kan man komplettera med en typ av "regioner" man ibland missar därför att de ofta kan vara ganska tysta.


Ibland märker vi dessa ändå när de kanaliserar kommunikation av någon form annat inte görlig lika enkelt om kanalen är aktuell för oss. Berlin under Kalla Kriget är ett exempel på det. Andra märker man mindre av där ett exempel är Bhutan vi kan se som potentiellt under volation head lock mellan flera entiteter ev. berörda. Samtidigt är det en kommunikationskanal mellan länder där andra vägar in och ut till åtmisntone vissa områden inte alltid annars är görligt. Särskilt just mellan två större geopolitiska entiteter man kan argumentera potentiellt är i head-lock: Indien och Kina (d.v.s. till och från Tibet via Bhutan över bergen).


Givet all realiserad intensitet i mer märkbara områden är perspektivet troligen mindre prioriterat för andra än Indien möjligen. Bhutan i sig är också en naturligt mycket potent barriär: Höga berg och djupa dalar med föga utvecklande möjligheter till transport. Av samma orsak är det tråkigt att Tibet inte existerar som land längre. Det hade tror jag varit en än potentare barriär om resp. Bhutan (om så för Tibet gärna mer oberoende än idag: Indien hanterar Bhutans försvar och står för försvarliga delar av deras statsbudget) och Tibet var oberoende stater. Båda är ju naturligt så arbetssamma att transportera sig över skapande en sund extra tid att tänka efter innan man gått för långt. Delvis existerar så klart samma broms oavsett resp. kontrollerande Tibet resp. Bhutan: De blir ju inte lättare att marschera över för det.


Asymmetriskt utnyttjande av semantisk dekomposition för att tränga in i den kinesiska vapensmedens tankar (eller oftare gissar jag marknadsanalys)

I övrigt relaterat analyserande kinesiska dokument erbjuder språket en hel del utmaningar för den som saknar färdiga lösningar. Teoretiska arbeten och ramverk som utgångspunkt existerar emellertid. Mycket praktiskt närmare och mer omedelbart värdeskapande för den som ska utveckla något finns säkert men mitt allmänintresse i området av natural language processing, semantik och text mining gör följande system som vad jag omedelbart tänker på att föreslå. Resp. är också som teoretiska arbeten såväl rörande många dimensioner för praktiskt bedöming tämligen ledande relativt övrigt tillgängligt. Här gäller också att den intresserade bör söka artiklar publicerade av olika personer som arbetat runt projekten genom åren. Samtliga har av och till just fått riktade bidrag för forskning relaterat övesättning till och från engelska och bl.a. just kinesiska språk (samt koreanska m.m.) från amerikanska myndigheter (ex. NFS) innebärande att viss öppen publicering av resultaten ska göras.


1. Welcome to the English LCS Lexicon | Umiacs.umd.edu (och verkligen som diskuterat senare är detta som minst tänkbara utgångspunkt: det finns mer) med sin praktiska realisering av LCS idéerna (d.v.s. att betrakta verb och händelser som vad vi kan dela upp i primitiver som go för förflyttning från en dimensionell punkt - eller tillstånd om vi så vill - ex. geografiskt / spatiell eller från mindre kunskap om något till att vi kan området). Ibland tänker jag att det är förvånande att inte fler använder LCS (som bedömt från referernser i böcker, artiklar m.m.) jämfört med Verbnet men varje gång man behöver använda det till något blir orsakerna mer tydliga för mig. Allt är väldefinierat o.s.v. men det är inte alltid rakt på sak att ta representationerna till användning utan en del stöd. Samtidigt är dokumentationen (av vad jag har samlat på mig under några år) utspridd över diverse artiklar från olika år (något bättre samlat går kanske att hitta).


Ett bra urval av vad publicerat runt LCS av Dorr med flera hittas också enklast via DTIC.mil:



En användning av detta förutom att tolka och förstå engelska direkt är att förflytta språk till mellan-representationer som ett steg under översättning. Är det nu automatiserad analys vi är intresserade av på större text mängder är det inte alls självklart att det är effektivt att göra läsbara översättningar av kanske miljoner eller fler dokument. Viktigare är att hitta de dokument intressanta att analysera djupare där översättning till ex. engelska kan vara ett steg. Mellan-representationer av dokumenten oavsett om på kinesiska eller engelska kan göra all föranalys innan djupare av potentiellt intressanta dokument snabbare. Särskilt gäller det när det kommer till att ta ut samband och relationer mellan dokument, personer refererade, orter m.m. eftersom detta kräver viss förståelse av resp. text (d.v.s. analys närmare dom vanligaste koncepten för sökmotor fungerar sämre: det räcker inte att vi bara ser att något förekommer i ett dokument om vi ska göra mass-analysen görlig utan att ändå behöva sitta i värsta fall manuellt och läsa en massa ointressant strunt kanske handlande om något helt annat än ett spännande super-vapen). Exempel på "rå-representation":


(
:DEF_WORD "mine"
:CLASS "35.1.a"
:SOURCES (LEVIN)
:WN_SENSE (("1.5" 00661132)
("1.6" 00791535)
("1.7.1" 00919618)
("2.0" 01127636))
:PROPBANK ("arg0 arg3 argm-LOC(in/on - up.)")
:THETA_ROLES ((1 "_ag_purp,loc()"))
:LCS (act loc (* thing 1) ((* [in] 10) loc (thing 1) (thing 11))
(for intent (*head*) (* thing 22)) (mine+ingly 26))
:VAR_SPEC ((10 :optional) (1 (animate +)) (22 (animate +) :obligatory))
)

(* thing 1) är här agent (_ag på raden ovanför). Och även om LCS kanske inte är vad söker restriktioner för (det lilla meta-språket är poängen med det) ser vi på VAR_SPEC att vi kan förvänta oss att agenten normalt är animate d.v.s. en människa eller ett djur (i mening av djur som kan agera så att vi upplever dem besluta d.v.s. djur för små att se brukar man inte kalla animate). Det hela antas fortgå i en localisering (bedrägligt lätt förståligt från [in] där den överdrivet intresserade ska uppmärksamma allt annat runt om ännu mer rakt på sak endast in i något imaginärt föreställt ännu enklare språk). Och det är en act sig snarare än att mining orsakar något i vilket fall vi har cause på första raden. loc direkt efter act tycker jag inte ska förstås locational även om det är vad det står för. Det kan vara det och just här är det oftare det men det är inte riktigt i den mening man använder det osm koncept här eftersom man försöker förenkla språket utnyttjande mönster d.v.s. inkluderande sådant vi uttrycker jämförbart med t.ex. förflyttning eller fortgående på en plats (tänkbart en plats i Wikipedia vi arbetar på eller görande text mining innanför Wikipedias gränser).


LCS är som matematik för barn och ungdomar: Det är nyttigt och gör dem mycket gott men jag tvivlar på att det alltid mer omedelbart är särskilt smidigt att ta till faktiskt värde sökt (räknande ut något spännande) eller för LCS analysera kinesiska dokument. Vi vet alla hur användbart det ofta är vardagen men LCS är "inte alltid roligt". Men säkert ett intressant projekt för någon Hong Kong student som vet att han är lite mer målfokuserad än sina kamrater rörande sådant här eller helt enkelt vill ha något annat att göra (för att referera till eller konkret bidra med) när hans kanske mer atletiska kamrater sitter ute på gatorna. Det finns massor att hitta användbart. Här som för en del liknande blir jag som uppåt lite glad av att tydliggöra värdet helt uttryckt jämfört med enklare alternativ mycket bättre. Jag gillar tanken på någon hypotetiskt person skapande något bra av det under förhoppningsvis utvecklande utmaningar på vägen. Lite kan vara så utvecklande som att lära sig en massa om LCS nog för att "översätta" ut värdet av det till vettiga strukturer ej fordrande att man har ett till språk förutom programmeringsspråk egna representationer, engelskan, kinesiska o.s.v. Sådant är bra för ungdomar. Studenter idag är så omotiverade och slöa saknande något både kul och utmanande. LCS tror jag är helt rätt.


Jag kan också tänka mig att LCS kan fungera ganska väl mot språk representerade motsvarande kinesiska. Emellertid talar jag inte alls kinesiska men har av och till intresserat mig en del för det som språk rörande lingvistiska företeelser grammatik o.s.v. (precis som lika ytligt men mycket oftare swahili och arabiska oftare återkommande när jag får för mig att det kan vara intressant att betrakta något från i ett annat perspektiv: Hakuna Mathata minns jag bäst men mest från Lejon Kungen egentligen). Arabiska, Swahili och Mandarin delar så klart stora likheter i språkens roll som handels- och krigar-språk över och mellan etniska grupper och regioner. Precis som engelskan.


En av ganska många existerande relevanta artiklar (lite äldre mer refererade men mycket relevant finns LCS och översättning). Och minns jag rätt en ganska acceptabel (i mening av kostnad läsande så att säga för den som inte tittat på LCS med besläktade koncept tidigare) introduktion:



En del finansiering och relaterat det publicering av andra ramverk finns också. Mest välkänt men mindre konkret här är givetvis Wordnet ursprungligen finansierat Department of Defence. Men även i och runt Verbnet finns forskning finansierad översättning. Emellertid även om LCS är mer svårarbetat är dess omfång ordentligt och jag tror man når längre sökande just intressant information mass-läsande kinesiska dokument. Verbnet är ju mycket en representation av grammatiska uttryck typiska man här har uttryckta ändå och med det en del restriktioner vanligare rörande om det är människor eller föremål m.m. argument samt ganska smala semantiska roller. LCS ger möjlighet att ta ut både bredare och djupare förståelse av verb och händelser. Även om meta-språket i sig säkert bra ofta är allt annat än effektivt att använda direkt ger det en utgångspunkt att ta ut snabbare egenskaper man är intresserad av ej omedelbart under analys (ex. verb som orsakar en förändring där vi kan upplevas rörande oss från något eller till något o.s.v.).


En del projekt för att föra samman både dessa och liknande har också finansierat kanske mer sista åren. Jag kan uppleva att det egentligen mest grötat hela fältet av common sense verb ännu mer. Mycket gjort abstrakt - i någon mening konkret - tillgångligt men fodrande väldigt letande runt på föga refererade projektsidor indikerande via leverabler som går att hitta på helt andra platser eller tittande runt på dom aktuella universiteten. men detta år nu inte kommersiella företag intresserade av att sälja det bredare än i sin egen subkultur av lingvistiskt intresserade bland universiteten resp. hos finansierande aktörer som Department of Defence. Även om koncept (om jag minns rätt på namnen) Verbocean, Omega m.m. ska vara större är det kanske inte praktiskt en bättre utgångspunkt för att ta in vetskapen de innehåller med. Ibland kan man rent av uppleva att man får mer börjande "samlande" av något bakåt i tiden (men det kan vara en feltolkning) inte bara rörande en usenet postning med LCS representationer prepositioner jag inte minns jag någonsin hittat på dom vanliga hemsidorna här.


Sedan är det bara att tömma tillgängliga resurser för dokument man kan nå i Kina och leta asymmetriskt krigföring. Massor finns tillgängligt men tråkigt nog inte via lika utmärkt organiserade accessvägar som DTIC.mil (som jag tror konkret vinner på att existera så länge man är sunt försiktig).

Semantiska roller: Location eller GEO political?

2015-02-07

Två övergripande ofta styrande egenheter med orter allmänt noteras först:


  • Nästan allt är en geografisk plats med ett känt namn. Det är nära noga svårt att hitta på ett namn som om kort inte visar sig existera. Jag försökte nyligen göra ett påhittat ortnamn som låter som ett riktigt men jag hoppades ej var det (för att slippa gå igenom vilka orter jag hade innan systemet gick för att testköra med orten) för att se detektionen av det. Orten jag prövade med var svensk (litet språk naturligt för mig manuellt så att säga): Bredsten men visade sig existera.
  • Orter tenderar att fras-relationerna komma relativt enkel att filtrera i regler. Man behöver knappast ens bry sig i verb-kunnande ex. via Verb net annat än utanför några enstaka möjliga konstruktioner.

Oftare förbisett är att samma benämning vi använder för orter kan vara geopolitiska aktörer. Det är i nyhetsrubrik ytterst vanligt att referera till dessa som personer (ex. USA hotar Kina, Kina gnällig och sur över Obamas möte med Dalai Lama). Det behöver inte vara ett svårt problem för de situationer där de kan ha betydelse och vi avstår här från att diskutera det (väldigt mycket relaterat orter rörande detta såväl som mycket av föregående är vad jag löser genom omfattande logiska regelkontroller i koden för att anpassa ut mot olika användningsområden: huvudsakligen för att slippa förstå om något är en ort endast när det inte skadar förståelse rörande vad man just är engagerad i för ett specifikt fall).


Intressantare är vad förståelse av en geopolitisk entitet möjliggör i djupare förståelse utanför själva nyheten eller titeln från denna tillsammans med vår befintliga vetskap om världen.


Vi utgår vi från ex. Marie burned Jack Londom from monday to friday in Alaska during lent rollerna finns satta via dumpen publicerad i Kulturellt medveten kvalitetssäkring: Semantisk analys (finns även sist)- Trroligen följer jag upp det här inlägget med en kompletterande dialog där ett till ex. dump publiceras så vi får ett ex. där on going och criminal activity för activity - d.v.s. under tidsperioden Marie begår brottet eller del av en större tidsperiod hon eller en grupp samarbetande eller en avgränsad annan grupp begår brotts-typen beroende på vad vi söker efter - vilket i analys är mer besläktat än motsvarande för crime som accomplishment vilket jag istället skar bort från dumpen eftersom det blir här nära nog samma som roll-exemplen diskuterade längre ner).


För rollerna systemet menar att deltagarna ska ha gäller inser vi också:


  • Marie (proto-agent och en human agent - dessutom female - i act d.v.s. fattande ett beslut tillsynes från text hon bör ha juridiskt ansvar för) fick bl.a. rollerna i den "verb / discourse happening nära" gruppen: Criminal, Killer (Jack London antingen allvarligt skadad eller död: Systemet förutsätter att han är död men vi inser att det missat att hon kan sitta och bränna honom på begränsade ytor under tidsperioder: Straffskattning för båda fallen är dock på så pass allvarlig att det ej är en problematisk förenkling: Om systemet sätter Killer och Criminal snarare än murder vet vi att en död-kropp ej är uppenbart noterad av systemet alternativt att murder är den explicita händelsen), Enemy o.s.v.
  • De flesta av Jack Londons motsvarande roller skapas genom att vända de roller agenten fick (några undantag - cirka 1/10 i totalt antal - finns från det där egna roll-system finns för proto-agent även för dom verb-nära): Victim eftersom han inte kämpar i discourse i vilket fall han hade kunnat få istället eller dessutom enemy, crime victim, burn victim (oavsett om burn-rollen för agent indikeras ett brinnande tillstånd när vi går in i det pågående en händelse eller "burner" betraktande det "händelse-utanför" som en sak startad och kanske avslutat mer startande som en vana eller flera gånger fire starter (eller fire stoper omvänt).

Vi har med andra ord ett brott burning genom att en AG__MALE_AGENT ("roller" börjande på "ag" är datatyper styrt av hur entiteten förstås snarare än uteslutande eller ens börjande med verb:et: Ett företag, en man, en organisation, en påtryckar-grupp är ex. alla överst mest topp AG__HUMAN_AGENT därför en eller flera människor kan agera via dem).


Antar vi att systemet tänker rätt när Alaska förstås som regionen där brottet begicks (snarare än varande en kroppsdel på Jack London) gäller att det är location snarare än geopolitiskt aktör. Samtidigt gäller att:


  • Den som är ansvarig för att hantera brott i location Alaska är den geopolitiska aktören Alaska samt "ovanför" denna det geopolitiska samarbete Alaska ingår i d.v.s. bl.a. geopolitiska organisationen USA.
  • Förståelse av detta ger bättre djup när ex. en nyhetshändelse pågående tolkas därefter. Andra aktörer ej varande Alaska, Jack London eller Marie som dyker upp senare (ex. AG__POLICE_ORG) blir praktiskt enkelt med föga annan logik att förstå hur de hör dit resp. hur olika sådana förhåller sig till varandra: Ex. att information från säg FBI är besläktad i källa med DEA eller state police när samma brott utreds men att det är parallella organisationer där nivå av samarbete under utredning ett brott resp. när samarbetet började och när resp. entitet började utreda relaterat brottet eller vad brottet är del av större kan variera från jämförbart till resultatet av oberoende kanske rent av konkurrerande entiteter.
  • Vi ges vidare kanaler analysen kan indikera är meningsfulla att börja kontrollera kontinuerligt resp. direkt för att försöka kontrollera information etablerad nyheter hittills under nyhetshändelsen: Polisorganisationer för administrative region

  • Vill vi rent av manuellt ta kontakt med någon ansvarig som resultat av analysen (kanske försöka kommunicera vikten av att vettigt normalt ge personer deras roller i förhållande till namnen - Rätt: State trooper Bill Montreol. Ok men ej rekommenderat: State Trooper Bill montreol, Fel: State trooper bill Montreol, . Fel: Statetrooper, Great Friend, and today Father, Bill Montreol - eller om vi ger upp hela konceptet att lära världen bättre och istället gör oss bättre att hantera dem kan vi hämta upp kända talespersoner och andra från aktuella organisationer som förekommit i historiska nyheter. Wikipedia, andra register m.m. vi har aggregerat med förstådda roller och relationer till den geopolitiska organisationen.


  • Vi kan söka prospekterande efter kanaler vid sidan om bevaka kända kanaler. Ex. kan vi söka finna indexerat material vi ej enkelt direkt får som relaterat men som kan visa sig vara det efter djupare analys. Ett enkelt exempel är att söka efter "Jack London" + "FBI" + Anchorage visande vid träff potentiellt en kanal som etablerat kontakt tidigare än övrigt till polisorganisationen.

Vad är särskilt för geopolitiska organisationer?

Egentligen ingenting. De är endast aktörer med en förstådd funktion associerad till ett geografiskt område.

Antar vi att vi har en upparbetad kunskap om diverse grupper eller personer som brukar bränna författare i Alaska är det kunskap vi kan tillämpa likartat.

Förståelse av hur en entitet (här bl.a. FBI in Anchorage och Jack London) förhåller sig till ett geografiskt område / entitet (Alaska) gör att vi bättre kan förstå analys pågående om de dyker upp i nyheten, kan komplettera med mer information enklare, identiifiera nya kanaler resp. prioritera dem mellan varandra (därför vi kan se vilka som har ny information indikerad vi vet potentiellt / troligt är intressant som ex. en tidning publicerande nyhet med FBI Anchorage i titel förutom Jack London medan ännu få hunnit med det).

Principiell skillnad mellan person och organisation finns egentligen inte. Organisationer är oftare relevanta. Men person med deras domäner oavsett om geografiska eller ett kunskapsområde (ex. domän kryptografi för Bruce Schneier eller att referenser runt Alaska och Jack London med The Call of the Wild troligt berör hans litterära gärning snarare än / eller nödvändigtvis något pågående just nu).

I hur jag väljer att sortera AG-typer i större grupper särskiljer jag några typer (som mer exakta uttryck för går att få) hörande till en "org-typ" inkl. geopolitiska organisationer. Personer, djur, sensorer, vapen, fordon m.m. sorterar ej här. Hit hör företag, organisationer, polisorganisationer, militära organisationer, entiteter i inom medicin, nöje, forskning m.m. Entiteter bestående av flera personer i ett samarbete mer varaktigt existerande vi som den större mängden människor i resp. område, land eller värld tenderar att se behov av eller naturligt att ställa till ansvar oavsett om "moraliskt" i nyheter eller i våra juridiska system. Det är också entiteter vi ger varaktiga namn på och som naturligt tar roll av agent vars beslutande människor vi gärna utan att tänka på det "gömmer" uttryckande det som att organisationen är den som tänker.

Samtliga org-typ såväl som personer får man en tror jag för de flesta förvånande bra utgångspunkt i antal inkluderade, bredd och djup rörande förståelse genom att ta första steget till etablering av vetskap om entiteter i världen från Wikipedia. Extraherar man djupt blir antalet rent av "gigantiskt" (djupt i mening av nyheter i kända tidningar eller referenser till journaler publicerade forskning - och tar upp personer också där rörande sådant som skribent tidning, insändarskribent engagerad i NN, eller bredare än så citerade talespersoner i nyheterna. Wikipedia är världen approximerad och approximationen blir mer exakt och inkluderande dag från dag utan att kostnaden extraktion av världens vetskap blir dyrare märkbart därifrån (medan världen växer snabbare i kanaler om man ska hämta ut samma approximation därifrån: Ett dataformat i Wikipedia och om än onödigt okynnes komplext så blir det sakta enklare och bättre, en kanal hämta data inkl. komprimerade filer).

Wikipedia har rent av sådant långsiktigt värde att man kan göra sig besvär att gå över deras kulturbärare manuellt av och till när man har tid genom åren och etablera vetskap om vem som egentligen är vem och var de hör till utanför Wikipedia (var de arbetar ex. inte ointressant SEO, PR o.s.v.) vilket aldrig blivit av för mig för något Wikipedia språk utanför svenskan (där jag dock tror jag har en försvarlig andel - åtminstone så sent som för fyra år sedan hade jag nästan alla inom ett antal stora ämnesområden som intresserade mig).

Argumenterat är behovet av sådan kontextuell information personer ej nödvändigt p.s.s. för engelskan som för det mindre språkområdet Sverige (detta kan vara förändrat: jag har ej följt upp svenska Wikipedia i storlek, antal aktiva personer m.m. på många år nu) när vi analyserar engelska Wikipedia. Andelen positivt verkande är ju givet värdet uppenbart etablerat större totalt medan fler allmänt engagerande kan tänkas göra upptäckt av kvalitets-divergenser från större värde per text-enhet till sämre detekterat för allt fler ämnesområden (Wikipedia gör ju en samma kvalitetsprojekt och fler personer med fler kompetenser möjliggör mer här). Att antalet läsare är potentiellt mycket stort beroende av artikel och publikationen ej är "fryst" till nästa upplaga löser säkert en hel del problem också (också om jag tror att format och nivå av information relaterat funktion och titlar för personer relaterade vad man skrivit om kanske i faktiskt antal bättre fångas av Wikipedia själva körande ungefär samma programvara och sedan sätta något i artikeln automatiskt när information saknas).

Jämför minskat behov av att förstå kontextuella kopplingar Wikipedia-folk utåt med i ett välfungerande land mindre behov av att bibehålla data över enskilda poliser klarar av sitt utredningsarbete eller vilka de känner. Andra kan ha detta behov (sökande korruption eller beslutande om befordring). Men analyserande nyheter räcker det att se dem som utredande polis i rätt organisation där kvalitetsproblem i sig kan antas propageras till och hanteras av övergripande ansvarig när behov uppstår (ex. kommun, department m.m.) och i det blivande sin egen nyhetshändelse. Söker vi prospekterande djupare just en särskild nyhet eller brott kanske kontextuellt djup är intressant (säg att vi är en tidning sökande korruption) men ju mer riktat djup analysen är desto mer data hanterat i andra områden kan exkluderas görande hantering av mer data och / eller CPU-tid (här mer det senare) görligt.

Vi ska vara på det klara med att vi får expoentiell tillväxt att totala mängden entiteter om vi ej sätter begränsning någonstans. Personer har så många relationer som i någon del av deras liv motsvarande ett område som generaliserar över människor åtminstone där är relevanta. En lagom nivå för den som ej extraherat djupt från Wikipedia förr troligen underskattande antalet personer är tror jag att ta motsvarande spokes person m.fl. roller för personer och var de hittades och vänta med dessa personers relationer till ämnen, händelser, andra entiteter o.s.v.

Dump med semantiska roller satta för test-meningen

En bit av dumpen från "arbetsminnet" där allt under all parsning lagras nedan (mängder av det borttaget) följer. Nummer längst vänster för resp. del motsvarar ungefär ordningen på resp. som ges roll (motsvarar frasens id-nummer) när PH är satt oavsett var pekar det också på PH-fras (den avsedd). Nummer på fält kan också vara ett, två eller något annat utan att värdet har mening annat än för att skapa datafältet (detta gäller ex. "label" där det är att label existerar som representerar analysresultat och ej om label är 1 eller 2).

Roller i typ-gruppen actor roles är de i huvudsak diskuterade. Thematic role sla ej ses som en satt semantisk eller tematisk roll utan är den första rollen som en initial "grov-hypotes" analysen satte medan ev. semantiska roller slutgiltigt om trovärdiga eller önskade dyker upp i Semantic roles där vissa ej behöver vara unika och alla kan vara ej unika om systemet ej klarar att avgöra vilken det är (minns jag rätt raderade jag bort semantic roles för alla därför de var fyllda med debug data samt att någon funktion skapade upp dessa på fel plats via define-kontroll: utvecklingssystemet dumpen kommer från). Vanligen är dock thematic role den semantisk roll man efter bra mycket mer kod får långt senare (men ej trovärdig på samma nivå: utnyttjar endast common sense rörande semantiska roller kombinerat en två-dimensionell roll prioritet för proto-agent och proto-patient grammatisk roll - ex. passiv + subjekt - resp. grammatisk relation framåt och nedåt - ex. varande en NP-fras i en PP-fras - och resp. dimension två prioritet via regler som om entiteten tycks kunna indikera både ett datasystem kallat Bill Xxxx samt en person med samma namn funktionellt som verktyg för att lösa ett problem och positionen i meningen ej sällan är aktuell både för agent och instrument ger vi den rollen agent oavsett om Bill Xxxx som verktyg kan antas eller är känt är enormt oftare refererad ty min princip är att vi hellre tappar lite vetskap etablerad än att vi etablerad vetskap defekt: Instrument är ett constraint görande narrow på världsbilden medan endast proto-agent egentligen ej skiljer mellan instrument och människa därför att oavsett vilket kan vi ej anta att en människa bakom verktyg resp. människa direkt indikerad finns styrande och beslutande och med mindre än om entiteten kan vara en automat, väderfenomi m.m. för vilket djupare analys kan vara värt att göra när det känns viktigt - så finns likväl i discourse om än inte alltid just för vad en enskild mening diskuterad en människa någonstans: Constraint vad någon kan göra och är är begränsning av vad som är rimligt att anta om världen bakåt och framåt d.v.s. sparande tid men om defekta gör att vi missar saker - desto mer någon kan göra eller indikerar ju säkrare antagande om man är osäker - även om jag i allmänt ser till att kod sätter resp. varande normalt där ekvivalent med resonemanget här).


'SITUATION_TYPE' => {
[Red. Accomplishment här därför bounded temporal
passed. Och Bounded -> mannerative är endast verb 
utan tolkning grammatik o.s.v. Givetvis inser jag
nu efter QA är avslutat att det kan kännas fel 
att kalla händelsen för en accomplishment. /HH]

  'ACT' => 1,
  'ACCOMPLISHMENT' => 1
  },

  'DEP_B' => {
   'SPATIAL_IMPLICIT_NON_MOVEMENT' => 1
   },

  'BOUNDEDNESS' => {
     'BOUNDED' => {
         'TIME' => {
            'START' => {
            'PH' => '6'
          },

          'TIME_PERIOD' => {
             'START_END' => 1
           },

          'END' => {
             'PH' => '8'
          }
      },
      
      'SPATIAL' => {
         'SPATIAL_AREA' => {
            'PH' => '4'
          }
       }
   },

   'UNBOUNDED' => { 'MANNERATIVE' => 1 }
   }
  },

 'AGENTATIVE' => {
  'ARG' => {
  
  '8' => {
     'ACTOR_ROLES' => {
         'PP_OPERATION' => {
             'DIRECTION' => 1
          },
          'BOUNDARY' => {
          'END' => 1
          },
          'NATURE_OF_SURFACE' => {
          'TIME' => 1
          }
      },

     'LABEL' => {
        'TIME PERIOD' => 1,
         'DAY' => 1
      },

      'SEM_TYPE' => 'PP',

       'AG' => {
          'AG__TIME' => 2
        },

       'TYPE' => 'PP__NP',
       'PREP' => 'TO',
       'head_np' => 'friday',
   },

  '6' => {
      'ACTOR_ROLES' => {
         'PP_OPERATION' => {
          'DIRECTION' => 1
          },
          'BOUNDARY' => {
          'START' => 1
          },
          'NATURE_OF_SURFACE' => {
          'TIME' => 1
          }
       },

      'LABEL' => {
         'TIME PERIOD' => 1,
         'DAY' => 1
      },

      'SEM_TYPE' => 'PP',

      'AG' => {
         'AG__TIME' => 2
       },

       'TYPE' => 'PP__NP',
       'PREP' => 'FROM',
       'head_np' => 'monday',
   },

  '4' => {
     'ACTOR_ROLES' => {
         'PP_OPERATION' => {
             'TOPOLOGICAL' => 1
          },
          'BOUNDARY' => {
             'INSIDE' => 1
           },
           'NATURE_OF_SURFACE' => {
              'SPACE' => 1,
           }
       },

       'SEM_TYPE' => 'PP',
          
       'AG' => {
          'AG__GOVERNMENT_ORG' => 2,
          'AG__LOCATION' => 2,
        },

        'TYPE' => 'PP__NP',
        'PREP' => 'IN',

        'CONCEPT_LABEL' => {
           'GEO ARENA' => {
              'ADMINISTRATIVE REGION' => 1,
              'INHABITED PLACE' => 1
            },
           
            'GEO POLITICAL ORG' => {
               'COUNTRY' => 1,
               'US STATE' => 1,
               'ADMINISTRATIVE DISTRICT' => 1,
               'STATE' => 1,
               'DISTRICT' => 1
            },
         },

         'head_np' => 'Alaska',
   },
 
 '0' => {
    'ACTOR_ROLES' => {
       'STIMULUS' => 1,
       'BURNER' => 1,
       'DESTROYER' => 1,
       'ENEMY' => 1,
       'CRIMINAL' => 1,
       'KILLER' => 1
    },

   'AG' => {
      'AG__HUMAN_FEMALE' => 1,
      'AG__HUMAN_AGENT' => 1,
      'AG__PERSON' => 1
    },

   'EMO_ROLES' => {
 '     NEGATIVE_ROLE' => 1,
       'UP_ROLE' => 1
    },

   'SEM_TYPE' => 'PROTO_AGENT',
   'THEMATIC_ROLE' => 'AGENT',
   'head_np' => 'Marie',
   },

  '2' => {
   
     'ACTOR_ROLES' => {
        'VICTIM' => 1,
         'BURN VICTIM' => 1,
      },

     'AG' => {
        'AG__HUMAN_MALE' => 2,
        'AG__HUMAN_AGENT' => 2,
        'AG__NOT_SHORT_NAME' => 2,
        'AG__PERSON' => 2
     },

   'LABEL' => {
      'PERSON' => 1,
      'SOCIALIST' => 1,
      'WAR CORRESPONDENT' => 1,
      'SURVIVOR' => 1,
      'WRITER' => 1,
      'NOVELIST' => 1
    },

   'SEM_TYPE' => 'PROTO_PATIENT',
   'CONCEPT_LABEL' => {
       'ARENA' => {
          'WAR CORRESPONDENT' => 1,
          'MILITARY' => 1
       }
    },

   'THEMATIC_ROLE' => 'PATIENT',
   'head_np' => 'Jack London',
   }
  }
 }
 },

Chunk parser: Fras-relationer för grammatisk- och semantisk information

2013-03-11

Speech and Language Processing är en excellent referens till mer än relaterat tolka tal, och har praktiskt i området statistical language processing oftare varit till nytta än Foundations of Statistical Natural Language Processing (ändå vad jag använder oftare än mycket annat och ett komplement kring en del) skriven av Dan Jurafsky's kollega Mannings. Den första ger en seriös och användbar introduktion till chunking medan det kanske är lite förvånande att den senare föga berör det och kanske lite negativt givet dess större användningsområden kring mycket relaterat praktisk problemlösning kring så mycket (regelbundet återkommande område man kanske glömmer är portning av data eller gamla register där meta-information saknas men också data mining.


Eftersom jag är svensk född i kyla och överlevande snö är balans viktigt. Berömmer man en entitet för mycket kan de bli upphetsade och springa i dörrar och släppa ut värmen eller överäta av förråden. Jag införde därför lite "träd-rekursion" i min semantiska chunk-parser där ju:


"The primary limitation placed on these chunk rules [Egentligen refererar han till en särskild sorts chunkers men det struntar vi i.] is that they cannot contain any recursion; the right-hand side of the rule cannot reference directly or indirectly the category that the rule is designed to capture."

Vi fortsätter nu Chunk parsers presterar på nivå med människa för meningar utvalda för att vara väldigt svåra för dem och tittar hur vi tar ut argument 1 till resp. verb i exempel meningen från hennes artikel som analyserade chunkers.


För ett parse-träd när vi ska tolka det för att ta ut en given sorts information existerar en korrekt väg givet trädet och givet när så är viktigt ev. statistiskt-modell för att välja nära flera val finns. Givet det går det naturligtvis utmärkt att representera platt tillsammans med programmatiskt logik. Jämfört med min representation av människans kunskaps-koncept (Blue light) al'a som mest slösaktigt uppställd 1 000 000 koncept och tiotals miljoner numera relationer är det i mycket mindre utsträckning möjligt. Man vinner på att extrahera och representera information på sådant sätt att vetskap bevaras i strukturen på ett sätt lättare att nå. När vi hanterar enskilda meningar, stycken o.s.v. skadar inte lite logik i programmen särskilt som de tenderar att bli snabbare av mindre rekursion, tillståndstabeller m.m.


För situationen att ett verb på en mer undanskuffad plats i vårt "parse-träd" inte har direkt möjligt att begripa vilket dess subjekt är behöver det ju hämta fram den verb-fras (resp. en del annat möjligt) som uttrycker dess relation till det. Det var vad Martha såg som det viktigaste värdet med vanliga parsers (vilket givetvis stämmer för flexibilitet om och när man kan eller vill betala med prestandan relativt mängden kod). Just för att lösa problematiken i ex. meningen är det dock egentligen inte särskilt mycket givet att man kan relatera chunks (och som här eg. inte explicit som named relations vilket ju heller inte är default för Blue light heller). Nedan är hela koden för det undantaget en rad med "return -1":


Klicka på bilderna för att se bättre

Hittas "ovanför" i kodlogiken inte ett subjekt som stämmer med S-id-numret anropas denna och om något kommer tillbaka större än -1 undersöks det. Och något kommer ut. Nedan första argumenten till verben i tidigare refererad ex. mening ("Big investment banks refused to step up to the plate to support the beleaguered floor traders by buying big blocks of stock, traders say."):



Övriga argument (och argument i ungefär samma mening som i Marthas excellenta SemLink vars nytta blev enkelt verklig mer än Verbnet när jag upptäckte att Verbnet som sparar ned tid att få samman dem finns.) är avstängda eftersom jag testade den nya och mycket snabbare kod-versionen för att hämta just verb-relationer till verb på subjekt.


Utan denna eller en liknande kontroll (den jag använde innan långsammare med också funktionell utan "1-dimensionella parsnings-träd" kanske vi ex. får problem med the plate. Är det ev. subjekt till VB direkt efter (nummer 6 i bilderna):



Ett alternativt sätt men med fler loopar och kontroller - och långsammare - är att promenera bakåt från verbet och titta vad som relaterar till det innan, och skapa en kedja tills vi når vad vi är säker på är översta verbfrasen. Inte mer komplicerad logik än chunkers, och kanske rent av enklare eftersom det bara är fraser. Vanligen är det tror jag ofta precis som i ex. meningen diverse PP-operatorer efter varandra och före och efter aktuellt verb som ställer till det men dom är ju bland det enklare att vandra över utan särskilt mycket logik och där mer logik krävs kan ju den mer ambitiösa använda logik representerad i kunskap i form av datastrukturer människan självorganiserat åt oss att skörda (ex. Verbnet m.m.) eller tror jag oftare för just sådant här egentligen mindre omtalade men nog så stora The Specialist Lexicon (U.S. National Library of Medicine, National Institutes of Health) där vi hittar en hel del "avslutande" om verb (och verb:et innan avslutar ju med vad vi har mellan det och verb:et efter.


Nedan ex. på verb complement från The Specialist. Till höger syns en bit av katalogen där det datat är strukturerat jag lät vara kvar med diverse andra verb-datakällor markerade med pilar (och kataloger med data möjligen - högst osäkert eg. - nedsparat samtidigt med en liten bugg i min spindels tolkning av webbplats-direktiv kring sådant om nu det alls var något aktuellt den tiden i ett av fallen och där ett större "bibliotek" / "institution" från europeiska kontinenten resp. ett antal parsers och liknande jag testade men inte tycker är något att rekommendera vara slöare ungefär mycket annat som ger mer information eller hade andra problem).


Skapad med Gimp och Google Docs i konstnärlig händelse och skapelse för att mer än illustrera verb dokumentera åren bakåt och säkert fortsatt länge där diverse arbetsmoment sker med applikationer på webben enklare på vissa sätt och med vanliga applikationer därför att vissa moment tycks de första aldrig få till ex. relevant här skärmdump som auto-sparas i min hemkatalog med min Linux-fix för funktionen.

Slutligen var det rekursionen - och för korrekthet rekursion i skriven pre-kompilator-mening mer än abstrakt koncept - har vi det nedan (första halvan av koden hade vi egentligen kunnat skriva på tre rader men den ska tas över mer eller mindre exakt till annat och har värde så här ett tag för att se om den har sönder saker märkbart istället för att kanske missas onödigt länge med underliga problem svårare att hitta ovanför). Rekursionen är att vi anropar samma funktion med det nya verbet vi fick från koden i en av de första bilderna.



Det tycks mycket troligt att jag plockar bort rekursionen. Jag är en starkt troende på att rekursion, grafer (snarare än ex. de säkrare hashtabellerna) särskilt skapat flexibelt med pekare (instabilt och farligt) eller ännu värre enkelt (blir stort och slött utan att det märks) är som koncept på universiteten (jag var som ung och mindre skadad av verkligheten involverad i labbarna runt Algoritmer och Datastrukturer, Uppsala Universitet kanske 1998 tror jag medan jag var student på Teknisk fysik för att vara studenterna på kursen behjälplig m.m. och rätta dem senare men visste inte bättre) ett exempel på dispergens mellan de datormiljöer, utmaningar och intellektuella resurser typiska för arbetslivet. Elegansen är ju ett värde i sig som bedöms gällan algoritmer medan stabiliteten i den faktiska implementationen några mätningar görs från betyder föga. Hade prioritet istället lagts på stabilitet och kvalitet tycks inte otroligt att både en försvarlig-andel av säkerhetsproblemen liksom de ofattbart dåligt optimerade program som år efter år suger upp all extra prestanda man får med ny dator (ex. Windows XP jag nyligen kom på att sortera en tabell så att det gjords faktiskt visuellt: nästan så snabbt att man inte märkte det ens under last men likväl systematiskt vad som kostar och för åtta år sedan hade datorn jag hade för nöjes-surfande inte orkat det utan att det direkt stört: helt otroligt. Inte självklart att problemet just har med XP att göra. Det mesta man installerat och avinstallerat tycks ju ha dll eller vad det numera kallas kvar registrerade såväl som oregistrerade).

Chunk parsers presterar på nivå med människa för meningar utvalda för att vara väldigt svåra för dem

Martha Palmer Verbnet och Probank hör till de mest användbara datastrukturerna för semantisk-tolkning av text närmare mer praktiska tillämpningar där prestanda är vad som ger möjlighet att göra fler och djupare kontroller på mer data genom att spara tid på mindre mer kompakta statistiska-motorer och ännu den tid man ev. annars själv hade lagt på det. Artiklar publicerade länkade från Martha Palmer (uppdaterad fram till 2011) tenderar också oftare än kanske vanligare ligga närmare praktiska tillämpningar (kanske något finansierat samarbete som inspirerat) och därför värt att titta till ibland.


Chunk parsers är praktiska verktyg och det var därför med visst glatt intresse jag prövade meningen hon gav som exempel i en sammantaget ganska negativ tolkning av chunk parsers:


"[...] it would be difficult to imagine identifying it without building a complete syntactic parse of the sentence. [...]
The prepositional phrase expressing the Manner relation, however, is not identified by the chunk-based system. The tree-based system's path features for this constituent is VB ARROW_UP VP ARROW_DOWN PP, which identifies the prepositional phrase as attaching to the verb, and increases its probability of being assigned an argument label."

Från: The Necessity of Parsing for Predicate Argument Recognition,
Daniel Gildea och Martha Palmer,
University of Pennsylvania,
Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics (ACL), Philadelphia, July 2002, pp. 239-246.

Och allmänt har visst Martha Palmer rätt även om nu informationsextraktion och annan praktisk användning ofta ger andra konkreta värden. Snabba och ofta tillräckligt stabila allmänt, och viktigare för riktad informationsextraktion presterar de bättre än generaliserad parser utan annan anpassning. Men man ska inte underskatta deras värde annars eller. Betänker vi ex. ett träd är det en komplexitet vi t.ex. också kan uttrycka med den typ av implicita flödesrelationer i grafer jag tog som exempel i Semantiska parsern nästan version 1.0.


"Konkret värde jag såg redan igår är att skillnad mellan när titel, abstrakt och varje stycke för sig körs in i Drifting thoughts på den snabbare utvecklingsdatorn jämfört med när titel och abstrakt körs in och därefter endast en approximation av vilken NP som är i fokus för allt vad jag vet kan vara oändlig. Bryt det längsta försöket att ta ut en referens representation av hjärnan maximalt nitiskt associerade och tolkande efter cirka 30 minuter. För nöje kan man ju ha en närmare mänsklig intelligens som ger lite idéer men för allt praktiskt behöver man man sin egen intelligens optimera prestanda-kostnaden sådant kommer med och att approximera löpande inspiration över artikel-body till fokus-objektet gör enorm skillnad genom att antalet nya udda koncept som behöver representeras upp med sina från 50 upp till ca tio tusentals relationer (och i Drifting thougts är det inte linjära samband utan rekursivt genom att aktivitet om än indirekt när de möts kan resultera i den nodens relationer realiseras upp med aktivitet o.s.v.) reduceras enormt. Jag såg inget uppenbart som missades genom det med mycket om infektioner, virus, cellbiologi, epidemier m.m topp fem hundra på aktiverade delar av hjärnan från en artikel från tror jag ploscompbiol.org eller ev. plosone.org."

Jag såg i exemplet nedan för den semantiska parser som utvecklas för att filtrera artiklar, nyheter m.m. Drifting thoughts inte något av de problem Martha upplevde med sin chunk-parser.


Notera först den första siffran till vänster vilket approximerar motsvarande upp och ned - vad jag gjorde för att approximera kognitiv-komplexitet (som diskuterat i Neurolinguistics bl.a. kring Gibbs-parser) samtidigt som jag försökte göra just upp-och-ner i en annan funktion som aldrig bra bra. Det gäller för S-fraserna. Denna uttrycker det dock så perfekt man kan komma med utan problem en die för icke noll per mening.


För by (vad jag kallar en PP-transformator) att verben vi binder till ganska typiskt upplever jag för den typen av verb-argument ger oss en bra indikationen om den generaliserade förenklade meningen möjlig att fånga i de kanske teoretiskt mindre uppmärksammade men praktiskt bland de viktigaste arbetena inom praktisk lingvistik Verbnet, Framenet, Propbank m.fl. liknande lösningar representerar. Verb-relationerna till by: 6 VP to support VP/S och 9 VP buying VP/S (siffran till vänster där är frasens id-nummer och den som står direkt till höger om "upp-ner-räknaren").


"Manner-argumentet" man ser det i artikeln är "by buying big blocks of stock" där vi ju lokalt i den har en PP. I citatet från min semantiska parser ovanpå chunking agerar by m.m. som operatorer och den uttrycker relationer direkt enligt tidigare där ju redan där ges i alla fall en antydan om "manner": köpa aktier för att stödja något (stödköpa kanske?). Relationerna till buying (egentligen inte argument utan relationer som ej går till vad vi kan tolka som VP/S, SBAR o.s.v.)


.............................................................
S VP/S 4 9 VP buying 

STRUCTURE RELATIONS

ARUGMENTS
 10 NP big blocks NP
 8 PP by PP
.............................................................


Det samma för big blocks där vi också märker av debug-testningen av PP-completement avsedd för situationer där vi har längre kedjor som gemensamt konvergerar till mening och tolkning ex. att ett argument begränsar dimensionsrymden det andra uttrycker. Ex. in the middle of the forest (inte bara obestämt eller hela skogen utan i mitten av skogen: praktiskt för de flesta av oss ännu mer unknown). Siffran är frasens interna id-nummber NP anger bara fras-typen och ex. big blocks är chunk-frasen.


NP 0 4 10 NP big blocks


STRUCTURE RELATIONS
 9 VP buying VP/S

ARUGMENTS
 11 PP of PP
PP-COMPLETEMENT ( 10 NP big blocks ) ( 11 PP of ) ( 12 NP stock )


Och hela utskriften av körningen av exemplet från Marthas artikel. Den är som sådan anpassad för vad jag utvecklar i den (strukturerar och sorterar diverse kod medan jag sätter högnivå-primitiver men just för att illustrera detta passar den perfekt).


Notera när vi tittar före och efter by för den lilla upp-ner-räknaren. Den ligger balanserat på fyra genom hela det "human annotations" beskrivit som Manner i Marthas exempel mening jag fick för mig att jag skulle provköra innan jag tänkte försöka somna. En avvikelse från perfekt manner är för traders say vilket med upp-och-ner räknaren ligger på samma då jag just nu har comma m.m. som inte hanteras i trädet borttaget men följer man relationerna får man rätt fras manner ändå. Say är ju en gammal vän här.


Det egentligen mer intressanta för mig runt motsvarande manner är mindre dom markeringarna oavsett hur användbara de är i kontext av entiteter och vad dom gör utan mer av vad som uttrycks avseende aktuella dimensioner och hur dom begränsas via constraints - kanske vad vi kan kalla proto-whole och proto-part p.s.s. sätt som proto-agent och proto-patient. Var vi är på kartan och vad för sorts karta är det? Är kartan ett antal verktyg (t.ex. gas chromatography, t-test, litterature search m.m.) aktualiserade i texten som förklarar hur vi kan avgränsa vad vi kan förstå om vad entiteterna gjort var någonstans och med vilken säkerhet?


.............................................................

##################################################################
PHRASE STRUCTURE MAP:body_last 0
 NP 0 0 0 NP Big investment banks


STRUCTURE RELATIONS
 1 VP refused VP/S

ARUGMENTS
.............................................................
S VP/S 1 1 VP refused BOSS 

STRUCTURE RELATIONS
 2 VP to step VP/S

ARUGMENTS
 0 NP Big investment banks NP
 13 O COMMA NOFUNC
 14 NP traders NP
 15 VP say VP
 16 O . NOFUNC
.............................................................
S VP/S 2 2 VP to step 

STRUCTURE RELATIONS
 1 VP refused VP/S

ARUGMENTS
 3 PRT up PRT
 4 PP to PP
.............................................................
 PRT 0 2 3 PRT up


STRUCTURE RELATIONS
 2 VP to step VP/S

ARUGMENTS
.............................................................
 PP 0 2 4 PP to


STRUCTURE RELATIONS
 2 VP to step VP/S

ARUGMENTS
 5 NP the plate NP
.............................................................
 NP 0 2 5 NP the plate


STRUCTURE RELATIONS
 6 VP to support VP/S

ARUGMENTS
 4 PP to PP
.............................................................
S VP/S 3 6 VP to support 

STRUCTURE RELATIONS

ARUGMENTS
 5 NP the plate NP
 7 NP the beleaguered floor traders NP
 8 PP by PP
.............................................................
 NP 0 3 7 NP the beleaguered floor traders


STRUCTURE RELATIONS
 6 VP to support VP/S

ARUGMENTS
.............................................................
 PP 0 3 8 PP by


STRUCTURE RELATIONS
 6 VP to support VP/S
 9 VP buying VP/S

ARUGMENTS
.............................................................
S VP/S 4 9 VP buying 

STRUCTURE RELATIONS

ARUGMENTS
 10 NP big blocks NP
 8 PP by PP
.............................................................
 NP 0 4 10 NP big blocks


STRUCTURE RELATIONS
 9 VP buying VP/S

ARUGMENTS
 11 PP of PP
PP-COMPLETEMENT ( 10 NP big blocks ) ( 11 PP of ) ( 12 NP stock )

.............................................................
 PP 0 4 11 PP of


STRUCTURE RELATIONS

ARUGMENTS
 10 NP big blocks NP
 12 NP stock NP
.............................................................
 NP 0 4 12 NP stock


STRUCTURE RELATIONS

ARUGMENTS
 11 PP of PP
.............................................................
 NOFUNC 0 4 13 O COMMA


STRUCTURE RELATIONS
 1 VP refused VP/S

ARUGMENTS
.............................................................
 NP 0 4 14 NP traders


STRUCTURE RELATIONS
 1 VP refused VP/S

ARUGMENTS
.............................................................
 VP 0 4 15 VP say


STRUCTURE RELATIONS
 1 VP refused VP/S

ARUGMENTS
.............................................................
 NOFUNC 0 4 16 O .


STRUCTURE RELATIONS
 1 VP refused VP/S

Och dom tematiska rollerna ger oss 0.92

2013-03-06

I fortsättning på Semantisk parser 0.90: Citing och Says och Semantiska parsern nästan version 1.0:



Och jag kan inte annat än att känna viss förundran inför alla som finner det naturligt när det praktiskt har relevant betydelse att införa mycket eleganta standardiserade lösningar för debug-utskrifter. Jag tror jag har tre små-system jag aldrig använder.

Eye in the Sky över stormande hav går från få till många

2013-03-05

Eye in the Sky är namnet på en av vad vi kan kalla koncept-grupp eller övertydlig beskrivning av tolkning vi kan göra av vad koncept det kan ha i större eller mindre utsträckning. Det skiljer sig tydligt från övriga jag tittade närmare på tidigt jämfört genom att det bättre klarade att fånga den paranoida-upplevelse-dimensionen koncept kan ha men sällan är enkelt att relatera till därför att det ofta är tämligen diskret.


En enkel och viktig men ofullständig förklaring ligger i unknown där vi ju väldigt uppenbart övertolkar potential, fara m.m. i vad som är dolt långt ifrån natten med dess gömda rovdjur. Ett fint exempel är de brutala övertolkningar av prestationsförmåga relativt övriga världen resp. övriga myndighetsfunktioner i eller utanför försvar många gör av NSA. Nyligen noterade jag ex. att det lätt blir så default styrande att också en kompetent person när information görs tillgänglig övertolkar utan antar jag sett över hela området som nedan med Bruce Schneier om semantic forests:


"It's pretty clear to me that this technology can be used to support an ECHELON-like system. I'm surprised the NSA hasn't classified this work."

Crypto-Gram Newsletter (December 15, 1999)

Det är en intressant algoritm som säkert kan vara användbar liksom många andra som jag tycker är intressant genom att den delvis har en del likheter med min Drifting thoughts genom att den friare associerar koncept samtidigt som den delar stor tradition med det mer traditionella ex. Wordnet (jr användningen av smalare mer strikta idéer om definitioner) är exempel på vilket minst sagt skiljer sig koncepten i Drifting thoughts. Men algoritmen är ett exempel på många som ligger på ungefär samma kompetensnivå och prestationsförmåga, och just för big-data situationen Schneir såg värde i är den kanske heller inte den bästa genom att graferna kan bli ganska tunga (men det finns också en del optimeringsmetoder runt det jag aldrig tittat på och heller inte tills nligen var medveten om fanns och det det är lätt att bedöma graf-optimering fel jfr ex. i Semantisk parser 0.90: Citing och Says på skillnaden när jag adderade min semantiska parser för att filtrera indata till Drifting thoughts.


Att unknown räcker för Eye in the sky var och är min tolkning att det inte gör. Dels tror jag att det också är just vad som bär mer av vad som när mätbart ligger längre ifrån normal unknown-övertolkning. Långt senare än när jag tittade på konceptet definierade jag ytterligare en dimension relaterade domän något verkar i (något relaterat PP-fraserna och den semantiska parsern). Luften är inte vår normala dimension och vi filtrerar därför vanligen bort den med undantag för processer som ligger verkande utan att vi normalt kan styra över dem (och i situationer där vi kan uppleva oss ha den möjligheten ex vissa grupper av dataspel eller raket / missil / nyårs-raket avfyrande sker det antingen via en sekundär representation på skärm eller linande eller vad vi först gör på market och sedan står och tittar på).


Paranoid och psykos bredare som jag tidigare diskuterade är vad alla versioner (också innan beteckningen) Drifting thoughts kan argumenteras ha för värde eller som problematik. Det är association till kraftfullare näraliggande koncept (och om inte fullt så förenklat vad jag tolkar vad mänsklig-psykos med det tämligen osäkra argumentet att integrationen mot Drifting thoughts praktiskt relaterat detta som jag nyligen upptäckte givit mig förmåga att läsa text insamlat från psykotiska personers tal där jag utan problem från alla timmar med Drifting thoughts kan känna igen de olika korrupta associationerna som görs vilket övertygade mig väldigt konkret omedelbart) från ett som dock avviker från aktuellt kontext d.v.s. irrelevant just nu. I allt omedelbart vi kan påverka är just domänen luften på Eye in the sky upp-nivå just irrelevant.


Just när vi applicerar konceptet på satelliter, flygplan m.m. snarare än gudar, gudinnor, totem-djur o.s.v. mer populärt lite bakåt i historien adderas något konkret. Och just för det konkreta verkar unknown. Och jag tror för den paranoida dimension konceptet söker ge ett övertydligt typ-exempel på är denna unknown mer styrande än för själva domänen. P.s.s. som det är enkelt att övertolka NSA:s 24-7 tactical combat power i textanalys när man inte har en översikt bild med lite djup på teknikområdet är det lätt att göra till default-förklaring eller argument för onormalt fri association ut i kontextuellt ej aktuella domäner.


Nu är frågan om DARPA från ett militärt perspektiv (allt militärt är jag något av en expert på i den taktiska domänen då jag som yngre vuxen spelade Red Alert mycket intensivt vilket som jag förstått det ger den militära befärsstruktur i teknik man försöker realisera rent allmänt) gör rätt i att beteckna sitt nya projekt Eyes in the sky (många små ögon):



Det finns en stor situations-grupp utanför det mer psykotiska resp. fiktiva-scenarier i film där Eye in the sky tenderar att bli verklig och det är under hög långvarig stress med en konkretiserad fiende du vet är verklig men som är i unknown. Ett exempel jag brukar använda (bland hur många man vill hitta därför det är ett normalt tillstånd i alla sådana situationer som helt inte kan undvikas och allt kommer märkas mer när själva typ-situationen är ny) är CIA:s övertolkningar av tv-kanalen Al-Jazeera's sändningar:



I mening av ett potentiellt verktyg att skapa en från det egna perspektivet sund "brand-paketering" av den egna slagkraften är konceptet därför knappast till nackdel.


Nackdelen att väga det mot är att i den globala världen med World Wide Web (som vi kallade det förr när jag var ung) kan det också addera intensitet till det mer osunt paranoida utanför försvarsbranschen.


Ett till värde jag tror är möjligt men har svårare att referera då jag inte har och knappast kommer se över vad som är dokumenterat är relaterat egna soldater i fält. Det kan tänkas tillföra värde att de tillskriver egna entiteter i dessa domäner lite övernaturliga egenskaper. Det kanske ger viss trygghet.


Givet - för att knyta tillbaka till vårt första exempel - NSA:s befintliga robusta paranoid-stimulans-problem, och de två indikerade värdena av Eye in the sky: Varför patenterade och publicerade de? Tja en orsak är mycket tänkbart att man har faktiska systematiska utmaningar i ett långsiktigt perspektiv och det därför ligger ett värde att bibehålla närhet till omvärlden gärna i det mycket konkreta relaterat algortimer och teknik.


Därmed inte sagt att de gör de ofta eller vinner på det regelmässigt men vi kan just notera att det sker avgränsat närmare områden vi inser i det systematiska är viktigt för dom liksom andra grupper av entiteter (både relaterat möjligheter och risker):