Visar inlägg med etikett NIST. Visa alla inlägg
Visar inlägg med etikett NIST. Visa alla inlägg

Är Google's ontologi Freebase mer noggrant installerad och användning hos stora konkurrenten istället för dom själva? För att försöka begripa samband mellan sökord

2013-06-09

Ett tag lite bakåt upplevde jag att Google körde ganska hård markov-logik nära naturligt språk på sökfrågorna. Säkerhet med data från Google NGRAM tillsammans med deras besläktade projekt för att samla mer långsamt föränderlig språk-datastatistik kontrast ex. tydligare sök-koncept mer tidsberoende. Det kändes aldrig lyckat men är kanske en parameter som också reducerats. Att dra nytta av väldigt ämnes-relateade koncept som minskar ner rymden blev sämre fungerande.


Sedan har de ju sin medelstora ontologi Freebase i skapande koncept något lite speciell precis som alla de mer kända av de medelstora i överkanten i det segmentet. Cyc gör det med människor övertränade på ontologier, NELL med automatiskt inlärning i mjukvaande skattande vidare från vad den upplever sig veta, Yago har kört in Wikipedia kategorierna och balanserat det med skattade idéer om tänkbara word-net-sense id-nummer de kan tänkas motsvara i hur de i sin tur ska klassificeras.


De är alla när en självorganiserande faktor fins därför att de uttrycker saker en aning skillt. Värdet är mer långsiktigt där vi kan se att vi kan utnyttja NELL över längre tid för en effektiv källa man ej behöver addera egen energi för att ta ut kandidater på mer grundläggande samband väldigt nära frasers elationer uttryande delvis internt så att säga A of B och mellan dem ex. A gör B.


Men för krävande lösningar där ett mycket flexibelt behöv i större budget finns tror jag att man hamnr fel om man idag använder dem direkt styrande logik-beslut och id+er om världen märkbart utåt. Krävande lösningar skulle ex. kunna vara en sökmotor eller något NSA skapat. Bara värdet som ges av att med föga respekt för deras struktur-idéer föra samman dem snarare efter hur vi ser på deras datakälla och metoden där med viss riktning mot var vi ser att det kan leverera är stort.


När jag nyligen i förbigående nämde mitt eget robot-surfande för att föröska ta ut stora mängder hög-komplex statistik sökande möjligheter bredare i på korrekt ambitions nivå för en mjukvaruagent idag fält och liknande. Märkte jag en period när jag råkade hantera hmtandet lite mindre hänsynfullt i sleep m.m. viss detektion stängande ner hos några. Gemensamt för för två av dem medan den tredje helt säkert gjorde det auto-räknande anrop från IP-adress med egentligen väldigt hög tolerans (en av de större statligt finansierade aktörerna i världen relaterat hälsa).


De andra två detekterade trots att konfigurationen av trådarna låg fel tror jag 4 till 12 veckor utan någon hänsyn eller variation alls ingenting förrän de råkade ta upp en fil som låg tillsammans med whitening data och som sådan en aning större egen skapad från Framenet för att försöka ta ut väldigt smala funktioner av dem (typiskt skärande ex. allt mer än concept A relation B eller liknande. Där gick de båda direkt upp i detektion.


Jag tror de lite varstans sitter och intresserar sig för samband sökförfrågningar. Google ger ju alt. förslag där nu jag ännu utan undantag har att se värde ifrån. De är regelmässigt mer breda i vad som inkluderat och mindre exakta d.v.s. typiskt skärande ett ord. Också när ett tillstånds indikerande att går mot högre komplexitet. Gissningsvis i smala områden föga söka tror Google att man stavat fel eller inte riktigt förstår vad som är bra termer att söka på och tycker att man ska skära bort ett eller två sök-koncept.


Nu var det dock inte Google som var aktuell här utan en av deras i viss verksamhet vad som har en del likhet i tjänster och produkter. Tänkbart tittar de en hel del också på samband mellan sökords-koncept och tog och började med att dra in hela rFreebase.


Jag har oerhört baffled över det i veckor. Det är inte där en aktör med resurser förväntat ska vara. Jag använder dem sällan sälv annars så jag hade heller ingen aktuell utgångspunkt. Bredden i samband koncept för en världspubik ligger på nivåer där Freebase överhuvudtaget inte bör ses som i närheten av en mer dominerande del av dom stödsystem i mer etablerad inlärning man kan låta komplettera den ännu bredare statistiska analysen om relationer.


Detta är intressant som en allmän indikation ungefär var kompetens relativt stor hårdvara och big-data ligger inte allt för långt ifrån årets kompetens-uppmuntring från NIST just relaterad i en del om jag minns rätt samband mellan sökförfrågningar.


En brägnsning i tankesätt jag upplevt genomgående relaterat sökförfrgningar jag tror är verklig men heller inte ser som ddirekt prioriterat att verifiera för den källan är att man förutom som här med ofta något ganska avgränsat vid sidan om ex. en statistisk parser med en del mer regelstyrda koncept och så ett eller två datastrukturer i common sense representation (ex. är Freebase såväl som The Specialist ganska vanliga om än i lite olika användningar oc numera av och till också Yago). Men det är inte förståelse som är särskilt relaterade dynamiken i webbsökningar. Det handlar ju mycket mer om förändring i våra tillstånd sökande aktivt såväl som nyhetshändelser, vad vi gjort under dagen, väder och vind mer på nivå idag och några dagar bakåt såväl som vad som kommer hända om några dagar.


Common sense måste ju vra den enklare grunden man hellre tar från flera koncept reducerande exakthet för att hindra dem från att göra för stora antagden om vad saker betyder för att leverera det värde jag tror är viktigare från dem i sökförfrågningar: en föga föränderlig grund där vi kan ta den att kunna relatera annat till. Det kritiska är nog mindre ofta om om person A göra B med krppsdel D att vi begriper att D är instrument även om just det givetvis r trivialt nog utan större common sense.


Mer intressant är ju att relatera förfrågningarnas relationer utåt från vad faktiskt sökt mötande andra datakällor vi har om världen. därmed hindrar vi ju överträning jag föreställer mig är en stor risk därför att folk misstänker tror jag gärna söker lite på samma sätt även användande olika sökord också när världen just nu uttryckande händelser, koncept, kultur m.m. fasförskjutande aktuellt bort relativt hur intressant det upplevs vara.
Sökningar motiverade mot referensinformation mindre beroende är ju också en fråga man antagligen från sökmotorföretag bra klarar att separera ut. Där är j behovet av andra datakällor än sidorna och sökorden och ev. system för att vikta dem via länkar m.m. säkert ganska potent i sig.


Men också mer abstrakt är ju common sense såväl som Google's age ranking, uppslagsböcker m.m. just några av en mängd exempel på att det är områden vi utmärkt hanterar idag. Människans natur är nu sådan att när koncept blivit välrepeterade med i alla referensböcker och löser problem väldigt svåraa för några år sådan kommer man fortsätta att pröva dem i andra tillämpningar trots att det gång på gång år efter år inte just verkar skapa mer intresse hos dina konsumenter eller för den delen uttryckande något nyskapande.


Det är en begränsning jag tror vi alla lider av. Men jag tror också att begränsningen i stora organisationer hamnar lite mer märkbart kollektivt runt produkter och tjänster medan det för oss som individer oftare handlar om mer privata trivialiteter i vardagen. Visst att göra B kan vara mycket bättre men nu har jag gjort A i fem år så varför inte fortsätta så slipper jag pröva något nytt.


V kan avsluta med att fundera lite på om man egentligen någonsin korrekt ska konvergera fast som givet i representation ex. via id-nummer eller om det borde komma naturligt från den som söker information där dennes användning riktar in honom på vilket av ett antal näraliggande koncept utefteer åtminstone normalt några dimensioner (ibland kanske mer svåra att uttrycka runtmetaforer m.m. men oftare mer varianter av ett koncept ex. Sångerskan Madonna i hon gjorde som jag skulle uppleva som farligt omoralisk vulgär-kultur, varande vid samma år väldigt gammal, eller tyckande att der var hennes unga år, eller precis vad som helst för att ta några enkla exempel som ligger tror jag egentligen långt borta från dimensioner merkatuella här. De här uppenbara dimensionerna bör utmärkt tas via similarity och associationssamband direkt på sökord. Jag tror folk antagligen bra förstår att lägga tll ex. "avklädd" till Madonna om de vill läsa ett avslöjande reportage som borrar in på ennes dolda hemligheter.


Gårman den kreativa vägen får man sedan på vägen ta att man ibland får koncept-förslag som tveklöst predikterar ex. relaterad intensitets-förhöjning men där vi har svårt att riktigt se hur vi kan ta identifikationen som där uttryckt mer konstnärligt b bra automatiserat. För att återknyta till landslide (Nordkorea: Kärnvapen och Jordskred
2012-12-06)
nere i Nordkorea. Och kanske också mitt missnöje med hur samma undersystem klarade att skämta där två exempel jag vet att jag publicerat var Black in White (Drifting thoughts (kanske) skämtar snuskigt (kanske rasistiskt) om President Obama och Hillary Clinton) som svar på ett skämt relaterat händelsen att utrikesminister clinton slutade där jag ville ha ett kul samband indikerat mellan dem (den implicta sexuella dimensionen störde mig också eftersom det kan peka på att fler koncept dr kan behöva återföras fodrande ev. mer av annan filtrering mo vulgär-kultur, fiktion, spam m.m. förgiftande seriösare analys) och nyligen lite bättre Blodsocker i äppelmos också från Dreamer när jag ville a ett skämt som gav en lite obehaglig känsla runt Syrien.


Jag tror dock att de nya undersystem jag utvecklat ett tag kommer lösa en hel del rörande just tolkning t.ex. relaterat skämt, metaformer, liknelser m.m. Natural language understanding handlar ju potentiellt inte bara om att tolka indata - kanske inte ens viktigast över en längre tid - utan också om att ge systemet en väg att bra för oss enkelt begripligt förklara vad det menar utan att behöva lägga tid för att be om tolkningar från ex. några jämförbara koncept runt om eller be den borra från ett annat kunskaps- eller kultur-perspektiv.


Etttill skämt av Drifter och Dreamer jag hade glömt att jag hade publicerat: Outsider Art - Ridiculous: Bondkomik av Drifting thoughts.

Chunk parsers presterar på nivå med människa för meningar utvalda för att vara väldigt svåra för dem

2013-03-11

Martha Palmer Verbnet och Probank hör till de mest användbara datastrukturerna för semantisk-tolkning av text närmare mer praktiska tillämpningar där prestanda är vad som ger möjlighet att göra fler och djupare kontroller på mer data genom att spara tid på mindre mer kompakta statistiska-motorer och ännu den tid man ev. annars själv hade lagt på det. Artiklar publicerade länkade från Martha Palmer (uppdaterad fram till 2011) tenderar också oftare än kanske vanligare ligga närmare praktiska tillämpningar (kanske något finansierat samarbete som inspirerat) och därför värt att titta till ibland.


Chunk parsers är praktiska verktyg och det var därför med visst glatt intresse jag prövade meningen hon gav som exempel i en sammantaget ganska negativ tolkning av chunk parsers:


"[...] it would be difficult to imagine identifying it without building a complete syntactic parse of the sentence. [...]
The prepositional phrase expressing the Manner relation, however, is not identified by the chunk-based system. The tree-based system's path features for this constituent is VB ARROW_UP VP ARROW_DOWN PP, which identifies the prepositional phrase as attaching to the verb, and increases its probability of being assigned an argument label."

Från: The Necessity of Parsing for Predicate Argument Recognition,
Daniel Gildea och Martha Palmer,
University of Pennsylvania,
Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics (ACL), Philadelphia, July 2002, pp. 239-246.

Och allmänt har visst Martha Palmer rätt även om nu informationsextraktion och annan praktisk användning ofta ger andra konkreta värden. Snabba och ofta tillräckligt stabila allmänt, och viktigare för riktad informationsextraktion presterar de bättre än generaliserad parser utan annan anpassning. Men man ska inte underskatta deras värde annars eller. Betänker vi ex. ett träd är det en komplexitet vi t.ex. också kan uttrycka med den typ av implicita flödesrelationer i grafer jag tog som exempel i Semantiska parsern nästan version 1.0.


"Konkret värde jag såg redan igår är att skillnad mellan när titel, abstrakt och varje stycke för sig körs in i Drifting thoughts på den snabbare utvecklingsdatorn jämfört med när titel och abstrakt körs in och därefter endast en approximation av vilken NP som är i fokus för allt vad jag vet kan vara oändlig. Bryt det längsta försöket att ta ut en referens representation av hjärnan maximalt nitiskt associerade och tolkande efter cirka 30 minuter. För nöje kan man ju ha en närmare mänsklig intelligens som ger lite idéer men för allt praktiskt behöver man man sin egen intelligens optimera prestanda-kostnaden sådant kommer med och att approximera löpande inspiration över artikel-body till fokus-objektet gör enorm skillnad genom att antalet nya udda koncept som behöver representeras upp med sina från 50 upp till ca tio tusentals relationer (och i Drifting thougts är det inte linjära samband utan rekursivt genom att aktivitet om än indirekt när de möts kan resultera i den nodens relationer realiseras upp med aktivitet o.s.v.) reduceras enormt. Jag såg inget uppenbart som missades genom det med mycket om infektioner, virus, cellbiologi, epidemier m.m topp fem hundra på aktiverade delar av hjärnan från en artikel från tror jag ploscompbiol.org eller ev. plosone.org."

Jag såg i exemplet nedan för den semantiska parser som utvecklas för att filtrera artiklar, nyheter m.m. Drifting thoughts inte något av de problem Martha upplevde med sin chunk-parser.


Notera först den första siffran till vänster vilket approximerar motsvarande upp och ned - vad jag gjorde för att approximera kognitiv-komplexitet (som diskuterat i Neurolinguistics bl.a. kring Gibbs-parser) samtidigt som jag försökte göra just upp-och-ner i en annan funktion som aldrig bra bra. Det gäller för S-fraserna. Denna uttrycker det dock så perfekt man kan komma med utan problem en die för icke noll per mening.


För by (vad jag kallar en PP-transformator) att verben vi binder till ganska typiskt upplever jag för den typen av verb-argument ger oss en bra indikationen om den generaliserade förenklade meningen möjlig att fånga i de kanske teoretiskt mindre uppmärksammade men praktiskt bland de viktigaste arbetena inom praktisk lingvistik Verbnet, Framenet, Propbank m.fl. liknande lösningar representerar. Verb-relationerna till by: 6 VP to support VP/S och 9 VP buying VP/S (siffran till vänster där är frasens id-nummer och den som står direkt till höger om "upp-ner-räknaren").


"Manner-argumentet" man ser det i artikeln är "by buying big blocks of stock" där vi ju lokalt i den har en PP. I citatet från min semantiska parser ovanpå chunking agerar by m.m. som operatorer och den uttrycker relationer direkt enligt tidigare där ju redan där ges i alla fall en antydan om "manner": köpa aktier för att stödja något (stödköpa kanske?). Relationerna till buying (egentligen inte argument utan relationer som ej går till vad vi kan tolka som VP/S, SBAR o.s.v.)


.............................................................
S VP/S 4 9 VP buying 

STRUCTURE RELATIONS

ARUGMENTS
 10 NP big blocks NP
 8 PP by PP
.............................................................


Det samma för big blocks där vi också märker av debug-testningen av PP-completement avsedd för situationer där vi har längre kedjor som gemensamt konvergerar till mening och tolkning ex. att ett argument begränsar dimensionsrymden det andra uttrycker. Ex. in the middle of the forest (inte bara obestämt eller hela skogen utan i mitten av skogen: praktiskt för de flesta av oss ännu mer unknown). Siffran är frasens interna id-nummber NP anger bara fras-typen och ex. big blocks är chunk-frasen.


NP 0 4 10 NP big blocks


STRUCTURE RELATIONS
 9 VP buying VP/S

ARUGMENTS
 11 PP of PP
PP-COMPLETEMENT ( 10 NP big blocks ) ( 11 PP of ) ( 12 NP stock )


Och hela utskriften av körningen av exemplet från Marthas artikel. Den är som sådan anpassad för vad jag utvecklar i den (strukturerar och sorterar diverse kod medan jag sätter högnivå-primitiver men just för att illustrera detta passar den perfekt).


Notera när vi tittar före och efter by för den lilla upp-ner-räknaren. Den ligger balanserat på fyra genom hela det "human annotations" beskrivit som Manner i Marthas exempel mening jag fick för mig att jag skulle provköra innan jag tänkte försöka somna. En avvikelse från perfekt manner är för traders say vilket med upp-och-ner räknaren ligger på samma då jag just nu har comma m.m. som inte hanteras i trädet borttaget men följer man relationerna får man rätt fras manner ändå. Say är ju en gammal vän här.


Det egentligen mer intressanta för mig runt motsvarande manner är mindre dom markeringarna oavsett hur användbara de är i kontext av entiteter och vad dom gör utan mer av vad som uttrycks avseende aktuella dimensioner och hur dom begränsas via constraints - kanske vad vi kan kalla proto-whole och proto-part p.s.s. sätt som proto-agent och proto-patient. Var vi är på kartan och vad för sorts karta är det? Är kartan ett antal verktyg (t.ex. gas chromatography, t-test, litterature search m.m.) aktualiserade i texten som förklarar hur vi kan avgränsa vad vi kan förstå om vad entiteterna gjort var någonstans och med vilken säkerhet?


.............................................................

##################################################################
PHRASE STRUCTURE MAP:body_last 0
 NP 0 0 0 NP Big investment banks


STRUCTURE RELATIONS
 1 VP refused VP/S

ARUGMENTS
.............................................................
S VP/S 1 1 VP refused BOSS 

STRUCTURE RELATIONS
 2 VP to step VP/S

ARUGMENTS
 0 NP Big investment banks NP
 13 O COMMA NOFUNC
 14 NP traders NP
 15 VP say VP
 16 O . NOFUNC
.............................................................
S VP/S 2 2 VP to step 

STRUCTURE RELATIONS
 1 VP refused VP/S

ARUGMENTS
 3 PRT up PRT
 4 PP to PP
.............................................................
 PRT 0 2 3 PRT up


STRUCTURE RELATIONS
 2 VP to step VP/S

ARUGMENTS
.............................................................
 PP 0 2 4 PP to


STRUCTURE RELATIONS
 2 VP to step VP/S

ARUGMENTS
 5 NP the plate NP
.............................................................
 NP 0 2 5 NP the plate


STRUCTURE RELATIONS
 6 VP to support VP/S

ARUGMENTS
 4 PP to PP
.............................................................
S VP/S 3 6 VP to support 

STRUCTURE RELATIONS

ARUGMENTS
 5 NP the plate NP
 7 NP the beleaguered floor traders NP
 8 PP by PP
.............................................................
 NP 0 3 7 NP the beleaguered floor traders


STRUCTURE RELATIONS
 6 VP to support VP/S

ARUGMENTS
.............................................................
 PP 0 3 8 PP by


STRUCTURE RELATIONS
 6 VP to support VP/S
 9 VP buying VP/S

ARUGMENTS
.............................................................
S VP/S 4 9 VP buying 

STRUCTURE RELATIONS

ARUGMENTS
 10 NP big blocks NP
 8 PP by PP
.............................................................
 NP 0 4 10 NP big blocks


STRUCTURE RELATIONS
 9 VP buying VP/S

ARUGMENTS
 11 PP of PP
PP-COMPLETEMENT ( 10 NP big blocks ) ( 11 PP of ) ( 12 NP stock )

.............................................................
 PP 0 4 11 PP of


STRUCTURE RELATIONS

ARUGMENTS
 10 NP big blocks NP
 12 NP stock NP
.............................................................
 NP 0 4 12 NP stock


STRUCTURE RELATIONS

ARUGMENTS
 11 PP of PP
.............................................................
 NOFUNC 0 4 13 O COMMA


STRUCTURE RELATIONS
 1 VP refused VP/S

ARUGMENTS
.............................................................
 NP 0 4 14 NP traders


STRUCTURE RELATIONS
 1 VP refused VP/S

ARUGMENTS
.............................................................
 VP 0 4 15 VP say


STRUCTURE RELATIONS
 1 VP refused VP/S

ARUGMENTS
.............................................................
 NOFUNC 0 4 16 O .


STRUCTURE RELATIONS
 1 VP refused VP/S