Visar inlägg med etikett Complexity. Visa alla inlägg
Visar inlägg med etikett Complexity. Visa alla inlägg

Shanghai Composite resp. Kollektivtrafik: Komplexiteten ökar när frihet till intensitet och exakthet minskar

2016-01-13

På väg till en lös tänkbar politisk förändring börjar vi med att tänka oss ett tämligen stabilt tränat biologiskt neuronnät i en människa. En del av detta ger möjlighet att uttrycka ganska hög variation i hur vi konvergerar mot en grupp nära besläktade lösningar (eller för resonemanget lika fungerande och enklare: representation för en entitet likt en människa vi är vana att se i olika former - kanske en publik person som en känd skådespelare).


Säg nu att vi börjar få höggradig intensitet i konvergenser mot detta men att dessa är föga upprepade. I abstrakt modell finns ett begrepp som argumenterat kan sägas motsvara i medicinsk termonologi tics men såväl funktionellt förenklat som möjligt att tillämpa som begrepp mycket bredare (därför att vad begreppet verkar på här har ej den typ av differensiering mellan funktioner, delar m.m. som en mänskliga hjärna har). Vi kan anta något motsvarande tics i delsystem görande att konvergensen blir utlöst av ganska stor bredd på datat alltid gående in mot oblanserat få lärda lösningar utan att någon ny vetskap lärs d.v.s. i den mån avsaknad av inlärning ej är inkorrekt är det rimligt att anta att motsvarande extrem känslighet för irrelevant brus utlöser dessa konvergenser.


Givet den relativt extremt höga aktiveringen ett fåtal lösningar existerande i de inlärda besläktade kan vi tänka oss att det utlöser pruning där komplexiteten i hela neuron-gruppen reduceras genom att minska ner deras relationer eller kanske tagande bort hela neuroner. Övrigt kan ju tyckas redundant.


Det är förövrigt ett fenomen vi kan spekulera om en motsvarighet till i klinisk medicin del-aspekter av vissa mer kroniska psykotiska tillstånd såväl som varför för dessa ex. atypiska antipsykotiska läkemedel kan fungera samtidigt som detta indirekt tycks i den mån tillämpbart peka på att de senare medicinerna kanske förhindrar möjligheterna att över-tiden hantera vad vi här kallade tics (i meningen här för begreppet är brett och förenklat nog för att ta in när motsvarighet klinisk-medicin diskuteras bl.a. schizofreni) genom att dess effekt nu är genom att reducera dimensionerna associerade antagligen särskilt uttryckt där problemet uppstår att efter den typ av skada de kan orsaka vi kommer till lära nytt såväl skapande kanske något meningsfullt av neuronerna som komma ifrån problemet (d.v.s. åtminstone denna typ av antipsykotiska läkemedel medan jag ej är säker alls på att det gäller de på serotonin-verkande jämförbart - jämför för att se skillnaden inlärning i det extrema med hur vi ej upplever oss beroende av ex. SSRI-läkemedel men att de praktiskt hur till de som är mer problematiska att sluta med troligt - bedömer jag - p.g.a. av åtminstone i försvarlig andel ej relaterat ursprunglig depression utan inlärning av ett normaltillstånd läkemedlen representeras. D.v.s. vi kan tänka oss en tämligen gigantisk temporal skillnad mot det i bl.a. kortare tid verkande dopamin genom att sådana effekter avsluta SSRI kan komma flera månader efteråt - Samtidigt att senare generationers antipsykotiska läkemedel med effekt via system runt serotonin kanske i sig ger oss en indikation om tiden självutveckling möjligen tar - om aktuellt varierar kanske ordentligt beroende på hur ev. aktuell association för en person ner till de grupper av genetisk-information om tror är delvis ansvariga ser ut - även om jag inte kan ta text-meter här att försöka uttrycka hur jag resonerat här tidigare egentligen i något annat: Men säg att vi istället motiverar det på annat sätt återigen utnyttjande jämförelsen till SSRI och säger att det kan ta 5 - 10 års nedtrappning via system av SSRI för att helt ta bort inträning och att detta ungefär kan tänkas vara tidsperiod för stabil självutläkning av vissa psykotiska fenomen genom först pruning och sedan när uppenbar re-wiring i och runt så att säga i neuronnätet görande brus-driven mer eller mindre självaktivering irrelevant till ej havande kontext där det sker).


Upprepning i sig defekt när pruning sker reducerar ner antalet lösningar. När korrekt data (i mening att träning av systemet ursprungligen skedde med jämförbart data och då etablerade konvergenser motsvarar en acceptabel lösning / agerande av datat) blir nu resultatet ett av ett fåtal nära besläktade. Det hela kan bli överdrivet känsligt också där minsta förändring gör att konvergerad lösning växlar till en annan. Och tänkbart har vilken vi hamnar eller när de växlar föga att göra med vilken som är bäst eftersom "frisk" träning skedde mot vad som kom att introducera många fler besläktade konvergenser där ofta de "riktiga" försvunnit genom till "immunförsvaret" (för människa så) föranledd pruning reducerande bort neuroner och kopplingar. Det hela har förtunnats.


Motsvarande system vi hamnat i kan vara när meningsfullt tränat för att vara just detta vad som kan vara starkare. Detta när snabbare respons krävs och själva valet av fler mer exakta lösningar tar tid. En avvägning mellan exakthet och möjlighet att reagera finns.


När vi resonerar motsvarande för ett kollektiv av människor i samarbete är buråkratiska organisationer intressantare. Och intressantas just nu upplever jag kinesiska kommunistpartiet givet att topp-styrd "pruning" skett mer eller mindre sedan Xi tillträdde. Sådan pruning av människo-noder kan vi tänka oss får ej bara konkret "immunförsvars-avdödade" noder att ej bidra onödigt till en lösning de kan leverera (ibland är det bättre att inte märkas så mycket: Att bara göra mindre är en väg man kan uppnå detta med ibland fungerande).


Förvisso kan effekten av sådant bli att man tycks göra mer i vissa områden. Men det säger ingenting stabilt om hur mycket man agerar samlat. Ännu mindre går det bra att bedöma exaktheten i det man gör från historik. En besläktad effekt här är ju dessutom (som vi utan problem kan "bunta" samman med den mer konkreta pruning) att många kanske också hellre upprepar en indikerad önskad lösning på ett problem än adderar en förändring än innan.


Redundans reduceras. Högre komplexitet på situation att hantera kan tänkbart vara svårare att hantera. Medan man lättare kanske kan hantera situationer man lätt föreställser kan orsaka problem. De lite annorlunda och överraskande utmaningarna som bäst konkret är ej helt triviala att rätt förstå om man inte satts sig in i ett ämne runt omkring något relevant är inte otroligt vad som är svårare för partiet att svara bra på. Kanske kan de rent av utlösa globala tics-fenomen i dem från lokala sådana? Att görande lösning ej fungerande sprider sig till allt fler och allt mer i vad de gör för att hantera något man upplever är ett problem men där vad man gör ej tycks fungera. Har vi tur kanske vi kan få se något spännande exempel framöver som kan visa sig otroligt är vad vi kan jämföra med globala tics etablerande allmänna "organisatoriska / kollektiva" maniska tillstånd.


Diverse agerande inom domän ekonomi i det praktiskt mycket påverkande och märkbara kanske vi kan tänka oss är ett exempel man kanske kan reflektera från den här utgångspunkten. Det känns som man identifierar en förenklad bild av potentiella problem framtid (eller som man tror är realitet) samtidigt som en mängd andra dimensioner runt dom här frågorna kastats som irrelevanta (jag kan tänka mig att växande vad man tror är vad som driver fram säkrande av diktaturen när de tros vara fallet gör allt möjligt annat numera tyst i hur det påverkar lösningar vilket jag svårligen tror kommer göra särskilt mycket annat än att öka möjligheten att diktatur upplevs dålig av fler eller gör problem i hot mot den svårare att hantera utanför just de mycket konkreta situationerna lätta att förstå och som man utan utmaning förstått långt innan kan uppkomma likt protester på gator medan komplexa domäner som "industri-ekonomisk-protest-rörelse-krigföring" eller vad helst vi kan tänka oss domäner av ekonomi och samhällets sociologiska flöden är vad de i den mån effekt uppstår bara försämrar diktaturens sannolikhet överlevnad för någon tidsperiod framåt).


Ett par exempel från ekonomin där hög reaktivitet (intensitet / händelser per tid som skattat här subjektivt både från effekt inducerad per tid i hur det påverkar kort därefter som hur benägen - reaktiv - man tycks ha varit). Först interventionen i handeln med värdepapper första handelsdagen 2016 medan Shanghai ännu fortfarande vill ner (men lite osäker om uppgifter import-export för Kina: Kanske lite feltänkta då jag tror enterprise-strukturer köper på sig lager bara därför att flera råvaror bl.a. olja är riktigt billiga just nu resp. varande just enorma statliga konglomerat är långsamma med att förändra sin planering):



Exempel två är jag egentligen inte riktigt trygg att ta med utan att peka på att jag inte är säker om detta är dyrt i åtgärd kortsiktigt med en kanske feltänkt besparing / värde på medellång eller lite längre bort kortsiktigt men som ev. kommer fel inducerande annan skada (det är jag mindre säker på) när företeelse minskar eller ökar kostnad och skada indirekt möjliggörande andra i risker jämförbara spekulationer. Snarare att jag chansade lite här utan att riktigt förstå området: Det hela känns reaktivt i hur de agerar och jag upplever att det passar in i en större mängd åtgärder inom ekonomi jag tror likt föregående gjordes onödigt dåligt p.g.a. dålig exakthet. Därför att dom gör något ganska reaktivt upplevt besläktat annat gissar jag att det kommer visa sig vara en dålig åtgärd men förstår inte själv området eller åtgärden alls (eller vad de försöker förhindra):


"In the latest in a series of moves to stop the local currency from leaving the mainland, China’s foreign-exchange regulator has verbally instructed some banks to limit outflows and reduce offshore yuan positions and liquidity, according to people with knowledge of the matter. The People’s Bank of China has repeatedly intervened in the offshore market via state banks this week to crack down on speculators, people familiar with the matter said. The intervention has limited the supply of yuan overseas, driving the currency’s interbank rates in Hong Kong to record highs."

Från: Offshore Yuan Set for Record Five-Day Gain as China Curbs Supply (2016-01-13) | Bloomberg

Fantasilös som jag är har jag svårigheter att så här spontant komma på en lista på andra bra områden utanför ekonomik där man kan tänka sig att partiet kan möjlighet till re-training i form av utmaningar man troligt hamnar i tics av eller åtminstone reducerat ner sina möjligheter att klara varians och nytt för resulterande i relativt sämre lösningar än vad som var fallet (eller för jämförbara utmaningar troligen bättre hade hindrats innan Xi drog igång sina pruning projekt med dess lite udda inledning genom fullständig bort med en ganska stor neurongrupp med hierarkiska pyramidnoden - en av då få verkligt trovärdigt troende marxisterna i toppen av partiet och utan tvekan alls pruning från defekt data - Bo som mest kontextuellt igenkännbara noden d.v.s. den symbol som kanske oftare är slut-konvergensen än ett delsteg: Bo pruningen var ju ganska komisk vilket jag möjligen berört någon gång rörande delar av orsakerna men om inte jag tror jag avstår från nu bl.a. därför att det kan vara bra att se hur "globala-tics" benäget det hela är innan man ev. föga genomtäntk själv löser ut någon större intern-förändring via Bo's PLA-kamrater likt militärdiktatur eller för demokrati-värde troligen ej självklart gynnsamt inbördeskrig - om dom nu inte alla tänkbara av dom redan gått i pruning vilket kanske är det troligaste men som jag inte ids kontrollera: I så fall tveklöst ett tecken på att PLA ofta inte har så himla bra koll på saker och ting i mening av sämre anpassningsbarhet utifrån information man etablerar via intelligence då nu själva processen att avlägsna Bo och därifrån kritiska delar av deras befällsstruktur - om så för det senare - nu var inducerat via förgiftad information från entitet - individ - utanför Kina och som nu faktiskt lika gärna kunde ha varit ett annat land - kanske Nordkorea - förberedande krigföring med dem: Sådan risk om ej önskvärd kan man minska genom att reducera komplexiteten d.v.s. när så ej hindrande värde ex. tydliggöra historik nära för att defekt intelligens inte ska exempelvis öka risk för väpnade konflikter när man fyller på runt feltolkningar och missad information med de mest "självklara" lösningar globalt utifrån vad man samlat skapats för och tränats för att hantera även om de egentligen är fullständigt otroliga. Kul var det i alla fall att Xi besegrade Bo: Kanske kommer någon besegra Xi snart? Kanske lärande lite hur det gick till och från det förfina tekniken ännu mer? Eller skaffande sig bättre anabola stereoider än föregående tungviktsmästare haft / Eller tagande Xi bara på att han inte direkt blir smartare med varje nu smäll på skallen: Svårare dock just genom fenomenet här diskuterat med en reduktion konvergens troligen i större andel likställande saker till super-lösningen göra som Xi-vill när kanske ganska många av de ej veka lösnings-bidragen redan gått ut i pruning).


Public transport kanske kunde vara något? Eller om den svenska inspirationen är defekt varande något unikt fel i vår kultur? Centralstationen, Stockholm, är ju trots allt en av de absolut fulaste "central-station" jag sett i någon huvudstad. Kan det vara någon kulturell "skada" som etablerat sig för evigheter sedan? Kanske något från början sökande göra sig icke-attraktiv för danskarna efter Stockholmsblodbar för att slippa nya övergrepp? Eller så kanske det är ett område som är lätt att misslyckas med och där varje misslyckande ej försumbart lätt för städer med hög intensitet göra (flyttar många individer per tidsenhet) påverkar många vilka gärna blir arga och ibland så arga att de gör rena överslags-handlingar i något inte alls relaterat alls.

Att skatta komplexitet för NP är svårare än ofta föreslaget

2015-03-27

Jag skulle behöva en bättre complexity gör godtyckliga noun phrases för att balansera upparbetning av ex. emotionell intensitet mot named entity eller andra noun compounds mot slutet. Detta förslag med en mängd liknande går dock inte att använda:


"Noun Phrase Complexity (Ravid & Berman, 2010)
1. Mean length of NP in words
2. Mean number of modifier tokens
3. Mean number of modifier types
4. Mean number of subordinated lexical nouns
5. Head noun concreteness (Coltheart, 1981; Nippold, et al. 1999)"

Från: Language Proficiency and Linguistic Complexity Craig Lambert, Ph.D. December 19th 2014 Vrije Universiteit, Brussel

Feltänket är antagandet att fler av resp. ökar komplexitet men det stämmer inte. Har vi en modifier av adjektiv-typ modifierande noun och till den lägger en modifier varande adverb modifierande adjektiv gäller att vi nu har en mening lättare att processa. Går vi ner i åldrarna hos barn (men inte uteslutande bedömt från vad känt från studier där) kan rent av adverb föregripande adjektiv modifierande den varan förutsättning för att förstå och klara ut adjektivet.


Av samma anledning är längden av NP i ord ej tillförlitlig att använda. Fler ord kan öka komplexitet men kan också minska ord för såväl tillägg av adverb, adjektiv och noun (noun berördes lite längre fram medan jag utelämnande adjektiv vara tämligen självklart: Direkt nära adjektiv kan vara förutsättning för att efterföljande noun compound alls kan tolkas medan tidigt evaluativt-adjektiv kan vara motivationen som gör att vi överhuvudtaget läser resten av meningen).


Vidare finns chunks intränade till välkända ofta sedda koncept i sig själv som ex. Carl Bildt eller Hans Husman är identifikationen av detta som chunk effektivt och kommer med lägre komplexitet för åtminstone vissa former av adjektiv och föregripande noun ej del av named entity helt enkelt därför att det inte blir förvirrat eller meningslöst hur de påverkar jämfört med om vi istället anger med säg efternamn och läsaren p.g.a. annan person nyligen förekommande i nyheter med samma namn behöver hålla divergent representation uppe för båda när han går framåt.


Av samma anledning är längden på orden - om än ibland - inte alltid heller bra för att skatta komplexitet. Förutom en del rent visuella egenskaper jag känner är korrekt att utelämna (men är heller inte vad jag någonsin betraktat i detalj utanför titlar, abstract, och taggar för journal-artiklar, news-artiklar och blog-postningar) eftersom vi nu ändå måste flytta ögonen eller huvudet förr eller senare (och idag med html-innehåll känns det inte alltid självklart att man kan skatta bra här under förutsättning att man endast ska ta hänsyn till text utan formatering).


Och tämligen spekulativt om propagerar vikt från adjektiv med indikerad kanske högre komplexitet från sannolikhet, idf, diskriminerbarhet m.fl. mer eller mindre jämförbara mått som kan kombineras samman för att uttrycka hur vana vid är vid en term resp. hur sannolikt den i sig själv är marked förekommande i ett dokument (very förekommande i många kontext, dokument, meningar är föga marked och kan ha viss inflation medan en udda term kan märkas ut mer men vara dyrare att processa) är det tänkbart att den kostnaden givet emotionell intensitet hos termen gör ett längre noun-compound lättare att processa därför att det blir emotionellt intensivt och spännande istället för väldigt tråkigt.


Vidare anknytande till vad jag skrev i Ej säkert att engelskan har ett positivt bias såg jag för ett par timmar sedan gående igenom vad publicerat i hopp om att slippa få ett överdrivet antal lingvistiska studier gjorda av lingvistiker mer önskande från andra områden faktiskt men också att jag hitta en del bra från dom också jag inte redan sett samma studie gjord förr av tio andra (lingvistik är låg-budget i forskning jämfört med ex. medicinsk grundforskning så när man rör sig mer i lingvistik i deras område är i min erfarenhet kvaliteten såväl som unikheten riktigt bra mycket bättre) en artikel intressant åtminstone i problemformuleringen där man bl.a. pekade på att recall av vissa former av koncept gynnas av konceptet är välkänt för oss (uppbearbetning till ungefär som frequency effect m.fl. likartade företeelser) medan diskriminerbarhet och att addera tid på konceptet kan gynnas av oväntade slumpmässiga kombinationer av bokstäver (minns jag rätt meningsfulla ljud). Det kändes tilltalande att någon mer noterat problematiken även om jag inte såg någon lösning där.


Och om vi har två adverb efter varandra fyllande samma funktioner gäller ibland att de mer än ska tolkas tillsammans också är en ofta förekommande kombination vi bäst ser som ett koncept i sig. Dels därför att vi kanske kan få korrektare värden genom att erkänna den som en gemensam koncept (jämför med Hans Husman istället för Hans + Husman) vidare relevant för komplexitet därför att det är möjligt att dessa är snabbare att processa än resp. ord var för sig om de ej konvergerar till ett gemensamt koncept.


Rörande ord med prefix gäller trots många studier demonstrerande korrelation rörande olika frekvenser för prefix, själva bas-konceptet, resp. ev. form på slutet (ex. ir + responsib + able eller som jag föredrar att skriva dem ir + responsible + able om nu responsible är begreppet närmast centralitet för besläktade koncept och om inte vad som nu visar sig vara det) i och för sig demonstrerande argument för eller emot olika idéer om hur hjärnan hanterar dessa koncept (ex. skattande vikter för ord vi aldrig tidigare sett men ändå förstår därför att vi ex. mått responsible tidigare om än irresponsible) att samband rörande frekvens ej på vettig nivå (med något jag prövade) approximerar frekvensen för hela ordet från base (när dessa faktiskt ej är ovanliga och trovärdiga värden finns). Approximationerna går att få mycket bättre inte överdrivet svårt men just frekvensen räcker inte: Men inte ens mycket bättre känns dom i all ärlighet bra i annan mening än jämfört med när beräknande endast från frekvenserna. Detta endast jämförande prefix + base d.v.s. utan att blanda in koncept som också varierade på slutet. Text längd gav heller inte särskilt bra approximationer.


Givetvis kan man införa en super-operator inkluderande bl.a. not såväl som alla prefix som praktiskt för en tillräckligt andel av ord de används för (och där antonym finns resp. om inte har kontrollerats förhand) vilket möjligen gör det enklare att approximera hur vikter för base ska modifieras (eller alternativt tvärtom gör det mycket svårare: Jag vet inte säkert).


Praktiskt tror jag emellertid att det tänkbart kommer ner till att dom den relevanta motivations-drivande vikten för base är tillräckligt hög kommer komplexitet som skattat för hela ordet skapa praktiskt större intensitet än endast base har: D.v.s. i någon mening att ordet har lägre komplexitet därför att det känns viktigare, intressantare, roligare o.s.v. att läsa. Det är fel att kalla sådana lösningar själv-plågande men jag ger visst erkännande till att det kanske felaktigt kan upplevas så att implementera dem och väntar med att göra dem innan en hel del annat prövats ty för att detta praktiskt ska gå är man direkt i en multidimensionell värd där man i värsta fall också kan behöva ta hänsyn till similarity (ex. har vi läst så långt som till koncept i tycks det troligt att om det har viss rimlig likhet med andra tidigare koncept i allmänhet krångliga och tråkiga om än mindre så i vissa ämnen att sådan kostnad ej avgör negativt: Men jag väldigt mycket så hoppas att det visar sig korrekt när jag skriver att jag absolut inte räknar med att behöva göra en sådan lösning).


Det låter som jag lärt mig en massa här och delvis stämmer det. Men det finns också alltid en viss risk att tänka för komplext. Samtidigt har jag åtminstone några stabila indikationer på att det svårt att komma undan med de typer av enklare lösningar man hellre skulle önska använda.


Energi att lägga på att skatta komplexitet över frasen resp. per ord är dock när rationellt driven vad anpassas från vad man tänker sig göra. Jag har mycket bra viktsystem potenta i projektioner från bag-of-word och nätverk av koncept, resp. redan för vissa kombinationer under parsning mellan olika delar av meningen som jag önskar ta längre. Det är tråkigt att förstöra ner dom värdena när många fler olika koncept av varierade sorter (olika adverb-typer, adjektiv-typer och "för-noun") ska kombineras innan de får verka på sista NN-konvergensen eller konvergenserna. Ofta när jag nu läst studier från den lingvistiska kulturen saknas en bra praktisk uppgift att verifiera teorin mot istället räknar man lite fram och tillbaka ofta på hand-markerat data eller tittar om man får liknande resultat på annat data som man fick på hand-pos-markerat data vilket inte direkt är trovärdigt får någon bredare mer krävande användning än kanske just träna en algoritm av deras typ på en begränsad mängd pos-lablat data. Jag såg ex. en studie som argumenterade för att modifiera intensitet av ett adverb verkande på ett adjektiv (av en särskild grupp de också infört: ev. kallad strong) med en multiplikativ faktor av 0.30. Och visst jag kan förstå att de fick 0.30 när de gick över adverben därför runt cirka 0.30 ligger för mig very såväl som most med flera vanliga när de viktats upp från bl.a. frekvens, IDF, och något till välkänt trivial mått (jag använder nu mest för att se hur andra kombinationer fungerar) och sedan normaliserats men jag tvivlar ju starkt på att 0.30 ens är i närheten av ex. ovanliga adverb förekommande i få chunk med anormal association till adjektivet. Med en praktisk domän att tillämpa det på hade man säkert uppmärksammat problematiken eftersom det där inte räcker med att hantera ett mindre antal adverb man sorterat upp i kategorierna utan att alla adverb ska hanteras.

Google Search Suggestions: Defekt demonstrerar bredare taktik

2015-03-19

Sista åren har jag upplevt att Google experimenterat med diverse små och i litteratur välkända metoder utanför de mer avancerande runt kärn-algoritm - manipulerande indata från sökningar såväl dokument - som ofta indikeras som tänkbara vägar till förbättringar. Jag har vad jag minns egentligen aldrig tyckt de förbättrat något men självklart är det inte alls lika troligt att jag lägger märke till sådana förbättringar när de fungerar bra lika lite som jag troligt lägger märke till sådana problem när de försvinner.


Problematiken i kvalitet från mitt perspektiv och hur jag söker är att dessa förändringar smetar ut mening och reducerar möjlighet att söka ytterst exakt. Det gör det svårare att gå från ganska breda begrepp man börjat med i en sökning och kontinuerligt addera på för området ganska smala men exakt krävande begrepp.


Ett exempel från nyligen var att Google gav en försvarlig mängd sökträffar innehållande complex när sökterm var complexity. Och complexity var som adderad term till en sökning bl.a. (övergripande topp och satt först) grammatical. Därmed fick jag en mängd träffar relaterade "complex phrases" av olika sorter. Men det var ju verkligen inte vad jag sökte på:


  • Jag sökte på complexity.
  • Det är i betydelse ett radikalt annorlunda från complex inom området av att tolka och förstå mänskligt språk.
  • Meningen är nära associerad till bl.a. information och entropi.

Att hitta ett annat begrepp som bra ersätter complexity går ej men däremot hade jag kunnat prövat att addera -"complex (jag har fått för mig att man ska bäst skriva det just så här inkl. citationstecken för att det ska fungera utan risk för liknande problem).


Ovan en ny sökning jag gjorde nu för att demonstrera problemet. Vi ser träffar både från antagande complex såväl som complexity: Praktiskt fylls sökresultaten ut med en ordentlig andel säkert irrelevanta dokument.

Varför adderar man dom här förändringarna? En orsak och varför sådant här ofta indikeras som vägar till bättre sökningar är att det kan minska problemen som kan skapas hur man exakt uttrycker en term trots att betydelsen är den samma som termen uttryckt ex. i dåtid istället för nutid.


Men jag tror inte som Google kanske gjort det - som jag vill tolka det mindre formellt - att det är orsaken. Jag tror att orsaken är att dom försöker reducera sin complexity som funktion av här särskilt mängden söktermer och mängden dokument. Många dokument med många söktermer hanterade gör saker arbetsamma. Denna komplexitet följer ju antar jag efter att snarare vektormodeller tagit ut mängder - tänkbart förberäknande för söktermer med utnyttjande av antagligen ganska komplexa algoritmer för att kombinera sökterm givet sådana resultat - och därefter reducerande dessa från mer exakt tolkning av söktermer. Därför bl.a. att man förr en lång period kunde få onormalt få söktermer när man gjorde sökningar från ett fåtal ganska breda begrepp och därefter försökt få ökad exakthet genom att addera några mer exakt termer.


Och vi har som framgår nedan från en ledighetssökning (eller säg att jag orolig för nöjesbranschen frivilligt gjorde lite grannsamverkan snarare än att söka något tänkbart otillåtet delat att titta på) samma typ-grupp av lösningar men ordentligt översträckande Google's förmåga att tolka och förstå mening i begrepp:



Google föreslår ett annat avsnitt av South Park än det avsnitt jag redan givit fullständig titel på.


Notera hur Google givit sig på att se mening av faith från christian. Faith är både vad vi kan se som ett bredare begrepp "ovanför" christian såväl som en tänkbar "ord-komplettering" följande christian till ett två-gram d.v.s. från christian till christian faith. Vidare är det tänkbar att faith i vektormodeller av dokument relaterat christian ofta har samförekomst eller rent av är ett av de ord som i vektormodell utnyttjas för att beskriva dokumenten "komprimerat" i antal dimensioner.


Det roliga (eller om man bättre upprört skriver att verksamhetskritisk nöjes-tid förbrukades) var att jag också gjorde fel. Jag klickade på resultatet och kom konkret så långt att jag började titta på fel avsnitt av South Park.


Jag har lätt road av detta. Ty mening när man tolkar går ej att generalisera för språk utan att det blir fel. Mening måste alltid tolkas som funktion av typ av dokument vi har:


  • Ligger dokument inom område medicin behöver vi för att minska risk för problematiska fel veta det.
  • Och p.s.s. för andra specialistområden. Annars kommer mening som varierar mellan områden leda till feltolkningar.
  • För godtyckliga meningar utanför specialistområden och innanför vad vi kan kalla allmänt språk där vanligaste meningen kan förutsättas går det fortfarande inte att tillämpa det utan förståelse av typ av dokument.

Problemet här är argumenterat (om ej en ren defekt) inte otroligt orsakat av den sista punkten. Typ av dokument avsedd är här ej riktigt filmklipp utan titel på filmklipp inom området nöje. Titlar är ett särskilt område som just här rörande mening har behov av en uttryckt exakthet. Titlarna för dokument, filmer m.m. är ju i kontext av search suggestions en av de mest optimerade för ökad enkelhet algoritmen kan ge.


Normalt är Google riktigt skicklig just på att ge hela titlar som förslag på några ord från dem. Det är rent av en av de få starka argumenten jag har för att använda Google för en större grupp typsökningar jag ofta gör snarare än specialiserade sökmotorer eller för den delen numera också Bing som jag nyligen kunde konstaterat gått upp ordentligt i kvalitet när artiklar publicerande forskning inom åtminstone språk söks (kvalitetsökningen här behöver ej innebära att den är generell ty utmaningar relaterat bl.a. spam är här få om alls förekommande).


Jag är inte en stor vän av vektor-modeller allmänt inom information retrieval eller nätverk över vetande och koncept. Särskilt inte när de tas vidare till associerad mening: Jag menar att de utnyttjar alldeles för få dimensioner och att man istället snarare ska expandera antalet dimensioner i och runt associerad mening samtidigt som alla dimensioner bibehålls. Emellertid inser jag också att om indexerar med en historisk målsättning av att ha allt indexerat blir min princip här minst sagt krävande i åtminstone men kanske inte nödvändigtvis mer än lagring.


Ännu fler år tillbaka fick jag för mig att Google kanske utnyttjat Google NGRAM för att bygga search suggestions. Det är en sak som kan fungera ganska bra för allt innehåll som är som titlar (inkl. enklast att ge exempel på undertitlar men mer liknande typer av "under-dokument" finns säkert även om jag ej har bra karta över sådant ännu normalt optimerande i analys på stora mängder data begränsat till titel, abstract, nyckelord, och något mer sällan referenser även om jag bl.a. för Plos journaler gått längre är det relativt väldigt få) även om självklart NGRAM-modeller bara skapat av titlar säkert fungerar stabilare över mer för titlar udda kombinationer. NGRAM-modellerna om man gör det senare behöver ju inte fortsätta skatta utan kan när en full träff på en titel hittas föreslå hela den om den är väldigt otrolig som funktion av hur otrolig av användaren givna ord i sin ordning var (eller hur man rätt uttrycker det i dagligt språk).


Datakällan ovan är dock i sig inte viktig eller vilken man egentligen kan avgöra (trivalt) använts. Men det ger en indikation om större metoder tillsammans med vetande om ex. titlar som kan ligga under och som man nu eventuellt försökt sig på att komplettera med meningstolkning. Gör man det sista snarare än att det är en annan defekt tror jag föga på det. Jag upplever Google allmänt som mindre uttryckt relaterad mening och när det tycks ske som att det snarast reducerar förmåga än att öka den. Möjligt därför att man använder få-dimensionella statistiska relationer av typen P(mening eller kompletterande / alternativ term | vad jag sökt på och hur dokument för prototypiska sökningar för dessa normalt). Exakta sökningar inom specialistområden tror jag det aldrig kan ge bra resultat för utan att algoritmer som kan prestera här konkret som sökande dessa områden som behärskande ska uppleva när man ser dem direkt kompletterar ens eget vetande alternativt hanterar ens vetande med samtidighet över så många dimensioner att man ej klarar det själv. Utan det tror jag alltid att man tappar möjlighet så fort man söker med många termer för att få fram något exakt.