Visar inlägg med etikett Smoothing. Visa alla inlägg
Visar inlägg med etikett Smoothing. Visa alla inlägg

Frekvenser: Smoothing

2015-04-08

Jag har prövat ett fåtal av de mer välkända algoritmerna för smoothing av sannolikheter för förekomst fler-gram och kan hålla med om en del i:



Också att i den mån smoothing ej sker eller så har skett befintligt för vad känt och något nytt upptäcks att vi kan se det som en förekomst och därefter börja spåra sannolikhet fortsatt.


Emellertid började jag små räkna lite i dagarna för att räkna om min Bluelight intensity till samma generation som andra viktsystem och därmed enklare jämförbar och samtidigt använd som dessa. Här utgick jag initialt för några tester från frekvens för koncept resp. sannolikheten för ett koncept givet ett annat koncept som också har en fast relation i Bluelight till det första konceptet (övrig P ( A | B ) sparade jag ej uppgifter för då det blev väldigt utrymmeskrävande och betungande).


En intressant egenskap här är att för vissa ord har frekvenser i stora delar av corpus ej räknats bl.a. the och of delvis också från ärvda sannolikheterna från föregående version. Medan dessa i absolut sista underversion av Bluelight gavs vänner fullt ut när jag såg att Berkley DB ej gav något problem krävande att jag ej kunde använda det (d.v.s. vid problem hade jag behövt kunna ha hela Bluelight i minne vilket kräver givet övrigt en gräns helst under 300 MB).


Frekvensen för the kommer därför ordentligt långt ner och befinner sig ej topp 10 000.


Säg nu att vi gör smoothing genom att göra något ganska enkelt som att över alla vänner en relationer finns för summera resp.


P ( the | relation ( i ) ) * frekvens ( relation ( i ) )

Den andra delen av uttrycket går som jag vet av erfarenhet att göra ordentligt bättre genom att utgå från relationerna för det konceptet och räkna framåt.


Värdet som detta gavs när ingen värdering alls till resp. koncept's uppmätta frekvens "korrigerade" positioner för åtminstone mycket vanliga ord som ex. the och of. Jag gjorde ingen mer exakt kontroll av det mer än att notera att jag mycket möjligt för beräkning av okända sannolikheterna hade en såväl enklare som eventuellt bättre algoritm än den jag just nu använder (som är similarity baserad och inte troligt presterar bättre än denna inom forskning m.m. tydligt ämnes-nära jfr om frekvens cognitive psychology är okänt).


Mitt intryck var emellertid att korrigeringen var mycket god för 1-gram (ord) åtminstone för alla ej ovanliga (jag tittade bara en bit högt upp). Mycket god bedömt från rank-ordningen. Effekten på fler-gram betraktade jag föga om alls men noterade en del tecken på att man troligt om alls utnyttjande detta behöver kontrollera det mycket noggrant. En del organisationer (United Nations, länder och en stad (New York) tycks korrekt gynnas men jag har en känsla här för att vi här inte längre får frekvenserna korrigerade eller skattade så mycket som att få motsvarande Bluelight intensity. P.s.s. som att frekvensen vi utgår från är mer eller mindre korrekt p.g.a. stop gäller tänkbart att ev. värdering av den behöver påverkas av faktorer kanske svåra för fler-gram anta är samma för allt.


Jag var här också intresserad av att få magnitud på det hela för att värdera vad känt såväl som frekvens och kontext på hur lätt vi processar data d.v.s. grundvikter utan hänsyn till det lokala kontext (kontext i bredare mening). Någon trivial vikt utnyttjande resp. frekvens och "smooth-frekvens" tillsammans presenterade sig emellertid inte.


Inte otrolig är mina frekvenser från start mycket nära vad jag sökte ovan eftersom de är baserade med en ganska kraftig andel titlar. I titlar har vi ofta 1 förekomst av resp. koncept och ger därför något motsvarande en kontextuell beräkning: Jämför gärna med mått vanliga i bibliotekssystem resp. sökmotorer för antalet dokument ett koncept förekommer jämfört med antal förekomster vi samlat har.


Detta är ett annat sätt att se på och göra smoothing även om det inte var målsättningen med vad jag gjorde här. Och tänkbart är den subjektiva vikt man kan få ut görlig att få närmare contextual diversity:



Jag kan tänka mig att sådana subjektiva sannolikheter kanske kan ge en förklaring till effekt som frekvens för chunk vs. frekvens för kortare chunks eller bara orden kan ha hastighet vi processar meningar med.

Fler konvergenser P(A,B): Inför Smash and grab operation i domän TV-nätet

2013-09-30

Smoothing enligt tidigare verkade av allt att döma mycket funktionell när value-typer adderades men jag valde ändå en förenklad metod som ger mindre flexibilitet men är funktionellt för alla viktiga användningar och behåller tidigare mindre lösning för övriga därför att förenklingar käver en till läsning av alla datafiler jämfört med skattade jag åtta till tio nya för flexiblare lösning (vilket tar väldigt lång tid) inte minst därför att filerna måste styckas upp mycket mer för att gå att ha minne för beräkning.


Oavsett det roade jag mig nyligen att ta ner större data rörande musik-lyrik och tog ut samförekomst rent binärt per meningsnivå av allt utan hänsyn resp. musik-lyrik-frekvens eller annan sådan spearering o.s.v. och från det samlad P(A,B) skattning.


Vidare från den viktade jag samförekomsten med ej normaliserad addition av förekomst två mått på intresse i två nära besläktade perspektiv: publicerande och upplevande (skattat från data jag tog ev. 2011 eller 2012 via möjligheter som då fanns via api:er hos en tämligen branschledande tjänst rörande publicering "media-stycken" bl.a. ofta på temat musik och film) - och normaliserat i kommersiellt möte av dessa data samlat från "internet marketing". Där värde adderas in i "antal" när det finns till resp. koncept oavsett om konceptet består av ett ord eller flera (om flera utan hänsyn förekomst av färre ord jfr wash your dog tar ingen hänsyn till samma värden för your dog eller dog) för resp. av de två koncepten.


För alla sådana förekomster - utan hänsyn till ordningen för A och B - dividerar vi värdet med alla värden för resp. de förekommer med.


Detta konvergerar avseende värde-typer förekommande - avrundat o.s.v. - för sannolikhet havande värde i resp. i+1 enligt proportionellt ökande eller minskande för lutningen som all förekomst av koncept-perspektiv vi är minus förekomsten vi bedömer dividerat med förekomsten vi bedömer.


Vilket innebär - är jag tämligen säker på - indikerar (trots tämligen rundimentärt hanterande av mätvärdena prospketerande om de är värda att använda seriösare) att de genomgått påverkande smoothing av tjänsten innan levererat ut. Antagligen enligt någon variant av bionominala-fördelningar. Det är kanske lite intressant eftersom jag aldrig annars fått intrycket att samma aktör just använt dom algoritmerna associerat sökresultat för annat.


Oavsett vilket gäller att för värde association mellan säg angenämnt belönande och våldsamt eller otrevligt gäller regelmässigt att förenkla till det till spontant uppenbara positiv och negativ hör till vad som oavsett någon förekommande viktlösning publicerad eller de bättre jag gjort själv i övrigt levererar regelmässigt signifikant sämre än andra motsvarande sådana "mer eller mindre" som jag brukar kalla för mig grundläggande. Normalt verkande påverkande globala tillstånd i vad som är beräkningskrävande ser jag föga värde av att låta positiv och negativ påverka därför att man får det typiskt mycket mindre med ex. up och down och Blu lght intensity och vid ev. behov utnyttja det till utgångspunkt att applicera positiv och negativ på riktat rörande något avgränsat koncept eller en koppling sådan till annan. Musik-lyriken när vikter som här mycket nära det reward-drivna - d.v.s. vad vi ser värde att publicera för, betala för att driva trafik till resp. lyssna eller titta på utan att behöva betala - precis som förväntat tycks ge mycket intressanta och potentiellt mycket kvalitativa skattningar.


Jag hade inte just räknat med att aktuellt musik- och film-specifikt viktdata skulle hålla tillräcklig kvalitet. Det gjorde det heller inte första körningarna men efter transformation / projektion på det datat med up och down fick jag vad jag spontant bedömer som riktigt mycket bättre data än jag någonsin sett för positiv och negativ. Åtminstone när vi ser mer värde i vad vi vill använda positiv och negativ till i det ärligt praktiskt reward-drivna snarare än vad som känns korrekt att indikera när mätt och tillfrågad i forsknings-lab i psykologi-forskning eller för ännu sämre positiv och negativ data i eventuellt ofullständigt roterade frågor på Amazon mechanical turk (för att indirekt referera två av de oftare uppmärksammade viktsystemen relaterade positiv och negativ vilka båda inte spontant ser fel ut enkelt när man tittar på dem men ej levererar predikterande människa eller människor i beteende från språk oavsett om vi går fram eller bak i tiden).


Åtminstone för stora delar av datakällans möjligheter via extraktionsmetod jag använde tror jag att den är slut nu. Förr kunde vad publicerat-tjänsten tas ut till sekundära tjänster (ex. omvandlande ett filmklipp innehållande musik till mp-3 eller motsvarande) vilket gav SEO-driven marketing för den tredje ganska viktiga värde-dimensionen. Andra vägar att ersätta finns säkert och ännu bättre är antagligen att försöka för musik längre tillbaka i tiden ta vikter från försäljning, marknadsföringsbudget m.m. Praktiskt här och nu för mig ser jag emellertid inte att det är intressant som funktion av tidskosgtnaden. Både rörande automatisering tolkning av datakällor reward såväl som att från data byggt av människor direkt eller indirekt avseende hur titlar på lyrik-sidorna m.m. ser jag många i och för sig säkert intressant glada små utmaningar (definition glatt: ej iriterande på nivå att man kastar ett lagringsmedia ex. exterm-hårddisk i väggen för att i ögonblickets sanning inse att kostnad några få-tusen ny hårddisk mot att garantera att långsammare delar av personligheten aldrig självplågar sig med skit-datat igen är korrekt) men just tidsödande.


En allmän oavsett viktsystem mycket trygg brytpunkt är att de 10 000 - 14 000 vanligaste koncepten över alla jag tillåter (och ej nödvändigtvis inkluderande alla ord oavsett om vanligare all det minst vanliga av dessa) är tryggt utdata om det tillämpas i mina algoritmer för transformation och projektion vid analys enskilda nyheter d.v.s. i kontext av ett större sammanhang där för enskildas koncepts ev. felaktigheter reduceras. D.v.s. när vi gör projektion till denna topp från deras kontext i nyheten där kontext består av en mängd koncept vikterna tillämpas på. Jag bedömer att om man hanterar datat jag utgick från mycket seriösare än nu prospekterande - särskilt något vettigt genomtänkt istället för additionen - kan det orka fram till det (vilket just för positiv och negativ nära nog unikt för viktsystem jag förvaltar långsiktigt ej orkar stabilitet givande förskjutningar och fel när vi räknar framåt i tiden utan nytt data görande att vi inte självklart kan betrakta säg nedanför topp 1000 - 5000 mycket bättre eller sämre än data långt nedanför vilket gör det ganska svår använt i de lösningar jag valde att skapa med många fler dimensioner än normalt - konkret problematiskt blir effekten att mer sällsynt data vi annars vet stabiliserar sig över allt inträffande görande att vi praktiskt kan ta data från säg topp 50 000 till 100 000 ej nödvändigtvis gäller och filtrering istället måste ske innan data går in i nöten vilket jag saknar lösningar för avseende så pass specialiserade problem som positiv och negativ där ju gäller tror jag att kan man se dom problemen för filtrering kan man antagligen lösa vikterna direkt istället - om inte vetskap och förståelse av världen just nu och hur den utvecklar sig handlar mindre om data från närmaste dagar, veckor resp. månad och mer om många år för att få det vettigt om ens alls görligt).


Positivt överraskad av datat från filmklippstjänsten. Gör mig nästan lite motiverad att socialisera samhällen relaterat sajter och tjänster implicit driven användar-initierad publicering av värde-innehåll (jfr musik- och filmsajter som vid förfrågan tar bort filmen som kom på bio förra veckan när ombedda om nu någon noterar att den publicerats från sekundära sajter publicerande inbäddat i brist på sökfunktioner m.m.). Ett segment där jag förövrigt kan notera att gällande rapporter åtminstone från amerikanska myndigheter runt frågan sista två åren såväl som är mitt intryck arbetsmetodik hos copyright-ägare ej riktigt förstått vad verksamheten som genererar intäkter är eller hur man effektivt kan detektera publiceringen. Fascinerande nog kommer det relaterat "antal" ner till vad vi kan applicera typer och instansier på precis som för för språket: Typen "This is a movie" såväl som ett språk-koncept vs. där det refererats skapande fler instansier. Ju mindre ditt sample du bedömer antalet instansier från är desto större relativa skattningar får du rörande egentligen allt om smoothing ej sker. Både faktiskt förekomst relativt hela världen såväl som dina förluster samtidigt som det faktiska resultat i borttagande av publicering i samma utsträckning blir sämre. Metoden att t.ex. göra stora delar - ytterst verkligt funktionell för affären - tillgänglig och uppenbar enkel för de metoder ex. leverantörer filmbolag använder medan säg 70% ej riktigt framgår - trivialt ex- spindlande dem - är ett exempel på dom divergenser verkliga också bara för en typ avseende publicister snarare än för själva copyright-koncepten.


Mitt återupptagande av teve-tittande sista åren - på laptop med liten skärm - efter många år helt utan teve, och utan att någonsin använt en fildelningssajt eller liknande (mycket post-kulturellt min tid som mediekonsument på nätet) - har kanske som ej otroligt representerande nu i all verklighet ytterst stora och väsentliga grupper med ålders-centralitet förskjuten uppåt allt mer också från min ålder (jag var nog tror jag äldre än år rörande internet-konsumption av populärkultur) avseende värde-mängd ex. för de betal-tevetjänster som nu marknadsför (tar betalt och har ytterst relativt gratistjänsterna verkar det mycket långsam såväl som smalare publucering åtminstone utanför som jag minns det den största lagliga i USA när den fortfarande var det drivande konceptet) har gissar jag i mitt motstånd från att behöva lär mig något nytt för rent hobby-ändåmål (jfr fildelning, thor och allt vad det heter) levererat en till den direkta kommersiella mitten här för åren som kommer. I samma utsträckning reduceras tid ex. på Youtube varande tror jag mer typiskt för samma då i storlek mindre centralitet för de teknik-tröga men ekonomiskt intressantare konsument-grupperna närmaste åren bakåt.


Datakällor för vikt viktsystem ska - vad som är kvalitetsdrivande upp till tung-nivå för mig - vara vad man rent personligen ligger nära i vad man egentligen mäter och där helst själv tillämpar. Att direkt personligen förstå typ av datakälla gör att man lättare detekterar när den börjar tappa och det är dags att försöka hitta fler alternativ att bredda upp den med. En gång dominanta datakällor har dock ännu för mig aldrig ännu kommit att reduceras till annat än stora - det är snarast nytt-nytt som behöver tillkomma för dem - vilket jag tycker pressmeddelanden är ett bra exempel på. En mängd fler kanaler finns - flera generationer av nya sådana - men det är likväl en god grundkälla man ej vill ta bort från en nu större parallell-mängd (där förövrigt den första kompletteringen var en till äldre datakälla: rekryterings-annonser, och pressmeddelanden lades förövrigt ovanpå den vid tiden också etablerade i patentansökningar).

Hans-faktor i smoothing konverger Eulers-konstant som funktion av antalet typer

2013-09-28

Lätt irrterad såg jag en lösning på problemet jag inte fann i färdig algoritm föranledande Snabb och mycket acceptabel smoothing för särskilda användningsområden inom natural language processing (2013-09-27) skapelsen när jag sökte rörande nästa steg sättande värde-typ-beroendet (där det tycks fungera väl med log antal av dessa typer utan att behöva blanda in antal för första och sista typen i storleksordning) i:



Där vad refererat "This is called Smith-Devine prediction (1985)." i formel (7) när utvecklad i uttryck (8) i avsnitt "Enhancement of Smith-Devine law" ger oss att vad "Hans-faktor" konvergerar mot - som man också ser ganska tydligt som funktion av sample-storleken - är Eulers-konstant. Notera för hur Hans-faktor används att vi beräknar ett minus faktorn (den konvergerar just ett minus Eulers).


När sample expanderar tender som den samplings-metod och identifikation av koncept bestående av flera ord, ord o.s.v. allt mer approximera väl utan behov annan hänsyn än endast antalet typer enligt formel och blir på det sättet en allt bättre approximation. För Hans-konstant var ju dock ett delbehov att värdera upp mindre samples något mer varande oftare utvalda därför att det ansetts viktiga varande expert på något eller balanserande en annars möjligen likartad världsbild från stora mycket kvalitativa färdiga data (likt Biomedcentral.com alla artiklar med dess journaler färdigt för nedladdning i stora xml-filer med ett antal mindre journal-hus också med öppen publicering som ett begränsat cirka 40 MB sample från Mdpi.com).


Jag är väl egentligen ej klar över ännu om viktning med värde-ranking om funktionell räcker förutom normalisering [0,1]. Eventuellt kanske omräkning som funktion för P(A,B) som funktion av P(A) och P(B) tvingas till (vilka jag om så ogillar precis som den omfattande stopp-listan men knappast heller där att något direkt tydligt omedelbart problem ges av det). Men jag gissar att det nog ej krävs (och om så kanske snaare som funktion av P(A) resp. P(B) alt. mindre troligt men kanske tillräckligt reducerande problem med små-värden för antingen A eller B maximum om division känns som ett mer tidseffektiv alternativ än här kanske lite bättre lösningar givet att vi antagligen har "ett antal" fall där varken A eller B förekommer förutom i ett P(A,B) givet att vi nu såg A med B sorterade som typen snarare än mängden av alla hittade typer A och B. Men verkligen att det ofta nog fungerar bättre för mig tycker jag att pröva lite erkännande att jag inte så mycket härledde Hans-konstant som att notera den när jag sorterade några små-filer i en Excell-liknande applikation i Star office: en osund färdighet som kommer efter några år tagande in diverse liknande data för att sortera från max till min för att upptäcka ev. problem och reflektera hur man normaliserar det).


Även om det kan tyckas lite långsökt bara från detta tror jag med diverse annat från annat att det uttrycker när vi här ser det i språket hur vi organsierar våra biologiska neuronnät där i många delar överföring svåäl som topologiska-relationer exponentiellt avtagande förhållanden finns. Och vi noterar också dess användning inom bildanalysen ex. i COSINE INTEGRAL IMAGES FOR FAST SPATIAL AND RANGE FILTERING. Jag har väl också sedan något år eller så egentligen accepterat att det snarast troligare handlar om cosinus-transformationerna (ex. snabba approximationer av vourier) än wavelet dr de senare kanske snarare är en omväg (jag var ganska övertygad om waveletäs innan det: varande upplevde jag elegantare för rum- och tidsberoende men vid den tiden hade jag heller inte prövat dem på större datamängder).


Och Laplace transform där ev. om jag minns rätt egentligen inte behövt plåga mig med dem på väldigt många år praktiskt att vi kanske kan se kopplingen till exponentiella fördelningar inom sannolikhet.


Intressant är givetvis också användning inom extremvärdesteori (och där aktuella fördelningar). Det är ju vad vi har när mängden typer som för språk fortsätter att växa ju mer vi samplar och troligt med fler tidigare aldrig sedda kombinationer tillkommande dagligen i vad dom humana-språk-genererings-noderna skapar på Twitter, Plos m.m. vi kan läsa in för att förbättra våra modeller. Ej väldigt otroligt alls har jag nod-språkgenererande här gjort just det.


Därmed inte sagt att jag just tror att något särskilt i naturen grundläggande finns just med Eulers-konstant. Den återkommande här har nog mer med våra approximationer eller ideal för sett att avbilda. Även om jag relaterat det egentligen själv alltid upplevt dom logaritmiska uttrycken - ex. relaterat dopamin-decay i våra biologiska neuronnät - som troligare (utan att själv försökt skatta det från verkligt data rörande belöning, inlärning, prediktion runt det från alla ap-försök med josbildningar m..m. utan edast språk) snarare än dom hyperbola-funktionerna. Inlärningsbias från att alltid ha använt dem och säkert aldrig en hyperbol sedan universitet kan ha inverkat där misstänker jag också (i någon mening bör det väl ändå tycker jag komma ner till nedbrytning av dom kemiska substanserna via enzym-system och det är ju domäner man också precis som informationsteori och språkanalys ligger i uttryck nära dom logaritmiska decay-funktionerna).


P.s.s. noterar vi citateet "The information entropy of the Weibull and Lévy distributions, and, implicitly, of the chi-squared distribution for one or two degrees of freedom." i Wikipedia. Och ytterst relevant här gäller - med viss risk att jag något mindre eller större fel i detalj - att betraktar vi uttrycket (jämför gärna den ev. skalning mot P(A) och P(B) att skillnaden mellan information rörande dessa och P(A,B) ex. användande Shannons-uttryck för information med:


H(A) + H(B) - H(A,B)


, där vi när vi multicerar värdet med antalet utfall samt ungefär 1.386 får vi Chi2-värdet för att avgöra om hypotesen att A och B är oberoende är rätt eller fel. Gamma distribution är förövrigt anpassningsbar skattande mänsklig-inlärning även om jag prövande fördelningsfunktioner på värden skattade med olika former av vikter (mina upp och ner m.m. görande det mer noggrant på de tio viktigaste) finns flera andra fungerande ungefär lika bra. Men kopplingen informationsteori gör det ganska tydligare såväl som att rent visuellt kan se hur vi kan forma både inlärningskurvan och sigmoid-kruva såväl som mängden typer när sample-storlek växter.

Snabb och mycket acceptabel smoothing för särskilda användningsområden inom natural language processing

2013-09-27

I NLP görs tror jag smoothing nästan huvudsakligen när P ( A givet B ) utifrån relativa frekvenser skattas. Antag emellertid att vi önskar betrakta P ( A,B) där vi vill se "A,B" som en symbol i sig och där utan att ordning har betydelse.


Antag vidare att vi skattar förekomst från olika corpus varierade i storlek, varierade i exakt vad vi samplar (jfr samförekomst i titel rörande detektion av fler-gram och/eller ord respektive samförekomst i taggar för artiklar i journaler).


Vidare gäller att vi ej vill se varje sample som vad vi sparar särskilt för enskild användning men samtidigt heller inte vill kasta bort den expertis det kan representera. Korrekt praktiskt har varje sample gjorts utvalt för att förstärkta där det ses meningsfullt i en övergripande grundläggande språkmodell i meningen hur språk speglas ner ex. i similarity-operationer eller när stöd där saknas rörande nya relationer (vi antar att vad vi här skapar byggs kontinuerligt vidare men smalare i typdokument som skattas: endast gårdagens nyheter fortlöpande vi uppdaterar med).


Vi har endast från resp. sample sannolikheterna att utgå från - därför att dessa filer är elegant samlat i en katalog på en snabb-hårddisk medan filer med själva antalen ligger spridda över tre eller fyra hårddiskar och skulle ta ej trivial tid att kopiera över till snabb-hårddisk - och önskar ej att mycket stora sample ex. från alla artiklars titlar i BMC och NIH eller United Nations dokument avseende olika rubriker skattat sekundär ej ska bestraffas för mängden typer oavsett per värde eller ngram ska reduceras abnormt (ca 8 - 16 GB styck) - eller internt Wikipedia-refererar-annan-artikel på antagligen cirka 40 GB eller mer (ej sammanfört en fil så det enkelt att räkna ut). Samtidigt vill vi ge erkännande åt att sample typiskt när optimalt rörande denna faktor ungefär 40 - 80 MB, och med medvetenhet om att vissa små-sample i mycket är mycket sämre värt än allt annat men just i sina unika områden kan addera visst värde.


Smoothing-målet här skiljer sig inte bara rörande detta från mer traditionell tillämpning där diverse mer eller mindre acceptabla algoritmer finns (vanligen med inte bättre koppling till distribution av typerna, token-antalet, eller informationsteori än grovt tumskattande på nivå med vad man själv kan komma fram till ex. lite linjärt skattande mellan antalen för saknande värde-antals-räknande och därefter beräkna lutning igen mellan resp. antal och humpa till något som oavsett hur föga optimalt med all trolighet är bättre fungerande än vad man "naturligt" får om man gör tämligen små samples), utan också genom därför att vi vill göra smoothing effektivt d.v.s. helst göra maximalt än beräkning per värde fortlöpande från givna värden snarare än att tröskla igenom varje rank eller kolumn.


Själva koncepten bakom tror jag alla vanliga smoothing algoritmer för traditionell användning ger oss att det rimligen är möjligt (jfr exemplet ovan för Good-Turing humpande med linjära log-skattningar i varje bak - rimligen görligt samlat ungeäfär lika bra som funktion av resp. faktiskt värde för resp. ngram-symbol).


Jag hade stora problem att se en bra lösning på det. En tyckte jag säre lösning jag annars använt fler år är att skatta från bl.a. max-värdet vilket när resp. mängd förekommande typer varierar relativt lite är funktionellt.


Efter reflekterande detta av och till flera veckor faktiskt där jag fått förkasta två lösningar jag var trygg nog i från små-tester att beräkna in (d.v.s. får räkna bort igen) hittade jag en vikt relativt funktionell rörande egentligen allt tycks det också om jag räknar med att behöva efter sammanförande av värde normalisera så att sannolikheterna summerar "rätt", förutom kanske 50 - 70 sample corpus behöva införa en extra där sannolikheterna för resp. PAB beräknas av PA * PB på hela, för att trycka ner outliers i små-corpus ej förekommande i övriga, samt ev. någon mer viktoperation (inte otroligt funktion av types avseende värden snarare än ngram-kombinationerna).


Vi börjar med att beräkna Hans-Faktor vilken är:


( 2 * ln ( ln ( types_ngram_kombination ) / ln 2 ) / ln 2 ) / ( ln ( types_ngram_kombination ) / ln ) )


Där vad vi dividerar med möjligen - även om jag ej tror det för Hans-faktor - kan vara kopplat en tidigare vikt (exakt samma) som tas bort fortlöpande på värden efteråt (lätt att tänka fel kring sådant tycker jag praktiskt och jag brukar få pröva upplever jag). Men jag tror divisionen ska vara där.


Detta ger ett värde som ungefär börjar på 0.39 för samples i storlek av cirka 300 - 400 MB (och om jag minns rätt neråt 0.32 för riktigt stora sample men som nu är utelämnade då jag ej är säker på att alla fått sina värden sammanförda vilka möjligen ställer skattningen av types ifråga vilket jag ej kontrollerat). Och cirka 0.52830 för det minsta samplet på endast 2.2 MB.


Hans-faktor utnyttjar vi därefter som smoothing-faktor. Önskar vi att kombinera väldigt få samples är det vettigare att använda den på detta sätt genom att styra hur mycket vi låter själva anpassningen av värdet vs. ursprungligt värde påverka. Här är emellertid utifrån våra särskilda krav viktigare att vi först (innan de indikerade senare operationer jag utgår från att behöva göra) att saker ligger i jämförbar magnitud utan att abnormt nervärdera stora samples (jfr Google 5-gram, NIH, UN m.fl. större) eller kasta bort expertkunskapen i mindre riktade sample (ex. Citeseer-X, DOE, NAP (alltid värd ett besök och givet samspel finanserande beställarroller d.v.s. the Congress, kvalitativt-oberoende och budget oavsett hur liten många andra datakällor rörande rå-dokument-storlek ett bra värde för långsamma faktorer vi kan önska få med kombinationer runt), Reuters välkända sample avseende endast titel- men ej ett parallellt jag gjorde själv spindlande som snarast hör till de stora om ej i närheten av UN m.m. - avseende endast titel medan om vi jag tagit ingress eller brödtext där hade de varit abnormt stora så klart - eller ännu mindre Google 5-gram men endast avseende rader uttryckta endast med stora bokstäver eller Eurostat's definitions-system avseende rubriker, underrubriker resp. varje stycke för resp. definition oberoende för resp.).


Vi gör nu brutalt hård - mycket mycket hårdare än jag hade tänkt och absolut egentligen inte gärna vill göra därför viss användning förlorar på det för övrigt lika gärna kan göras vid användning - filtrering på stopp-ord. Detta därför att en faktor jag tar in är min gamla vana att låta max-värdet påverka. Givet att datakällornas typ varierar mellan rubriker, ingress, brödtext, taggar, interna referenser Wikipedia, referenser science-articles m.m. varierar naturlig förekomst av stopp-ord ordentligt. De flesta stoppord ex. is, for m.m. är i vissa av dess typer av datakällor abnormt vanliga vs. ex. i taggar. Skalar vi som funktion av maximalt värde fas-förskjuter det brutalt out-of-sync mellan dessa d.v.s. stopp-filtrering på några hundra ord.


Därefter blir ev. kvarvarande naturliga out-liers missade under sample synliga (ex. emerican + ämnesområde för yrkesorganisation inom subområde i medicin vars journaler vi samplat). De bör väl bäst hanteras om man inte som jag tänker pröva om om PAB * PAB hanterar det nedtryckt men ändå speglande den samhällspåverkan och i kunskapsförvaltning dessa organisationer när värda att sampla kan argumenteras ha.


För implicit-etablerande för-smoothing finns också samples speglande de viktigare användningsområden det hela förbereds för. Ex. är en av alla sample ett falskt sample utnyttjande samförekomst i vänner i Blue light d.v.s. just där de färdiga värdena hanteras. Bättre hade jag egentligen antagligen där viktigast med Blue light intensity men eftersom Blue light precis uppdaterats från optimerat tämligen liten till stor (kanske 100 000 typer tlll för första två värdesiffror 11 miljoner) var det ej gjort och praktiskt tämligen tidsödande om en ej på nivå med detta. Det gör nu små-värden på alla kombinationer som förekommer där och trots att varje relation oviktat förekommer exakt en gång varierar de något därför att det är samförekomsten mellan vänner resp. nod har (indirekt en väldigt förenklad similarity-operation).


Blue light sample får Hans-faktor på 0.409666347738257 vilket eftersom endast beroende av typer - ej summa - endast speglar antalet kombinationer beaktade. Det avviker från hur jag egentligen hade önskat det med kanske större bestraffning neråt naturligt från början förväntat både av den och kanske 4 - 6 andra "smoothing-samples" där vikt av förekomst-antal är mindre viktigt än att relationen skapande ett PAB sample faktiskt förekommer verksamhets-, forsknings-, eller dyligt styrande i något ekonomiskt kostande eller predikterande sammanhang även om vi ej kan ge det ett viktvärde.


Kanske kan vi kalla denna implicit-etablerande smoothing för modern-fast-internet-smoothin? Mer styrt av övriga smoothing sample än just Blue light. De gör ju ett avsevärt bättre uttryck över en tänkt fördelning än mycket annat när vi för varje sådant kan se att det är en värde med "kontinuerlig-värde-vikt-mening" vettigt styrande tillämpningsområdets fördelningsfunktioner (ex. information retrivial givande en preferens större än rent skattade kombinationer därför att vi vet att det är tydligt samhällsinverkande faktorer och som därför förr eller senare ger avtryck i ex. nyheter - när något gått fel där - ex. dataregister lagar för myndigheter).


För varje sample identifierar vi nu max-värdet. För varje värde vi önskar vikta - till korrekt samarbetsgemensamt magnitud-språk - dividerar vi med max-värdet. Eftersom vi vill ge viss - i alla fall lätt grovt skattad - preferens till mindre sample därför att dessa typiskt bär större vetskap (jämför gärna med hur vi för samma bl.a. behöver reducera antalet tydligare ör ej uttryckt per relativ-frekvens i närmare traditioell användning därför att symboler / typer ej är resp. kombination: mycket enklare men mindre flexibelt användbart) multiplicerar vi med (1 - Hans-faktor) d.v.s.


(1 - Hans-faktor) P (nuvarande kombination ) / P (största sannolikhet över i resp. sample förekommande samples)


Notera ovan skillnaden mot om vi snarare görande det för färre sample-grupper och utan pre-sample-smoothing-filerna låter det värdera mot original-värde eller om vi så vill i distans från ett. Hade vi gjort så hade antagligen något del-moment efterföljande reducerats men hade kanske - tycks så för mig - minskat värdet av vår implicita-smoothing genom att sample stora kombinationsrymder inkluderande ex. i nyheter oftare mindre vanliga kombinationer men i själva samhällsstrukturens kunskapsbevarande representerande en viktig faktor fortlöpande påverkande nyheter vi ser givande bättre fördelning på smoothing ovanliga kombinationer mellan ovanliga A och B.


Och oavsett hur praktiskt tycks det elegant fungerande utgångspunkt bör vi räkna och utgå från att en faktor funktion av värde-förekomsterna (d.v.s. närmare entropi som funktionellt mer "core-human" än som indirekt approximerat via dess uttryck i vårt språk via ordens samförekomst) krävs.


Samt no doubt at all en vid sidan om totala antalet samples värdering med varandra till ett värde - bland dessa ej mer värderat än något annat - skattat PA * PB för att få bort abnorma out-liers topp 10 - 50 000 (givetvis oerhört beroende på sample-storlek: det tycks för mig att det praktiskt från att små-tittat manuellt i några mindre filer normalt snarast slutar att vara problem egentligen snarare topp tio till 20 bland de minsta och kanske aldrig är det när vi går över 40 - 60 MB men vi förlorar ej något om jag ej tänker fel på att anta att det sträcker sig ner åt 5% för genomsnittlig storlek på filerna d.v.s. 500 MB ungefär och topp 10 000 - 50 000) för resp. sample,


Hur som helst bra värden och mycket snabbt jämfört med de alt. genom att kombinera flera smoothing och back-tracking algoritmer mer anpassade ex. statistiska parsers för språk.


Sådant här bökigt brukar jag vara jag genom svagheter i min personlighet finna svårt att dela när jag löst när så konkret. Men här upplever jag vis av erfarenhet att en hel del för-viktande jag plockar bort antagligen påverkat en del i viktfunktionerna vilket korrekt utvecklande för ev. person att lösa samma sak bör ge åtminstone rätt utgångspunkt för en del personliga utmaningen hoppas jag. Problemlösning är endast korrekt samhällsbyggande långsiktigt när en sund utmaning och arbetsinsats finns och här finns helt säkert mycket lokalt beroende misstänker jag färdigt att explodera för mig nästa gång jag gör det såväl tillämpning här.