Visar inlägg med etikett Vikt news providers. Visa alla inlägg
Visar inlägg med etikett Vikt news providers. Visa alla inlägg

Konstanter för kostnad när aktivitet sprids över graf-relationer

2014-05-26

Kostnadsfaktorn för hur en nod kan påverka vidare över epoker alt. via random-walk liknar många andra (bl.a. Google Pageranking som beskrivet tidigt) och görs här för motsvarande koncept-nät som skapas från ett stycke innehåll i indata:



Problemet jag upplever med en vikt skapande en kostnad är att det är uppenbart för mig från dom perspektiv jag haft vad det jämfört med ingen vikt egentligen gör "korrektare" eller tillför i värde i resultatet mer resonerande:


1. Koncept I: Hur vi aktiverar upp resp. stänger ner ej relevant aktivitet vid konvergens till en tolkning

1.1. Jämför vi med hur "omedelbar spreading activation" tycks fungera biologiskt när vi läser aktiveras för ett ord - eller jämförbar enhet mer unison på abstraktionsnivå - ett antal möjliga "fortsättnngar" av det huuvdsakligen med kraftig tyngd från inlärt i första steg snarare än kontext befintligt. Neurolinguistics - An introduction to Spoken Language Processing and its Disorders, John C.L. Ingram, Cambridge Textbooks in Linguistics, 2010: ger en ganska kortfattad sammanfattning av det:



I steg efter med mycket vanlig grundfunktion var helst i hjärnan stängs aktivitet ner i första steget "predikterande aktiverade" relationer ej rimligt relevanta.


Exemplet i citatet är i sig avgränsat till vad lättare att ta upp vid tiden for studiens mätningar: ord där betydelsen i ett kontext ej är självklart. Det viktiga är emellertid att:


  • Tills betydelse gissats troligare i mening att vi sätter tillstånd till det fortsatt framåt tills det ev. går fel givet ny information expanderar vi upp möjligheterna och betraktar dem.
  • När vi gjort comit på en betydelse reduceras aktivitet övriga alternativ väsentligt ner.

D.v.s. det kritiska tycks inte vara just att reducera möjlighet en nod kan sprida aktivitet från dess egen aktivitet. En nod - eller neuron eller bättre konvergens för neurongrupp - signalerar "framåt" promiskiöst och noder där tar upp aktiviteten. Nås interferens för nod på abstraktionsnivå där aktuellt reduceras övrigas aktivitet modulerat stöd från andra system (vid sidan om närmare i neurongrupp mer direkt funktion som välkänt lateral inhibitation).


1.2. Begränsning vad en nod kan påverka med blir tycks för mig från detta koncept mer än fråga om att dess aktivitet ej stängs ner resp. hur långt den kan nå med viss sannolikhet rörande för ett kontext åtminstone implicita relationer via vad vi redan kan om världen resp. avstånd explicit i kontext (ex. om nod är i samma mening, i rubrik direkt innan o.s.v.).


Det är tror jag fel att se aktivitet som stängs ner som ej bidra till konvergens också när de explicit eller implicit ej aktiviterat upp konvergens nod eller nod-grupp på mätbarnivå. Att de ej klarade att aktivera upp något själva över tröskelvärde bär ju "uteslutande information".


2. Hur läser vi egentligen?

Föregående paradigm är jag sedan längd tilltalad av därför det är abstrakt enkelt att förestå och inför ganska få antaganden i sig. Däremot är det inte direkt trivialt i att härleda vikter, låta dem agera funktioner av tillstånd, och kanske mer än något annat utnyttja paradigmets självorganiserade natur väl i vad det kan indikera utan att det kommer till priset av att man för en ganska kortfattad text likt titel, abstrakt och kategorier för en forskningsstudie sitter med över 100 000 aktiverade implicita noder efter några varv givet innan pågående kotnext upparbetat läst innan, personen pågående o.s.v. Att aktivera upp är lättare än att aktivera ner åtminstone när tröskelvärden lämnas.


Men man kan också resonera från hur vi läser och hur det påverkar olika aspekter vi är intresserade av att modulera. Lägger vi en kostnad på hur relationerna kan propagera kan vi ju se kostnaden representeras av sannolikheten när vi betraktar ex. en mening i taget (eller ord för ord m.fl. alternativ) att läsaren slutar att läsa och går iväg för att göra något annat istället. Kanske gå ut för att handla tändstickor för att göra ett tidningsbål.


Men vad innebär det? Antar vi att läsaren läsande innebär att vi se möjlighet till förändring i ett varaktigt globalt tilsltånd för en tänkt population av väldigt många läsare kommer denna läsare bidra med mindre sådan feedback. D.v.s. påverkan och därmed prediktion av hur associera koncept ändrar dimensioner rörande valence, känslor, volativitet, påverkan andra, om de växer eller minskar, och allt annat vi kan söka se blir "stympat".


Men har det egentligen någon betydelse? Möjligen. Men mycket tänkbart har vi likartade begränsningar av andra orsaker mer påverkande:


  • Utgår vi från princip en skribent en läsare för innehåll av typ där detta är ganska rimligt och görande bedömning görligt gäller att vi selektivt kan söka informationskällor ej begränsade motsvarande att läsaen slutar läsa via samplings-kanaler jag åtminstone nu föredrar: feeds (RSS och liknande). Här är när vi exkluderar motsvarande tweets och liknande kort full story i RSS det normala.
  • Antar vi att vi samplar entiteter där samma antagande ej är optimalt d.v.s. tidningar med många läsare eller starka bloggar med många läsare [ vilket är ett bra antagande därför att jag gör så tillsvidare i väntan på att något elegant halvfabrikat ska presentera sig för att ta ut nyheter "visuellt-generiskt" utan riktat letande av mig (i brist på det givet att man har förkortat inlägg i RSS kan man åtminstone normalt se var nyheten börjar på html-sidan medan var nyheten slutar ibland kan vara enklare från mängden terminerade html-taggar relativt där innan påbörjade - kanske i en bättre värld än där vi är: jag har endast prövat det mot Wall Street Journals Japan Realtime som är om jag kommer ihåg rätt ganska ok som test eftersom den stoppar in "icke relevant" inlägget publicerat i strömmen) ] gäller att RSS-ström är begränsad. D.v.s. nängd data att analyserad är ändå reducerad.
  • Vidare för entiteter föregående gäller att återpublicerad endast av titel och kort ingress är mycket vanligt också utanför publikation och där det är från en hel del nu känt från varierade studier lämnande direkt upplevelse av det samma som surfare med eller utan att klicka och läsa hela att också respons i form av tweets (tydligast re-tweets) ej nödvändigtvis kommer med att hela nyheten lästs.
  • Vi har också nu ett fåtal stora tidningar och fler till antal mindre (ev. ungefär det samma i andel) som ej gör hela nyheten tillgänglig utan betala. Ett vanligt system tycks vara (där jag tror The New York Times var bland de första):
    • Vi får läsa ett fåtal nyheter fritt per kalender månad.
    • Därefter förväntas vi betala.
    • Därmed påverkar också tänkbart temporala samband som kan innebära att artiklar i början av en kalender månad blir mer lästa i sin helhet.
    • Emellertid får man ofta också läsa artikeln gratis om man når den via Google. Därmed skiljer sig läsare spontant eller naturligt via den kanaler resp. läsare som fuskar via sökmotor-kanalen för att läsa gratis.
    • Fuskar emulerande en sökmotor-läsare. Spekulativt kan det vara uppmuntrat av publicst påverkande hur de konverterar oavsett den besökaren befintliga per "enhet".

Från vad jag försöker uttrycka är utmaningen att söka uttrycka vad av nyhet som flest ser och upplever än vilka andelar av nyheten någon som konkret sätter sig och börjar läsa den där hela nyheten faktiskt finns tillgänglig. Men här känns det som kanske andra modeller passar bättre än att betrakta över explicita resp. implicita noder aktiverade. Exempelvis läsbeteende där vi uttrycker sannolikhet - eller för något så basalt grovt andelar som betraktar resp. självklar abstraktion från överst titel över ingress ner till allt till sammans - men det är inte självklart för mig hur stor skillnad det egentligen gör (jag analyserar den information i feed och tycks det magert kompenserar jag tillsvidare med fler entiteter att sampla).


3. Och vad vi kan vi missat

Dessa algoritmer med eller utan kostnad tycks alltid konvergera för mig. Det finns matematiskt formalia med härledningar o.s.v. för när det gäller som givet. Ev. kan emellertid gälla att nära kostnaden ses som funktion av parametrar mer globalt för pågående konvergens och nedstängdning (ex. något motsvarande likhet till kraftigt aktiverade nod-grupperna) att det kan lösa egentligen allt önskat i del ett såväl som kanske även om jag för det senare ej ser det själv riktigt det senare.


Jag aldrig försökt låsa det den vägen. Utan mer anammat något ej självorganiserat som tittar till det självorganiserade mellan resp. epok för normalisering, tröskelvärdes-filtrering / nedständning o.s.v.


En generell tumregel när jag känner mig lätt distansierad till ett koncept jag ej prövat kan värde finnas där jag ej har lust att realisera därför att man behöver göra något (kanske enklare och bättre) med ny metod.

Minimalistiskt sido-algoritm-skiss beräknande läsare nyhetsmedier

2014-04-30

Och kärnan i vad det syftar till är ej predikterande läsare i morgon eller längre fram utan läsare samma dag eller rimligen nära i tiden föregående.


Sista punkten är möjligen upplevt intressantare av en hel del från annorlunda (men besläktade) perspektiv och jag tar ut den direkt. Samt adderar en visuell illustration av vad som ibland är ett besläktat fenomen (men som jag ej vet om det är fallet just med ex. jag råkade träffa på igår). I visualisering tänker vi oss att en konceptuell rymd blivit associerad till själva domänen vilket gör att individuellt data där publicerat tenderar att gynnas åtminstone när domänen i sig är sitt eget rum. Det är när så direkta motsatsen till egenskapen önskat för den typ av samplingspunkter indikerade i punkten. Frågeställningen - det potentiella problemet oavsett visuell illustration eller användning indikerad i punkten - är att associationen avser tjänsten som sådan för domänen medan innehållet ej nödvändigtvis är relaterad denna.


"2.0 Och självklart - färre inte fler - avgränsade habitat läsare för mining är bättre. Medan i övrigt förvisso en del fler krävs men ej stora där det kritiska för dessa endast är att fånga när något uttrycks brett utan rimlig varians över resp. habitat. Hence det mest exklusiva är självklart att själv kontrollera ett habitat om man grundläggande är mycket beroende av denna typ av nod-relations information medan vi här klarar oss jämförbart bra med tillgängliga utan att ex. känna behov av att försöka hitta pengar nog för att köpa Wordpress.com, Blogspot.com eller liknande inte helt olikt vad primärt tänkt här."

[Red. Referensen köpa Wordpress.com ska inte förstås som att det är ett tänkbart alternativ utan mer humor kanske. Jag har flera gånger genom åren försökt övertyga Matt m.fl. jag upplevt associerade redan utan att lyckats. /HH[]

Google.com: Illustration punkt 2.0. Association (tänkbart) mellan domän och sökords-clustren relaterade sökningen påverkande undersida visad och relativt konkurrerande undersidor samma domän resp. andra domäner.

Komplettering: En komisk detalj är att oavsett hur föga läst ett tydligare tråkigare inlägg mest skrivet för egen bearbetning typiskt är gäller att nära nog hur föga indikerat eller undangömd en sido-notering relaterat SEO är i det tenderar det att ge viss mycket enkelt mätbar reaktion under en efterliggande period av upp till cirka en månad. Av det förstår vi att den enklast mest framgångsrika webbaffären enkelt tänkbar är den som ger användaren läsare (jämför ex. med just Google) eller motsvarande internet-värde (ex. editor / skribent status i Wikipedia). Därmed inte sagt att det just är en metod att lära känna någon eller något nytt på internet :-)

Jag tog förövrigt inte med först tänkta algoritm nedan. Texten var endast för att tänka så när utgångspunkten tänkt avslutades det. Ev. kan jag av en del upplevt förolämpa läsare som skrivet. Det för de som de berör ska inses för uttryck för en hos dem mycket osäker självbild snarare än något besläktat hos mig. Riktigare ska förstås som en hyllning till läsarens visdom varande alltid min ledstjärna här i livet.


Vidare föranledande mini-alg.-kompletteringen är att antalet entiteter hanterade i mening att innehåll hanteras in i datalayer expanderar kraftigt vilket gör mappning mot läsare via andra metoder ganska begräsnat (resp. p.s.s. görande approximationen att värdera varje publicist snarare än läsare som ett mindre funktionell vilket tillsammans med andra viktsystem är funktionell "ner till" cirka de 10 000 - 15 000 största nyhetsmedierna på engelska).



1. "Easy" news-entity trust



I proof-of-concept motsvarande "fysikernas" lilla konstant men i FL ett eget
universum. Vi gör här något mer sofistikerat men ej överdrivet och utgår från:



1.1. Särskilda på domän identifierbara kan antas i rimlig utsträckning
representera: En individ.



1.2. En individ har per diskret tidsenhet betraktad en viss tid denne gör vad
läsare bör göra.



1.3. Individ kan dessutom söka för byggande referens-vetande eller ofta nog
argumentation eller illustration om uttryckande.



1.4. Vi är endast intresserade av det första för tänket här men ser det senare
ej som särskilt filtreras i någon textanalys-mening.



1.5. Vi identifierar läsande och därefter baffled, sur, utiliserande i
low-impulscontrol, larmande eller liknande typiskt i sig onyttigt beteende
läsaren gör genom att betrakta tidsfönster.



1.6. Potentiell risk tidsfönster är auto-publicerande där jag är osäker om det
är en läsare eller ska bort. Ev. kan jag sätta en brutal snabb id för identifikation
och innan för läsare habitat filtrera bort uppenbart förkortade strömmar
(filtrering naturlig för vad som är planerat att utilisieras).



1.5. Här - helt tänker jag i analys separerat projection describe -> do - är
vad läsaren säger ointressant. Kritiskt dock:



1.5.1 Att dimensioner till news-id i HH-NOSQL ger lookup per genuin
länk. ID i sig fick det ej och de känns redan ganska långa även om jag
inte vill utesluta att det ev. snabbar upp BDB skapandet eller i alla
fall inte slöar ner det. Men en av kanske 20 räknande alla koncept och
symboler som en snarare än de miljoner det maximalt kan bli när språket
orkat i fatt till allt existerande BL.



1.6. 90 miljoner frågan här är om koppling cognition mellan REWARD och attention
där förnärvarande attention endast existerar abstrakt och ej ens nära konkret
eller implementerad modell är meningsfull:



1.6.1. Värderar vi attention som andel?



1.6.2. Och är en som ex. notorisk Wikipedia engagerad värderad mer eller
mindre när mer tid regelmässigt prioriteras? Och om så vill jag - är
det värt det - att skapa ett tillståndssystem för historik i nuvarande
version? Vi säger nej där för att hålla initialt enkelt.



1.7. 900 miljoners frågan - och betryggande nog är vi nu mycket mer i inarbetad
core-funktionalitet i andra tmp. delar - är om reaktion, attention, läsande
o.s.v. speglande / indikerande större andel DESCRIBE läsande eller indikerande
att åtminstone inte endast DO läsande och reaktion (det senare får jag erkänna
till min irritation ofta nog genom åren är mycket vanligt hos reaktions-benägna
läsare) är möjlig utan ev. indikation att de faktiskt läst mer än titel, lite
ingress, och kanske läst en bild.



1.7.1. Det är ev. intressant återkopplande feedback för referens-checkup.



1.7.2. Men här kan vi ej värdera det utan vetskap mer om hur folk läser
jfr läsande som effect population än jag har just nu även om det lätt
nog kan tas ut effektivt.



1.7.3. Viktigare är headline (DO bättre sagt i analys mer än löpsedel
mening) i sig i bra mycket av all mening vad som är
grejen betraktande prediktion snarare än DESCRIBE -> PROJEKTIONERNa.



1.7.4. Vidare värderas DESCRIBE upp ges väl en del referens.



Inte otroligt ska dock DESCRIBE värdering till men vi lämnar det nog bäst
initialt så en utgångspunkt finns utan något som införs och riskerar att bli
atavistiskt.



1.8. Hur gör man med multipla läsande-indikationer i samma reaction-node?
Flera kan indikera att läsaren tänker, resonerar och argumenterar. D.v.s. söker
fram [argument försvarande] någon tanke eller idé de har utan just läst
det. Här särskiljer det från 1.7 givet att DO i 1.7 här blir inte heller
DESCRIBE egentligen utan vad som läsaen upplever har similarity med den cue-
aktivering tanken de har d.v.s. upp-aktiverande noder i dennes gärna nära stämmer
med och ev. med någon föreställande - argumenterande funktion jag ej har i
något regel oavsett modell tror jag. Samtidigt visst. De kanske intresserar sig
runt ex. Ukraina och överläser sig. Särskilt events upplevt lärmande eller
agiterande i övrigt kan läsaren ibland polla.



1.9 Oavsett 1.8 eller ev. en del i övrigt är frågan om analys-materiel är
scarce? om inte kan man ju mer exklusivt kasta bort en del som känns mer än
vad jag tror de har läst för att inte riskera att få bias från Google's sökning
eller liknande via läsaren. Jag kan ev. tänka mig att översättnings-filtrering
är egentlgien rörande mer direkt auto-publicering numera är viktigare än just
antalet länkar.



((( 2.0. Vidare lämnande indikation i 1. är frågan om optimering att ta på länkarna
räcker och/eller förenklar märkbart? Jfr att göra det the good old HH way?
Jag tror vi här för att begränsa mindre i förståelse etablerade
rundgångs-riskområden tar på länkarna givet att de är unika och jag heller inte
känner för separation-probabilistiska viktsystem rörande kollisioner runt entitets-system
jag starkt ser kommer ligga efter att mer direkt nödvändiga story-lookup
existerar. )))



1.10 Donering: Läsaren donerar sin tid. Läsaren reagerar på vad som har
potential. Potentialen är vad vi helst helt slipper här eftersom det skattas
mycket bättre många magnituder korrektare redan. Antal reaktion kan indikera
att personen läser mer. Emellertid vet jag ej nog här för att våga riskera
atavister.



1.11. Låt oss besluta att tillstånd finns. Konceptet här i sig kräver det
per newsprovider så varför inte på allt som importeras från?



1.12 "Problemet" här är sökmotor. Utan dem kan man enkelt med historiken nå
en skattning. Men det är nu läsare i spread som intresserar oss dit saker slutligen
hamnar så det känns lite underligt begränsade att kräva att de just ska vara
regelbundna. Men det är just motsvarande Google News front-page eller klistrade
topics medan riktade sökningar bär risk av resonerande-argumentation.



[1.NN Dummy point for good luck.]



1.14 De tre grupperna läsare i:

http://vcj.sagepub.com/content/5/1/65.abstract#aff-3

http://kodu.ut.ee/~cect/teoreetilised%20seminarid_2011/teoreetiline%20seminar%2019.04.2011/Holsanova_jt2006.pdf
[Red. Förövigt åtminstone en svensk författare - K. Holmqvist, Lunds Universitet, om jag minns rätt.]

Tycks motsvarande ungefär vad vi har resonerat här i reaktion men utan
att de är mängd-kvantierade så att totalen kan skattas från resp. motsvarande
i reaktion focused and general (medan editorial snarare riskerar att oftare
tror jag blandas med risk för sök-bias implicit från större sökmotorer).



1.15 Och mer hemvant från Netrunner prototypen är locomotion i social media
problematiskt p.s.s. "Re-tweeting" kan och är ofta någon läsande - agerande
från - tweet men ej nödvändigtvis vad där indikerat oavsett optimerat länkar
eller via konceptuell BL-rel. Desto ovanligare desto mer läst i mening av att
vi kastar bort all specifik information emellertid känns det ganska osäkert
om inte också bra information om läsande också försvinner för att filtrera
co-locomotion samtidigt om search-beteende för arg. utan läsande
riskerar att störa. Och omvänt lokalt på blogg ju vanligare.



2.0 Och självklart - färre inte fler - avgränsade habitat läsare för mining är
bättre. Medan i övrigt förvisso en del fler krävs men ej stora där det kritiska
för dessa endast är att fånga när något uttrycks brett utan rimlig varians över
resp. habitat. Hence det mest exklusiva är självklart att själv kontrollera
ett habitat om man grundläggande är mycket beroende av denna typ av nod-relations
information medan vi här klarar oss jämförbart bra med tillgängliga utan att
ex. känna behov av att försöka hitta pengar nog för att köpa Wordpress.com,
Blogspot.com eller liknande inte helt olikt vad primärt tänkt här.



HH-NOSQL: Vi avbryter och sätter bättre namn på det. Rebel-As? As för
asymmetric. Domänen har ju tradition av lite flexiblare namn även om jag eg.
inte vet om mongo är en slure som i svenskan. [Red. Men lite fegt as snarare än
uppenbara alternativ.]