Visar inlägg med etikett RSS. Visa alla inlägg
Visar inlägg med etikett RSS. Visa alla inlägg

Internet-spam: Uppsala Universitets media-farmar resp. Google Font Search utsatt för pågående omfattande manipulation

2014-05-09

Konceptet länkar i sökning har en del värden så väl som begränsningar. En tanke som kom till mig betraktande "läsar-reaktioner" var att problemen jag hade åtminstone en period med att klara att söka på konceptet Wikipedia (ex. tekniska analyser eller studier beteende) kanske (andra förklaringar tidigare föreslagna är nog nästan mer troliga) är att jag själv tenderar att addera Wikipedia i ankarteext:


  • Vilket sker för att tydliggöra för läsare var de hamnar.
  • Medan det inte direkt är en liten minnesanteckning för vad jag vill söka relaterat titeln på ankartexten tillsammans med Wikipedia som sökord förstärkt.
  • Vad jag referenslänkar i inlägg är ju långt innanför zonen av material jag hittat till och har metoder att söka (ex. för Wikipedia ofta direkt i den eller via URL).

Vad Google Font Search värderar och påverkan ranking vidare till webb- och nyhetssökning

Ett till problem kan vi se för Google Font Search. Eftersom kultur att länka med meta-information om inlägg och sajter rörande sådant är de antingen inte alls del av algoritm eller ej tillämpade så att det märks. Indikerar du t.ex. att visning kan ha värde via arial är Google robot:en benägen att ofta tro på det. Problematiken liknar den som förr (åtminstone ett mycket mindre problem idag) fanns med för surfaren osynliga länkar.


Kanske är Google Font Search och dess sekundära inverkan en del andra index förklaringen till en del länkar likt dessa jag uppmärksammade kontrollerade att exporten gick som den skulle (länkar extraherade från RSS-strömmar etablerade testdata inför skapandet Minimalistiskt sido-algoritm-skiss beräknande läsare nyhetsmedier):



Eller gissningvis något tekniskt problem. Jag tittade inte så noga. Det märkte dock ut sig med precis över en sida med Emacs satt till font sex bland de kanske 500 000 till 1 000 000 första "länk-händelserna" exporterade. Jag tror förövrigt inte så mycket krävande en massa utökad parsning i annan mening än att ta bort inverkan mer än tvingat. Allt kostar både i beräkning, utveckling och defekter som av och till slår till. Och om någon sökmotor fonter finns (och det kanske det gör) har jag inte hört om den.


Utökad information: Egentligen trodde jag inte något ev. liknande Google Font Search fanns även om sjlva konceptet inte var vad jag uteslöt.

Dock finns Google Fonts vilket kanske är ett ex. för den hos större internet-företag när de åldrats några år och går bra ibland återkommande fascinationen för information föregripande internet likt tryckta magasin, böcker, fonter m.m. Hos AOL havande mer tidigt i det konkretiserade - varorna - kan vi omvänt se sista åren allt mer intresse data man kan hitta på nätet (inklusive köp Alexa, diverse tjänster, en (medium sized) big data katalog. Jag tror hur som helst inte dessa fonter påverkan ranking och betvivlar mycket effekt utanför frågor relaterat språk-detektion, och grov skattning vilka som egentligen kan läsa det.


Uppsala Universitet: Fortsatta pågående angrepp mot yngre över nätet

Yngre vuxna kan bli ekonomiskt utnyttjade.

Bland de första exporterade jag tittade på manuellt fanns få sajter med .se domän länkade. Det är mycket förväntat eftersom det nu knappast var mer än en miljon i filken (och kanske neråt 400 - 500 tusen) och det är primärt engelskt material samplat. Emellertid märker internets-hungrigt länksökande ut sig. Och vi har nedan exempel med en på ytan seriös aktör som tycks ha byggt någon form av "media-farm" (jag antar att det är en avancerad form av länkfarm).


Fear and self-loathing in Uppsala.

Tråkigt nog känner jag inte att det är ovanligt. Så fort det är valtider eller debatt om anslag till forskning resp. betalning för studenter dyker det upp en massa media farmar hos Uppsala Universitet. Surfar man på en av deras många sajter utspridda länkande varandra (vilket jag gjorde i Några bias från en enkel web spindel) kan vi konstatera att yngre-vuxna utan ex. min längre gedigna erfarenhet av internets problemområden utsätts för omoraliskt överdriven marknadsföring (och kanske sammanblandad med någon sjuk självhats-sekt):


"UKÄ presenterar idag sin utvärdering av biomedicinutbildningar. I Uppsala fick masterutbildningarna i forensisk vetenskap och molekylär medicin toppbetyg medan fyra utbildningar i infektionsbiologi och biomedicin kritiseras.

21 utbildningar i landet inom biomedicin har granskats av Universitetskanslersämbetet, UKÄ. Kvaliteten bedöms som vanligt efter en tregradig skala: mycket hög kvalitet, hög kvalitet eller bristande kvalitet. Nio av utbildningarna får högsta betyg medan tolv får omdömet bristande kvalitet och blir därmed ifrågasatta."

Från: Utbildningar inom biomedicin får ris och ros | Uppsala Universitet


Jag kan bara föreställa mig hur mycket media-synlighet de lurat till sig i Kina, Tyskland m.fl. länder.


Och vi kan konstatera hur deras övergripande boss - den s.k. "rektorn" - inte tvekar att kapitalisera på ungdomsfylla för att gömma undan de annars tråkigare aspekter man tråkigt nog riktigt för de flesta yngre bedömt att utländska studenter kan värdera:



Och det var inte ett besök på restaurang planerat utan "Idag, första maj, deltar vi i majmiddagar på olika nationer.". Riktigt otäckt.

Även om man kan förstå att en liten aktör är desperat gör Uppsala Universitet titta hur världens större aktörer inom business area: sell customer student the college / universty. Jag ser då ingenting likt Uppsala Universitets media-farmar där - och när alls försvarliga steg från kunderna - eller något alls liknande deras länkning krävande viss manuell-insats så att saker kommer igång lite snabbare.


Det är varje publicist ansvar att minnas vem som är eller kan vara läsaren. Är det mycket troligt fler i antal prospekterande studenter - d.v.s. yngre vuxna - gäller ett större ansvar och man kan inte uttrycka sig som blivit kultur i mötet de politiska systemen där sådant här gillas lite.

Att hantera underliga datum i RSS-strömmar just nu och förberedande inför en mer korrekt framtid

2014-05-08

I fortsättning på tidigare publicerat kring spindling efter RSS-strömmar resp. initial inhämtning data där övriga publicerade innan de fyra föregående kan hittas i dessa:



En ganska vanlig idé är att vår tid är begränsad därför att vi föds och dör och att det är viktigt att hinna med väldigt många. Andra menar att det kanske oftare leder till höga kortison (kortison hellre än kortison kan passa bättre givet den medicinska kopplingen oavsett biologiskt snarare än syntetiskt ursprung) med förtidig död och försämrad livskvalitet som resultat.


Lösningen på problemområdet kan ibland vara (vill jag röeslå) att ta sig an något troligt i framtidens historia lagom gigantiskt men medan det genomförs inte överdrivet stressat (när fungerande idellt medan vi alla vet hur det ofta blir det mesta mänskliga). Vi minns ju från skolans undervisning i historia att nästan vad som helst relativt dagens mått mätt rena trivialiteter kan bli del av obligatorisk kunskap när den anses vara del av en gemensam kulturellt grundförståelse snarare än förhoppningsvis att någon tar den icke-vetenskapliga forskningen i dessa ämnen som att tolka ut och driva teser "vetenskapligt" om vad som skett bakåt i tiden med jämförbara krav jämfört vetenskap (hard science) i ämnen likt kemi, fysisk (utanför den "utsvävande teoretiska" som börjar när försök ej kan avgöra om hypoteserna är korrekta d.v.s. tvingande fram metoder tämligen lika ex. historia: från några saker sekundärt noterade i rest-effekt försöka göra en teori trolig eller ännu bättre utan bias söka en god teori).


Men hur förstår vi när något egentligen inträffade i historien? Befann jag mig där och såg det inträffa har det mycket högre trovärdighet än när resultatet av det inträffade själv försöker göra troligt för mig att det inträffade vid en tidpunkt. Betraktar vi detta (ett ex. från en vid varje tidpunkt aldrig helt ovanlig förekomst) ser vi att det försöker påskina att det inträffade i framtiden trots att det uppenbart är felaktigt:


Thu, 04 Sep 2031 0:00:00 CLT___http://www.goreloslagos.cl/resources/downloads/rss_es.xml___http://www.goreloslagos.cl___Noticias - Gore Los Lagos___www.goreloslagos.cl___en_osorno_se_realiz___la_primera_sesi__n_del_consejo_regional_de_los_lagos _TITLE___HH____En Osorno se realizó la primera sesión del Consejo Regional de Los Lagos___GG____URL_STORY___HH____http://www.goreloslagos.cl/sala_prensa/noticias_det/690___GG____DESC___HH____A la cita asistió el subsecretario de Desarrollo Regional, que recogió las sugerencias realizadas por el Consejo Regional.___GG____PUBDATE___HH____Thu, 04 Sep 2031 0:00:00

Det är förövrigt det mest extrema fallet av en serie underliga tidsförskjutningar från samma entitet vilka i ett "stickprov" från de första 900 000 av antagligen cirka 40 - 50 miljoner RSS-strömmar där övriga tänkbart kan innehålla några "senare inträffade" publicerringar.


Men som sagt är det inte helt ovanligt även om det är mycket mer "normalt" att saker inträffar några månader in i framtiden.


Samtidigt gäller åtminstone i min import där jag står just nu (framtida importer hanterar givetvis en del av detta i den mån kontroll om någon månad indikerar det meningsfullt att addera parallella lookup-dimensioner för att göra möjligt att kontrollera) kan inte avgöra om inlägg publicerade ex 2014 fram till idag egentligen publicerades säg 2000 till 2013 men satte datum felaktigt.


Och också om jag filtrerar bort uppenbart rimligt orimliga datum tillåter jag förnärvarande år ganska långt bak i tiden innan RSS var vanligt eller ens förekom. Orsaken är att jag upplevde mig minnas att ett par stora entiteter översatt publicering via annan kanal till RSS med samma aktuella datum och önskar följa upp det när i databas innan ev. radering om ej så eller problemområdet i övrigt tycks betydelsefullt (troligen är det för aktuella år säg från 1999 till cirka 2004 försumbart även om API varken för dem eller ett antal år i framtiden tillåter användning exponerat annat än totalt "dumt" tidsoberoende tillstånd).


Några exempel på år från de första 900 000 som ej tilläts utan gick i filter. Ett ganska uttjatat begrepp i och med betydelsen sociala media när de kan översättas till entitet har för påverkan sökmotorer är domäntrust. Men möjligen givet negativa stereotyper kring "universitet i solen" m.m. kan vi kanske (och kanske vad som när mer import är gjord visar sig varken mer eller mindre korrekt än för andra universitet) tänka oss att detta var mer förväntat för University of Hawaii än för (också universitet i solen faktiskt) Stanford (men IT-iinovativ-marknadsförda Palo Alto vilket tänkbart balanserar sol-slappa stereotyper) eller Harvard närmare den regniga östkusten.


Wed, 01 Jan 1964 00:00:00 GMT___http://scholarspace.manoa.hawaii.edu/feed/rss_2.0/site___http://scholarspace.manoa.hawaii.edu:80___ScholarSpace at University of Hawaii at Manoa___hdl.handle.net___pa1_013 _TITLE___HH____PA1-013___GG____URL_STORY___HH____http://hdl.handle.net/10125/32782___GG____DESC___HH____Box of 942 index cards of plant and animal names, labeled "Marshalls." Given in indigenous languages, English, and Latin. Digital versions provided as tiff, jpg, pdf.___GG____PUBDATE___HH____Wed, 01 Jan 1964 00:00:00 GMT___GG____URL_COMMENT___HH____

"ScholarSpace is an open-access, digital institutional repository for the University of Hawaii at Manoa community. ScholarSpace stores the intellectual works and unique collections of the UH at Manoa academic community and also provides a permanent web location for those accessing these resources. Click here for more information."

http://scholarspace.manoa.hawaii.edu/



Och vi noterar vid manuell-kontroll att aktuell datasamling vid University of Hawaii kan argumenteras handha datum fullt korrekt. Och ett utmärkt (men ej planerat) exempel på entiteter jag ade för mig lade ut väsentligt data med datum i RSS satta utifrån när publicerat förr och ej när publicerat i RSS:


Från: http://scholarspace.manoa.hawaii.edu/handle/10125/32782?show=full

Öar och jämförbart geografiskt i resurser och infrastruktur begränsade entiteter med få möjligheter att ta stabilitet av ett större land är vad jag riktat låtit spindel söka RSS strömmar från publikationer associerade till. De är intressanta att se till att man får med eftersom de av och till kan bli mer flexibla i vad man tillåter för att säkerställa typiskt ekonomiskt stabilitet.


Därav att vi har försvarlig mängd tjänsteleverantör inom "utökad" banksekretess lokaliserade i dessa regioner. Och i all accounting särsklt när ränta ska beräknas eller när AI intelligenser söker transkationer i Swift efter handel med länder under bojkott eller relaterat terrorism (resp. än mer kritiska vid inloggning mot deras nätlösningar) är tidsstämplarna viktiga.


Men knappast verksamhetskritiska i RSS för publicister i regionerna. Jag inaser förövrigt att jag tog fel på ursprunget och att detta nog inte är den "ö-nation" jag fick för mig var aktuell men exemplet kan ha värde ändå om inte annat för att visa upp höjden på min kvalitetskontroll och hur jag vanligen inte irrationellt döljer mina fel för läsaren (det är ju viktigt när ungdomar och yngre vuxna kan tänkas läsa vad man skriver som på nätet att ej glömma att man är ett föredöme - dessutom på plus-sidan sparar jag in tid på att ta bort redan skrivet). Hur som helst är ev. problem snarare än hälsa runt det mentala diskuterade möjligen Alzheimers sjukdom eftersom man nu tror sig befinna sig ett antal år bakåt i tiden:


Wed, 31 Dec 1969 19:00:00 -0500___http://www.countyofperth.on.ca/fileBin/news.xml___http://www.perthcounty.ca___Perth County___www.perthcounty.ca___perth_county_ems_hosts_emergency_workers_mental_health_workshop___heroes_are_human _TITLE___HH____Perth County EMS Hosts Emergency Workers Mental Health Workshop - Heroes Are Human___GG____URL_STORY___HH____ http://www.perthcounty.ca/page/news&iArticle= ___GG____DESC___HH____Perth County EMS Hosts Emergency Workers Mental Health Workshop - Heroes Are Human    Share On Twitter___GG____PUBDATE___HH____Wed, 31 Dec 1969 19:00:00 -0500___GG____URL_COMMENT___HH____

"Welcome!
To the County of Perth
A vibrant, rich agricultural community, diverse in its heritage and culture. The County will strive to efficiently and measurably deliver excellent services and work to strengthen the capacity of the local municipalities that Council represents."

http://www.countyofperth.on.ca/



Sista exemplet är del av en försvarlig mängd inlägg i RSS-strömmen alla "publicerade Wed, 31 Dec 1969 19:00:00".


En till aktör med ett filter-belastande stort antal publikationer 1969. Varav det första (givet året och konceptet "love" inte otroligt något hippi-relaterat kanske inkluderande hasch-knark och naken-dans):


Wed, 31 Dec 1969 16:00:00 -0800___http://www.ppt.org/announcements/index.rss___http://www.ppt.org/announcements___Pittsburgh Public Theater - What's New___www.ppt.org___shaw_s_sparkling_comedy _TITLE___HH____Shaw s Sparkling Comedy___GG____URL_STORY___HH____http://www.ppt.org/pages/shaws-sparkling-comedy___GG____DESC___HH____In this sparkling British comedy directed by Ted Pappas, love and marriage are the targets of George Bernard Shaw s celebrated wit.___GG____PUBDATE___HH____Wed, 31 Dec 1969 16:00:00 -0800___GG____URL_COMMENT___HH____

WELCOME
TO THE PUBLIC!
Welcome to Pittsburgh Public Theater, contemporary theater in the heart of downtown Pittsburgh's Cultural District. With our unique three-quarter thrust stage — the audience surrounds the actors on three sides — The Public offers intimate, engaging, professional theater.

http://www.ppt.org/



En till från årtiondet av riktigt dåliga polis-serier på televisionen. Om det är mer förtroende eller inte att en leverantör av mjukvara var med redan på 1970-talet är en fråga jag upplever kognitiv dissonans runt men just här fick jag för mig att det var en anpassning avsedd att köra på ett Windows kanske från Microsoft vilket mest känns underligt:


Thu, 01 Jan 1970 00:00:00 -0500___http://www.Acrocat.com/rss/en/news_rss.xml___http://www.Acrocat.com/bbs___Acrocat Software Announcements___www.Acrocat.com___acrocat_software_releases_pdabs_3_0_18__windows_ma _TITLE___HH____Acrocat Software releases PDAbs 3.0.18 (Windows/Ma___GG____URL_STORY___HH____http://www.Acrocat.com/bbs/forum_posts.asp?TID=665___GG____DESC___HH____Acrocat Software releases PDAbs [Desktop Component] Build 18 (v3.0.18):Enhancements \ Bug FixesEdit dialog was populating incorrectly. (#35)Manage Clients dialog drop down list updated t___GG____PUBDATE___HH____Thu, 01 Jan 1970 00:00:00 -0500___GG____URL_COMMENT___HH___

Här reflekterade jag kort om det kanske fanns mening i hur datum var angivet? Är det tänkbart att dokumentären gjordes januari 1984 (Diktaturen mellan September 11, 1973 till Mars, 1990)) enligt Wikipedia för ett par konkreta händelser):


Thu, 03 Jan 1974 00:00:00 +0000___http://www.journeyman.tv/rss.php?id=1___http://www.journeyman.tv___Journeyman Pictures :: Documentaries RSS___www.journeyman.tv___inside_pinochet_s_prisons _TITLE___HH____Inside Pinochet s Prisons___GG____URL_STORY___HH____ http://www.journeyman.tv/?lid=8946 ___GG____DESC___HH____Inside Pinochet's Prisons - 30' '' - 3 January 1974___GG____PUBDATE___HH____Thu, 03 Jan 1974 00:00:00 +0000___GG____URL_COMMENT___HH__

Hur hanterar vi det i framtidens filter?

D.v.s. publicerat nu men kommande från framtiden. Antingen p.s.s. som inläggen kan eftersökas databas just nu d.v.s. kontrollera om de förekommer med titel och innehåll redan innan tagit vid tidigare tidpunkt.


En tror jag egentligen mer stabil lösning men mer kostsam än jag just nu ser rimlig är att utgå från att något dyker upp i RSS-ström vid tiden ti oavsett om ti är rimlig och innehållet ej noterades i RSS vid tidpunkt ti-k då orimlig ej innebär att innehållet ej publicerades vid någon annan tidpunkt föregripande ti.


En nyhet kan exempelvis publiceras 2014-01-01 men ej komma i RSS oavsett samma entitet eller annan förrän senare kanske 2016-01-01. Att spindla nätet vid sidan om detta - eller utnyttja sekundär tjänst för detta i samband med kontroll av tillförlitlighet av entiteter - är en lösning.


Ett mindre krävande mellansteg är att spindla varje URL ett inlägg i RSS pekar ut. Detta är förövrigt mindre krävande än man kan tänka sig därför att en försvarlig del av värdet hämtande data via RSS medför kommer av att man skjuta på utmaningen att parsa html-sidor godtyckligt gjorda medan nedladdningstid resp. svarstid ej är väsentligt (i min erfarenhet) sämre för html utan tvärtom när ej tjänster motsvarande ex. feedburner.com används är ofta RSS långsammare (vilket är logiskt i perspektiv från publicist). Utökad kostnad inhämtning data detta medför behöver därför inte vara avgörande när det görs samlat vid diskreta tidpunkter kanske ett par, tre dagar eller kanske rent av en vecka i taget medan kostnad kvalitetskontroll är noll under antagande att hemsidor aldrig ändras och varje motsvarande nyhet alltid kommer se ut som en gång publicerad eller också förenlat men fungerande för möjligen tillräckligt antal för att göra lösningen rimlig att samma URL kan ses som indikation (i vilket fall vi egentligen inte behöver spindla men upparbetad historik är ju själva saken här om man vill utöka kontroller: kostnaden att spindla ifatt ett gigantiskt antal inlägg är abnorm vid vilken tidpunkt som helst).


Jag minns förövrigt från många år tillbaka i samband med en inkludering i Google News för en publikation ägd av mig att del av kraven där (och antagligen för RSS-strömmar rörande Google i övrigt ex. bloggsökning) är tillgänglighet i båda kanalerna RSS och vanlig HTML för Google-robotarna.

Resultat spindling efter RSS- och ATOM-strömmar

2014-04-27

Det huvudsakliga syftet med sista "spindla efter strömmar" (när refererat rss-ström avses vilka som helst strömmar oavsett RSS eller ATOM resp. version) projektet var att öka mängden blogg-strömmar (och på vägen dit nyhets- / pressmeddelande-strömmar) på .edu-domäner eller övrigt inriktat forskning. Spindlingen utgick från alla pressmeddelanden publicerade på EurekAlert! fortfarande i Breaking News.


Robot dumpade hittade länkar tidigt i samma fil och längre fram när jag började tråda den i filer med slumpmässigt namn. Vidare sattes ett stopp-värde per domän parametriserat vid start d.v.s. vid varje återstart eller att tråden börjar om (för att slippa hålla mycket stora mängder länkar gjorda eller att göra) är det inte självklart att de länkar först skrivna till fil för en domän tas först utan ordningen ges av filerna sorterade efter namn.


I skärmdump framgår ordningen filerna för redan besökta resp. identifierade länkar läses in. Rörande parametrisering anger första siffran antalet besök på domänen som tillåts, andra hur många länkar att besöka som tillåts ligga i minne (kan praktiskt hamna något under resp. över), tredje parametering vad som ska finnas i länken för att den ska besöka (eller tillåts resp. allt ska finnas) samt den fjärde ej i bilden omvänt från den tredje d.v.s. vad som ska uteslutas.

Utifrån tanken diskuterad i:



Införde jag möjlighet att parametrisera vilka undermängder av identifierade länkar en tråd ska prospektera. Bl.a. lät jag trådar gå tämligen länge (kanske 10 - 48 timmar totalt) för:


  • Just Blogspot.
  • Wordpress.com resp. Wordpress förekommande i url.
  • Typepad.com
  • .edu inkl. .edu.
  • .gov inkl. .gov.
  • .mil inkl. .mil.
  • .org inkl. .org.

En relativt övrigt kortare tid men med vid den tidpunkten startad (sista 25% av tiden robotarna vandrade nätet) snabbt expanderande i antal hittade rss-strömmar: .com (minns jag rätt ej inkl. .com.).


Samma trådar efter att de kommit igång med att besöka tidigare identifierade länkar.

Exakt som jag förväntat från när jag skapade första proof-of-concept versionen av sökmotorn gäller att spindla efter RSS-strömmar är vekt inom flera områden med viktiga newsprovidera:


  • Att utgå från <link ...> levererar ej och när det leverar en försvinnande liten andel.

Istället behöver man spindla efter länkade undersidor och där suga upp länkar (jag begränsade till länkar och intrycket är att det täcker upp de flesta även om några endast skriver dem i text) till RSS-strömmar man publicerar. Detta gäller särskilt:


  • Amerikanska .gov och .mil sajter.
  • P.s.s. som föregående en del nyhetstidningar.

Vidare besläktat men när man väl hittar motsvarande blogg fungerar ofta <link ...>:


  • Bloggar som enskilda medarbetare, organisationer m.m. har "undangömda" långt in i spindlings-väg relativt endast enklast domän-namn.

I detta spindlings-projekt sökte jag endast <link ...> medan jag vid ett föregående också analyserade länkar för att söka avgöra om de ev. är RSS. Det första projektet gav ordentligt fler RSS-strömmar men införde också diverse felaktigt antaget RSS som ännu ej filtrerats bort (bl.a. en del sitemap-länkar).


Trots att .gov och .mil prioriterades i timmar blev andelen RSS-strömmar levererade försvinnande få och inte mer än cirka 10% av vad jag lade till manuellt genom att gå igenom de viktigaste sajterna (ex. resp. vapengrens huvudsida för .mil med ex. site-sökning med Google) , tjänsterna (ex. tjänster för varningar rörande väder - ex. tsnunami-alert - o.s.v.). Det understryker hur begränsat <link ...> är.


Riktad spindling mot URL inkluderande news och/eller press levererade vettigt och tämligen högt men prioriterades relativt ordentligt mindre än övrigt. Bäst resultat i antal identifierade strömmar gavs av självklara orsaker när Blogspot, Wordpress och Typepad prioriterades. Dessa prioriterades vidare ordentligt i tid utifrån tankarna diskuterade i:



Totalt tycks 147 172 RSS-strömmar identifierats. En del är antagligen defekta bl.a. av följande noterande orsaker:


  • Angiven men används ej. D.v.s. man har växlat url någon gång men ej förändrat vad angivet alt. att den ej fungerar just när jag kontrollerat.

Den initiala start-noden EurekAlert! gav så länge jag körde en hög andel strömmar relaterade forskning. Men vilken andel det är av totalt identifierade domäner vet jag ej och har ej kontrollerat hur stort det totala antalet identifierade (spindlade eller inte) domäner är.


Trådar pollande RSS-strömmar. Den eller de parametriserade först inkl. EXTRA hämtar från vad som identifierats i diskuterad spidering. FAST särskilt prioriterade avseende bl.a. nyhetstjänster likt ex. Reuters eller New York Times (och dessutom inkluderade sådana manuellt adderade oavsett ofta uppdaterade). ALL avser en ganska stor lista skapad genom tidigare kontroll av alla sajter där det för mig är känt med ganska hög tillförlitlighet vilken entitet de tillhör (utnyttjande tvättat Wikipedia-data): totalt cirka 90 000 strömmar inkl. ett mindre antal (cirka 5000 - 20000) "defekta" strömmar och ATOM- och RSS-strömmar för samma publicering.

Sampling är e diskriminerande från annan aspekt än att det är önskvärt att en hög andel strömmar är på engelska. Och prioritet i manuellt arbete har gjorts för att söka inkludera särskilt politiska entiteter från länder "problematiska" att enkelt från domän identifiera som tillhörande ex. myndighet (ex. Sverige med government.se snarare än government.gov.se jag gärna önskat som synonym eller Japan med go.jp) liksom politiskt "mer bråkiga" länder som Ryssland och Kina. Vidare sker hantering sampling enligt principer som gör att ingen kostnad annat än i tid processing föreligger avseende att "inkludera för mycket" (undantag hantering strömmar där inlägg saknar meningsfull titel där positiv-särbehandling sker på ett antal RSS-strömmar från amerikanska myndigheter eftersom de där av och till berör varnings-tjänster vilka jag gärna vill få med just indexerade).

Spidering av url:er inkluderande news men ej .blogspot eller wordpress (därför de senare har egna trådar).

Sista raden ovanför ett antal = kan ge upp till två siffor indikerande antal länkar resp. antal strömmar identifierade.

Hur jag gärna vill se att domäner relaterat regering eller myndighet indikeras och p.s.s. relaterat utbildning med .edu..

Antal identifierade för några utvalda meningsfulla under-grupper

Totalt tycks 147 172 RSS-strömmar identifierats. Ev. summerar uppgifterna ej korrekt för undergrupperna vilket om så har att göra med logiken för hur resp. grupp tas ut när RSS-strömmarna efter spindling hämtas för att tas ned (typiskt enligt för ex. wordpress: index(lc($url),"wordpress") i Perl). Medan tillförlitlighet totalt andel är mycket god eftersom allt förekommande i filerna med identifierade RSS-strömmar tas in och lagras i hash-tabeller för att garantera unik-förekomst samtidigt som domäner som notoriskt indikerar både ATOM- och RSS-strömmar - ex. Blogspot.com - särbehandlas för att hantera detta).


Självklara blogg-plattformar


Wordpress (Oftast Wordpress.com men allt inkl. wordpress i url-feed
51190
Feedburner
1435
Blogspot (extrahering utnyttjar Google's semantik för hur strömmar namnges men ej en perfekt lösning)
46020
Typepad (inkl. typepad i url feed)
4219

Domäner indikerande meningsfull indelning verksamhet


.edu (inkl. .edu.)
4847
.gov (inkl. .gov.)
799
.org (inkl. .org.)
18179
.com (inkl. .com.)
21430
.mil (inkl. .mil.)
162

Övriga


Alla övriga (ex. ip-adresser)
3152

Google: Feedburner, Youtube och Feedproxy

2014-04-21

Spidering sökande riktat feeds nära entiteter forskning med utgångspunkt pressmeddelanden publicerade via EurekAlert, AAAS gav ett antal strömmar identifierade för Youtube-sidor. Där kunde konstateras att dessa precis som FeedBurner (Feedburner trevligt snabb) var mycket snabba.



Vidare noterades att även feedproxy.google.com märkte ut sig som mycket snabb. När jag testar feedproxy.google.com i webbläsaren hamnar jag på FeedBurner. Förklaring tycks vara att Bloggers egna feedsystem nu är FeedBurner direkt (förändring ska nog tas som trolig skett för flera år sedan utan att jag märkt något förrän nu).


Praktiskt gäller tveklöst att ju fler strömmar hos dessa desto snabbare att polla igenom allt. Konkret märkbart - tydligt - snabbare än vad jag märkt allt förekommande nog i antal för att man ska märka det. Från denna aspekt är ex. blogg på Blogger trevligare än Wordpress (men säger givetvis inget om värde indexering eller som statistiskt mätpunkt varför de lika självklart pollas precis som Blogger).


RSS vs ATOM: FeedBurner

Spännande eller bättre sagt udda / fascinerande nog fick Google ett antal år sedan för sig att blåsa liv i nära nog döda Atom kanske för att inspirera nätets publicister och utvecklare med en till standard att hantera. FeedBurner är här ganska trevlig och vilken standard önskan kan konfigureras till önskan från (om jag inte missat någon ev. konfigurerarbar begränsning feed-ägaren kan ställa) vilken som helst feed-indikerad.


D.v.s. som i exemplet nedan för att säkerställa RSS (Perl och låt oss tänka - oss utan risk att någon oväntat hoppar fram och erbjuder mig en stor summa pengar för att direkt binärt sälja det just då - att jag egentligen gjorde det hela mycket mer avancerat riktigt pressande allt vad standarden och Feedburner har att erbjuda i möjlighet men för läsarens enkelhet valde att skriva något kortfattat):


if ( index($cline,"feedburner.com") != -1 )
    {
 if ( index($cline,'?') != -1 )
 {
     # Tar bort givna parametrar...
     $cline = substr($cline,0,index($cline,'?'));
 }

 $cline = 
     $cline . "?alt=rss"; 
    }

Jag såg förövrigt på Stackoverflow.com (Feedburner RSS url variable for number of items in feed? - mer FeedBurner Stackoverflow) att det ej går att styra FeedBurner till att visa fler inlägg än vad som ges. Om det stämmer är jag inte säker på (har överhuvudtaget inte läst manualerna men funderar på att se över möjligheterna där såväl som från andra källor eftersom FeedBurner tycks riktigt stor).