Visar inlägg med etikett Web mining. Visa alla inlägg
Visar inlägg med etikett Web mining. Visa alla inlägg

GEOData: Media, Business intelligence, Navigering, Kunskapsorganisation och Military intelligence

2013-02-20

Handledningar media

Guider med ett konkret praktiskt värde för media relaterat verksamhet. Från din mest tekniktrötta kulturskribent eller åldrad IT-chef / redaktör / journalist / fotograf på en döende landsortstidning som känner att det är dags att youtuba vad man gör så att alla Stockholmare kan hitta tillbaka till naturen och harmonin, till också den mycket kunniga som mer än kunskapen kan hitta idéer därför att inläggen speglar just en viktig sida i varför jag bloggat om det när det kommer till det egna värdet.


God Thesaurus för media
Geografisk lokalisering för anpassad presentation på nättidningar
Exempel - "Dashboard" med Geo-information för business intelligence
Geografiskt lokaliserad information för insamling
Satellitbilder för media
Hur mediekoncerner i underrättelseanalys kan visualisera och navigera geografiska data
Kartor från Google Maps i bloggar och webbsajter
Google Earth visar jordbävningen i Kina
Illustrera med foto, filmklipp, kartor, teckningar m.m.


Extern sajt:


Mapping GitHub – a network of collaborative coders | Flowingdata.com
Slides & Thoughts from Hadoop World NYC | Datawrangling.com


NASA World Wind, OpenStreetMap, Google Maps, Bing Maps


Bing Maps: NASA World Wind förutom OpenStreetMaps2012-10-18
Microsoft navigerar stabilt på stormande datahav


Kartor från Google Maps i bloggar och webbsajter
Buzz, webbkameror och foton på Google Maps
Buzz, webbkameror och foton på Google Maps
Google Public Data Explorer för att visualisera statistik om världen
Satsning på skola med Google Geo Teachers Institute
Nytt JavaScript API till Google Maps


Konceptuellt


En stjärna föds i absolut skönhet likt en symbol för universums storslagenhet
Att låta rymden inspirera till en bättre värld
Att navigera spännande tak för nya intryck

Business Intelligence

Äldre tidigare borttagen sida som publiceras igen som kommenterat i Hans rapporterar: Status utveckling, tidsperspektiv, behov hårdvara, finansiering 2013 och om sampling Asien. Relaterat och bättre uppdaterat rörande GEOdata se GEOData: Media, Business intelligence, Navigering, Kunskapsorganisation och Military intelligence.


För avancerad dataanalys finns otaliga system som används inom forskning, business intelligence, underrättelseanalys, trendanalys, medicin m.m. Få av dessa används inom media men kan ge stort värde. Här diskuteras fem möjligheter:

1. Ontologi för att beskriva samband
2. Tidsanalys för att upptäcka vad som hänt
3. Keynote för att beskriva avancerade system med rättigheter
4. Emotionellt läckage är svart magi vackrare än allt annat
5. Formella språk
6. Att mäta nuhet
7. Business intelligence och prediktion från Google
8. Google Image Swirl
9. Geotaggning och geografiska data
10. Visualisering av data
11. Forskning tydliggör riktning för en bransch utveckling
12. Google Public Data Explorer
Appendix A: Övrigt

1. Ontologi för att beskriva samband


Bild över entiteter och deras relationer från dataprogrammet ONT i en superdator lösning från SGI där access kan hyras:

Ontologies (SGI.com)

Att denna typ av datakraft krävs för tillämpningar aktuella i media är inte fallet även om det mycket möjligt att detta kan vara den mer kostnadseffektiva lösningen (svårt för mig att avgöra).

Ontologi handlar om att beskriva entiteter utifrån dess egenskaper och hur de förhåller sig med varandra. Genom detta går detta att analysera även ytterst komplexa entiteter där huvud och/eller papper inte räcker till.

Ontologi låter mediekoncerner följa entiteter och deras relationer

2. Tidsanalys för att upptäcka vad som hänt

Tidsanalys är den analysmetod jag menar är i särklass mest kraftfull ändå sällan använd utanför krypteringsanalys. Orsaken att den inte är mer använd har troligen att göra med att människan naturligt inte förhåller sig "exakt" till dig. Trots styrkan som finns i metoden (utvecklad och förenklad av mig för media) är den ganska enkel att använda:

Tidsanalys i grävande journalistik

3. Keynote för att beskriva avancerade system med rättigheter

Ett alternativ ibland kanske intressant är Keynote (RFC 2704) för att beskriva förtroende hos distribuerade system. Med Keynote kan du t.ex. beskriva att en entitet du följer hade rättighet att göra vissa typer av affärer men saknade rättighet att göra det om inte vissa andra saker var uppfyllda. Just flexibilitet gör att egentligen allt runt rättigheter med fria villkor kan definieras.

Standarden utvecklades bl.a. Matt Blaze. Jag gjorde den första implementationen av standarden utanför referensimplementationen redan 1999. Läs mer i:

Datacentrisk säkerhetsarkitektur och Keynote
The KeyNote Trust-Management System Version 2

4. Emotionellt läckage är svart magi i renaste formen

Även går med andra lösningar att beräkna känslomässigt innehåll i både text och bild beräknas:

1. Det är intressant att göra för att se att det överensstämmer med vad som är önskat att kommunicera. En del artikel med positivt innehåll men som känns helt pessimism är givetvis inkorrekt.

2. Emotionellt läckage som jag kallar detta (jfr informationsläckage) går också att tillämpa för att uppskatta en persons känsloläge.

3. Det kan också vara möjligt att använda som en mer eller mindre unik signatur för en skribent. En möjlighet med det kan vara att från en text för vilken skribenten är okänd hitta denna genom att jämföra emotionellt läckage vilket kan fungera bättre även för fallet när texten av annan person översatts till ett främmande språk.

5. Formella språk

Rörande formella system ej tidigare berörda är troligen möjlig användning inom media obefintligt. För övriga fall är troligen CSP ett bra första alternativ att titta på:

Communicating Sequential Processes (CSP)


Foto: Tetsumo Licens: CC by 2.0

6. Att mäta nuhet

Nuhet rör sig i samma område som emotionellt läckage men är inte samma sak. Det handlar mer om det ögonblick när en grupp personer (eller en individ) påverkar trender och påverkas av trender. Begreppet liksom övrigt runt det är del av ett eget system och en del finns att läsa i:

Nuhet förenklad till tre dimensioner
Att mäta nuhet via Google
Är mobiler vägen till det absoluta ögonblicket?

Nuhet diskuteras i följande inlägg som troligen bättre illustrerar det för en trivial situation förenklad till två dimensioner:

Nära grupperade relaterade händelser är hög nuhet - Prediktera betydelse och trender för forskning från pressmeddelanden | Nyhetsbloggen

Även uttryckt i följande dikt jag skrev:

Poesi till rumstid, tid, datum (tidslinje) och nuhet | Nyhetsbloggen

7. Business intelligence och prediktion från Google

Google har ett antal verktyg i det här segmentet som jag använder alldeles för sällan. Tills de bättre finns beskriva länkas de direkt:

www.google.se/trends
Google Domestic Trends
www.google.com/insights/search/#

8. Google Image Swirl

Google Image Swirl uttrycker relationer mellan bilder:

Explore Images with Google Image Swirl (Google Research Blog)

9. Geotaggning och geografiska data

Uppgifter om geografisk position t.ex. för en händelse gör i växande omfattning det möjligt att identifiera foton, "tweet", inlägg på bloggar, information i Wikipedia m.fl. datakällor.

Kartor från Google Maps i bloggar och webbsajter
Geografisk lokalisering för anpassad presentation på nättidningar
Buzz, webbkameror och foton på Google Maps
Exempel - "Dashboard" med Geo-information för business intelligence
Geografiskt lokaliserad information för insamling
Hur mediekoncerner i underrättelseanalys kan visualisera och navigera geografiska data
Google Public Data Explorer för att visualisera statistik om världen

10. Visualisering av data

Hur data kan visualiseras är ett omfattande område med många möjligheter. Rörande geografiskt data (liksom mer än så) diskuteras några möjligheter i:

Hur mediekoncerner i underrättelseanalys kan visualisera och navigera geografiska data

11. Forskning tydliggör riktning för en bransch utveckling

Hur större entiteter prioriterar forskning och annat grundläggande område är en viktig indikation hur en bransch rör sig:

Forskning hos "viktiga" entiteter berättar om branschen

Följande metod (egentligen två stycken) utgår från hur forskning uttrycker sig i pressmeddelanden:

Prediktera betydelse och trender för forskning från pressmeddelanden

12. Google Public Data Explorer

Google Public Data Explorer är ett verktyg för att visualisera och jämföra data Google importerar från olika källor om världen och dess utveckling:

Google Public Data Explorer för att visualisera statistik om världen

Statistiken kan enkelt bäddas in på olika sätt.

Appendix A: Övrigt

Att se olämpligt rapporterande i nutid inringade av historien
Skärning mellan historia och nutid i underrättelseanalys med stridsflygplan som exempel
Neuronnät för intelligent övervakning av servrar

PP IS AS HARD AS THE POLYNOMIAL-TIME HIERARCHY* (PS)
Toda, SIAM J. COMPUT.,
Vol. 20, No. 5, pp. 865-877, October 1991

Metagame (Wikipedia)

Om systematisk avlyssning på nätet:

Internet och problemet med systematisk avlyssning

Hur generella kvalitetsfaktorer associerade till användare kan identifieras i Wikipedia:

Who does what on Wikipedia?

En upplever jag välgjord strukturering av nyheter rörande meta-information samt dessutom en färdig partiell lösning i öppen källkod:

Google living stories i öppen källkod

Via Infotorg ges access till ett antal databaser inklusive gamla Dafa spar där folkbokföringsadress kan bindas till t.ex. personnummer för mer trovärdiga utskick (ex. lösenord). Uppgifter om statistik och uppgifter rörande en mängd andra saker finns också från olika databaser.

www.infotorg.se

Wiki hos MIT om kollektiv intelligens:

Handbook of Collective Intelligence

Hos Gapminder.org finns visualisering av trender rörande en mängd områden att fritt använda:

www.gapminder.org

I området att mäta vad besökare gör på en webbsajt är Occam's razor den bästa sajten när det gäller guider. Det finns en hel del bra samlat särskilt från sista sex månaderna och de två senaste inläggen är ett par värda att läsa:

Kill Useless Web Metrics: Apply The "Three Layers Of So What" Test
10 Fundamental Web Analytics Truths: Embrace 'Em & Win Big

Även medtagen i dagens citat:

Dagens citat: Avinash Kaushik

Aaron diskuterar möjligheterna att använda data från Alexa:

Is Alexa Relevant in 2010?

Verktyg för att visualisera samband sannolikt manuellt (har ännu inte testat det men åtminstone är det ett trevligt exempel):

Mapping GitHub – a network of collaborative coders | Flowingdata.com

Programmeringsspråk för att bygga AI från en princip som låter intressant:

Grand Unified Theory of AI: New Approach Unites Two Prevailing but Often Opposed Strains in Artificial-Intelligence Research

Både positiva och negativa stereotyper påverkar läsarna. Detta har diskuterats i:

Effekten av ninja som positiv stereotyp
Var försiktig med negativa stereotyper

Det verkar heller inte otroligt att förekomsten av övervägande positiva eller negativa stereotyper säger något och är intressant att mäta. Ännu mer rör det i så fall troligen förändringen av fördelningen mellan positiva och negativa.

Världsbanken har nu gjort sin statistik enkelt tillgänglig över nätet och även i API:er. Läs mer i:

Världsbankens statistik enkelt och fritt tillgänglig

Företag som gör marknadsundersökningar rörande användning av och affärer på internet:

www.comscore.com

En liten tjänst Google gjorde för UK som tycks importera korta RSS-snuttar från leverantörer av uppgifter om statistik elegant presenterade fördelade över olika ämnen.

Google Internet Stats

Sökfunktionen tycks verka över nyckelord i RSS-bitarna som tagits med. Exakt med vad den är gjord med vet jag inte säkert men det hela tycks skapat med Google Spreadsheets och det tycks troligt att den har en sökfunktion även om jag inte använt den för något avancerat själv.

Guide till ett flertal verktyg och tjänster för enkel användning rörande trender på nätet och som jag uppfattar det prioriterat mot ögonblicket sett utifrån begrepp som kan uttryckas motsvarande sökord:

API and Dataset Cheatsheet - Building Quick & Dirty Tools | SEOMoz.org

Fallstudie över hur en enklare tjänst för att analysera några väldigt grundläggande men väldigt stora datakällor:

Slides & Thoughts from Hadoop World NYC | Datawrangling.com

Från Google finns också för att prediktera och kategorisera utifrån data och upptäcka förändring Google Prediction API:

Google Prediction API för att kategorisera, prediktera och se förändring

Där Google Prediction API också av filosofiskt intresse kan relateras till följande diskussion:

Relationer i länkar kanske approximerar generella samband för "organisatorisk entropi"

Där vi kan se länkar som bärande mening i form av riktning d.v.s. grafteori, mening vilket vi kan uttrycka som entropi och också implicit kategorisera från båda dessa egenskaper.

En webbsajt som gör till Sunlight foundation med en lösning för att hämta federal statistik:

transparencydata.com

Notera också följande undersida för bulk-nedladdning:

transparencydata.com/bulk/

Tre lösningar värda att titta på. Bland annat att avgränsa och mänta ut text entiteter från en text och ansiktsigenkänning respektive:

Tre spännande lösningar möjliggör kreativ data drilling

Data rörande hälsa i USA har gjorts tillgängligt via Google. Jag har ej testat det själv men Google Public Policy blog har länk till var det finns att ladda ner och diskuterar hur deras lösning Google Fusion Tables kan användas för att göra informationen "mer användbart":

Making U.S. community health data accessible and useful | Google Public Policy blog

Google Public Policy blog har information om patenter och varumärken att ladda ner:

10 terabytes of patents and trademarks | Google Public Policy blog

Statistik över sociala media är Viralheat en tjänst för:

Viralheat gör statistik över sociala media tillgängliga fritt

För att värdera olika hypoteser är ACH som används av CIA och numera finns i öppen källkod ett alternativ:

Att värdera alternativa hypoteser med ACH

Visualisering och samarbete från perspektivet kreativitet och innovation diskuteras i:

Idéer till kreativitets plattform för stora organisationer via fria lösningar

Tips rörande metoder, litteratur m.m. i kontext av nationalekonomi ges i:

Att bedöma ekonomisk utveckling: Några råd

Google googlar med Google-NGRAM: Antalet indexerade sidor fel

2013-02-10

Vågar vi spekulera att Google's index nu är mer beroende av sista versionen av Google NGRAM? Denna hade ju part-of-speech med adjektiv, subjektiv, verb m.m. utmärkta. Själv har jag tråkigt nog inte mäktat att få den nedladdad (mycket annat tas ju nuer kontinuerligt och pos har gjort stort till ganska stort om än inte gigantiskt - och big data blir det först med P ( A | B ) över långa relationer för olika expertområden d.v.s. ex. om Google för varje ngram beräknar frekvensen de förekommer med tillsammans med varje annat i resp. bok) - Google skickar mig nog en USB eller liknande med alla Google NGRAM filer för att jag skrivit om det antagna felet här (annars kan ju folk få för sig att de börjar bli veka och rädda för konkurrenter och smyger med varje små-saker som kanske inte är 100% rätt så att inte Bing ska hoppa på dom).


Tittar vi på träffarna Google gav mig för dessa fyra sökord noterar vi att den längsta termen ger oss flest träffar:


“the man” = 581,000,000
“old man” = 259,000,000
“the old” = 879,000,000
“the old man” = 997,000,000


En orsak kan vara att Google skurit citationstecknen utan att meddela. Google vill allt oftare kanske sista året gärna ta bort det, och sällan eller aldrig med vad jag upplevt har någon fördel. Ett exempel är sökrutan där om jag har ett initialt citationstecken och väljer att gå vidare med nästa ord i förslagen i markov-ledjan kstar Google bort mitt citationstecken som jag behöver lägga till. Kanske är det så att Google snabb-parsar sidor helt utan the m.m.? Kanske fungerar bra för det mesta utom vad man särskilt kanske gör det för.


Emellertid skär vi citationstecknen får vi:


old man = 2,380,000,000
the old man = 2,510,000,000
the man = 4,850,000,000
the old = 9,900,000,000


D.v.s. förklaringen tycks inte ligga i att Google skurit citationstecken."


En förklaring skulle dock kunna ligga i hur Google parsar med hjälp av nya Google Ngram (se också för en längre introduktion till Google NGRAM) Notera först att vi får ca 840 M i summa när vi adderar “the man” + “old man”.


Jämför gär a ex. med hur jag ser på NP konvergens i drifting thoughts där aktiviteten för NP konvergen till motsvarande en neuron här för the old man men konvergensen styrs av föregående, eller kanske enklare dependency grammar där the och old kommer peka på man. Dom relationerna kan vi ju förslagsvis bestämma statistiskt med just P ( A | B ).


Men om vi inte parsar på det sättet kan det ju ligga nära till hands att se att "the old" hamnar högre i frekvens än "old man" och därmed bli benägen att välja "the old" som en fras och "man" som en fras efteråt trts att det verkligen inte blir riktigt rätt här. Problematiken var generellt var vad Lauer pekade på i samband med att introducerade sin dependency parser: Corpus Statistics Meet the Noun Compound.


Mannings (s. 429) menar dock att det inte behöver vara ett argument mot träd-grammatik (vilket jag avstår att bedöma då jag inte använder dem) utan att problemet går att komma ifrån där också om representerar trädet genom att också markera varje NP och där utgå från dom noder som kommer närmast åt egentligen rätt håll.


Antar vi att vi gissar rätt ligger det kanske nära tillhands att tro att Google antingen skulle ha dels en 2gram representation och en 1gram på den. Men jag skulle gissa mer på att det är något med taggningen i den senaste Google NGRAM som gör att man kanske hamnar i sådana här preferenser lite varstans. Oavsett om det är relaterat det datat eller annat har jag en känsla av det kanske är relaterat till diverse småsaker jag upplever mig störas av hur Google ibland ger sökordsförslag med en irritation ny sedan ett tag nu.


Med stor glädje och förhoppning om att detta är ett exempel med en mängd liknande större problem för mer ovanliga ngram av dom sorter man i brist på andra corpus tenderar att använda sociala media, webben, specialiserade sökmotor (jag hade stor nytta av att spindla ner MIL (finansierar mycket forskning och publicerar många av artiklarna i egna register som finns på webben: bra corpus för hard science medan computer science inte adderar något jämförbart med Citeseerx) och utnyttja deras sökfunktioner men det tycks ha stängts ner nu i den mening att förfrågningarna last-delas ner till långsammare tid så nästa gång blir det att tröskla deras PDF-filer lokalt istället) givet att det knappast lär störa sökresultatet eller informationssökare, men däremot alla veta och rika företag och universitet som betalar för att göra annat än få sökmotorförfrågningar (2010 tror jag att jag prövade det sist och om jag minns rätt bottnade fria förfrågningar ut redan efter kanske 10000 förfrågningar vilket verkligen är ingenting). Har det inte ändrats känns det bra med lite sunda utmaningar. Får folk vana i att ta data från en källa sitter det hårt och det byts ogärna på tio till 20 andra.


Google ska förövrigt noteras ha värde framför Bing rörande detta och värde av den sort vi gärna vill se i verktyg som används i skolan. Google via API:erna jag noterade förr, resp. också numera av och till när jag söker normalt men utesluter domäner från sökresultaten (d.v.s. vad som tänkbart kan göra att man kan plocka ut relativa potens-skillnader mellan sajter läckande mer än nödvändigt) kommunicerar Google det tydligt genom att fråga om jag är människa. Det irriterar mig men jag får inte förfalskad information tillbaka. Förfalskad information besvärar inte mig i något relaterat detta eftersom det detekteras utan problem men det är mycket problematiskt genom att det indikerar att man saknar design rules för quality assurance and true moral commit. för sådana här tjänster får man givetvis aldrig ge korrupt information ut. Särskilt inte om man inte sunt kan separera det till IP utan det går bredare ut över många motsvarande IP-rymder hos ISP:er.


Bing är också tråkig i att Microsoft uppenbart har information och statistik nog för att göra något vettigt av den men ändå tycks det aldrig bli av. Om något känns det lite som att de kanske har ett problematiskt fokus på kunskapskoncept som var och fortfarande är viktiga i Word m.fl. liknande produkter men inte alls är vad som just adderar något bra för att generera sunda sökresultat. Faktiskt är det inte svårt att med information Microsoft exporterar räkna om deras SERP:ar med spam-sajterna nerskjutna och bättre överensstämmelse med vad man faktiskt söker efter utan att behöva utnyttja trust-indikationer domän, inlänkar eller annat.