During an internal activity in the place where I work i got the opportunity to organize a little hackathon about Open Data and Linked Data.
The activity was a use case in the "Cinema" domain where we used the Linked Data technologies in order to mix public and private Data with the aim to discover new insight in the Data and imagine new uses of these Graph of data.
I split the activity in many sub activity. In this way everyone could work on what preferred using the technologies one could.
Data Sources
We analyzed the domain and we discovered interesting source of data released as Open Data such as Freebase in RDF and the list of the "Cinema Theatre" of Milan.
Someone imported this data in the graph and created a sample link between a movie and the place where a person saw it.
We also tried to think about the private information the graph could contains and we realized that a lot of them are already in digital form, but are in the Social Network silos.
Someone else discovered this really cool open data release about cultural events in rome. We couldn't find the data at the end, what a pity!
Data Process
I described some methodology of simple data import, cleaning and reconciliation before the hackathon.
Someone in the group used Open Refine and the RDF extension in order to reconciliate a list of movies and places in data from an existing source.
In this way some movies from a local libray were linked to the freebase dataset.
Data Store
I presented a lab instance of the Virtuoso Store and the people used that in order to store and query the graph of data.
Data Queries
I presented some basic SPARQL queries useful in order to discover what's inside a triple store.
Someone edited that in order to get an idea of the Freebase graph and all the data linked to it.
Some interesting queries about "Genre of movies i am more interested in" were produced.
People with query skills found SPARQL very similar to SQL
Data View
I presented some tools useful in exploring a distribuited graph of data and for make a graph view from the result of a query.
Someone used lodlive for getting ispired and discover new relationship in the data.
Someone else used VisualBox in order to build a tag cloud of the genre linked with the movies he had in his library: take a look!
This basic hackathon has been appreciated by the public. They found the "Hands-on" session helpful in order to understand better the use case of the semantic web technologies and a good annex to the more theoretical courses we organized
Monday, 30 September 2013
Tuesday, 16 July 2013
Parlare in pubblico, arrivooo!
Questa me la sono scampata.
O meglio, la mia bassa tolleranza ai motivatori all'americana #soTuttoIoFateComeMeDiventereteFamosi è stata sufficiente.
Per questo nella apparizzione in pubblico conclusiva del corso ho ringraziato.
Per questo e per il fatto che il corso mi ha insegnato molti trucchi che mi saranno utili nel mio lavoro.
Sta poi a me, alle singole persone, usare queste "tecniche" con cognizione e sopratutto con onestà.
"Il fatto che puoi convincere persone a fare cose che altrimenti non farebbero non vuol dire che devi spingerle a fare cose per loro dannose"
Dimenticavo, lo scorso weekend ho avuto la possibilità, grazie alla mia azienda, di partecipare ad un corso di "public speaking".
Come dice sempre mio nonno.. impara l'arte e mettila da parte!
Friday, 28 June 2013
Better Open Data 1
Siamo all’alba dell’era degli open data.
Qualcosa inizia a muoversi e si iniziano ad intravedere dati interessanti all’orizzonte.
Come racconta Giuseppe Marini qui non sono però tutte rose e fiori.
Le problematiche principali identificate nell’articolo sono:
- formati dei file disparati
- denominazione dei campi con significato implicito
- contenuto dei campi con errori o difficilmente confrontabile
La prima cosa da fare è utilizzare un formato di dati comune.
Il candidato ideale è l’RDF in quanto:
- E’ sufficientemente generico, si possono esprimere in rdf i dati di qualunque complessit
- E’ possibile convertire in rdf qualsiasi tipo di dato (csv, xls..) piuttosto facilmente
- Ha diverse “serializzazioni” (xml, json, etc) in modo da poter usare quella che fa più comod
- E’ supportato dalla comunità open e quindi dai tool utilizzati per analizzare i dati
Per fare questo ci sono due strade:
- usare lo stesso formato e quindi gli stessi nomi dei campi
- usare formati diversi ma spiegando il significato dei campi
La seconda soluzione è meno comoda, sopratutto se si vuole che anchè un software possa “capire” il significato delle tabelle, ma.. rullo di tamburi... si.
può. fareeee!
Come? Usando le ontologie. Calma (già vedo le facce impaurite)
Le ontologie (nelle loro forme pù semplici) non sono altro che un elenco di campi standardizzati.
Prima di pubblicare i dati (o anche dopo (RAW DATA NOW)) si cercano ontologie esistenti per il dominio dei dati che si sta trattando.
Per quanto è possibile si cerca di utilizzare campi esistenti e solo nel caso non esistano se ne creano di nuovi cercando comunque di spiegarne il significato.
Spiegare il significato di nuovi termini in definitiva significa creare mapping tra i "propri" termini e altri standard
Una delle ontologie di base è ad esempio il “dublin core”. Questo definisce campi come “autore”, “titolo” etc..
Ogni campo ha un’indirizzo web al quale si puo accedere per avere informazioni quali: etichetta del campo in piu lingue -> è possibile confrontare dati “in lingue diverse” Campi correlati (ad esempio dice che autore è una specializzazione di contributor) -> si puo trattare l’autore come un contributor!!
Labels:
linked data
,
mappings
,
open data
,
rdf
Sunday, 9 June 2013
Monday, 27 May 2013
New Task: Linked Data in Digital Library Management System
I'm proud to announce that in the next months i will (also) work on the Digital Library project here in CINECA.
In this project, born with a collaboration with Sapienza, i will work on the Linked (Open) Data publishing.
A lot of NICE DATA for everyone!!
Ready for reuse!
Here the slideshow about the work we will do in the next months.
Stay tuned!
Ho il piacere di annunciare che nei prossimi mesi lavorerò (anche) al progetto Digital Library.
In questo progetto nato in collaborazione con Sapienza mi occuperò della pubblicazione dei dati in Linked (Open) Data.
Presto tanti BEI dati per tutti!!
Qui di seguito la presentazione su lavoro che faremo nei prossimi mesi.
Subscribe to:
Posts
(
Atom
)
