Mots clés : internet, World Wide Web
.
Depuis son adoption par le W3C comme format d'échange
standard pour les données de l'Internet, XML a séduit tous
les grands acteurs du marché informatique.
Contrairement aux données HTML, il est possible d'extraire
la structure d'un document XML. Cette structure peut être
utilisée de multiples faÇons. Notamment, elle permet
d'interroger les documents de faÇon plus intelligente. Par
exemple, il est concevable en XML d'évaluer une requête de
type : ``donner les documents contenant des produits dont le
prix est supérieur à 10.000 Euros''. Sur un ensemble de
documents HTML, la requête la plus proche de celle-ci serait
: ``donner les documents contenant les mots produits et
prix''. Il est également possible d'envisager l'intégration
automatique d'un ensemble de documents portant sur le même
sujet mais dont les structures sont légèrement différentes.
Ceci facilite l'interrogation mais également la manipulation
des données par des applications (par exemple, une
application sur des données génomiques collectées en
différents endroits de la planète).
Verso parie sur XML. Nous pensons que ce format va gagner
encore en popularité et que dans un futur relativement
proche, la majorité des données publiées sur le Web seront
XML. Nous comptons être alors présent avec des outils
permettant une bonne exploitation de ces données. Nous nous
proposons plus particulièrement de construire une base de
données géante intégrant toutes les données XML du Web. Cette
base servira de support à un ensemble de services tels que :
interrogation conviviale et pertinente, abonnement de
requêtes (e.g. prévenez-moi si un nouveau projet apparaît sur
le site de l'INRIA) ou requêtes temporelles (e.g. quelle est
l'évolution du nombre de projets à l'INRIA depuis 1980).
Une version alpha de ce système est maintenant prête. La
société Xyleme vient d'être créée et va prendre en charge ce
prototype pour en faire un produit.