Participants : Philippe Flajolet,
Pierre Nicodème, Mireille Régnier, Bruno Salvy, Mathias
Vandenbogaert.
Mots clés : combinatoire des mots,
séquences, recherche de motifs, génome .
Résumé :
L'objet des recherches sur les séquences est la
conception de nouveaux algorithmes, l'obtention de la
complexité moyenne de ces algorithmes et l'application à
l'algorithmique de certains résultats statistiques. Plus
généralement, nous développons une théorie analytique de
l'information qui s'appuie sur la combinatoire, les
probabilités et l'analyse.
L'algorithmique des
séquences ou objets textuels couvre des domaines
d'application variés (compression des données textuelles et
séquences biologiques). Ce sujet comprend d'abord des
recherches algorithmiques. Il s'agit de trouver efficacement
un motif ou un ensemble de motifs dans un texte. Cet ensemble
peut en particulier être l'ensemble des mots voisins d'un mot
donné, à un nombre d'erreurs près, où le type et le nombre
d'erreurs autorisées sont déterminés par l'application. Une
nouvelle classe d'algorithmes dits d'extraction de motifs,
émerge dans les recherches sur le génome. On extrait des
motifs à signification biologique particulière, non connus à
l'avance. Ce sont par exemple des mots à fréquence
exceptionnelle : surrepresentés ou sousrepresentés pour
un modèle probabiliste donné. On peut aussi rechercher une
expression régulière caractéristique d'une famille donnée.
Ces algorithmes testent sur une même séquence un grand nombre
de candidats potentiels et la rapidité du calcul statistique,
et sa précision, apparaissent essentielles.
D'un point de vue méthodologique, des théorèmes
probabilistes trouvent des applications naturelles dans
l'étude des séquences. Plus précisément, nous avons mis en
évidence différents types de processus de renouvellement, la
loi limite étant généralement gaussienne; le calcul effectif
des paramètres de coût peut être très délicat et les outils
combinatoires et analytiques permettent pour cette classe de
problèmes les calculs effectifs des distributions. Les
formules obtenues sont aussi valables dans le domaine fini.
Enfin, l'étude des grandes déviations, en cours, est très
prometteuse. Parallèlement, nous développons des outils de
calcul dans le modèle probabiliste markovien. La complexité
des évaluations de performances dans le cas markovien
provient du nombre de cas différents à considérer. Nous
définissons pour chaque problème des langages
caractéristiques dont la contribution au coût total de
l'algorithme est calculable. Ceci équivaut à une agrégation
des états de l'automate associé. Les résultats s'appliquent à
la compression et à la recherche de motifs avec erreurs ou de
motifs exceptionnels dans les textes (DosDNA, reconnaissance
de gènes ou de signaux de régulation, etc.). Ils permettent
aussi d'établir les domaines d'efficacité des différents
algorithmes de recherche de similarités dans des bases de
données protéiques.