Lieu : Centre Broca
Thèse soutenue en anglais
IMN
Equipe : Neurosciences computationnelles
Thèse dirigée par Xavier Hinaut
Titre
Des modèles hybrides Reservoir–Transformer aux State Space Models pour un traitement efficace des séquences
Abstract
Les architectures Transformer ont révolutionné le traitement automatique des séquences, notamment dans le domaine du langage. Leur mécanisme d’attention permet d’accéder directement aux éléments antérieurs d’une séquence et favorise un entraînement fortement parallélisable. Cette efficacité à l’entraînement s’accompagne toutefois d’un coût croissant avec la longueur du contexte : l’attention présente une complexité quadratique en fonction de la longueur de la séquence et, en génération autorégressive, le stockage des clés et des valeurs passées nécessite une mémoire qui augmente elle aussi avec le nombre de tokens traités. À l’inverse, les architectures récurrentes maintiennent un état de taille fixe, ce qui les rend naturellement adaptées au traitement continu des données et à une inférence à coût constant par pas de temps. Leur caractère séquentiel limite cependant la parallélisation de l’entraînement. Cette thèse étudie comment réunir les propriétés de ces deux types d’architectures : l’entraînement parallèle des Transformers et l’inférence à coût constant des modèles récurrents. Elle explore pour cela l’hybridation entre Transformers et Reservoir Computing, une approche particulière des réseaux récurrents reposant sur des systèmes dynamiques. Une première architecture, l’Echo State Transformer, remplace l’attention portée à l’ensemble des éléments passés par une attention appliquée à un nombre fixe d’unités de mémoire dynamiques. Ces travaux conduisent ensuite à une reformulation des réservoirs linéaires. En paramétrant directement leur dynamique à l’aide de valeurs propres complexes, il devient possible de modéliser différentes échelles temporelles tout en remplaçant les opérations matricielles récurrentes par des opérations élément par élément, moins coûteuses. Cette progression aboutit au Dynamical Memory Transformer, une architecture appartenant à la classe des State-Space Models, fondée sur plusieurs unités de mémoire récurrentes sélectives. Celles-ci sont mises à jour en fonction de l’entrée grâce à un taux de fuite adaptatif, tandis que l’attention permet d’organiser leurs interactions. Comme cette dynamique reste linéaire, l’évolution des états peut être calculée à l’aide d’un scan associatif parallèle. Le modèle conserve ainsi les avantages d’un entraînement parallélisable tout en maintenant, à l’inférence, un état de taille fixe. Enfin, la thèse développe CogScale, un benchmark de tâches synthétiques destiné à évaluer séparément différents aspects cognitifs tels que la rétention, la sélection, le rappel associatif et la manipulation d’informations. L’ensemble de ces travaux vise à concevoir des architectures capables de préserver un accès précis au passé tout en maintenant un coût d’inférence constant par pas de temps.
Mots-clés
Transformers, State Space Models, Reservoir Computing, Système Dynamique, Scan Associatif, Traitement de Sequence
Publications
- Cogscale: https://arxiv.org/abs/2605.19758
- Deploying Open-Source Large Language Models: https://arxiv.org/abs/2409.14887
- Dynamical Memory Transformer: (travail en cours…)
- Echo State Transformer: https://arxiv.org/abs/2507.02917
- Fast Linear Reservoir: https://arxiv.org/abs/2602.19802
- Interactive Documentation Enhanced with LLM and Knowledge Graph: https://arxiv.org/abs/2507.05279
Jury
+ d’infos prochainement
