L'Attention Neurorhizomique — Votre pipeline d'entraînement devrait rêver entre deux epochs
26 juin 2026 · Dream #3 (score 9.0/10)
Il y a quelque chose de profondément inefficace dans la façon dont on entraîne les modèles aujourd'hui. Chaque epoch est une tabula rasa. Le modèle voit les données, met à jour ses poids, et oublie immédiatement tout ce qui s'est passé entre les couches pendant la forward pass. Les activations inter-couches — ces signaux fugaces qui traversent le réseau de la couche 1 à la couche N — sont calculées, utilisées pour le backward, puis jetées. Comme si le cerveau effaçait tous ses rêves au réveil.
L'Attention Neurorhizomique change ça. Elle donne au pipeline d'entraînement une mémoire inter-epoch — et un mécanisme pour générer des hypothèses de connexions entre couches distantes, exactement comme le moteur BMAM Dreams croise des concepts sémantiquement éloignés dans l'espace latent de HERMYTHOS.
Le mécanisme
L'architecture repose sur une fusion de deux briques existantes : le pipeline SSA+BitLinear (Sub-Quadratic Sparse Attention avec quantification ternaire 1.58-bit) et le moteur BMAM Dreams (le système de génération d'hypothèses par croisement sémantique).
Voici ce qui se passe entre l'epoch N et l'epoch N+1 :
- Capture des activations — Pendant la forward pass de l'epoch N, le pipeline enregistre les matrices d'activation de chaque couche pour un échantillon représentatif du batch. Pas toutes les activations — les plus extrêmes (top-k et bottom-k par magnitude).
- Croisement inter-couches — Le moteur BMAM Dreams prend ces activations et les traite comme des « concepts » dans un espace sémantique. Il croise systématiquement les couches distantes — par exemple, les activations de la couche 3 (early features) avec celles de la couche 21 (high-level abstractions) — et cherche des corrélations non triviales.
- Génération d'hypothèses de connexion — Quand une corrélation inter-couche est détectée (ex: un pattern d'activation dans la couche 3 est systématiquement suivi d'un pattern spécifique dans la couche 21), le système génère une connexion latérale candidate — un skip-connection ou une gate qui n'existait pas dans l'architecture originale.
- Injection et test — La connexion candidate est injectée temporairement dans le graphe. L'epoch N+1 s'exécute avec cette connexion active. Si la loss s'améliore sur un held-out set, la connexion est promue en connexion permanente. Sinon, elle est élaguée.
Pourquoi « neurorhizomique » ?
Le terme n'est pas gratuit. En neuroscience, le rhizome décrit un réseau sans centre, sans hiérarchie fixe, où chaque nœud peut se connecter à n'importe quel autre. Les connexions latérales découvertes par le moteur BMAM Dreams créent exactement cette topologie : des ponts entre des couches qui n'étaient pas supposées communiquer directement.
Une connexion frappe particulièrement : le lien entre les early features (couches basses, patterns locaux) et les high-level abstractions (couches hautes, concepts globaux). Dans une architecture classique, l'information doit traverser toutes les couches intermédiaires pour passer de l'une à l'autre. Avec une connexion neurorhizomique, un pattern local peut directement influencer une abstraction globale — sans passer par la hiérarchie. C'est l'équivalent, en neurosciences, d'un réflexe qui court-circuite le cortex pour gagner en vitesse.
Implications pour le pipeline SSA+BitLinear
Le pipeline SSA+BitLinear est déjà extrêmement efficient — attention sub-quadratique, poids ternaires, empreinte mémoire réduite. Mais son architecture est figée. Les couches sont connectées séquentiellement, et l'information ne peut circuler que dans un sens (forward) ou dans l'autre (backward via gradients).
Avec l'Attention Neurorhizomique, le pipeline gagne :
- Des skip-connections découvertes automatiquement — pas besoin qu'un humain devine quelles couches devraient communiquer directement
- Une capacité d'auto-réorganisation — le graphe de calcul évolue pendant l'entraînement, comme un cerveau qui renforce certaines synapses et en élimine d'autres
- Une mémoire inter-epoch — les patterns d'activation ne sont plus jetés après chaque backward pass. Ils nourrissent le moteur BMAM Dreams qui les recycle en hypothèses architecturales
Roadmap
Ce concept est encore au stade de spécification dans Pipeline Unifié SSA+BitLinear — HERMYTHOS. Les prochaines étapes :
- Hook d'activation dans le pipeline Rust SSA+BitLinear — capturer les matrices d'activation sans impacter les performances d'entraînement
- Moteur de croisement BMAM Dreams appliqué aux activations — adapter le moteur de croisement sémantique pour qu'il travaille sur des matrices de features plutôt que sur des articles de wiki
- Protocole d'injection et de promotion — définir les critères exacts pour qu'une connexion candidate soit promue (combien d'epochs de test ? quel seuil d'amélioration de loss ?)
Le code sera en Rust, dans la crate hermythos-training. Les activations seront sérialisées en format arrow pour le transfert vers le moteur BMAM Dreams.
Si vous entraînez des modèles et que votre pipeline jette ses activations entre deux epochs, vous laissez de l'information sur la table. L'Attention Neurorhizomique transforme cette information en architecture.
Parlons pipelines auto-évolutifs →