L'Attention Neurorhizomique — Votre pipeline d'entraînement devrait rêver entre deux epochs

26 juin 2026 · Dream #3 (score 9.0/10)

HERMYTHOS V2.0 SSA+BitLinear BMAM Dreams Attention Neuroscience

Il y a quelque chose de profondément inefficace dans la façon dont on entraîne les modèles aujourd'hui. Chaque epoch est une tabula rasa. Le modèle voit les données, met à jour ses poids, et oublie immédiatement tout ce qui s'est passé entre les couches pendant la forward pass. Les activations inter-couches — ces signaux fugaces qui traversent le réseau de la couche 1 à la couche N — sont calculées, utilisées pour le backward, puis jetées. Comme si le cerveau effaçait tous ses rêves au réveil.

L'Attention Neurorhizomique change ça. Elle donne au pipeline d'entraînement une mémoire inter-epoch — et un mécanisme pour générer des hypothèses de connexions entre couches distantes, exactement comme le moteur BMAM Dreams croise des concepts sémantiquement éloignés dans l'espace latent de HERMYTHOS.

Un cerveau qui n'a pas de sommeil paradoxal ne consolide pas sa mémoire. Un pipeline d'entraînement qui n'a pas de phase de « rêve » entre deux epochs ne consolide pas ses représentations inter-couches.

Le mécanisme

L'architecture repose sur une fusion de deux briques existantes : le pipeline SSA+BitLinear (Sub-Quadratic Sparse Attention avec quantification ternaire 1.58-bit) et le moteur BMAM Dreams (le système de génération d'hypothèses par croisement sémantique).

Voici ce qui se passe entre l'epoch N et l'epoch N+1 :

  1. Capture des activations — Pendant la forward pass de l'epoch N, le pipeline enregistre les matrices d'activation de chaque couche pour un échantillon représentatif du batch. Pas toutes les activations — les plus extrêmes (top-k et bottom-k par magnitude).
  2. Croisement inter-couches — Le moteur BMAM Dreams prend ces activations et les traite comme des « concepts » dans un espace sémantique. Il croise systématiquement les couches distantes — par exemple, les activations de la couche 3 (early features) avec celles de la couche 21 (high-level abstractions) — et cherche des corrélations non triviales.
  3. Génération d'hypothèses de connexion — Quand une corrélation inter-couche est détectée (ex: un pattern d'activation dans la couche 3 est systématiquement suivi d'un pattern spécifique dans la couche 21), le système génère une connexion latérale candidate — un skip-connection ou une gate qui n'existait pas dans l'architecture originale.
  4. Injection et test — La connexion candidate est injectée temporairement dans le graphe. L'epoch N+1 s'exécute avec cette connexion active. Si la loss s'améliore sur un held-out set, la connexion est promue en connexion permanente. Sinon, elle est élaguée.
Le pipeline ne se contente pas d'optimiser des poids — il fait évoluer sa propre architecture. Les connexions latérales ne sont pas designées par un humain. Elles sont découvertes par le croisement systématique des activations inter-couches.

Pourquoi « neurorhizomique » ?

Le terme n'est pas gratuit. En neuroscience, le rhizome décrit un réseau sans centre, sans hiérarchie fixe, où chaque nœud peut se connecter à n'importe quel autre. Les connexions latérales découvertes par le moteur BMAM Dreams créent exactement cette topologie : des ponts entre des couches qui n'étaient pas supposées communiquer directement.

Une connexion frappe particulièrement : le lien entre les early features (couches basses, patterns locaux) et les high-level abstractions (couches hautes, concepts globaux). Dans une architecture classique, l'information doit traverser toutes les couches intermédiaires pour passer de l'une à l'autre. Avec une connexion neurorhizomique, un pattern local peut directement influencer une abstraction globale — sans passer par la hiérarchie. C'est l'équivalent, en neurosciences, d'un réflexe qui court-circuite le cortex pour gagner en vitesse.

Implications pour le pipeline SSA+BitLinear

Le pipeline SSA+BitLinear est déjà extrêmement efficient — attention sub-quadratique, poids ternaires, empreinte mémoire réduite. Mais son architecture est figée. Les couches sont connectées séquentiellement, et l'information ne peut circuler que dans un sens (forward) ou dans l'autre (backward via gradients).

Avec l'Attention Neurorhizomique, le pipeline gagne :

Roadmap

Ce concept est encore au stade de spécification dans Pipeline Unifié SSA+BitLinear — HERMYTHOS. Les prochaines étapes :

Le code sera en Rust, dans la crate hermythos-training. Les activations seront sérialisées en format arrow pour le transfert vers le moteur BMAM Dreams.

Si vous entraînez des modèles et que votre pipeline jette ses activations entre deux epochs, vous laissez de l'information sur la table. L'Attention Neurorhizomique transforme cette information en architecture.

Parlons pipelines auto-évolutifs →