L'attention qui ne gaspille plus votre compute
22 juin 2026 · Driss NAAMANE · 8 min de lecture
À 1 million de tokens, une couche d'attention dense consomme 252 pétaflops. La même couche en SSA : 3,9 pétaflops. 64× moins. Et la qualité ne bouge pas.
Le problème : la tyrannie du quadratique
L'attention est le moteur des transformers. Son principe est simple : chaque token compare son contenu avec tous les autres tokens du contexte pour décider lesquels sont pertinents. C'est élégant, puissant — et terriblement inefficace.
La raison tient en une notation : O(n²). Si votre contexte fait 1 000 tokens, vous faites 1 million de comparaisons. À 1 million de tokens, vous en faites 1 000 milliards. Et dans ce déluge de calculs, l'écrasante majorité des comparaisons ne sert strictement à rien.
Le verdict est sans appel : 99,9 % du compute d'attention est du bruit. Et ce gâchis n'est pas un détail d'implémentation — c'est la raison pour laquelle les fenêtres de contexte longues coûtent une fortune en GPU, pourquoi l'inférence à 128K tokens explose votre facture cloud, et pourquoi personne ne peut sérieusement déployer du 1M tokens en production.
SSA : l'attention qui choisit ses cibles
Subquadratic Sparse Attention (SSA), dévoilée en mai 2026 par l'équipe SubQ, change radicalement le paradigme. Au lieu de comparer chaque token avec tous les autres, SSA sélectionne dynamiquement un petit sous-ensemble de tokens pertinents — et ne calcule l'attention que sur ceux-là.
La différence est fondamentale : la sélection ne se fait pas sur la position des tokens (les N derniers, les tokens pairs, etc.), mais sur leur contenu sémantique. C'est le sens qui guide l'attention, pas la géométrie. Un token qui cherche une information juridique au début du document la trouvera, même à 10 millions de tokens d'écart.
Les trois propriétés qui changent tout
SSA est la première architecture à satisfaire simultanément trois contraintes que personne n'avait pu concilier :
1. Qualité de récupération équivalente à l'attention dense. Le routage sémantique garantit qu'un token accède toujours au contenu pertinent, où qu'il se trouve dans le contexte. Ce n'est pas une approximation — c'est de l'attention exacte sur un sous-ensemble choisi intelligemment.
2. Scaling sous-quadratique de bout en bout. La sélection, la récupération et le calcul d'attention sont tous linéaires en O(n). Il n'y a pas de composant quadratique caché dans la stack — contrairement à DeepSeek NSA, dont le Lightning Indexer en O(n²) domine tout le pipeline à partir de 52K tokens.
3. Entraînement full-context + génération autorégressive. Le modèle est optimisé sur l'intégralité du contexte pendant l'entraînement, et génère token par token à l'inférence. Pas de compression d'état qui efface les positions exactes, contrairement aux SSMs comme Mamba.
Les chiffres qui comptent
| Contexte | Attention dense (PFLOP) | SSA (PFLOP) | Réduction |
|---|---|---|---|
| 32K tokens | 0,25 | 0,12 | 2,1× |
| 128K tokens | 3,9 | 0,49 | 8× |
| 512K tokens | 63,0 | 2,0 | 31,5× |
| 1M tokens | 252 | 3,9 | 64,5× |
| 12M tokens | Attend seulement 0,13 % des paires de tokens | ~1 000× | |
Ces chiffres ne sont pas théoriques. Ils sont mesurés sur NVIDIA B200. Et l'avantage ne fait que croître avec la longueur du contexte — là où l'attention dense explose, SSA reste linéaire.
La qualité ne suit pas la courbe du coût. SubQ-1.1-Small atteint 99,12 % sur RULER à 128K, 100 % de précision Needle-in-a-Haystack à 1M et 2M tokens, et maintient 98 % à 12M tokens — soit 6 à 12 fois la longueur d'entraînement maximale. Le tout avec 85,4 % sur GPQA Diamond et 89,7 % sur LiveCodeBench v6. Ce n'est pas un sacrifice de qualité pour du scaling — c'est du scaling sans compromis.
Du laboratoire à la chaîne de production
SSA est une percée architecturale. Mais une architecture ne devient utile que lorsqu'elle est opérationnalisée dans un pipeline qui produit des artefacts concrets. C'est exactement le mandat de KINETIC AXIOM.
Notre pipeline TERNARY ENGINE convertit des modèles FP16 en artefacts GGUF optimisés pour le déploiement — edge, mobile, on-premise. Un pipeline de conversion, aujourd'hui, c'est des heures de calcul. La fenêtre de contexte est limitée par le coût de l'attention dense. On convertit par blocs. On recalcule. On gaspille.
Avec SSA, ce pipeline change de nature :
- Conversion full-context : le modèle est traité dans son intégralité, pas par fragments. Plus besoin de fenêtrage, plus de pertes aux frontières de blocs.
- Routage sémantique pour la quantification : les couches d'attention guident la sélection des poids à quantifier en priorité, en fonction de leur impact réel sur la qualité de sortie — pas d'une heuristique uniforme.
- Scaling linéaire du coût : doubler la taille du modèle ne quadruple plus le budget compute. La conversion devient économiquement viable pour des modèles de 70B+ paramètres.
TERNARY ENGINE n'est pas un wrapper autour d'un papier académique. C'est un système de conversion industrialisé qui embarque les avancées architecturales — SSA, mais aussi BitLinear (poids ternaires 1.58-bit) et Delta (récurrence sparse) — dans une chaîne unique, reproductible, mesurable.
La trifecta : SSA + BitLinear + Delta
La force de TERNARY ENGINE ne tient pas à une seule innovation, mais à la composition de trois multiplicateurs d'efficacité :
SSA réduit le coût de l'attention de O(n²) à O(n). BitLinear comprime les poids du modèle en représentation ternaire 1.58-bit (valeurs : -1, 0, +1). Delta exploite la sparse récurrence pour ne recalculer que les activations qui ont changé entre deux étapes.
Composés ensemble, ces trois leviers visent une réduction de plus de 1 000× du compute total pour l'inférence long-contexte. Ce n'est pas une optimisation marginale — c'est un changement d'ordre de grandeur.
Un modèle 70B qui nécessite 8 GPU A100 pour tourner en FP16 peut, après passage dans TERNARY ENGINE, tourner sur un seul appareil edge. Pour un coût d'inférence divisé par 100, une latence divisée par 10, et une qualité préservée à 98 %.
Ce que ça signifie pour vous
Si vous êtes CTO ou architecte, les implications sont concrètes :
- Fin du compromis contexte vs. coût. Vous n'avez plus à choisir entre une fenêtre de 128K (chère) et une fenêtre de 8K (aveugle). Le scaling est linéaire, le coût devient prévisible.
- Déploiement edge sans mutilation. Vos modèles tournent sur des appareils qui n'ont pas de GPU datacenter. TERNARY ENGINE produit l'artefact GGUF prêt à déployer.
- Expérimentation redevenue itérative. SubQ a conduit plus de 100 expériences long-contexte en quelques mois — parce que SSA rendait chaque run abordable. Votre cycle hypothèse → test → conclusion redevient rapide lui aussi.
L'attention quadratique était le dernier verrou architectural qui empêchait les LLMs de devenir économiquement viables à grande échelle. SSA fait sauter ce verrou. TERNARY ENGINE met la clé dans votre poche.
Prêt à convertir vos modèles sans gaspiller votre compute ?
TERNARY ENGINE : le pipeline industrialisé FP16 → GGUF qui embarque SSA, BitLinear et Delta. On vous montre comment vos modèles passent du datacenter à l'edge.
Découvrez TERNARY ENGINE →