L'attention qui ne gaspille plus votre compute

22 juin 2026 · Driss NAAMANE · 8 min de lecture

À 1 million de tokens, une couche d'attention dense consomme 252 pétaflops. La même couche en SSA : 3,9 pétaflops. 64× moins. Et la qualité ne bouge pas.

Le problème : la tyrannie du quadratique

L'attention est le moteur des transformers. Son principe est simple : chaque token compare son contenu avec tous les autres tokens du contexte pour décider lesquels sont pertinents. C'est élégant, puissant — et terriblement inefficace.

La raison tient en une notation : O(n²). Si votre contexte fait 1 000 tokens, vous faites 1 million de comparaisons. À 1 million de tokens, vous en faites 1 000 milliards. Et dans ce déluge de calculs, l'écrasante majorité des comparaisons ne sert strictement à rien.

Le verdict est sans appel : 99,9 % du compute d'attention est du bruit. Et ce gâchis n'est pas un détail d'implémentation — c'est la raison pour laquelle les fenêtres de contexte longues coûtent une fortune en GPU, pourquoi l'inférence à 128K tokens explose votre facture cloud, et pourquoi personne ne peut sérieusement déployer du 1M tokens en production.

SSA : l'attention qui choisit ses cibles

Subquadratic Sparse Attention (SSA), dévoilée en mai 2026 par l'équipe SubQ, change radicalement le paradigme. Au lieu de comparer chaque token avec tous les autres, SSA sélectionne dynamiquement un petit sous-ensemble de tokens pertinents — et ne calcule l'attention que sur ceux-là.

La différence est fondamentale : la sélection ne se fait pas sur la position des tokens (les N derniers, les tokens pairs, etc.), mais sur leur contenu sémantique. C'est le sens qui guide l'attention, pas la géométrie. Un token qui cherche une information juridique au début du document la trouvera, même à 10 millions de tokens d'écart.

Les trois propriétés qui changent tout

SSA est la première architecture à satisfaire simultanément trois contraintes que personne n'avait pu concilier :

1. Qualité de récupération équivalente à l'attention dense. Le routage sémantique garantit qu'un token accède toujours au contenu pertinent, où qu'il se trouve dans le contexte. Ce n'est pas une approximation — c'est de l'attention exacte sur un sous-ensemble choisi intelligemment.

2. Scaling sous-quadratique de bout en bout. La sélection, la récupération et le calcul d'attention sont tous linéaires en O(n). Il n'y a pas de composant quadratique caché dans la stack — contrairement à DeepSeek NSA, dont le Lightning Indexer en O(n²) domine tout le pipeline à partir de 52K tokens.

3. Entraînement full-context + génération autorégressive. Le modèle est optimisé sur l'intégralité du contexte pendant l'entraînement, et génère token par token à l'inférence. Pas de compression d'état qui efface les positions exactes, contrairement aux SSMs comme Mamba.

Les chiffres qui comptent

Contexte Attention dense (PFLOP) SSA (PFLOP) Réduction
32K tokens0,250,12 2,1×
128K tokens3,90,49
512K tokens63,02,0 31,5×
1M tokens2523,9 64,5×
12M tokensAttend seulement 0,13 % des paires de tokens ~1 000×

Ces chiffres ne sont pas théoriques. Ils sont mesurés sur NVIDIA B200. Et l'avantage ne fait que croître avec la longueur du contexte — là où l'attention dense explose, SSA reste linéaire.

La qualité ne suit pas la courbe du coût. SubQ-1.1-Small atteint 99,12 % sur RULER à 128K, 100 % de précision Needle-in-a-Haystack à 1M et 2M tokens, et maintient 98 % à 12M tokens — soit 6 à 12 fois la longueur d'entraînement maximale. Le tout avec 85,4 % sur GPQA Diamond et 89,7 % sur LiveCodeBench v6. Ce n'est pas un sacrifice de qualité pour du scaling — c'est du scaling sans compromis.

Du laboratoire à la chaîne de production

SSA est une percée architecturale. Mais une architecture ne devient utile que lorsqu'elle est opérationnalisée dans un pipeline qui produit des artefacts concrets. C'est exactement le mandat de KINETIC AXIOM.

Notre pipeline TERNARY ENGINE convertit des modèles FP16 en artefacts GGUF optimisés pour le déploiement — edge, mobile, on-premise. Un pipeline de conversion, aujourd'hui, c'est des heures de calcul. La fenêtre de contexte est limitée par le coût de l'attention dense. On convertit par blocs. On recalcule. On gaspille.

Avec SSA, ce pipeline change de nature :

TERNARY ENGINE n'est pas un wrapper autour d'un papier académique. C'est un système de conversion industrialisé qui embarque les avancées architecturales — SSA, mais aussi BitLinear (poids ternaires 1.58-bit) et Delta (récurrence sparse) — dans une chaîne unique, reproductible, mesurable.

La trifecta : SSA + BitLinear + Delta

La force de TERNARY ENGINE ne tient pas à une seule innovation, mais à la composition de trois multiplicateurs d'efficacité :

SSA réduit le coût de l'attention de O(n²) à O(n). BitLinear comprime les poids du modèle en représentation ternaire 1.58-bit (valeurs : -1, 0, +1). Delta exploite la sparse récurrence pour ne recalculer que les activations qui ont changé entre deux étapes.

Composés ensemble, ces trois leviers visent une réduction de plus de 1 000× du compute total pour l'inférence long-contexte. Ce n'est pas une optimisation marginale — c'est un changement d'ordre de grandeur.

Un modèle 70B qui nécessite 8 GPU A100 pour tourner en FP16 peut, après passage dans TERNARY ENGINE, tourner sur un seul appareil edge. Pour un coût d'inférence divisé par 100, une latence divisée par 10, et une qualité préservée à 98 %.

Ce que ça signifie pour vous

Si vous êtes CTO ou architecte, les implications sont concrètes :

L'attention quadratique était le dernier verrou architectural qui empêchait les LLMs de devenir économiquement viables à grande échelle. SSA fait sauter ce verrou. TERNARY ENGINE met la clé dans votre poche.

SSA sparse-attention subquadratic TERNARY ENGINE gguf fp16-conversion

Prêt à convertir vos modèles sans gaspiller votre compute ?

TERNARY ENGINE : le pipeline industrialisé FP16 → GGUF qui embarque SSA, BitLinear et Delta. On vous montre comment vos modèles passent du datacenter à l'edge.

Découvrez TERNARY ENGINE →