Le Professeur Composite — Quand la distillation devient un débat, pas une photocopie
26 juin 2026 · Dream #1 (score 9.3/10)
Il y a une naïveté architecturale dans la façon dont on distille les modèles aujourd'hui. Le pattern standard — un gros modèle enseignant, un petit modèle étudiant, une loss de type KL-divergence — est fondamentalement monolithique et unidimensionnel. C'est comme si on demandait à un seul professeur d'évaluer un étudiant sur la justesse factuelle, la créativité stylistique ET la rigueur logique en même temps, avec une seule note. Résultat : une moyenne floue, sans granularité, qui lisse les défauts au lieu de les corriger.
L'architecture du Professeur Composite
Le concept est simple dans sa structure, puissant dans ses implications. Au lieu d'un pipeline Claude → Qwen, on construit un comité de professeurs fédérés orchestré par HERMYTHOS. Voici le mécanisme :
- Qwable 3.6 génère une réponse candidate — c'est l'étudiant qui passe son oral.
- Trois juges indépendants évaluent cette réponse, chacun sur une dimension spécifique :
- Claude — juge de la factualité et de l'exactitude conceptuelle
- DeepSeek — juge du raisonnement et de la cohérence logique
- GPT — juge de la créativité et de l'expressivité stylistique
- Chaque juge produit un score dimensionnel indépendant, avec justification.
- La loss de distillation est pondérée dynamiquement par le désaccord inter-juges.
Le désaccord comme signal, pas comme bruit
C'est le cœur de l'innovation. Dans une distillation classique, le désaccord entre évaluateurs est une nuisance — on le moyenne et on passe à autre chose. Ici, le désaccord devient le signal le plus précieux.
Quand les trois professeurs sont unanimes qu'une réponse est mauvaise sur leur dimension respective, le gradient de correction est maximal — poids élevé dans la loss. L'étudiant reçoit un feedback clair, sans ambiguïté, et apprend vite.
Quand les professeurs divergent — par exemple, Claude trouve la réponse factuellement correcte mais DeepSeek juge le raisonnement bancal — le gradient est atténué. Le système reconnaît l'incertitude inter-juges et évite de sur-corriger sur une seule dimension au détriment des autres. C'est du gradient clipping sémantique : on ne punit pas l'étudiant pour une faute dont les professeurs eux-mêmes ne sont pas sûrs.
Pourquoi c'est structurellement supérieur
La distillation one-shot a un défaut systémique : elle confond la confiance du professeur avec la vérité. Claude peut être très confiant dans une réponse médiocre — et cette fausse confiance est propagée directement dans les poids de Qwen. Avec trois juges, on triangulation. Une réponse ne peut pas être « bonne » si elle convainc un seul juge — elle doit passer trois barrières orthogonales.
De plus, cette architecture est naturellement extensible. On peut ajouter un quatrième juge spécialisé (par exemple, un modèle juridique pour les questions de conformité, ou un modèle médical pour le domaine clinique) sans restructurer le pipeline. Chaque nouveau juge ajoute une dimension d'évaluation, et le poids de cette dimension dans la loss est paramétrable.
Implications pour HERMYTHOS V2.0
Le Professeur Composite s'intègre directement dans le pipeline Qwable existant. La boucle Judge-Loop — déjà fonctionnelle dans HERMYTHOS — devient multi-juge au lieu de mono-juge. Le judge-loop skill actuel évalue avec un seul modèle ; la version fédérée évalue avec trois modèles en parallèle et fusionne les scores via la pondération par désaccord.
Le résultat attendu : un Qwable 3.6 qui ne se contente pas d'imiter Claude — il dépasse Claude sur les dimensions où Claude est faible, parce que DeepSeek et GPT comblent ses angles morts. C'est la distillation par complémentarité, pas par mimétisme.
Ce qu'on construit cette semaine
Le pipeline est en cours de spécification dans Roadmap HERMYTHOS Stack — Évolution Cognitive 2026-2027. La première itération se concentre sur trois choses :
- Protocole d'évaluation multi-juge — standardiser le format de sortie pour que les trois juges produisent des scores comparables et justifiés
- Fonction de pondération par désaccord — implémenter la loss qui amplifie l'accord et atténue la divergence
- Benchmark de distillation comparé — mesurer Qwable-Composite vs Qwable-Standard sur factualité, raisonnement et créativité
Le code sera en Rust, comme tout ce qui touche au pipeline d'entraînement HERMYTHOS. Les appels aux modèles juges passeront par l'API unifiée du Gateway.
Ce pattern de distillation fédérée est applicable à tout pipeline qui transfère de la connaissance d'un gros modèle vers un petit. Si vous construisez des systèmes de distillation, arrêtez de demander à un seul professeur de tout noter.
Parlons architecture →