Votre RAG répond faux une fois sur trois. Vous le savez, vos utilisateurs le sentent, et votre dashboard ne vous dit rien. C'est le problème qu'on a décidé d'éliminer — pas d'optimiser, pas d'atténuer : éliminer.
Le RAG, cette promesse non tenue
Le Retrieval-Augmented Generation est partout. Chaque startup brandit son « RAG en 5 minutes », chaque framework open source vous promet la lune avec trois appels API. La réalité est plus cruelle : un RAG mal calibré aggrave le problème qu'il prétend résoudre. Il injecte des sources hors sujet, ignore les documents pertinents, et donne au LLM assez de contexte pour halluciner avec autorité.
Le pire ? Personne ne mesure. On déploie, on croise les doigts, on ajuste un chunk size à l'aveugle. La boucle de feedback n'existe pas. Le résultat : des chatbots d'entreprise qui répondent avec aplomb des contresens complets, des moteurs de recherche interne qui passent à côté de 40 % des documents critiques, des assistants juridiques qui citent des jurisprudences… inventées.
Ce n'est pas un problème de technologie. C'est un problème de discipline.
La méthodologie Golden Dataset : quand le RAG devient mesurable
Il existe une approche rigoureuse, née dans les équipes qui construisent du RAG pour la santé, le droit, la finance — des domaines où une réponse fausse coûte plus cher qu'une absence de réponse. Cette approche s'appelle le Golden Dataset.
Le principe est simple, l'exécution est exigeante :
On sélectionne 10 à 50 questions représentatives du domaine, avec leurs réponses attendues et les sources qui les justifient. Pas de génération automatique : chaque paire Q/R est validée humainement par un expert métier.
On fait tourner le pipeline RAG sur ces questions et on mesure l'écart. Précision, rappel, fidélité aux sources, latence. Chaque métrique est tracée, chaque écart est documenté.
On débugge par étape : chunking, embedding model, stratégie de retrieval, prompt template, reranking. On itère jusqu'à ce que toutes les métriques dépassent les seuils contractuels. Pas 80 %. Pas « presque ». Toutes.
Ce qui sort de ce pipeline n'est pas un « prototype de RAG ». C'est un système validé, dont vous connaissez la précision exacte sur votre domaine avant même de le mettre en production.
GSN Offline : la distribution qui change tout
Un RAG validé, c'est bien. Un RAG validé que votre client peut utiliser sans infrastructure, sans compte cloud, sans dépendance réseau, c'est une autre catégorie.
C'est là qu'intervient le modèle GSN Offline. Inspiré des bundles logiciels autonomes, GSN Offline empaquette l'intégralité du stack — LLM local quantifié, base vectorielle, embeddings, interface web — dans un exécutable qui tient sur une clé USB. Pas de Docker. Pas de pip install. Pas de clé API à configurer.
Le déploiement se résume à trois gestes :
- Brancher la clé USB.
- Double-cliquer.
- Poser une question.
Golden Key : la fusion des deux mondes
Golden Key est la synthèse de ces deux approches. Ce n'est pas un outil. Ce n'est pas un framework. C'est un produit fini : une clé USB qui contient un RAG pré-entraîné, pré-validé et pré-mesuré pour un domaine spécifique.
La qualité n'est pas une aspiration. C'est un contrat.
Mesuré. Affiché. Dashboard embarqué.
Chaque Golden Key est livré avec son dashboard de performance embarqué. L'utilisateur non technique — le directeur juridique, le responsable conformité, le chef de projet industrialisation — voit en temps réel la fiabilité des réponses. Chaque réponse est sourcée. Chaque source est pondérée. Rien n'est caché.
Ce n'est pas un « RAG en 5 minutes ». C'est un RAG dont vous connaissez le taux d'erreur avant de poser votre première question. La différence est fondamentale.
Pour qui ? Pour quoi ?
Golden Key n'est pas pour tout le monde. Il s'adresse aux organisations pour qui une réponse approximative est inacceptable :
- Juridique et conformité : interrogez vos 15 000 pages de documentation réglementaire avec la certitude que chaque citation est exacte.
- Industrie et ingénierie : vos cahiers des charges, normes ISO et procédures techniques deviennent interrogeables sans connexion réseau — y compris en atelier.
- Santé et pharmacie : protocoles cliniques, notices médicaments, guidelines — un RAG où la fidélité des sources n'est pas négociable.
- Éducation et recherche : corpus académiques, manuels de référence, documentation interne — avec traçabilité complète des réponses.
Ce que Golden Key n'est pas
Soyons clairs. Golden Key n'est pas :
- Un concurrent de LangChain ou LlamaIndex. Ces frameworks sont des outils de construction. Golden Key est un produit fini.
- Un chatbot généraliste. Chaque clé est spécifique à un domaine, calibrée sur un corpus documentaire précis.
- Un service cloud. Tout tourne en local. Zéro donnée ne sort de la machine.
L'architecture de la confiance
En tant qu'architecte, ce qui m'importe n'est pas la prouesse technique isolée — c'est la chaîne de garantie de bout en bout. Golden Key repose sur quatre piliers :
- Golden Dataset validé : le juge de paix. Pas de déploiement sans validation préalable.
- Pipeline Bronze → Silver → Gold : chaque étape est tracée, chaque décision est documentée, chaque métrique est auditable.
- Distribution offline : le RAG validé est figé, empaqueté, scellé. Pas de dérive. Pas de mise à jour silencieuse qui dégrade les performances.
- Dashboard de transparence : l'utilisateur voit ce que le système voit. Score de confiance par réponse, sources consultées, documents ignorés.
C'est cette chaîne qui transforme un prototype de laboratoire en outil de décision.
Vous avez un domaine critique. Nous avons la méthodologie.
Golden Key est en accès anticipé pour les organisations qui opèrent dans des secteurs à fort enjeu documentaire. Chaque déploiement commence par une phase de qualification : nous construisons avec vous le Golden Dataset qui servira de référence, puis nous itérons jusqu'à ce que les métriques contractuelles soient atteintes.
Pas de SaaS. Pas d'abonnement à vie. Un produit que vous possédez, sur un support que vous contrôlez.
Parler à l'équipe →