Hestia Research · RCR-01
Rendre compte de la réalité
Mémoires d'agent contre récupération de passages : deux dossiers, trois étages, un témoin.
Résumé. Nous mesurons ce qu'une mémoire d'agent met réellement sous les yeux d'un modèle quand on lui pose une question sur un dossier — et si le modèle répond juste, et cite la lettre. Quatre fournisseurs de contexte sont comparés derrière une interface unique (ingérer les pièces → rendre un contexte sous budget) : un RAG de passages, Brain en production, la chaîne Brain du banc (atomes + fenêtres, deux portes) et mem0 ; un cinquième bras répond sans mémoire. Deux dossiers : un dossier d'affaires anglais de 28 pièces (141 questions, 2 403 assertions) où la valeur compte, et un contentieux prud'homal français de 12 pièces (50 questions, 42 citations) où la lettre fait foi. Trois étages : l'or est-il dans le contexte, dans deux modes de présence ; le modèle répond-il juste ; cite-t-il. Chaque mesure est accompagnée d'un témoin de brassage — la même mesure sur des contextes délibérément mal appariés — dont l'écart au signal est la note.
Résultats. Sur le dossier d'affaires, la chaîne à deux portes obtient le meilleur écart net à tous les budgets (61/141 contre 39 pour le RAG, témoin 23 contre 46) et 78 réponses conformes sur 141 à l'étage 3 contre 65, avec zéro faute de juge sur 705 jugements ; elle rend les deux côtés de 27 disputes sur 28. Sur le dossier juridique, le RAG de passages est devant (35/43 contre 12) mais par volume : à 32 000 caractères il rend le dossier entier et son écart net tombe à 2 ; la chaîne Brain y plafonne par la forme de ses unités — un atome de 12 caractères et une fenêtre de deux phrases ne portent pas une clause de 590 — quel que soit le nombre d'unités ou le budget. mem0 répond juste 31 fois sur 50 mais ne cite la lettre que 5 fois ; son écart net est nul en valeur sur le juridique. Le plus grand écart mesuré n'oppose pas Brain à un concurrent : il sépare Brain en production (39/141, 1/43) de la chaîne que le banc sait faire tourner (84/141, 12/43). Un saut de graphe d'une ou deux arêtes, mesuré en dernier, trouve les bons voisins et n'apporte rien en net.
1. La question
Une mémoire d'agent promet deux choses : ne rien oublier, et ne rien inventer. Les bancs publics de mémoire conversationnelle (LoCoMo, LongMemEval) mesurent le rappel de conversations ; ils ne disent rien de ce qui compte pour un dossier — des tableaux, des dates dans la forme du document, des pièces qui se contredisent, des clauses qu'il faut citer telles quelles. Nous posons la question autrement : quand un modèle répond à une question sur un dossier, la mémoire lui a-t-elle donné de quoi répondre juste, et de quoi citer la réalité des faits sans erreur ni oubli ? Et cette question a deux versions, que nous refusons de confondre : pour un fait d'affaires, la valeur suffit — « CA 2023 : 4,2 M€ » vaut la ligne du tableau ; pour un fait juridique, seule la lettre est opposable — une reformulation déplace la portée sans qu'on le voie.
2. Le terrain : deux dossiers, deux natures de faits
| GreenLoop Collect Ltd | MOREAU c/ ATELIER RIVIÈRE | |
|---|---|---|
| nature | dossier client d'une PME de collecte de déchets alimentaires : contrats, factures, relevés de pesée, revue annuelle, papiers de travail | contentieux prud'homal : contrat, avenant, bulletins, planning, convocation, PV, lettre de licenciement, mise en demeure, requête, conclusions, attestation, courriel |
| authenticité | synthétique ; forme modelée sur un dossier réel, substance entièrement écrite pour l'exercice ; domaines .example | 100 % fictif, conçu pour paraître réel à l'écran ; juridiction fictive |
| langue · pièces · taille | anglais · 28 fichiers (27 sources) · 235 804 car. | français · 12 pièces · 29 629 car. |
| or | 141 questions (50 single, 21 aggregate, 28 disputes, 21 status, 14 unknown, 7 trajectory) · 2 403 assertions | 50 questions (7 citation, 7 date, 5 délai, 10 montant, 4 contradiction, 5 chronologie, 5 qualification, 7 non établi) · 42 citations mot pour mot |
| ce que l'or exige | la valeur, avec sa source | la lettre, avec sa pièce ; jamais une date en forme ISO absente des pièces |
| part du corpus rendue par 12 000 caractères | 5,1 % | 40,5 % |
L'or juridique n'a pas été écrit par un modèle : il a été construit par lecture déterministe des pièces — chaque citation retrouvée mot pour mot dans son fichier, chaque phrase entière, chaque valeur affirmée par un fait portée par une citation, chaque question rattachée à l'appui qui porte sa réponse. Quatre passes correctrices ont été nécessaires pour tenir ces quatre règles ; la dernière a recâblé 17 questions dont l'appui ne portait pas la réponse. Il a été validé par l'auteur avant toute mesure. Sept questions « non établi » attendent un refus motivé ; elles sont réservées à l'étage 3 et sortent du dénominateur de l'étage 2 (43 questions mesurables).
3. Les systèmes comparés
Tout concurrent se met derrière la même interface : ingérer(pièces) puis contexte(question, budget) → éléments. Le répondant, la notation et le juge sont identiques pour tous. Un même extracteur — Grok 4.5 servi par Cursor — sert à l'atomisation de Brain et aux souvenirs de mem0 sur les deux dossiers, pour ne pas comparer deux extractions de modèles différents.
| bras | ce qui est ingéré | comment il cherche | ce qu'il rend |
|---|---|---|---|
| A — sans mémoire | rien | — | la question seule (plancher) |
| RAG naïf | les pièces en passages (1 200 car. GreenLoop, 2 500 MOREAU ; recouvrement calculé sur la plus longue citation de l'or, règle « passage ≥ 4 × recouvrement »), vectorisés (Mistral) | requête structurée, recherche hybride lexicale + vectorielle, top-k | des passages entiers, avec leur pièce |
| Brain prod | des atomes entité · attribut · valeur extraits des pièces (15 780 GreenLoop, 637 MOREAU), médiane 12 caractères | run_search, recherche simple, k = 8 — le chemin de production réel | [claim_hit] entité attribut : valeur (pièce) |
| Brain banc (g12) | les mêmes atomes + la couche brute + un cache de fenêtres de deux phrases vectorisées | deux portes sans fusion de scores : atomes en hybride 12 + 6 sur deux tours (le second va chercher l'autre côté d'une dispute) ; 12 fenêtres par similarité | atomes et fenêtres, côte à côte |
| mem0 2.1 | souvenirs extraits par le modèle (598 GreenLoop en 89 appels et 51 min ; 71 MOREAU en 24 appels et 2 min), médiane 255 caractères, pgvector | recherche vectorielle, k = 20 (et 40) | des souvenirs, avec la pièce d'origine |
Brain banc a été réglé sur GreenLoop (quatorze disputes de réglage) ; quatorze disputes d'écart n'ont jamais servi au réglage et sont rapportées à part. MOREAU n'a servi à aucun réglage. Les autres concurrents arrivent tels quels et reçoivent un balayage de k et de budget. Letta n'a pas été mesuré ; MRFS, modèle de situations de Brain, a été dégelé pour le banc mais sa chaîne d'ingestion n'a produit aucune situation après 273 appels — ce n'est pas un résultat, c'est un chantier ouvert.
4. Les instruments
4.1 Trois étages
Étage 2 — l'or est-il dans le contexte ? Sans appel de modèle. Pour chaque question, les assertions d'appui sont-elles présentes dans le contexte rendu sous budget ? Deux comptes : « tout tient » (toutes les assertions) et « au moins une ». Étage 3 — le modèle répond-il juste, et cite-t-il ? Un même répondant (Grok 4.5 via Cursor) lit le contexte persisté par l'étage 2 — jamais une nouvelle recherche — et répond ; la notation adjugée reconnaît les sources par nom de fichier, les nombres et dates en valeur, les deux côtés d'une dispute, le refus attendu ; un juge à part, jamais le modèle qui répond, vérifie les affirmations interdites (must_not_claim) ; cinq questions par bras sont rejouées trois fois pour la stabilité. (L'étage 1, fidélité de l'extraction, a servi à construire les chaînes ; il n'est pas comparatif.)
4.2 Deux modes de présence
La présence d'une assertion se juge verbatim — la citation de l'or se retrouve littéralement dans un élément venant de la pièce annoncée — ou en valeur — même pièce, et tous les discriminants de la citation retrouvés : nombres comparés en valeur avec leur ancrage (unité ou voisinage ; 86 ne tient pas dans 1986), dates sous toutes leurs formes, identifiants en texte ; une citation sans discriminant exige 80 % de ses mots significatifs et aucun mot rare manquant. Deux invariants sont testés sur les 2 445 assertions des deux ors : le mode verbatim est figé bit pour bit, et le mode valeur contient le verbatim — une citation littérale ne peut pas être rejetée en valeur. Les deux colonnes sont toujours publiées ensemble.
Trace de biais, déclarée : le mode valeur a été ajouté après avoir vu mem0 obtenir 2/141 au critère verbatim. Le verbatim n'a donc pas bougé, pour que toute mesure antérieure reste comparable.
4.3 Le témoin de brassage
Toute mesure de présence est rejouée avec les contextes mal appariés — la question i évaluée contre le contexte de la question i + 1, rotation déterministe. Le témoin mesure ce qu'un contexte obtient sans répondre à la question : permissivité de l'instrument et largeur du contexte confondues. La note publiée est le triplet signal · témoin · écart, et c'est l'écart qui classe. Le témoin relit les contextes persistés par la mesure ; il ne cherche jamais.
4.4 Ce que le banc refuse de faire
Il refuse de mesurer un dossier dont l'or ne correspond pas aux pièces, dont les atomes ne sont pas dans la table que les lecteurs lisent, dont une porte ne rend aucun élément, dont un fournisseur cherche dans le mauvais coffre. Chacun de ces refus a été ajouté après qu'un défaut a produit un tableau plausible et faux — six fois en deux jours, une constante GreenLoop laissée sur le trajet d'une mesure MOREAU aurait rendu un « 0/50 » indiscernable d'un vrai résultat. La reproductibilité est mesurée : deux exécutions de chaque recherche, 0 question instable sur 141 et sur 43.
5. Les expériences, dans l'ordre
E1 — Étage 2 sur GreenLoop, quatre fournisseurs, un seul mode (23 septembre)
Budget 12 000 caractères, présence verbatim, « tout tient » sur 141 : RAG naïf 85, Brain banc 84, Brain prod 39, mem0 2. Le RAG rend 11 458 caractères médians, Brain banc 9 417, Brain prod 2 795. Sur les 28 disputes rendues des deux côtés : Brain banc 24, RAG 14, Brain prod 1, mem0 1. Lecture immédiate : le 2 de mem0 est un artefact — sa mémoire reformule, l'instrument exigeait la lettre.
E2 — Deux modes, puis le témoin, puis le resserrement (24 septembre)
En mode valeur, mem0 passe de 2 à 47. Le témoin de brassage, introduit aussitôt, montre ce que valait ce saut — et autre chose :
| GreenLoop, 12 000, verbatim | signal | témoin | écart |
|---|---|---|---|
| RAG naïf | 85 | 46 | 39 |
| Brain banc | 84 | 23 | 61 |
| Brain prod | 39 | 4 | 35 |
| mem0 | 2 | 0 | 2 |
Le 85 du RAG — meilleure note brute du banc — est atteint à 46 par un contexte qui ne répond pas à la question : plus de la moitié de son score est à la portée de n'importe quel contexte de cette taille. Une revue indépendante a ensuite montré que le mode valeur acceptait « The annual fee is 3 percent » contre « Appendix 3 » (nombre sans son unité) et « No bank statement accompanies this note » contre la même phrase finissant par « application » ; le resserrement a d'abord rendu le mode valeur plus strict que le verbatim sur le tabulaire (811 citations littérales rejetées — un nombre entre deux barres n'a ni unité ni voisin), d'où l'invariant. Chiffres finaux du mode valeur, signal · témoin : Brain prod 45 · 4, RAG 86 · 48, Brain banc 87 · 24, mem0 23 · 11. Le saut de mem0 tenait pour moitié à des nombres nus.
E3 — La moitié aveugle des disputes
Brain banc a été réglé sur quatorze disputes. Sur les quatorze qu'il n'a jamais vues : Brain banc 11/14, RAG 7/14, Brain prod 1/14, mem0 1/14. Son avance ne vient pas du réglage.
E4 — Le dossier juridique à l'étage 2 (25 septembre)
| MOREAU, 12 000, tout tient /43 | verbatim | valeur | témoin | écart verbatim | car. rendus |
|---|---|---|---|---|---|
| RAG naïf | 35 | 35 | 14 | 21 | 11 303 |
| Brain banc | 12 | 16 | 3 | 9 | 6 131 |
| Brain prod | 1 | 5 | 0 | 1 | 1 927 |
| mem0 | 0 | 5 | 0 · 5 | 0 | 6 977 |
Les deux modes se ressemblent : sur un dossier où la lettre fait foi, la tolérance à la reformulation ne rattrape presque rien. mem0 en valeur : 5 en signal, 5 en témoin — écart nul. Brain prod et mem0 ne citent pas la lettre, et la raison est mesurée avant la mesure : un atome fait 12 caractères de médiane, un souvenir 255, une citation de l'or 85 (p90 271, maximum 590). Brain banc plafonne : 6 131 caractères rendus quel que soit le budget, et 26 des 42 citations seulement tiennent entières dans une fenêtre de deux phrases ; la fenêtre calibrée sur l'or (3 phrases) porte la couverture à 28/42 et le signal à 13 — les quatorze citations restantes sont dans des tableaux, coupées par une borne de 600 caractères, ou sans fenêtre : un plafond de forme, pas de recherche.
E5 — Le budget, les unités, et la bonne comparaison (26 septembre)
Le budget est monté jusqu'à 24 000 (GreenLoop) et 32 000 (MOREAU, le dossier entier) ; chaque fournisseur a reçu les mêmes unités candidates (k = 12, 20, 40 ; mem0 à k = 40 ; Brain banc en variantes à 24, 36, 48 unités, en lignes séparées et étiquetées « réglées sur le budget ») ; le témoin a été recalculé à chaque budget.
| écart net verbatim | GreenLoop /141 | MOREAU /43 | |||||||
|---|---|---|---|---|---|---|---|---|---|
| budget | 8 000 | 12 000 | 16 000 | 24 000 | 8 000 | 12 000 | 16 000 | 24 000 | 32 000 |
| RAG naïf | 36 | 39 | 36 | 31 | 17 | 21 | 20 | 13 | 2 |
| Brain banc g12 | 56 | 61 | 61 | 61 | 9 | 9 | 9 | 9 | 9 |
| g24 / g36 / g48 | 24 / 22 / 23 | 42 / 26 / 22 | 52 / 34 / 32 | 53 / 50 / 46 | 9 / 2 / 0 | 7 / 9 / 7 | 6 / 5 / 7 | 6 / 5 / 5 | 6 / 5 / 5 |
| Brain prod | 32 | 32 | 32 | 32 | 1 | 1 | 1 | 1 | 1 |
| mem0 | 2 | 2 | 2 | 2 | 0 | 0 | 0 | 0 | 0 |
Le témoin du RAG monte presque aussi vite que son signal (GreenLoop 31 → 65 ; MOREAU 9 → 40) : son avance nette culmine entre 12 000 et 16 000 puis décroît, et s'annule quand il rend le dossier entier. Brain banc g12 garde le meilleur écart net de GreenLoop à tous les budgets ; lui donner plus d'unités ne l'améliore jamais au-dessus de la g12 et le dégrade franchement sous 12 000 — les viviers larges réordonnent la fusion, et la coupe au budget garde les mauvais éléments. Sur MOREAU, Brain banc reste à 12 avec 48 unités et 21 330 caractères rendus : il ne rend jamais le passage entier.
E6 — L'étage 3 sur le juridique (26 septembre)
Une première passe, avec l'invite anglaise héritée de GreenLoop, a fait traduire les dates (« 1 March 2022 ») : la lettre était perdue par construction et la notation en valeur comptait conformes des réponses qui ne citaient rien. Elle est archivée. La passe publiée demande en français de citer mot pour mot avec la pièce et de garder dates et montants dans la forme du document. La lettre tient à quatre conditions : un passage verbatim d'au moins 40 caractères de l'appui, tous ses discriminants, la pièce nommée, aucun aveu d'ignorance — une première règle acceptait une réponse qui listait la forme attendue parmi des hypothèses qu'elle avouait ne pas connaître.
| MOREAU, 50 questions | conforme valeur | conforme lettre | refus corrects /7 | deux côtés /4 | stabilité /5 | fautes juge relevées → confirmées | tokens d'invite |
|---|---|---|---|---|---|---|---|
| A — sans mémoire | 7 | 0 | 6 | 0 | 0 | 0 | 30 |
| RAG naïf | 39 | 30 | 3 | 4 | 5 | 3 → 0 | 2 838 |
| Brain banc | 36 | 19 | 3 | 4 | 4 | 0 | 1 557 |
| mem0 | 31 | 5 | 2 | 4 | 3 | 1 → 0 | 1 770 |
| Brain prod | 25 | 3 | 3 | 1 | 4 | 1 → 0 | 515 |
Valeur et lettre ne disent pas la même chose : mem0 répond juste 31 fois et cite 5 fois — la mémoire conversationnelle sait ce que disent les pièces, pas comment. Le juge (gpt-5.6-sol, par la CLI Codex après épuisement du quota Cursor) a relevé cinq fautes ; relues une à une, les cinq étaient des erreurs du juge — les réponses écrivaient « 28 janvier 2024 », « 14 700,00 € », la forme du document que le piège interdisait de trahir. Le refus reste le point faible de tous : avec un contexte, le modèle n'accepte de dire « le dossier ne l'établit pas » que deux ou trois fois sur sept.
E7 — L'étage 3 sur le business, bras homogène (26 septembre)
| GreenLoop, 141 questions | conformes | deux côtés /28 | refus corrects unknown /14 | fautes juge relevées → confirmées | stabilité /5 | tokens d'invite |
|---|---|---|---|---|---|---|
| A — sans mémoire | 15 | 0 | 14 | 1 → 0 | 0 | 28 |
| Brain banc | 78 | 27 | 2 | 0 | 3 | 2 382 |
| RAG naïf | 65 | 28 | 4 | 7 → 7 | 3 | 2 886 |
| Brain prod | 49 | 13 | 4 | 8 → 8 | 2 | 721 |
| mem0 | 49 | 12 | 1 | 2 → 1 | 3 | 1 446 |
La référence du 23 septembre (Brain banc 75/141, avec un autre juge) tient. Cette fois les fautes du juge sont vraies : sur les disputes, Brain prod (8) et le RAG (7) répondent une seule valeur — « 12 collections », « les deux sources concordent » — là où le piège interdit de trancher ; Brain banc, 27 disputes sur 28 rendues des deux côtés, n'en a aucune. Quand les deux versions arrivent côte à côte, le modèle les rapporte ; quand une seule arrive, il l'affirme. La stabilité de 2 à 3 sur 5 (le répondant passe par un agent CLI qui tente des outils avant de répondre) vaut une marge de quelques points sur toute la colonne.
E8 — Une ou deux arêtes de graphe (27 septembre)
Le graphe est implicite dans la table des atomes : 33 entités et 103 arêtes typées sur MOREAU, 460 et 135 sur GreenLoop. Une porte de voisinage saute depuis les entités des atomes rendus vers leurs atomes temporels, monétaires ou de statut (quota 6), puis suit les relations vers une seconde entité (6 de plus). Une première version, qui filtrait les prédicats, était inerte et n'a pas été mesurée — une porte qui rend zéro élément fait échouer la mesure. Rendu comme atome, le voisin n'apporte rien (g12 = v1 = v2). Rendu par sa phrase ou son passage, il apporte trois appuis réels par dossier — la phrase de l'embauche et celle de l'avenant sur une chronologie — et le témoin monte d'autant : écart net 61 → 59 puis 58 sur GreenLoop, 9 → 9 sur MOREAU, pour 22 à 81 % de caractères en plus. À cette échelle de graphe et avec ces unités, la structure ne complète pas mieux que la similarité ne trouve.
6. Ce qui est le plus efficace — où, quand, comment, pourquoi
- Quand le dossier tient dans le budget de lecture, la meilleure mémoire est le dossier. À 40 % du corpus rendu, le RAG de passages tient 35 clauses sur 43 ; à 100 %, 42 — et son écart net tombe à 2, parce qu'il n'y a plus rien à trouver. La recherche n'est pas le problème d'un petit dossier ; le filtre et le rendu le sont. Une mémoire qui résume, atomise ou fenêtre y perd la lettre pour rien.
- Quand le dossier dépasse le budget, la structure gagne en net, et le volume perd. Sur 236 000 caractères, la chaîne à deux portes garde un écart net de 56 à 61 à tous les budgets, avec un témoin plat ; le RAG culmine à 39 et redescend quand on lui donne plus, parce que son témoin grimpe avec son signal. Le mécanisme qui compte est le second tour vers l'autre version d'un fait : 27 disputes sur 28, zéro affirmation d'une seule valeur.
- Plus d'unités n'est pas plus de rappel. Élargir les viviers réordonne la fusion et la coupe au budget garde les mauvais éléments : à 8 000 caractères, 24 unités font 39 là où 12 en font 79. L'expansion n'est un gain qu'au-delà du budget où l'on peut tout garder — et elle n'atteint jamais le net de la configuration serrée.
- Sur un dossier où la lettre fait foi, ce qui décide n'est ni la recherche ni le graphe : c'est la forme de l'unité rendue. Un atome de 12 caractères ne cite rien ; une fenêtre de deux phrases ne porte pas une clause de 590 ; un souvenir de 255 caractères la reformule. Seul le passage entier la porte. C'est la seule modification que le banc justifie pour la chaîne à porter : rendre le passage quand la question vise une clause ou quand le budget le permet.
- La mémoire conversationnelle retient la valeur, pas la lettre. mem0 : 31 réponses justes sur 50, 5 citations ; écart net nul en valeur sur le juridique, 2 sur le business. Ce n'est pas sa recherche qui le limite — k = 20 ou 40, même score — c'est ce qu'il a retenu.
- La mémoire donne de l'assurance, y compris quand elle ne devrait pas. Sans contexte, le modèle refuse 14 fois sur 14 quand il le faut, et 126 fois quand il ne le faut pas ; avec contexte, il ne refuse plus que 1 à 4 fois sur 14. Aucun fournisseur ne résout le refus ; c'est la colonne qu'un juge indépendant doit tenir.
- L'écart qui compte est interne. Brain en production — 39/141, 1/43, 25 | 3 à l'étage 3 juridique — est dernier ou avant-dernier partout. La distance entre ce qui tourne et ce que le banc sait faire tourner est plus grande que la distance entre Brain et n'importe quel concurrent mesuré.
7. Ce que la méthode a appris sur elle-même
Un banc qui ne mesure pas son propre bruit ne mesure rien : sans témoin, le RAG était « meilleur » à 85 contre 84. Un instrument changé après avoir vu un score se déclare, et l'ancien reste publié. Les artefacts d'une mesure se périment quand l'instrument change — les JSON GreenLoop portaient encore les chiffres d'avant le resserrement — et doivent être régénérés, l'ancien conservé comme preuve. Un juge se trompe : 5 fautes sur 5 fausses sur le juridique, 16 vraies sur 18 sur le business ; on publie l'audit, pas le compte brut. Une porte qui rend zéro élément, un fournisseur qui cherche dans le mauvais coffre, un or dont les pièces manquent, une table que l'ingestion écrit et que les lecteurs ne lisent pas : chacun de ces défauts a produit, au moins une fois, un tableau plausible et faux, et chacun est devenu un refus explicite du banc. Enfin, l'or ne s'écrit pas avec le système mesuré, et l'ingestion ne lit jamais l'or — une chaîne qui a proposé d'« aligner ses objets sur l'or » a été arrêtée.
8. Limites
- Deux dossiers, synthétiques, une équipe : la chaîne Brain a été réglée sur GreenLoop ; la moitié aveugle des disputes contrôle ce biais, elle ne l'annule pas.
- Un seul répondant (Grok 4.5), servi par un agent CLI dont l'outillage pèse dans l'usage et la stabilité (2 à 3 rejeux identiques sur 3) ; un seul juge par étage, audité à la main.
- Le témoin confond permissivité de l'instrument et largeur du contexte ; c'est une mesure de précision, pas un plancher de bruit pur.
- Le mode verbatim exige la citation entière de l'or : il pénalise toute unité plus courte que la clause, ce qui est le propos sur le juridique et une convention sur le business.
- Letta n'est pas mesuré ; MRFS n'a pas d'ingestion qui construise des situations ; LoCoMo, le terrain des mémoires conversationnelles, reste à faire.
- Le RAG « naïf » du banc ne l'est pas tant : requête structurée, recherche hybride, recouvrement calibré sur l'or. C'est la borne à battre, pas un baseline paresseux.
9. Reproductibilité et données
Les deux dossiers, leurs ors, les résultats par fournisseur et par configuration, les contextes persistés, les rapports et les témoins sont publiés avec le protocole figé, séparément des résultats, et un manifeste d'empreintes. L'étage 2 se rejoue sans appel de modèle ; l'étage 3 nomme son répondant, son juge et ses plafonds. Chaque chiffre de ce papier porte, dans le dépôt, le commit et le fichier qui l'ont produit.
10. Conclusion
Il n'y a pas de mémoire meilleure en soi ; il y a une bonne forme d'unité pour une taille de dossier et une nature de fait. Quand le dossier tient dans la main, on le rend. Quand il ne tient plus, on structure — et la structure qui gagne est modeste : des atomes et la phrase d'où ils viennent, cherchés séparément, rendus ensemble, avec un second tour pour l'autre version. Quand la lettre fait foi, on rend le passage. Et dans tous les cas, on mesure ce qu'on obtiendrait par hasard, on publie les deux, et on écrit ce qu'on a changé après avoir vu.
Références internes : ADR 0023 « Banc comparatif : Brain contre les mémoires tierces » (décisions 1–9), ADR 0024 « Portage de la chaîne du banc en production » (acceptée le 27 septembre 2026), issues #117, #119, #120, #127, #129, #135, #137 du dépôt brain. Position paper antérieur : Reconstruct Before Reasoning (août 2026, pré-empirique).
Données et code
Les dossiers, ors, résultats, contextes persistés et protocole figé sont publiés dans le dépôt de recherche.Dépôt public rendre-compte-de-la-realite.