Donnez à un modèle un document de cent pages et interrogez-le sur un point situé à la page cinquante : il peut passer à côté de la réponse — non pas parce que l’information est absente du contexte, mais à cause de l’endroit où elle se trouve.
TL;DR
- Les LLM exploitent bien mieux le début et la fin d’un long contexte que son milieu.
- L’effet a une forme en U et apparaît même dans les modèles explicitement conçus pour le long contexte.
- Faire tenir une information dans la fenêtre n’équivaut pas à ce que le modèle l’utilise.
La promesse, et le piège
Les fenêtres de contexte plus grandes vendent une idée séduisante : il suffirait de tout coller à l’intérieur et de laisser le modèle démêler le reste. Aucune récupération, aucune structure — un seul prompt gigantesque. Mais il existe un écart entre le fait d’avoir l’information dans la fenêtre et le fait que le modèle l’utilise réellement, et cet écart se creuse avec la longueur.
Ce que montre la recherche
Dans Lost in the Middle: How Language Models Use Long Contexts, Liu et ses collègues ont mesuré la capacité des modèles à trouver et à exploiter une information selon l’endroit où elle se situe dans l’entrée. Ils ont conçu deux tests délibérément contrôlés :
- Question-réponse multi-documents. Le modèle reçoit une question ainsi qu’une pile de documents — 10, 20 ou 30 — dont un seul contient la réponse. Ce document de référence est glissé à chaque position de la pile, et l’exactitude est mesurée à chaque emplacement.
- Récupération clé-valeur. Un test synthétique dépouillé de tout parasite linguistique : un long objet JSON contenant des centaines de paires clé-valeur aléatoires, où le modèle doit renvoyer la valeur associée à une clé donnée — ce qui isole la pure recherche par position de la compréhension.
Sur les deux tâches, et pour les modèles ouverts comme fermés (GPT-3.5-Turbo, Claude, MPT-30B-Instruct, LongChat-13B), la même forme est apparue : l’exactitude est maximale lorsque l’élément pertinent se trouve près du début ou de la fin du contexte et s’affaisse dès que le modèle doit puiser dans le milieu — une courbe en U.
La performance est souvent maximale lorsque l’information pertinente apparaît au début ou à la fin du contexte d’entrée, et se dégrade nettement lorsque les modèles doivent y accéder au milieu.
Trois détails rendent la chose pire qu’il n’y paraît. Cela vaut même pour les modèles conçus pour le long contexte — une fenêtre plus grande ne signifie pas que le modèle la lit de façon uniforme. Dans le pire des cas (le milieu), l’exactitude en multi-documents peut tomber en dessous du niveau de référence à livre fermé — le même modèle répondant sans aucun document, à partir de ses seuls paramètres. Et fournir à un modèle sa propre version à contexte étendu n’apportait aucun avantage lorsque l’entrée tenait déjà dans la fenêtre plus petite : la capacité supplémentaire n’achetait rien.
Une seule atténuation a eu un effet : la contextualisation tenant compte de la requête — répéter la question à la fois avant et après les documents. Elle a presque corrigé la tâche synthétique clé-valeur, mais n’a guère aidé la véritable question-réponse multi-documents ; ce n’est donc pas un remède universel. C’est la position, et pas seulement la présence, à laquelle le modèle est sensible.
Ce que cela signifie pour vous
Si vous comptez coller un long historique, un gros document ou un projet entier dans une conversation, la qualité de la réponse du modèle dépend en partie de la chance — de l’endroit où le passage pertinent a atterri. À mesure que le contexte grandit, le « milieu » sous-lu grandit avec lui. Deux implications pratiques :
- Mettez en avant, n’enfouissez pas. Le contenu pertinent devrait parvenir au modèle sous la forme d’un passage court et bien placé — et non caché au milieu d’un mur de texte.
- La structure l’emporte sur le volume. Organiser et récupérer les bons éléments de manière fiable surpasse constamment l’espoir qu’une fenêtre plus grande les lise tous.
Où FocusLM intervient
C’est exactement pour cela que FocusLM conserve votre contenu sous forme de mémoire structurée plutôt que comme un journal de conversation qui enfle. Au lieu de tout entasser dans un unique contexte en espérant que le milieu soit lu, il classe ce que vous lui fournissez et fait remonter les éléments pertinents et sourcés lorsque vous posez une question — pour que la réponse s’appuie sur le bon contenu, d’où qu’il provienne à l’origine.