L'étude et le benchmark de Microsoft Research ont le mérite de documenter quantitativement la dérive cumulative des LLMs sur des tâches longues. Rien de surprenant — même si les écarts d'un modèle à l'autre sont significatifs — les modèles étant des processus non-déterministes, et donc généralement non-réversibles.

À noter que les workflows bureautiques n'ont pas attendu les LLMs pour dégrader ou alourdir silencieusement des documents partagés — ceux des sponsors de cette étude n'étant pas toujours exemplaires en la matière.

Mais au-delà d'enfoncer une porte ouverte, cette étude renforce pour moi une analogie plus intéressante : celle d'un système physique dissipatif, dont les états successifs « brûlent » de l'information — simplifications, traductions, hallucinations — augmentant l'entropie globale de l'ensemble. L'enjeu devient alors de maximiser le « rendement » de l'opération inverse — à la fois en termes de conservation de l'information, de clarification du signal et de consommation de tokens.

Ce constat plaide pour des systèmes hybrides, où la créativité et la capacité de « raisonnement » du modèle sont strictement encadrées par des garde-fous déterministes, externes au modèle lui-même. Les setups locaux — type Claude Code, Codex App ou OpenCode, couplés à Git — contribuent typiquement à réduire cette dérive, notamment lorsqu'ils imposent le traitement systématique par fichiers plats, un versionnement natif rigoureux — gage de réversibilité — et le recours à des skills ou tools dès que nécessaire.

Et au fond, c'est presque l'inverse : bien intégrés, ces systèmes deviennent justement des machines à réduire l'entropie — ils condensent, structurent et clarifient des espaces informationnels dispersés, en particulier dans l'entreprise, qui étouffe de plus en plus sous sa propre masse de données. Ce n'est sans doute pas un hasard si les probabilités — dont les LLMs prolongent aujourd'hui l'héritage — ont trouvé, avec Ludwig Boltzmann, une expression profonde dans la thermodynamique statistique.

En fin de compte, l'enjeu n'est pas de lutter contre l'entropie intrinsèque de ces modèles, mais au contraire de la canaliser pour faire émerger de la structure à partir du chaos.

arxiv.org
LLMs Corrupt Your Documents When You Delegate
Laban, Schnabel & Neville (Microsoft Research), 2026 — l'étude et le benchmark DELEGATE-52 cités dans ce post.
In response to this post