Vous avez déployé Claude Code ou Codex dans vos équipes. Les résultats sont inégaux : brillant un mardi, à côté du sujet le jeudi, sans que personne sache dire pourquoi. Le réflexe est d’incriminer le modèle, ou d’attendre le suivant. C’est une impasse, pour une raison simple : votre concurrent utilise exactement le même modèle, sorti le même jour, au même tarif. La différence ne peut pas venir de là. Elle vient de tout ce qui l’entoure.

Tout ce qui n’est pas le modèle

Ce « tout ce qui l’entoure » porte un nom depuis le printemps. Le 2 avril 2026, Birgitta Böckeler, Distinguished Engineer chez Thoughtworks, publiait sur le site de Martin Fowler Harness engineering for coding agent users. Le harness, c’est « everything in an AI agent except the model itself ». La gestion du contexte, la mémoire, le bac à sable, les outils que l’agent a le droit d’appeler, les règles qu’il doit respecter, les contrôles qui vérifient son travail. D’où l’équation qui a fait le tour du métier :

Agent = modèle + harness

Böckeler y ajoute la distinction qui compte pour un dirigeant. Il y a le harness intégré, celui que l’éditeur livre dans son produit, et le harness externe, celui que votre équipe construit autour, pour votre code et vos règles. Le premier est rigoureusement identique chez vous et chez votre concurrent. Le second ne l’est pas.

Ce n’est pas une lubie de consultant : les éditeurs eux-mêmes publient leurs recettes. Anthropic a documenté dès le 26 novembre 2025 comment structurer un agent qui travaille sur plusieurs jours : un fichier de progression, un script d’initialisation, un historique de commits lisible, une routine de démarrage de session. Aucune de ces briques n’est un modèle. Toutes sont du harness.

Guider avant, mesurer après

Le cadre de Böckeler tient en deux familles, empruntées à la cybernétique. Les guides sont des contrôles feedforward : ils anticipent le comportement de l’agent et l’orientent avant qu’il agisse. Les sensors sont des contrôles feedback : ils observent après coup et lui permettent de se corriger. L’une sans l’autre ne marche pas, et elle le dit sans détour :

You get either an agent that keeps repeating the same mistakes (feedback-only) or an agent that encodes rules but never finds out whether they worked (feed-forward-only).

La boucle guides, agent, sensors Les guides orientent l'agent avant qu'il agisse. Les sensors vérifient son travail après coup. Ce que les sensors détectent revient enrichir les guides, ce qui referme la boucle. GUIDES avant l'action AGENT modèle + outils SENSORS après l'action oriente vérifie ce qui a échoué devient une règle
Les deux familles de contrôles ne valent que reliées. Sans guides, l'agent répète ses erreurs. Sans sensors, il applique des règles sans jamais savoir si elles ont produit l'effet attendu.

Un second axe traverse ces deux familles : le contrôle est soit computationnel, déterministe, rapide et bon marché, soit inférentiel, confié à un modèle, sémantiquement plus fin mais lent, coûteux et non reproductible. Ce qui donne quatre cases, et une grille de lecture directement actionnable.

ComputationnelInférentiel
Guides (avant)Gabarits de projet, règles de dépendances, permissions et bacs à sableAGENTS.md, conventions de code, spécifications, skills
Sensors (après)Tests, linters, vérification de types, tests de mutation, détection de secretsRevue de code par IA, analyse sémantique de modularité

La colonne de gauche est celle qu’on sous-estime, parce qu’elle ressemble à de l’outillage ancien. La ligne du haut est celle qui se standardise le plus vite : AGENTS.md, publié par OpenAI en août 2025, a été versé fin 2025 à l’Agentic AI Foundation de la Linux Foundation, aux côtés de MCP. Écrire les règles de votre maison dans un fichier que tous les agents savent lire n’est plus un bricolage, c’est un standard.

Les capteurs sont aveugles là où le mal se fait

C’est le résultat le plus utile, et le moins confortable. Le 27 mai 2026, Böckeler a publié l’expérience complète : ESLint, Semgrep, dependency-cruiser, vérification de types, couverture, tests de mutation, détection de secrets, plus une analyse de couplage maison.

Ce qui marche est net. L’analyse statique couvre beaucoup plus de terrain qu’attendu, et surtout, un message de lint rédigé pour être lu par l’agent change vraiment son comportement : il se corrige seul. Les règles de dépendances ont permis de remettre des couches en ordre, puis de les tenir dans la durée.

Ce qui ne marche pas est plus instructif. Sur les métriques de couplage brutes, le verdict tombe : « I don’t have the impression that this type of coupling data is useful to AI on its own. » Et la conclusion générale :

Computational sensors impressed me most at the file and function level. Cross-file concerns like modularity and coupling were a different story, the raw data itself was very noisy and not that useful without semantic interpretation.

Rapprochez cela de ce que nous documentions dans l’article précédent : quand l’IA écrit, les appels entre fichiers reculent de 35 %. Autrement dit, la dégradation se produit exactement là où les capteurs voient le moins bien. Le fichier isolé est bien surveillé, la relation entre les fichiers ne l’est pas. Ce que les capteurs ne savent pas mesurer, les guides doivent l’interdire d’avance. Et décider ce qui est interdit d’avance, c’est de l’architecture.

Un harness est aussi un périmètre de sécurité

On peut voir le harness comme de la plomberie de productivité. Ce serait une erreur de cadrage, et le meilleur contre-exemple vient de chez l’éditeur lui-même.

Le 1er juin 2026, les chercheurs de GMO Flatt Security ont publié l’analyse d’une faille qu’ils avaient signalée à Anthropic le 12 janvier et qui fut corrigée le 16. Dans l’action GitHub officielle de Claude Code, la fonction qui vérifiait les droits d’écriture approuvait sans condition toute application GitHub. Un attaquant créait la sienne, ouvrait un ticket sur un dépôt public, y glissait une injection de prompt qui amenait l’agent à lire ses propres variables d’environnement, et repartait avec un jeton donnant accès en écriture au code, aux tickets et aux workflows. Cotation 7,8 sur 10. Les exemples de configuration livrés avec l’outil comportaient par ailleurs un caractère générique qui autorisait n’importe quel utilisateur à déclencher le workflow.

Aucune ligne de code générée n’était en cause. C’est le harness qui était troué.

Ce que les éditeurs vont vous reprendre

Reste une question d’investissement : si le harness est l’actif, combien de temps le restera-t-il ? Tomasz Tunguz a posé le cadre le 14 juillet 2026 en le désignant comme le nouveau champ de bataille, parce que c’est lui qui décide quelles données entrent, ce qui est journalisé et ce qui nourrit le modèle suivant.

Ce mouvement est déjà engagé, et nous l’avons décrit sans le nommer : la mémoire persistante et les espaces de travail isolés que GPT-6 Astra a apportés à Codex en septembre sont exactement du harness intégré. Les éditeurs absorberont méthodiquement tout ce qui est générique. Ce qu’ils ne peuvent pas absorber, c’est la partie qui encode vos frontières de service, vos règles métier, vos interdits. Cette partie-là ne s’achète pas, pour la même raison qu’un plan de maison ne s’achète pas au rayon outillage.

La critique, et ce qu'elle vaut

Une objection revient, formulée par Mike Lanzetta : « If you work in DevOps, you've been doing this for years, just called it something else. » Elle est largement fondée, et c'est plutôt une bonne nouvelle. Tests, linters, permissions scopées, CI, télémétrie : rien de tout cela n'est neuf, et vous en avez déjà une partie. Ce qui change, c'est le destinataire. Ces contrôles étaient écrits pour des humains qui pouvaient s'en passer. Ils sont désormais lus par une machine qui ne peut pas.


Böckeler termine son expérience par un avertissement qu’il faut garder en tête avant de budgéter quoi que ce soit : ces dispositifs « ne sont pas une solution magique pour sortir complètement l’humain de la boucle ». Le harness ne supprime pas la supervision, il la déplace vers l’amont, là où une décision se prend une fois et vaut pour toutes les exécutions suivantes. Votre concurrent a le même modèle que vous. Il n’a pas vos règles, sauf si vous ne les avez jamais écrites.

À retenir
  • Agent = modèle + harness. Le modèle est identique chez tout le monde, le harness externe ne l'est pas.
  • Deux familles de contrôles : les guides qui orientent avant, les sensors qui vérifient après. L'une sans l'autre ne produit rien de fiable.
  • Les capteurs automatiques voient bien le fichier isolé et mal les relations entre fichiers, c'est-à-dire précisément là où le code généré se dégrade.
  • Un harness mal conçu est une faille de sécurité, pas seulement une perte de productivité.
  • Les éditeurs absorberont tout ce qui est générique. Ce qui reste à vous, ce sont vos règles écrites.