Votre responsable des opérations a construit son outil de suivi un mardi après-midi. Votre développeur livre en deux jours ce qui en prenait dix. Vous avez peut-être vous-même généré une application complète en une soirée, et elle fonctionne. Puis la question arrive, et elle ne repart plus : si tout le monde sait produire, qu’est-ce qui vous distingue encore ? La réponse est apparue le 3 septembre, dans un endroit que presque personne n’a regardé. Pas dans les benchmarks. Dans le changelog.
Astra ne code pas mieux, il s’organise mieux
Le 3 septembre 2026, OpenAI publie GPT-6 Astra, présenté comme son meilleur modèle d’ingénierie logicielle et disponible dans Codex. Sur l’Intelligence Index d’Artificial Analysis, il obtient 61. Exactement le score de la génération précédente, et cinq points sous Claude Fable 5.1. Un commentaire sur Hacker News résume la déception en une ligne : « First chart: from score 61 to drumroll 61. »
La vraie nouveauté est ailleurs, et elle est passée sous les radars. Astra introduit dans Codex un mécanisme de contexte inédit : plutôt que de compacter la conversation en résumé quand la fenêtre se remplit, le modèle tient des notes structurées et garde ses fenêtres précédentes indexées et consultables. Il peut retrouver le message d’erreur exact d’il y a trois cycles de compaction. Six jours plus tard, la version 0.154.0 de Codex ajoute des espaces de travail isolés pour faire tourner plusieurs agents en parallèle sans collision, et se décrit lui-même comme une « couche de coordination persistante ».
Relisez la liste : mémoire persistante, indexation, isolation, coordination. Aucun de ces mots ne parle de génération. Ce sont des décisions d’architecture. Le laboratoire qui vend la production de code a consacré sa sortie majeure à construire la structure autour de la production.
Ce déplacement porte un nom, et le métier l’avait baptisé cinq mois avant qu’OpenAI ne le mette en produit. Dans un texte publié le 2 avril 2026 sur le site de Martin Fowler, Birgitta Böckeler appelle harness engineering le travail consistant à construire tout ce qui entoure le modèle : gestion du contexte, persistance de la mémoire, bac à sable isolé, garde-fous. La formule qui a fait le tour du métier tient en trois termes, Agent = Model + Harness, et elle décrit exactement ce qui s’est joué le 3 septembre : le modèle est resté à 61, c’est le harness qui a progressé.
C’est une confirmation directe de ce que nous écrivions en juillet sur le contexte comme véritable reine de la partie. Et c’est aussi pourquoi courir après chaque nouveau modèle, comme nous l’avons documenté dans Le SOTA dure six semaines, est devenu le plus mauvais usage de votre attention. Ce qui progresse n’est plus la capacité à produire. C’est la capacité à tenir ce qu’on produit.
L’architecture est devenue une variable de performance
Tant que l’architecture relevait du goût d’ingénieur, on pouvait la reporter. Elle est devenue mesurable, et elle décide désormais si la machine réussit ou échoue.
Une étude de janvier 2026 a analysé 33 000 pull requests écrites par cinq agents de codage. Le constat est net : les contributions rejetées sont celles qui touchent le plus de fichiers et proposent les changements les plus volumineux. La documentation et les mises à jour de build passent, les corrections de bug et les optimisations échouent. La surface du changement prédit l’échec mieux que la difficulté de la tâche.
S’y ajoute une mécanique implacable, celle des erreurs qui se composent. Sur une tâche en vingt étapes enchaînées, passer la fiabilité par étape de 95 % à 97 % fait monter le taux de succès de 36 % à 54 %. Autrement dit, doubler la qualité du modèle continue de perdre une exécution sur deux. Le seul levier qui reste n’est pas le modèle : c’est le nombre d’étapes couplées. Découper, isoler, réduire les dépendances. Ce sont les trois gestes de l’architecte.
Le modèle ne connaît pas votre architecture. S’il n’en trouve pas, il la remplace par du copier-coller.
Cette phrase se vérifie sur 623 millions de changements de code analysés entre 2023 et 2026 par GitClear. La duplication progresse de 81 %. Le refactoring recule de 70 %. Et surtout, les appels entre fichiers chutent de 35 %. Le code produit avec l’IA est moins relié, moins réutilisé, moins structuré qu’avant. GitClear vend des outils d’analyse de code, la précaution s’impose, mais la direction du signal est cohérente avec le reste.
La facture arrive en aval. Selon l’AI Engineering Report 2026, le temps médian de revue a été multiplié par cinq, et 31 % des pull requests sont fusionnées sans revue dans les équipes à forte adoption. Thoughtworks a donné un nom à ce phénomène dans son Technology Radar d’avril 2026 : la dette cognitive, cet écart qui se creuse entre ce que le système fait et ce que l’équipe en comprend. Sa CTO Rachel Laycock y ajoute la formule qui tranche : le point d’inflexion où nous sommes n’est pas une affaire de technologie, c’est une affaire de technique.
L’IA amplifie, elle ne corrige pas
C’est le résultat le plus inconfortable de toute la littérature récente, et le plus utile pour un dirigeant. Le rapport DORA de Google Cloud, construit sur environ 5 000 professionnels, établit que l’adoption de l’IA augmente simultanément le débit de livraison et l’instabilité de livraison. Dans l’édition 2024, chaque hausse de 25 % de l’adoption s’accompagnait d’une dégradation de 7,2 % de la stabilité.
Mais la conclusion qui compte est celle-ci : l’IA amplifie les forces des organisations performantes et les dysfonctionnements de celles qui peinent. Là où existent une plateforme interne, des interfaces propres et des tests solides, elle se comporte en collaborateur puissant. Là où l’outillage est fragmenté, les données en silo et l’infrastructure fragile, elle accélère la production de dette.
flowchart TD
A["Une équipe adopte l'IA"] --> B{"Socle technique existant"}
B -->|"Plateforme, interfaces nettes, tests"| C["Débit en hausse, qualité tenue"]
B -->|"Outillage fragmenté, données en silo"| D["Débit en hausse, dette en hausse"]
L’IA ne comble pas l’écart entre les organisations. Elle l’élargit.
Ce qui invalide au passage la réponse réflexe. Gartner anticipe que 80 % des grandes organisations logicielles auront une équipe plateforme d’ici fin 2026, mais que moins de 30 % en tireront un gain de productivité mesurable. Créer l’équipe ne suffit pas. Ce qui distingue, ce sont les frontières qu’elle sait tracer.
Ce qui ne se génère pas
Reste la couche que personne ne produit en une soirée. Elle a un nom peu séduisant, exploitation, et elle pèse entre 60 et 80 % du coût de cycle de vie d’un logiciel. L’IA vient d’effondrer les vingt à quarante pour cent restants. Elle n’a pas touché au reste.

L’illustration la plus nette est arrivée cet été. Le 16 juillet 2026, Hugging Face publiait la chronologie d’une intrusion menée par un système d’agents autonomes : des milliers d’actions individuelles exécutées à travers des bacs à sable éphémères, une entrée par deux chemins d’exécution de code dans le traitement des jeux de données, et le vol d’identifiants de service. Rien dans cet incident ne relève de la qualité du code généré. Tout relève de l’isolation, des droits et de la détection.
La même limite est écrite noir sur blanc dans la documentation des espaces de travail parallèles de Codex : ils séparent les fichiers et les branches, mais n’isolent ni les identifiants, ni l’accès réseau, ni les processus, ni les services externes. C’est exactement le sujet que nous traitions dans Un grand pouvoir, un grand coffre-fort : la puissance se distribue vite, la gouvernance des accès ne se distribue pas toute seule.
Le marché, lui, a déjà arbitré. Au premier trimestre 2026, 69,3 % des offres de développeur sont des postes seniors, contre 4,5 % de postes débutants. GitHub, analysant ses propres utilisateurs les plus avancés, le formule sans détour : la valeur d’un développeur se déplace vers le jugement, l’architecture, le raisonnement et la responsabilité du résultat.
L'architecture n'est pas une rente éternelle, c'est l'avantage du moment. Les limites de contexte et de mémoire sont précisément ce que les laboratoires travaillent aujourd'hui. Et l'intuition se trompe dans les deux sens : l'essai randomisé de METR a montré des développeurs expérimentés 19 % plus lents avec l'IA sur du code qu'ils maîtrisaient, alors qu'ils se croyaient 20 % plus rapides.
Nous avons documenté l’effondrement du coût de produire dans La fin du jour-homme, puis le retour de la question du quoi produire dans Construire redevient moins cher qu’acheter. Voici le troisième temps, et c’est le seul qui se voit en production : savoir ce qui tient. Produire ne différencie plus personne, et Astra vient d’en administrer la preuve en consacrant sa sortie à mieux s’organiser plutôt qu’à mieux coder. La distinction ne se joue plus au moment où l’application apparaît. Elle se joue six mois plus tard, quand il faut la faire évoluer, l’intégrer, l’exploiter et en répondre.
- La nouveauté d'Astra n'est pas la génération de code mais la mémoire persistante, l'indexation et l'isolation. Des décisions d'architecture.
- L'architecture est devenue mesurable : les contributions d'agents qui échouent sont celles qui touchent trop de fichiers, et les appels entre fichiers reculent de 35 % quand l'IA écrit.
- L'IA amplifie l'existant. Elle récompense les organisations structurées et accélère la dette des autres.
- La couche qui ne se génère pas, exploitation, droits, intégration, pèse 60 à 80 % du coût réel d'un logiciel.