Ce qui importe, ce n’est pas que l’agent code plus vite
Le changement le plus utile dans le développement assisté par l’IA n’est pas l’autonomie totale. C’est la capacité à organiser une collaboration vérifiable entre un humain et un agent. C’est ce sur quoi se concentre HAI-Eval, un benchmark de recherche axé sur la synergie entre l’humain et l’IA dans le domaine du codage. Son point de départ est simple : les évaluations classiques mesurent souvent un modèle isolé face à un problème bien délimité. Le travail réel sur les logiciels ne se présente pas toujours ainsi. Les tâches importantes nécessitent de décrypter un contexte imparfait, de choisir une stratégie, de comprendre l’intention du produit, puis de le mettre en œuvre sans perturber le système.
Dans ce contexte, la question intéressante n’est plus « l’IA peut-elle remplacer le développeur ? » La meilleure question est : « Dans quelles conditions un duo humain-agent produit-il un meilleur résultat que chacune des parties travaillant seule ? » HAI-Eval présente des résultats allant dans ce sens : les modèles autonomes obtiennent de mauvais résultats sur les tâches nécessitant une collaboration, les humains travaillant sans aide restent limités par le temps et la complexité, et la collaboration améliore considérablement les chances de réussite. Ce n’est pas un slogan marketing. C’est un rappel de conception à l’intention des équipes : la valeur de l’agent augmente lorsque le flux de travail donne au développeur le pouvoir de guider, de contraindre, de vérifier et de décider.
Ce message arrive à point nommé. Les agents de codage sortent des laboratoires. Ils modifient des dépôts, préparent des tests, explorent des API, résument des incidents et proposent des pull requests. L’automatisation devient plus ambitieuse, mais les risques se concrétisent également. Plus l’agent produit rapidement, plus la révision humaine doit être structurée. Plus il est capable d’agir, plus l’équipe doit définir explicitement où s’arrête la délégation.
Pourquoi les benchmarks classiques ne suffisent plus
Les benchmarks de code ont longtemps été utiles pour comparer des modèles sur des tâches fermées : écrire une fonction, réussir une suite de tests, corriger un bug isolé. Ces exercices restent importants, mais ils mesurent principalement l’exécution. Le développement logiciel professionnel ajoute autre chose : choisir le bon problème, répartir le travail, interpréter des exigences ambiguës, préserver l’architecture, trouver un compromis entre lisibilité et performances, tenir compte de l’historique des incidents et rejeter une solution qui semble élégante mais qui n’a pas sa place dans le produit.
HAI-Eval est intéressant car il tente de mesurer cette zone intermédiaire. Les tâches nécessitant une collaboration ne sont pas simplement difficiles pour un modèle. Elles sont conçues pour exiger une coordination : l’humain apporte le cadre, le jugement et la stratégie ; l’agent apporte la rapidité, la mémoire de travail, l’exploration et la génération. Le résultat souhaité n’est pas un robot autonome, mais un système fonctionnel où chaque partie compense les limites de l’autre.
Pour une équipe produit, cela modifie la manière dont il convient d’interpréter les progrès de l’IA. Un meilleur modèle n’est pas seulement celui qui génère davantage de lignes de code. C’est celui qui accepte les contraintes de manière plus fiable, met en évidence l’incertitude, facilite la vérification et donne au développeur un contrôle clair sur les décisions importantes. Le benchmark devient un indicateur du flux de travail, et non plus seulement un concours de modèles.
Le développeur ne disparaît pas ; c’est le levier d’action qui change
Le rapport 2026 d’Anthropic sur les tendances du codage agentique soulève un point connexe : les ingénieurs s’éloignent progressivement de l’écriture de chaque ligne de code pour se consacrer à l’orchestration d’agents, à l’évaluation de leurs résultats et à la définition d’une orientation stratégique. Il est important de noter que cette transition ne supprime pas l’expertise humaine. Elle la redéploie. Un développeur de valeur devient celui qui est capable de définir le problème, de préparer le contexte, de choisir les limites, d’analyser les données et de décider si la solution doit être déployée.
Il s’agit d’un changement de levier. Auparavant, la compétence visible était souvent la capacité à produire rapidement un correctif. Désormais, cette capacité peut être partiellement déléguée. La compétence rare devient la capacité à reconnaître un bon correctif au sein d’un système en évolution. Le changement réduit-il réellement la complexité ? Respecte-t-il les invariants métier ? Élargit-il une autorisation sans raison valable ? Crée-t-il une dette technique que personne ne remarquera avant le prochain incident ? Ces questions restent du ressort de l’humain, car elles relient le code à la responsabilité.
Dans les équipes matures, l’agent doit donc être considéré comme un collègue très rapide mais non responsable. Il peut proposer, rechercher, comparer, tester, reformuler et documenter. Il ne doit pas devenir l’autorité finale. La responsabilité des décisions de fusion, de la sécurité, de la conformité et de l’impact sur les utilisateurs doit rester attribuée à une personne ou à une chaîne de décision claire.
Ce que confirment les recherches sur la supervision
Une autre étude récente sur la supervision humaine des systèmes agents dans la pratique décrit plusieurs formes de travail de supervision déjà utilisées par des développeurs expérimentés : le contrôle a priori, la co-planification, la surveillance en temps réel et la révision a posteriori. Cette taxonomie est importante car elle montre que la supervision humaine ne doit pas se réduire à une simple étape d’approbation finale. Si l’humain n’intervient qu’à la fin, il risque de se voir présenter un écart important, difficile à contester, accompagné d’explications convaincantes mais incomplètes.
Le contrôle a priori définit le périmètre : fichiers autorisés, actions interdites, dépendances à ne pas modifier et critères de réussite. La co-planification empêche l’agent de s’engager précipitamment dans une voie pratique mais erronée. La surveillance en temps réel permet d’interrompre une hypothèse erronée avant qu’elle ne se traduise par un changement majeur. L’examen a posteriori vérifie les éléments probants : tests, journaux, hypothèses, impact sur la sécurité, lisibilité et réversibilité.
Cette décomposition rend la notion d’« intervention humaine » beaucoup plus concrète. Il ne suffit pas de dire qu’une personne a examiné le résultat. Les équipes doivent savoir à quel moment le plan a été contrôlé, quelles informations ont été vérifiées, quelles actions ont été approuvées et quels risques ont été rejetés.
La bonne unité de travail devient la décision vérifiable
Si les équipes prennent l’évaluation HAI-Eval au sérieux, elles doivent cesser de concevoir des flux de travail axés uniquement sur la génération de code. La bonne unité de travail devient la décision vérifiable. Un agent peut proposer plusieurs options, mais le système doit aider le développeur à comprendre pourquoi une option a été choisie. Un agent peut écrire des tests, mais le flux de travail doit montrer quel comportement a échoué auparavant et a réussi par la suite. Un agent peut modifier la configuration, mais la chaîne de révision doit rendre visible l’étendue des répercussions.
Cela nécessite une discipline simple. Tout d’abord, demandez un plan lorsque la tâche dépasse le cadre d’une simple correction mineure. Ensuite, limitez les droits de l’agent au strict nécessaire pour la tâche. Exigez ensuite des preuves exécutables : tests, commandes, captures de journaux et reproduction du bug. Enfin, réservez à l’humain le dernier mot sur les modifications touchant aux données, aux autorisations, à la production, aux paiements, à l’authentification ou à l’expérience client critique.
Cette approche n’est pas anti-automatisation. C’est ce qui permet aux équipes d’utiliser l’automatisation plus largement. Les gens font plus facilement confiance aux agents lorsqu’ils savent où se trouvent les freins, les journaux et les points d’approbation. Une vitesse durable découle d’un contrôle clair, et non de l’absence de contrôle.
Ce que les équipes peuvent changer dès maintenant
- Rédigez des spécifications plus concises. Un agent fonctionne mieux lorsque l’objectif, les contraintes et les exclusions sont explicites.
- Demandez une stratégie avant le correctif. Pour les tâches risquées, le plan doit être examiné avant l’écriture du code.
- Conservez les preuves. Les tests exécutés, les hypothèses et les limites doivent être visibles dans la pull request.
- Empêchez les modifications silencieuses des garde-fous. Un agent ne doit pas affaiblir l’intégration continue (CI), supprimer un test ou élargir une autorisation sans examen spécifique.
- Formez les développeurs à l’évaluation. La compétence essentielle réside désormais dans la lecture critique des résultats de l’agent, et non plus dans une confiance aveugle.
Ces pratiques renforcent le duo homme-agent car elles clarifient les rôles. L’agent se charge de l’exploration et de l’exécution. L’humain conserve l’intention, le contexte et l’autorité.
Conclusion : l’autonomie utile reste une délégation supervisée
HAI-Eval renforce une vérité simple : en matière de logiciels, les meilleurs résultats proviennent rarement d’une autonomie brute. Ils découlent d’une collaboration bien conçue. Les agents peuvent accélérer la production, réduire le coût de l’exploration et aider les équipes à tester plus rapidement. Mais la décision de mise en production revient toujours aux personnes qui comprennent les utilisateurs, le système, les risques et les conséquences.
L’avenir du développement assisté par l’IA ne doit donc pas être présenté comme la fin du développeur. Il doit être conçu comme un cockpit amélioré. Plus les agents gagnent en capacités, plus le rôle de l’humain doit être explicite : encadrer, superviser, vérifier et assumer la responsabilité. C’est ainsi que l’IA devient véritablement utile pour les équipes de développement logiciel : non pas comme une machine qui remplace le jugement humain, mais comme une machine qui élargit la portée de ce jugement.