Michelin a désactivé par défaut le mode Auto de GitHub Copilot après avoir regardé de près comment il choisissait ses modèles. Sur environ 700 requêtes de test, une même phrase pouvait aboutir à un modèle différent entre 44 % et 74 % du temps. Et sur plusieurs tâches vérifiables, le petit modèle le moins cher faisait aussi bien que ceux sélectionnés automatiquement.
Même requête, modèle différent
Pendant trois jours, Romain Masseboeuf, ingénieur chez Michelin, a traité le mode Auto de Copilot comme une boîte noire. Même phrase répétée plusieurs fois, tâches dont le résultat pouvait être vérifié automatiquement, sessions de plusieurs échanges : au total, environ 700 requêtes, dont 644 ont laissé une trace exploitable du routage. Les résultats sont détaillés dans un long billet technique publié par Michelin.
Premier constat : le texte envoyé à Copilot produit des scores très stables. En revanche, le modèle choisi derrière ne l’est pas du tout. À texte strictement identique, deux exécutions successives aboutissaient déjà à un modèle différent dans 44 % à 74 % des cas, selon les corpus testés. Michelin a ainsi observé qu’un même niveau de « raisonnement » pouvait déboucher sur GPT-5.6 Luna, GPT-5.6 Sol, Terra, Claude Sonnet ou Opus. Sur une simple demande de renommage de variable, la facture est passée de 0,23 à 3,24 crédits selon le modèle tiré.
GitHub présente pourtant son mode Auto comme un système capable d’évaluer la complexité de la tâche et de l’orienter vers le modèle le plus adapté, en tenant aussi compte de sa disponibilité. Les traces observées chez Michelin racontent quelque chose d’un peu différent : le texte détermine d’abord une plage de modèles possibles. Le choix final à l’intérieur de cette plage peut ensuite varier.
Le modèle bon marché suffisait sur les six tâches testées
La question du prix a fini de convaincre Michelin. L’équipe a préparé six tâches dont elle pouvait vérifier automatiquement le résultat : corriger une erreur 500 dans un backend Python, résoudre un test instable, traiter une fuite mémoire Java, réaliser une agrégation avec pandas, modifier un README ou encore corriger une injection SQL.
GPT-5.6 Luna, l’un des modèles les moins chers disponibles dans le catalogue de l’entreprise, a réussi les six tâches lors de chacun des essais. Le mode Auto n’a pourtant sélectionné Luna pour aucune d’entre elles. Il a choisi Sonnet, Sol ou Opus, pour un coût six à dix-huit fois supérieur par tâche, sans obtenir davantage de réussites dans cette série de tests. Même la remise de 10 % accordée lors de l’utilisation du mode Auto n’a pas inversé le calcul. Sur ce petit ensemble de tâches, Michelin estime que le coût cumulé restait environ douze fois supérieur à celui obtenu en imposant Luna.
Ce résultat ne constitue pas un benchmark général des modèles. Michelin le précise lui-même : les essais portent sur un catalogue donné, une version donnée de Copilot et quelques tâches choisies par l’auteur.
La première question peut fixer le prix de toute la conversation
Le comportement devient encore plus étrange au fil d’une discussion. Michelin a rejoué plusieurs fois une même conversation de sept questions en changeant seulement leur ordre. Lorsque la session commençait par la question la plus complexe, Copilot sélectionnait généralement Sonnet ou Sol et conservait ce modèle jusqu’au bout. Coût observé : environ 13,7 crédits. En commençant par une demande triviale, Luna restait au contraire utilisé jusque sur les questions difficiles dans cinq sessions sur huit. Le coût tombait alors à 0,78 crédit.
GitHub a documenté depuis ce comportement en indiquant que le routage cherche à éviter les changements de modèle en cours de session, notamment parce qu’ils font perdre le bénéfice du cache et peuvent augmenter les coûts.
Michelin a donc changé son réglage par défaut. Depuis septembre, les nouvelles conversations Copilot de l’entreprise démarrent sur GPT-5.6 Luna plutôt qu’en Auto. Les développeurs restent libres de choisir un modèle plus puissant lorsqu’ils estiment en avoir besoin.
Il faudra toutefois refaire une partie des mesures. Quelques jours après les tests de Michelin, GitHub a ajouté trois niveaux au mode Auto — Efficiency, Balance et Intelligence — qui modifient la manière dont les modèles sont privilégiés lors du routage.
Le premier passage au banc d’essai aura au moins eu un effet immédiat : chez Michelin, ce n’est plus le routeur qui choisit en premier.








