La baisse du prix des tokens ne suffit plus à contenir la facture de l’IA. À mesure que les usages passent à l’échelle, le coût dépend surtout de la manière dont sont conçus les systèmes, placées les charges d’inférence et orchestrés les flux de données. Eric Bezille, CTO ambassador chez Dell Technologies, explique pourquoi l’architecture devient désormais le principal levier d’optimisation.
La baisse du coût des tokens ne se traduit pas nécessairement par une baisse du coût de l’IA. C’est le paradoxe souligné par McKinsey : malgré l’effondrement du coût d’inférence de niveau GPT-3.5, passé de 17 € à 6 centimes par million de tokens depuis 2024, les dépenses des entreprises en LLM ont triplé. À l’échelle de la production, l’enjeu n’est donc plus seulement d’acheter des tokens au meilleur prix, mais de concevoir une architecture capable d’en optimiser l’usage.
Pendant longtemps, les discussions autour de l’économie de l’IA se sont concentrées sur le coût des LLM : comparer les prix par token, évaluer les grilles tarifaires des fournisseurs et calculer le coût unitaire d’une requête.
À mesure que les projets d’IA passent du stade expérimental à celui de la production à grande échelle, l’économie des tokens devient un enjeu stratégique. Le prix d’un modèle n’est plus qu’une variable parmi d’autres. Les entreprises doivent désormais optimiser l’ensemble de la chaîne : localisation de l’inférence, fréquence des appels, taille du contexte, mécanismes de récupération des données et choix architecturaux. Un modèle peu coûteux peut ainsi se révéler plus cher à exploiter qu’un modèle plus onéreux si l’architecture qui l’entoure consomme inutilement des tokens. La véritable bataille se joue désormais sur l’efficacité globale du système, et non plus uniquement sur le coût unitaire du modèle.
De la course aux modèles à la course à l’efficacité des tokens
La valeur de l’IA d’entreprise est souvent créée là où résident déjà les données. Plus l’inférence occupe une part croissante du calcul IA, plus le choix de l’infrastructure se complexifie. Il ne s’agit plus de savoir où sont entraînés les grands modèles, mais où l’IA s’exécute au quotidien, où les données sont récupérées, où le contexte est réutilisé, et où les coûts peuvent être maîtrisés. Le choix de l’infrastructure devient donc déterminant, tant pour maîtriser les coûts que pour assurer un succès opérationnel de l’IA.
En production, l’IA change d’échelle et de nature. Là où un prototype repose sur quelques requêtes ponctuelles, un système déployé exécute potentiellement des milliers, voire des millions d’appels d’inférence chaque jour. Cette réalité est encore amplifiée par l’IA agentique : un même workflow peut planifier des actions, récupérer des données, invoquer plusieurs outils, vérifier les résultats, relancer des tâches en cas d’échec et les transmettre à d’autres agents. Chaque interaction consomme des tokens supplémentaires, augmente la latence et fait grimper les coûts. Dans ce contexte, l’efficacité des tokens devient un enjeu opérationnel et économique majeur, bien au-delà du simple prix affiché par le modèle.
L’efficacité des tokens : un enjeu d’architecture avant tout
Afin de traiter efficacement les charges de travail d’IA, l’approche la plus pertinente repose sur un mix d’environnements informatiques. Cette diversification est essentielle car un modèle économique viable lors d’un pilote peut rapidement devenir coûteux lorsque l’IA est déployée à grande échelle. Cela s’explique par le fait que les coûts de l’IA générative dépendent autant de l’architecture que du modèle lui-même. Le placement des charges d’inférence doit être adapté aux contraintes de prévisibilité, de sensibilité des données et de latence afin d’exécuter chaque traitement dans l’environnement le plus efficace économiquement. Par ailleurs, la conception du système de recherche de données, notamment via une architecture RAG performante, conditionne directement la consommation de tokens : une indexation, des métadonnées et des mécanismes de filtrage de qualité permettent de limiter le contexte envoyé au modèle tout en améliorant la pertinence des réponses.
La maîtrise des coûts ne dépend plus uniquement du prix des modèles, mais de la façon dont les données, la mémoire et les agents sont orchestrés. La recherche vectorielle, le cache et la réutilisation des connaissances réduisent les traitements redondants et optimisent l’utilisation des tokens. Dans le même temps, les workflows agentiques doivent être gouvernés afin de mobiliser le bon modèle au bon moment, limiter les appels superflus aux outils et aux données, et intégrer les contrôles IA et humains nécessaires. À l’échelle de l’entreprise, ces décisions d’architecture déterminent directement la performance, la gouvernance et la rentabilité des initiatives d’IA.
Quand la consommation de tokens devient un signal de performance
Une consommation élevée de tokens peut être le symptôme d’un problème plus profond : une récupération d’informations peu efficace, une gouvernance des données insuffisante, un choix de modèle inadapté, des boucles agentiques superflues ou encore un mauvais positionnement des charges de travail.
À mesure que l’inférence devient le principal moteur de la consommation de calcul liée à l’IA, les organisations devront disposer d’une plus grande flexibilité dans leurs choix d’infrastructure. La prochaine génération d’IA d’entreprise ne se distinguera pas uniquement par la performance ou le prix des modèles, mais par la qualité de l’architecture qui les soutient.
En optimisant l’emplacement de l’inférence, en rapprochant l’IA des données et en gouvernant la consommation de tokens, les organisations peuvent transformer une contrainte de coûts en un levier durable de performance et de différenciation. Pour cela elles devront se doter des capacités de pouvoir être maître de leur choix par la mise en place d’une politique d’architecture hybride, leur permettant d’exécuter le bon modèle, sur la bonne donnée, au bon endroit et au meilleur coût.








