Au cours des deux dernières années, de nombreuses entreprises ont adopté une approche maximaliste en matière d’adoption de l’IA : en lançant davantage de cas d’utilisation, en affectant davantage d’employés, en déployant davantage d’agents et en consommant davantage de jetons. Pour les nouvelles technologies, c’est rationnel. L’entreprise ne sait pas encore quels workflows seront modifiés, quels modèles seront suffisamment fiables ou quels collaborateurs adopteront les outils. Le moyen le plus rapide de le savoir est de déployer autant d’agents et d’exécuter autant de pilotes que possible pour déterminer ce qui fonctionne.
Mais cette année, la conversation a changé. Dans presque toutes les revues de direction, la question n’est plus « Comment pouvons-nous obtenir plus d’IA ? » ou “Quel modèle est le plus intelligent ?” La question est « Comment puis-je produire des résultats percutants tout en gardant les coûts de l’IA sous contrôle ? » Différentes entreprises ont des réponses différentes. Uber a resserré ses dépenses internes en matière d’IA après que la consommation ait été bien en avance sur les prévisions. Anthropic, OpenAI et Google ont réduit de manière agressive les prix des jetons d’entrée et lancé des caches rapides. Et Cursor, avec Composer 2.5, considère désormais le coût comme un facteur important dans la sélection du modèle, pas seulement les performances.
La suppression des modèles de jetons et de frais est une solution, mais elle ignore un problème plus profond : la plupart des entreprises ne prévoient pas d’utiliser les jetons de manière efficace. Les pipelines d’IA modernes se comportent comme des tamis : des jetons et des dollars fuient à chaque phase d’exécution. Verser des jetons moins chers à travers une fondation qui fuit n’est pas une solution durable. Pour produire réellement de bons résultats à moindre coût, les entreprises ont besoin d’une fondation architecturale qui colmate ces fuites. Voici comment.
Figure 1 – Canaux d’IA qui fuient : où des jetons et de l’argent sont perdus chaque jour.
publicité
publicité
Cinq piliers de l’optimisation des jetons
L’optimisation des jetons nécessite plus que des invites intelligentes. Il faut une architecture conçue pour répondre à cinq points de défaillance prévisibles qui apparaissent encore et encore :
-
Gonflement du contexte: Le gonflement du contexte de la fenêtre est la première fuite. Plus vous obtenez d’informations, plus vous payez cher et plus les modèles volent. L’amélioration vient en ajoutant du contexte avant étape rapide – avec une base de données sur laquelle l’agent peut s’appuyer pour toujours fournir la version la plus fiable de la vérité. La gestion des données de référence utilise la mise en correspondance, la fusion et la déduplication déterministes pour intégrer des ensembles de données qui se chevauchent ou sont en conflit dans un seul enregistrement unique, garantissant ainsi que les agents ont toujours accès au bon client, au bon compte, à la bonne politique, à la bonne transaction et à la bonne activité récente – non pas via des invites, mais intégrés dans l’infrastructure de chaque interaction.
-
Accès aux données non sécurisé. Sans gouvernance claire, les agents parcourent sans but l’entrepôt de données à la recherche d’informations crédibles, puis vérifient les résultats après coup, perdant ainsi du temps et des jetons et produisant des actions incohérentes. L’établissement de catalogues de données, de lignées, d’autorisations et de signaux de qualité fait de la gouvernance un routage de signaux plutôt qu’un point de contrôle, dirigeant les agents vers des données certifiées dès le premier saut.
-
mauvais modèle. La force brute algorithmique – envoyer chaque tâche au modèle de démarcation – est le comportement le plus coûteux du bâtiment. L’acheminement des coûts via le bon modèle, plutôt que le plus grand, est l’un des meilleurs moyens d’augmenter l’efficacité. Ligne de coûts de travail. Traitez le modèle comme un portefeuille : petit et efficace pour les recherches et la classification, niveau intermédiaire ajusté pour les flux de travail de domaine, la limite est réservée aux raisons nouvelles et au jugement sensible.
-
Manque de mémoire persistante. Chaque agent apatride démarre chaque interaction à partir de zéro. Il doit recharger le contexte, retraiter l’historique et redécouvrir toutes les exceptions résolues. La mémoire structurée transforme chaque nouvelle interaction en une interaction incrémentielle. L’agent conserve et récupère les conditions utiles en cas de besoin (faits pertinents, décisions antérieures, préférences de l’utilisateur et tâches ouvertes) au lieu de repartir de zéro. Il réduit la consommation de jetons, améliore la cohérence et réduit le coût par interaction.
-
Sémantique à usage unique. Trop d’agents d’entreprise traitent les demandes répétées comme s’ils les voyaient pour la première fois. Par exemple, relisez le même contexte, exécutez à nouveau pour obtenir le même résultat et reproduisez les réponses qui peuvent avoir été mises en cache, intégrées ou pré-calculées. En associant le cache rapide, la réinsertion et la sortie précalculée aux structures sémantiques déjà présentes dans les flux de données d’entreprise, les entreprises peuvent rendre les nouvelles demandes moins chères, plus rapides et plus fiables.
L’efficacité des jetons est le prochain avantage concurrentiel
publicité
publicité
L’optimisation des jetons fait la différence entre une expérience inefficace et une base qui stimule la productivité de l’entreprise.
Les grandes entreprises qui utilisent des agents IA pour des opérations de vente ou de service peuvent traiter des milliers d’interactions avec des agents chaque jour. Chaque interaction qui transmet des données brutes et non conservées à une invite LLM consomme 5 à 10 fois plus de jetons que nécessaire. À 10-15 $ par million de jetons, il s’accumule rapidement sur une flotte d’agents. Les entreprises qui investissent dans la gestion des données de référence et la gouvernance des données créent un avantage naturel : elles s’appuient sur des données pré-organisées, sémantiquement enrichies et évaluées de qualité plutôt que sur du bruit brut.
J’ai pu constater ces avantages directement auprès des clients avec lesquels je travaille quotidiennement. Je le constate personnellement dans mon travail avec les entreprises clientes. Lorsque la gestion des données de référence d’Informatica s’intègre à Data 360, la plateforme de données client de Salesforce, elle garantit que chaque agent d’IA est ancré dans un contexte client et commercial fiable. Ensemble, l’architecture transforme la consommation non réglementée de l’IA en valeur commerciale réglementée et mesurable.
Chaque entreprise peut acheter plus de jetons. Très peu de gens savent comment tirer plus de valeur de moins. La prochaine phase des entreprises d’IA ne sera pas définie par celui qui utilise le plus de jetons, gère le plus grand modèle ou remplit la plus grande fenêtre contextuelle. Il sera défini par qui peut convertir la consommation d’IA en valeur commerciale mesurable.
publicité
publicité
Les opinions exprimées dans les commentaires de Fortune.com sont uniquement les opinions de leurs auteurs et ne reflètent pas nécessairement les opinions et les convictions de fortune.
Cette histoire a été initialement présentée sur Fortune.com