« Le problème avec l’IA agentique à grande échelle est que la consommation est difficile à prévoir, les recherches et les recherches des agents créent des coûts et des latences complexes et imprévisibles, et les équipes financières détestent ces factures variables. Savoir que vos agents rechercheront dans un plafond défini et que vous pouvez définir ce plafond par charge de travail est ce qui rend la recherche agentique sûre à grande échelle plutôt qu’un compteur incontrôlable », a noté Chaturvedi.

Les aspects économiques pourraient devenir encore plus convaincants, a ajouté Chaturvedi, si le modèle spécialisé peut offrir la qualité de récupération revendiquée par des modèles à usage général plus grands avec une latence plus faible.

Adaptive Instructed-Retriever, selon Databricks, a égalé ou dépassé la qualité de récupération de Claude Sonnet 5, GPT-5.6 Luna et DeepSeek-V4-Flash dans ses évaluations internes tout en complétant les requêtes en 5,8 secondes, soit plus de deux fois plus vite que ces modèles.

A lire également