L’optimisation conjointe du modèle et de l’agent pourrait améliorer la planification et la gestion du contexte, mais tout avantage concurrentiel devrait être démontré par de meilleurs résultats sur les projets d’entreprise tout en réduisant le besoin d’intervention humaine, a déclaré Pareekh Jain, PDG de Pareekh Consulting.
Meta a rapporté que Muse Spark 1.2 a obtenu un score pass@1 de 82,9 % sur Terminal-Bench 2.1, derrière Claude Opus 5 mais légèrement devant GPT-5.6 Terra. Sur DeepSWE 1.1, le modèle a obtenu un score de 59,3 %, derrière ses deux concurrents.
Pour Terminal-Bench 2.1 et DeepSWE 1.1, Meta a évalué chaque modèle avec son agent de codage sélectionné plutôt que d’utiliser le même agent partout. Il a également reconnu que les modèles propriétaires concurrents pouvaient avoir fonctionné différemment avec des outils et des invites spécialement conçus pour eux.
