Le modèle inclut un paramètre d’effort de raisonnement que les développeurs peuvent ajuster de 0,2 à 0,99. Thinking Machines a déclaré que le paramètre permet aux utilisateurs d’équilibrer les performances par rapport au nombre de jetons générés. Lors des tests de l’entreprise, Inkling a égalé le score Terminal Bench 2.1 du Nemotron 3 Ultra tout en générant environ un tiers du nombre de jetons.

Les développeurs peuvent affiner Inkling via Tinker en utilisant des longueurs de contexte de 64 000 ou 256 000 jetons et le tester via Inkling Playground. Le modèle est disponible via les API de Together AI, Fireworks, Modal, Databricks et Baseten. Il est également pris en charge par des logiciels d’inférence, notamment SGLang, vLLM, TokenSpeed, llama.cpp et Hugging Face Transformers.

Les poids complets d’Inkling sont disponibles sur Hugging Face en tant que point de contrôle d’origine et en tant que point de contrôle NVFP4 quantifié. Thinking Machines a également présenté en avant-première Inkling-Small, qui compte 276 milliards de paramètres au total et 12 milliards de paramètres actifs. La société a annoncé qu’elle publierait le poids complet du modèle plus petit après avoir terminé les tests.

A lire également