Inkling : 975 milliards de paramètres à poids ouverts signés Mira Murati
Inkling est le premier modèle d'IA en poids ouverts de Thinking Machines Lab, le laboratoire fondé par Mira Murati, ancienne directrice technique d'OpenAI. Ses poids se téléchargent gratuitement sous licence Apache 2.0; seule l'inférence, sur vos machines ou via une API partenaire, se paie. Sous le capot, un mélange d'experts de 975 milliards de paramètres, dont 41 milliards actifs par requête, et une fenêtre de contexte d'un million de tokens. Il lit texte, images et audio, puis répond en texte, code compris.
- Poids téléchargeables et modifiables sous licence Apache 2.0
- Comprend nativement texte, images et audio
- Fenêtre de contexte d'un million de tokens
- Effort de réflexion réglable pour maîtriser les coûts
- Déclinaison Inkling-Small pour les configurations modestes
- Sorties limitées au texte, sans génération d'images
- Version complète réservée aux gros clusters GPU
- Performance brute en retrait des tout meilleurs modèles
Trois sens en entrée, un curseur d'effort en sortie
Inkling accepte du texte, des images et de l'audio, et produit du texte, y compris du code et des données structurées. Ce modèle LLM repose sur une architecture en mélange d'experts: sur ses 975 milliards de paramètres, seuls 41 milliards se réveillent à chaque requête, ce qui allège la facture d'inférence. L'entraînement a englouti 45 000 milliards de tokens mêlant texte, images, audio et vidéo.
Son réglage le plus malin au quotidien: l'effort de réflexion. Vous baissez le curseur, la réponse tombe plus vite et consomme moins; vous le montez, le modèle creuse. Sur un test de code, Thinking Machines annonce le même score que le Nemotron 3 Ultra de NVIDIA avec trois fois moins de tokens. Et plutôt que d'inventer, Inkling a été entraîné à signaler ce dont il n'est pas sûr.
Inkling, une base à façonner plutôt qu'un trophée de podium
Thinking Machines assume qu'Inkling n'est pas le modèle le plus fort du marché, poids ouverts ou fermés confondus. Le pari est ailleurs: livrer un socle équilibré que chaque organisation affine ensuite sur ses propres données via Tinker, le service maison de fine-tuning, avec des contextes de 64K ou 256K tokens. À sa sortie, il était le plus gros modèle américain à poids ouverts, en réplique directe aux DeepSeek V4, GLM 5.2 et Kimi K2.6 qui trustent le haut du classement des modèles LLM.
Quelques signes particuliers relevés au lancement:
- 77,6 % sur SWE-bench Verified, devant Nemotron 3 en ingénierie logicielle
- parmi les modèles ouverts les plus solides en compréhension audio (VoiceBench, MMAU)
- capable d'écrire ses propres scripts de fine-tuning via un agent de code
- entraîné à répondre franchement sur les sujets exposés à la censure
- un petit frère, Inkling-Small, 276 milliards de paramètres dont 12 actifs
Où essayer et télécharger Inkling
Le chemin le plus court passe par l'Inkling Playground, un chat mis en ligne gratuitement au lancement. Pour un usage sérieux, plusieurs voies coexistent (votre PC de bureau, lui, déclinera poliment l'invitation pour la version complète).
| Voie d'accès | Ce que vous obtenez | Pour qui |
|---|---|---|
| Inkling Playground | essai conversationnel dans le navigateur | les curieux, sans installation |
| Hugging Face | poids complets BF16, NVFP4 et variantes GGUF | équipes disposant d'un cluster GPU |
| Tinker | fine-tuning sur vos données, contexte 64K ou 256K | personnalisation métier |
| API partenaires (Together AI, Fireworks, Baseten, Modal, Databricks) | inférence hébergée facturée à l'usage | intégration dans vos applications |
Questions fréquentes
Inkling est-il gratuit ?
Oui, les poids d'Inkling se téléchargent gratuitement sur Hugging Face sous licence Apache 2.0. Le coût se déplace vers l'exécution: soit votre propre matériel, soit une API facturée à l'usage chez Together AI, Fireworks, Baseten, Modal ou Databricks. Le fine-tuning via Tinker se paie également.
Inkling est-il vraiment open source ?
Techniquement, Inkling est un modèle à poids ouverts plutôt qu'open source complet: la licence Apache 2.0 couvre usage commercial, modification et redistribution sans redevance, mais les données et le code d'entraînement restent privés. C'est le même standard que les publications de Llama ou DeepSeek.
Quelle machine faut-il pour faire tourner Inkling en local ?
Du très lourd: le point de contrôle BF16 réclame 2 To de VRAM cumulée, la version quantisée NVFP4 se contente d'environ 600 Go, et des GGUF compressés circulent pour llama.cpp. Sur une machine modeste, la piste réaliste s'appelle Inkling-Small et ses 12 milliards de paramètres actifs.
Inkling ou DeepSeek, lequel choisir ?
Les deux jouent dans la même cour des grands modèles ouverts, DeepSeek V4 côté chinois, Inkling côté américain. Les premiers comparatifs donnent l'avantage à certains rivaux sur le code en terminal, mais Inkling reste le seul du lot à écouter de l'audio et lire des images nativement, avec un contexte d'un million de tokens.
Verdict : Champion des classements, non; matière première, oui: si votre équipe cherche un modèle multimodal à affiner sur ses propres données sans dépendre d'une API fermée, Inkling est l'une des fondations ouvertes les plus ambitieuses à l'ouest du Pacifique.
