Groq sert les modèles ouverts à plus de 500 tokens par seconde sur ses puces LPU
Groq est une plateforme d'inférence rapide pour modèles d'IA ouverts, bâtie sur une puce maison, le LPU, et accessible via l'API GroqCloud. Plus de 5 millions de développeurs y font tourner Llama, Qwen, GPT-OSS ou Whisper, souvent au-delà de 500 tokens par seconde. L'entrée est gratuite, sans carte bancaire; la production, elle, se règle au million de tokens, sans abonnement.
- Débits d'inférence parmi les plus rapides du marché
- Palier gratuit sans carte bancaire
- API compatible OpenAI, migration en quelques minutes
- Tarifs au token très bas, lots à moitié prix
- Catalogue limité aux modèles ouverts, sans GPT ni Claude
- Pas de fine-tuning hébergé de vos propres modèles
- Limites de débit serrées en gratuit
Un circuit taillé pour l'inférence, pas pour le rendu 3D
Le LPU (Language Processing Unit) est un circuit spécialisé dans une seule tâche: servir des modèles de langage avec une latence minimale et un comportement déterministe. Jonathan Ross, passé par la conception des premiers TPU de Google, a fondé l'entreprise en 2016 sur un pari: les GPU, hérités du rendu graphique, ne seraient jamais la bonne machine pour l'inférence.
Les débits constatés vont de 250 à plus de 1 000 tokens par seconde selon le modèle, pour une efficacité énergétique annoncée jusqu'à dix fois supérieure à celle des GPU. Le pari a payé: en décembre 2025, Nvidia a signé une licence non exclusive d'environ 20 milliards de dollars sur cette architecture, avec des racks Groq 3 LPX de 256 puces prévus aux côtés de sa plateforme Vera Rubin.
GroqCloud, un catalogue 100 % poids ouverts derrière une API compatible OpenAI
GroqCloud sert uniquement des modèles à poids ouverts: Llama, Qwen, GPT-OSS, plus Whisper côté transcription et des voix de synthèse. Rien n'est entraîné en interne; Groq exécute les modèles des autres, et Meta lui a confié une partie de l'inférence de son API Llama officielle en 2025.
La migration est une formalité: l'API imite celle d'OpenAI, vous changez l'URL de base et le nom du modèle, et votre application répond depuis les LPU (le temps de relancer le serveur, la première réponse est déjà là). De quoi brancher des assistants de code ou un agent vocal sans toucher au reste de la pile.
- Agents vocaux, où chaque dixième de seconde s'entend
- Chatbots à fort trafic et agents multi-appels
- Transcription audio en série avec Whisper
Essayer Groq sans payer, puis régler au million de tokens
Une clé API se crée en deux minutes sur console.groq.com, sans carte bancaire, avec des limites de débit propres à chaque modèle. Un moyen de paiement enregistré relève ces plafonds et bascule la facturation à la consommation. Le traitement par lots divise chaque tarif par deux, le cache de prompts en fait autant sur les entrées répétées, et les deux remises se cumulent.
Les modèles entrent et sortent du catalogue à un rythme soutenu: vérifiez la page tarifs de groq.com avant de budgéter, elle seule fait foi.
| Modèle servi | Entrée ($/M tokens) | Sortie ($/M tokens) |
|---|---|---|
| GPT-OSS 20B | 0,075 $ | 0,30 $ |
| GPT-OSS 120B | 0,15 $ | 0,60 $ |
| Qwen 3.6 27B | 0,60 $ | 3,00 $ |
Questions fréquentes
Groq est-il gratuit ?
Oui, GroqCloud comporte un palier gratuit sans carte bancaire: tous les modèles du catalogue y sont accessibles, avec des limites de requêtes par minute et par jour. L'ajout d'un moyen de paiement bascule ensuite le compte en facturation au million de tokens consommés, sans abonnement ni minimum mensuel.
Quelle est la différence entre Groq et Grok ?
Aucun rapport entre les deux: Groq, fondée en 2016, conçoit des puces et vend de l'inférence, alors que Grok est le chatbot de xAI, lancé par Elon Musk en 2023. Groq détient la marque déposée et avait publiquement demandé à xAI de changer de nom.
Peut-on utiliser GPT-5 ou Claude via Groq ?
Non, le catalogue se limite aux modèles à poids ouverts comme Llama, Qwen ou GPT-OSS. Les modèles fermés restent chez leurs éditeurs, d'où une pratique courante: Groq pour la couche rapide de l'application, un second fournisseur pour le raisonnement le plus lourd.
Que change l'accord Nvidia pour les clients de GroqCloud ?
Rien au quotidien: la licence de décembre 2025, non exclusive et estimée à 20 milliards de dollars, porte sur l'architecture LPU, et GroqCloud continue de tourner de façon indépendante sous la direction d'Adam Winter, devenu CEO en 2026. Le fondateur Jonathan Ross a, lui, rejoint Nvidia.
Verdict : Jusqu'à dix-neuf fois moins cher qu'un équivalent OpenAI, avec des réponses qui reviennent avant l'animation de chargement: gardez un modèle fermé en appoint pour le raisonnement de pointe, Groq fera le reste pour les développeurs d'agents vocaux, de chatbots temps réel et de gros volumes de transcription.
