GLM-5.2 fait tenir tout un projet logiciel dans son million de tokens de contexte
Mis à jour le 7 août 2026
GLM-5.2 est le grand modèle de langage de Z.ai conçu pour les tâches au long cours: il maintient un contexte d'un million de tokens qui reste exploitable du premier au dernier échange. Ses poids se téléchargent librement sous licence MIT, une rareté à ce niveau. Le chat de z.ai se teste sans payer, tandis que l'API se facture au token, loin des tarifs des grands modèles fermés. Les équipes de développement qui font tourner des agents de code pendant des heures sont le public visé.
- Contexte d'un million de tokens réellement stable
- Poids ouverts publiés sous licence MIT
- Niveaux d'effort de réflexion réglables
- Servi par une vingtaine d'hébergeurs au choix
- Entrée et sortie limitées au texte
- Poids trop lourds pour un GPU personnel
- Quotas du Coding Plan plus serrés aux heures de pointe
Un million de tokens qui ne s'effritent pas en route
Le contexte d'un million de tokens de GLM-5.2 reste utilisable sur toute sa longueur, là où beaucoup de modèles acceptent des tokens supplémentaires sans vraiment s'en servir. Son architecture IndexShare partage un même indexeur toutes les quatre couches d'attention creuse et divise le calcul par token par 2,9 à pleine longueur.
Sous cette mécanique vit un modèle de 753 milliards de paramètres, successeur direct de GLM-5.1, avec plusieurs niveaux d'effort de réflexion pour arbitrer entre qualité et latence. À son lancement, il terminait à un point de Claude Opus 4.8 sur le benchmark FrontierSWE tout en devançant GPT-5.5, le genre d'écart qui se vérifie dans les classements de modèles de langage.
GLM-5.2 au travail, du cahier des charges au déploiement
Z.ai a entraîné GLM-5.2 pendant des mois sur des scénarios d'agent de codage. Vous lui confiez un dépôt complet: il retient les frontières entre modules, les contrats d'API et les décisions déjà prises, puis les applique des heures plus tard au lieu de les réinventer. Une seule tâche peut couvrir le cycle entier, jusqu'au produit déployable sur plusieurs plateformes.
Dans la pratique, quatre terrains lui vont particulièrement bien:
- Refonte de code à l'échelle d'un dépôt entier
- Recherche automatisée et bancs d'essai
- Débogage qui traverse des dizaines de fichiers
- Mini-jeux et prototypes complets en une consigne
Chat sans frais, Coding Plan ou API: comment essayer GLM-5.2
GLM-5.2 se découvre gratuitement sur chat.z.ai (aucune carte bancaire demandée, ce qui simplifie le premier essai). Pour un usage soutenu, trois circuits de facturation cohabitent, résumés ci-dessous.
Les poids complets sont publiés sur Hugging Face sous licence MIT, et une vingtaine d'hébergeurs tiers servent le modèle, souvent sous les tarifs officiels. Ces chiffres bougent vite; seule la page de Z.ai fait foi au moment où vous lisez.
| Accès | Ce que vous y faites | Facturation |
|---|---|---|
| chat.z.ai | Questions, essais, petits sites | Sans frais |
| GLM Coding Plan | Agents de code au forfait mensuel | Autour de 18 $/mois en entrée de gamme |
| API Z.ai | Applications et agents en production | 1,40 $ en entrée / 4,40 $ en sortie par million de tokens, 0,26 $ en cache |
| Poids ouverts | Hébergement sur vos propres GPU | Licence MIT, matériel à votre charge |
Questions fréquentes
GLM-5.2 est-il gratuit ?
Oui, en partie. Le chat de z.ai permet de l'essayer sans payer, et ses poids se téléchargent librement sous licence MIT. L'usage intensif passe en revanche par l'API facturée au token ou par le Coding Plan mensuel, un abonnement réservé aux outils de codage compatibles.
Peut-on intégrer GLM-5.2 dans un produit commercial ?
La licence MIT autorise l'usage commercial comme non commercial, sans redevance. Vous pouvez embarquer le modèle dans un produit payant, le modifier ou l'héberger vous-même. Peu de modèles de ce calibre laissent une liberté aussi complète, et c'est un vrai argument face aux API fermées.
GLM-5.2 rivalise-t-il avec Claude Opus 4.8 ?
Sur le benchmark FrontierSWE, GLM-5.2 termine à un point derrière Claude Opus 4.8 et un point devant GPT-5.5, pour un coût par token nettement plus bas. Pour du codage agentique à gros volume, le rapport qualité-prix penche donc clairement de son côté.
Peut-on faire tourner GLM-5.2 en local ?
Les poids sont disponibles sur Hugging Face et via Ollama, mais leurs 753 milliards de paramètres réclament une grosse infrastructure GPU. En pratique, la plupart des équipes passent par un hébergeur ou l'API officielle et réservent l'auto-hébergement aux volumes très réguliers.
Verdict : Refondre un dépôt entier sans saucissonner la mission en dix morceaux: voilà le terrain où GLM-5.2 excelle, et les équipes qui vivent dans un agent de code y gagneront un moteur d'endurance pour une fraction du budget des modèles fermés.
« Un assistant IA privé gratuit orienté confidentialité, hébergé en Europe et chiffré de bout en bout. Il combine des capacités de raisonnement poussées, la génération d'images, la recherche sur le deep web et la mémoire à long terme. Il garantit par ailleurs que vos conversations ne sont pas utilisées pour entraîner des modèles »
