Ollama exécute Kimi, Mistral ou DeepSeek sur votre PC, hors ligne et sans compteur de tokens
Ollama est un logiciel open source qui fait tourner des grands modèles de langage directement sur votre ordinateur, sous Windows, macOS ou Linux. Une commande dans le terminal télécharge Kimi, Mistral, DeepSeek-R1 ou Qwen, et le modèle répond ensuite même sans connexion internet. Le programme ne coûte rien et dépasse les 90 000 étoiles sur GitHub; une déclinaison Ollama Cloud, facultative, prend le relais pour les modèles trop lourds. Développeurs, équipes soumises au RGPD et curieux du terminal y trouvent une IA dont les données ne quittent jamais le disque dur.
- Gratuit et open source sous licence MIT
- Fonctionne hors ligne une fois le modèle récupéré
- API locale compatible avec le format OpenAI
- Catalogue fourni: Kimi, Mistral, DeepSeek, Qwen ou gpt-oss
- Aucune limite d'usage sur votre propre machine
- Plus à l'aise au terminal qu'en interface graphique
- Réclame un GPU ou une bonne dose de RAM
- Ollama Cloud ne publie pas de garantie de disponibilité
Ollama en pratique: une commande pour télécharger, un port pour dialoguer
Ollama associe un gestionnaire de modèles à un serveur d'inférence pour grands modèles de langage: ollama pull récupère un modèle, ollama run le lance, et une API HTTP au format OpenAI écoute sur le port 11434 de votre machine. Vous tapez une question dans le terminal, la réponse défile, même en avion (le premier téléchargement, lui, demande un peu de patience selon votre connexion).
Les Modelfiles figent un comportement, modèle de base, paramètres et instructions compris, pour le partager comme une recette. L'appel d'outils et les sorties structurées en JSON branchent le tout sur LangChain, LlamaIndex ou un serveur MCP, sans adaptateur maison.
Le dépôt a franchi les 90 000 étoiles sur GitHub, un cap que très peu de projets IA open source atteignent; dans la bibliothèque de modèles, DeepSeek-R1 cumule à lui seul plus de 88 millions de téléchargements.
Ce que chaque taille de modèle exige de votre matériel
La quantification en 4 bits fait tenir un modèle de 7 milliards de paramètres dans environ 4 Go de VRAM, et un 8B tourne confortablement avec 8 Go de RAM sur un portable. Bonne surprise au passage: les Mac Apple Silicon s'en sortent très bien avec leur mémoire partagée entre CPU et GPU, pendant que CUDA, ROCm et Vulkan couvrent les cartes des PC.
| Taille du modèle | Matériel indicatif | Usage type |
|---|---|---|
| 7-8B quantifié | 8 Go de RAM | aide à la rédaction, code léger, apprentissage |
| 13B quantifié | environ 8 Go de VRAM | assistants plus fins, analyse de documents |
| 70B quantifié | 40 Go de VRAM et plus | qualité proche des API propriétaires |
Ollama Cloud, le relais GPU quand votre machine cale
Ollama Cloud fait tourner les modèles trop gros pour votre matériel sur les GPU de l'éditeur, avec la même ligne de commande et la même API: vous changez l'adresse de base, rien d'autre. Un palier gratuit permet d'y goûter, Pro coûte 20 $ par mois avec environ 50 fois le quota gratuit, et Max grimpe à 100 $ par mois pour les charges d'agents soutenues.
La facturation compte du temps GPU plutôt que des tokens, avec des plafonds remis à zéro toutes les cinq heures et chaque semaine. Les requêtes ne sont ni journalisées ni utilisées pour l'entraînement. Ces montants valaient au moment d'écrire ces lignes; avant de sortir la carte, vérifiez la page tarifs d'Ollama, qui bouge régulièrement.
Questions fréquentes
Ollama est-il gratuit ?
Oui, Ollama est entièrement gratuit et open source sous licence MIT, sans limite d'usage sur votre propre machine. Les modèles de sa bibliothèque se téléchargent aussi sans payer. Seule l'option Ollama Cloud, qui héberge les gros modèles sur des GPU distants, comporte des paliers payants à 20 et 100 dollars par mois.
Ollama ou LM Studio, lequel choisir ?
LM Studio mise sur une application de bureau tout en interface graphique, quand Ollama privilégie la ligne de commande et une API pensée pour être appelée par d'autres programmes. Pour débuter sans toucher un terminal, LM Studio rassure; pour relier un modèle local à vos scripts, assistants de code ou agents, Ollama garde la main. Les deux ne coûtent rien.
Ollama est-il sûr pour des données confidentielles ?
En local, oui: prompts et réponses restent sur votre disque, rien ne transite par un serveur tiers, ce qui simplifie la conformité RGPD et le travail sous NDA. Un point de vigilance: l'API écoute sans authentification, gardez-la donc sur 127.0.0.1 au lieu de l'exposer au réseau. Côté Cloud, l'éditeur indique ne jamais conserver ni entraîner sur vos requêtes.
Ollama fonctionne-t-il sans GPU ?
Tout à fait, le processeur suffit pour les petits modèles, mais la génération ralentit nettement. Une carte de 6 à 8 Go de VRAM, type RTX 3060, met un modèle 7B à l'aise, et les Mac M1 à M4 se débrouillent remarquablement bien. Pour les mastodontes de 70 milliards de paramètres, visez 24 Go de VRAM ou le Cloud.
Verdict : Rien ne sort de votre machine et rien ne se facture au token: voilà l'attrait d'Ollama pour les développeurs, les équipes tenues au secret et quiconque construit sur des modèles ouverts, avec Ollama Cloud en renfort le jour où le GPU local montre ses limites.
