Ollama icône
Ollama
#62 dans Modèles LLM
5/5
« Discutez avec des modèles de langage LLM localement comme Llama2, Mixtral ou Code Llama. Compatible macOS, Linux et bientôt Windows »
En savoir plus : ChatGPT Perplexity
Outil du Mois janvier 2024 Gratuit 11426

Ollama exécute Kimi, Mistral ou DeepSeek sur votre PC, hors ligne et sans compteur de tokens

Ollama est un logiciel open source qui fait tourner des grands modèles de langage directement sur votre ordinateur, sous Windows, macOS ou Linux. Une commande dans le terminal télécharge Kimi, Mistral, DeepSeek-R1 ou Qwen, et le modèle répond ensuite même sans connexion internet. Le programme ne coûte rien et dépasse les 90 000 étoiles sur GitHub; une déclinaison Ollama Cloud, facultative, prend le relais pour les modèles trop lourds. Développeurs, équipes soumises au RGPD et curieux du terminal y trouvent une IA dont les données ne quittent jamais le disque dur.

Avantages
  • Gratuit et open source sous licence MIT
  • Fonctionne hors ligne une fois le modèle récupéré
  • API locale compatible avec le format OpenAI
  • Catalogue fourni: Kimi, Mistral, DeepSeek, Qwen ou gpt-oss
  • Aucune limite d'usage sur votre propre machine
Inconvénients
  • Plus à l'aise au terminal qu'en interface graphique
  • Réclame un GPU ou une bonne dose de RAM
  • Ollama Cloud ne publie pas de garantie de disponibilité

Ollama en pratique: une commande pour télécharger, un port pour dialoguer

Ollama associe un gestionnaire de modèles à un serveur d'inférence pour grands modèles de langage: ollama pull récupère un modèle, ollama run le lance, et une API HTTP au format OpenAI écoute sur le port 11434 de votre machine. Vous tapez une question dans le terminal, la réponse défile, même en avion (le premier téléchargement, lui, demande un peu de patience selon votre connexion).

Les Modelfiles figent un comportement, modèle de base, paramètres et instructions compris, pour le partager comme une recette. L'appel d'outils et les sorties structurées en JSON branchent le tout sur LangChain, LlamaIndex ou un serveur MCP, sans adaptateur maison.

Le dépôt a franchi les 90 000 étoiles sur GitHub, un cap que très peu de projets IA open source atteignent; dans la bibliothèque de modèles, DeepSeek-R1 cumule à lui seul plus de 88 millions de téléchargements.

Prise en main complète d'Ollama, de l'installation aux premiers modèles
Ollama branché sur Claude Code pour coder en local

Ce que chaque taille de modèle exige de votre matériel

La quantification en 4 bits fait tenir un modèle de 7 milliards de paramètres dans environ 4 Go de VRAM, et un 8B tourne confortablement avec 8 Go de RAM sur un portable. Bonne surprise au passage: les Mac Apple Silicon s'en sortent très bien avec leur mémoire partagée entre CPU et GPU, pendant que CUDA, ROCm et Vulkan couvrent les cartes des PC.

Taille du modèleMatériel indicatifUsage type
7-8B quantifié8 Go de RAMaide à la rédaction, code léger, apprentissage
13B quantifiéenviron 8 Go de VRAMassistants plus fins, analyse de documents
70B quantifié40 Go de VRAM et plusqualité proche des API propriétaires

Ollama Cloud, le relais GPU quand votre machine cale

Ollama Cloud fait tourner les modèles trop gros pour votre matériel sur les GPU de l'éditeur, avec la même ligne de commande et la même API: vous changez l'adresse de base, rien d'autre. Un palier gratuit permet d'y goûter, Pro coûte 20 $ par mois avec environ 50 fois le quota gratuit, et Max grimpe à 100 $ par mois pour les charges d'agents soutenues.

La facturation compte du temps GPU plutôt que des tokens, avec des plafonds remis à zéro toutes les cinq heures et chaque semaine. Les requêtes ne sont ni journalisées ni utilisées pour l'entraînement. Ces montants valaient au moment d'écrire ces lignes; avant de sortir la carte, vérifiez la page tarifs d'Ollama, qui bouge régulièrement.

Questions fréquentes

Ollama est-il gratuit ?

Oui, Ollama est entièrement gratuit et open source sous licence MIT, sans limite d'usage sur votre propre machine. Les modèles de sa bibliothèque se téléchargent aussi sans payer. Seule l'option Ollama Cloud, qui héberge les gros modèles sur des GPU distants, comporte des paliers payants à 20 et 100 dollars par mois.

Ollama ou LM Studio, lequel choisir ?

LM Studio mise sur une application de bureau tout en interface graphique, quand Ollama privilégie la ligne de commande et une API pensée pour être appelée par d'autres programmes. Pour débuter sans toucher un terminal, LM Studio rassure; pour relier un modèle local à vos scripts, assistants de code ou agents, Ollama garde la main. Les deux ne coûtent rien.

Ollama est-il sûr pour des données confidentielles ?

En local, oui: prompts et réponses restent sur votre disque, rien ne transite par un serveur tiers, ce qui simplifie la conformité RGPD et le travail sous NDA. Un point de vigilance: l'API écoute sans authentification, gardez-la donc sur 127.0.0.1 au lieu de l'exposer au réseau. Côté Cloud, l'éditeur indique ne jamais conserver ni entraîner sur vos requêtes.

Ollama fonctionne-t-il sans GPU ?

Tout à fait, le processeur suffit pour les petits modèles, mais la génération ralentit nettement. Une carte de 6 à 8 Go de VRAM, type RTX 3060, met un modèle 7B à l'aise, et les Mac M1 à M4 se débrouillent remarquablement bien. Pour les mastodontes de 70 milliards de paramètres, visez 24 Go de VRAM ou le Cloud.

Verdict : Rien ne sort de votre machine et rien ne se facture au token: voilà l'attrait d'Ollama pour les développeurs, les équipes tenues au secret et quiconque construit sur des modèles ouverts, avec Ollama Cloud en renfort le jour où le GPU local montre ses limites.

★ Outils IA de Prestige ★
IA Alternatives à Ollama
Payant
Freemium
Payant
Gratuit
Freemium
Payant
Payant
Payant