Sommaire11 parties
Ollama est un outil open source, écrit surtout en Go, qui permet de télécharger et de faire tourner des modèles d’IA ouverts comme Gemma, Qwen, DeepSeek ou gpt-oss, sur ton ordinateur ou dans le cloud. Une commande suffit pour discuter avec un modèle, une autre pour y brancher un agent de code. Le projet propose aussi une API REST et des bibliothèques Python et JavaScript pour l’intégrer à tes propres applications.
En bref
- Ollama lance des modèles ouverts avec
ollama run, en local ou via le cloud - Il s’installe sur macOS, Windows, Linux ou avec l’image Docker officielle
ollama launchbranche des agents comme Claude Code, Codex ou OpenCode- Une API REST et des bibliothèques Python et JavaScript servent aux développeurs
- Licence MIT ; 182 215 étoiles sur GitHub au 5 octobre 2026
Ollama, c’est quoi ?
Faire tourner un modèle de langage ouvert sur sa propre machine demande normalement de réunir plusieurs briques : le modèle, un moteur pour l’exécuter, une interface pour lui parler. Ollama rassemble tout cela derrière une commande. Le README le résume ainsi : « Start building with open models », c’est-à-dire commencer à construire avec des modèles ouverts.
Le projet vise deux usages. Le premier : utiliser des modèles ouverts depuis des applications de bureau et des agents de code. Le second : les intégrer dans ta propre application. La documentation précise que tu peux choisir des modèles cloud, pour tourner sans carte graphique locale, ou des modèles locaux, qui s’exécutent sur ton ordinateur. Selon le site d’Ollama, tes requêtes ne sont ni stockées ni utilisées pour entraîner des modèles.
Installer Ollama sur macOS, Windows, Linux ou Docker
Le README donne une commande d’installation pour chaque système. Sur macOS et Linux, c’est un script à lancer dans le terminal. Sur Windows, une commande PowerShell. Un téléchargement manuel reste possible pour macOS et Windows, et une page de la documentation décrit l’installation manuelle sous Linux.
Si tu préfères Docker, l’image officielle ollama/ollama est publiée sur Docker Hub. Une fois l’application installée, tape simplement ollama : le programme te propose de lancer un modèle ou de connecter tes outils. Sur Linux, la documentation indique de démarrer le serveur avec ollama serve s’il ne tourne pas déjà.
curl -fsSL https://ollama.com/install.sh | sh
irm https://ollama.com/install.ps1 | iex
Discuter avec un modèle ouvert en local
Pour lancer un modèle en local, il suffit de donner son nom. Ollama le télécharge, puis ouvre une conversation dans le terminal. Le README prend Gemma 4 en exemple ; la liste complète des modèles disponibles se trouve dans la bibliothèque du site d’Ollama. Pour quitter la conversation, la documentation indique de taper /bye.
La documentation donne un repère de matériel, mais pour un seul modèle : Gemma 4 E2B pèse environ 7,2 Go au téléchargement, et elle recommande 8 Go de VRAM disponible, ou de mémoire unifiée sur un Mac. Avec moins de VRAM, Ollama peut utiliser la mémoire vive du système, mais les réponses risquent d’être plus lentes. Le projet ne donne pas de configuration minimale valable pour tous les modèles.
ollama run gemma4
Connecter un agent de code ou un assistant avec ollama launch
La commande ollama launch démarre une intégration déjà configurée pour fonctionner avec Ollama. Le README cite Claude Code, Codex, Copilot CLI, DeepSeek Harness, Droid et OpenCode. D’après le guide de démarrage, Ollama propose d’installer l’outil s’il manque, puis te demande de choisir un modèle. Tu lances la commande depuis le dossier de ton projet.
Le README présente aussi OpenClaw, qui transforme Ollama en assistant personnel disponible sur WhatsApp, Telegram, Slack, Discord et d’autres messageries. Sur macOS, l’onglet Apps de l’application permet en outre de connecter Claude ou ChatGPT (Desktop) et de choisir tes modèles Ollama dans leurs réglages.
ollama launch claude
ollama launch openclaw
Utiliser l’API REST d’Ollama dans tes projets
Ollama expose une API REST : un serveur local, sur le port 11434, auquel tes programmes envoient des requêtes pour exécuter et gérer des modèles. L’exemple du README envoie une question à Gemma 4 et attend la réponse complète, car le streaming est désactivé.
Pour les développeurs, le projet fournit des bibliothèques officielles, installées avec pip install ollama pour Python et npm i ollama pour JavaScript. La documentation ajoute que l’API est compatible avec un sous-ensemble des clients OpenAI et Anthropic. Les modèles cloud demandent une clé d’API ; les modèles locaux n’en demandent pas. La documentation conseille de garder cette clé côté serveur, hors du code navigateur et du dépôt de code.
curl http://localhost:11434/api/chat -d '{
"model": "gemma4",
"messages": [{
"role": "user",
"content": "Why is the sky blue?"
}],
"stream": false
}'
Où en est Ollama
Au 5 octobre 2026, le dépôt GitHub d’Ollama compte 182 215 étoiles, 18 104 copies (forks) et 615 contributeurs. Il a été créé le 26 juin 2023, et son code a été modifié pour la dernière fois le 4 octobre 2026. La dernière version publiée est la v0.35.1, du 29 septembre 2026.
Les versions récentes ajoutent les modèles de décision, accessibles par /v1/systemone. Ils renvoient des choix, des probabilités et des scores plutôt que du texte, pour du tri de tickets, du routage de modèles ou de la classification de contenu. La v0.35.1 prend en charge Clef et Clef Flash, des modèles de décision de Cloudflare qui acceptent aussi des images. Elle relève de trois à dix le nombre de recherches web par réponse et ajoute des déclarations CAPABILITY dans les Modelfiles.
Une préversion, la v0.40.0-rc3 du 25 septembre 2026, prévoit que sur Apple Silicon les modèles pris en charge par le moteur MLX tournent dessus par défaut. Le projet précise qu’il continue de tester d’autres modèles.
Ce qu’il faut savoir avant de se lancer
Ollama est publié sous licence MIT. Le README indique que le moteur d’exécution pris en charge est llama.cpp, un projet fondé par Georgi Gerganov. L’écosystème autour est large : le README liste de nombreuses interfaces web, des éditeurs de code et des bibliothèques de développement qui s’y connectent, comme Open WebUI, LibreChat, Continue ou LangChain.
Le README et le guide de démarrage ne donnent pas de prix pour les modèles cloud et renvoient à la page Cloud de la documentation pour les modèles et les limites d’usage. Le dépôt compte aussi 4 168 tickets et demandes de fusion ouverts à la date du relevé, signe d’un projet très actif.
Quelques repères
- API REST : Une API est une porte d’entrée qui permet à un programme d’en utiliser un autre. Une API REST fonctionne par requêtes web : ton code envoie une demande à une adresse et reçoit une réponse.
- VRAM : C’est la mémoire de la carte graphique. Un modèle d’IA doit y tenir en grande partie pour tourner vite ; sinon, l’ordinateur se rabat sur la mémoire vive, plus lente.
- Agent de code : Un programme qui s’appuie sur un modèle de langage pour lire, modifier et exécuter du code à ta demande, depuis un terminal ou un éditeur.
Questions fréquentes
Ollama est-il gratuit ?
Le code d’Ollama est open source, sous licence MIT. Le README et le guide de démarrage ne donnent pas de prix pour les modèles cloud : la documentation renvoie vers sa page Cloud pour les limites d’usage.
Comment installer Ollama sur Windows ?
Lance irm | iex dans PowerShell, ou télécharge manuellement le fichier OllamaSetup.exe proposé par le projet.
Faut-il une carte graphique pour utiliser Ollama ?
Pas forcément : les modèles cloud tournent sans carte graphique locale. En local, la documentation recommande 8 Go de VRAM ou de mémoire unifiée pour Gemma 4 E2B ; avec moins, Ollama utilise la mémoire vive, plus lentement.
Peut-on utiliser Claude Code avec Ollama ?
Oui, avec la commande ollama launch claude. Ollama propose d’installer Claude Code s’il manque, puis te laisse choisir un modèle.
À retenir
Ollama réunit sous une même commande l’installation, le téléchargement et l’exécution de modèles ouverts, en local ou dans le cloud, avec des intégrations d’agents et une API pour les développeurs. Le code est sous licence MIT, mais le prix des modèles cloud n’est pas précisé dans le README ni dans le guide de démarrage.
Sources
- ollamaREADME
- ollama.comdocumentation officielle
- docs/index.mdxdocumentation officielle
- docs/README.mddocumentation officielle
- docs/quickstart.mdxdocumentation officielle
- GitHubnotes de version






