# Ollama : lancer des modèles d'IA ouverts en local ou cloud

> Ollama est un outil open source pour lancer des modèles ouverts (Gemma, Qwen, DeepSeek) en une commande, avec API REST et agents de code.

- Type : projet open source
- Famille : LLM locaux · Lanceur de modèles ouverts
- Habitat : Terminal · macOS, Windows, Linux, Docker
- Niveau : intermédiaire
- Langage : Go
- Licence : MIT
- Étoiles GitHub : 182241 (relevé le 5 octobre 2026)
- Source : https://github.com/ollama/ollama
- Publié le : 5 octobre 2026
- Page : https://geekus.fr/projets/ollama/

Ollama est un outil open source, écrit surtout en Go, qui permet de télécharger et de faire tourner des modèles d'IA ouverts comme Gemma, Qwen, DeepSeek ou gpt-oss, sur ton ordinateur ou dans le cloud. Une commande suffit pour discuter avec un modèle, une autre pour y brancher un agent de code. Le projet propose aussi une API REST et des bibliothèques Python et JavaScript pour l'intégrer à tes propres applications.

## En bref

- Ollama lance des modèles ouverts avec `ollama run`, en local ou via le cloud
- Il s'installe sur macOS, Windows, Linux ou avec l'image Docker officielle
- `ollama launch` branche des agents comme Claude Code, [Codex](https://geekus.fr/projets/codex/) ou OpenCode
- Une API REST et des bibliothèques Python et JavaScript servent aux développeurs
- Licence MIT ; 182 215 étoiles sur GitHub au 5 octobre 2026

## Ollama, c'est quoi ?

Faire tourner un modèle de langage ouvert sur sa propre machine demande normalement de réunir plusieurs briques : le modèle, un moteur pour l'exécuter, une interface pour lui parler. Ollama rassemble tout cela derrière une commande. Le README le résume ainsi : « Start building with open models », c'est-à-dire commencer à construire avec des modèles ouverts.

Le projet vise deux usages. Le premier : utiliser des modèles ouverts depuis des applications de bureau et des agents de code. Le second : les intégrer dans ta propre application. La documentation précise que tu peux choisir des modèles cloud, pour tourner sans carte graphique locale, ou des modèles locaux, qui s'exécutent sur ton ordinateur. Selon le site d'Ollama, tes requêtes ne sont ni stockées ni utilisées pour entraîner des modèles.

## Installer Ollama sur macOS, Windows, Linux ou Docker

Le README donne une commande d'installation pour chaque système. Sur macOS et Linux, c'est un script à lancer dans le terminal. Sur Windows, une commande PowerShell. Un téléchargement manuel reste possible pour macOS et Windows, et une page de la documentation décrit l'installation manuelle sous Linux.

Si tu préfères Docker, l'image officielle `ollama/ollama` est publiée sur Docker Hub. Une fois l'application installée, tape simplement `ollama` : le programme te propose de lancer un modèle ou de connecter tes outils. Sur Linux, la documentation indique de démarrer le serveur avec `ollama serve` s'il ne tourne pas déjà.

```bash
curl -fsSL https://ollama.com/install.sh | sh
irm https://ollama.com/install.ps1 | iex
```

## Discuter avec un modèle ouvert en local

Pour lancer un modèle en local, il suffit de donner son nom. Ollama le télécharge, puis ouvre une conversation dans le terminal. Le README prend Gemma 4 en exemple ; la liste complète des modèles disponibles se trouve dans la bibliothèque du site d'Ollama. Pour quitter la conversation, la documentation indique de taper `/bye`.

La documentation donne un repère de matériel, mais pour un seul modèle : Gemma 4 E2B pèse environ 7,2 Go au téléchargement, et elle recommande 8 Go de VRAM disponible, ou de mémoire unifiée sur un Mac. Avec moins de VRAM, Ollama peut utiliser la mémoire vive du système, mais les réponses risquent d'être plus lentes. Le projet ne donne pas de configuration minimale valable pour tous les modèles.

```bash
ollama run gemma4
```

## Connecter un agent de code ou un assistant avec ollama launch

La commande `ollama launch` démarre une intégration déjà configurée pour fonctionner avec Ollama. Le README cite Claude Code, Codex, Copilot CLI, DeepSeek Harness, Droid et OpenCode. D'après le guide de démarrage, Ollama propose d'installer l'outil s'il manque, puis te demande de choisir un modèle. Tu lances la commande depuis le dossier de ton projet.

Le README présente aussi OpenClaw, qui transforme Ollama en assistant personnel disponible sur WhatsApp, Telegram, Slack, Discord et d'autres messageries. Sur macOS, l'onglet Apps de l'application permet en outre de connecter Claude ou ChatGPT (Desktop) et de choisir tes modèles Ollama dans leurs réglages.

```bash
ollama launch claude
ollama launch openclaw
```

## Utiliser l'API REST d'Ollama dans tes projets

Ollama expose une API REST : un serveur local, sur le port 11434, auquel tes programmes envoient des requêtes pour exécuter et gérer des modèles. L'exemple du README envoie une question à Gemma 4 et attend la réponse complète, car le streaming est désactivé.

Pour les développeurs, le projet fournit des bibliothèques officielles, installées avec `pip install ollama` pour Python et `npm i ollama` pour JavaScript. La documentation ajoute que l'API est compatible avec un sous-ensemble des clients OpenAI et Anthropic. Les modèles cloud demandent une clé d'API ; les modèles locaux n'en demandent pas. La documentation conseille de garder cette clé côté serveur, hors du code navigateur et du dépôt de code.

```bash
curl http://localhost:11434/api/chat -d '{
  "model": "gemma4",
  "messages": [{
    "role": "user",
    "content": "Why is the sky blue?"
  }],
  "stream": false
}'
```

## Où en est Ollama

Au 5 octobre 2026, le dépôt GitHub d'Ollama compte 182 215 étoiles, 18 104 copies (forks) et 615 contributeurs. Il a été créé le 26 juin 2023, et son code a été modifié pour la dernière fois le 4 octobre 2026. La dernière version publiée est la v0.35.1, du 29 septembre 2026.

Les versions récentes ajoutent les modèles de décision, accessibles par `/v1/systemone`. Ils renvoient des choix, des probabilités et des scores plutôt que du texte, pour du tri de tickets, du routage de modèles ou de la classification de contenu. La v0.35.1 prend en charge Clef et Clef Flash, des modèles de décision de Cloudflare qui acceptent aussi des images. Elle relève de trois à dix le nombre de recherches web par réponse et ajoute des déclarations `CAPABILITY` dans les Modelfiles.

Une préversion, la v0.40.0-rc3 du 25 septembre 2026, prévoit que sur Apple Silicon les modèles pris en charge par le moteur MLX tournent dessus par défaut. Le projet précise qu'il continue de tester d'autres modèles.

## Ce qu'il faut savoir avant de se lancer

Ollama est publié sous licence MIT. Le README indique que le moteur d'exécution pris en charge est llama.cpp, un projet fondé par Georgi Gerganov. L'écosystème autour est large : le README liste de nombreuses interfaces web, des éditeurs de code et des bibliothèques de développement qui s'y connectent, comme Open WebUI, LibreChat, Continue ou LangChain.

Le README et le guide de démarrage ne donnent pas de prix pour les modèles cloud et renvoient à la page Cloud de la documentation pour les modèles et les limites d'usage. Le dépôt compte aussi 4 168 tickets et demandes de fusion ouverts à la date du relevé, signe d'un projet très actif.

## Quelques repères

- **API REST** : Une API est une porte d'entrée qui permet à un programme d'en utiliser un autre. Une API REST fonctionne par requêtes web : ton code envoie une demande à une adresse et reçoit une réponse.
- **VRAM** : C'est la mémoire de la carte graphique. Un modèle d'IA doit y tenir en grande partie pour tourner vite ; sinon, l'ordinateur se rabat sur la mémoire vive, plus lente.
- **Agent de code** : Un programme qui s'appuie sur un modèle de langage pour lire, modifier et exécuter du code à ta demande, depuis un terminal ou un éditeur.

## Questions fréquentes

### Ollama est-il gratuit ?

Le code d'Ollama est open source, sous licence MIT. Le README et le guide de démarrage ne donnent pas de prix pour les modèles cloud : la documentation renvoie vers sa page Cloud pour les limites d'usage.

### Comment installer Ollama sur Windows ?

Lance `irm  | iex` dans PowerShell, ou télécharge manuellement le fichier OllamaSetup.exe proposé par le projet.

### Faut-il une carte graphique pour utiliser Ollama ?

Pas forcément : les modèles cloud tournent sans carte graphique locale. En local, la documentation recommande 8 Go de VRAM ou de mémoire unifiée pour Gemma 4 E2B ; avec moins, Ollama utilise la mémoire vive, plus lentement.

### Peut-on utiliser Claude Code avec Ollama ?

Oui, avec la commande `ollama launch claude`. Ollama propose d'installer Claude Code s'il manque, puis te laisse choisir un modèle.

## À retenir

Ollama réunit sous une même commande l'installation, le téléchargement et l'exécution de modèles ouverts, en local ou dans le cloud, avec des intégrations d'agents et une API pour les développeurs. Le code est sous licence MIT, mais le prix des modèles cloud n'est pas précisé dans le README ni dans le guide de démarrage.

Sources :

- [ollama](https://github.com/ollama/ollama) (README)
- [ollama.com](https://ollama.com) (documentation officielle)
- [docs/index.mdx](https://github.com/ollama/ollama/blob/HEAD/docs/index.mdx) (documentation officielle)
- [docs/README.md](https://github.com/ollama/ollama/blob/HEAD/docs/README.md) (documentation officielle)
- [docs/quickstart.mdx](https://github.com/ollama/ollama/blob/HEAD/docs/quickstart.mdx) (documentation officielle)
- [GitHub](https://github.com/ollama/ollama/releases) (notes de version)

Mots-clés : ollama, llm, modèles ouverts, cli, api rest, docker

---

Fiche publiée par Geekus : https://geekus.fr/projets/ollama/
