# Strata : une IA de 125 milliards de paramètres en local

> Strata fait tourner en local un modèle d'IA de 125 milliards de paramètres sur un PC de jeu Windows ou Linux, avec une carte NVIDIA ou AMD.

- Type : actu de l'IA
- Famille : LLM locaux · Moteur d'inférence local
- Habitat : PC Windows ou Linux · C++
- Niveau : débutant
- Langage : C++
- Licence : MIT
- Étoiles GitHub : 10132 (relevé le 7 octobre 2026)
- Source : https://github.com/Niko1221/Strata
- Publié le : 7 octobre 2026
- Page : https://geekus.fr/projets/strata/

Strata est un moteur d'inférence open source (licence MIT) qui fait tourner le modèle Qwen3.8-Flash-Next, 125 milliards de paramètres, sur un PC de jeu ordinaire plutôt que sur un serveur. Il discute, écrit du code et peut lire des images, sans que rien ne quitte ta machine. Il expose aussi une API locale compatible avec OpenAI et Anthropic, ce qui permet de le brancher à tes applications et à tes agents de code.

## En bref

- Fait tourner Qwen3.8-Flash-Next sur un PC de jeu, sans serveur ni cloud
- Il faut une carte NVIDIA ou AMD d'au moins 12 Go de VRAM et 32 Go de RAM
- Sur une RTX 5070, la taille Q2_0 écrit 94 tokens par seconde
- API locale compatible OpenAI et Anthropic, lecture d'images en option
- Windows ou Linux, gratuit, licence MIT

![Strata en image (tirée de la page du projet)](/illustrations/strata-2.webp?v=6ac5f2e8)

## Strata, une IA de 125 milliards de paramètres sur ton PC

Les modèles de cette taille tournent d'habitude sur des serveurs équipés de centaines de gigaoctets de mémoire graphique. Strata, développé par Niko1221 et écrit surtout en C++, vise l'inverse : faire tourner Qwen3.8-Flash-Next, un modèle de l'équipe Qwen, sur un PC de jeu avec une carte graphique de 12 à 24 Go.

Le modèle discute, écrit du code, lit des images et travaille avec tes applications et agents de code. Tout reste sur ta machine : c'est une façon de disposer d'une IA hors ligne, sans envoyer tes textes à un service distant. Le projet est gratuit, et le README propose seulement un don facultatif pour soutenir le travail.

## Comment fonctionne Strata

Le modèle est constitué de 24 576 petits spécialistes, appelés « experts ». Pour chaque mot, il n'en faut que 10. Strata répartit donc le travail sur tout le PC : la carte graphique garde les experts les plus sollicités, la RAM les contient tous, le processeur travaille en parallèle sur le reste, et le SSD stocke une grande table de correspondance. Le README compare cela à une cuisine : ce qu'on utilise sans cesse reste sur le plan de travail, le reste attend dans le garde-manger.

Une seconde astuce accélère les réponses : un petit assistant devine les prochains mots, puis le grand modèle les vérifie tous d'un coup. La réponse reste la même, mais elle arrive 1,6 à 1,8 fois plus vite selon le README. Les longs textes sont lus par gros blocs, jusqu'à 8 192 tokens à la fois.

![Strata : autre image tirée de la page du projet](/illustrations/strata-3.webp?v=6ac5f2e8)

## Quelle vitesse sur une carte graphique grand public

Le projet a mesuré deux PC de jeu. Un token correspond à environ trois quarts de mot. Sur le PC équipé d'une RTX 5070 (12 Go), la taille Q2_0 écrit 94 tokens par seconde, IQ2_XS 79, IQ3_XXS 62 et IQ3_S 53. Sur celui équipé d'une RX 9070 XT (16 Go), Q2_0 écrit 60 tokens par seconde et IQ2_XS 52.

Le README note que 60 tokens par seconde dépasse la vitesse de lecture. Il estime aussi qu'une carte avec plus de mémoire va plus vite : une RTX 3090 devrait écrire environ 100 à 140 tokens par seconde, mais il s'agit d'une estimation, pas d'une mesure présentée dans le tableau. Les mesures portent sur des réponses courtes et des prompts de 32K tokens, avec des versions du moteur qui varient selon la ligne.

- Q2_0 : la taille la plus rapide
- IQ2_XS : la taille recommandée avec 64 Go de RAM
- IQ3_S : la plus lente, mais la plus fine
- Coder : version pour le code, qui tient dans 32 Go de RAM

## Installer Strata sur Windows ou Linux

Le projet prévoit deux voies. La première consiste à coller dans un assistant de code (Claude Code, Cursor, [Codex](https://geekus.fr/projets/codex/), GitHub Copilot…) une phrase qui renvoie au fichier `docs/AI_SETUP.md` du dépôt : l'assistant vérifie ta carte, ta RAM et ton disque, choisit la taille du modèle, l'installe et le démarre. Des outils d'IA peuvent aussi installer, lancer et arrêter Strata via son serveur MCP.

La seconde est manuelle : télécharge le dépôt et décompresse-le. Sous Windows, double-clique sur `START-HERE.bat`. Sous Linux, lance la commande ci-dessous dans le dossier de Strata. L'installateur détecte ta carte NVIDIA ou AMD, pose le bon moteur, puis demande quel modèle et quelle taille, quel contexte (la quantité de texte que le modèle garde en tête) et si les images doivent être lues. Appuyer sur Entrée à chaque question applique le choix recommandé.

Le modèle pèse environ 70 Go à télécharger ; si le téléchargement s'interrompt, relancer le script le reprend là où il s'était arrêté. Le navigateur ouvre ensuite l'application de Strata à l'adresse locale ` Aux lancements suivants, `START-HERE.bat` (ou `./setup.sh`) démarre directement, sans rien retélécharger.

```bash
./setup.sh
```

## Utiliser Strata avec tes applications et agents de code

Dans le navigateur, l'application propose un chat, un moniteur en direct du modèle et de l'usage du GPU, du processeur et de la RAM, et une page « About » avec les réglages et les adresses. Pour tes autres outils, Strata ouvre un serveur local : il suffit d'ajouter un fournisseur « compatible OpenAI » avec l'adresse de base ` N'importe quelle clé d'API et n'importe quel nom de modèle sont acceptés.

Les applications qui utilisent l'API d'Anthropic passent par `/v1/messages`, et le README donne la variable ci-dessous pour Claude Code, ce qui permet d'utiliser cet agent de code avec un modèle local. Codex CLI et les outils fondés sur l'API Responses d'OpenAI passent par `/v1/responses`. Le niveau de réflexion se règle sur arrêt, bas, moyen ou haut, depuis le menu du chat ou le réglage « reasoning effort » de ton application.

Pour les images, réponds oui à la question « Images ? » à l'installation, puis joins-les dans le chat ou dans ton application. Les cartes AMD lisent les images via le processeur sous Linux ; sous Windows, ce n'est pas encore possible. Pour y accéder depuis un téléphone ou un autre PC, le README indique d'ajouter `--host 0.0.0.0` et de toujours définir une clé avec `--api-key`.

```
ANTHROPIC_BASE_URL=http://127.0.0.1:8080
```

## Où en est le projet

D'après les chiffres relevés sur GitHub le 7 octobre 2026, le dépôt, créé le 24 septembre 2026, compte 16 156 étoiles, 1 392 forks et 125 contributeurs, avec 369 tickets et demandes de fusion ouverts. Le code est écrit à 71 % en C++, avec du Python, du Cuda et un peu de CMake. La dernière version, la v0.1.40.1, date du 6 octobre 2026 : c'est un correctif qui empêche qu'un appel d'outil simplement cité dans la réflexion du modèle soit exécuté, et qui évite que des requêtes restent bloquées après un redémarrage du moteur.

La v0.1.40 ajoute une prise en charge expérimentale des puces AMD Strix Halo (Ryzen AI Max), des correctifs de plantages et de valeurs aberrantes, et un meilleur fonctionnement multi-GPU. La v0.1.39 a apporté des accélérations, le traitement de plusieurs requêtes à la fois, l'API Responses d'OpenAI pour Codex et un mode expérimental pour les processeurs plus anciens, sans AVX2.

## Ce qu'il faut savoir avant d'installer Strata

Il faut une carte NVIDIA (séries RTX 20 à RTX 50) ou AMD (plusieurs Radeon RX 7000, RX 9000 et RX 6800 / 6900 sont listées) avec au moins 12 Go de VRAM, 32 Go de RAM ou plus, environ 80 Go de disque libre, et Windows 10 ou 11, ou Linux. La documentation précise qu'avec 8 Go de VRAM, Strata fonctionne mais lentement. Elle demande un pilote NVIDIA en version 580 ou plus récente. Un SSD, de préférence NVMe, accélère beaucoup le premier démarrage.

Au démarrage du modèle, ton PC peut ralentir ou ne plus répondre pendant 1 à 3 minutes, parce que Strata charge 35 à 55 Go en RAM : le README conseille d'attendre sans fermer la fenêtre. Par défaut, Strata traite une requête à la fois ; le premier message d'une conversation est lu en entier, soit environ 1 minute pour 30 000 tokens, et les suivants démarrent en quelques secondes.

Le choix de la taille dépend de ta RAM : Coder avec 32 Go, IQ2_XS ou Q2_0 avec 48 Go, IQ2_XS recommandé avec 64 Go. Strata est sous licence MIT, mais quelques composants et chaque modèle ont leurs propres licences, détaillées dans la documentation du projet.

## Quelques repères

- **VRAM** : C'est la mémoire propre à la carte graphique. Sa capacité limite la taille des modèles d'IA que la carte peut accueillir.
- **Token** : C'est un morceau de texte, un mot entier ou une partie de mot, que le modèle lit et écrit. La vitesse d'un modèle se mesure en tokens par seconde.
- **API** : C'est une porte d'entrée standardisée qui permet à un logiciel d'en utiliser un autre. Ici, elle permet à une application d'envoyer des questions au modèle et de recevoir ses réponses.

## Questions fréquentes

### Strata est-il gratuit ?

Oui, Strata est gratuit et open source sous licence MIT. Le README propose seulement un don facultatif, et précise que quelques composants et chaque modèle ont leurs propres licences.

### Quelle carte graphique faut-il pour faire tourner Strata ?

Il faut une carte NVIDIA ou AMD avec 12 Go de VRAM ou plus, associée à 32 Go de RAM au minimum. La documentation indique qu'avec 8 Go de VRAM, Strata fonctionne mais lentement.

### Peut-on utiliser Claude Code avec Strata en local ?

Oui, Strata expose une API compatible avec celle d'Anthropic. Pour Claude Code, le README indique de définir ANTHROPIC_BASE_URL sur l'adresse locale du serveur, sur le port 8080.

### Strata peut-il lire des images ?

Oui, si tu réponds oui à la question « Images ? » pendant l'installation. Sur les cartes AMD, la lecture passe par le processeur sous Linux, et elle n'est pas encore possible sous Windows.

## À retenir

Strata permet de faire tourner en local un modèle de 125 milliards de paramètres sur un PC de jeu, à condition d'avoir une carte de 12 Go de VRAM au minimum et assez de RAM pour la taille choisie. Il se branche aux applications et aux agents de code par une API locale compatible OpenAI et Anthropic, sous licence MIT.

Sources :

- [Niko1221](https://github.com/Niko1221/Strata) (README)
- [docs/INSTALL.md](https://github.com/niko1221/strata/blob/HEAD/docs/INSTALL.md) (documentation officielle)
- [GitHub](https://github.com/niko1221/strata/releases) (notes de version)

Mots-clés : llm local, qwen, api openai, gpu, windows, linux

---

Fiche publiée par Geekus : https://geekus.fr/projets/strata/
