Sommaire10 parties
Kolibri est un modèle de langage ouvert en allemand et en anglais, publié par Aleph Alpha le 3 octobre 2026 sous licence Apache 2.0. Il compte 78 milliards de paramètres au total, mais n’en mobilise qu’environ 3 milliards par token, ce qui permet de l’héberger en interne. Il est aussi entraîné à répondre « je ne sais pas » quand le contexte ne contient pas la réponse.
En bref
- Modèle allemand-anglais, poids complets sur Hugging Face, licence Apache 2.0
- 78 milliards de paramètres au total, 3,46 milliards actifs par token
- Contexte natif de 262 144 tokens, validé jusqu’à 1 048 576
- 21,3 % de tokens allemands au pré-entraînement, raisonnement possible en allemand
- Environ 78 Go de mémoire GPU nécessaires pour les poids en FP8
Kolibri, un modèle de langage ouvert venu d’Allemagne
Aleph Alpha a publié Kolibri le 3 octobre 2026, jour de la réunification allemande. Les poids complets du modèle se téléchargent sur Hugging Face et s’utilisent selon les termes de la licence Apache 2.0. D’après le blog de tej.as, cette licence couvre les poids et les fichiers de configuration, tandis qu’Aleph Alpha garde les droits sur son code et ses méthodes d’entraînement.
L’éditeur le présente comme un modèle spécialisé pour des travaux sensibles dans des secteurs réglementés : administration publique, industrie, aéronautique. Il a été conçu en Allemagne et entraîné sur des infrastructures situées en Allemagne et en Finlande. Aleph Alpha parle de « souveraineté » : le modèle peut tourner chez le client, sans envoyer de données internes à un service d’inférence tiers.
Cette souveraineté a des nuances, que la fiche du modèle reconnaît elle-même selon tej.as : des modèles venus d’ailleurs ont servi pendant la préparation des données. Gemma 4 a reformulé du texte web anglais, Mistral-NeMo du texte allemand, et Qwen3-32B a annoté des données pour les filtres de qualité.
Comment fonctionne Kolibri
Kolibri est un modèle de type Mixture-of-Experts, ou mélange d’experts. Chaque couche contient de nombreux petits sous-réseaux, les experts, et un routeur choisit lesquels activer pour chaque token. Ici, le modèle compte 50 couches, 384 experts par couche plus un expert partagé, et chaque token en traverse 6. Résultat : 78,1 milliards de paramètres au total, dont 3,46 milliards seulement travaillent à chaque token.
Cela réduit le calcul, pas la mémoire : tous les experts doivent rester chargés. Selon la fiche du modèle citée par tej.as, le modèle complet doit être tenu en mémoire même si seule une partie est active. Les poids occupent environ 78 Go en FP8.
Côté attention, 40 couches sur 50 ne regardent que les 512 tokens précédents, et une couche sur cinq regarde tout le contexte. Aleph Alpha explique que ce choix borne le calcul et la mémoire du décodage, quelle que soit la longueur du contexte. Le contexte natif atteint 262 144 tokens, et Aleph Alpha l’a validé jusqu’à 1 048 576 tokens.
Le niveau de réflexion se règle aussi à la demande : quatre niveaux de raisonnement existent, none, low, medium et high. Ils permettent d’arbitrer entre coût, vitesse et qualité de la réponse.
Un modèle bilingue pensé pour l’allemand
Aleph Alpha a développé un tokenizer bilingue de 128 000 entrées, pour que les mots composés allemands ne soient pas découpés en morceaux trop nombreux. Dans l’exemple donné par tej.as, « Bundesverfassungsgericht » compte 2 tokens avec Kolibri contre 6 avec le tokenizer utilisé par GPT-5. Moins de tokens signifie que davantage de texte allemand tient dans le même contexte.
Au pré-entraînement, 21,3 % des tokens sont allemands, soit environ 4,3 billions de tokens. La traduction automatique n’a servi que dans 6 % des cas, car un texte traduit garde la marque de sa langue d’origine. L’équipe a donc retravaillé ses filtres : les réglages habituels éliminent par erreur la prose administrative allemande, qui contient beaucoup de mots longs. Au total, le modèle a vu près de 24 billions de tokens, sur 768 GPU B200.
Le modèle raisonne aussi en allemand sur des questions posées en allemand, alors que les modèles de raisonnement pensent le plus souvent en anglais, selon tej.as.
Répondre « je ne sais pas » quand le contexte ne suffit pas
Kolibri a été entraîné avec des données d’abstention et avec le protocole Merlin-Arthur d’Aleph Alpha. Le modèle, nommé Arthur, reçoit une question dont des passages du document sont masqués. Merlin cache des parties de façon à faciliter la bonne réponse, Morgana cache les preuves dont la réponse dépend. Arthur ne sait jamais lequel des deux il affronte, et doit donc vérifier que les éléments sous ses yeux justifient une réponse.
Pour un usage avec vos propres documents, cette abstention compte : un modèle qui avoue ne pas savoir vaut mieux qu’une réponse fausse énoncée avec aplomb. Sur le test Omniscience d’Artificial Analysis, Kolibri s’abstient ou donne une réponse partielle dans 44 % des cas où il ne sait pas, contre 11,1 % pour Qwen3.5 35B-A3B, selon tej.as.
Résultats annoncés et limites de Kolibri
Selon l’évaluation d’Aleph Alpha, Kolibri atteint 96,9 à AIME 2025 en anglais et 87,5 en allemand, des scores de mathématiques supérieurs à ceux des modèles comparés. Sur les benchmarks internes qui imitent des métiers de clients, les scores montent entre Kolibri Origin, un modèle précédent non publié, et Kolibri : de 0,14 à 0,59 en aéronautique, de 0,54 à 0,75 pour le secteur public allemand. Ce sont des évaluations de l’éditeur lui-même.
Les faiblesses sont publiées dans la fiche du modèle, d’après tej.as. Kolibri ne répond correctement qu’à 14,8 % des questions Omniscience, contre 22,2 % pour Qwen3.5 35B-A3B : il connaît moins de choses de mémoire. Il obtient 27,7 à Terminal-Bench 2.1, contre 39,7 pour Qwen3.5 35B-A3B, et 66,4 à SWE-bench Verified. Il ne gère que l’allemand et l’anglais, un choix que la fiche appelle « depth over breadth ».
- Bon score en mathématiques, en allemand comme en anglais
- Questions sur des documents jamais vus : 89,7 en anglais, contre 87,0 pour Qwen3.5 35B-A3B
- Connaissances de mémoire plus faibles, à utiliser avec des documents fournis
- Moins à l’aise comme agent de code
Installer Kolibri et le faire tourner chez soi
D’après la fiche du modèle, il faut environ 78 Go de mémoire GPU : au minimum deux GPU A100 ou H100 de 80 Go, ou un seul H200, B200 ou B300. Le modèle passe par un plugin d’Aleph Alpha pour vLLM, qui ne prend en charge qu’une version de vLLM à la fois. Au lancement, selon tej.as, aucun hébergeur ne le proposait encore.
Le serveur obtenu est compatible avec l’API d’OpenAI : n’importe quel client OpenAI peut donc s’y connecter. La fiche recommande temperature=1.0, top_p=0.97 et top_k=128, et un contexte d’au plus 262 144 tokens pour les usages sensibles à la latence.
Le projet ne donne pas de prix : les poids sont librement téléchargeables, mais le coût du matériel reste à votre charge.
pip install 'aleph-alpha-inference>=1'
vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 \
--reasoning-parser kolibri1 \
--tool-call-parser kolibri1 \
--enable-auto-tool-choice
Quelques repères
- Token : Un token est un morceau de texte, mot entier ou fragment de mot, que le modèle lit et produit. Les modèles de langage comptent leur contexte et leurs coûts en tokens.
- Poids ouverts : Les poids sont les valeurs numériques apprises par un modèle pendant son entraînement. Quand ils sont publiés, chacun peut les télécharger et faire tourner le modèle sur son propre matériel.
- Mixture-of-Experts : Architecture où le modèle est composé de nombreux sous-réseaux spécialisés, les experts. Pour chaque token, seule une petite partie d’entre eux est utilisée, ce qui réduit le calcul.
Questions fréquentes
Kolibri est-il gratuit et utilisable commercialement ?
Oui, les poids de Kolibri sont téléchargeables sur Hugging Face et placés sous licence Apache 2.0. Aleph Alpha garde toutefois les droits sur son code et ses méthodes d’entraînement. L’éditeur ne parle pas de prix, et le matériel reste à la charge de l’utilisateur.
Quelle configuration faut-il pour héberger Kolibri en interne ?
Il faut environ 78 Go de mémoire GPU pour les poids en FP8. Selon la fiche du modèle, cela représente deux GPU A100 ou H100 de 80 Go, ou un seul H200, B200 ou B300. Un portable ne suffit pas.
Kolibri gère-t-il un contexte d’un million de tokens ?
Oui, Aleph Alpha l’a validé jusqu’à 1 048 576 tokens, mais le contexte natif de l’entraînement est de 262 144 tokens. La fiche recommande de ne pas dépasser ce dernier pour les usages sensibles à la latence.
Kolibri répond-il « je ne sais pas » quand il n’a pas l’information ?
Oui, c’est un objectif d’entraînement : Kolibri s’abstient quand le contexte ne soutient pas de réponse, grâce au protocole Merlin-Arthur et à des données d’abstention. Sur le test Omniscience, il s’abstient ou donne une réponse partielle dans 44 % des cas où il ne sait pas.
À retenir
Kolibri est un modèle allemand-anglais aux poids ouverts, conçu pour tourner sur ses propres serveurs, avec de bons résultats en mathématiques et un entraînement à l’abstention. Il demande environ 78 Go de mémoire GPU, connaît moins de choses de mémoire que ses concurrents comparés et reste moins à l’aise comme agent de code.
Sources
- aleph-alpha.compage citée sur Hacker News
- tej.aspage citée sur Hacker News






