Aller au contenu
geekus
ActuModèles·6 min de lecture

Clef-omni : modèle de décision ouvert, audio et vidéo

Clef-omni de Cloudflare traite audio, vidéo, image et texte dans un seul appel. Une vidéo de 21 secondes avec son est notée en 1,5 seconde. Clef-flash baisse à 0,038 $ le million de tokens, avec 24k de contexte hébergé.

blog.cloudflare.com/clef-faster-cheaper-multimodal/
Capture de la page de Clef-omni
Sommaire10 parties

Clef-omni est un modèle de décision à poids ouverts publié par Cloudflare, qui accepte du texte, des images, de l’audio et de la vidéo dans un même appel. Il évite de transcrire la parole ou de séparer le son et l’image avant l’analyse. Cloudflare annonce aussi un prix en baisse pour Clef-flash et un Clef hébergé plus rapide.

En bref

  • Clef-omni accepte audio (wav, mp3), vidéo (mp4, webm), images et texte dans un seul appel.
  • Les poids sont publiés sur Hugging Face, sur une base Qwen3-Omni-30B-A3B-Instruct.
  • Une vidéo de 21 secondes avec son est notée en environ 1,5 seconde.
  • Clef-flash passe de 0,09 $ à 0,038 $ le million de tokens en entrée, avec un contexte hébergé réduit à 24k.
  • Clef hébergé est environ 1,7 à 2 fois plus rapide, sans nouveaux poids.

Ce que change Clef-omni pour les modèles de décision

Un modèle de décision ne rédige pas de texte : il examine une entrée et choisit des valeurs parmi des options prévues à l’avance. Selon Cloudflare, ces modèles étaient restés largement limités au texte depuis les débuts de Jev, de TypeSafe. Clef gérait déjà les images et les séries d’images extraites de vidéos.

Clef-omni ajoute l’audio (wav ou mp3) et la vidéo (mp4 ou webm). Au lieu d’enchaîner plusieurs modèles pour transcrire la parole ou séparer le son et l’image d’une vidéo, il suffit d’appeler un seul modèle pour décider à partir de n’importe quelle modalité.

Comment fonctionne Clef-omni

Clef-omni repose sur Qwen3-Omni-30B-A3B-Instruct, un modèle de type mélange d’experts qui traite déjà texte, image, audio et vidéo. Cloudflare conserve la partie de compréhension et écarte les composants de sortie vocale. En production, le modèle fait une passe rapide sur l’ensemble de la requête et note en même temps toutes les modalités et toutes les options valides.

Comme les modèles Clef ne sont pas des modèles de langage et ne génèrent pas de texte en sortie, il n’y a ni transcription ni légende des fichiers reçus. Le son et la vidéo sont synchronisés avec les images dans une même séquence. Un mécanisme d’attention en deux étapes rassemble pour chaque option les indices présents dans l’entrée, qu’ils soient dans le texte, l’image ou l’audio, puis calcule des scores de confiance.

Pour l’entraînement, Cloudflare reprend la méthode de Clef : base Qwen3 gelée, adaptateurs LoRA, et une perte d’entropie croisée à étiquettes lissées combinée à une calibration par score de Brier. Le but est un modèle robuste aux variations de schéma, d’ordre des champs et de formulation.

Envoyer de l’audio et de la vidéo à Clef-omni

Clef-omni s’appelle par l’API de Cloudflare. La requête contient un texte de contexte, des fichiers encodés en base64 (images, audio, vidéos) et des questions, chacune avec un type et une consigne. L’exemple de Cloudflare vérifie une installation à partir d’une photo, d’un enregistrement sonore et d’une vidéo du ventilateur.

curl https://api.cloudflare.com/client/v4/accounts/$CLOUDFLARE_ACCOUNT_ID/ai/run/@cf/cloudflare/clef-omni \
-X POST \
-H "Authorization: Bearer $CLOUDFLARE_AUTH_TOKEN" \
-H "Content-Type: application/json" \

Vitesse et résultats de Clef-omni

Cloudflare annonce des décisions sur texte seul en environ 130 ms à la médiane, sur image en environ 150 ms, sur extrait audio en quelques centaines de millisecondes. Un clip vidéo de 21 secondes avec son est noté en environ 1,5 seconde, toujours en un seul appel.

Sur les tests publiés, les résultats sont mitigés selon les tâches. Clef-omni obtient 94,8 en macro-F1 sur BANKING77 et 97,7 sur CLINC150+OOS, devant Clef et Jev. Sur Home appliances, il fait 69,3 contre 82,95 pour Clef et 97,73 pour Clef-flash. Sur When2Call, il fait 63,3 contre 80,97 pour Jev. Ces chiffres viennent de Cloudflare, pas d’un test indépendant.

Prix de Clef-omni, Clef-flash et Clef

Les prix annoncés s’entendent par million de tokens en entrée, un token étant un petit morceau de texte ou de média converti pour le calcul. Clef-flash passe de 0,09 $ à 0,038 $, ce qui le place sous Jev selon Cloudflare. Clef reste à 0,24 $ et Clef-omni est lancé à 0,15 $. La documentation de Cloudflare détaille la conversion de l’image et de l’audio en tokens.

Cette baisse a une contrepartie : la version hébergée de Clef-flash passe de 64k à 24k de contexte. Cloudflare indique que 0,24 % des requêtes dépassent 24k tokens. Les poids publiés sur Hugging Face restent inchangés et ont été entraînés pour 256k de contexte en auto-hébergement. Pour des entrées longues, Cloudflare conseille Clef, qui garde 64k.

Clef plus rapide, usages et auto-hébergement

Le Clef hébergé sur Workers AI gagne en vitesse grâce à des optimisations de l’infrastructure de service, dont le passage à SGLang. Aucun nouveau poids n’est publié. Le gain médian est de 1,7 fois pour environ 800 tokens, de 2,0 fois pour environ 3 400 tokens et de 1,7 fois pour environ 16 000 tokens.

Cloudflare a contribué à SGLang pour prendre en charge Clef, avec une intégration prévue dans la version 0.5.22. Les commandes de lancement sont sur le dépôt Hugging Face et dans les cookbooks SGLang. Clef est compatible avec l’API de Jev et disponible via AI Gateway : il suffit de changer l’identifiant du modèle.

En interne, Cloudflare utilise Clef pour détecter et fermer les tickets de spam de son dépôt de documentation, modérer les extensions de son CMS EmDash contre l’hameçonnage, repérer des données personnelles comme des pièces d’identité, et détecter des domaines malveillants.

Quelques repères

  • Poids ouverts : Les poids sont les paramètres appris d’un modèle d’IA. Quand ils sont publiés, chacun peut télécharger le modèle et l’exécuter sur ses propres machines.
  • Token : Unité de découpage utilisée par un modèle d’IA : un mot, un morceau de mot ou un fragment de média converti. Les tarifs et les limites de contexte se comptent souvent en tokens.
  • Mélange d’experts : Architecture où le modèle est composé de plusieurs sous-réseaux spécialisés, dont seule une partie travaille sur chaque entrée. Cela limite le calcul nécessaire.

Questions fréquentes

Clef-omni accepte-t-il l’audio et la vidéo ?

Oui. Clef-omni accepte l’audio en wav ou mp3, la vidéo en mp4 ou webm, ainsi que les images et le texte, dans un seul appel API.

Les poids de Clef-omni sont-ils disponibles en open source ?

Oui, Cloudflare a publié les poids de Clef-omni sur Hugging Face. Le modèle repose sur Qwen3-Omni-30B-A3B-Instruct.

Combien coûte Clef-omni ?

Clef-omni est lancé à 0,15 $ le million de tokens en entrée. Clef reste à 0,24 $ et Clef-flash passe de 0,09 $ à 0,038 $.

Clef-omni est-il rapide pour analyser une vidéo avec du son ?

Cloudflare annonce environ 1,5 seconde pour un clip de 21 secondes avec son, en un seul appel. Le texte seul revient en environ 130 ms à la médiane.

À retenir

Clef-omni permet de décider à partir de texte, d’images, d’audio et de vidéo avec un seul modèle à poids ouverts, sans transcription préalable. Cloudflare baisse aussi le prix de Clef-flash, au prix d’un contexte hébergé réduit à 24k, et accélère Clef hébergé.

Sources

multimodalcloudflareopen-weightaudiovidéoworkers ai
Dans le même genre

Des fiches proches.

toute la famille
À lire aussi

Les dernières fiches.

tout l'annuaire

Le Carnet de Geekus · chaque vendredi

Les trouvailles de la semaine, dans ta boîte mail.

Un email, cinq minutes de lecture. En français, gratuit, sans publicité.

S'inscrire au Carnet →
  1. Le spécimen de la semaine, expliqué à fond
  2. L'actu IA en bref
  3. Les autres trouvailles et le mot de la semaine