VoiceStudio est une application open source de voix par intelligence artificielle, qui fonctionne sur ton propre ordinateur. Elle permet de cloner une voix, d’en créer une à partir d’une description, de doubler une vidéo, de dicter, de transcrire et de fabriquer des livres audio, en 646 langues. Cet article explique comment elle marche, comment l’installer et ce que le projet dit de ses limites.
En bref
- Application de bureau open source (AGPL-3.0), présentée comme une alternative locale à ElevenLabs
- Clonage de voix, création de voix, doublage vidéo, dictée, transcription et livres audio
- 646 langues annoncées, moteur par défaut basé sur OmniVoice, d’autres moteurs au choix
- Fonctionne avec une carte NVIDIA, une puce Apple Silicon, ou sur le processeur seul, en plus lent
- Dernière version relevée : v0.5.6, publiée le 23 septembre 2026

Qu’est-ce que VoiceStudio ?
VoiceStudio est un atelier de voix synthétiques que tu installes sur ton ordinateur. Le dépôt le décrit comme une alternative open source à ElevenLabs, un service de voix hébergé en ligne, avec une différence de principe : ici, les traitements s’exécutent sur ta machine plutôt que chez un prestataire.
Le projet réunit dans une seule application des outils qui sont souvent séparés : clonage de voix, conception de voix, doublage de vidéos, dictée, transcription et création de livres audio. Il est écrit surtout en Python, et sa licence est l’AGPL-3.0.
Comment fonctionne VoiceStudio en local
L’application de bureau pilote un moteur de synthèse vocale installé sur ta machine. Le moteur par défaut est VoiceStudio lui-même, qui s’appuie sur k2-fsa/OmniVoice, et le projet propose d’autres moteurs au choix. Le modèle nécessaire se télécharge quand l’application le demande, et le catalogue des modèles se gère depuis l’application.
Le README précise que les traitements locaux utilisent ton matériel, que les services distants sont facultatifs et que les statistiques d’usage ne sont envoyées qu’avec ton accord. Il est aussi possible de brancher des machines distantes (« remote workers »), en option. Une partie de ces fonctions est décrite comme à venir sur le site du projet.

Clonage de voix, doublage vidéo et livres audio
Le site du projet liste sept ateliers. Le clonage reproduit une voix à partir d’un court enregistrement (le site parle de trois secondes), et le README recommande une référence propre, sans bruit. La conception de voix crée une voix à partir d’une description écrite.
Le doublage prend une vidéo et produit une parole calée sur le même rythme, dans une autre langue ; les notes de la version 0.5.4 ajoutent que dialogues, timing et sons d’arrière-plan sont conservés. Les livres audio se fabriquent chapitre par chapitre, avec une importation de fichiers EPUB.
- Voice clone : reproduire une voix à partir d’un échantillon
- Voice design : décrire une voix pour l’obtenir
- Video dubbing : doubler une vidéo dans une autre langue
- Stories : attribuer une voix à chaque rôle d’un script
- Audiobook : transformer un livre en chapitres audio
- Transcripts : passer d’un enregistrement à du texte consultable
Dicter, transcrire et brancher des outils
La dictée passe par un widget flottant, affiché au-dessus des autres fenêtres. La transcription convertit un enregistrement audio en texte dans lequel on peut chercher.
VoiceStudio expose aussi une API locale et un serveur MCP pour que des agents IA s’y connectent. La version 0.5.6 ajoute une configuration à copier pour Claude Code, Cursor, Codex CLI et l’OpenAI Agents SDK, ainsi que la possibilité de répondre à des appels téléphoniques Twilio avec un message d’accueil dans une voix enregistrée. Cette dernière option est désactivée par défaut.
Installer VoiceStudio sur Windows, macOS ou Linux
Sur macOS et Linux, une commande installe la dernière version de l’application de bureau. Elle exige curl et un outil de calcul SHA-256. Sur Windows 10 ou 11 en x64, le site propose une commande PowerShell. Des installateurs sont aussi téléchargeables depuis les versions publiées sur GitHub, et une image Docker existe.
Une fois l’application ouverte, tu choisis l’atelier Voice cloning, une voix ou un enregistrement de référence, tu saisis ton texte et tu lances la génération. Côté matériel, le README indique la prise en charge de la carte NVIDIA (CUDA) sur Windows et Linux, et d’Apple Silicon (Metal). Sans carte graphique dédiée, tout fonctionne sur le processeur, plus lentement, avec environ 5 Go d’espace disque pour la version allégée de PyTorch.
curl -fsSL https://voicestudio.sh/install | sh
powershell -ep bypass -c "irm https://voicestudio.sh/install.ps1|iex"
Pour qui, et pour quels usages
Le projet vise celles et ceux qui veulent produire de la voix sans envoyer leurs enregistrements à un service en ligne : doublage d’une vidéo, narration d’un livre, voix pour un script à plusieurs rôles, dictée au quotidien. Le site compare son offre à celle d’ElevenLabs et annonce que l’audio reste local, contre un envoi chez le prestataire ; cette comparaison vient du projet lui-même, relevée le 30 septembre 2026.
Une version Pro, avec licence commerciale, est vendue 99 dollars par an ou 299 dollars en achat unique, pour un utilisateur et trois appareils. La version open source est gratuite. Le site précise que l’usage commercial de la version open source relève de l’AGPL-3.0.
Où en est le projet
Selon les chiffres relevés sur GitHub le 2 octobre 2026, le dépôt, créé le 9 avril 2026, compte 51 727 étoiles, 5 756 copies, 94 contributeurs et 76 tickets ou demandes de fusion ouverts. La dernière version, v0.5.6, date du 23 septembre 2026.
Les trois dernières versions vont vite. La 0.5.4 répare le moteur CosyVoice et améliore les raccords audio des histoires et livres audio. La 0.5.5 permet de garder la langue de sortie choisie en clonage : une référence en anglais peut lire un script en français avec un moteur multilingue. La 0.5.6 permet de remplacer l’échantillon d’une voix clonée, de finir de longs chapitres sur des cartes graphiques de 8 Go et de conserver les chapitres générés après une coupure de courant.
Ce qu’il faut savoir avant de se lancer
Electron est désormais la seule application de bureau et interface web. La version 0.5.3 était la dernière version Tauri, et son système de mise à jour ne peut pas installer Electron : les anciens utilisateurs doivent installer Electron séparément, en sauvegardant d’abord leur dossier de données. Sur Mac Intel, seule l’interface est prise en charge, avec un serveur distant. Windows sur ARM reste expérimental.
Les installateurs Electron sont non signés ou signés de façon ad hoc, et non notariés par Apple : Windows et macOS peuvent afficher des avertissements, et les mises à jour automatiques sur macOS ne sont pas vérifiées. Les modèles ont chacun leur licence, à relire avant un usage commercial, et le projet demande de ne cloner une voix qu’avec l’accord de la personne.
Quelques repères
- API : Une API est une porte d’entrée qui permet à un logiciel d’en commander un autre par des demandes standardisées, sans passer par son interface visuelle.
- MCP : MCP est un protocole qui permet à un assistant IA d’utiliser des outils ou des services externes de manière normalisée.
- GPU : Le GPU est le processeur graphique d’un ordinateur. Il calcule beaucoup d’opérations en parallèle, ce qui accélère les modèles d’intelligence artificielle.
Questions fréquentes
VoiceStudio est-il gratuit ?
Oui, la version open source de VoiceStudio est gratuite et publiée sous licence AGPL-3.0. Le site propose en plus une version Pro avec licence commerciale, à 99 dollars par an ou 299 dollars en achat unique.
VoiceStudio fonctionne-t-il sans carte graphique ?
Oui, VoiceStudio reste utilisable sur le processeur seul, mais plus lentement. L’installation récupère alors la version allégée de PyTorch, qui demande environ 5 Go d’espace disque libre.
VoiceStudio est-il une alternative à ElevenLabs ?
Oui, c’est ainsi que le projet se présente. Dans sa propre comparaison, relevée le 30 septembre 2026, VoiceStudio tourne sur ta machine et est open source, alors qu’ElevenLabs est un service hébergé en code fermé, avec 74 langues sur ses offres payantes contre 646 pour VoiceStudio.
Comment cloner une voix avec VoiceStudio ?
Dans l’atelier Voice cloning, tu choisis une voix ou tu ajoutes un enregistrement de référence propre, tu saisis ton texte et tu lances la génération. Le modèle nécessaire s’installe quand l’application le demande.
À retenir
VoiceStudio regroupe en une seule application locale le clonage de voix, la création de voix, le doublage, la dictée, la transcription et les livres audio, sous licence AGPL-3.0. Le projet évolue vite, mais ses installateurs ne sont pas notariés et les modèles ont chacun leur licence, à vérifier avant tout usage commercial.



