OmniVoice : cloner sa voix en local et en français, réglages et limite de licence
Cloner sa propre voix sans envoyer ses enregistrements sur un serveur, c'est ce que promet OmniVoice, un modèle développé par l'équipe Next-gen Kaldi de Xiaomi. D'après la source, il suffit d'un extrait audio de 3 à 10 secondes pour obtenir une voix de synthèse qui ressemble à la vôtre, et le tout tourne en local, gratuitement, sur Mac, Linux ou Windows. Deux réserves importantes avant de se lancer : la qualité dépend beaucoup de la propreté de l'extrait de référence, et les poids du modèle sont sous licence CC-BY-NC, ce qui interdit l'usage commercial. Voici ce qu'il faut savoir pour installer l'outil, le régler correctement et éviter les pièges.
Ce que fait OmniVoice, et ce que ça implique
Le modèle prend en charge 646 langues selon la source, et le français n'est pas un parent pauvre : il s'agit de la cinquième langue du corpus d'entraînement, avec 23 675 heures sur un total de 581 000. Concrètement, cela signifie que la prononciation française est mieux couverte que dans beaucoup d'outils multilingues, même si cela ne garantit pas un résultat parfait sur les noms propres ou les phrases complexes.
L'usage est local et gratuit, mais il faut distinguer deux licences. Le code d'OmniVoice est publié sous Apache 2.0, une licence permissive. Les poids du modèle, eux, sont sous CC-BY-NC : usage personnel autorisé, usage commercial interdit. C'est une nuance que le README ne mettrait pas en avant, selon la source, et elle change tout pour un créateur qui voudrait monétiser des voix off générées.
Installation : les prérequis à vérifier avant de commencer
OmniVoice nécessite Python 3.10 ou plus récent, dans un environnement isolé. Le premier lancement télécharge environ 3,3 Go de poids, donc prévoyez de l'espace disque et une connexion correcte.
Le matériel compte davantage. Sur Mac, le modèle utilise le GPU intégré via MPS. Sur Linux et Windows, une carte NVIDIA est nécessaire pour en tirer quelque chose de confortable. Sans carte graphique, l'installation fonctionne, mais le calcul prend environ cinq fois la durée de l'audio d'après un test cité par la source. Autrement dit, une phrase de dix secondes peut demander près d'une minute.
Attention aussi aux chiffres de performance du projet : le facteur 40 fois plus rapide que le temps réel a été mesuré sur un H100, pas sur un ordinateur de bureau. Sur un M4 Max, la source a compté 4 à 6 secondes de calcul pour 5,4 secondes d'audio. C'est utilisable, mais très loin du chiffre mis en avant.
Les deux réglages qui changent vraiment le résultat
1. La qualité de l'extrait de référence
C'est le point le plus déterminant. L'extrait doit être propre : pas de blanc, pas d'hésitation, pas de musique de fond. Au-delà de 10 secondes, l'extrait ralentit le calcul et dégrade le clonage selon la source. Mieux vaut donc un court passage net qu'un long enregistrement approximatif.
2. Fournir la transcription exacte
Si vous ne donnez pas la transcription de l'extrait, l'outil télécharge Whisper, soit 1,6 Go supplémentaires, et peut se tromper sur les noms propres. En fournissant le texte exact, vous évitez ce téléchargement et ces erreurs. Détail pratique : la ligne de commande n'applique aucune normalisation, donc les chiffres doivent être écrits en toutes lettres.
Les limites à connaître avant de s'engager
Le clonage n'est pas parfait. Sur 24 générations de la même phrase, 5 ont perdu ou déformé un mot, souvent au début ou à la fin, selon la source. C'est un bug connu qui oblige à relancer plusieurs fois pour obtenir une prise correcte. La qualité dépend aussi fortement de la propreté de l'extrait audio de référence.
Et surtout, la licence CC-BY-NC des poids ferme la porte aux projets professionnels. Pour un usage personnel, expérimental ou éducatif, OmniVoice reste une option intéressante. Pour produire des voix off commerciales, il faudra chercher ailleurs ou vérifier les conditions auprès de l'équipe.
En résumé
- Ce que c'est : un modèle de clonage vocal local, gratuit, multilingue (646 langues), développé par Next-gen Kaldi (Xiaomi).
- Ce qu'il faut : Python 3.10+, un environnement isolé, 3,3 Go d'espace, et idéalement une carte NVIDIA (ou un Mac récent).
- Les deux réglages clés : un extrait de référence propre de 3 à 10 secondes, et la transcription exacte fournie manuellement.
- La limite : poids sous CC-BY-NC, donc pas d'usage commercial.
- Les performances réelles : loin du 40x temps réel annoncé, qui a été mesuré sur un H100.
OmniVoice est un outil prometteur pour qui veut expérimenter le clonage vocal en français sans dépendre d'un service cloud. À condition d'accepter ses limites : quelques ratés à la génération, une qualité très dépendante de l'extrait, et une licence qui restreint sérieusement les usages professionnels.
Source
OmniVoice - Clonez votre propre voix en local et en français