Fish Audio icône
Fish Audio
#54 dans Lecture Vocale (TTS)
4.5/5
« Une plateforme de synthèse vocale IA avancée. Créez des voix réalistes, personnalisez-les et intégrez-les facilement à vos projets grâce à une API puissante »
En savoir plus : ChatGPT Perplexity
Freemium 2843

Fish Audio: dix secondes d'audio pour cloner une voix, 83 langues en sortie

Fish Audio est une plateforme de synthèse vocale et de clonage de voix par IA, née du projet open source Fish Speech. Un extrait de 10 secondes suffit pour recréer un timbre, et le clone obtenu peut parler dans 83 langues, français compris. La formule gratuite couvre environ sept minutes d'audio par mois, tandis que la publication commerciale passe par un abonnement payant. Les vidéastes, podcasteurs et studios de jeu y trouvent une alternative nettement moins chère à ElevenLabs.

Avantages
  • Clonage vocal à partir de 10 secondes d'audio
  • 83 langues avec détection automatique, dont le français
  • Balises d'émotion, chuchotement, rire, ton radio
  • Modèle S2 publié en poids ouverts
  • Tarifs bien en dessous des rivaux directs
Inconvénients
  • Interface en anglais uniquement
  • Formule gratuite réservée aux projets personnels
  • Qualité inégale dans la bibliothèque communautaire

Fish Audio clone un timbre, puis le fait chuchoter ou éclater de rire

Fish Audio repose sur le modèle maison S2.1 Pro, capable de générer une voix naturelle dans 83 langues avec un temps de réponse d'environ 90 millisecondes, assez rapide pour un agent vocal en conversation réelle. Vous collez votre script, choisissez une voix dans une bibliothèque de plus de 2 millions de modèles ou créez la vôtre depuis un court enregistrement, et le fichier sort en quelques secondes.

Le vrai plaisir, ce sont les balises glissées dans le texte. Écrivez une indication entre crochets, chuchote nerveusement ou rit doucement, et le modèle suit la consigne au mot près (oui, la balise rire fonctionne vraiment, et c'est troublant la première fois). Cette latence sous les 300 ms en streaming place l'API parmi les plus réactives des outils de synthèse vocale du marché.

Prise en main de Fish Audio, du clonage à la voix off

D'un GPU de gamer à une levée de 52 millions de dollars

Fish Speech, l'ancêtre open source de la plateforme, a dépassé les 31 000 étoiles sur GitHub. Son auteur, Shijia Liao, ancien chercheur de NVIDIA et amateur de VTubers, a entraîné ses premiers modèles sur une seule carte graphique de jeu, dans sa chambre. L'entreprise revendique aujourd'hui 8 millions de comptes et a annoncé une levée d'amorçage de 52 millions de dollars menée par Coreline Ventures et Capital Today.

La maison n'a pas renié ses origines. Le modèle S2, entraîné sur 10 millions d'heures d'audio, a été publié en poids ouverts avec son code d'affinage, et il a remporté à sa sortie des tests d'écoute à l'aveugle face à Seed-TTS et MiniMax-Speech. Peu d'acteurs du secteur jouent cette carte de la transparence.

Fish Audio en pratique, du plan gratuit à l'API

Fish Audio se teste sans carte bancaire. Le plan gratuit donne 8 000 crédits par mois, soit environ sept minutes d'audio, mais reste limité aux projets personnels. Pour monétiser une vidéo YouTube ou un podcast, il faut basculer sur un abonnement payant. Les développeurs disposent en parallèle d'une déclinaison gratuite de S2.1 Pro via l'API, sous conditions d'usage raisonnable.

FormuleTarifCe que vous obtenez
Gratuit0 $Environ 7 min par mois, usage personnel
Plus15 $ par moisEnviron 200 min, droits commerciaux, API
Pro100 $ par mois2 millions de crédits, 3 sièges d'équipe
APIEnviron 15 $ le million de caractèresFacturation à l'usage, streaming temps réel

Questions fréquentes

Fish Audio est-il gratuit ?

Oui, Fish Audio propose un plan gratuit permanent avec 8 000 crédits par mois, soit environ sept minutes d'audio, plafonné à 500 caractères par génération. Cette formule est réservée aux projets personnels, sans accès API. La monétisation d'un contenu, sur YouTube ou ailleurs, demande un abonnement payant avec droits commerciaux.

Fish Audio gère-t-il bien le français ?

Oui, le français fait partie des 83 langues prises en charge par le modèle S2.1 Pro, avec détection automatique de la langue du texte. Un clone créé depuis un enregistrement en anglais peut ensuite parler français avec le même timbre. Seule l'interface du site reste en anglais pour le moment.

Fish Audio ou ElevenLabs, lequel choisir ?

Fish Audio mise sur le prix et le contrôle fin des émotions, avec une API facturée autour de 15 $ le million de caractères, plusieurs fois moins que sa rivale. ElevenLabs conserve un studio plus fourni, doublage vidéo et effets sonores inclus. Pour la voix off multilingue à gros volume, Fish Audio garde un net avantage budgétaire.

Peut-on héberger Fish Audio sur son propre serveur ?

Oui, le modèle S2 a été publié en poids ouverts avec son code d'affinage et un moteur d'inférence prêt pour la production. Vous pouvez donc le faire tourner sur votre propre matériel, y compris pour un usage commercial selon la licence du dépôt, ce que la plupart des services vocaux fermés ne permettent pas.

Verdict : Sonoriser un livre audio, un jeu ou une chaîne YouTube sans studio ni micro, voilà le terrain où Fish Audio excelle. Vidéastes, développeurs et podcasteurs à budget serré y gagnent une voix crédible en français pour une fraction du tarif des ténors du secteur.

★ Outils IA de Prestige ★
IA Alternatives à Fish Audio