Synthèse vocale

Collez le texte, choisissez une voix et appuyez sur le bouton. Tout est synthétisé dans le navigateur : la voix du système démarre aussitôt, la voix neuronale demande un téléchargement unique mais sonne pareil sur tous les appareils et peut être enregistrée dans un fichier.

  • 0Caractères
  • 0Durée approximative
  • 0Voix disponibles

La voix du système ne peut pas être enregistrée : le navigateur l’envoie directement à la carte son sans fournir de flux audio à la page. La voix neuronale, elle, est calculée sur votre appareil et se télécharge en WAV.

Comment faire

  1. Collez ou saisissez le texte à lire.
  2. Pour une voix régulière sur tous les appareils — et un fichier à conserver — activez la voix neuronale : le modèle se télécharge une fois et reste dans le navigateur.
  3. Choisissez une voix — la liste vient des langues installées sur votre appareil.
  4. Réglez vitesse et hauteur si la lecture par défaut est trop rapide ou trop plate.
  5. Appuyez sur « Lire à voix haute » ; vous pouvez mettre en pause et reprendre au même endroit.

Bon à savoir

D’où viennent les voix

Le navigateur n’embarque pas de voix : il les demande au système d’exploitation. D’où une liste différente d’une machine à l’autre : un téléphone en a souvent plusieurs par langue, un Linux de bureau peut n’en avoir aucune tant qu’un paquet vocal n’est pas installé. Cela signifie aussi ni limite de caractères ni abonnement : le travail est fait par un logiciel que vous possédez déjà.

Trois voix, trois compromis

La voix du système ne coûte rien à lancer : elle est déjà installée et parle dès le clic — mais son rendu dépend de la machine, et sur un Linux de bureau il peut n’y en avoir aucune. Les voix neuronales sont des modèles téléchargés qui tournent sur votre appareil : Kokoro, quatre-vingt-huit mégaoctets, sonne le plus vivant et couvre cette langue ; Piper pèse soixante et connaît toutes les langues du site. Dans les deux cas le texte reste chez vous et le résultat s’enregistre en WAV.

Un texte long est lu par morceaux

Recevant un article entier, le moteur vocal abandonne en route : Chrome s’arrête au bout d’une quinzaine de secondes si l’on ne relance pas la file, et Safari laisse tomber tout ce qui dépasse quelques centaines de caractères. Le texte est donc découpé aux limites de phrases et mis en file une phrase à la fois. Découper au nombre de caractères placerait la coupure au milieu d’un mot, ce qui s’entend comme un bégaiement.

Questions fréquentes

Puis-je télécharger l’audio ?

Oui, avec la voix neuronale : elle fabrique le son dans la page même, et un bouton « Télécharger le WAV » apparaît à côté du lecteur. La voix du système, elle, ne peut pas être enregistrée : le navigateur l’envoie directement à la carte son sans fournir de flux audio à la page.

La liste des voix est vide. Que faire ?

Le système n’en a aucune installée. Sous Windows on les ajoute dans les paramètres de langue, sous Android et iOS dans l’accessibilité, sous Linux en installant un paquet de voix pour speech-dispatcher. Rechargez ensuite la page : la liste est lue au chargement.

Pourquoi le même texte sonne-t-il autrement dans un autre navigateur ?

Parce que la voix vient du système, mais le choix de la voix par défaut, la gestion des pauses et le rythme exact appartiennent au navigateur. Chrome peut en outre proposer des voix réseau, plus lisses et nécessitant une connexion.

Le texte est-il envoyé à un serveur ?

La page n’envoie aucun texte. La voix neuronale télécharge son modèle depuis huggingface une seule fois, puis fonctionne hors ligne ; ce que vous collez ne quitte jamais l’appareil. Une voix système marquée « réseau » peut, elle, demander l’audio au fabricant : c’est pourquoi les voix locales sont privilégiées ici.

Outils similaires