Texto a voz

Pega el texto, elige una voz y pulsa el botón. Todo se genera dentro del navegador: la voz del sistema arranca al instante, la neuronal necesita una descarga única pero suena igual en cualquier dispositivo y se puede guardar como archivo.

  • 0Caracteres
  • 0Duración aproximada
  • 0Voces disponibles

La voz del sistema no se puede guardar: el navegador la envía directo a la tarjeta de sonido sin dar a la página un flujo de audio. La voz neuronal se genera en tu dispositivo, así que se puede descargar en WAV.

Cómo usarlo

  1. Pega o escribe el texto que se debe leer.
  2. Para una voz pareja en cualquier dispositivo — y un archivo que puedas guardar — activa la voz neuronal: el modelo se descarga una vez y se queda en el navegador.
  3. Elige una voz: la lista viene de los idiomas instalados en tu dispositivo.
  4. Ajusta velocidad y tono si la lectura por defecto va rápida o suena plana.
  5. Pulsa «Leer en voz alta»; puedes pausar y continuar desde el mismo punto.

Lo que conviene saber

De dónde salen las voces

El navegador no lleva voces propias: se las pide al sistema operativo. Por eso la lista cambia de un equipo a otro: un teléfono suele tener varias voces por idioma y un Linux de escritorio puede no tener ninguna hasta instalar un paquete de habla. También significa que no hay límite de caracteres ni suscripción: el trabajo lo hace software que ya tienes.

Tres voces, tres compromisos

La voz del sistema no cuesta nada arrancar: ya está instalada y habla en cuanto pulsas el botón, pero cómo suena depende de la máquina, y en un Linux de escritorio puede no haber ninguna. Las voces neuronales son modelos que se descargan y funcionan en tu propio equipo: Kokoro, de ochenta y ocho megabytes, es la que suena más viva y cubre este idioma; Piper pesa sesenta y conoce todos los idiomas del sitio. En ambos casos el texto se queda contigo y el resultado se puede guardar en WAV.

El texto largo se lee por partes

Si se le entrega un artículo entero, el motor de voz se rinde a mitad de camino: Chrome se detiene a los quince segundos si no se empuja la cola, y Safari descarta todo lo que pasa de unos cientos de caracteres. Por eso el texto se corta en los límites de las frases y se encola de una en una. Cortar por número de caracteres pondría el corte dentro de una palabra, y eso se oye como un tartamudeo.

Preguntas frecuentes

¿Puedo descargar el audio como archivo?

Sí, con la voz neuronal: genera el audio en la propia página, por eso junto al reproductor aparece el botón «Descargar WAV». La voz del sistema no se puede guardar: el navegador la envía directo a la tarjeta de sonido sin dar a la página un flujo de audio, así que no hay con qué armar un archivo.

No hay voces en la lista. ¿Qué hago?

El sistema no tiene ninguna instalada. En Windows se añaden en la configuración de Idioma, en Android e iOS en Accesibilidad, en Linux instalando un paquete de voces de speech-dispatcher. Recarga la página después: la lista se lee al cargar.

¿Por qué el mismo texto suena distinto en otro navegador?

Porque la voz viene del sistema, pero la elección de la voz por defecto, el manejo de las pausas y el ritmo exacto son del navegador. Chrome además puede ofrecer voces de red, que suenan más suaves y necesitan conexión.

¿Se envía el texto a un servidor?

La página no envía ningún texto. La voz neuronal descarga su modelo de huggingface una sola vez y luego trabaja sin conexión; las palabras que pegas nunca salen del dispositivo. Una voz del sistema marcada como de red sí puede pedir el audio al fabricante, y por eso aquí se prefieren las locales.

Herramientas relacionadas