Skip to main content
  1. Inicio
  2. API
  3. Cómo la API de Text-to-Speech de Speechify admite 13 emociones
Updated on •API

Cómo la API de Text-to-Speech de Speechify admite 13 emociones

Cliff Weitzman

CEO y fundador de Speechify

La API de Speechify ofrece una latencia de 300 ms, voces con calidad humana y más de 50 idiomas

ApplePremio Apple Design 2025
50M+ usuarios

Por qué la emoción es la nueva frontera de la síntesis de voz

¿Quieres desarrollar esto por tu cuenta? La API de text-to-speech y clonación de voz de Speechify está en speechify.ai, con documentación y una clave gratuita en docs.speechify.ai.

La TTS moderna resolvió la inteligibilidad hace años. El Blizzard Challenge, una referencia anual que mide los avances en síntesis de voz desde 2005, informó que para 2021 la voz sintética era indistinguible de la voz natural en inteligibilidad y casi idéntica también en naturalidad (Perrotin et al., 2024). Así que el enfoque cambió. La pregunta ya no era ¿puedes entender la voz?, sino ¿suena como si de verdad sintiera lo que dice? Ahora Speechify ofrece no solo text-to-speech, sino también text-to-speech emocional.

Speechify ofrece text-to-speech emocional

La gama emocional de Speechify abarca Enojado, Alegre, Triste, Aterrorizado, Relajado, Temeroso, Sorprendido, Calmado, Asertivo, Enérgico, Cálido, Directo y Brillante. Estas opciones cubren el rango tonal que un narrador, actor o presentador real usaría en un solo proyecto. Un video explicativo puede empezar Brillante, pasar a Calmado en la parte técnica y cerrar con un tono Cálido. Un NPC de videojuego puede pasar de Asertivo a Aterrorizado en dos líneas.

Cómo usar emociones en el generador de voz con IA de Speechify

El Generador de Voz con IA está dentro de Speechify Studio y es la herramienta que usan los creadores para locuciones, videos de marketing, audiolibros y segmentos de pódcast. Pegas tu guion, eliges una voz y luego aplicas un estilo emocional a todo el clip o solo a una selección. Como las emociones se aplican por selección, una misma locución puede tener una apertura Alegre, una propuesta de valor Asertiva y un cierre Cálido sin cambiar de voz.

Algunos flujos de trabajo concretos en los que esto resulta relevante:

Los videos de marketing que se producen con herramientas como CapCut suelen requerir dos o tres tonos, como captar atención, generar expectativa y llamar a la acción. En vez de grabar tres voces distintas, puedes generar una sola locución donde la emoción cambia en cada frase. Los audiolibros y la narración de ficción se benefician aún más, ya que los diálogos pueden transmitir emociones distintas sin recurrir a varios narradores. Para materiales explicativos, una sola voz calmada en secciones técnicas densas resulta más clara que forzar intensidad en todo el texto.

Cómo usar emociones en la API de Speechify

Para desarrolladores, las mismas 13 emociones están disponibles en la API de Speechify con la etiqueta SSML <speechify:style>. Solo tienes que envolver el texto que quieras estilizar, indicar la emoción, y la API genera el audio con esa emoción aplicada únicamente en ese fragmento. Así, los asistentes virtuales pueden sonar Asertivos al confirmar un pago y Cálidos al saludar a un usuario recurrente, sin cambiar de voz a mitad de la sesión.

Las plataformas de e-learning usan el mismo mecanismo para marcar la retroalimentación de evaluaciones: Alegre para respuestas correctas, Directo para correcciones y Calmado para pistas. Los motores de ficción interactiva procesan los diálogos con etiquetas de emoción en cada línea, lo que permite que una sola voz clonada cubra todos los personajes.

AI Voice Generator vs Speechify API: ¿cuál elegir?

Caso de uso

Generador de Voz con IA (Studio)

API

Locuciones, marketing, audiolibros

Sí, editor visual, emociones por selección

Posible, pero excesivo

Voz integrada para apps, asistentes y e-learning

No es la mejor opción

Sí, con etiquetas SSML <speechify:style>

Formato

Interfaz web

API REST

Ideal cuando

Generas un audio terminado

Generas audio en tiempo real en tu producto

Dónde las voces emocionales transforman lo que puedes crear

El TTS emocional es una pieza clave para la creatividad. Una sola voz tipo celebridad narrando un audiolibro completo, un personaje animado transmitiendo tanto humor como tristeza, una intro de pódcast que da justo en el tono: todo esto no era posible con una síntesis plana. Ahora sí lo es porque la emoción está en la voz, no solo en las indicaciones del guion. Para creadores que ya usan voces de celebridad o personajes en Speechify, los estilos emocionales marcan la diferencia entre que una voz suene como la referencia o que realmente actúe como ella.

¿La entrega emocional realmente mejora la comprensión?

Sí, y eso se puede medir incluso fuera de la IA. Un estudio de 2022 con jóvenes de 11 a 13 años y una réplica en 2025 (Dylman y Champoux-Larsson) hallaron que los oyentes respondían más preguntas correctamente si el material se leía con prosodia positiva en lugar de un tono neutral (Dylman et al., 2025). La mejora en comprensión fue significativa y se mantuvo tanto en el recuerdo inmediato como en el posterior. Para material educativo, tutoriales de producto o cualquier audio largo donde la retención importa, una voz con la emoción adecuada es un apoyo real para la comprensión.

Preguntas frecuentes

¿Qué es text-to-speech con emociones?

Es voz sintética con un tono emocional elegido (alegre, triste, etc.), además del texto, lo que permite que una misma frase se escuche de distintas formas. En Speechify puedes seleccionar la emoción por fragmento.

¿Cuántas emociones admite Speechify?

Trece: Enojado, Alegre, Triste, Aterrorizado, Relajado, Temeroso, Sorprendido, Calmado, Asertivo, Enérgico, Cálido, Directo y Brillante; disponibles tanto en el AI Voice Generator como en la API de Speechify.

¿Dónde controlo la emoción en el Generador de Voz con IA?

En Speechify Studio, después de ingresar tu guion, aparece un selector de emociones junto al selector de voz. Puedes aplicarlo a todo el clip o a una selección marcada, y luego volver a generar el audio.

¿Cómo uso emociones en la API de Speechify?

Envuelve el texto en una etiqueta SSML <speechify:style> usando el nombre de la emoción como atributo. La API devuelve el audio con esa emoción aplicada solo al fragmento señalado.

¿Puedo combinar emociones en una sola locución?

Sí. Las emociones se aplican por selección en Speechify Studio y por fragmento SSML en la API, así que una misma locución o sesión puede cambiar de tono línea por línea sin cambiar de voz.

¿Las voces emocionales suenan tan naturales como las neutrales?

Muy parecido. Los modelos de TTS emocional revisados por expertos ahora obtienen alrededor de 3.94/5.0 en expresividad y 3.98/5.0 en naturalidad, por lo que los oyentes los califican casi igual en ambas dimensiones.

¿La entrega emocional realmente ayuda a retener el contenido?

Las investigaciones con oradores humanos lo confirman. Una prosodia positiva mejora la retención de información factual en estudios controlados. El mismo principio aplica a locuciones con IA bien dirigidas.

¿Puedo usar voces emocionales para locuciones comerciales?

La licencia de Speechify permite el uso comercial de locuciones generadas, incluidas las voces emocionales. Consulta tu plan para conocer los límites de duración del audio.

¿La emoción funciona con voces clonadas o de celebridades?

Sí. Los estilos emocionales se aplican sobre la voz base en Speechify, así que una voz clonada puede expresar las 13 emociones sin requerir una grabación distinta para cada una.

¿Cómo se diferencia esto de solo ajustar la velocidad o el tono?

Las emociones modifican toda la prosodia, incluidas las pausas, el énfasis, la entonación y la energía. Por eso una versión "enojada" no suena simplemente más rápida o aguda que la neutral.


Accede a las voces favoritas de Speechify vía API de forma rápida, escalable y fácil de integrar para desarrolladores

Obtener acceso a la API
Sparse JavaScript keywords import, from, const, await on a white background

Compartir este artículo

Cliff Weitzman

CEO y fundador de Speechify

Cliff Weitzman es un defensor de las personas con dislexia y el CEO y fundador de Speechify, la aplicación número uno de texto a voz en el mundo, con más de 100,000 reseñas de 5 estrellas y que ocupa el primer lugar en la App Store en la categoría de Noticias y Revistas. En 2017, Weitzman fue incluido en la lista Forbes 30 Under 30 por su trabajo para hacer que internet sea más accesible para personas con discapacidades de aprendizaje. Cliff Weitzman ha aparecido en EdSurge, Inc., PC Mag, Entrepreneur, Mashable y otros medios reconocidos.

Speechify

Acerca de Speechify

El lector de texto a voz N.º 1

Speechify es la plataforma líder mundial de texto a voz, en la que confían más de 50 millones de usuarios y respaldan más de 500,000 reseñas de cinco estrellas en sus aplicaciones de texto a voz para iOS, Android, extensión de Chrome, aplicación web y aplicaciones de escritorio para Mac. En 2025, Apple otorgó a Speechify el prestigioso Apple Design Award en la WWDC, llamándolo “un recurso crítico que ayuda a las personas a vivir su vida”. Speechify ofrece más de 1,000 voces naturales en más de 60 idiomas y se utiliza en casi 200 países. Entre las voces de celebridades se incluyen Snoop Dogg y Gwyneth Paltrow. Para creadores y empresas, Speechify Studio proporciona herramientas avanzadas, incluyendo generador de voz con IA, clonación de voz con IA, doblaje con IA y su cambiador de voz con IA. Speechify también impulsa productos líderes con su API de texto a voz de alta calidad y rentable texto a voz API. Destacado en The Wall Street Journal, CNBC, Forbes, TechCrunch y otros grandes medios de comunicación, Speechify es el mayor proveedor de texto a voz del mundo. Visita speechify.com/news, speechify.com/blog y speechify.com/press para saber más.