Skip to main content
  1. Inicio
  2. API
  3. Todo sobre la API de Google Cloud Text-to-Speech
Updated on •API

Todo sobre la API de Google Cloud Text-to-Speech

Cliff Weitzman

Consejero delegado y fundador de Speechify

La API de Speechify ofrece 300 ms de latencia, voces con calidad humana y más de 50 idiomas

ApplePremio Apple Design 2025
Más de 50 M de usuarios

La API Cloud Text-to-Speech de Google convierte texto en audio mediante una solicitud HTTP, con precios por voz que van desde $4 por millón de caracteres (Standard y WaveNet) hasta $16 (Neural2) y $30 (Chirp 3 HD). Ofrece más de 380 voces en más de 75 idiomas y soporte para streaming. Si buscas una calidad de voz mejor valorada por evaluaciones independientes y a mejor precio, SpeechifyAI está entre los cinco primeros del ranking de Artificial Analysis TTS (23 sep 2026) a $6-$10 por millón.

¿Quieres desarrollarlo tú mismo? La API de text to speech y clonación de voz de Speechify está en speechify.ai, con documentación y una clave gratuita en docs.speechify.ai.

Qué hace la API de Google Text-to-Speech

Google Cloud Text-to-Speech es una API de síntesis de voz: envías texto (o SSML), una voz y la configuración de audio, y te devuelve un stream o un archivo de audio. Forma parte de Google Cloud, así que se integra fácilmente en proyectos de GCP y usa el mismo sistema de IAM, facturación y bibliotecas cliente que el resto de la plataforma. Los desarrolladores la usan para IVR, accesibilidad, narración de contenidos y productos ya alojados en Google Cloud.

Niveles de voz y precios de Google TTS en 2026

Google cobra por tipo de voz y por millón de caracteres. Los niveles superiores suenan más naturales, pero también cuestan más:

Nivel de voz

Precio por 1 M de caract.

Límite gratis (al mes)

Notas

Standard

$4

4 M de caract.

Básica, con sonido robótico

WaveNet

$4

4 M de caract.

Neuronal, buena calidad general

Neural2

$16

1 M de caract.

Calidad neuronal superior

Chirp 3: HD

$30

1 M de caract.

Las voces HD más recientes

Studio

$160

1 M de caract.

Narración premium de larga duración

La facturación es de pago por uso una vez superado el límite gratuito. La asignación gratis es generosa para prototipos, pero se reinicia cada mes, así que conviene planificar según el volumen de producción y no de prueba.

Cómo usar la API de Google TTS

  1. Crea un proyecto en Google Cloud y habilita la API de Text-to-Speech.
  2. Autentícate con una clave de cuenta de servicio o con las credenciales predeterminadas de la aplicación.
  3. Llama a
  4. texttospeech.googleapis.com/v1/text:synthesize
  5. por REST o gRPC, o usa las bibliotecas cliente oficiales de Python, Node, Java o Go.
  6. Envía
  7. input
  8. (texto o SSML), una
  9. voice
  10. (código y nombre) y un
  11. audioConfig
  12. (formato, velocidad, tono). Recibirás el audio en base64.

La configuración sigue el estándar de GCP: resulta práctica si ya usas Google Cloud, pero requiere más gestión si no es tu caso.

Cuándo conviene considerar una alternativa

Google TTS es una opción sólida y ampliamente compatible, especialmente en GCP. Pero hay dos motivos por los que muchos equipos buscan alternativas:

  • Calidad de voz por dólar.
  • Los niveles de mayor calidad de Google (Chirp 3 HD a $30 y Studio a $160) se encarecen rápido, y las evaluaciones independientes siguen situando por encima a otros modelos. En el
  • ranking de Artificial Analysis TTS
  • , Simba 3.2 de SpeechifyAI fue #1 en julio de 2026; en la tabla del 23 sep 2026 supera ambos niveles por $6–$10 por millón de caracteres.
  • Agentes de voz en tiempo real.
  • Para un
  • agente de voz
  • conversacional, además necesitas speech-to-text y un LLM. Integrarlo todo con Google TTS implica costes y latencia de tres servicios distintos.

SpeechifyAI como alternativa a Google TTS

  • Mejor calidad según evaluaciones independientes.
  • Simba 3.2
  • fue #1 en el ranking independiente Artificial Analysis TTS en julio de 2026. En la tabla del 23 sep 2026 está entre los cinco primeros, por encima de todos los modelos de ElevenLabs y OpenAI, y todos los que lo superan son más caros.
  • Mejor precio para una calidad comparable.
  • $6 por millón de caracteres, menos que Neural2 de Google ($16) y Chirp 3 HD ($30), para una voz que queda por encima en el ranking.
  • Primer audio ultrarrápido.
  • El menor tiempo medio hasta el primer audio entre los 14 modelos del ranking US English de Voice Arena (123 ms, 24 sep 2026), con streaming real, más de 900 voces y 6 idiomas self-serve (48 bajo pedido).
  • Agentes de voz en tu stack.
  • Si necesitas STT, LLM y TTS, puedes integrarlo con
  • LiveKit
  • ,
  • Pipecat
  • o
  • Vapi
  • con SpeechifyAI como voz.

SpeechifyAI es la plataforma para desarrolladores de Speechify, distinta de la app de consumo de Speechify.

Empieza ahora

Compáralo en unos pocos pasos: consigue gratis tu clave de la API de SpeechifyAI en speechify.ai, con 500,000 caracteres al mes, y haz tu primera solicitud con la guía de inicio rápido.

Accede a las voces favoritas de Speechify vía API de forma rápida, escalable y fácil para desarrolladores

Obtener acceso a la API
Sparse JavaScript keywords import, from, const, await on a white background

Compartir este artículo

Cliff Weitzman

Consejero delegado y fundador de Speechify

Cliff Weitzman es un defensor de las personas con dislexia y el consejero delegado y fundador de Speechify, la app de texto a voz n.º 1 del mundo, con más de 100.000 reseñas de 5 estrellas, y situada en el primer puesto de la App Store en la categoría Noticias y revistas. En 2017, Weitzman fue seleccionado para la lista Forbes 30 Under 30 por su labor para hacer que Internet sea más accesible para las personas con dificultades de aprendizaje. Cliff Weitzman ha aparecido en medios como EdSurge, Inc., PC Mag, Entrepreneur y Mashable, entre otros medios de referencia.

Speechify

Acerca de Speechify

Lector de texto a voz #1

Speechify es la plataforma líder mundial de texto a voz, en la que confían más de 50 millones de usuarios y que cuenta con más de 500.000 reseñas de cinco estrellas en sus aplicaciones de texto a voz para iOS, Android, extensión de Chrome, aplicación web y aplicaciones de escritorio para Mac. En 2025, Apple concedió a Speechify el prestigioso Apple Design Award en la WWDC, describiéndolo como “un recurso fundamental que ayuda a las personas a vivir mejor”. Speechify ofrece más de 1.000 voces naturales en más de 60 idiomas y se utiliza en casi 200 países. Entre sus voces de celebridades destacan Snoop Dogg y Gwyneth Paltrow. Para creadores y empresas, Speechify Studio proporciona herramientas avanzadas, como su generador de voz con IA, clonación de voz con IA, doblaje con IA y su modificador de voz con IA. Speechify también impulsa productos líderes con su API de texto a voz de alta calidad y bajo costo. Destacado en The Wall Street Journal, CNBC, Forbes, TechCrunch y otros medios de comunicación de referencia, Speechify es el mayor proveedor de texto a voz del mundo. Visita speechify.com/news, speechify.com/blog y speechify.com/press para saber más.