Skip to main content
  1. Inicio
  2. API
  3. Todo sobre la API de Google Cloud Text-to-Speech
Updated on •API

Todo sobre la API de Google Cloud Text-to-Speech

Cliff Weitzman

CEO y fundador de Speechify

La API de Speechify ofrece una latencia de 300 ms, voces con calidad humana y más de 50 idiomas

ApplePremio Apple Design 2025
50M+ usuarios

La API de Google Cloud Text-to-Speech convierte texto en audio mediante una solicitud HTTP, con precios desde $4 por millón de caracteres para voces Standard y WaveNet, $16 para Neural2 y $30 para Chirp 3 HD. Ofrece más de 380 voces en más de 75 idiomas y admite streaming. Si buscas una voz de mejor calidad a menor costo, SpeechifyAI está entre los cinco primeros del ranking de Artificial Analysis TTS (23 sep 2026), con precios de $6 a $10 por millón.

¿Lo vas a desarrollar tú mismo? La API de texto a voz y clonación de voz de Speechify está en speechify.ai, con documentación y una clave gratuita en docs.speechify.ai.

Qué hace la API de Google Text-to-Speech

Google Cloud Text-to-Speech es una API de síntesis de voz: envías texto (o SSML) junto con la voz y la configuración, y recibes un archivo o flujo de audio. Forma parte de Google Cloud, así que se integra fácilmente en proyectos de GCP y usa el mismo IAM, la misma facturación y las mismas bibliotecas cliente que el resto de la plataforma. Los desarrolladores la usan para IVR, accesibilidad, narración de contenido y cualquier producto que ya funcione en Google Cloud.

Niveles de voz y precios de Google TTS en 2026

Google cobra por tipo de voz y por millón de caracteres. Los niveles más altos suenan más naturales, pero también cuestan más:

Nivel de voz

Precio por 1 millón de caracteres

Nivel gratuito (al mes)

Notas

Standard

$4

4 M de caracteres

Básica, algo robótica

WaveNet

$4

4 M de caracteres

Neuronal, buena calidad general

Neural2

$16

1 M de caracteres

Neuronal de mayor calidad

Chirp 3: HD

$30

1 M de caracteres

Voces HD de última generación

Studio

$160

1 M de caracteres

Narración premium para formato largo

La facturación es por uso una vez que superas el nivel gratuito. Es generoso para prototipos, pero se reinicia cada mes, así que planea con base en tu volumen real, no solo en la prueba.

Cómo llamar a la API de Google TTS

  1. Crea un proyecto en Google Cloud y habilita la API de Text-to-Speech.
  2. Autentícate con una clave de cuenta de servicio o con las Credenciales Predeterminadas de la Aplicación.
  3. Llama a
  4. texttospeech.googleapis.com/v1/text:synthesize
  5. mediante REST o gRPC, o usa las bibliotecas oficiales de Python, Node, Java o Go.
  6. Envía
  7. input
  8. (texto o SSML), una
  9. voice
  10. (código de idioma y nombre) y un
  11. audioConfig
  12. (formato, velocidad, tono). Recibirás audio en base64.

La configuración es la habitual en GCP: resulta práctica si ya trabajas en Google Cloud, pero más compleja si no.

Cuándo conviene considerar una alternativa

Google TTS es una opción sólida y ampliamente compatible, especialmente dentro de GCP. Pero hay dos razones principales por las que los equipos buscan otras opciones:

  • Calidad de voz por dólar.
  • Los niveles con mejor sonido de Google (Chirp 3 HD a $30 y Studio a $160) elevan el costo rápidamente, y las evaluaciones independientes siguen colocando a otros modelos por encima. En el
  • ranking de Artificial Analysis TTS
  • , Simba 3.2 de SpeechifyAI ocupó el puesto #1 en julio de 2026 y, en la tabla del 23 sep 2026, supera ambos niveles por $6 a $10 por millón de caracteres.
  • Agentes de voz en tiempo real.
  • Para crear un
  • agente de voz
  • , también necesitas reconocimiento de voz y un LLM. Usar Google TTS implica facturación y latencia en tres servicios distintos.

SpeechifyAI como alternativa a Google TTS

  • Mayor calidad según evaluaciones independientes.
  • Simba 3.2
  • fue #1 en el ranking de Artificial Analysis TTS en julio de 2026. En la tabla del 23 sep 2026 está entre los cinco primeros, por encima de todos los modelos de ElevenLabs y OpenAI, y los modelos mejor valorados cuestan más.
  • Mejor precio con una calidad comparable.
  • $6 por millón de caracteres, menos que Neural2 ($16) y Chirp 3 HD ($30) de Google, para una voz que supera ambos niveles.
  • Primer audio más rápido.
  • El menor tiempo promedio hasta el primer audio entre 14 modelos en Voice Arena para inglés de EE. UU. (123 ms, 24 sep 2026), con streaming real, más de 900 voces y 6 idiomas autogestionados (48 a solicitud).
  • Agentes de voz dentro de tu stack.
  • Si necesitas STT + LLM + TTS, intégralo con
  • LiveKit
  • ,
  • Pipecat
  • o
  • Vapi
  • usando SpeechifyAI como voz.

SpeechifyAI es la plataforma para desarrolladores de Speechify, distinta de la app de consumo de Speechify.

Empieza ahora

Compáralo fácilmente con Google: obtén gratis tu clave API de SpeechifyAI en speechify.ai, con 500,000 caracteres al mes, y haz tu primera solicitud con la guía rápida.

Accede a las voces favoritas de Speechify vía API de forma rápida, escalable y fácil de integrar para desarrolladores

Obtener acceso a la API
Sparse JavaScript keywords import, from, const, await on a white background

Compartir este artículo

Cliff Weitzman

CEO y fundador de Speechify

Cliff Weitzman es un defensor de las personas con dislexia y el CEO y fundador de Speechify, la aplicación número uno de texto a voz en el mundo, con más de 100,000 reseñas de 5 estrellas y que ocupa el primer lugar en la App Store en la categoría de Noticias y Revistas. En 2017, Weitzman fue incluido en la lista Forbes 30 Under 30 por su trabajo para hacer que internet sea más accesible para personas con discapacidades de aprendizaje. Cliff Weitzman ha aparecido en EdSurge, Inc., PC Mag, Entrepreneur, Mashable y otros medios reconocidos.

Speechify

Acerca de Speechify

El lector de texto a voz N.º 1

Speechify es la plataforma líder mundial de texto a voz, en la que confían más de 50 millones de usuarios y respaldan más de 500,000 reseñas de cinco estrellas en sus aplicaciones de texto a voz para iOS, Android, extensión de Chrome, aplicación web y aplicaciones de escritorio para Mac. En 2025, Apple otorgó a Speechify el prestigioso Apple Design Award en la WWDC, llamándolo “un recurso crítico que ayuda a las personas a vivir su vida”. Speechify ofrece más de 1,000 voces naturales en más de 60 idiomas y se utiliza en casi 200 países. Entre las voces de celebridades se incluyen Snoop Dogg y Gwyneth Paltrow. Para creadores y empresas, Speechify Studio proporciona herramientas avanzadas, incluyendo generador de voz con IA, clonación de voz con IA, doblaje con IA y su cambiador de voz con IA. Speechify también impulsa productos líderes con su API de texto a voz de alta calidad y rentable texto a voz API. Destacado en The Wall Street Journal, CNBC, Forbes, TechCrunch y otros grandes medios de comunicación, Speechify es el mayor proveedor de texto a voz del mundo. Visita speechify.com/news, speechify.com/blog y speechify.com/press para saber más.