Skip to main content
  1. Inici
  2. API
  3. Tot el que cal saber sobre l'API de Google Cloud Text-to-Speech
Actualitzat el •API

Tot el que cal saber sobre l'API de Google Cloud Text-to-Speech

Cliff Weitzman

CEO i fundador de Speechify

L'API de Speechify ofereix una latència de 300 ms, veus amb qualitat humana i més de 50 idiomes

ApplePremi de Disseny Apple 2025
Més de 50 M d'usuaris

L'API de Google Cloud Text-to-Speech converteix text en àudio mitjançant una sol·licitud HTTP, amb preus per veu que van des de 4 dòlars per milió de caràcters (Standard i WaveNet) fins a 16 dòlars (Neural2) i 30 dòlars (Chirp 3 HD). Ofereix més de 380 veus en més de 75 idiomes i admet streaming. Si voleu una qualitat de veu millor segons rànquings independents i a un preu més baix, SpeechifyAI és entre els cinc primers del rànquing independent Artificial Analysis TTS (23 set. 2026) per 6 a 10 dòlars per milió.

Voleu provar-ho vosaltres mateixos? L'API de text a veu i clonació de veu de Speechify és a speechify.ai, amb documentació i una clau gratuïta a docs.speechify.ai.

API de Google Cloud Text-to-Speech

Què fa l'API de Google Text-to-Speech

Google Cloud Text-to-Speech és una API de síntesi de veu: hi envieu text (o SSML), una veu i la configuració d'àudio, i us retorna un flux d'àudio o un fitxer. Forma part de Google Cloud, de manera que s'integra fàcilment en projectes de GCP i fa servir el mateix sistema d'identitat, facturació i llibreries de client que la resta de la plataforma. Els desenvolupadors la fan servir per a IVR, accessibilitat, narració de continguts i qualsevol producte allotjat a Google Cloud.

Tipus de veus i preus de Google TTS el 2026

Google cobra segons el tipus de veu, per cada milió de caràcters. Les veus més avançades sonen més naturals i tenen un cost més alt:

Nivell de veu

Preu per 1 M de caràcters

Nivell gratuït (al mes)

Notes

Estàndard

$4

4 M de caràcters

Bàsic, una mica robòtic

WaveNet

$4

4 M de caràcters

Neuronal, bona qualitat general

Neural2

$16

1 M de caràcters

Veu neuronal d'alta qualitat

Chirp 3 HD

$30

1 M de caràcters

Veus d'última generació en alta definició

Studio

$160

1 M de caràcters

Narració prèmium per a textos llargs

La facturació és per ús un cop superat el nivell gratuït. Aquesta quota és generosa per a prototips, però es reinicia cada mes; planifiqueu segons el vostre volum real, no segons la prova.

Com cridar l'API de Google TTS

  1. Creeu un projecte de Google Cloud i activeu l'API de Text-to-Speech.
  2. Autentiqueu-vos amb una clau de compte de servei o amb Application Default Credentials.
  3. Feu la crida a
  4. texttospeech.googleapis.com/v1/text:synthesize
  5. amb REST o gRPC, o feu servir les llibreries oficials de Python, Node, Java o Go.
  6. Envieu
  7. input
  8. (text o SSML), una
  9. voice
  10. (codi d'idioma i nom) i una
  11. audioConfig
  12. (codificació, velocitat, to). Rebreu l'àudio en base64.

La configuració segueix l'estàndard de GCP: ideal si ja treballeu amb Google Cloud, però implica més gestió si no és el vostre entorn habitual.

Quan convé considerar una alternativa

Google TTS és una opció sòlida i molt compatible, sobretot dins de GCP. Però hi ha dos motius pels quals molts equips busquen alternatives:

  • Qualitat de veu per dòlar.
  • Els nivells més avançats de Google (Chirp 3 HD per 30 $ i Studio per 160 $) són cars i, segons oients independents, hi ha altres models més ben situats. Al
  • rànquing Artificial Analysis TTS
  • , Simba 3.2 de SpeechifyAI va ser el núm. 1 el juliol de 2026 i, a 23 de setembre, encara supera aquests nivells per només 6-10 $ per milió de caràcters.
  • Agents de veu en temps real.
  • Per a un
  • agent de veu
  • , també necessiteu reconeixement de veu i un LLM. Connectar-ho tot amb Google TTS implica facturació i latència entre tres serveis.

SpeechifyAI com a alternativa a Google TTS

  • Més qualitat segons rànquings independents.
  • Simba 3.2
  • va ocupar el primer lloc del rànquing independent Artificial Analysis TTS el juliol de 2026. A 23 de setembre, continua entre els cinc primers, per sobre de tots els models d'ElevenLabs i OpenAI, i tots els que té per davant costen més.
  • Preu més baix amb gran qualitat.
  • 6 $ per milió de caràcters, per sota de Neural2 de Google (16 $) i Chirp 3 HD (30 $), tot i tenir una posició millor al rànquing.
  • Inici d'àudio ràpid.
  • Menor temps mitjà fins al primer àudio dels 14 models del tauler Voice Arena en anglès (123 ms, 24 set. 2026), streaming real, més de 900 veus i 6 idiomes en autoservei (48 sota demanda).
  • Agents de veu integrats.
  • Si us cal STT, LLM i TTS, podeu construir-ho sobre
  • LiveKit
  • ,
  • Pipecat
  • o
  • Vapi
  • amb SpeechifyAI com a veu.

SpeechifyAI és la plataforma per a desenvolupadors de Speechify, diferent de l'app de consum de Speechify.

Comenceu ara

Compareu Speechify amb Google fàcilment: aconseguiu una clau API gratuïta de SpeechifyAI a speechify.ai, amb 500.000 caràcters al mes, i feu la primera petició amb la guia ràpida.

Accedeix ràpidament a les teves veus preferides de Speechify via API, escalable i fàcil per a desenvolupadors

Accedeix a l'API
Sparse JavaScript keywords import, from, const, await on a white background

Comparteix aquest article

Cliff Weitzman

CEO i fundador de Speechify

Cliff Weitzman és un defensor de la dislèxia i el CEO i fundador de Speechify, l'app de text a veu número 1 al món, amb més de 100.000 ressenyes de 5 estrelles i líder del rànquing de l'App Store en Notícies i Revistes. El 2017, Weitzman va entrar a la llista Forbes 30 under 30 per la seva tasca fent internet més accessible per a persones amb dificultats d'aprenentatge. Cliff Weitzman ha aparegut a EdSurge, Inc., PC Mag, Entrepreneur, Mashable i altres mitjans destacats.

Speechify

Sobre Speechify

El millor lector de text a veu

Speechify és la plataforma líder mundial de text a veu, de confiança per a més de 50 milions d'usuaris i avalada per més de 500.000 ressenyes de cinc estrelles a les seves aplicacions de text a veu per a iOS, Android, Extensió de Chrome, aplicació web i aplicació per a Mac. El 2025, Apple va premiar Speechify amb el prestigiós Premi de Disseny Apple a la WWDC, qualificant-lo com “una eina essencial que ajuda la gent a viure la seva vida.” Speechify ofereix més de 1.000 veus naturals en més de 60 idiomes i s'utilitza a gairebé 200 països. Entre les veus de celebritats hi trobem Snoop Dogg i Gwyneth Paltrow. Per a creadors i empreses, Speechify Studio proporciona eines avançades com Generador de veu IA, Clonació de veus IA, Doblatge IA i el seu Canviador de veu IA. Speechify també impulsa productes líders amb la seva API de text a veu, d'alta qualitat i amb una relació qualitat-preu òptima API de text a veu. Present en The Wall Street Journal, CNBC, Forbes, TechCrunch i altres mitjans destacats, Speechify és el proveïdor de text a veu més gran del món. Visiteu speechify.com/news, speechify.com/blog i speechify.com/press per saber-ne més.