Skip to main content
  1. Početna
  2. API
  3. Sve što trebate znati o Google Cloud Text-to-Speech API-ju
Ažurirano •API

Sve što trebate znati o Google Cloud Text-to-Speech API-ju

Cliff Weitzman

CEO i osnivač Speechifyja

Speechify API donosi latenciju od 300 ms, glasove ljudske kvalitete i podršku za više od 50 jezika

AppleApple Design Award 2025.
50M+ korisnika

Google Cloud Text-to-Speech API pretvara tekst u govor putem HTTP zahtjeva. Cijene glasova kreću se od 4 USD po milijunu znakova (Standard i WaveNet) do 16 USD (Neural2) i 30 USD (Chirp 3 HD). Podržava više od 380 glasova na više od 75 jezika, uz mogućnost streaminga. Ako tražite osjetno višu kvalitetu govora po nižoj cijeni, SpeechifyAI je među pet najboljih na neovisnoj Artificial Analysis TTS ljestvici (23. rujna 2026.), s cijenom od 6 do 10 USD po milijunu znakova.

Želite sami graditi? Speechify API za text-to-speech i kloniranje glasa dostupan je na speechify.ai, a dokumentacija i besplatan ključ na docs.speechify.ai.

Google Cloud Text to Speech API

Što radi Google Text-to-Speech API

Google Cloud Text-to-Speech je API za sintezu govora: šaljete tekst (ili SSML), glas i audio konfiguraciju, a zauzvrat dobivate audiosnimku ili stream. Dio je Google Cloud platforme, pa se lako integrira u GCP projekte i koristi isti IAM, naplatu i klijentske biblioteke. Programeri ga koriste za IVR sustave, pristupačnost, medijsku naraciju i proizvode koji su već izgrađeni na Google Cloud-u.

Google TTS razine glasova i cijene za 2026.

Google naplaćuje po vrsti glasa, za svaki milijun znakova. Više razine zvuče prirodnije, ali su i skuplje:

Razina glasa

Cijena za 1M znakova

Besplatni paket (mjesečno)

Napomene

Standard

4 USD

4M znakova

Osnovna, pomalo robotska kvaliteta

WaveNet

4 USD

4M znakova

Neuralni, vrlo kvalitetan

Neural2

16 USD

1M znakova

Neuralni glas više kvalitete

Chirp 3: HD

30 USD

1M znakova

Najnoviji glasovi visoke definicije

Studio

160 USD

1M znakova

Premium naracija duljih tekstova

Naplata se obračunava prema potrošnji nakon besplatnog paketa. Besplatni paket velikodušan je za izradu prototipa, ali se obnavlja svaki mjesec — planirajte prema stvarnom opsegu korištenja, a ne prema probnoj verziji.

Kako koristiti Google TTS API

  1. Izradite Google Cloud projekt i uključite Text-to-Speech API.
  2. Autentificirajte se putem ključa servisnog računa ili Application Default Credentials.
  3. Pozovite
  4. texttospeech.googleapis.com/v1/text:synthesize
  5. putem REST-a ili gRPC-a, ili koristite službene klijentske biblioteke za Python, Node, Java ili Go.
  6. Pošaljite
  7. input
  8. (tekst ili SSML),
  9. voice
  10. (jezični kod i naziv), te
  11. audioConfig
  12. (kodiranje, brzina govora, ton). Dobivate audio u formatu base64.

Postavljanje je standardno za GCP: jednostavno ako već koristite Google Cloud, a nešto zahtjevnije za početnike.

Kada razmotriti alternativu

Google TTS je pouzdano i široko podržano rješenje, osobito za GCP korisnike. Ipak, postoje dva razloga da razmotrite alternativu:

  • Omjer kvalitete glasa i cijene.
  • Najbolji Googleovi glasovi (Chirp 3 HD za 30 USD, Studio za 160 USD) skuplji su, a neovisni slušatelji i dalje češće biraju druge modele. Na
  • Artificial Analysis TTS ljestvici
  • Simba 3.2 iz SpeechifyAI bio je prvi u srpnju 2026., a 23. rujna 2026. nadmašio je te glasove uz cijenu od 6–10 USD po milijunu znakova.
  • Glasovni agenti u stvarnom vremenu.
  • Za razgovornog
  • glasovnog agenta
  • trebate i prepoznavanje govora i LLM. Povezivanje tih servisa s Google TTS-om znači zasebnu naplatu i latenciju na tri servisa.

SpeechifyAI kao alternativa Google TTS-u

  • Viša neovisno potvrđena kvaliteta.
  • Simba 3.2
  • bio je prvi na neovisnoj Artificial Analysis TTS ljestvici u srpnju 2026. Na ljestvici od 23. rujna 2026. bio je među pet najboljih, iznad svih ElevenLabs i OpenAI modela, a svaki bolje ocijenjen model bio je skuplji.
  • Niža cijena za istu razinu kvalitete.
  • 6 USD po milijunu znakova — manje nego Googleovi glasovi Neural2 (16 USD) i Chirp 3 HD (30 USD), i to za glas koji ih nadmašuje.
  • Najbrže vrijeme do prvog zvuka.
  • Najniže prosječno vrijeme do prvog zvuka među 14 modela na Voice Arena US English listi (123 ms, 24. 9. 2026.), uz pravi streaming, više od 900 glasova i 6 samoposlužnih jezika (48 na zahtjev).
  • Glasovni agenti na vašoj infrastrukturi.
  • Ako trebate STT plus LLM plus TTS, to možete izgraditi na
  • LiveKit
  • ,
  • Pipecat
  • ili
  • Vapi
  • , uz SpeechifyAI kao glasovni sloj.

SpeechifyAI je razvojna platforma tvrtke Speechify, odvojena od potrošačke aplikacije Speechify.

Kako započeti

Usporedite ga s Googleom u nekoliko minuta: zatražite besplatan ključ za SpeechifyAI API na speechify.ai, uz 500.000 znakova mjesečno, i pošaljite prvi zahtjev uz quickstart.

Pristupite svojim omiljenim Speechify glasovima putem API-ja – brzo, skalabilno i prilagođeno developerima

Zatraži API pristup
Sparse JavaScript keywords import, from, const, await on a white background

Podijeli ovaj članak

Cliff Weitzman

CEO i osnivač Speechifyja

Cliff Weitzman je zagovaratelj osoba s disleksijom te CEO i osnivač Speechifyja, najpopularnije aplikacije za pretvaranje teksta u govor na svijetu, s preko 100.000 ocjena s 5 zvjezdica i prvim mjestom u App Store kategoriji Vijesti i časopisi. Godine 2017. Weitzman je uvršten na Forbesovu listu 30 ispod 30 zbog rada na poboljšanju pristupačnosti interneta za osobe s teškoćama u učenju. O njemu su pisali EdSurge, Inc., PC Mag, Entrepreneur, Mashable i drugi vodeći mediji.

Speechify

O Speechifyju

Br. 1 čitač teksta u govor

Speechify je vodeća svjetska platforma za pretvaranje teksta u govor kojoj vjeruje više od 50 milijuna korisnika, s više od 500.000 recenzija s pet zvjezdica na svojim aplikacijama za iOS, Android, Chrome ekstenziju, web-aplikaciju i Mac desktop. Godine 2025. Apple je dodijelio Speechifyju prestižnu nagradu Apple Design Award na WWDC-u, opisavši ga kao “ključni resurs koji ljudima pomaže živjeti svoje živote”. Speechify nudi više od 1000 prirodnih glasova na više od 60 jezika i koristi se u gotovo 200 zemalja. Među glasovima slavnih su Snoop Dogg i Gwyneth Paltrow. Za kreatore i tvrtke Speechify Studio pruža napredne alate, uključujući AI generator glasa, AI kloniranje glasa, AI sinkronizaciju i vlastiti AI mijenjač glasa. Speechify također pokreće vodeće proizvode svojim visokokvalitetnim i pristupačnim API-jem za pretvaranje teksta u govor. Istaknut u The Wall Street Journalu, CNBC-ju, Forbesu, TechCrunchu i drugim velikim medijima, Speechify je najveći svjetski pružatelj usluga pretvaranja teksta u govor. Posjetite speechify.com/news, speechify.com/blog i speechify.com/press za više informacija.