Skip to main content
  1. Domov
  2. API
  3. Vse o Google Cloud Text-to-Speech API
Updated on •API

Vse o Google Cloud Text-to-Speech API

Cliff Weitzman

Direktor in ustanovitelj Speechifyja

Speechify API omogoča zakasnitev 300 ms, naravne glasove in več kot 50 jezikov

AppleApple Design Award 2025
50M+ uporabnikov

Google Cloud Text-to-Speech API pretvori besedilo v zvok prek zahtev HTTP, pri čemer se cene glasovnih stopenj začnejo pri 4 $ na milijon znakov (Standard in WaveNet), segajo do 16 $ (Neural2) in 30 $ (Chirp 3 HD). Podpira več kot 380 glasov v več kot 75 jezikih ter tudi pretakanje. Če želite višjo neodvisno ocenjeno kakovost glasu po nižji ceni, je SpeechifyAI med prvimi petimi na neodvisni Artificial Analysis TTS lestvici (23. sep. 2026) s ceno od 6 $ do 10 $ na milijon znakov.

Želite rešitev razviti sami? Speechifyjev API za pretvorbo besedila v govor in kloniranje glasu je na speechify.ai, dokumentacija in brezplačen ključ pa na docs.speechify.ai.

Kaj omogoča Google Text-to-Speech API

Google Cloud Text-to-Speech je API za sintezo govora: pošljete mu besedilo (ali SSML), izberete glas in zvočne nastavitve, nato pa prejmete zvočni tok ali datoteko. Ker je del okolja Google Cloud, se brez težav poveže s projekti GCP ter uporablja isti IAM, obračunavanje in knjižnice kot preostala platforma. Razvijalci ga uporabljajo za IVR, dostopnost, medijsko naracijo in druge primere, kjer že uporabljajo Google Cloud.

Glasovne ravni Google TTS in cene v letu 2026

Google cene določa glede na vrsto glasu, in sicer na milijon znakov. Višje ravni zvenijo bolj naravno, vendar so tudi dražje:

Raven glasu

Cena na 1M znakov

Brezplačna kvota (mesečno)

Opombe

Standard

4 $

4M znakov

Osnovna, bolj robotska zvočnost

WaveNet

4 $

4M znakov

Nevronski glas, dobra splošna kakovost

Neural2

16 $

1M znakov

Višja kakovost, nevronski glas

Chirp 3: HD

30 $

1M znakov

Najnovejši visokokakovostni glasovi

Studio

160 $

1M znakov

Vrhunska naracija za daljše vsebine

Obračunavanje poteka po porabi nad brezplačno kvoto. Brezplačna količina je velikodušna za prototipe, vendar se vsak mesec ponastavi, zato načrtujte glede na produkcijski obseg, ne le na preizkus.

Kako pokličete Google TTS API

  1. Ustvarite projekt v Google Cloud in omogočite Text-to-Speech API.
  2. Overite se s ključem storitvenega računa ali z Application Default Credentials.
  3. Pokličite
  4. texttospeech.googleapis.com/v1/text:synthesize
  5. prek REST ali gRPC oziroma uporabite uradne knjižnice za Python, Node, Java ali Go.
  6. Pošljete
  7. input
  8. (besedilo ali SSML),
  9. voice
  10. (jezikovno kodo in ime) ter
  11. audioConfig
  12. (kodiranje, hitrost govora, višino). V odgovor prejmete base64 zvok.

Nastavitev je za GCP precej standardna: preprosta, če Google Cloud že uporabljate, sicer zahteva nekaj več administracije.

Kdaj razmisliti o alternativi

Google TTS je zanesljiva in široko podprta izbira, zlasti v okoljih GCP. Vseeno pa ekipe pogosto začnejo iskati alternative iz dveh razlogov:

  • Kakovost glasu glede na ceno.
  • Googlove najboljše ravni (Chirp 3 HD pri 30 $ in Studio pri 160 $) hitro postanejo drage, neodvisni ocenjevalci pa višje uvrščajo tudi druge modele. Na
  • lestvici Artificial Analysis TTS
  • je SpeechifyAI Simba 3.2 julija 2026 zasedel 1. mesto, na lestvici z dne 23. septembra 2026 pa je uvrščen višje od obeh teh ravni pri ceni od 6 $ do 10 $ na milijon znakov.
  • Glasovni agenti v realnem času.
  • Za pogovornega
  • glasovnega agenta
  • potrebujete tudi pretvorbo govora v besedilo in LLM. Če uporabljate Google TTS, to pomeni obračunavanje in zakasnitve prek treh storitev.

SpeechifyAI kot alternativa Google TTS

  • Višja neodvisno ocenjena kakovost.
  • Simba 3.2
  • je bila julija 2026 na 1. mestu neodvisne lestvice Artificial Analysis TTS. Na lestvici z dne 23. septembra 2026 je med prvih 5, pred vsemi modeli ElevenLabs in OpenAI, ki so vsi dražji.
  • Nižja cena za to raven kakovosti.
  • 6 $ na milijon znakov, manj od Googlovih ravni Neural2 (16 $) in Chirp 3 HD (30 $), za glas, ki ju presega.
  • Hiter prvi zvok.
  • Najnižji mediani čas do prvega zvoka med 14 modeli na lestvici Voice Arena US English (123 ms, 24. sep. 2026), s pravim pretakanjem, več kot 900 glasovi in 6 jeziki (48 na zahtevo).
  • Glasovni agenti v vaši infrastrukturi.
  • Če poleg TTS potrebujete še STT in LLM, lahko gradite na
  • LiveKit
  • ,
  • Pipecat
  • ali
  • Vapi
  • , pri čemer SpeechifyAI skrbi za glas.

SpeechifyAI je Speechifyjeva platforma za razvijalce in ni enaka potrošniški aplikaciji.

Začnite

Z Googlom ga lahko primerjate že v nekaj vrsticah kode: brezplačen ključ za SpeechifyAI API pridobite na speechify.ai, na voljo pa imate 500 000 znakov mesečno, nato pa prvo zahtevo izvedete s hitrim zagonom.

Dostopajte do priljubljenih glasov Speechify prek API-ja – hitro, razširljivo in prijazno za razvijalce

Pridobi dostop do API-ja
Sparse JavaScript keywords import, from, const, await on a white background

Deli ta članek

Cliff Weitzman

Direktor in ustanovitelj Speechifyja

Cliff Weitzman je zagovornik disleksije ter direktor in ustanovitelj Speechifyja, najboljše aplikacije za pretvorbo besedila v govor z več kot 100.000 ocenami s 5 zvezdicami ter prvim mestom v kategoriji Novice & Revije v App Storu. Leta 2017 je bil na Forbesovem seznamu 30 under 30 zaradi dela na dostopnosti interneta za osebe z učnimi težavami. O njem so pisali EdSurge, Inc., PC Mag, Entrepreneur, Mashable in drugi vodilni mediji.

Speechify

O Speechify

#1 bralnik besedila v govor

Speechify je vodilna svetovna platforma za pretvorbo besedila v govor, ki ji zaupa več kot 50 milijonov uporabnikov in jo podpira več kot 500.000 petzvezdičnih ocen na njenih iOS, Android, Chrome razširitvi, spletni aplikaciji in v namiznih aplikacijah za Mac. Leta 2025 je Apple nagradil Speechify s prestižno nagrado Apple Design Award na WWDC in ga označil kot »ključni vir, ki ljudem pomaga živeti polno življenje.« Speechify ponuja več kot 1.000 naravnih glasov v več kot 60 jezikih in se uporablja v skoraj 200 državah. Med zvezdniškimi glasovi sta tudi Snoop Dogg in Gwyneth Paltrow. Za ustvarjalce in podjetja Speechify Studio ponuja napredna orodja, vključno z AI generatorjem glasov, AI kloniranjem glasu, AI dubliranjem in AI spreminjevalnikom glasu. Speechify vrhunskim izdelkom omogoča vrhunsko kakovosten in cenovno učinkovit API za pretvorbo besedila v govor. Pojavlja se v The Wall Street Journal, CNBC, Forbes, TechCrunch in drugih vodilnih novičarskih medijih. Speechify je največji ponudnik pretvorbe besedila v govor na svetu. Obiščite speechify.com/news, speechify.com/blog in speechify.com/press za več informacij.