Skip to main content
  1. Etusivu
  2. API
  3. Kaikki Google Cloud Text-to-Speech API:sta
Updated on •API

Kaikki Google Cloud Text-to-Speech API:sta

Cliff Weitzman

Speechifyn perustaja ja toimitusjohtaja

Speechify API tarjoaa 300ms 
viiveen, ihmisen kaltaiset äänet, 
ja yli 50 kieltä

Apple2025 Apple Design Award
50M+ käyttäjää

Googlen Cloud Text-to-Speech API muuntaa tekstin puheeksi HTTP-pyynnöllä. Äänitasojen hinnat vaihtelevat välillä $4/milj. merkkiä (Standard ja WaveNet) – $16 (Neural2) ja $30 (Chirp 3 HD). Palvelussa on yli 380 ääntä yli 75 kielellä sekä suoratoiston tuki. Jos haluat paremman äänenlaadun edullisemmin ilman omaa infrastruktuuria, SpeechifyAI on Top 5:ssa riippumattomalla Artificial Analysis TTS -leaderboardilla (23.9.2026) hintaluokassa $6–10/milj. merkkiä.

Rakennatko tätä itse? Speechifyn tekstistä puheeksi- ja äänenkloonaus-API löytyy osoitteesta speechify.ai. Dokumentaatio ja ilmainen avain ovat saatavilla osoitteessa docs.speechify.ai.

Miten Google Text-to-Speech API toimii

Google Cloud Text-to-Speech on synteesi-API: lähetät tekstin (tai SSML:n), valitset äänen ja audiomääritykset, ja API palauttaa ääninäytteen tai tiedoston. Se on osa Google Cloudia, joten se integroituu helposti GCP-projekteihin ja käyttää samoja IAM-, laskutus- ja client library -käytäntöjä kuin muukin alusta. Kehittäjät hyödyntävät sitä IVR:ssä, saavutettavuusratkaisuissa, mediakerronnassa ja Google Cloudissa toimivissa tuotteissa.

Google TTS -äänitasot ja hinnat vuonna 2026

Google hinnoittelee äänet tyypeittäin per miljoona merkkiä. Luonnollisemmat äänet maksavat enemmän:

Äänitaso

Hinta / 1M merkkiä

Ilmainen taso (kk)

Huomioita

Standard

$4

4M merkkiä

Perustaso, melko robottimainen

WaveNet

$4

4M merkkiä

Neuraalinen, hyvä yleislaatu

Neural2

$16

1M merkkiä

Laadukkaampi neuraalinen ääni

Chirp 3: HD

$30

1M merkkiä

Uusimmat HD-äänet

Studio

$160

1M merkkiä

Premium-tason pitkämuotoinen kerronta

Laskutus toimii pay-as-you-go-mallilla ilmaisen tason jälkeen. Ilmainen käyttö riittää prototypointiin, mutta se nollautuu kuukausittain – mitoita käyttö tuotantotarpeen, ei kokeilujen, mukaan.

Näin teet Google TTS API -kutsun

  1. Luo Google Cloud -projekti ja ota Text-to-Speech API käyttöön.
  2. Todennus hoituu palvelutilin avaimella tai Application Default Credentialsilla.
  3. Kutsu
  4. texttospeech.googleapis.com/v1/text:synthesize
  5. REST- tai gRPC-rajapinnan kautta tai käytä virallisia Python-, Node-, Java- tai Go-kirjastoja.
  6. Lähetä
  7. input
  8. (teksti tai SSML),
  9. voice
  10. (kielikoodi ja nimi) sekä
  11. audioConfig
  12. (koodaus, puhenopeus, sävelkorkeus). Vastauksena saat base64-koodatun äänitiedoston.

Määrittely on hyvin tyypillistä GCP:tä: kaikki toimii sujuvasti, jos käytät jo Google Cloudia, mutta muuten hallinnollista työtä tulee lisää.

Milloin vaihtoehtoa kannattaa harkita

Google TTS on vakaa ja laajasti tuettu ratkaisu – erityisesti GCP-ympäristössä. Tiimit alkavat kuitenkin usein katsoa vaihtoehtoja kahdesta syystä:

  • Äänenlaatu suhteessa hintaan.
  • Googlen luonnollisimmat tasot (Chirp 3 HD $30, Studio $160) nostavat kustannuksia nopeasti, ja riippumattomissa vertailuissa muut mallit sijoittuvat korkeammalle.
  • Artificial Analysis TTS -listalla
  • SpeechifyAI:n Simba 3.2 oli sijalla 1 heinäkuussa 2026, ja 23.9.2026 se sijoittui näitä kahta tasoa korkeammalle hintaan $6–10/milj. merkkiä.
  • Reaaliaikaiset ääniagentit.
  • Keskustelevan
  • ääniagentin
  • rakentaminen vaatii myös Speech-to-Textin ja LLM:n. Jos yhdistät ne Google TTS:ään, maksat kolmesta palvelusta ja lisäät samalla viivettä.

SpeechifyAI vaihtoehtona Google TTS:lle

  • Korkeampi laatu riippumattomissa vertailuissa.
  • Simba 3.2
  • oli sijalla 1 riippumattomalla Artificial Analysis TTS -listalla heinäkuussa 2026. 23.9.2026 se oli top 5:ssa kaikkien ElevenLabsin ja OpenAI:n mallien edellä, ja kaikki sen yläpuolella olevat mallit maksoivat enemmän.
  • Edullisempi laatu.
  • $6/milj. merkkiä – edullisempi kuin Googlen Neural2 ($16) ja Chirp 3 HD ($30), vaikka ääni sijoittuu niiden yläpuolelle.
  • Nopea ensimmäinen äänivaste.
  • Alhaisin mediaaniaika US English Voice Arena -vertailun 14 mallista (123 ms, 24.9.2026): aito suoratoisto, yli 900 ääntä ja 6 itsepalvelukieltä (48 pyynnöstä).
  • Ääniagentit omassa ympäristössäsi.
  • Jos tarvitset STT:n, LLM:n ja TTS:n, voit rakentaa kokonaisuuden
  • LiveKitin
  • ,
  • Pipecatin
  • tai
  • Vapin
  • päälle käyttäen SpeechifyAI:ta puhekerroksena.

SpeechifyAI on Speechifyn kehittäjäalusta, joka on eri tuote kuin kuluttajille suunnattu Speechify-sovellus.

Aloita

Vertaa sitä Googleen muutamalla rivillä koodia: nouda ilmainen SpeechifyAI API-avaimesi osoitteesta speechify.ai (500 000 merkkiä/kk) ja tee ensimmäinen pyyntö quickstartin avulla.

Käytä Speechifyn suosittuja ääniä API:n kautta nopeasti, skaalautuvasti ja kehittäjäystävällisesti

Hanki API-käyttöoikeus
Sparse JavaScript keywords import, from, const, await on a white background

Jaa tämä artikkeli

Cliff Weitzman

Speechifyn perustaja ja toimitusjohtaja

Cliff Weitzman on dysleksian puolestapuhuja sekä Speechifyn perustaja ja toimitusjohtaja. Speechify on maailman johtava tekstin puheeksi -sovellus, jolla on yli 100 000 viiden tähden arvostelua ja joka on App Storen Uutiset & Aikakauslehdet -kategoriassa ykkönen. Vuonna 2017 Weitzman valittiin Forbesin 30 under 30 -listalle työstään internetin saavutettavuuden parantamiseksi oppimisvaikeuksia kokeville. Cliff Weitzman on ollut esillä muun muassa julkaisuissa EdSurge, Inc., PC Mag, Entrepreneur ja Mashable.

Speechify

Tietoa Speechifystä

#1 Tekstistä puheeksi -lukija

Speechify on maailman johtava tekstistä puheeksi -alusta, johon luottaa yli 50 miljoonaa käyttäjää ja joka on saanut yli 500 000 viiden tähden arvostelua sen iOS-, Android-, Chrome-laajennus-, verkkosovellus- ja Mac-työpöytäsovellus -versioista. Vuonna 2025 Apple myönsi Speechifylle arvostetun Apple Design Award -palkinnon WWDC-tapahtumassa, kutsuen sitä “elintärkeäksi resurssiksi, joka auttaa ihmisiä elämään elämäänsä.” Speechify tarjoaa yli 1 000 luonnollisen kuuloista ääntä yli 60 kielellä ja sitä käytetään lähes 200 maassa. Julkkisäänet sisältävät muun muassa Snoop Doggin, Mr. Beastin ja Gwyneth Paltrow’n. Sisällöntuottajille ja yrityksille Speechify Studio tarjoaa edistyneitä työkaluja, kuten tekoälypohjaisen äänenluonnin, äänen kloonauksen, dubbaustyökalut ja äänimuuntimen. Speechify myös tukee johtavia tuotteita korkealaatuisella ja kustannustehokkaalla tekstistä puheeksi API:lla. Esillä muun muassa julkaisuissa The Wall Street Journal, CNBC, Forbes ja TechCrunch, Speechify on maailman suurin tekstistä puheeksi -palveluntarjoaja. Vieraile osoitteissa speechify.com/news, speechify.com/blog ja speechify.com/press saadaksesi lisätietoja.