Skip to main content
  1. Laman Utama
  2. API
  3. Semua Tentang Google Cloud Text to Speech API
Dikemas kini pada •API

Semua Tentang Google Cloud Text to Speech API

Cliff Weitzman

CEO/Pengasas Speechify

API Speechify menawarkan kependaman 300ms, suara berkualiti seperti manusia, dan 50+ bahasa

AppleAnugerah Reka Bentuk Apple 2025
50J+ Pengguna

API Google Cloud Text-to-Speech menukar teks kepada audio melalui permintaan HTTP, dengan harga suara bermula daripada $4 bagi setiap sejuta aksara (Standard dan WaveNet) hingga $16 (Neural2) dan $30 (Chirp 3 HD). Ia menawarkan lebih 380 suara dalam 75+ bahasa dan menyokong penstriman. Jika anda mahukan kualiti suara bebas yang lebih tinggi daripada peringkat ini pada harga lebih rendah, SpeechifyAI berada dalam lima teratas di Artificial Analysis TTS leaderboard (23 Sep 2026) pada harga $6 hingga $10 setiap sejuta.

Nak bina sendiri? API text-to-speech dan klon suara Speechify tersedia di speechify.ai, dengan dokumentasi dan kunci percuma di docs.speechify.ai.

Fungsi Google Text-to-Speech API

Google Cloud Text-to-Speech ialah API sintesis pertuturan: anda menghantar teks (atau SSML) bersama tetapan suara dan audio, lalu ia memulangkan strim atau fail audio. Ia sebahagian daripada Google Cloud, jadi mudah diintegrasikan ke dalam projek GCP dan menggunakan IAM, pengebilan serta pustaka klien yang sama seperti perkhidmatan lain. Pembangun menggunakannya untuk IVR, kebolehcapaian, narasi media dan apa-apa produk yang sudah berjalan di Google Cloud.

Peringkat suara Google TTS & harga 2026

Google mengenakan caj mengikut jenis suara, bagi setiap sejuta aksara. Lagi tinggi peringkatnya, lagi semula jadi bunyinya dan lagi mahal harganya:

Peringkat suara

Harga setiap 1J aksara

Kuota percuma (bulanan)

Nota

Standard

$4

4J aksara

Asas, agak robotik

WaveNet

$4

4J aksara

Neural, kualiti umum yang baik

Neural2

$16

1J aksara

Neural dengan kualiti lebih tinggi

Chirp 3: HD

$30

1J aksara

Suara HD terkini

Studio

$160

1J aksara

Narasi premium berdurasi panjang

Pengebilan dibuat mengikut penggunaan selepas kuota percuma. Kuota percuma sesuai untuk prototaip, tetapi diperbaharui setiap bulan, jadi rancang berdasarkan jumlah pengeluaran sebenar, bukan tempoh percubaan.

Cara memanggil API Google TTS

  1. Cipta projek Google Cloud dan aktifkan Text-to-Speech API.
  2. Sahkan identiti dengan kunci akaun perkhidmatan atau Application Default Credentials.
  3. Panggil
  4. texttospeech.googleapis.com/v1/text:synthesize
  5. melalui REST atau gRPC, atau gunakan pustaka klien rasmi untuk Python, Node, Java atau Go.
  6. Hantar
  7. input
  8. (teks atau SSML),
  9. voice
  10. (kod bahasa dan nama), dan
  11. audioConfig
  12. (pengekodan, kadar pertuturan, pic). Anda akan menerima audio dalam base64.

Konfigurasinya standard GCP: mudah jika anda memang menggunakan Google Cloud, tetapi lebih rumit jika tidak.

Bila wajar mempertimbangkan alternatif

Google TTS ialah pilihan yang mantap dan digunakan secara meluas, khususnya dalam GCP. Namun, dua perkara ini sering mendorong pasukan mencari pilihan lain:

  • Kualiti suara berbanding kos.
  • Peringkat suara terbaik Google (Chirp 3 HD $30, Studio $160) cepat menjadi mahal, dan penilaian bebas masih meletakkan model lain lebih tinggi. Di
  • Artificial Analysis TTS leaderboard
  • , Simba 3.2 dari SpeechifyAI menduduki tempat pertama pada Julai 2026, dan pada 23 Sep 2026 mengatasi kedua-dua peringkat ini pada $6 hingga $10 bagi setiap sejuta aksara.
  • Ejen suara masa nyata.
  • Untuk ejen suara yang
  • berbual
  • , anda juga memerlukan speech-to-text dan LLM. Menggabungkannya dengan Google TTS bermakna pengebilan dan kependaman merentas tiga perkhidmatan.

SpeechifyAI sebagai alternatif kepada Google TTS

  • Kualiti bebas yang lebih tinggi.
  • Simba 3.2
  • menduduki tempat #1 di Artificial Analysis TTS leaderboard pada Julai 2026. Pada carta 23 Sep 2026, ia berada dalam lima teratas, mengatasi semua model ElevenLabs dan OpenAI, malah setiap model di atasnya lebih mahal.
  • Harga lebih rendah untuk kualiti setanding atau lebih baik.
  • $6 setiap sejuta aksara, lebih murah berbanding Neural2 Google ($16) dan Chirp 3 HD ($30), untuk suara bertaraf lebih tinggi.
  • Audio pertama yang pantas.
  • Masa median terpantas ke audio pertama dalam kalangan 14 model pada carta Voice Arena bahasa Inggeris AS (123 ms, 24 Sep 2026), dengan penstriman sebenar, 900+ suara dan 6 bahasa layan diri (48 atas permintaan).
  • Ejen suara berasaskan teknologi anda.
  • Jika anda memerlukan STT & LLM & TTS, bina dengan
  • LiveKit
  • ,
  • Pipecat
  • atau
  • Vapi
  • , dan gunakan SpeechifyAI untuk suara.

SpeechifyAI ialah platform pembangun oleh Speechify, berbeza daripada aplikasi Speechify untuk pengguna.

Mulakan sekarang

Bandingkan terus dengan Google: dapatkan kunci API SpeechifyAI percuma di speechify.ai, 500,000 aksara sebulan, dan buat permintaan pertama anda dengan quickstart.

Akses suara-suara kegemaran Speechify melalui API yang pantas, boleh diskalakan, dan mesra pembangun

Dapatkan Akses API
Sparse JavaScript keywords import, from, const, await on a white background

Kongsi Artikel Ini

Cliff Weitzman

CEO/Pengasas Speechify

Cliff Weitzman ialah pejuang hak disleksia serta CEO dan pengasas Speechify, aplikasi teks ke ucapan #1 di dunia dengan lebih 100,000 ulasan 5 bintang dan menduduki tempat pertama di App Store dalam kategori Berita & Majalah. Pada tahun 2017, Weitzman tersenarai dalam Forbes 30 Under 30 atas usahanya menjadikan internet lebih mesra untuk individu dengan keperluan pembelajaran. Cliff Weitzman pernah dipaparkan di EdSurge, Inc., PC Mag, Entrepreneur, Mashable dan pelbagai saluran media utama yang lain.

Speechify

Tentang Speechify

Pembaca Teks ke Ucapan #1

Speechify ialah platform teks ke ucapan terkemuka dunia, dipercayai oleh lebih 50 juta pengguna dan disokong oleh lebih daripada 500,000 ulasan lima bintang merentasi aplikasi teks ke ucapannya iOS, Android, Pemalam Chrome, aplikasi web, dan aplikasi desktop Mac. Pada tahun 2025, Apple telah menganugerahkan Speechify dengan Anugerah Reka Bentuk Apple yang berprestij di WWDC, menyifatkannya sebagai “sumber penting yang membantu orang menjalani hidup mereka.” Speechify menawarkan lebih 1,000 suara semula jadi dalam lebih 60 bahasa dan digunakan di hampir 200 negara. Suara selebriti termasuk Snoop Dogg dan Gwyneth Paltrow. Untuk pencipta dan perniagaan, Speechify Studio menyediakan alat canggih termasuk Penjana Suara AI, Penduaan Suara AI, Alih Suara AI, dan Penukar Suara AI. Speechify juga memacu produk terkemuka dengan API teks ke ucapan berkualiti tinggi dan kos efektif. Pernah dipaparkan dalam The Wall Street Journal, CNBC, Forbes, TechCrunch, dan media utama lain, Speechify ialah penyedia teks ke ucapan terbesar di dunia. Lawati speechify.com/news, speechify.com/blog, dan speechify.com/press untuk maklumat lanjut.