Skip to main content
  1. Strona główna
  2. API
  3. Wszystko o API Google Cloud Text-to-Speech
Updated on •API

Wszystko o API Google Cloud Text-to-Speech

Cliff Weitzman

CEO i założyciel Speechify

API Speechify zapewnia opóźnienie 300 ms, głosy o jakości ludzkiej oraz obsługę ponad 50 języków

AppleNagroda Apple Design 2025
Ponad 50 mln użytkowników

API Google Cloud Text-to-Speech zamienia tekst na dźwięk przez żądanie HTTP, a ceny głosów zaczynają się od 4 $ za milion znaków (Standard i WaveNet), 16 $ (Neural2) i 30 $ (Chirp 3 HD). Oferuje ponad 380 głosów w ponad 75 językach i obsługuje streaming. Jeśli potrzebujesz niezależnego rozwiązania z wyższą jakością głosu w niższej cenie, SpeechifyAI jest w top 5 niezależnego rankingu Artificial Analysis TTS (23 wrz 2026) przy cenach 6–10 $ za milion znaków.

Budujesz to samodzielnie? API Speechify do text-to-speech i klonowania głosu znajdziesz na speechify.ai, a dokumentację i darmowy klucz na docs.speechify.ai.

Google Cloud Text to Speech API

Jak działa API Google Text-to-Speech

Google Cloud Text-to-Speech to API syntezy mowy: wysyłasz tekst (lub SSML) z wybranym głosem i konfiguracją audio, a w odpowiedzi dostajesz strumień lub plik dźwiękowy. Usługa należy do Google Cloud, więc łatwo integruje się z projektami GCP i korzysta ze wspólnego IAM, rozliczeń oraz bibliotek klienckich platformy. Programiści najczęściej wybierają ją do IVR, rozwiązań dostępności, narracji do mediów i wszędzie tam, gdzie produkt działa już na Google Cloud.

Poziomy głosów Google TTS i ceny w 2026 roku

Ceny Google zależą od typu głosu i są liczone za milion znaków. Wyższe poziomy brzmią naturalniej, ale też kosztują więcej:

Poziom głosu

Cena za 1 mln znaków

Darmowy limit (miesięcznie)

Uwagi

Standard

4 $

4 mln znaków

Podstawowy, syntetyczny

WaveNet

4 $

4 mln znaków

Neuronalny, dobra jakość ogólna

Neural2

16 $

1 mln znaków

Wyższa jakość neuronalna

Chirp 3: HD

30 $

1 mln znaków

Najnowsze głosy HD

Studio

160 $

1 mln znaków

Premium, do długich nagrań

Po przekroczeniu darmowego limitu płacisz za rzeczywiste użycie. Darmowy limit wystarcza do prototypowania, ale odnawia się co miesiąc, więc planuj pod kątem środowiska produkcyjnego, a nie tylko testów.

Jak wywołać API Google TTS

  1. Utwórz projekt Google Cloud i włącz API Text-to-Speech.
  2. Uwierzytelnij się za pomocą klucza konta usługi lub Application Default Credentials.
  3. Wywołaj
  4. texttospeech.googleapis.com/v1/text:synthesize
  5. przez REST lub gRPC albo użyj oficjalnych bibliotek klienckich dla Pythona, Node, Java lub Go.
  6. Przekaż
  7. input
  8. (tekst lub SSML),
  9. voice
  10. (kod języka i nazwę) oraz
  11. audioConfig
  12. (kodowanie, tempo, ton). W odpowiedzi otrzymasz audio w base64.

Konfiguracja wygląda jak w innych usługach GCP: jest prosta, jeśli już pracujesz na Google Cloud, ale oznacza większy narzut, jeśli nie.

Kiedy warto rozważyć alternatywę

Google TTS to solidne, szeroko wspierane rozwiązanie w GCP. Są jednak dwa powody, dla których zespoły szukają alternatyw:

  • Jakość głosu względem ceny.
  • Najlepsze głosy Google (Chirp 3 HD za 30 $, Studio za 160 $) są kosztowne, a niezależne rankingi wciąż wyżej oceniają inne modele. W
  • rankingu Artificial Analysis TTS
  • SpeechifyAI Simba 3.2 zajmował 1. miejsce w lipcu 2026, a na liście z 23 wrz 2026 wypada lepiej od czołowych głosów Google pod względem ceny i jakości (6–10 $ za milion).
  • Głosowi agenci czasu rzeczywistego.
  • Do konwersacyjnego
  • voice agenta
  • potrzebujesz także STT i LLM. Jeśli korzystasz tylko z Google TTS, płacisz za trzy osobne usługi i czekasz na ich działanie.

SpeechifyAI jako alternatywa dla Google TTS

  • Wyższa jakość potwierdzona niezależnie.
  • Simba 3.2
  • zajął 1. miejsce w niezależnym rankingu Artificial Analysis TTS w lipcu 2026. Na liście z 23 wrz 2026 znajduje się w top 5, przed wszystkimi modelami ElevenLabs i OpenAI, a przy tym jest tańszy od droższych modeli.
  • Niższa cena przy tej klasie jakości.
  • 6 $ za milion znaków — taniej niż poziomy Neural2 (16 $) i Chirp 3 HD (30 $) Google, a przy tym z lepszym brzmieniem głosu.
  • Bardzo szybkie generowanie audio.
  • Najniższy średni czas do pierwszego dźwięku na Voice Arena w US English (123 ms, 24 wrz 2026), streaming, ponad 900 głosów, 6 języków (48 na życzenie).
  • Voice agent we własnym stacku.
  • Jeśli potrzebujesz STT + LLM + TTS, buduj na
  • LiveKit
  • ,
  • Pipecat
  • lub
  • Vapi
  • z głosem SpeechifyAI.

SpeechifyAI to platforma programistyczna Speechify, odrębna od aplikacji konsumenckiej.

Pierwsze kroki

Porównaj je z Google w kilku linijkach kodu: pobierz darmowy klucz SpeechifyAI na speechify.ai (500 000 znaków miesięcznie) i wypróbuj quickstart.

Uzyskaj szybki, skalowalny i przyjazny dla deweloperów dostęp do głosów Speechify przez API

Uzyskaj dostęp do API
Sparse JavaScript keywords import, from, const, await on a white background

Udostępnij ten artykuł

Cliff Weitzman

CEO i założyciel Speechify

Cliff Weitzman jest orędownikiem osób z dysleksją oraz CEO i założycielem Speechify — najlepszej na świecie aplikacji do zamiany tekstu na mowę, która ma na koncie ponad 100 000 pięciogwiazdkowych recenzji i zajęła 1. miejsce w App Store w kategorii News & Magazines. W 2017 roku Weitzman został wyróżniony na liście Forbes 30 Under 30 za działania na rzecz zwiększania dostępności internetu dla osób z trudnościami w uczeniu się. O Cliffie Weitzmanie pisały m.in. EdSurge, Inc., PC Mag, Entrepreneur i Mashable oraz inne czołowe redakcje.

Speechify

O Speechify

Najlepszy czytnik tekstu na mowę

Speechify to wiodąca na świecie platforma tekstu na mowę, zaufana przez ponad 50 milionów użytkowników, z ponad 500 000 recenzji na 5 gwiazdek w aplikacjach tekstu na mowę na iOS, Androida, rozszerzenie Chrome, aplikację webową oraz aplikację desktopową na Maca. W 2025 roku Apple przyznało Speechify prestiżową Nagrodę Apple Design podczas WWDC, nazywając to rozwiązanie „kluczowym zasobem, który pomaga ludziom w codziennym życiu”. Speechify oferuje ponad 1 000 naturalnych głosów w ponad 60 językach i jest używane w niemal 200 krajach. Wśród znanych głosów znajdują się Snoop Dogg i Gwyneth Paltrow. Dla twórców i firm Speechify Studio zapewnia zaawansowane narzędzia, w tym Generator Głosu AI, Klonowanie głosu AI, AI Dubbing oraz Zmieniacz głosu AI. Speechify dostarcza także wysokiej jakości i przystępne cenowo API tekstu na mowę dla czołowych produktów na świecie. O Speechify pisano w The Wall Street Journal, CNBC, Forbes, TechCrunch i innych najważniejszych mediach – Speechify to największy dostawca tekstu na mowę na świecie. Odwiedź speechify.com/news, speechify.com/blog oraz speechify.com/press, aby dowiedzieć się więcej.