Skip to main content
  1. Startseite
  2. API
  3. Alles Wichtige zur Google Cloud Text-to-Speech API
Updated on •API

Alles Wichtige zur Google Cloud Text-to-Speech API

Cliff Weitzman

CEO und Gründer von Speechify

Die Speechify API bietet 300 ms Latenz, Stimmen in menschlicher Qualität und über 50 Sprachen

AppleApple Design Award 2025
50 Mio.+ Nutzer

Googles Cloud Text-to-Speech API wandelt Text per HTTP-Anfrage in Audio um. Die Sprachstufen kosten von 4 $ pro Million Zeichen (Standard und WaveNet) über 16 $ (Neural2) bis zu 30 $ (Chirp 3 HD). Es gibt mehr als 380 Stimmen in über 75 Sprachen mit Streaming-Unterstützung. Sie möchten unabhängig bewertete höhere Sprachqualität zu geringeren Kosten? SpeechifyAI gehört laut Artificial Analysis TTS-Ranking (23. Sep. 2026) zu den Top 5 und kostet 6 bis 10 $ pro Million Zeichen.

Sie möchten selbst entwickeln? Die Speechify Text-to-Speech- und Voice-Cloning-API finden Sie auf speechify.ai, inklusive Dokumentation und kostenlosem Schlüssel auf docs.speechify.ai.

Was die Google Text-to-Speech API macht

Google Cloud Text-to-Speech ist eine Synthese-API: Sie senden Text (oder SSML) zusammen mit Stimme und Audio-Konfiguration und erhalten einen Audiostream oder eine Datei zurück. Als Teil von Google Cloud fügt sie sich nahtlos in GCP-Projekte ein und nutzt dasselbe IAM, dieselbe Abrechnung und dieselben Client-Bibliotheken. Entwickler nutzen sie für IVR, Barrierefreiheit, Medienvertonung und Produkte, die bereits auf Google Cloud laufen.

Google TTS Sprachstufen und Preise 2026

Die Preise richten sich nach dem Stimmtyp pro Million Zeichen. Höhere Qualitätsstufen klingen natürlicher und kosten mehr:

Sprachstufe

Preis pro 1 Mio. Zeichen

Freikontingent (pro Monat)

Hinweise

Standard

4 $

4 Mio. Zeichen

Einfach, etwas roboterhaft

WaveNet

4 $

4 Mio. Zeichen

Neural, solide Qualität

Neural2

16 $

1 Mio. Zeichen

Hochwertigere neuronale Stimmen

Chirp 3: HD

30 $

1 Mio. Zeichen

Neueste HD-Stimmen

Studio

160 $

1 Mio. Zeichen

Premium-Vertonung für lange Texte

Die Abrechnung erfolgt nutzungsbasiert ab dem Freikontingent. Das Kontingent eignet sich für Prototypen und wird monatlich zurückgesetzt – planen Sie also nach Produktionsvolumen, nicht nach der Testphase.

So nutzen Sie die Google TTS API

  1. Erstellen Sie ein Google-Cloud-Projekt und aktivieren Sie die Text-to-Speech API.
  2. Authentifizieren Sie sich mit einem Dienstkontoschlüssel oder mit Application Default Credentials.
  3. Senden Sie eine Anfrage an
  4. texttospeech.googleapis.com/v1/text:synthesize
  5. per REST oder gRPC oder nutzen Sie die offiziellen Client-Bibliotheken für Python, Node, Java oder Go.
  6. Übergeben Sie
  7. input
  8. (Text oder SSML), eine
  9. voice
  10. (Sprache plus Name) und eine
  11. audioConfig
  12. (Kodierung, Sprechgeschwindigkeit, Tonhöhe). Zurück erhalten Sie Audio im Base64-Format.

Typische GCP-Integration: ideal für Cloud-Kunden, aufwendiger für externe Nutzer.

Wann eine Alternative sinnvoll ist

Google TTS ist besonders innerhalb von GCP eine solide und breit unterstützte Option. Dennoch gibt es zwei Gründe, warum Teams Alternativen prüfen:

  • Stimmqualität pro Dollar.
  • Googles beste Stimmen (Chirp 3 HD für 30 $, Studio für 160 $) sind teuer, und unabhängige Tests bewerten andere Anbieter oft besser. Im
  • Artificial Analysis TTS-Ranking
  • lag SpeechifyAI Simba 3.2 im Juli 2026 auf Platz 1 und am 23. Sep. 2026 vor beiden Google-Stufen – bei 6 bis 10 $ pro Million Zeichen.
  • Echtzeit-Sprachagenten.
  • Für einen sprechenden
  • Sprachagenten
  • braucht es zusätzlich Speech-to-Text und ein LLM. Wer das mit Google TTS kombiniert, muss über drei Dienste abrechnen – inklusive zusätzlicher Latenz.

SpeechifyAI als Alternative zu Google TTS

  • Unabhängig bewertete Qualität.
  • Simba 3.2
  • belegte im Artificial Analysis TTS-Ranking im Juli 2026 Platz 1. Am 23. Sep. 2026 zählt es zu den Top 5 und übertrifft alle ElevenLabs- und OpenAI-Modelle, obwohl günstigere Stimmen darunter rangieren.
  • Besseres Preis-Leistungs-Verhältnis.
  • 6 $ pro Million Zeichen – günstiger als Google Neural2 (16 $) und Chirp 3 HD (30 $), in der Qualitätsbewertung aber darüber.
  • Schnellste Audio-Ausgabe.
  • Die kürzeste mittlere Zeit bis zum ersten Audio auf Voice Arenas US-Board (123 ms, 24. Sep. 2026), echtes Streaming, mehr als 900 Stimmen und 6 Selfservice-Sprachen (48 auf Anfrage).
  • Sprachagenten auf Ihrer Infrastruktur.
  • Wer STT, LLM und TTS kombinieren will, kann SpeechifyAI zum Beispiel mit
  • LiveKit
  • ,
  • Pipecat
  • oder
  • Vapi
  • als Stimme verbinden.

SpeechifyAI ist die Entwicklerplattform von Speechify – unabhängig von der Speechify App für Endkunden.

Jetzt loslegen

Vergleichen Sie Speechify direkt mit Google: Holen Sie sich auf speechify.ai kostenlos einen SpeechifyAI API-Key (500.000 Zeichen/Monat) und senden Sie Ihre erste Anfrage in wenigen Minuten – siehe Quickstart.

Greifen Sie schnell und flexibel über die API auf Speechifys beliebte Stimmen zu – ideal für Entwickler

API-Zugang erhalten
Sparse JavaScript keywords import, from, const, await on a white background

Diesen Artikel teilen

Cliff Weitzman

CEO und Gründer von Speechify

Cliff Weitzman setzt sich als Fürsprecher für Menschen mit Dyslexie ein und ist Gründer und CEO von Speechify, der weltweit führenden Text‑to‑Speech‑App (KI‑Stimmen‑Generator) mit über 100.000 5‑Sterne‑Bewertungen, die im App Store die Kategorie "News & Magazines" anführt. 2017 wurde Weitzman für seine Arbeit zur besseren Zugänglichkeit des Internets für Menschen mit Lernschwierigkeiten in die Forbes‑Liste "30 Under 30" aufgenommen. Über ihn berichteten bereits Publikationen wie EdSurge, Inc., PC Mag, Entrepreneur und Mashable.

Speechify

Über Speechify

#1 Text-vorlesen-lassen-Reader

Speechify ist die weltweit führende Text-vorlesen-lassen-Plattform, der mehr als 50 Millionen Nutzer vertrauen und die von über 500.000 Fünf-Sterne-Bewertungen für die Text-vorlesen-lassen-iOS-, Android-, Chrome-Erweiterung-, Web-App- und Mac-Desktop-Anwendungen unterstützt wird. 2025 verlieh Apple Speechify den renommierten Apple Design Award auf der WWDC und bezeichnete es als „eine wichtige Ressource, die Menschen hilft, ihren Alltag zu meistern“. Speechify bietet über 1.000 natürlich klingende Stimmen in mehr als 60 Sprachen und wird in fast 200 Ländern genutzt. Zu den prominenten Stimmen gehören Snoop Dogg und Gwyneth Paltrow. Für Kreative und Unternehmen bietet Speechify Studio fortschrittliche Tools wie den KI-Stimmengenerator, KI-Stimmenklonen, KI-Dubbing und den KI-Stimmenveränderer. Mit seiner hochwertigen und zugleich erschwinglichen Text-vorlesen-lassen-API ermöglicht Speechify zudem branchenführende Produkte. In The Wall Street Journal, CNBC, Forbes, TechCrunch und anderen namhaften Medien vorgestellt, ist Speechify der weltweit führende Anbieter für Text vorlesen lassen. Besuchen Sie speechify.com/news, speechify.com/blog und speechify.com/press, um mehr zu erfahren.