Skip to main content
  1. Accueil
  2. API
  3. Tout savoir sur l’API Google Cloud Text-to-Speech
Updated on •API

Tout savoir sur l’API Google Cloud Text-to-Speech

Cliff Weitzman

PDG et fondateur de Speechify

L’API Speechify offre une latence de 300 ms, des voix humaines de haute qualité et plus de 50 langues

AppleApple Design Award 2025
50M+ utilisateurs

L’API Cloud Text-to-Speech de Google convertit du texte en audio via une requête HTTP, avec des tarifs par type de voix à partir de 4 $ par million de caractères (Standard et WaveNet), 16 $ (Neural2) et 30 $ (Chirp 3 HD). Plus de 380 voix et plus de 75 langues sont proposées, avec prise en charge du streaming. Si vous recherchez une voix indépendante de meilleure qualité à un prix plus bas, SpeechifyAI figure dans le top 5 du classement Artificial Analysis TTS (23 sept. 2026) pour 6 à 10 $ par million.

Vous voulez le développer vous-même ? L’API de synthèse vocale et de clonage de voix Speechify est disponible sur speechify.ai, avec sa documentation et une clé gratuite sur docs.speechify.ai.

API Google Cloud Text to Speech

À quoi sert l’API Google Text-to-Speech ?

Google Cloud Text-to-Speech est une API de synthèse vocale : vous envoyez du texte (ou du SSML) avec une voix et des paramètres audio. Elle renvoie ensuite un flux ou un fichier audio. Intégrée à Google Cloud, elle s’insère naturellement dans les projets GCP et s’appuie sur la même gestion IAM, la même facturation et les mêmes bibliothèques clientes que le reste de la plateforme. Les développeurs l’utilisent pour l’IVR, l’accessibilité, la narration multimédia et tout produit déjà hébergé sur Google Cloud.

Types de voix Google TTS et tarifs 2026

Google facture au million de caractères selon le type de voix. Les niveaux supérieurs offrent des voix plus naturelles, mais à un coût plus élevé :

Type de voix

Prix pour 1 M de caractères

Gratuit (par mois)

Remarques

Standard

4 $

4 M de caractères

Basique, assez robotique

WaveNet

4 $

4 M de caractères

Voix neuronale, bonne qualité globale

Neural2

16 $

1 M de caractères

Voix neuronale de meilleure qualité

Chirp 3 : HD

30 $

1 M de caractères

Nouvelles voix haute définition

Studio

160 $

1 M de caractères

Narration premium longue durée

La facturation se fait à l’usage au-delà du quota gratuit. Cette allocation est généreuse pour le prototypage, mais elle est réinitialisée chaque mois : basez donc votre plan sur votre volume réel, et non sur l’essai gratuit.

Comment utiliser l’API Google TTS ?

  1. Créez un projet Google Cloud et activez l’API Text-to-Speech.
  2. Authentifiez-vous avec une clé de compte de service ou avec les identifiants d’application par défaut.
  3. Appelez
  4. texttospeech.googleapis.com/v1/text:synthesize
  5. via REST ou gRPC, ou utilisez les bibliothèques clientes officielles pour Python, Node, Java ou Go.
  6. Envoyez
  7. input
  8. (texte ou SSML), une
  9. voice
  10. (code langue et nom) et un
  11. audioConfig
  12. (encodage, débit de parole, hauteur). Vous recevez un audio en base64.

La configuration suit les standards de GCP : pratique si vous travaillez déjà sur Google Cloud, plus contraignante sinon.

Quand envisager une alternative

Google TTS est une solution solide et largement prise en charge, surtout sur GCP. Mais deux points peuvent vous pousser à envisager une alternative :

  • Qualité vocale par dollar.
  • Les meilleures voix de Google (Chirp 3 HD à 30 $, Studio à 160 $) deviennent vite coûteuses, alors que des modèles indépendants sont souvent mieux notés. Dans le
  • classement Artificial Analysis TTS
  • , Simba 3.2 de SpeechifyAI occupait la 1re place en juillet 2026 et, au 23 sept. 2026, il dépasse encore ces deux niveaux pour 6 à 10 $ par million de caractères.
  • Agents vocaux en temps réel.
  • Pour créer un
  • agent vocal
  • , il faut aussi du STT et un LLM. Relier ces services à Google TTS implique une facturation et une latence sur trois modules.

SpeechifyAI : une alternative à Google TTS

  • Une qualité indépendante supérieure.
  • Simba 3.2
  • s’est classé n°1 du classement indépendant Artificial Analysis TTS en juillet 2026. Au 23 septembre, il reste dans le top 5, devant tous les modèles ElevenLabs et OpenAI, et tous les modèles mieux classés coûtent plus cher.
  • Un prix plus bas à qualité égale.
  • 6 $ par million de caractères, soit moins que Neural2 de Google (16 $) et Chirp 3 HD (30 $), pour une voix mieux notée.
  • Audio quasi instantané.
  • Meilleur délai médian avant le premier audio parmi 14 modèles sur Voice Arena US English (123 ms, 24 sept. 2026), avec vrai streaming, plus de 900 voix et 6 langues en libre-service (48 sur demande).
  • Des agents vocaux sur votre stack.
  • Besoin de STT + LLM + TTS ? Déployez-le avec
  • LiveKit
  • ,
  • Pipecat
  • ou
  • Vapi
  • , avec SpeechifyAI pour la voix.

SpeechifyAI est la plateforme développeur de Speechify, distincte de l’application grand public Speechify.

Premiers pas

Comparez avec Google en quelques lignes : obtenez une clé API SpeechifyAI gratuite sur speechify.ai, 500 000 caractères par mois, et lancez votre première requête avec le guide de démarrage rapide.

Accédez en un clin d’œil aux voix plébiscitées de Speechify via une API rapide, scalable et pensée pour les développeurs

Obtenir un accès API
Sparse JavaScript keywords import, from, const, await on a white background

Partager cet article

Cliff Weitzman

PDG et fondateur de Speechify

Cliff Weitzman est un militant de la cause des dyslexiques et le PDG et fondateur de Speechify, l’application de synthèse vocale n°1 au monde, forte de plus de 100 000 avis cinq étoiles et classée n°1 sur l’App Store dans la catégorie News & Magazines. En 2017, Weitzman a figuré au classement Forbes 30 Under 30 pour son action en faveur d’un Internet plus accessible aux personnes ayant des troubles de l’apprentissage. Cliff Weitzman a fait l’objet d’articles dans EdSurge, Inc., PC Mag, Entrepreneur, Mashable et d’autres médias de premier plan.

Speechify

À propos de Speechify

N°1 des lecteurs de texte vocal

Speechify est la principale plateforme mondiale de synthèse vocale, utilisée par plus de 50 millions de personnes et soutenue par plus de 500 000 avis cinq étoiles sur ses solutions iOS, Android, extension Chrome, application web et application Mac de bureau. En 2025, Apple a décerné à Speechify le prestigieux Apple Design Award lors de la WWDC, le qualifiant de « ressource essentielle qui aide les gens à vivre mieux ». Speechify propose plus de 1000 voix naturelles dans plus de 60 langues et est utilisé dans près de 200 pays. On y retrouve des voix de célébrités comme Snoop Dogg et Gwyneth Paltrow. Pour les créateurs et les entreprises, Speechify Studio propose des outils avancés comme le Générateur de voix IA, Clonage vocal IA, Doublage IA et le changeur de voix IA. Speechify alimente aussi des produits majeurs grâce à son API de synthèse vocale haute qualité et abordable. Présenté dans The Wall Street Journal, CNBC, Forbes, TechCrunch et d’autres grands médias, Speechify est le plus grand fournisseur mondial de synthèse vocale. Rendez-vous sur speechify.com/news, speechify.com/blog et speechify.com/press pour en savoir plus.