Skip to main content
  1. Início
  2. API
  3. Tudo sobre a API Google Cloud Text-to-Speech
Updated on •API

Tudo sobre a API Google Cloud Text-to-Speech

Cliff Weitzman

CEO e fundador da Speechify

A API Speechify oferece latência de 300 ms, vozes com qualidade humana e suporte a mais de 50 idiomas

AppleApple Design Award 2025
50M+ usuários

A API Cloud Text-to-Speech do Google transforma texto em áudio via requisição HTTP, com níveis de voz a partir de US$4 por milhão de caracteres (Standard e WaveNet), US$16 (Neural2) e US$30 (Chirp 3 HD). São mais de 380 vozes em mais de 75 idiomas, com suporte a streaming. Se você busca vozes com qualidade superior a esses níveis por um preço menor, a SpeechifyAI está entre as cinco melhores no ranking Artificial Analysis TTS (23 set. 2026), por US$6 a US$10 por milhão.

Quer desenvolver por conta própria? A API de síntese de voz e clonagem de voz da Speechify está em speechify.ai, com documentação e chave gratuita disponíveis em docs.speechify.ai.

Como funciona a API Google Text-to-Speech

A Google Cloud Text-to-Speech é uma API de síntese de voz: você envia texto (ou SSML), escolhe uma voz, configura o áudio e recebe de volta um arquivo ou stream de áudio. Ela faz parte do Google Cloud, então se integra facilmente a projetos no GCP e usa IAM, cobrança e bibliotecas do restante da plataforma. Desenvolvedores a utilizam em URA, acessibilidade, narração de mídia e em qualquer produto que já rode no Google Cloud.

Níveis de voz do Google TTS e preços em 2026

O Google cobra por tipo de voz, por milhão de caracteres. Os níveis mais avançados soam mais naturais, mas também custam mais:

Nível de voz

Preço por 1M de caracteres

Franquia grátis (por mês)

Observações

Standard

US$4

4M de caracteres

Básico, com som mais robótico

WaveNet

US$4

4M de caracteres

Neural, com boa qualidade geral

Neural2

US$16

1M de caracteres

Neural de qualidade superior

Chirp 3: HD

US$30

1M de caracteres

Vozes HD mais recentes

Studio

US$160

1M de caracteres

Narração premium para textos longos

A cobrança é pós-paga acima da franquia gratuita. A cota grátis é generosa para prototipagem, mas é renovada todo mês. Planeje com base no seu volume de produção, e não só nos testes.

Como usar a API Google TTS

  1. Crie um projeto no Google Cloud e ative a API Text-to-Speech.
  2. Autentique-se com uma chave de conta de serviço ou com Application Default Credentials.
  3. Chame
  4. texttospeech.googleapis.com/v1/text:synthesize
  5. via REST ou gRPC, ou use as bibliotecas cliente oficiais para Python, Node, Java ou Go.
  6. Envie
  7. input
  8. (texto ou SSML), uma
  9. voice
  10. (código e nome do idioma) e um
  11. audioConfig
  12. (formato, velocidade e tom da fala). O retorno é um áudio em base64.

A configuração segue o padrão do GCP: é ideal para quem já usa Google Cloud, mas exige algumas etapas a mais para quem não usa.

Quando considerar alternativas

O Google TTS é uma opção sólida e bem suportada, especialmente em ambientes GCP. Mas há dois fatores que levam equipes a buscar alternativas:

  • Qualidade de voz por dólar.
  • Os níveis de melhor qualidade (Chirp 3 HD a US$30 e Studio a US$160) ficam caros rapidamente, e avaliações independentes ainda colocam outros modelos à frente. No
  • ranking Artificial Analysis TTS
  • , o Simba 3.2 da SpeechifyAI ficou em 1º lugar em jul/2026 e, em 23/set/2026, aparece acima desses dois níveis, por US$6 a US$10 por milhão de caracteres.
  • Agentes de voz em tempo real.
  • Para criar um
  • agente de voz
  • , você também precisa de reconhecimento de fala e de um LLM. Integrar tudo isso ao Google TTS significa custos e latência em três serviços distintos.

SpeechifyAI como alternativa ao Google TTS

  • Qualidade superior em avaliações independentes.
  • Simba 3.2
  • ficou em 1º lugar no ranking independente Artificial Analysis TTS em jul/2026. Em 23/set/2026, está entre os cinco melhores, acima de todos os modelos da ElevenLabs e da OpenAI — e os que superam o Simba 3.2 custam ainda mais caro.
  • Preço menor pela mesma qualidade.
  • US$6 por milhão de caracteres, abaixo dos níveis Neural2 (US$16) e Chirp 3 HD (US$30) do Google, para uma voz que supera ambos.
  • Primeiro áudio gerado em tempo recorde.
  • O menor tempo mediano para gerar áudio entre 14 modelos no board Voice Arena US English (123 ms, 24/set/2026), com streaming real, mais de 900 vozes e 6 idiomas self-service (48 sob demanda).
  • Agentes de voz na sua stack.
  • Se você precisa de STT + LLM + TTS, use
  • LiveKit
  • ,
  • Pipecat
  • ou
  • Vapi
  • com SpeechifyAI como voz.

SpeechifyAI é a plataforma para desenvolvedores da Speechify, diferente do app voltado ao consumidor.

Comece agora

Compare com o Google em poucas linhas: obtenha uma chave gratuita da API SpeechifyAI em speechify.ai, 500.000 caracteres por mês, e faça sua primeira solicitação com o quickstart.

Tenha acesso às vozes favoritas da Speechify via API de forma rápida, escalável e amigável para desenvolvedores

Acessar API
Sparse JavaScript keywords import, from, const, await on a white background

Compartilhar este artigo

Cliff Weitzman

CEO e fundador da Speechify

Cliff Weitzman é um defensor da causa da dislexia e CEO e fundador da Speechify, o app nº 1 do mundo para leitura em voz alta, com mais de 100 mil avaliações cinco estrelas e em 1º lugar na App Store na categoria Notícias & Revistas. Em 2017, Weitzman foi incluído na lista Forbes 30 Under 30 por seu trabalho para tornar a internet mais acessível para pessoas com transtornos de aprendizagem. Cliff Weitzman já foi destaque em publicações como EdSurge, Inc., PC Mag, Entrepreneur e Mashable.

Speechify

Sobre a Speechify

Leitor de Texto em Voz Alta nº 1

Speechify é a principal plataforma de leitura de texto em voz alta do mundo, confiada por mais de 50 milhões de usuários e com mais de 500.000 avaliações cinco estrelas em seus aplicativos de leitura em voz alta para iOS, Android, extensão para Chrome, web app e para Mac. Em 2025, a Apple premiou a Speechify com o prestigiado Apple Design Award na WWDC, chamando a plataforma de “um recurso essencial que ajuda as pessoas a viverem suas vidas.” A Speechify oferece mais de 1.000 vozes naturais em mais de 60 idiomas, sendo usada em quase 200 países. Vozes de celebridades incluem Snoop Dogg e Gwyneth Paltrow. Para criadores e empresas, o Speechify Studio oferece ferramentas avançadas, incluindo Gerador de Voz IA, Clonagem de Voz IA, Dublagem IA e seu Modificador de Voz IA. A Speechify também impulsiona produtos líderes de mercado com sua solução de API de leitura em voz alta de alta qualidade e baixo custo. Destaque em The Wall Street Journal, CNBC, Forbes, TechCrunch e outros grandes veículos de imprensa, a Speechify é a maior provedora de leitura em voz alta do mundo. Acesse speechify.com/news, speechify.com/blog e speechify.com/press para saber mais.