Skip to main content
  1. Início
  2. API
  3. Tudo sobre a API Google Cloud Text-to-Speech
Updated on API

Tudo sobre a API Google Cloud Text-to-Speech

Cliff Weitzman

CEO e fundador da Speechify

A API Speechify oferece latência de 300 ms, vozes com qualidade humana e mais de 50 idiomas

AppleApple Design Award 2025
Mais de 50M de usuários

A API Cloud Text-to-Speech do Google transforma texto em áudio por meio de requisições HTTP, com vozes a partir de US$ 4 por milhão de caracteres (Standard e WaveNet), US$ 16 (Neural2) e US$ 30 (Chirp 3 HD). São mais de 380 vozes em mais de 75 idiomas, com suporte a streaming. Se você procura mais qualidade de voz por um custo menor, o SpeechifyAI lidera o ranking de TTS da Artificial Analysis, com preços de US$ 6 a US$ 10 por milhão.

Vai desenvolver por conta própria? As APIs de text-to-speech e clonagem de voz do Speechify estão em speechify.ai, com documentação e chave gratuita em docs.speechify.ai.

O que a API Google Text-to-Speech faz

O Google Cloud Text-to-Speech é uma API de síntese de voz: você envia texto (ou SSML), além de uma voz e das configurações de áudio, e recebe um stream ou arquivo de áudio. Ela faz parte do Google Cloud e se integra com facilidade a projetos no GCP, usando o mesmo IAM, faturamento e bibliotecas dos demais serviços da plataforma. Desenvolvedores a utilizam em IVR, acessibilidade, narrações e produtos já executados no Google Cloud.

Tipos de voz e preços do Google TTS em 2026

O preço do Google varia de acordo com o tipo de voz, por milhão de caracteres. As opções mais avançadas soam mais naturais e também custam mais:

Tipo de voz

Preço por 1 mi de caracteres

Faixa gratuita (por mês)

Observações

Standard

US$ 4

4 mi de caracteres

Básica, com som mais robótico

WaveNet

US$ 4

4 mi de caracteres

Neural, com boa qualidade geral

Neural2

US$ 16

1 mi de caracteres

Neural de qualidade superior

Chirp 3: HD

US$ 30

1 mi de caracteres

Vozes HD mais recentes

Studio

US$ 160

1 mi de caracteres

Narração premium para longos formatos

A cobrança é por uso, acima da cota gratuita. A franquia grátis é generosa para prototipagem, mas é renovada todo mês, então vale planejar com base no volume de produção.

Como usar a API Google TTS

  1. Crie um projeto no Google Cloud e ative a API Text-to-Speech.
  2. Autentique-se com uma chave de conta de serviço ou com Application Default Credentials.
  3. Chame
  4. texttospeech.googleapis.com/v1/text:synthesize
  5. via REST ou gRPC, ou use as bibliotecas oficiais para Python, Node, Java ou Go.
  6. Envie
  7. input
  8. (texto ou SSML), uma
  9. voice
  10. (código do idioma e nome) e um
  11. audioConfig
  12. (formato, velocidade, tom). O retorno é um áudio em base64.

A configuração segue o padrão do GCP: é simples para quem já usa Google Cloud, mas exige mais etapas para quem está começando.

Quando considerar outra alternativa

O Google TTS é uma opção sólida e amplamente compatível, especialmente dentro do GCP. Ainda assim, dois fatores costumam levar equipes a buscar alternativas:

  • Qualidade de voz por dólar.
  • As melhores opções do Google (Chirp 3 HD a US$ 30, Studio a US$ 160) elevam rapidamente o custo, e avaliações independentes ainda colocam outros modelos à frente. No
  • ranking de TTS da Artificial Analysis
  • (julho/2026), o Simba 3.2 do SpeechifyAI ocupa o 1º lugar, à frente do Google DeepMind.
  • Agentes de voz em tempo real.
  • Para criar um
  • agente de voz
  • conversacional, você também precisa de speech-to-text e LLM. Ao integrar tudo ao Google TTS, o custo e a latência se multiplicam entre três serviços.

SpeechifyAI como alternativa ao Google TTS

  • Qualidade superior em avaliações independentes.
  • Simba 3.2
  • lidera o ranking da Artificial Analysis (julho/2026) e ocupa o 2º lugar no Voice Arena, acima de Google DeepMind, ElevenLabs e OpenAI.
  • Melhor custo-benefício em qualidade.
  • US$ 6 por milhão de caracteres, abaixo do Neural2 (US$ 16) e do Chirp 3 HD (US$ 30) do Google, para uma voz mais bem colocada no ranking.
  • ~300ms de latência, mais de 30 idiomas e 1.500+ vozes
  • , com streaming real para aplicações em tempo real.
  • Agentes de voz integrados.
  • Precisa de STT + LLM + TTS? O SpeechifyAI reúne tudo em uma única API por US$ 0,068 a US$ 0,075 por minuto, sem repasse adicional de cobrança.

SpeechifyAI é a plataforma para desenvolvedores do Speechify, separada do aplicativo de consumo do Speechify.

Comece agora

Compare com o Google em poucas linhas: obtenha uma chave de API gratuita do SpeechifyAI em speechify.ai, com 50.000 caracteres por mês, e instale o SDK com pip install speechify-api ou npm install @speechify/api.

Acesse as vozes favoritas da Speechify via API — rápido, escalável e com foco no desenvolvedor

Solicitar acesso à API
Sparse JavaScript keywords import, from, const, await on a white background

Compartilhe este artigo

Cliff Weitzman

CEO e fundador da Speechify

Cliff Weitzman é um defensor da causa da dislexia e o CEO e fundador da Speechify, o aplicativo número 1 de conversão de texto em fala do mundo, com mais de 100.000 avaliações 5 estrelas e líder de downloads na App Store na categoria Notícias & Revistas. Em 2017, Weitzman foi incluído na lista Forbes 30 under 30 por seu trabalho para tornar a internet mais acessível a pessoas com dificuldades de aprendizagem. Cliff Weitzman já foi destaque em veículos como EdSurge, Inc., PC Mag, Entrepreneur, Mashable, entre outros importantes meios de comunicação.

Speechify

Sobre a Speechify

Leitor de texto para fala nº 1

Speechify é a principal plataforma de texto para fala do mundo, confiável por mais de 50 milhões de usuários e com mais de 500.000 avaliações cinco estrelas em suas versões para iOS, Android, extensão para Chrome, web app e aplicativos para Mac desktop. Em 2025, a Apple premiou a Speechify com o prestigiado Apple Design Award na WWDC, chamando-a de “um recurso essencial que ajuda as pessoas a viverem melhor”. A Speechify oferece mais de 1.000 vozes naturais em mais de 60 idiomas e é usada em quase 200 países. As vozes de celebridades incluem Snoop Dogg e Gwyneth Paltrow. Para criadores e empresas, o Speechify Studio oferece ferramentas avançadas, incluindo o Gerador de Voz IA, Clonagem de Voz IA, Dublagem de IA e seu próprio Alterador de Voz IA. A Speechify também integra grandes produtos com sua API de texto para fala de alta qualidade e custo acessível. Em destaque no The Wall Street Journal, CNBC, Forbes, TechCrunch e outros grandes veículos de mídia, a Speechify é a maior provedora de texto para fala do mundo. Visite speechify.com/news, speechify.com/blog e speechify.com/press para saber mais.