Skip to main content
  1. 首页
  2. API
  3. Google Cloud 文本转语音 API 全面解析
Updated on •API

Google Cloud 文本转语音 API 全面解析

Cliff Weitzman

Speechify 首席执行官兼创始人

Speechify API 实现 300ms 级延迟、人声级音质及 50+ 种语言支持

Apple2025 年苹果设计大奖
5000 万+ 用户

Google 的 Cloud Text-to-Speech API 可通过 HTTP 请求将文本转为音频,不同语音档位的价格从每百万字符 4 美元(Standard 和 WaveNet),到 16 美元(Neural2)和 30 美元(Chirp 3 HD)不等。支持 75+ 种语言、380+ 种声音,并支持流式输出。 如果你希望以更低成本获得更高的独立语音质量,SpeechifyAI 在独立 Artificial Analysis TTS 排行榜(2026年9月23日)中位列前五,价格为每百万 6-10 美元。

想自己搭建? Speechify 文本转语音和语音克隆 API 可在 speechify.ai 获取,文档和免费密钥请见 docs.speechify.ai。

Google Cloud 文本转语音 API

Google 文本转语音 API 的功能

Google Cloud Text-to-Speech 是一项语音合成 API:提交文本(或 SSML)、语音和音频配置后,即可返回音频流或音频文件。作为 Google Cloud 的一部分,它能无缝集成到 GCP 项目中,沿用同一套身份验证、计费和客户端库。适用于 IVR、无障碍、媒体播报,以及各类已运行在 Google Cloud 上的产品。

Google TTS 语音档位及 2026 年价格

Google 按语音类型和每百万字符收费。语音档位越高,声音越自然,价格也越高:

语音档位

每百万字符价格

每月免费额度

说明

Standard

$4

4M 字符

基础款,机械感较强

WaveNet

$4

4M 字符

神经网络语音,整体表现均衡

Neural2

$16

1M 字符

更高质量的神经网络语音

Chirp 3: HD

$30

1M 字符

最新高保真语音

Studio

$160

1M 字符

适合长篇旁白的高级语音

超出免费额度后按量计费。免费额度适合用于原型开发,且每月重置;若用于生产环境,建议按实际用量提前规划。

如何调用 Google TTS API

  1. 创建 Google Cloud 项目,并启用 Text-to-Speech API。
  2. 通过服务账号密钥或应用默认凭据完成身份验证。
  3. 通过 REST 或 gRPC 调用
  4. texttospeech.googleapis.com/v1/text:synthesize
  5. ,或使用官方 Python、Node、Java、Go 客户端库。
  6. 提交
  7. input
  8. (文本或 SSML)、
  9. voice
  10. (语言代码和名称)、
  11. audioConfig
  12. (编码、语速、音调),即可返回 base64 音频。

配置流程与标准 GCP 流程一致:如果你已经在使用 Google Cloud,上手会比较轻松;否则前期配置会稍显繁琐。

何时考虑替代方案

Google TTS 是 GCP 生态中广受认可的选择,但以下两点常常会让团队考虑转向其他方案:

  • 每美元的音质表现。
  • Google 的高端语音(Chirp 3 HD $30,Studio $160)价格较高,而在独立听众评分中仍不及部分其他模型。在
  • Artificial Analysis TTS 榜单
  • 上,SpeechifyAI 的 Simba 3.2 于 2026 年 7 月排名第一,截至 9 月 23 日的评分仍高于上述 Google 高端档位,价格却仅为每百万 6-10 美元。
  • 实时语音助手需求。
  • 如果要搭建
  • 语音助手
  • ,通常还需要语音转文本和大语言模型(LLM)。将这三者接入 Google TTS 往往意味着要处理多项服务的计费与延迟问题。

SpeechifyAI 作为 Google TTS 的替代方案

  • 独立音质更出色。
  • Simba 3.2
  • 在独立 Artificial Analysis TTS 榜单中于 2026 年 7 月夺得第一,截至 9 月 23 日仍稳居前五,优于所有 ElevenLabs 和 OpenAI 模型,且价格也更低。
  • 高质量,价格更低。
  • 每百万字符 6 美元,低于 Google Neural2($16)和 Chirp 3 HD($30),同时音质评级更高。
  • 首音响应更快。
  • 在 Voice Arena 美式英语语音榜的 14 款模型中,首音时间最低(123 毫秒,2026 年 9 月 24 日),支持真正的流式输出,提供 900+ 种声音及 6 种自助语言(如有需要可扩展至 48 种)。
  • 更灵活的语音代理集成。
  • 如果需要整合 STT、LLM 和 TTS,可使用
  • LiveKit
  • 、
  • Pipecat
  • 或
  • Vapi
  • ,并以 SpeechifyAI 作为语音引擎。

SpeechifyAI 是 Speechify 面向开发者的平台,与面向消费者的 Speechify 应用不同。

快速开始

只需几行代码,你就能开始对比 Google 方案:访问 speechify.ai 获取免费的 SpeechifyAI API 密钥,每月可用 50 万字符;查看快速入门,即可发送第一条请求。

通过 API 快速接入 Speechify 的高级语音服务,弹性扩展,开发者友好

获取 API 访问权限
Sparse JavaScript keywords import, from, const, await on a white background

分享此文

Cliff Weitzman

Speechify 首席执行官兼创始人

Cliff Weitzman 是一位阅读障碍倡导者,也是 Speechify 首席执行官兼创始人。Speechify 是全球排名第一的文字转语音应用,累计收获逾 100,000 条五星好评,并在 App Store 的“新闻与杂志”分类中位居第一。2017 年,因致力于提升互联网对学习障碍人群的可及性,Weitzman 入选福布斯“30 位 30 岁以下精英”(Forbes 30 Under 30)榜单。其事迹曾被 EdSurge、Inc.、PC Mag、Entrepreneur、Mashable 等主流媒体报道。

Speechify

关于 Speechify

No.1 文字转语音阅读器

Speechify 是全球领先的文字转语音平台,深受超过 5000 万用户信赖,并在其文字转语音 iOS、Android、Chrome 扩展、网页版应用和 Mac 桌面端应用上,收获超过 50 万条五星好评。2025 年,Apple 授予 Speechify 备受业界瞩目的 苹果设计大奖,并在 WWDC 盛会上称其为“帮助人们更好生活的重要资源”。Speechify 提供 1000+ 自然音色、60+ 种语言支持,服务覆盖近 200 个国家/地区。明星声音包括 Snoop Dogg 和 Gwyneth Paltrow。面向创作者和企业用户,Speechify Studio 提供强大工具,包括 AI 语音生成器、AI 语音克隆、AI 配音和高阶AI 变声器。Speechify 还通过高品质、低成本的文字转语音 API赋能行业领先产品。Speechify 被众多主流媒体报道,包括《华尔街日报》、CNBC、福布斯、TechCrunch等,现已成为全球最大的文字转语音服务提供商。更多信息请访问 speechify.com/news、speechify.com/blog 和 speechify.com/press 了解更多。