Skip to main content
  1. Trang chủ
  2. API
  3. Tất cả về Google Cloud Text to Speech API
Updated on •API

Tất cả về Google Cloud Text to Speech API

Cliff Weitzman

Giám đốc điều hành/Nhà sáng lập Speechify

Speechify API cho độ trễ chỉ 300ms, giọng đọc tự nhiên như người thật, hỗ trợ hơn 50 ngôn ngữ

AppleGiải Thiết Kế Apple 2025
50 triệu+ người dùng

Google Cloud Text-to-Speech API chuyển văn bản thành âm thanh qua yêu cầu HTTP, với mức giá từ $4 cho mỗi triệu ký tự (Standard và WaveNet), $16 (Neural2) và $30 (Chirp 3 HD). Dịch vụ hỗ trợ hơn 380 giọng, hơn 75 ngôn ngữ và phát trực tuyến. Nếu bạn muốn chất lượng giọng nói được đánh giá độc lập cao hơn với chi phí thấp hơn, SpeechifyAI nằm trong top 5 bảng xếp hạng Artificial Analysis TTS (23/9/2026) với mức giá từ $6 đến $10 cho mỗi triệu ký tự.

Tự xây dựng giải pháp? Speechify API hỗ trợ chuyển văn bản thành giọng nói và nhân bản giọng nói tại speechify.ai, kèm tài liệu và khóa dùng thử miễn phí tại docs.speechify.ai.

Google Text-to-Speech API dùng để làm gì?

Google Cloud Text-to-Speech là API tổng hợp giọng nói: bạn gửi văn bản (hoặc SSML), chọn giọng nói và cấu hình âm thanh, hệ thống sẽ trả về luồng hoặc tệp âm thanh. Đây là một phần của Google Cloud, tích hợp liền mạch với các dự án GCP, dùng chung hệ thống IAM, thanh toán và thư viện khách như các dịch vụ khác. Các nhà phát triển thường chọn dịch vụ này cho IVR, trợ năng, thuyết minh nội dung và tích hợp vào sản phẩm đang chạy trên Google Cloud.

Bảng giá Google TTS năm 2026

Google tính phí theo từng loại giọng, trên mỗi triệu ký tự. Cấp càng cao thì giọng nghe càng tự nhiên và chi phí cũng cao hơn:

Cấp giọng

Giá mỗi 1M ký tự

Gói miễn phí (mỗi tháng)

Ghi chú

Standard

$4

4M ký tự

Cơ bản, giọng máy

WaveNet

$4

4M ký tự

Neural, chất lượng tốt trong tầm phổ thông

Neural2

$16

1M ký tự

Neural chất lượng cao hơn

Chirp 3: HD

$30

1M ký tự

Giọng mới, chất lượng HD

Studio

$160

1M ký tự

Tường thuật dài chuyên nghiệp

Phần vượt quá gói miễn phí sẽ được tính theo mức dùng thực tế. Gói miễn phí phù hợp để thử nghiệm và được làm mới hằng tháng, vì vậy hãy cân đối theo nhu cầu thực tế chứ không chỉ dựa vào bản dùng thử.

Cách gọi Google TTS API

  1. Tạo project trên Google Cloud và bật Text-to-Speech API.
  2. Xác thực bằng khóa tài khoản dịch vụ hoặc Application Default Credentials.
  3. Gọi
  4. texttospeech.googleapis.com/v1/text:synthesize
  5. qua REST hoặc gRPC, hoặc dùng thư viện chính thức cho Python, Node, Java, Go.
  6. Truyền
  7. input
  8. (văn bản hoặc SSML),
  9. voice
  10. (mã ngôn ngữ kèm tên giọng) và
  11. audioConfig
  12. (mã hóa, tốc độ đọc, tông giọng). Kết quả trả về là âm thanh dạng base64.

Quy trình thiết lập bám sát tiêu chuẩn GCP: khá thuận tiện nếu bạn đã dùng Google Cloud, nhưng sẽ mất thêm công nếu mới bắt đầu.

Khi nào nên cân nhắc giải pháp thay thế

Google TTS là lựa chọn ổn định, hỗ trợ rộng, đặc biệt phù hợp trong hệ sinh thái GCP. Tuy nhiên, hai yếu tố sau khiến nhiều đội ngũ tìm sang giải pháp khác:

  • Chất lượng giọng nói trên chi phí bỏ ra.
  • Các cấp giọng tốt nhất của Google (Chirp 3 HD $30, Studio $160) nhanh chóng trở nên đắt đỏ, trong khi các đánh giá độc lập vẫn xếp hạng thấp hơn một số mô hình khác. Trên
  • Artificial Analysis TTS leaderboard
  • , Simba 3.2 của SpeechifyAI đứng #1 vào tháng 7/2026, và đến ngày 23/9/2026 vẫn xếp trên cả hai mức giá đó với chi phí chỉ $6-$10 cho mỗi triệu ký tự.
  • Tác vụ giọng nói thời gian thực.
  • Nếu cần xây dựng voice agent
  • thời gian thực
  • , bạn còn cần speech-to-text và LLM. Việc ghép các thành phần này với Google TTS sẽ làm tăng chi phí và độ trễ vì phải đi qua ba dịch vụ.

SpeechifyAI - giải pháp thay thế cho Google TTS

  • Chất lượng được đánh giá độc lập cao hơn.
  • Simba 3.2
  • đứng #1 trên bảng xếp hạng Artificial Analysis TTS độc lập vào tháng 7/2026. Đến ngày 23/9/2026, mô hình này vẫn nằm trong top 5, vượt mọi model của ElevenLabs, OpenAI, và tất cả các model xếp trên đều có giá cao hơn.
  • Chi phí thấp cho chất lượng cao.
  • $6 mỗi triệu ký tự, thấp hơn Google Neural2 ($16) và Chirp 3 HD ($30), trong khi chất lượng giọng nói vượt cả hai.
  • Nhận âm thanh cực nhanh.
  • Thời gian trả audio nhanh nhất trên bảng xếp hạng US English của Voice Arena (123ms, ngày 24/9/2026), hỗ trợ streaming thực, hơn 900 giọng và 6 ngôn ngữ trực tuyến (48 ngôn ngữ theo yêu cầu).
  • Tích hợp voice agent trên stack hiện có của bạn.
  • Nếu cần STT, LLM và TTS cùng lúc, bạn có thể xây trên
  • LiveKit
  • ,
  • Pipecat
  • hoặc
  • Vapi
  • để dùng giọng SpeechifyAI.

SpeechifyAI là nền tảng dành cho lập trình viên của Speechify, tách biệt với ứng dụng Speechify cho người dùng cá nhân.

Bắt đầu sử dụng

Bạn có thể so sánh với Google chỉ bằng vài dòng lệnh: nhận API key SpeechifyAI miễn phí tại speechify.ai (500.000 ký tự/tháng) và gửi yêu cầu đầu tiên với quickstart.

Truy cập các giọng đọc yêu thích của Speechify qua API tốc độ cao, dễ mở rộng và thân thiện với lập trình viên

Nhận quyền truy cập API
Sparse JavaScript keywords import, from, const, await on a white background

Chia sẻ bài viết này

Cliff Weitzman

Giám đốc điều hành/Nhà sáng lập Speechify

Cliff Weitzman là một người luôn lên tiếng bảo vệ những người mắc chứng khó đọc và là Giám đốc điều hành kiêm nhà sáng lập Speechify, ứng dụng chuyển văn bản thành giọng nói số 1 thế giới, với hơn 100.000 lượt đánh giá 5 sao và nhiều lần giữ vị trí số một trong mục Tin tức & Tạp chí trên App Store. Năm 2017, Weitzman được vinh danh trong danh sách Forbes 30 Under 30 nhờ những đóng góp giúp internet trở nên dễ tiếp cận hơn với người gặp khó khăn trong học tập. Cliff Weitzman cũng từng được nhắc đến trên EdSurge, Inc., PC Mag, Entrepreneur, Mashable cùng nhiều kênh truyền thông lớn khác.

Speechify

Về Speechify

Nền tảng chuyển văn bản thành giọng nói số 1 thế giới

Speechify là nền tảng chuyển văn bản thành giọng nói hàng đầu thế giới, được hơn 50 triệu người tin dùng và nhận hơn 500.000 đánh giá 5 sao trên các ứng dụng chuyển văn bản thành giọng nói của mình trên iOS, Android, Tiện ích mở rộng Chrome, ứng dụng web và ứng dụng Mac desktop. Năm 2025, Apple đã trao tặng cho Speechify giải thưởng danh giá Apple Design Award tại WWDC, nhận định đây là “một tài nguyên quan trọng giúp mọi người sống tốt hơn.” Speechify cung cấp hơn 1.000 giọng đọc tự nhiên bằng hơn 60 ngôn ngữ và được sử dụng tại gần 200 quốc gia. Các giọng đọc của người nổi tiếng bao gồm Snoop Dogg và Gwyneth Paltrow. Đối với người sáng tạo nội dung và doanh nghiệp, Speechify Studio mang đến các công cụ nâng cao như Trình tạo giọng nói AI, Nhân bản giọng nói AI, Lồng tiếng AI và Trình đổi giọng AI. Speechify còn cung cấp giải pháp chuyển văn bản sang giọng nói chất lượng cao, tiết kiệm chi phí thông qua API chuyển văn bản thành giọng nói cho các sản phẩm hàng đầu. Được xuất hiện trên The Wall Street Journal, CNBC, Forbes, TechCrunch và nhiều trang tin tức lớn khác, Speechify hiện là nhà cung cấp giải pháp chuyển văn bản sang giọng nói lớn nhất thế giới. Truy cập speechify.com/news, speechify.com/blog và speechify.com/press để tìm hiểu thêm.