Skip to main content
  1. หน้าแรก
  2. API
  3. ทุกเรื่องที่ควรรู้เกี่ยวกับ Google Cloud Text to Speech API
Updated on •API

ทุกเรื่องที่ควรรู้เกี่ยวกับ Google Cloud Text to Speech API

Cliff Weitzman

ซีอีโอ/ผู้ก่อตั้ง Speechify

Speechify API ให้บริการด้วยความเร็ว 300ms 
เสียงคุณภาพระดับมนุษย์ และรองรับกว่า 50 ภาษา

Appleรางวัล Apple Design Award 2025
ผู้ใช้งานกว่า 50 ล้านคน

Google Cloud Text-to-Speech API แปลงข้อความเป็นเสียงผ่าน HTTP request โดยคิดค่าบริการตามกลุ่มเสียง เริ่มต้นที่ $4 ต่อ 1 ล้านตัวอักษร (Standard และ WaveNet) ไปจนถึง $16 (Neural2) และ $30 (Chirp 3 HD) ครอบคลุมเสียงมากกว่า 380 แบบ ในกว่า 75 ภาษา และรองรับการสตรีม หากคุณต้องการคุณภาพเสียงจากผู้ประเมินอิสระที่สูงกว่ากลุ่มราคานี้ในต้นทุนที่ต่ำกว่า SpeechifyAI ติด Top 5 บน Artificial Analysis TTS leaderboard (23 ก.ย. 2026) ที่ราคา $6 ถึง $10 ต่อ 1 ล้านตัวอักษร

อยากพัฒนาเอง? API แปลงข้อความเป็นเสียงและโคลนเสียงของ Speechify พร้อมให้ใช้งานที่ speechify.ai ดูเอกสารและขอคีย์ฟรีได้ที่ docs.speechify.ai

Google Text-to-Speech API ทำงานอย่างไร

Google Cloud Text-to-Speech เป็น API สำหรับสังเคราะห์เสียง: ส่งข้อความ (หรือ SSML) พร้อมเสียงและการตั้งค่าที่ต้องการ แล้วระบบจะส่งไฟล์เสียงหรือสตรีมเสียงกลับมา ในฐานะที่เป็นส่วนหนึ่งของ Google Cloud จึงใช้งานร่วมกับโปรเจ็กต์บน GCP ได้สะดวก ใช้ IAM ระบบเรียกเก็บเงิน และไลบรารีชุดเดียวกับบริการอื่นๆ นักพัฒนามักนำไปใช้กับ IVR, ฟีเจอร์การช่วยการเข้าถึง, การบรรยายสื่อ และบริการต่างๆ ที่ทำงานอยู่บน Google Cloud อยู่แล้ว

กลุ่มเสียงและราคา Google TTS ปี 2026

Google คิดค่าบริการตามประเภทเสียงต่อ 1 ล้านตัวอักษร โดยกลุ่มเสียงระดับสูงจะให้คุณภาพใกล้เคียงเสียงจริงมากขึ้นและมีราคาสูงขึ้น:

ประเภทเสียง

ราคาต่อ 1M ตัวอักษร

โควตาฟรี/เดือน

หมายเหตุ

Standard

$4

4M ตัวอักษร

พื้นฐาน โทนค่อนข้างเหมือนหุ่นยนต์

WaveNet

$4

4M ตัวอักษร

เสียง Neural คุณภาพโดยรวมดี

Neural2

$16

1M ตัวอักษร

เสียง Neural คุณภาพสูงขึ้น

Chirp 3: HD

$30

1M ตัวอักษร

เสียงความคมชัดสูงรุ่นใหม่

Studio

$160

1M ตัวอักษร

เหมาะกับงานพากย์ยาวระดับพรีเมียม

ระบบจะคิดค่าบริการตามการใช้งานจริงเมื่อใช้เกินโควตาฟรี โควตาฟรีเหมาะกับการทดสอบต้นแบบ แต่จะรีเซ็ตทุกเดือน ดังนั้นควรวางแผนตามปริมาณการใช้งานจริง

วิธีเรียกใช้งาน Google TTS API

  1. สร้างโปรเจ็กต์ Google Cloud และเปิดใช้งาน Text-to-Speech API
  2. ยืนยันตัวตนด้วย service account key หรือ Application Default Credentials
  3. เรียก
  4. texttospeech.googleapis.com/v1/text:synthesize
  5. ผ่าน REST หรือ gRPC หรือใช้ client libraries ของ Python, Node, Java หรือ Go
  6. ระบุ
  7. input
  8. (ข้อความหรือ SSML),
  9. voice
  10. (รหัสภาษาและชื่อเสียง) และ
  11. audioConfig
  12. (รูปแบบไฟล์, ความเร็ว, ระดับเสียง) แล้วระบบจะส่งไฟล์เสียงแบบ base64 กลับมา

ขั้นตอนโดยรวมคล้ายกับบริการอื่นบน GCP หากคุณใช้อยู่แล้วก็จะสะดวก แต่ถ้ายังไม่ใช้งาน อาจต้องมีการตั้งค่าเพิ่มพอสมควร

เมื่อไรควรมองหาทางเลือกอื่น

Google TTS เป็นตัวเลือกที่เสถียรและมีการสนับสนุนที่ดี โดยเฉพาะสำหรับผู้ที่ใช้งาน GCP อยู่แล้ว แต่โดยทั่วไปมีอยู่ 2 เหตุผลที่หลายทีมเลือกใช้ทางเลือกอื่น:

  • คุณภาพเสียงเมื่อเทียบกับราคา
  • กลุ่มเสียงคุณภาพสูงของ Google (Chirp 3 HD $30, Studio $160) มีราคาค่อนข้างสูง และจากการจัดอันดับอิสระก็ยังมีโมเดลอื่นที่อยู่เหนือกว่า ใน
  • Artificial Analysis TTS leaderboard
  • SpeechifyAI รุ่น Simba 3.2 ได้อันดับ #1 ในเดือน ก.ค. 2026 และในตารางวันที่ 23 ก.ย. 2026 ก็ยังอยู่สูงกว่าทั้งสองกลุ่มเสียงนี้ที่ราคา $6 ถึง $10 ต่อ 1 ล้านตัวอักษร
  • โซลูชันเสียงแบบเรียลไทม์
  • หากต้องการ
  • voice agent
  • ที่โต้ตอบได้ คุณจะต้องใช้ทั้งบริการแปลงเสียงเป็นข้อความและ LLM เพิ่มเติมด้วย หากนำบริการเหล่านี้มาเชื่อมกับ Google TTS ก็จะต้องจัดการบิลแยกกัน และอาจมีดีเลย์จากหลายบริการ

SpeechifyAI ทางเลือกแทน Google TTS

  • คุณภาพเสียงจากการประเมินอิสระสูงกว่า
  • Simba 3.2
  • ได้อันดับ #1 บน Artificial Analysis TTS leaderboard ในเดือน ก.ค. 2026 และในตารางวันที่ 23 ก.ย. 2026 ก็ยังติด Top 5 เหนือทุกโมเดลของ ElevenLabs และ OpenAI โดยโมเดลที่อยู่สูงกว่านี้ทั้งหมดมีราคาสูงกว่า
  • ราคาคุ้มค่ากว่าในระดับคุณภาพใกล้กัน
  • $6 ต่อ 1 ล้านตัวอักษร ซึ่งต่ำกว่า Google Neural2 ($16) และ Chirp 3 HD ($30) สำหรับเสียงที่มีอันดับสูงกว่า
  • ได้ยินเสียงแรกเร็วกว่า
  • ค่ามัธยฐานเวลาจนได้ยินเสียงแรกต่ำที่สุดในบรรดา 14 โมเดลของ Voice Arena US English (123 ms, 24 ก.ย. 2026) พร้อมรองรับการสตรีมจริง มีเสียงกว่า 900 แบบ และ 6 ภาษาหลัก (ขอเพิ่มได้สูงสุด 48 ภาษาตามความต้องการ)
  • โซลูชัน voice agent บนสแตกของคุณเอง
  • หากต้องการ STT, LLM และ TTS คุณสามารถสร้างระบบบน
  • LiveKit
  • ,
  • Pipecat
  • หรือ
  • Vapi
  • โดยใช้ SpeechifyAI เป็นระบบเสียง

SpeechifyAI คือแพลตฟอร์มสำหรับนักพัฒนาของ Speechify ที่แยกจากแอป Speechify สำหรับผู้ใช้ทั่วไป

เริ่มต้นใช้งาน

คุณสามารถเปรียบเทียบกับ Google ได้ในไม่กี่ขั้นตอน ขอ API Key ฟรีจาก SpeechifyAI ได้ที่ speechify.ai รับโควตา 500,000 ตัวอักษรต่อเดือน และเริ่มใช้งานได้ทันทีด้วย quickstart

เข้าถึงเสียงที่ผู้ใช้ชื่นชอบของ Speechify ผ่าน API ที่รวดเร็ว ขยายได้ และเป็นมิตรกับนักพัฒนา

ขอสิทธิ์การใช้งาน API
Sparse JavaScript keywords import, from, const, await on a white background

แชร์บทความนี้

Cliff Weitzman

ซีอีโอ/ผู้ก่อตั้ง Speechify

คลิฟฟ์ ไวท์ซ์แมน เป็นผู้ขับเคลื่อนสิทธิผู้มีภาวะดิสเล็กเซีย และดำรงตำแหน่งซีอีโอและผู้ก่อตั้ง Speechify แอปแปลงข้อความเป็นเสียงอันดับ 1 ของโลก ที่กวาดรีวิว 5 ดาวกว่า 100,000 รายการ และเคยครองอันดับ 1 ใน App Store หมวดข่าวสารและนิตยสาร ในปี 2017 ไวท์ซ์แมนติดโผ Forbes 30 Under 30 จากผลงานผลักดันให้โลกออนไลน์เข้าถึงได้มากขึ้นสำหรับผู้มีความบกพร่องทางการเรียนรู้ ผลงานของคลิฟฟ์ ไวท์ซ์แมนถูกกล่าวถึงในสื่อชั้นนำอย่าง EdSurge, Inc., PC Mag, Entrepreneur, Mashable และอีกมากมาย

Speechify

เกี่ยวกับ Speechify

#1 โปรแกรมอ่านข้อความเป็นเสียง

Speechify เป็นแพลตฟอร์ม แปลงข้อความเป็นเสียง ชั้นนำของโลกที่มีผู้ใช้งานกว่า 50 ล้านคน และได้รับรีวิวระดับ 5 ดาวมากกว่า 500,000 รีวิวในแอปพลิเคชัน iOS, Android, Chrome Extension, เว็บแอป และ แอปบน Mac ในปี 2025 Apple ได้มอบรางวัล Apple Design Award อันทรงเกียรติให้กับ Speechify ในงาน WWDC โดยกล่าวว่าเป็น “ทรัพยากรสำคัญที่ช่วยให้ผู้คนใช้ชีวิตได้ง่ายขึ้น” Speechify มีเสียงธรรมชาติกว่า 1,000 เสียงใน 60+ ภาษา และมีผู้ใช้งานในเกือบ 200 ประเทศ เสียงคนดังที่มีให้เลือกใช้งาน เช่น Snoop Dogg, Mr. Beast และ Gwyneth Paltrow สำหรับผู้สร้างสรรค์และธุรกิจ Speechify Studio มีเครื่องมือขั้นสูง เช่น AI Voice Generator, AI Voice Cloning, AI Dubbing และ AI Voice Changer Speechify ยังสนับสนุนผลิตภัณฑ์ชั้นนำด้วย Text to Speech API ที่มีคุณภาพสูงและคุ้มค่า นอกจากนี้ยังได้รับการนำเสนอใน The Wall Street Journal, CNBC, Forbes, TechCrunch และสื่อชั้นนำอื่น ๆ Speechify เป็นผู้ให้บริการแปลงข้อความเป็นเสียงที่ใหญ่ที่สุดในโลก เยี่ยมชม speechify.com/news, speechify.com/blog และ speechify.com/press เพื่อเรียนรู้เพิ่มเติม