Skip to main content
  1. होम पेज
  2. एपीआई
  3. Google Cloud Text-to-Speech API के बारे में पूरी जानकारी
Updated on •एपीआई

Google Cloud Text-to-Speech API के बारे में पूरी जानकारी

क्लिफ वाइट्समैन

Speechify के CEO और संस्थापक

Speechify API 300ms 
लेटेंसी, मानव-स्तर की आवाज़ें 
और 50+ भाषाओं का सपोर्ट देता है

Apple2025 Apple Design Award
50M+ यूज़र्स

Google का Cloud Text-to-Speech API, HTTP अनुरोध के जरिए टेक्स्ट को ऑडियो में बदलता है। इसकी वॉयस-स्तर की कीमतें $4 प्रति मिलियन कैरेक्टर (Standard और WaveNet), $16 (Neural2) और $30 (Chirp 3 HD) हैं। इसमें 75+ भाषाओं में 380+ आवाज़ों के विकल्प हैं और स्ट्रीमिंग का समर्थन भी मिलता है। अगर आप इन स्तरों से बेहतर, स्वतंत्र रूप से आंकी गई वॉयस क्वालिटी कम कीमत पर चाहते हैं, तो SpeechifyAI स्वतंत्र Artificial Analysis TTS लीडरबोर्ड (23 सितंबर 2026) में $6 से $10 प्रति मिलियन पर टॉप-5 में है।

खुद बनाना चाहते हैं? Speechify का टेक्स्ट-टू-स्पीच और वॉयस क्लोनिंग API speechify.ai पर उपलब्ध है। इसकी डॉक्युमेंटेशन और फ्री की docs.speechify.ai से मिलती है।

Google Text-to-Speech API क्या करता है

Google Cloud Text-to-Speech एक सिंथेसिस API है: आप टेक्स्ट (या SSML) के साथ वॉयस और ऑडियो कॉन्फ़िगरेशन भेजते हैं, और यह आपको ऑडियो स्ट्रीम या फ़ाइल लौटाता है। यह Google Cloud का हिस्सा है, इसलिए GCP प्रोजेक्ट्स में इसे आसानी से इंटीग्रेट किया जा सकता है, और IAM, बिलिंग व क्लाइंट लाइब्रेरीज़ का अनुभव भी परिचित रहता है। डेवलपर्स इसे IVR, एक्सेसिबिलिटी, मीडिया नैरेशन और Google Cloud पर चल रहे प्रोडक्ट्स के लिए इस्तेमाल करते हैं।

Google TTS वॉयस टीयर और 2026 की कीमतें

Google, वॉयस टाइप के आधार पर प्रति मिलियन कैरेक्टर कीमत तय करता है। ऊँचे स्तर की आवाज़ें ज़्यादा प्राकृतिक लगती हैं और उनकी कीमत भी अधिक होती है:

वॉयस स्तर

1M कैरेक्टर की कीमत

फ्री स्तर (प्रति माह)

नोट्स

Standard

$4

4M कैरेक्टर

बुनियादी, कुछ हद तक रोबोटिक

WaveNet

$4

4M कैरेक्टर

न्यूरल, अच्छी सामान्य गुणवत्ता

Neural2

$16

1M कैरेक्टर

और बेहतर न्यूरल क्वालिटी

Chirp 3: HD

$30

1M कैरेक्टर

नई हाई-डेफ़िनिशन आवाज़ें

Studio

$160

1M कैरेक्टर

प्रीमियम लंबे-फ़ॉर्म का नैरेशन

बिलिंग, फ्री स्तर के बाद पे-एज़-यू-गो मॉडल पर होती है। फ्री अलॉटमेंट प्रोटोटाइपिंग के लिए ठीक है, लेकिन यह हर महीने रीसेट हो जाता है, इसलिए केवल ट्रायल पर नहीं, अपनी प्रोडक्शन ज़रूरतों के हिसाब से योजना बनाएं।

Google TTS API को कैसे कॉल करें

  1. Google Cloud प्रोजेक्ट बनाएं और Text-to-Speech API को सक्षम करें।
  2. Service account key या Application Default Credentials से ऑथेंटिकेट करें।
  3. texttospeech.googleapis.com/v1/text:synthesize
  4. को REST या gRPC के जरिए कॉल करें, या ऑफिशियल Python, Node, Java, या Go क्लाइंट लाइब्रेरी का उपयोग करें।
  5. input
  6. (टेक्स्ट या SSML),
  7. voice
  8. (भाषा कोड और नाम) और
  9. audioConfig
  10. (एन्कोडिंग, स्पीकिंग रेट, पिच) पास करें। रिटर्न में आपको base64 ऑडियो मिलेगा।

सेटअप, Google Cloud के दूसरे प्रोडक्ट्स जैसा ही है: अगर आप पहले से GCP इस्तेमाल करते हैं, तो यह आसान लगेगा; नहीं तो थोड़ा अतिरिक्त प्रयास करना पड़ सकता है।

कब किसी विकल्प पर विचार करें

Google TTS एक भरोसेमंद और व्यापक रूप से समर्थित विकल्प है, खासकर GCP पर। लेकिन दो वजहों से टीमें विकल्प तलाशती हैं:

  • प्रति डॉलर वॉयस क्वालिटी।
  • Google की बेहतरीन आवाज़ें (Chirp 3 HD $30, Studio $160) जल्दी महंगी पड़ने लगती हैं, और स्वतंत्र श्रोता अक्सर दूसरे मॉडलों को ऊँची रैंक देते हैं।
  • Artificial Analysis TTS लीडरबोर्ड
  • पर SpeechifyAI का Simba 3.2 जुलाई 2026 में #1 था और 23 सितंबर 2026 को भी इन दोनों से ऊपर, सिर्फ $6-$10 प्रति मिलियन पर।
  • रीयल-टाइम वॉयस एजेंट्स।
  • अगर आपको बातचीत करने वाला
  • वॉइस एजेंट
  • चाहिए, तो आपको स्पीच-टू-टेक्स्ट और LLM (लार्ज लैंग्वेज मॉडल) भी चाहिए। इन्हें Google TTS के साथ जोड़ने पर तीन सेवाओं की बिलिंग और लेटेंसी, दोनों बढ़ जाते हैं।

Google TTS का एक विकल्प: SpeechifyAI

  • बेहतर स्वतंत्र रेटिंग वाली गुणवत्ता।
  • Simba 3.2
  • जुलाई 2026 में स्वतंत्र Artificial Analysis TTS लीडरबोर्ड पर #1 रही। 23 सितंबर 2026 के बोर्ड पर यह टॉप-5 में है, हर ElevenLabs और OpenAI मॉडल से ऊपर, और इससे ऊपर की सभी मॉडल्स महंगी हैं।
  • गुणवत्ता के साथ कम कीमत।
  • $6 प्रति मिलियन कैरेक्टर, जो Google के Neural2 ($16) और Chirp 3 HD ($30) से सस्ता है, और बेहतर रैंक वाली आवाज़ के लिए।
  • तेज़ पहला ऑडियो।
  • Voice Arena के US English बोर्ड (123ms, 24 सितंबर 2026) में 14 मॉडलों के बीच सबसे कम मीडियन फर्स्ट-ऑडियो समय, असली स्ट्रीमिंग, 900+ आवाज़ें और 6 सेल्फ-सर्व भाषाएं (48 ऑन-रिक्वेस्ट)।
  • अपने स्टैक पर वॉइस एजेंट्स।
  • अगर आपको STT, LLM और TTS चाहिए, तो
  • LiveKit
  • ,
  • Pipecat
  • या
  • Vapi
  • पर SpeechifyAI की आवाज़ों के साथ बनाएं।

SpeechifyAI Speechify का डेवलपर प्लेटफ़ॉर्म है, जो उपभोक्ताओं के लिए बने Speechify ऐप से अलग है।

शुरू करें

Google से तुलना, सिर्फ कुछ लाइनों में करें: speechify.ai पर मुफ्त SpeechifyAI API key (500,000 कैरेक्टर प्रति माह) पाएं और quickstart का इस्तेमाल करें।

Speechify की पसंदीदा आवाज़ों तक API के ज़रिए तेज़, स्केलेबल और डेवलपर-फ्रेंडली एक्सेस पाएँ

API एक्सेस लें
Sparse JavaScript keywords import, from, const, await on a white background

यह लेख शेयर करें

क्लिफ वाइट्समैन

Speechify के CEO और संस्थापक

क्लिफ वाइट्समैन डिस्लेक्सिया (अक्षरजटिलता) के पैरोकार हैं और वे Speechify के CEO और संस्थापक हैं — जो दुनिया का नंबर 1 टेक्स्ट-टू-स्पीच ऐप है, जिसके पास 100,000 से अधिक 5-स्टार समीक्षाएँ हैं और App Store की News & Magazines श्रेणी में नंबर 1 रहा है। 2017 में इंटरनेट को सीखने में कठिनाइयों का सामना करने वाले लोगों के लिए अधिक सुलभ बनाने के उनके काम के लिए उन्हें Forbes 30 Under 30 सूची में शामिल किया गया था। क्लिफ वाइट्समैन का ज़िक्र EdSurge, Inc., PC Mag, Entrepreneur, Mashable सहित कई प्रमुख प्रकाशनों में आ चुका है।

Speechify

Speechify के बारे में

#1 टेक्स्ट टू स्पीच रीडर

Speechify दुनिया का अग्रणी टेक्स्ट टू स्पीच प्लेटफ़ॉर्म है जिस पर 50 मिलियन से ज़्यादा यूज़र्स भरोसा करते हैं, और इसके टेक्स्ट टू स्पीच iOS, Android, Chrome Extension, वेब ऐप और Mac डेस्कटॉप ऐप्स के लिए 500,000 से ज़्यादा पाँच-सितारा रिव्यूज़ हैं। 2025 में Apple ने Speechify को प्रतिष्ठित Apple Design Award से सम्मानित किया WWDC में, और इसे “एक अहम संसाधन बताया जो लोगों की ज़िंदगी आसान बनाता है।” Speechify 60+ भाषाओं में 1,000+ नैचुरल आवाज़ें ऑफर करता है और इसका इस्तेमाल लगभग 200 देशों में होता है। सिलेब्रिटी आवाज़ों में शामिल हैं Snoop Dogg और Gwyneth Paltrow। क्रिएटर्स और बिज़नेस के लिए Speechify Studio एडवांस्ड टूल्स देता है, जिनमें शामिल हैं ए.आई. वॉइस जेनरेटर, ए.आई. वॉइस क्लोनिंग, ए.आई. डबिंग और ए.आई. वॉइस चेंजर। Speechify अपने हाई-क्वालिटी, लो-कॉस्ट टेक्स्ट टू स्पीच API के ज़रिए कई बड़े प्रोडक्ट्स को भी पावर करता है। इसे The Wall Street Journal, CNBC, Forbes, TechCrunch और अन्य प्रमुख न्यूज़ आउटलेट्स में फीचर किया गया है, और Speechify आज दुनिया का सबसे बड़ा टेक्स्ट टू स्पीच प्रोवाइडर है। और जानने के लिए speechify.com/news, speechify.com/blog और speechify.com/press पर जाएँ।