Skip to main content
  1. ホーム
  2. API
  3. Google Cloud Text to Speech APIのすべて
Updated on •API

Google Cloud Text to Speech APIのすべて

クリフ・ワイツマン

SpeechifyのCEO兼創業者

Speechify APIは300msの 
低遅延、人間の声のような自然さ、 
50以上の言語に対応

Apple2025年 Apple デザインアワード受賞
5,000万以上のユーザー

GoogleのCloud Text-to-Speech APIは、HTTPリクエストでテキストを音声に変換できます。料金は音声タイプ別で、StandardとWaveNetが100万文字あたり4ドル、Neural2が16ドル、Chirp 3 HDが30ドル。75以上の言語と380種類以上の音声に対応し、ストリーミングも利用できます。 さらに、より低価格で高品質な独立系音声モデルをお探しなら、SpeechifyAIもおすすめです。Artificial Analysis TTSリーダーボード(2026年9月23日)でトップ5に入り、価格も100万文字あたり6〜10ドルです。

自分で作りたいですか? Speechifyのテキスト読み上げ・音声クローンAPIはspeechify.aiで提供しています。ドキュメントと無料キーはdocs.speechify.aiで確認できます。

Google Text-to-Speech APIの機能

Google Cloud Text-to-Speechは音声合成APIです。テキスト(またはSSML)に音声とオーディオ設定を指定して送信すると、音声ストリームまたは音声ファイルが返されます。Google Cloudのサービスの一部なので、GCPプロジェクトへ直接組み込めるほか、IAM、課金、クライアントライブラリも他のサービスと共通です。IVR、アクセシビリティ対応、メディアの音声化、GCP上のプロダクトなどでよく使われています。

Google TTSの音声タイプと2026年の料金

Googleは音声タイプごとに、100万文字単位で料金を設定しています。上位モデルほど音声は自然になりますが、そのぶん価格も上がります。

音声タイプ

100万文字あたりの料金

無料枠(月間)

備考

Standard

$4

400万文字

基本的な機械音声

WaveNet

$4

400万文字

ニューラル音声で、一般に高品質

Neural2

$16

100万文字

より自然な高品質ニューラル音声

Chirp 3: HD

$30

100万文字

最新の高精細音声

Studio

$160

100万文字

高品質な長文ナレーション向け

課金は、無料枠を超えた分だけ従量課金で支払う仕組みです。無料枠は試作や検証には十分ですが、毎月リセットされるため、本番運用では想定利用量に基づいて計画しましょう。

Google TTS APIの呼び出し方

  1. Google Cloudプロジェクトを作成し、Text-to-Speech APIを有効にします。
  2. サービスアカウントキー、またはアプリケーションのデフォルト認証情報で認証します。
  3. texttospeech.googleapis.com/v1/text:synthesize
  4. をRESTまたはgRPCで呼び出すか、公式のPython、Node、Java、Goクライアントライブラリを使います。
  5. input
  6. (テキストまたはSSML)、
  7. voice
  8. (言語コード+音声名)、
  9. audioConfig
  10. (エンコード、話速、ピッチ)を指定すると、base64の音声が返されます。

セットアップは標準的なGCPの手順に沿います。すでにGoogle Cloudを使っているならスムーズですが、そうでない場合は手順がやや多めです。

他サービスを検討するケース

Google TTSはGCPとの連携に優れた信頼性の高い選択肢ですが、次の2つの理由から別のサービスを選ぶ企業も少なくありません。

  • コストに対する音声品質。
  • Googleの高品質モデル(Chirp 3 HDは30ドル、Studioは160ドル)は、利用量が増えるとコストがかさみます。さらに、独立調査では他モデルのほうが高く評価されています。
  • Artificial Analysis TTSリーダーボード
  • では、SpeechifyAIのSimba 3.2が2026年7月に1位となり、9月23日版でも両モデルを上回りながら、100万文字あたり6〜10ドルです。
  • リアルタイム音声エージェント。
  • 音声エージェント
  • の開発には、音声認識やLLM連携も欠かせません。Google TTSと組み合わせる場合、3つのサービス分の課金やレイテンシーを調整する必要があります。

Google TTSの代替としてのSpeechifyAI

  • 独立評価で高い音声品質。
  • Simba 3.2
  • は、2026年7月のArtificial Analysis TTSリーダーボードで1位を獲得。9月23日版でもトップ5に入り、ElevenLabsやOpenAIの全モデルを上回っています。しかも、それらの上位モデルはいずれもより高価です。
  • 高品質で低価格。
  • 100万文字あたり6ドルで、GoogleのNeural2(16ドル)やChirp 3 HD(30ドル)より安く、評価も上回ります。
  • 業界最速クラスの初回音声。
  • Voice Arena英語版USボードの14モデル中、初回音声の中央値123ms(2026年9月24日)で最速です。リアルタイムストリーミングに対応し、900以上の音声と6言語に対応(要望に応じて48言語まで対応可能)しています。
  • 既存スタック上で音声エージェントを構築。
  • STT+LLM+TTSをまとめて使いたい場合は、
  • LiveKit
  • 、
  • Pipecat
  • 、
  • Vapi
  • などの環境で、SpeechifyAIの音声を利用できます。

SpeechifyAIは開発者向けプラットフォームであり、一般向けのSpeechifyアプリとは異なります。

はじめ方

Googleとの比較は数行で始められます。speechify.aiで無料のAPIキーを取得すれば、毎月50万文字まで利用できます。クイックスタートから、最初のリクエストを送ってみましょう。

Speechify自慢の音声を、API経由で高速・スケーラブルかつ開発者フレンドリーにご利用いただけます

APIアクセスを取得
Sparse JavaScript keywords import, from, const, await on a white background

この記事をシェアする

クリフ・ワイツマン

SpeechifyのCEO兼創業者

クリフ・ワイツマンはディスレクシア支援の提唱者であり、世界で最も人気のテキスト読み上げアプリ、SpeechifyのCEO兼創業者です。Speechifyは、5つ星レビューが10万件以上寄せられ、App Storeの「ニュース&雑誌」カテゴリで1位を獲得しています。2017年には、学習障害のある方々がインターネットをより使いやすくなるよう尽力した功績が評価され、Forbesの「30 Under 30」に選出されました。クリフ・ワイツマンは、EdSurge、Inc.、PC Mag、Entrepreneur、Mashableなどの主要メディアで取り上げられています。

Speechify

Speechifyについて

No.1 テキスト読み上げリーダー

Speechify は、世界をリードする テキスト読み上げ プラットフォームであり、5,000万を超えるユーザーに利用され、iOSiOS、Android、Chrome拡張機能、Webアプリ、そしてMacデスクトップアプリで50万件以上の5つ星レビューを獲得しています。2025年には、Appleから権威あるApple デザインアワードをWWDCで受賞し、「人々の暮らしを支える重要なリソース」と評されました。Speechifyは、60言語以上・1,000以上の自然な音声を提供し、ほぼ200か国で利用されています。有名人の音声にはSnoop Doggやグウィネス・パルトロウなども含まれます。クリエイターや企業向けに、Speechify Studio では高度なツールを提供し、AIボイスジェネレーター、AIボイスクローン、AI吹き替え、そしてAIボイスチェンジャーも利用できます。また、Speechifyは高品質でコストパフォーマンスに優れたテキスト読み上げAPIで、主要なプロダクトも支えています。これまでにウォール・ストリート・ジャーナル、CNBC、Forbes、TechCrunchなどの主要メディアにも取り上げられています。Speechifyは世界最大のテキスト読み上げプロバイダーです。詳しくはspeechify.com/news、speechify.com/blog、speechify.com/pressをご覧ください。