Speechifyでは、厳選したテキスト読み上げモデルを提供しています。最適なモデルを選ぶには、遅延、対応言語、音質のバランスが重要です。本ガイドでは各モデルの適した用途を紹介し、すべて試さなくても最適な選択ができるようまとめています。
各リリースの詳細は、speechify.aiのモデル解説記事をご覧ください。Simba 3.2発表では、現在このモデルをおすすめする理由を詳しく紹介しています。
Speechifyテキスト読み上げAPIの導入方法は、クイックスタートガイドをご覧ください。
自社開発をご検討中ですか? Speechifyのテキスト読み上げ・ボイスクローンAPIはspeechify.aiで提供しています。ドキュメントと無料APIキーはdocs.speechify.aiから取得できます。
Speechifyの提供モデル一覧
モデルは3ファミリーあります。
- Simba 3.2:英語向けに推奨される最新モデル。ストリーミング対応で応答が最速、厳選された英語ボイスを提供します。対話型の用途に最適です。
- Simba 3.0:現在のAPIデフォルト。ストリーミング対応の多言語モデルで、英語、ドイツ語、スペイン語、フランス語、イタリア語、ブラジルポルトガル語に対応。3.2よりやや遅延はあるものの、多言語展開に適しています。
- レガシーモデル(simba-english・simba-multilingual):Simba 1.6シリーズ。APIバージョン2026-09-21で提供終了となり、2026-11-21にサービス停止予定です。既存統合で特定の旧ボイスや言語が必要な場合のみ使用し、早めの移行をおすすめします。
最も高速なモデルは?
Simba 3.2です。ストリーミング向けに最適化されており、音声の初回応答が最速です。英語の音声エージェント向けの標準推奨モデルでもあります。
Simba 3.0も近い性能ですが、多言語対応の処理が加わります。レガシーモデルの2つは最も遅いため、可能な限り移行をおすすめします。
最も多くの言語に対応するモデルは?
Simba 3.0です。英語、ドイツ語、スペイン語(スペイン/メキシコ)、フランス語、イタリア語、ブラジルポルトガル語に公式対応しています。POST /v1/audio/speechでlanguageパラメータを指定すると、各言語のネイティブボイスが返されます。旧simba-multilingualは30以上のロケールに対応していましたが、APIバージョン2026-09-21で提供終了となり、2026-11-21に完全停止します。
製品が単一言語なら、速度と品質のバランスでSimba 3.2が最適です。複数言語に展開するなら、現時点ではSimba 3.0が最適です。
音質が最も優れているモデルは?
音質はモデル世代ごとに向上しています。Simba 3.2は英語で非常に自然な音声を実現し、Simba 3.0も各対応言語で高品質です。レガシーモデルは最も古い世代のため、機械的に聞こえます。
顧客向けの音声には、Simba 3.2またはSimba 3.0をおすすめします。
利用可能な音声一覧の取得方法
GET /v1/voicesを呼び出してください。タイプ、ロケール、性別、モデルで絞り込み、合成前に最適な音声を選べます。音声とモデルのレスポンス形式は、speechify.aiの記事でも紹介しています。
ストリーミング or バッチ?
Simba 3モデルはどちらもストリーミングに対応しています。ライブ再生にはPOST /v1/audio/stream、タイムスタンプやワードマーク付き音声にはPOST /v1/audio/stream/with-timestamps、単一ファイル出力にはPOST /v1/audio/speechを使用します。モデル選択は配信方式に左右されません。
FAQ
Speechifyで推奨のTTSモデルは?
Simba 3.2です。新規用途向けのデフォルト推奨モデルで、ストリーミング対応、初回音声の応答が最速、英語の品質も最高レベルです。
Simba 3.2(英語):ストリーミング対応、初回音声の応答が最速、英語で最高品質です。なお、APIのデフォルトはmodel未指定時にSimba 3.0となるため、model: "simba-3.2"を明示的に指定してください。
はい。Simba 3.0は、言語パラメータに応じて多くのロケールでネイティブ音声を返します。Simba 3.2は英語に特化しています。
はい。Simba 3.0は英語と欧州6言語でネイティブ音声を返します。Simba 3.2は英語に特化しています。
既存統合で旧ボイスが必要な場合にのみ使用してください。それ以外はSimba 3.2またはSimba 3.0への移行をおすすめします。
既存統合で旧ボイスが必要な場合にのみ利用できます。APIバージョン2026-09-21で提供終了、2026-11-21で完全停止となるため、それまでにSimba 3.2またはSimba 3.0へ移行してください。
最速の応答が必要ならSimba 3.2を選び、ストリーム出力でリアルタイム利用できます。

