Google DeepMind開発の音声合成モデル。テキストから高品質な音声を生成。
パラメータ
非公開
コンテキスト長
8K
ライセンス
プロプライエタリ
リリース日
2026-04-16
ベンチマーク性能
AA インテリジェンス指数
—
LMArena Elo
—
Human-Like Evaluation
—
ARC-AGI-2
—
SWE-bench Verified
—
GPQA Diamond
—
MMLU-Pro
—
LiveCodeBench
—
AIME 2025
—
MATH-500
—
日本語性能
多言語対応モデルのうち、日本語処理に優れた性能を持つモデル。
API料金
このモデルのAPI料金情報は現在未公開です
強み
弱み
活用例
深度分析
アリーナElo
1211
Artificial Analysis TTSリーダーボードで総合2位
入力価格
$1.00/1M tokens
Google AI Studio経由
出力価格
$20.00/1M tokens
音声出力トークン
対応言語数
70+
主要な世界言語を含む
レイテンシー
<200ms
短尺コンテンツ生成時
オーディオタグ
200+
インライン自然言語タグによる表現力制御
強み
- ・200以上のインラインオーディオタグによる、他に類を見ない表現力と精密な声の制御が可能。
- ・低レイテンシー(<200ms)により、リアルタイムインタラクティブなアプリケーションに最適。
- ・70以上の言語をサポートし、グローバルな利用に対応した幅広い多言語対応。
弱み
- ・プレビュー版であるため、不安定性、SLAなし、破壊的変更の可能性がある。
- ・プリセットボイス30種のみで、ボイスクローニング非対応の限定的なボイスライブラリ。
- ・1分以上の長尺コンテンツで品質が著しく低下し、90%の失敗率が観測されている。
競合比較
| Model | Arena | SWE | GPQA | Price |
|---|---|---|---|---|
| ElevenLabs Flash | #3 | N/A | N/A | $0.050/1K chars |
| OpenAI TTS-1-HD | トップ10圏外 | N/A | N/A | $0.030/1K chars |
Gemini 3.1 Flash TTSは、2026年4月にGoogle DeepMindがリリースしたプレビュー版のテキスト読み上げモデルで、高忠実度・高表現力の音声合成を目的として設計されています。200以上のインラインオーディオタグによるきめ細かな制御が特徴で、テキストプロンプト内から直接、声のスタイル、ペーシング、感情を指示することができます。70以上の言語をサポートし、ネイティブなマルチスピーカー対話機能を備え、AI生成コンテンツの検出用SynthIDウォーターマークも含まれています。
プレミアムTTSサービスのコスト効率の高い代替として位置づけられ、リアルタイムナレーション、アクセシビリティツール、eラーニングコンテンツなどの短尺アプリケーションに優れた性能を発揮します。ただし、プレビュー版であることや、長尺コンテンツの安定性・音声の多様性に制限があるため、プロトタイピングや、表現力と低コストが生産環境での堅牢性よりも優先される特定のユースケースに限定しての利用が主となります。
出典
- Gemini 3.1 Flash TTS: New text-to-speech AI model - Google Blog
- Gemini 3.1 Flash TTS Preview — model deep-dive · Tokonomix
- Gemini 3.1 Flash TTS Preview – 16k context | LLM Reference
- Gemini 3.1 Flash TTS (Text-to-Speech) Preview | Gemini API | Google AI for Developers
- Gemini 3.1 Flash TTS Review: Expressive AI Voice Model in 2026 | AI 4U Blog
- Gemini 3.1 Flash TTS Review: How It Compares to ElevenLabs | MindStudio
- Gemini 3.1 Flash TTS Review 2026: Google's New Voice AI Tested | TextToLab
- Gemini 3.1 Flash TTS Sounds Amazing - For About 60 Seconds | TTSAudit
- Guide to prompting Gemini 3.1 Flash TTS | Google Cloud Blog
- Gemini 3.1 Flash Audio (Flash Live, TTS) - Model Card | Google DeepMind
分析生成日: 2026-07-17