Google Deep Mindプロプライエタリ

Gemini 3.1 Flash TTS (preview)

このモデルを比較

Google DeepMind開発の音声合成モデル。テキストから高品質な音声を生成。

シェア:XはてブLINE

パラメータ

非公開

コンテキスト長

8K

ライセンス

プロプライエタリ

リリース日

2026-04-16

ベンチマーク性能

AA インテリジェンス指数

LMArena Elo

Human-Like Evaluation

ARC-AGI-2

SWE-bench Verified

GPQA Diamond

MMLU-Pro

LiveCodeBench

AIME 2025

MATH-500

日本語性能

高品質日本語

多言語対応モデルのうち、日本語処理に優れた性能を持つモデル。

API料金

このモデルのAPI料金情報は現在未公開です

強み

    弱み

      活用例

        深度分析

        アリーナElo

        1211

        Artificial Analysis TTSリーダーボードで総合2位

        入力価格

        $1.00/1M tokens

        Google AI Studio経由

        出力価格

        $20.00/1M tokens

        音声出力トークン

        対応言語数

        70+

        主要な世界言語を含む

        レイテンシー

        <200ms

        短尺コンテンツ生成時

        オーディオタグ

        200+

        インライン自然言語タグによる表現力制御

        強み

        • 200以上のインラインオーディオタグによる、他に類を見ない表現力と精密な声の制御が可能。
        • 低レイテンシー(<200ms)により、リアルタイムインタラクティブなアプリケーションに最適。
        • 70以上の言語をサポートし、グローバルな利用に対応した幅広い多言語対応。

        弱み

        • プレビュー版であるため、不安定性、SLAなし、破壊的変更の可能性がある。
        • プリセットボイス30種のみで、ボイスクローニング非対応の限定的なボイスライブラリ。
        • 1分以上の長尺コンテンツで品質が著しく低下し、90%の失敗率が観測されている。

        競合比較

        ModelArenaSWEGPQAPrice
        ElevenLabs Flash#3N/AN/A$0.050/1K chars
        OpenAI TTS-1-HDトップ10圏外N/AN/A$0.030/1K chars

        Gemini 3.1 Flash TTSは、2026年4月にGoogle DeepMindがリリースしたプレビュー版のテキスト読み上げモデルで、高忠実度・高表現力の音声合成を目的として設計されています。200以上のインラインオーディオタグによるきめ細かな制御が特徴で、テキストプロンプト内から直接、声のスタイル、ペーシング、感情を指示することができます。70以上の言語をサポートし、ネイティブなマルチスピーカー対話機能を備え、AI生成コンテンツの検出用SynthIDウォーターマークも含まれています。

        プレミアムTTSサービスのコスト効率の高い代替として位置づけられ、リアルタイムナレーション、アクセシビリティツール、eラーニングコンテンツなどの短尺アプリケーションに優れた性能を発揮します。ただし、プレビュー版であることや、長尺コンテンツの安定性・音声の多様性に制限があるため、プロトタイピングや、表現力と低コストが生産環境での堅牢性よりも優先される特定のユースケースに限定しての利用が主となります。

        分析生成日: 2026-07-17