音声クローンが可能な音声合成AI「Qwen-Audio-3.0-TTS」が登場、日本語対応でGemini超えの性能

  • 高品質な音声クローン機能を実現

    • わずかな参考音声とテキストを入力するだけで、話者の声質やニュアンスを精緻に再現した読み上げ音声を生成可能。

  • 日本語を含む多言語&クロス言語変換

    • 日本語・英語・中国語など16言語に対応。中国語や英語の参考音声から日本語のクローン音声を自然に出力する「クロス言語音声生成」も実現。

  • Gemini等を超える高い音声品質

    • 音声の自然さや話者再現度において、主要な競合AIモデル(Gemini 3.1 Flash TTS等)を凌駕するベンチマーク結果を提示。

  • リアルタイム性と高精度な制御

    • 低遅延なリアルタイム配信向け「Flash」と品質重視「Plus」の2モデルを展開し、笑い・ため息などの感情表現や自然言語による話し方の詳細制御に対応。

  • 音声AX(AI変革)がもたらすビジネス影響

    • 動画制作・Webメディアの音声化・多言語コールセンター対応など、エンタープライズ領域におけるコンテンツ制作・顧客対応の自動化とコスト削減を大きく推進。

  • https://gigazine.net/news/20260723-qwen-audio-3-tts/

前へ
前へ

AIモデルは1つに決めない方が安くて高性能、Kimi K3とFable 5の使い分けで最大50倍のコスト効率という実験結果

次へ
次へ

1180億パラメーターで1.6兆パラメーターのDeepSeek-V4-Pro-Maxを超えるアメリカ製オープンモデル「Laguna S 2.1」が登場