本文へスキップ
hdknr blog
戻る

Mistral Voxtral TTS: ElevenLabs に匹敵するオープンウェイト音声AI

Mistral AI が 2026年3月26日にリリースした Voxtral TTS(Text-to-Speech)は、オープンウェイトで公開された音声合成モデルです。ElevenLabs に匹敵する品質を持ちながら、ローカル環境で動作するのが最大の特徴です。

Voxtral TTS の概要

Voxtral TTS は Mistral AI 初のテキスト読み上げモデルで、4B(40億)パラメータの軽量設計です。Hugging Face で mistralai/Voxtral-4B-TTS-2603 として公開されています。

主な特徴:

ElevenLabs との比較

Mistral の公式ベンチマークによると、Voxtral TTS は:

従来は従量課金制の商用サービスに頼るしかなかった高品質音声合成が、オープンウェイトで利用できるようになりました。

動作要件

項目仕様
パラメータ数4B
モデルサイズ約 8 GB(BF16)
GPU メモリ16 GB 以上推奨
出力形式WAV, PCM, FLAC, MP3, AAC, Opus
サンプリングレート24 kHz

BF16 版は GPU 16GB 以上が必要ですが、量子化バージョン(mlx-community/Voxtral-4B-TTS-2603-mlx-4bit)も公開されており、Apple Silicon Mac などでより少ないメモリで実行可能です。Mistral はスマートフォンなどのエッジデバイスでの動作も想定した設計としています。

利用シーン

ライセンスと注意点

Voxtral TTS は CC BY-NC 4.0(クリエイティブ・コモンズ 表示-非営利 4.0)ライセンスで公開されています。商用利用には別途ライセンスが必要です。

また、API 経由での利用も可能で、Mistral の Le Chat や la Plateforme から利用できます。

まとめ

Voxtral TTS は、高品質な音声合成がオープンウェイトとして誰でもローカルで動かせる時代を切り開くモデルです。商用 TTS サービスへの依存を減らしたい開発者や、プライバシーを重視する企業にとって有力な選択肢になるでしょう。

参考リンク



前の記事
Pay2Key の Linux ランサムウェアが x64/ARM64 サーバーを標的に — 防御機構を無効化する高度な手口
次の記事
Claude AI で投資銀行レベルの財務モデルを作成する 12 のプロンプト