NVIDIAはMagpie TTSで多言語音声生成のためのオープンウェイトモデルを提供し、開発者が自社インフラで低遅延音声エージェントを構築できるようにした。このモデルは12言語に対応し、カスタマーサポートエージェント、ヘルスケアアシスタント、企業向けユーティリティなどのアプリケーションに適した基盤を提供する。Magpie TTSは3億6400万パラメータを持ち、現代標準アラビア語、韓国語、ブラジルポルトガル語などの新しい言語をサポートし、ユーザーが音声をカスタマイズし遅延時間を制御できる機能を備えている。

Magpie TTSは32msという低遅延で音声生成を行い、迅速で自然な体験を実現する。このモデルはフレームスタッキングやローカルトランスフォーマーなどの技術を使用し、音質を維持しながら生成時間を短縮している。また、開発者が自社インフラで実行できるため、遅延時間を直接制御しスケーリングを行うことが可能だ。

Magpie TTSはNVIDIA Nemotron Voice Agent Developer Exampleの一部として、音声認識、言語モデル、推論モデルが統合されたシステムで動作する。これにより、開発者はリアルタイム対話型音声エージェントを構築し、自社アプリケーションに適応させることができる。