ElevenLabsは月曜日、次世代音声モデルであるv4とv4 Turboをリリースした。

同社は、新アーキテクチャにより10秒の音声サンプルでクローンが可能になったと説明。対応言語を70から90に拡大し、日本語、ブラジルポルトガル語、北京語、広東語で最も大きな品質向上を確認したとしている。

モデルはテキストの文脈を保持し、長文でも話者のアイデンティティをより良く維持。表現タグのスタック機能により、連続した感情的なイントネーションを実現する。