NVIDIAがオープンソースの全二重音声対話モデルNemotronLabs VoiceChat 11Bを公開
要点:NVIDIAは、約450ミリ秒の低遅延で応答可能な全二重音声対話モデルを公開しました。対話中にリアルタイムでツール呼び出しが可能で、API実行中の沈黙を防ぐ工夫も実装されています。
日本の事業者にとって、なぜ重要?
オープンソースで高度な音声対話AIを構築できるため、自社サービスへの低遅延な音声インターフェース導入を検討する際の重要な選択肢となります。
元記事
NVIDIA Releases NemotronLabs VoiceChat 11B: An Open Full-Duplex Speech-to-Speech Model with ~450 ms Turn-Taking and Live Tool Calling
元記事を読むAI評価
外部公開データの選定スコアです。評価元の掲載内容も確認できます。
選定元:AI HOT