ByteDanceが音動画全二重モデル「SeedRealtime」を発表、リアルタイム対話を実現
要点:音声・動画・テキストを統合したアーキテクチャにより、見ながら・聞きながら・話すリアルタイム対話を実現しました。従来のモデルと比較して対話のテンポの遅延を半減させ、すでに「豆包(Doubao)」アプリで実装されています。
日本の事業者にとって、なぜ重要?
マルチモーダルな全二重対話技術が大規模に実用化されたことで、今後のAIエージェントにおける自然なユーザー体験の基準が大きく引き上げられる可能性があります。
元記事
SeedRealtime 音视频全双工大模型发布:走向全模态自然交互
元記事を読むAI評価
外部公開データの選定スコアです。評価元の掲載内容も確認できます。
選定元:AI HOT