Black Forest Labsが多模態モデル「FLUX 3」を発表、20秒の動画生成に対応
画像・動画・音声を統合学習した基礎モデル「FLUX 3」が早期アクセスで公開されました。単一の生成プロセスで最大20秒の動画と音声を生成でき、文生成や画像からの動画生成にも対応しています。
動画生成AIの進化は、広告やコンテンツ制作のワークフローを劇的に変える可能性があり、最新モデルの表現力はクリエイティブ業務の効率化に直結します。
画像生成・編集モデルとクリエイティブ活用
Soranoru画像・動画・音声を統合学習した基礎モデル「FLUX 3」が早期アクセスで公開されました。単一の生成プロセスで最大20秒の動画と音声を生成でき、文生成や画像からの動画生成にも対応しています。
動画生成AIの進化は、広告やコンテンツ制作のワークフローを劇的に変える可能性があり、最新モデルの表現力はクリエイティブ業務の効率化に直結します。
SANA-Video 2.0は、5Bおよび14Bのパラメータ規模を持つ混合型動画拡散Transformerです。線形とソフトマックスの注意機構を組み合わせることで、単一GPU環境での効率的な動画生成を実現しました。
高コストな計算リソースを必要とする動画生成において、単一GPUでの動作は中小規模の制作現場や個人クリエイターにとって導入のハードルを下げる重要な進歩です。
Qwen-Image-3.0は、最大4.5kトークンの入力や多言語対応、高度な画像編集機能を備えた画像生成モデル。実測テストでは、UIデザインや複雑な文字入れにおいてGPT Image2に匹敵する精度を示した。
日本語を含む多言語対応や正確な文字生成能力を持つモデルの選択肢が増えることで、国内の制作現場におけるクリエイティブ作業の効率化が期待されます。
RTX 5090クラスのデスクトップGPUで動作する、動作条件付きのビデオ世界生成モデルです。長時間の自律的な生成におけるズレを抑え、リアルタイムな対話型環境を実現します。
高価なサーバー環境なしで高度なシミュレーションが可能になる可能性があり、ゲーム開発やVRコンテンツ制作の効率化に寄与する技術です。
「実」を追求した第3世代の画像生成モデルで、4.5kトークンの指示入力に対応し、複雑な情報を網羅したグリッドレイアウトの生成が可能です。12言語のテキストレンダリングに対応し、実務での活用を想定しています。
高精度なテキスト描画と長文指示への対応により、広告や資料作成など、ビジネス現場での画像生成AIの活用範囲がさらに広がる可能性があります。
ニール・ブロムカンプ監督が、動画生成モデル「Seedance 2.0」を活用した13分のSFホラー短編『Nightborne』を公開しました。同監督は今後、同様の手法で長編映画の制作を目指すAI映画スタジオ「Barley Studios」を設立しています。
映像制作の現場において、AIが単なる補助ツールから主要な制作手段へと進化していることを示しており、コンテンツ制作のコスト構造や手法が根本から変わる可能性があります。
人声、効果音、環境音を一つのモデルで生成可能な「Seed Audio 1.0」が登場しました。100ms単位の精密な制御が可能で、多言語対応かつ高い自然度を実現しています。
映像制作やコンテンツ制作において、高品質な音響効果をAIで自動生成できるようになるため、制作コストの削減と表現の幅の拡大が期待されます。
昆仑万维はWAICにて、世界モデル「Matrix-Game 3.5」や音楽生成モデルなどを発表しました。特にMatrix-Game 3.5は、単一GPUで20FPSのリアルタイム生成を実現しています。
動画やゲーム生成におけるリアルタイム性の向上は、エンターテインメントやシミュレーション分野でのAI活用を加速させる可能性があります。