異種モデル間の蒸留を可能にする新フレームワーク「Any-OPD」発表
異なるアーキテクチャを持つ流マッチングモデル間で、効率的な同策略蒸留を実現するフレームワーク「Any-OPD」が提案されました。DINOv2を活用して教師モデルと学生モデルを橋渡しすることで、パラメータ数を抑えつつ生成品質を大幅に向上させることが可能です。
生成AIモデルの軽量化と高性能化を両立させる技術として、リソース制約のある環境での画像生成AI導入を加速させる可能性があります。
画像生成・編集モデルとクリエイティブ活用
Soranoru異なるアーキテクチャを持つ流マッチングモデル間で、効率的な同策略蒸留を実現するフレームワーク「Any-OPD」が提案されました。DINOv2を活用して教師モデルと学生モデルを橋渡しすることで、パラメータ数を抑えつつ生成品質を大幅に向上させることが可能です。
生成AIモデルの軽量化と高性能化を両立させる技術として、リソース制約のある環境での画像生成AI導入を加速させる可能性があります。
画像とテキストの間に意図的な矛盾を含ませた5,111の反事実グループと25,555の画像バリエーションからなる、マルチモーダルLLMの評価用ベンチマークです。モデルが視覚情報とテキスト情報のどちらを優先し、どう判断するかを検証します。
マルチモーダルAIの信頼性向上に不可欠な「情報の不整合への耐性」を測定できるため、高精度な画像認識や分析ツールを導入する際のモデル選定基準として注目されます。
MiniMaxは、テキスト、画像、動画、音声を統合的に理解・生成できる次世代モデル「H3」を公開しました。最大2K解像度、15秒の動画生成に加え、32kHzのステレオ音声をネイティブで生成可能です。
高品質な動画と音声を同時に生成できるモデルの登場は、広告制作やコンテンツ制作のワークフローを効率化し、クリエイティブの質を大きく変える可能性があります。
MiniMax H3を用いた実証実験では、広告TVC、短編ドラマ、UIアニメーションなど幅広い用途での活用が確認されました。最大7000文字のプロンプトに対応し、画像や動画、音声を組み合わせた高度な生成が可能です。
実務レベルでの動画生成AIの活用範囲が広がっており、制作現場におけるコスト削減や表現の幅を広げるための具体的なツールとして注目されます。
MiniMaxはテキスト、画像、動画、音声を統合的に理解・生成できるマルチモーダルモデル「H3」を発表しました。最大2K解像度で15秒のステレオ音声付き動画を生成可能で、近日中にモデルの重みを公開する予定です。
既存モデルと比較して高いコストパフォーマンスを実現しており、オープンソース化されれば、動画制作やコンテンツ開発におけるAI活用の選択肢が大きく広がる可能性があります。
MiniMaxは、広告やVlog、ゲームUIなどの視覚効果生成に強みを持つ動画生成AIモデル「H3」の公開とオープンソース化を発表しました。高い指示追従性を備え、動的なコンテンツ制作の効率化が期待されます。
オープンソース化により、特定の業界向けに最適化された派生モデルの登場が予想され、クリエイティブ制作の現場におけるAI活用の幅が広がる可能性があります。
Google Earthのウェブ版に画像生成モデル「Nano Banana 2」が統合されました。ユーザーはテキストプロンプトを用いて、特定の場所の過去の景観や新しい施設を3D映像として視覚化できます。
都市計画や不動産開発、観光プロモーションにおいて、場所の変遷や将来のイメージを直感的に共有するための強力なツールとなる可能性があります。
Seedance 2.5は一度の生成で最大30秒の動画作成が可能になり、画像や動画、音声などの多種多様な参照素材を用いた高度な編集をサポートします。即夢AIや豆包などのプラットフォームで順次提供され、今後はAPI経由での利用も予定されています。
動画生成の長尺化と参照素材の柔軟な活用により、広告やコンテンツ制作の効率が大幅に向上する可能性があります。日本国内でのAPI提供開始時には、業務フローへの組み込みを検討すべき技術です。
PhiZeroは、動画から物理的な状態変化を離散的な「物理言語」として学習し、未来の挙動を推論する世界モデルです。推論後に拡散モデルで映像化する手法により、物理的に整合性の高い動画生成や動作シミュレーションを実現しました。
物理法則に基づいた高精度な動画生成技術は、製造業のシミュレーションやクリエイティブ制作における映像生成の品質を飛躍的に高める可能性を秘めています。
Google DeepMindは、音楽生成モデル「Lyria 3.5」をGoogle Flow Musicに導入しました。旋律の複雑さや歌詞の追従性、人声の表現力が向上し、より細かな創作制御が可能になりました。
生成AIによるコンテンツ制作の品質が向上しており、広告やエンターテインメント業界におけるクリエイティブ制作のワークフローに変化をもたらす可能性があります。
xAIは、同意のないAI生成のわいせつ画像を禁止し、高額な罰金を科すミネソタ州の新法に対し、憲法違反であるとして提訴しました。同社は、この法律が過度な制限であり、自社の画像生成機能「Grok Imagine」の運用に支障をきたすと主張しています。
AIによる画像生成の法的責任と表現の自由を巡る議論は世界的に加速しており、AIツールを提供する事業者にとって、各国の規制動向がビジネスモデルに与える影響を注視する必要があります。
音楽生成AIのSunoがウェブおよびモバイル版で新機能を公開しました。音源分離やMIDIエクスポート、画像からの楽曲生成、車載システムへの対応などが追加されています。
MIDI出力や画像生成機能の追加により、AI生成楽曲をDAWで編集するなどのクリエイティブなワークフローへの統合が加速し、制作現場での実用性が向上しています。
Midjourneyは最新モデル「V8.2」をリリースし、生成画像の品質向上とユーザーの美的嗜好への適応能力を強化しました。低品質な生成を抑制し、パーソナライズ設定の選択肢を拡充することで、より意図に近い画像生成が可能になります。
クリエイティブ制作において、ブランドのトーン&マナーに合わせた画像生成の精度が向上するため、広告やデザイン業務での実用性がさらに高まることが期待されます。
Runway Agent上で、ノードベースのワークフローを自然言語で構築・編集・実行できるようになりました。これにより、複雑な映像生成プロセスを大規模かつ効率的に自動化できます。
クリエイティブ制作現場において、専門的な操作スキルを問わずAIワークフローを構築できる点は、制作効率の劇的な向上につながる可能性があります。
SANA-Video 2.0は、5Bおよび14Bのパラメータ規模を持つ混合型動画拡散Transformerです。線形とソフトマックスの注意機構を組み合わせることで、単一GPU環境での効率的な動画生成を実現しました。
高コストな計算リソースを必要とする動画生成において、単一GPUでの動作は中小規模の制作現場や個人クリエイターにとって導入のハードルを下げる重要な進歩です。
Black Forest Labsは、画像、動画、音声を統合的に学習する次世代マルチモーダルモデル「FLUX 3」を発表しました。世界を単一の表現として捉えることを目指したモデルで、現在早期アクセスが提供されています。
画像生成AIの分野で高い評価を得るFLUXシリーズの最新版であり、動画や音声との統合により、クリエイティブ制作のワークフローに大きな変革をもたらす可能性があります。
Qwen-Image-3.0は、最大4.5kトークンの入力や多言語対応、高度な画像編集機能を備えた画像生成モデル。実測テストでは、UIデザインや複雑な文字入れにおいてGPT Image2に匹敵する精度を示した。
日本語を含む多言語対応や正確な文字生成能力を持つモデルの選択肢が増えることで、国内の制作現場におけるクリエイティブ作業の効率化が期待されます。
RTX 5090クラスのデスクトップGPUで動作する、動作条件付きのビデオ世界生成モデルです。長時間の自律的な生成におけるズレを抑え、リアルタイムな対話型環境を実現します。
高価なサーバー環境なしで高度なシミュレーションが可能になる可能性があり、ゲーム開発やVRコンテンツ制作の効率化に寄与する技術です。
「実」を追求した第3世代の画像生成モデルで、4.5kトークンの指示入力に対応し、複雑な情報を網羅したグリッドレイアウトの生成が可能です。12言語のテキストレンダリングに対応し、実務での活用を想定しています。
高精度なテキスト描画と長文指示への対応により、広告や資料作成など、ビジネス現場での画像生成AIの活用範囲がさらに広がる可能性があります。
ニール・ブロムカンプ監督が、動画生成モデル「Seedance 2.0」を活用した13分のSFホラー短編『Nightborne』を公開しました。同監督は今後、同様の手法で長編映画の制作を目指すAI映画スタジオ「Barley Studios」を設立しています。
映像制作の現場において、AIが単なる補助ツールから主要な制作手段へと進化していることを示しており、コンテンツ制作のコスト構造や手法が根本から変わる可能性があります。