Midjourneyが画像編集モデルV8.2のテストを開始、直感的な編集機能を強化
Midjourneyは、指示による編集や最大4枚の参照画像を用いた生成、局部重绘や拡張が可能なV8.2モデルのテストを開始しました。WebサイトおよびDiscordのコマンドから利用可能です。
画像生成の精度だけでなく、意図した通りの修正が容易になることで、クリエイティブ制作におけるワークフローの効率化が期待されます。
画像生成・編集モデルとクリエイティブ活用
SoranoruMidjourneyは、指示による編集や最大4枚の参照画像を用いた生成、局部重绘や拡張が可能なV8.2モデルのテストを開始しました。WebサイトおよびDiscordのコマンドから利用可能です。
画像生成の精度だけでなく、意図した通りの修正が容易になることで、クリエイティブ制作におけるワークフローの効率化が期待されます。
LTX社が発表した動画生成モデル「LTX-2.5」は、ComfyUIにネイティブ対応し、高速な生成性能を実現しました。一定規模以下の企業は無料で利用可能で、音声付き動画を低コストで生成できます。
動画生成の高速化とコスト低減が進むことで、広告やSNS向けコンテンツ制作の効率が大幅に向上する可能性があります。特にComfyUIとの親和性が高く、ワークフローへの組み込みが容易な点が実務上のメリットです。
AlibabaのQwen Cloudにて、画像生成モデル「Qwen-Image-3.0-Pro」および「Standard」版が提供開始されました。最大4.5kトークンのプロンプトに対応し、12言語のサポートや高精度な文字レンダリング機能を備えています。
中国国内で高い評価を得ている画像生成モデルが利用可能となり、多言語対応や文字描画精度が向上したことで、グローバルなクリエイティブ業務における選択肢の一つとして注目されます。
動画、音声、画像、動作予測を統合したマルチモーダルモデル「FLUX 3 Video」がOpenRouter上で公開されました。統一されたアーキテクチャにより、映画のような映像からクリエイティブな表現まで幅広く対応します。
API経由で最新の動画生成モデルを容易に組み込めるようになるため、映像制作やコンテンツ開発の効率化を検討する事業者にとって重要な選択肢となります。
MiniMaxは、テキスト、画像、動画、音声を統合的に理解・生成できる次世代モデル「H3」を公開しました。最大2K解像度、15秒の動画生成に加え、32kHzのステレオ音声をネイティブで生成可能です。
高品質な動画と音声を同時に生成できるモデルの登場は、広告制作やコンテンツ制作のワークフローを効率化し、クリエイティブの質を大きく変える可能性があります。
MiniMaxはテキスト、画像、動画、音声を統合的に理解・生成できるマルチモーダルモデル「H3」を発表しました。最大2K解像度で15秒のステレオ音声付き動画を生成可能で、近日中にモデルの重みを公開する予定です。
既存モデルと比較して高いコストパフォーマンスを実現しており、オープンソース化されれば、動画制作やコンテンツ開発におけるAI活用の選択肢が大きく広がる可能性があります。
MiniMaxは、広告やVlog、ゲームUIなどの視覚効果生成に強みを持つ動画生成AIモデル「H3」の公開とオープンソース化を発表しました。高い指示追従性を備え、動的なコンテンツ制作の効率化が期待されます。
オープンソース化により、特定の業界向けに最適化された派生モデルの登場が予想され、クリエイティブ制作の現場におけるAI活用の幅が広がる可能性があります。
Seedance 2.5は一度の生成で最大30秒の動画作成が可能になり、画像や動画、音声などの多種多様な参照素材を用いた高度な編集をサポートします。即夢AIや豆包などのプラットフォームで順次提供され、今後はAPI経由での利用も予定されています。
動画生成の長尺化と参照素材の柔軟な活用により、広告やコンテンツ制作の効率が大幅に向上する可能性があります。日本国内でのAPI提供開始時には、業務フローへの組み込みを検討すべき技術です。
Google DeepMindは、音楽生成モデル「Lyria 3.5」をGoogle Flow Musicに導入しました。旋律の複雑さや歌詞の追従性、人声の表現力が向上し、より細かな創作制御が可能になりました。
生成AIによるコンテンツ制作の品質が向上しており、広告やエンターテインメント業界におけるクリエイティブ制作のワークフローに変化をもたらす可能性があります。
Midjourneyは最新モデル「V8.2」をリリースし、生成画像の品質向上とユーザーの美的嗜好への適応能力を強化しました。低品質な生成を抑制し、パーソナライズ設定の選択肢を拡充することで、より意図に近い画像生成が可能になります。
クリエイティブ制作において、ブランドのトーン&マナーに合わせた画像生成の精度が向上するため、広告やデザイン業務での実用性がさらに高まることが期待されます。
SANA-Video 2.0は、5Bおよび14Bのパラメータ規模を持つ混合型動画拡散Transformerです。線形とソフトマックスの注意機構を組み合わせることで、単一GPU環境での効率的な動画生成を実現しました。
高コストな計算リソースを必要とする動画生成において、単一GPUでの動作は中小規模の制作現場や個人クリエイターにとって導入のハードルを下げる重要な進歩です。
Black Forest Labsは、画像、動画、音声を統合的に学習する次世代マルチモーダルモデル「FLUX 3」を発表しました。世界を単一の表現として捉えることを目指したモデルで、現在早期アクセスが提供されています。
画像生成AIの分野で高い評価を得るFLUXシリーズの最新版であり、動画や音声との統合により、クリエイティブ制作のワークフローに大きな変革をもたらす可能性があります。
「実」を追求した第3世代の画像生成モデルで、4.5kトークンの指示入力に対応し、複雑な情報を網羅したグリッドレイアウトの生成が可能です。12言語のテキストレンダリングに対応し、実務での活用を想定しています。
高精度なテキスト描画と長文指示への対応により、広告や資料作成など、ビジネス現場での画像生成AIの活用範囲がさらに広がる可能性があります。
昆仑万维はWAICにて、世界モデル「Matrix-Game 3.5」や音楽生成モデルなどを発表しました。特にMatrix-Game 3.5は、単一GPUで20FPSのリアルタイム生成を実現しています。
動画やゲーム生成におけるリアルタイム性の向上は、エンターテインメントやシミュレーション分野でのAI活用を加速させる可能性があります。