SoranoruNEWS
TOPIC

画像生成AIの最新情報

画像生成・編集モデルとクリエイティブ活用

Soranoru
NEWS FEED

14件のニュース

Midjourney:Updates(RSS)元記事へのリンクあり
参考

Midjourneyが画像編集モデルV8.2のテストを開始、直感的な編集機能を強化

Midjourneyは、指示による編集や最大4枚の参照画像を用いた生成、局部重绘や拡張が可能なV8.2モデルのテストを開始しました。WebサイトおよびDiscordのコマンドから利用可能です。

なぜ注目?

画像生成の精度だけでなく、意図した通りの修正が容易になることで、クリエイティブ制作におけるワークフローの効率化が期待されます。

IT之家(RSS)元記事へのリンクあり
参考

動画生成AI「LTX-2.5」が登場、10秒の720p動画を6.8秒で生成しComfyUIに統合

LTX社が発表した動画生成モデル「LTX-2.5」は、ComfyUIにネイティブ対応し、高速な生成性能を実現しました。一定規模以下の企業は無料で利用可能で、音声付き動画を低コストで生成できます。

なぜ注目?

動画生成の高速化とコスト低減が進むことで、広告やSNS向けコンテンツ制作の効率が大幅に向上する可能性があります。特にComfyUIとの親和性が高く、ワークフローへの組み込みが容易な点が実務上のメリットです。

X:通义千问 / Qwen (@Alibaba_Qwen)元記事へのリンクあり
参考

Alibabaが画像生成AI「Qwen-Image-3.0-Pro」を公開、多言語対応と高精度な文字描画を実現

AlibabaのQwen Cloudにて、画像生成モデル「Qwen-Image-3.0-Pro」および「Standard」版が提供開始されました。最大4.5kトークンのプロンプトに対応し、12言語のサポートや高精度な文字レンダリング機能を備えています。

なぜ注目?

中国国内で高い評価を得ている画像生成モデルが利用可能となり、多言語対応や文字描画精度が向上したことで、グローバルなクリエイティブ業務における選択肢の一つとして注目されます。

X:OpenRouter (@OpenRouter)元記事へのリンクあり
参考

Black Forest Labsのマルチモーダルモデル「FLUX 3 Video」がOpenRouterで利用可能に

動画、音声、画像、動作予測を統合したマルチモーダルモデル「FLUX 3 Video」がOpenRouter上で公開されました。統一されたアーキテクチャにより、映画のような映像からクリエイティブな表現まで幅広く対応します。

なぜ注目?

API経由で最新の動画生成モデルを容易に組み込めるようになるため、映像制作やコンテンツ開発の効率化を検討する事業者にとって重要な選択肢となります。

公众号:MiniMax(稀宇科技)元記事へのリンクあり
注目

MiniMaxが動画生成モデル「H3」をオープンソース化:2K解像度と立体音響に対応

MiniMaxは、テキスト、画像、動画、音声を統合的に理解・生成できる次世代モデル「H3」を公開しました。最大2K解像度、15秒の動画生成に加え、32kHzのステレオ音声をネイティブで生成可能です。

なぜ注目?

高品質な動画と音声を同時に生成できるモデルの登場は、広告制作やコンテンツ制作のワークフローを効率化し、クリエイティブの質を大きく変える可能性があります。

MiniMax:Blog(网页)元記事へのリンクあり
注目

MiniMaxが全能型マルチモーダルモデル「H3」を発表、2K動画生成とオープンソース化を予定

MiniMaxはテキスト、画像、動画、音声を統合的に理解・生成できるマルチモーダルモデル「H3」を発表しました。最大2K解像度で15秒のステレオ音声付き動画を生成可能で、近日中にモデルの重みを公開する予定です。

なぜ注目?

既存モデルと比較して高いコストパフォーマンスを実現しており、オープンソース化されれば、動画制作やコンテンツ開発におけるAI活用の選択肢が大きく広がる可能性があります。

公众号:数字生命卡兹克元記事へのリンクあり
参考

MiniMaxが動画生成AIモデルH3を公開へ 広告や動的エフェクトに特化

MiniMaxは、広告やVlog、ゲームUIなどの視覚効果生成に強みを持つ動画生成AIモデル「H3」の公開とオープンソース化を発表しました。高い指示追従性を備え、動的なコンテンツ制作の効率化が期待されます。

なぜ注目?

オープンソース化により、特定の業界向けに最適化された派生モデルの登場が予想され、クリエイティブ制作の現場におけるAI活用の幅が広がる可能性があります。

注目

ByteDanceが動画生成モデルSeedance 2.5を公開、最大30秒の生成と多角的な編集に対応

Seedance 2.5は一度の生成で最大30秒の動画作成が可能になり、画像や動画、音声などの多種多様な参照素材を用いた高度な編集をサポートします。即夢AIや豆包などのプラットフォームで順次提供され、今後はAPI経由での利用も予定されています。

なぜ注目?

動画生成の長尺化と参照素材の柔軟な活用により、広告やコンテンツ制作の効率が大幅に向上する可能性があります。日本国内でのAPI提供開始時には、業務フローへの組み込みを検討すべき技術です。

Google DeepMind:Blog(RSS)元記事へのリンクあり
参考

Google DeepMindが音楽生成モデルLyria 3.5をFlow Musicで提供開始

Google DeepMindは、音楽生成モデル「Lyria 3.5」をGoogle Flow Musicに導入しました。旋律の複雑さや歌詞の追従性、人声の表現力が向上し、より細かな創作制御が可能になりました。

なぜ注目?

生成AIによるコンテンツ制作の品質が向上しており、広告やエンターテインメント業界におけるクリエイティブ制作のワークフローに変化をもたらす可能性があります。

Midjourney:Updates(RSS)元記事へのリンクあり
注目

Midjourneyが画像生成モデル「V8.2」を公開、美学とパーソナライズ機能を強化

Midjourneyは最新モデル「V8.2」をリリースし、生成画像の品質向上とユーザーの美的嗜好への適応能力を強化しました。低品質な生成を抑制し、パーソナライズ設定の選択肢を拡充することで、より意図に近い画像生成が可能になります。

なぜ注目?

クリエイティブ制作において、ブランドのトーン&マナーに合わせた画像生成の精度が向上するため、広告やデザイン業務での実用性がさらに高まることが期待されます。

注目

動画生成AI「SANA-Video 2.0」発表、単一GPUで720p動画を効率的に生成

SANA-Video 2.0は、5Bおよび14Bのパラメータ規模を持つ混合型動画拡散Transformerです。線形とソフトマックスの注意機構を組み合わせることで、単一GPU環境での効率的な動画生成を実現しました。

なぜ注目?

高コストな計算リソースを必要とする動画生成において、単一GPUでの動作は中小規模の制作現場や個人クリエイターにとって導入のハードルを下げる重要な進歩です。

Black Forest Labs:Blog(网页)元記事へのリンクあり
参考

Black Forest Labsがマルチモーダルモデル「FLUX 3」の早期アクセスを開始

Black Forest Labsは、画像、動画、音声を統合的に学習する次世代マルチモーダルモデル「FLUX 3」を発表しました。世界を単一の表現として捉えることを目指したモデルで、現在早期アクセスが提供されています。

なぜ注目?

画像生成AIの分野で高い評価を得るFLUXシリーズの最新版であり、動画や音声との統合により、クリエイティブ制作のワークフローに大きな変革をもたらす可能性があります。

Qwen:Blog Retrieval(API)元記事へのリンクあり
注目

通義千問が画像生成モデル「Qwen-Image-3.0」を発表、実用性とテキスト描画精度を強化

「実」を追求した第3世代の画像生成モデルで、4.5kトークンの指示入力に対応し、複雑な情報を網羅したグリッドレイアウトの生成が可能です。12言語のテキストレンダリングに対応し、実務での活用を想定しています。

なぜ注目?

高精度なテキスト描画と長文指示への対応により、広告や資料作成など、ビジネス現場での画像生成AIの活用範囲がさらに広がる可能性があります。

公众号:昆仑万维(天工)元記事へのリンクあり
注目

昆仑万维が「世界モデル元年」を宣言、リアルタイム生成モデル等を発表

昆仑万维はWAICにて、世界モデル「Matrix-Game 3.5」や音楽生成モデルなどを発表しました。特にMatrix-Game 3.5は、単一GPUで20FPSのリアルタイム生成を実現しています。

なぜ注目?

動画やゲーム生成におけるリアルタイム性の向上は、エンターテインメントやシミュレーション分野でのAI活用を加速させる可能性があります。