SoranoruNEWS
TOPIC

画像生成AIの最新情報

画像生成・編集モデルとクリエイティブ活用

Soranoru
NEWS FEED

全42件 · 2ページ目

注目

異種モデル間の蒸留を可能にする新フレームワーク「Any-OPD」発表

異なるアーキテクチャを持つ流マッチングモデル間で、効率的な同策略蒸留を実現するフレームワーク「Any-OPD」が提案されました。DINOv2を活用して教師モデルと学生モデルを橋渡しすることで、パラメータ数を抑えつつ生成品質を大幅に向上させることが可能です。

なぜ注目?

生成AIモデルの軽量化と高性能化を両立させる技術として、リソース制約のある環境での画像生成AI導入を加速させる可能性があります。

注目

マルチモーダルAIの視覚とテキストの矛盾を評価する新ベンチマーク「SIGNPOST-Bench」

画像とテキストの間に意図的な矛盾を含ませた5,111の反事実グループと25,555の画像バリエーションからなる、マルチモーダルLLMの評価用ベンチマークです。モデルが視覚情報とテキスト情報のどちらを優先し、どう判断するかを検証します。

なぜ注目?

マルチモーダルAIの信頼性向上に不可欠な「情報の不整合への耐性」を測定できるため、高精度な画像認識や分析ツールを導入する際のモデル選定基準として注目されます。

公众号:MiniMax(稀宇科技)元記事へのリンクあり
注目

MiniMaxが動画生成モデル「H3」をオープンソース化:2K解像度と立体音響に対応

MiniMaxは、テキスト、画像、動画、音声を統合的に理解・生成できる次世代モデル「H3」を公開しました。最大2K解像度、15秒の動画生成に加え、32kHzのステレオ音声をネイティブで生成可能です。

なぜ注目?

高品質な動画と音声を同時に生成できるモデルの登場は、広告制作やコンテンツ制作のワークフローを効率化し、クリエイティブの質を大きく変える可能性があります。

公众号:卡尔的AI沃茨元記事へのリンクあり
注目

動画生成モデル「MiniMax H3」の実力:広告や動的コンテンツ制作での活用事例

MiniMax H3を用いた実証実験では、広告TVC、短編ドラマ、UIアニメーションなど幅広い用途での活用が確認されました。最大7000文字のプロンプトに対応し、画像や動画、音声を組み合わせた高度な生成が可能です。

なぜ注目?

実務レベルでの動画生成AIの活用範囲が広がっており、制作現場におけるコスト削減や表現の幅を広げるための具体的なツールとして注目されます。

MiniMax:Blog(网页)元記事へのリンクあり
注目

MiniMaxが全能型マルチモーダルモデル「H3」を発表、2K動画生成とオープンソース化を予定

MiniMaxはテキスト、画像、動画、音声を統合的に理解・生成できるマルチモーダルモデル「H3」を発表しました。最大2K解像度で15秒のステレオ音声付き動画を生成可能で、近日中にモデルの重みを公開する予定です。

なぜ注目?

既存モデルと比較して高いコストパフォーマンスを実現しており、オープンソース化されれば、動画制作やコンテンツ開発におけるAI活用の選択肢が大きく広がる可能性があります。

公众号:数字生命卡兹克元記事へのリンクあり
参考

MiniMaxが動画生成AIモデルH3を公開へ 広告や動的エフェクトに特化

MiniMaxは、広告やVlog、ゲームUIなどの視覚効果生成に強みを持つ動画生成AIモデル「H3」の公開とオープンソース化を発表しました。高い指示追従性を備え、動的なコンテンツ制作の効率化が期待されます。

なぜ注目?

オープンソース化により、特定の業界向けに最適化された派生モデルの登場が予想され、クリエイティブ制作の現場におけるAI活用の幅が広がる可能性があります。

X:Google AI (@GoogleAI)元記事へのリンクあり
参考

Google EarthがNano Banana 2を統合、テキストから地形や街並みを生成可能に

Google Earthのウェブ版に画像生成モデル「Nano Banana 2」が統合されました。ユーザーはテキストプロンプトを用いて、特定の場所の過去の景観や新しい施設を3D映像として視覚化できます。

なぜ注目?

都市計画や不動産開発、観光プロモーションにおいて、場所の変遷や将来のイメージを直感的に共有するための強力なツールとなる可能性があります。

注目

ByteDanceが動画生成モデルSeedance 2.5を公開、最大30秒の生成と多角的な編集に対応

Seedance 2.5は一度の生成で最大30秒の動画作成が可能になり、画像や動画、音声などの多種多様な参照素材を用いた高度な編集をサポートします。即夢AIや豆包などのプラットフォームで順次提供され、今後はAPI経由での利用も予定されています。

なぜ注目?

動画生成の長尺化と参照素材の柔軟な活用により、広告やコンテンツ制作の効率が大幅に向上する可能性があります。日本国内でのAPI提供開始時には、業務フローへの組み込みを検討すべき技術です。

注目

物理法則を言語化して世界をシミュレーションする新モデル「PhiZero」

PhiZeroは、動画から物理的な状態変化を離散的な「物理言語」として学習し、未来の挙動を推論する世界モデルです。推論後に拡散モデルで映像化する手法により、物理的に整合性の高い動画生成や動作シミュレーションを実現しました。

なぜ注目?

物理法則に基づいた高精度な動画生成技術は、製造業のシミュレーションやクリエイティブ制作における映像生成の品質を飛躍的に高める可能性を秘めています。

Google DeepMind:Blog(RSS)元記事へのリンクあり
参考

Google DeepMindが音楽生成モデルLyria 3.5をFlow Musicで提供開始

Google DeepMindは、音楽生成モデル「Lyria 3.5」をGoogle Flow Musicに導入しました。旋律の複雑さや歌詞の追従性、人声の表現力が向上し、より細かな創作制御が可能になりました。

なぜ注目?

生成AIによるコンテンツ制作の品質が向上しており、広告やエンターテインメント業界におけるクリエイティブ制作のワークフローに変化をもたらす可能性があります。

IT之家(RSS)元記事へのリンクあり
注目

xAIが米ミネソタ州のAI生成画像規制法を提訴、表現の自由を巡り対立

xAIは、同意のないAI生成のわいせつ画像を禁止し、高額な罰金を科すミネソタ州の新法に対し、憲法違反であるとして提訴しました。同社は、この法律が過度な制限であり、自社の画像生成機能「Grok Imagine」の運用に支障をきたすと主張しています。

なぜ注目?

AIによる画像生成の法的責任と表現の自由を巡る議論は世界的に加速しており、AIツールを提供する事業者にとって、各国の規制動向がビジネスモデルに与える影響を注視する必要があります。

X:Suno (@suno)元記事へのリンクあり
参考

音楽生成AIのSunoがアップデート、MIDI出力や画像からの楽曲生成に対応

音楽生成AIのSunoがウェブおよびモバイル版で新機能を公開しました。音源分離やMIDIエクスポート、画像からの楽曲生成、車載システムへの対応などが追加されています。

なぜ注目?

MIDI出力や画像生成機能の追加により、AI生成楽曲をDAWで編集するなどのクリエイティブなワークフローへの統合が加速し、制作現場での実用性が向上しています。

Midjourney:Updates(RSS)元記事へのリンクあり
注目

Midjourneyが画像生成モデル「V8.2」を公開、美学とパーソナライズ機能を強化

Midjourneyは最新モデル「V8.2」をリリースし、生成画像の品質向上とユーザーの美的嗜好への適応能力を強化しました。低品質な生成を抑制し、パーソナライズ設定の選択肢を拡充することで、より意図に近い画像生成が可能になります。

なぜ注目?

クリエイティブ制作において、ブランドのトーン&マナーに合わせた画像生成の精度が向上するため、広告やデザイン業務での実用性がさらに高まることが期待されます。

X:Runway (@runwayml)元記事へのリンクあり
参考

Runway Agentが自然言語によるワークフロー構築機能を導入

Runway Agent上で、ノードベースのワークフローを自然言語で構築・編集・実行できるようになりました。これにより、複雑な映像生成プロセスを大規模かつ効率的に自動化できます。

なぜ注目?

クリエイティブ制作現場において、専門的な操作スキルを問わずAIワークフローを構築できる点は、制作効率の劇的な向上につながる可能性があります。

注目

動画生成AI「SANA-Video 2.0」発表、単一GPUで720p動画を効率的に生成

SANA-Video 2.0は、5Bおよび14Bのパラメータ規模を持つ混合型動画拡散Transformerです。線形とソフトマックスの注意機構を組み合わせることで、単一GPU環境での効率的な動画生成を実現しました。

なぜ注目?

高コストな計算リソースを必要とする動画生成において、単一GPUでの動作は中小規模の制作現場や個人クリエイターにとって導入のハードルを下げる重要な進歩です。

Black Forest Labs:Blog(网页)元記事へのリンクあり
参考

Black Forest Labsがマルチモーダルモデル「FLUX 3」の早期アクセスを開始

Black Forest Labsは、画像、動画、音声を統合的に学習する次世代マルチモーダルモデル「FLUX 3」を発表しました。世界を単一の表現として捉えることを目指したモデルで、現在早期アクセスが提供されています。

なぜ注目?

画像生成AIの分野で高い評価を得るFLUXシリーズの最新版であり、動画や音声との統合により、クリエイティブ制作のワークフローに大きな変革をもたらす可能性があります。

公众号:卡尔的AI沃茨元記事へのリンクあり
参考

画像生成モデル「Qwen-Image-3.0」が登場、日本語長文や多図融合で高い性能を発揮

Qwen-Image-3.0は、最大4.5kトークンの入力や多言語対応、高度な画像編集機能を備えた画像生成モデル。実測テストでは、UIデザインや複雑な文字入れにおいてGPT Image2に匹敵する精度を示した。

なぜ注目?

日本語を含む多言語対応や正確な文字生成能力を持つモデルの選択肢が増えることで、国内の制作現場におけるクリエイティブ作業の効率化が期待されます。

注目

単体GPUで無限のインタラクティブ世界を生成する「ABot-World-0」発表

RTX 5090クラスのデスクトップGPUで動作する、動作条件付きのビデオ世界生成モデルです。長時間の自律的な生成におけるズレを抑え、リアルタイムな対話型環境を実現します。

なぜ注目?

高価なサーバー環境なしで高度なシミュレーションが可能になる可能性があり、ゲーム開発やVRコンテンツ制作の効率化に寄与する技術です。

Qwen:Blog Retrieval(API)元記事へのリンクあり
注目

通義千問が画像生成モデル「Qwen-Image-3.0」を発表、実用性とテキスト描画精度を強化

「実」を追求した第3世代の画像生成モデルで、4.5kトークンの指示入力に対応し、複雑な情報を網羅したグリッドレイアウトの生成が可能です。12言語のテキストレンダリングに対応し、実務での活用を想定しています。

なぜ注目?

高精度なテキスト描画と長文指示への対応により、広告や資料作成など、ビジネス現場での画像生成AIの活用範囲がさらに広がる可能性があります。

The Decoder:AI News(RSS)元記事へのリンクあり
注目

映画『第9地区』監督が全編AI生成の短編映画を公開、AI専門スタジオも設立

ニール・ブロムカンプ監督が、動画生成モデル「Seedance 2.0」を活用した13分のSFホラー短編『Nightborne』を公開しました。同監督は今後、同様の手法で長編映画の制作を目指すAI映画スタジオ「Barley Studios」を設立しています。

なぜ注目?

映像制作の現場において、AIが単なる補助ツールから主要な制作手段へと進化していることを示しており、コンテンツ制作のコスト構造や手法が根本から変わる可能性があります。