SoranoruNEWS
TOPIC

画像生成AIの最新情報

画像生成・編集モデルとクリエイティブ活用

Soranoru
NEWS FEED

全53件 · 1ページ目

公众号:生数科技(Vidu·视频)元記事へのリンクあり
参考

生数科技がVidu S2を発表:デジタルヒューマンと動画編集のリアルタイム生成モデル

生数科技は、デジタルヒューマンとの対話を実現する「Vidu S2-Avatar」と、動画ストリームのリアルタイム編集を行う「Vidu S2-Editing」を公開しました。さらに、VRヘッドセット向けの空間ビデオ生成と編集機能の探索も進めています。

なぜ注目?

リアルタイムでの動画編集や対話型アバター生成は、次世代のコンテンツ制作や顧客対応の効率を劇的に変える可能性があり、今後の技術動向を注視する必要があります。

Suno:Blog(网页)元記事へのリンクあり
参考

音楽生成AI「Suno」が次世代モデルv6を発表、3つのバージョンを展開

Sunoは音楽業界のパートナーと共同開発した新モデル「v6」を発表しました。フラッグシップ版のv6と実験的なv6-wildは有料会員向けに、高速なv6-miniは全ユーザー向けに提供されます。

なぜ注目?

音楽生成の品質と速度が向上することで、広告やコンテンツ制作におけるBGM生成の効率化と表現の幅がさらに広がることが期待されます。

X:Google AI (@GoogleAI)元記事へのリンクあり
参考

Googleが画像生成ツールGoogle Picsを公開、Nano Bananaモデルで高度な編集を実現

Googleは、Nano Bananaモデルを基盤とした画像生成ツール「Google Pics」を公開しました。部分的なオブジェクト編集やテキストの修正・翻訳、複数人での共同作業に対応しています。

なぜ注目?

直感的な編集機能と共同作業環境が提供されることで、マーケティングやデザイン業務における画像制作の効率化が期待されます。

Tripo(官方 X)元記事へのリンクあり
参考

TripoとGPT-6 Astraを組み合わせた3Dモデリングの最新ワークフロー

TripoやBlender MCP、GPT-6 Astraを活用し、AI主導で3Dキャラクターを生成する実例が公開されました。スクリーンショットと指示のみで形状やテクスチャの修正を自動化する高度な制作プロセスが示されています。

なぜ注目?

AIによる3D制作の自動化が進むことで、専門的なモデリングスキルがなくても短時間でキャラクター制作が可能になる可能性があり、制作コスト削減の観点から注目されます。

X:Suno (@suno)元記事へのリンクあり
参考

音楽生成AI「Suno v6」公開、画像や動画から楽曲制作が可能に

Sunoは最新モデル「v6」を公開し、画像や動画、音声メモを基にした楽曲生成に対応しました。既存の楽曲に対して詳細な編集を加える機能や、実験的な「v6-wild」モデルも提供されています。

なぜ注目?

マルチモーダルな入力から音楽を生成できるため、広告制作やコンテンツ制作におけるBGM調達の効率化や、クリエイティブの幅を広げるツールとして活用が期待されます。

Hugging Face:Blog(RSS)元記事へのリンクあり
参考

Hugging FaceがGradio WorkflowでAUTOMATIC1111の主要機能を再現

Hugging Faceは、73個のノードと11個のメディアパイプラインを用いてAUTOMATIC1111の主要機能を再現した「Workflow1111」を公開しました。画像生成から高解像度化、ControlNet風の処理、動画生成まで幅広い機能を網羅しています。

なぜ注目?

画像生成AIのワークフローを視覚的に構築・管理できる手法として、開発や制作現場におけるツール構築の柔軟性が高まる可能性があります。

OpenRouter:Announcements(RSS)元記事へのリンクあり
参考

動画生成モデルSeedance 2.5の性能と活用シーンをOpenRouterが解説

ByteDanceの動画生成モデル「Seedance 2.5」のAPI活用に関するレビューが公開されました。最大30秒の動画生成や、画像・音声入力による制御、首尾フレーム指定などの機能とコスト効率について解説しています。

なぜ注目?

動画生成AIの商用利用において、既存素材の活用や制御機能の重要性が高まっています。本モデルの特性を理解することで、映像制作のワークフロー効率化やコスト削減の検討材料となります。

OpenRouter:Announcements(RSS)元記事へのリンクあり
参考

OpenRouterがGeminiを用いた画像編集APIの活用ガイドを公開

OpenRouterは、Gemini 1.5 Flash(Nano Banana 2)を活用して画像とテキスト指示から編集を行うAPI実装チュートリアルを公開しました。PythonやTypeScriptでの実装例に加え、モデルの性能やコスト比較についても解説しています。

なぜ注目?

API経由で画像編集機能を自社サービスに組み込む際の具体的な実装手法として参考になります。モデルの切り替えが容易なため、コストと品質のバランスを最適化したい開発者にとって有益です。

X:OpenAI Developers (@OpenAIDevs)元記事へのリンクあり
参考

OpenAIがAPI向け画像生成モデル「GPT-Image-2.5 Flare」および「Sunburst」を発表

OpenAIはAPIを通じて、新たな画像生成モデル「Flare」と「Sunburst」の提供を開始しました。従来モデルと比較して細部の描写が鮮明になり、スタイルへの追従性や画像編集の制御機能が強化されています。

なぜ注目?

画像生成の品質と編集精度が向上したことで、広告制作やデザイン業務におけるAI活用の幅がさらに広がることが期待されます。

X:OpenAI (@OpenAI)元記事へのリンクあり
参考

ChatGPTの画像生成機能が「2.5」へアップデート、生成速度と編集精度が向上

OpenAIはChatGPTの画像生成機能を「2.5」にアップデートしました。生成速度の向上に加え、編集時の細部の一貫性維持や、コメントに基づいた部分的な修正機能が強化されています。

なぜ注目?

生成後の修正が容易になったことで、プロンプトの微調整にかかる工数を削減し、より意図に近いビジュアル制作を迅速に行えるようになります。

注目

OpenAIが画像生成モデル「ChatGPT Images 2.5」を発表、生成速度と精度が大幅向上

OpenAIは画像生成モデル「ChatGPT Images 2.5」を公開しました。前モデルと比較して生成遅延を最大50%削減し、細部の描写や編集精度、一貫性が強化されています。

なぜ注目?

生成速度の向上と編集精度の改善により、広告クリエイティブやデザイン業務におけるAI活用の効率化と品質向上が期待されます。

Google Blog:AI(RSS)元記事へのリンクあり
参考

Google Workspaceに画像生成・編集ツール「Google Pics」が登場

GoogleはWorkspace向けに画像生成・編集ツール「Google Pics」を発表しました。今後数週間以内に、Google AI ProおよびUltraのサブスクリプション契約者と、多くのWorkspace法人顧客向けに提供を開始します。

なぜ注目?

日常的に利用するGoogle Workspace内で直接画像生成や編集が可能になることで、資料作成やコンテンツ制作のワークフローが大幅に効率化される可能性があります。

Midjourney:Updates(RSS)元記事へのリンクあり
参考

Midjourneyが画像編集モデルV8.2のテストを開始、直感的な編集機能を強化

Midjourneyは、指示による編集や最大4枚の参照画像を用いた生成、局部重绘や拡張が可能なV8.2モデルのテストを開始しました。WebサイトおよびDiscordのコマンドから利用可能です。

なぜ注目?

画像生成の精度だけでなく、意図した通りの修正が容易になることで、クリエイティブ制作におけるワークフローの効率化が期待されます。

OpenRouter:Announcements(RSS)元記事へのリンクあり
参考

OpenRouterが動画生成APIを公開、単一のインターフェースで複数モデルに対応

OpenRouterは、SeedanceやVeo、Wanなどの主要な動画生成モデルを統一されたAPI経由で利用できる機能を公開しました。モデルの切り替えは識別子を変更するだけで行えるため、開発者は実装コストを抑えて最新の動画生成技術を導入できます。

なぜ注目?

動画生成モデルの進化が速い中、特定のモデルに依存せず柔軟に切り替え可能なAPI環境は、制作現場のワークフロー構築において有用な選択肢となります。

公众号:MiniMax(稀宇科技)元記事へのリンクあり
参考

MiniMaxが動画生成・編集AI「MiniMax Design」を発表

MiniMax Designは、多模態モデル「H3」を基盤とし、タスクの分解から素材処理、最終出力までを自動化するAIエージェントツールです。ComfyUIなどの外部ワークフローとの連携にも対応しています。

なぜ注目?

動画制作の工程をAIが自律的に判断・実行することで、広告やコンテンツ制作における作業効率の大幅な向上が期待されます。

X:Sky Computing Lab (@haoailab)元記事へのリンクあり
参考

Macで動画生成を高速化する「FastMetal」が登場、ローカル環境で5秒動画を30秒で生成

Apple Silicon搭載Mac上で動作する動画生成フレームワーク「FastMetal」が公開されました。CUDAやクラウド環境を必要とせず、最小3.9GBのメモリ消費で効率的な動画生成を実現します。

なぜ注目?

高価なGPUサーバーを介さず、手元のMacで動画生成が可能になることで、クリエイターや小規模事業者の制作コスト削減とワークフローの効率化に寄与する可能性があります。

蚂蚁 inclusionAI:GitHub 新仓库元記事へのリンクあり
参考

Ant GroupのinclusionAIが画像編集データ生成パイプライン「ConceptEdit」をオープンソース公開

ConceptEditは、VLMによる指示生成、FLUXによる編集、VQAによる評価の3段階で大規模な画像編集用データセットを構築するパイプラインです。単一および複数の概念に対応したデータ生成をサポートしています。

なぜ注目?

画像生成AIの微調整やデータセット構築の効率化に寄与する技術であり、独自の画像生成モデルや編集ツールを開発する事業者にとって、高品質な学習データ作成の参考となります。

IT之家(RSS)元記事へのリンクあり
参考

動画生成AI「LTX-2.5」が登場、10秒の720p動画を6.8秒で生成しComfyUIに統合

LTX社が発表した動画生成モデル「LTX-2.5」は、ComfyUIにネイティブ対応し、高速な生成性能を実現しました。一定規模以下の企業は無料で利用可能で、音声付き動画を低コストで生成できます。

なぜ注目?

動画生成の高速化とコスト低減が進むことで、広告やSNS向けコンテンツ制作の効率が大幅に向上する可能性があります。特にComfyUIとの親和性が高く、ワークフローへの組み込みが容易な点が実務上のメリットです。

X:Runway (@runwayml)元記事へのリンクあり
注目

Runwayの動画生成AI「Seedance 2.5」が公開、50種類のキャラクター参照に対応

Runwayの最新モデル「Seedance 2.5」がリリースされ、最大50種類のキャラクター参照が可能になりました。音楽と同期した最大30秒の動画生成をサポートしています。

なぜ注目?

キャラクターの一貫性を保った動画生成が可能になることで、広告制作やコンテンツ制作におけるキャラクター活用の幅が大きく広がります。

MarkTechPost(RSS)元記事へのリンクあり
注目

ComfyUI APIを活用したMiniMax-H3による動画・音声生成パイプラインの実装

ComfyUIを推論バックエンドとして利用し、MiniMax-H3モデルによる動画・音声生成ワークフローを構築する手法が公開されました。GUIを介さずPythonから直接実行し、GPUリソースに応じた最適化が可能です。

なぜ注目?

動画生成AIを自社システムや自動化パイプラインに組み込む際、既存のオープンソースツールを活用した効率的な実装手法として参考になります。