SoranoruNEWS
NEWS ARCHIVE

AIニュース一覧

Soranoru
NEWS FEED

全107件 · 4ページ目

X:AI at Meta (@AIatMeta)元記事へのリンクあり
参考

Metaがローカル環境での常時稼働に最適化した30Bパラメータのオープンモデル「Muse Glimmer」を発表

Metaは、エージェントワークフロー向けに最適化されたオープンウェイトモデル「Muse Glimmer」を公開しました。消費電力やハードウェア要件を抑え、Macや高性能GPU搭載PCで動作するように設計されています。

なぜ注目?

クラウド依存を減らし、ローカル環境でセキュアかつ低遅延なAIエージェントを構築したい企業にとって、実用的な選択肢となる可能性があります。

注目

Scale AIが「Muse Spark 1.2」のオープンウェイト版公開を予告、エージェントモデルを拡充

Scale AIは、Muse Spark 1.2のオープンウェイト版を近日公開すると発表しました。同時に発表されたMuse Glimmerは24GBのVRAMで動作し、エージェントとしての信頼性を維持しています。

なぜ注目?

AI開発のインフラを支えるScale AIがモデル公開に注力することで、企業が自社環境で高度なAIエージェントを構築・運用するハードルが下がる可能性があります。

参考

OpenAI、セキュリティ研究者向け専用モデル「GPT-5.6-Cyber」を発表

OpenAIは、脆弱性の調査や検証、セキュリティテストに特化したモデル「GPT-5.6-Cyber」を公開しました。本モデルは「Daybreak Red」を通じて提供され、サイバー防御の迅速化を支援します。

なぜ注目?

セキュリティ対策の高度化が求められる中、専門的なAIツールが実務にどう活用できるか、今後の脆弱性管理のあり方として注視すべき動向です。

MarkTechPost(RSS)元記事へのリンクあり
注目

NVIDIAがオープンソースの全二重音声対話モデルNemotronLabs VoiceChat 11Bを公開

NVIDIAは、約450ミリ秒の低遅延で応答可能な全二重音声対話モデルを公開しました。対話中にリアルタイムでツール呼び出しが可能で、API実行中の沈黙を防ぐ工夫も実装されています。

なぜ注目?

オープンソースで高度な音声対話AIを構築できるため、自社サービスへの低遅延な音声インターフェース導入を検討する際の重要な選択肢となります。

IT之家(RSS)元記事へのリンクあり
参考

Googleが気象予測モデル「WeatherNext」を発表、ハリケーン予報を24時間前倒し

Google DeepMindが気象予測モデル「WeatherNext Cyclones」を発表しました。このモデルはハリケーンの経路や強度を予測する精度が高く、従来より平均して24時間早く予報を出すことが可能です。

なぜ注目?

AIによる高精度な気象予測は、物流やサプライチェーン管理など、気象リスクを抱えるあらゆる事業にとって重要な意思決定支援ツールとなる可能性があります。

NVIDIA Blog(RSS)元記事へのリンクあり
参考

NVIDIAが物理AIモデル Cosmos 3 を発表

NVIDIAは、視覚的推論、世界生成、動作予測を統合した物理AI基盤モデル「Cosmos 3」を公開しました。混合Transformerアーキテクチャを採用し、物理世界を理解するAIのフロンティアを押し広げます。

モデル AI評価 71
なぜ注目?

物理的な挙動を予測・生成する能力は、ロボティクスやシミュレーション分野の産業応用において、AIの精度と実用性を飛躍的に高める可能性があります。

MarkTechPost(RSS)元記事へのリンクあり
注目

NVIDIAが自動運転向けVLAモデル「Alpamayo 2 Super」を公開

NVIDIAは、自動運転の長尾事象に対応する340億パラメータの視覚・言語・動作(VLA)モデル「Alpamayo 2 Super」を発表しました。本モデルはOpenMDW-1.1ライセンスで公開され、商用利用が可能です。

なぜ注目?

自動運転技術の高度化に向けたオープンソースモデルの選択肢が広がることで、関連する開発コストの低減や技術革新が加速する可能性があります。

X:通义千问 / Qwen (@Alibaba_Qwen)元記事へのリンクあり
参考

Alibabaが画像生成AI「Qwen-Image-3.0-Pro」を公開、多言語対応と高精度な文字描画を実現

AlibabaのQwen Cloudにて、画像生成モデル「Qwen-Image-3.0-Pro」および「Standard」版が提供開始されました。最大4.5kトークンのプロンプトに対応し、12言語のサポートや高精度な文字レンダリング機能を備えています。

なぜ注目?

中国国内で高い評価を得ている画像生成モデルが利用可能となり、多言語対応や文字描画精度が向上したことで、グローバルなクリエイティブ業務における選択肢の一つとして注目されます。

X:OpenRouter (@OpenRouter)元記事へのリンクあり
参考

Black Forest Labsのマルチモーダルモデル「FLUX 3 Video」がOpenRouterで利用可能に

動画、音声、画像、動作予測を統合したマルチモーダルモデル「FLUX 3 Video」がOpenRouter上で公開されました。統一されたアーキテクチャにより、映画のような映像からクリエイティブな表現まで幅広く対応します。

なぜ注目?

API経由で最新の動画生成モデルを容易に組み込めるようになるため、映像制作やコンテンツ開発の効率化を検討する事業者にとって重要な選択肢となります。

注目

ByteDanceが音動画全二重モデル「SeedRealtime」を発表、リアルタイム対話を実現

音声・動画・テキストを統合したアーキテクチャにより、見ながら・聞きながら・話すリアルタイム対話を実現しました。従来のモデルと比較して対話のテンポの遅延を半減させ、すでに「豆包(Doubao)」アプリで実装されています。

なぜ注目?

マルチモーダルな全二重対話技術が大規模に実用化されたことで、今後のAIエージェントにおける自然なユーザー体験の基準が大きく引き上げられる可能性があります。

X:商汤 SenseTime (@SenseTime_AI)元記事へのリンクあり
参考

商湯(SenseTime)が推論と画像生成を統合したオープンソースモデル「SenseNova U1」を公開

SenseNova U1は、単一のプロンプトから構造化されたスライド資料を作成したり、段階的に図解コンテンツを生成したりすることが可能です。現在、SenseNova StudioやHuggingFace、GitHubで利用可能です。

なぜ注目?

推論と画像生成を統合したモデルは、資料作成やプレゼンテーションの自動化を効率化する可能性があり、今後の業務ツールへの応用が注目されます。

NVIDIA Blog(RSS)元記事へのリンクあり
参考

NVIDIAが自動運転向けオープンモデル「Alpamayo 2 Super」を商用利用可能に

NVIDIAは自動運転やロボタクシー向けモデル「Alpamayo 2 Super」の商用利用を開始しました。軌道予測や因果推論、視覚的質問応答など多機能な出力をサポートしています。

なぜ注目?

自動運転技術の開発において、高度な推論能力を持つモデルが商用利用可能になることで、関連サービスの開発スピードが加速する可能性があります。

公众号:腾讯混元元記事へのリンクあり
参考

Tencentが次世代音声認識モデル「Hy ASR 3.0 preview」を発表

大規模言語モデルとMoEアーキテクチャを統合し、高精度な認識と文脈理解を実現した音声認識モデルです。中国語、英語、広東語で高い認識精度を誇り、文脈に応じた自動修正やノイズ環境下での利用にも対応しています。

なぜ注目?

文脈理解に優れた音声認識は、会議録作成やカスタマーサポートの自動化において業務効率を大幅に向上させる可能性があります。日本市場への展開状況を含め、高精度な多言語対応モデルの選択肢として注視すべき技術です。

X:商汤 SenseTime (@SenseTime_AI)元記事へのリンクあり
参考

センスタイムが軽量マルチモーダルモデル「SenseNova U1.5-Lite-Preview」を公開

NEO-Unifyアーキテクチャを採用した8B-MoTパラメータの軽量モデルです。商用クローズドモデルに匹敵する生成・編集品質を実現しています。

なぜ注目?

軽量かつ高性能なオープンソースモデルの選択肢が増えることで、オンプレミス環境やエッジデバイスでのAI活用が加速する可能性があります。

公众号:MiniMax(稀宇科技)元記事へのリンクあり
注目

MiniMaxが動画生成モデル「H3」をオープンソース化:2K解像度と立体音響に対応

MiniMaxは、テキスト、画像、動画、音声を統合的に理解・生成できる次世代モデル「H3」を公開しました。最大2K解像度、15秒の動画生成に加え、32kHzのステレオ音声をネイティブで生成可能です。

なぜ注目?

高品質な動画と音声を同時に生成できるモデルの登場は、広告制作やコンテンツ制作のワークフローを効率化し、クリエイティブの質を大きく変える可能性があります。

Qwen:Blog Retrieval(API)元記事へのリンクあり
重要

Qwen 3.8-Max発表:2.4兆パラメータを誇る最強クラスのコーディング・協調AI

Qwenシリーズで最も強力な「Qwen 3.8-Max」が発表されました。2.4兆パラメータ(アクティブ950億)を擁し、Qwen-Maxクラスのモデルとして初めて重みが公開される予定です。

なぜ注目?

オープンソースとして最高峰の性能を持つモデルが利用可能になることで、企業は自社環境で高度なコーディング支援やAI協調システムを構築できる選択肢が広がります。

注目

マルチモーダル埋め込みモデル「UEmbed」:疎な表現と密な表現を単一パスで生成

UEmbedは、デコーダーのみの構造を採用したマルチモーダル埋め込みモデルです。単一の因果的フォワードパスで、単語レベルの疎な表現と密な表現を同時に生成し、情報ボトルネックを解消します。

なぜ注目?

検索やレコメンドシステムの精度向上に寄与する技術であり、将来的にマルチモーダル検索の効率化を検討する際の重要な選択肢となる可能性があります。

X:Artificial Analysis (@ArtificialAnlys)元記事へのリンクあり
注目

DeepSeekが新モデル「DeepSeek V4 Flash 0731」を公開、オープンソース上位にランクイン

DeepSeekは、Artificial Analysisの指標でスコア50を獲得し、オープンソースモデルの上位3位にランクインした「DeepSeek V4 Flash 0731」を公開しました。MITライセンスで提供され、総パラメータ数284B(アクティブ13B)の構成で、公式APIも利用可能です。

なぜ注目?

高性能なオープンソースモデルの選択肢が増えることで、自社環境でのAI導入やコスト最適化の検討材料として注目されます。

MiniMax:Blog(网页)元記事へのリンクあり
注目

MiniMaxが全能型マルチモーダルモデル「H3」を発表、2K動画生成とオープンソース化を予定

MiniMaxはテキスト、画像、動画、音声を統合的に理解・生成できるマルチモーダルモデル「H3」を発表しました。最大2K解像度で15秒のステレオ音声付き動画を生成可能で、近日中にモデルの重みを公開する予定です。

なぜ注目?

既存モデルと比較して高いコストパフォーマンスを実現しており、オープンソース化されれば、動画制作やコンテンツ開発におけるAI活用の選択肢が大きく広がる可能性があります。

公众号:数字生命卡兹克元記事へのリンクあり
参考

MiniMaxが動画生成AIモデルH3を公開へ 広告や動的エフェクトに特化

MiniMaxは、広告やVlog、ゲームUIなどの視覚効果生成に強みを持つ動画生成AIモデル「H3」の公開とオープンソース化を発表しました。高い指示追従性を備え、動的なコンテンツ制作の効率化が期待されます。

なぜ注目?

オープンソース化により、特定の業界向けに最適化された派生モデルの登場が予想され、クリエイティブ制作の現場におけるAI活用の幅が広がる可能性があります。