SoranoruNEWS
TOPIC

AIエージェントの最新情報

自律実行、ツール連携、業務自動化の最新情報

Soranoru
NEWS FEED

全36件 · 2ページ目

公众号:小红书技术(dots.llm)元記事へのリンクあり
注目

小紅書が長期間のタスク実行に特化したAIモデル dots3-note Preview を公開

小紅書(Xiaohongshu)が開発した dots3-note Preview は、280Bのパラメータを持ちながら16Bの活性化パラメータで動作する軽量モデルです。512Kのコンテキストウィンドウを備え、テキスト・画像・音声のマルチモーダル理解と複雑な推論タスクに対応しています。

なぜ注目?

長期間の自律的なタスク実行(エージェント機能)に最適化されており、業務自動化や複雑なワークフローを構築する際の新たな選択肢として注目されます。

X:硅基流动 SiliconFlow (@SiliconFlowAI)元記事へのリンクあり
参考

DeepSeek V4 ProがSiliconFlowで提供開始、100万トークンのコンテキストに対応

SiliconFlowにてDeepSeek-V4-Pro-0813が利用可能となり、100万トークンのコンテキストウィンドウと3段階の推論強度を提供します。コーディングやツール呼び出し、AIエージェントのワークフローに最適化されており、MITライセンスで公開されています。

なぜ注目?

長大なコンテキスト処理とエージェント機能に特化したモデルが低価格で利用可能になることで、複雑な業務自動化や開発効率化の選択肢が広がります。

Cursor Blog元記事へのリンクあり
参考

CursorとSpaceXAIが共同開発したGrok 4.6がリリース

CursorとSpaceXAIが発表したGrok 4.6は、長時間のタスク実行や対話型の視覚処理能力を強化しました。プログラミングやナレッジワークのベンチマークで最高水準の性能を達成しています。

なぜ注目?

開発環境に統合されたAIモデルの性能向上は、エンジニアの生産性に直結します。最新モデルが既存のGPTシリーズと並ぶ性能を示したことで、開発ツールの選択肢として注視すべき論点です。

LMSYS:Blog(Chatbot Arena 团队)元記事へのリンクあり
注目

推論フレームワークSGLangがNVIDIA Nemotron 3.5 Lightningに即日対応

SGLangがNVIDIAの最新オープンモデル「Nemotron 3.5 Lightning」のサポートを開始しました。本モデルは100万トークンの長文脈に対応し、OpenAI互換API経由でAIエージェント開発に利用可能です。

なぜ注目?

高速な推論が可能な軽量モデルがAIエージェント開発の選択肢に加わることで、低遅延かつ高機能な自社AIサービスの構築が加速する可能性があります。

LMSYS:Blog(Chatbot Arena 团队)元記事へのリンクあり
注目

推論エンジンSGLangがMetaのマルチモーダルモデルMuse GlimmerにDay-0対応

SGLangがMeta Superintelligence Labsと連携し、エージェントワークフロー向けに最適化された30Bパラメータのマルチモーダルモデル「Muse Glimmer」をサポートしました。同モデルは128kトークン以上のコンテキストウィンドウを備えています。

なぜ注目?

ローカル環境でのエージェント実行性能が向上することで、機密性の高いデータを扱う業務でのAI活用や、長文脈を必要とする自動化プロセスの効率化が期待されます。

X:AI at Meta (@AIatMeta)元記事へのリンクあり
参考

Metaがローカル環境での常時稼働に最適化した30Bパラメータのオープンモデル「Muse Glimmer」を発表

Metaは、エージェントワークフロー向けに最適化されたオープンウェイトモデル「Muse Glimmer」を公開しました。消費電力やハードウェア要件を抑え、Macや高性能GPU搭載PCで動作するように設計されています。

なぜ注目?

クラウド依存を減らし、ローカル環境でセキュアかつ低遅延なAIエージェントを構築したい企業にとって、実用的な選択肢となる可能性があります。

注目

Scale AIが「Muse Spark 1.2」のオープンウェイト版公開を予告、エージェントモデルを拡充

Scale AIは、Muse Spark 1.2のオープンウェイト版を近日公開すると発表しました。同時に発表されたMuse Glimmerは24GBのVRAMで動作し、エージェントとしての信頼性を維持しています。

なぜ注目?

AI開発のインフラを支えるScale AIがモデル公開に注力することで、企業が自社環境で高度なAIエージェントを構築・運用するハードルが下がる可能性があります。

注目

ByteDanceが音動画全二重モデル「SeedRealtime」を発表、リアルタイム対話を実現

音声・動画・テキストを統合したアーキテクチャにより、見ながら・聞きながら・話すリアルタイム対話を実現しました。従来のモデルと比較して対話のテンポの遅延を半減させ、すでに「豆包(Doubao)」アプリで実装されています。

なぜ注目?

マルチモーダルな全二重対話技術が大規模に実用化されたことで、今後のAIエージェントにおける自然なユーザー体験の基準が大きく引き上げられる可能性があります。

NVIDIA Blog(RSS)元記事へのリンクあり
参考

NVIDIAが自動運転向けオープンモデル「Alpamayo 2 Super」を商用利用可能に

NVIDIAは自動運転やロボタクシー向けモデル「Alpamayo 2 Super」の商用利用を開始しました。軌道予測や因果推論、視覚的質問応答など多機能な出力をサポートしています。

なぜ注目?

自動運転技術の開発において、高度な推論能力を持つモデルが商用利用可能になることで、関連サービスの開発スピードが加速する可能性があります。

公众号:腾讯混元元記事へのリンクあり
参考

Tencentが次世代音声認識モデル「Hy ASR 3.0 preview」を発表

大規模言語モデルとMoEアーキテクチャを統合し、高精度な認識と文脈理解を実現した音声認識モデルです。中国語、英語、広東語で高い認識精度を誇り、文脈に応じた自動修正やノイズ環境下での利用にも対応しています。

なぜ注目?

文脈理解に優れた音声認識は、会議録作成やカスタマーサポートの自動化において業務効率を大幅に向上させる可能性があります。日本市場への展開状況を含め、高精度な多言語対応モデルの選択肢として注視すべき技術です。

Google DeepMind:Blog(RSS)元記事へのリンクあり
参考

Google DeepMindがロボット向け基盤モデルGemini Robotics ER 2を発表

動画理解やタスクの自動編成、複数ロボット間の連携能力を強化したロボット用基盤モデルです。現実世界での複雑な推論や協調作業の実行を可能にします。

なぜ注目?

AIがデジタル空間を超えて物理的な作業を自律的にこなす技術が進化しており、製造や物流現場における自動化の高度化が期待されます。

MarkTechPost(RSS)元記事へのリンクあり
参考

Microsoftがサイバーセキュリティ特化型モデルMAI-Cyber-1-Flashを発表

総パラメータ数137B、アクティブパラメータ数5BのMoEモデルで、CyberGymのMDASHスコアで95.95%を記録しました。MAI-Code-1-Flashをベースに微調された、256kのコンテキストウィンドウを持つモデルです。

なぜ注目?

セキュリティ運用における自動化の精度が向上しており、将来的に企業のセキュリティ監視や脅威分析の効率化に寄与する可能性があります。

X:Kimi.ai (@Kimi_Moonshot)元記事へのリンクあり
注目

Moonshot AIが最強モデルKimi K3を公開、2.8TパラメータのMoEモデルと技術レポートを発表

Moonshot AIは、2.8兆パラメータのMoEモデル「Kimi K3」の重みと技術レポートを公開しました。本モデルはネイティブな視覚理解と100万トークンのコンテキストウィンドウを備え、計算効率を大幅に向上させています。

なぜ注目?

高性能なMoEモデルと関連インフラがオープンソース化されたことで、企業が独自のAIエージェントや大規模な推論環境を構築する際の選択肢が広がります。

X:通义千问 / Qwen (@Alibaba_Qwen)元記事へのリンクあり
注目

Alibabaが最新TTSモデル「Qwen-Audio-3.0-TTS」を公開、業界最高性能を記録

リアルタイム対話向けのFlash版と高品質なPlus版の2種類を展開する音声合成モデルです。16言語に対応し、感情表現の制御や最大3分間の長文生成が可能です。

なぜ注目?

TTS性能の向上は、顧客対応AIやコンテンツ制作の効率化に直結します。特にリアルタイム性と表現力の両立は、日本市場におけるAI接客の質を大きく引き上げる可能性があります。

公众号:通义实验室(千问)元記事へのリンクあり
参考

通義実験室がリアルタイム音声合成モデル「Qwen-Audio-3.0-TTS」を発表

通義実験室は、低遅延の「Flash」版と高性能な「Plus」版からなる音声合成モデルを公開しました。16言語と20種類の方言に対応し、高い話者類似度とリアルタイム性を実現しています。

なぜ注目?

多言語対応の音声合成技術は、グローバルな顧客対応やコンテンツ制作の自動化において、日本企業にとっても活用が期待される技術です。

公众号:面壁智能(MiniCPM)元記事へのリンクあり
注目

面壁智能、具身知能モデル「MiniCPM-Robot」シリーズを発表

汎用VLAモデル「MiniCPM-RobotManip」と追跡モデル「MiniCPM-RobotTrack」からなる、具身知能(ロボティクス)向けの軽量モデルシリーズです。OpenBMBと共同で開発され、オープンソースとして提供されます。

なぜ注目?

ロボット制御に特化した軽量AIモデルの登場は、製造業や物流現場における自律型エージェントの実装コストを下げ、現場導入を促進する可能性があります。