Thinking Machinesが軽量モデルInkling-Smallを公開、276Bパラメータで従来と同等の性能を実現
Thinking Machinesは、従来モデルの4分の1の規模となる276Bパラメータの「Inkling-Small」を公開しました。アクティブパラメータは12Bで、フルウェイトがオープンソースとして提供されます。
推論コストを抑えつつ高性能なモデルを利用できる可能性があり、自社環境でのAI導入や微調整を検討する事業者にとって選択肢の一つとなります。
Thinking Machinesは、従来モデルの4分の1の規模となる276Bパラメータの「Inkling-Small」を公開しました。アクティブパラメータは12Bで、フルウェイトがオープンソースとして提供されます。
推論コストを抑えつつ高性能なモデルを利用できる可能性があり、自社環境でのAI導入や微調整を検討する事業者にとって選択肢の一つとなります。
Seedance 2.5は一度の生成で最大30秒の動画作成が可能になり、画像や動画、音声などの多種多様な参照素材を用いた高度な編集をサポートします。即夢AIや豆包などのプラットフォームで順次提供され、今後はAPI経由での利用も予定されています。
動画生成の長尺化と参照素材の柔軟な活用により、広告やコンテンツ制作の効率が大幅に向上する可能性があります。日本国内でのAPI提供開始時には、業務フローへの組み込みを検討すべき技術です。
動画理解やタスクの自動編成、複数ロボット間の連携能力を強化したロボット用基盤モデルです。現実世界での複雑な推論や協調作業の実行を可能にします。
AIがデジタル空間を超えて物理的な作業を自律的にこなす技術が進化しており、製造や物流現場における自動化の高度化が期待されます。
OpenAIはGPT-5.6のLunaおよびTerraモデルの価格を改定し、企業が大規模なAIワークフローをより効率的に展開できるよう支援します。
モデルの価格性能比の向上は、AI導入を検討する企業にとって運用コストの最適化に直結する重要な指標となります。
Google DeepMindは、音楽生成モデル「Lyria 3.5」をGoogle Flow Musicに導入しました。旋律の複雑さや歌詞の追従性、人声の表現力が向上し、より細かな創作制御が可能になりました。
生成AIによるコンテンツ制作の品質が向上しており、広告やエンターテインメント業界におけるクリエイティブ制作のワークフローに変化をもたらす可能性があります。
低遅延のリアルタイム処理に特化した「GPT-Live-Transcribe」と、バッチ処理に最適化された「GPT-Transcribe」の2モデルがAPIに追加されました。専門用語や背景雑音への対応力が向上し、より高精度な文字起こしが可能になります。
音声データの活用精度が向上することで、カスタマーサポートや議事録作成などの業務効率化を検討する企業にとって実用的な選択肢となります。
総パラメータ数137B、アクティブパラメータ数5BのMoEモデルで、CyberGymのMDASHスコアで95.95%を記録しました。MAI-Code-1-Flashをベースに微調された、256kのコンテキストウィンドウを持つモデルです。
セキュリティ運用における自動化の精度が向上しており、将来的に企業のセキュリティ監視や脅威分析の効率化に寄与する可能性があります。
Feyn Labsが開発した「FeyNoBg」は、BiRefNetアーキテクチャをベースにパラメータを最適化した自動背景削除モデルです。8つのベンチマークのうち4つで最高スコアを記録し、関連するトレーニングライブラリ「NoBg」もオープンソースとして公開されました。
画像編集やクリエイティブ制作の自動化において、高精度な背景削除は業務効率に直結します。オープンソースで提供されているため、自社システムへの組み込みやカスタマイズを検討する際の有力な選択肢となります。
Moonshot AIは、2.8兆パラメータのMoEモデル「Kimi K3」の重みと技術レポートを公開しました。本モデルはネイティブな視覚理解と100万トークンのコンテキストウィンドウを備え、計算効率を大幅に向上させています。
高性能なMoEモデルと関連インフラがオープンソース化されたことで、企業が独自のAIエージェントや大規模な推論環境を構築する際の選択肢が広がります。
Midjourneyは最新モデル「V8.2」をリリースし、生成画像の品質向上とユーザーの美的嗜好への適応能力を強化しました。低品質な生成を抑制し、パーソナライズ設定の選択肢を拡充することで、より意図に近い画像生成が可能になります。
クリエイティブ制作において、ブランドのトーン&マナーに合わせた画像生成の精度が向上するため、広告やデザイン業務での実用性がさらに高まることが期待されます。
Claude Opus 5は、前世代のOpus 4.8と比較して性能が2倍以上に向上し、ARC-AGI 3では他モデルを圧倒するスコアを記録しました。本モデルはClaude MaxのデフォルトおよびClaude Proの最上位モデルとして提供されます。
最高性能モデルのコストが半減したことで、高度なAI活用を検討する企業にとって、業務効率化や開発コスト削減の選択肢が大きく広がります。
リアルタイム対話向けのFlash版と高品質なPlus版の2種類を展開する音声合成モデルです。16言語に対応し、感情表現の制御や最大3分間の長文生成が可能です。
TTS性能の向上は、顧客対応AIやコンテンツ制作の効率化に直結します。特にリアルタイム性と表現力の両立は、日本市場におけるAI接客の質を大きく引き上げる可能性があります。
Googleは、高性能モデル「Gemini 3.6 Flash」と軽量モデル「Gemini 3.5 Flash-Lite」を正式リリースしました。3.6 Flashは複雑なエージェントタスクやマルチモーダル処理を強化し、コスト削減と100万トークンのコンテキストウィンドウに対応しています。
低コストかつ高性能なモデルの選択肢が増えることで、企業はAIエージェントや大規模なデータ処理をより経済的に実装できるようになります。
Cactusは、生成した回答に対して0から1の信頼度スコアを付与する「Cactus Hybrid」を公開しました。信頼度が低い場合に自動でより大規模なモデルへ切り替える仕組みを備えています。
デバイス上での推論効率と精度のバランスを最適化できるため、コストを抑えつつ信頼性の高いAIアプリケーションを構築したい開発者にとって重要な選択肢となります。
SANA-Video 2.0は、5Bおよび14Bのパラメータ規模を持つ混合型動画拡散Transformerです。線形とソフトマックスの注意機構を組み合わせることで、単一GPU環境での効率的な動画生成を実現しました。
高コストな計算リソースを必要とする動画生成において、単一GPUでの動作は中小規模の制作現場や個人クリエイターにとって導入のハードルを下げる重要な進歩です。
Black Forest Labsは、画像、動画、音声を統合的に学習する次世代マルチモーダルモデル「FLUX 3」を発表しました。世界を単一の表現として捉えることを目指したモデルで、現在早期アクセスが提供されています。
画像生成AIの分野で高い評価を得るFLUXシリーズの最新版であり、動画や音声との統合により、クリエイティブ制作のワークフローに大きな変革をもたらす可能性があります。
Google DeepMindは、主力モデル「Gemini 3.6 Flash」、低コスト・高効率な「3.5 Flash-Lite」、サイバーセキュリティ特化型の「3.5 Flash Cyber」の3モデルを公開しました。これらはGoogle AI開発者プラットフォームを通じてAPIで利用可能です。
用途に応じたモデルの使い分けが可能になることで、コスト最適化やセキュリティ対策など、ビジネス現場でのAI導入の柔軟性が高まる可能性があります。
小紅書の「dots-note 3.0」モデルが、第67回国際数学オリンピック(IMO 2026)の問題で満点を記録しました。形式言語に頼らず、LaTeX形式の課題を直接読み取り、自己批判プロセスを経て解法を導き出す能力が証明されました。
AIの論理的推論能力が人間トップレベルに達したことを示す事例であり、高度な推論を要する業務へのAI活用可能性を広げる技術として注目されます。
「実」を追求した第3世代の画像生成モデルで、4.5kトークンの指示入力に対応し、複雑な情報を網羅したグリッドレイアウトの生成が可能です。12言語のテキストレンダリングに対応し、実務での活用を想定しています。
高精度なテキスト描画と長文指示への対応により、広告や資料作成など、ビジネス現場での画像生成AIの活用範囲がさらに広がる可能性があります。
NVIDIAは、40億パラメータのオープンソース世界モデル「Cosmos 3 Edge」をHugging Faceで公開しました。エッジデバイス上でのリアルタイムな環境理解や動作生成を目的としています。
エッジAIやロボティクス分野でのリアルタイム推論が加速する可能性があり、製造業や物流現場での自律型AI活用における重要な技術基盤となるでしょう。