Ant GroupのLing-3.0-tinyとASystemが単体マシンでのエージェント型強化学習の閉ループを実現
要点:Ant GroupとASystemチームは、Ling-3.0-tinyモデルとARenoフレームワークを用い、単一マシン環境でエージェント型強化学習(Agentic RL)の学習サイクルを確立しました。井字棋を用いた検証では、GSPOアルゴリズムにより報酬の向上とトークン効率の改善を確認しています。
日本の事業者にとって、なぜ重要?
大規模な計算リソースを必要とせず、単体マシンでエージェントの学習・改善サイクルを回せる可能性を示しており、自社環境でのAIエージェント開発の効率化に向けた技術的知見として注目されます。
元記事
从跑起来到训起来:Ling-3.0-tiny × ASystem AReno,打通单机 Agentic RL 闭环
元記事を読むAI評価
外部公開データの選定スコアです。評価元の掲載内容も確認できます。
選定元:AI HOT