スタンフォード大学らが科学研究ワークフロー評価用ベンチマーク「Terminal-Bench-Science 0.1」を公開
要点:生命科学や物理学など5分野から厳選された70のタスクを用い、AIエージェントの科学研究能力を評価するベンチマークが公開されました。研究開発の自動化におけるAIの適性を測定するための新たな指標となります。
日本の事業者にとって、なぜ重要?
AIエージェントが専門的な研究業務をどこまで代替できるかを客観的に評価する指標であり、将来的なR&D部門のAI導入や自動化戦略を検討する際の重要な判断材料となります。
元記事
终端-工作台-科学:在科学研究工作流中评估人工智能代理
元記事を読むAI評価
外部公開データの選定スコアです。評価元の掲載内容も確認できます。
選定元:AI HOT