LMSYSがBlackwellアーキテクチャ向け低精度強化学習手法を発表
要点:LMSYSチームは、Blackwellアーキテクチャ上でMXFP8およびNVFP4を用いた効率的な強化学習手法を実装しました。この手法により、精度を維持しつつ推論時間の短縮を実現しています。
日本の事業者にとって、なぜ重要?
次世代GPU環境におけるAIモデルの学習・推論コストを大幅に削減できる可能性があり、大規模モデルの運用効率化を目指す企業にとって重要な技術動向です。
元記事
Blog Towards Blackwell-Native 8-bit and 4-bit RL: End-to-End MXFP8 and NVFP4 RL in Miles TL;DR: We implemented two Blackwell-native RL recipes in Miles: end-to-end MXFP8 and per-token NVFP4 for MoE experts. Both are supported by fine-grained precision control across checkpoint conversion,… Ziang Li, humans& and Miles Team
元記事を読むAI評価
外部公開データの選定スコアです。評価元の掲載内容も確認できます。
選定元:AI HOT