頭條 · 框架與項目
Microsoft Agent Lightning v1.0 讓正式環境的 harness 主導訓練迴圈,訓練系統退到旁邊觀察——只用 6000 筆資料,就把 SWE-bench 分數拉高了 14.6 個百分點。
Chris Vale
·
2026年09月05日
2026 年 8 月 17 日,Microsoft Research 釋出 Agent Lightning v1.0,這是一套開源的 強化學習(RL)框架,處理的是 agent 開發裡一個長期存在、卻很少被直接點名的痛點:你拿來訓練 agent 的環境,跟你實際部署 agent 的環境,往往是兩套完全不同的東西。這個落差有個名字,叫 train-serve mismatch(訓練與部署不一致),而 Agent Lightning v1.0 的核心主張很直白——與其每次訓練都得把正式環境的邏輯重新兜一遍塞進訓練框架,不如讓正式環境的「外殼」(harness)直接主導整個互動迴圈,訓練系統退到旁邊,只負責觀察跟優化。問題出在「誰擁有這個迴圈」傳統的 agentic RL...