微软。图片来源:Shutterstock

微软已在GitHub开源其Agent强化学习框架“Agent Lightning v1.0”。

据The News Stack近日报道,这一框架的设计重点并不在训练引擎本身,而是将上下文构建、工具执行以及Agent与环境之间的交互闭环,交由生产级Harness负责。

在这一架构下,训练引擎只需观察LLM与Harness之间的交互记录,无需在训练系统内部单独实现Agent执行工具、与环境交互等逻辑。

微软表示,在“适度的计算资源”条件下,仅使用6000条训练数据对Qwen3.5-9B进行强化学习训练,便将其在SWE-bench Verified基准测试中的成绩从41.8%提升至56.4%,提高了14.6个百分点。

报道称,传统方案通常由训练引擎接管完整的交互闭环,因此容易带来诸如重新分词、样本拼接、优势计算、损失归一化以及训练后端调度等问题。为解决这些痛点,微软还提供了面向编码Agent的数据清洗流水线,以及可复现实验的训练脚本。该框架核心Python代码约3500行,并以MIT许可证开源。

来自内布拉斯加的软件工程研究人员Rashid Hasan表示,直接基于真实生产Harness进行训练,有助于减少训练阶段与线上服务之间的不一致;工具协议、上下文策略以及恢复动作也可以原样保留,从而让训练收益更容易迁移到实际生产环境中。

科罗拉多的数据科学家Priyank Jain评价称,这一路径是在尝试消除机器学习领域历史最久、成本最高的问题之一,即训练与服务之间的偏差。他表示:“真正的关键成果,是让训练对象本身就是部署对象。”不过,他也担心,未来可能会有更多人在尚未充分理解奖励设计的情况下尝试强化学习。

ToolDex创始人Ria Banerjee则肯定了该框架代码规模较小这一点,认为基础设施工程师可以直接阅读代码并建立信任。但她同时指出,真正具备落地条件的团队,可能仍主要是拥有GPU和Kubernetes集群的平台团队;此外,Harness的每一次变更都会反映到模型权重中,因此Harness本身也需要纳入版本管理。

关键词

#微软 #Agent Lightning v1.0 #强化学习 #Agent #LLM #GitHub #开源 #SWE-bench Verified #Qwen3.5-9B #生产级Harness #MIT许可证
版权所有 © DigitalToday。未经授权禁止转载或传播。