harness已成为影响AI智能体性能的关键因素之一。图片来源:Shutterstock

决定AI智能体性能上限的,不只有大语言模型(LLM)本身。围绕模型构建、负责工具调用、结果校验和长程任务推进的harness,正逐步成为新的关键竞争点。

据日本媒体Gigazine报道,AI软件开发商Earendil将智能体概括为“模型+harness”。ChatGPT、Claude等模型可以理解问题并生成答案,但如果要进一步完成网页检索最新信息、修改文件、验证计算结果,以及在出错后重试等任务,仍离不开独立执行环境的支撑。

Earendil将常见的harness能力归纳为四类。其一是系统提示词,用于规定模型的角色定位和行为原则;其二是工具,负责执行网页搜索、代码运行、邮件撰写等外部任务;其三是Agent Loop,负责在“执行任务—核验结果—决定下一步”之间循环推进;其四是转换层,用于适配不同厂商模型的调用方式和数据格式,打通OpenAI、Anthropic等厂商之间不同的接口规范。

Earendil开发的开源harness“Pi”,也基于这一思路构建。该框架支持在同一环境中切换使用多家AI厂商的模型,并可根据用户工作流对系统提示词、工具和扩展能力进行定制。Pi用户分享的扩展功能数量已超过5000个。

harness重要性的一个典型案例,来自NVIDIA的AI智能体系统AVO。AVO将Claude Opus 5与持续性记忆、工具使用和监督系统等组件结合,在ARC-AGI-3公开数据集中完成了25个环境、183个关卡的全部测试,取得100分成绩。NVIDIA表示,在长程任务中,记忆模块可保留前序结果,监督系统则可在反复失败时引导系统切换策略。

不过,这并不意味着可以将这一结果与Opus 5约30%的成绩简单对比,并据此得出harness将性能提升逾3倍的结论。NVIDIA也强调,两次评测条件并不相同,相关结果并非对harness效果的单独拆分测量。更重要的是,这一案例说明,仅看模型的单项基准测试,已难以准确评估真实智能体系统的能力。

AI智能体的竞争,已不再只是模型参数和能力的较量。harness如何管理记忆、开放哪些工具、在失败后如何恢复,以及如何在长程任务中持续推进任务,正成为影响实际表现的另一处关键战场。

关键词

#AI智能体 #大语言模型 #harness #Earendil #Pi #系统提示词 #工具 #Agent Loop #转换层 #NVIDIA AVO
版权所有 © DigitalToday。未经授权禁止转载或传播。