微软一天连发3篇之:打造自己的Harness原生Agents
就在前几天抱抱脸 Daily Papers 上微软一口气挂出三篇论文——《LLMs Get Lost in Evolving User Intent》《Multi-Turn On-Policy Distillation with Prefix Replay》以及本篇主角OpenForge RL。[HarnessModel双引擎驱动的长程Agents最新综述]现在的 Agent 都跑在Claude Code、Codex、OpenClaw这类复杂 Harness 里但开源 SFT/RL 框架根本塞不进这些 Harness 去训练只能重新实现一个简化版OpenForge RL用一个轻量代理Proxy Kubernetes 编排器让任意 Harness × 任意环境都能直接接入标准 RL 代码库只用几百到几千个任务就把30B-A3B 和 8B模型训到了同尺寸开源模型的最前面。一、训练时一套脚手架部署时另一套今天的顶尖 Agent 早就不是”裸模型”了。它们被包裹在越来越复杂的推理 Harness里——Claude Code、Codex、OpenClaw 这些编排脚手架负责多轮交互、工具调用、上下文管理还连着 MCP Server、浏览器、GUI 等外部系统。论文直言近期 Agent 基准上的进步Harness 的功劳不亚于基座模型本身。Figure 1左——OpenForge RL 基于 Orchard Env把任意 Harness × 任意环境接入 veRL 等标准 RL 代码库消除训练-部署错配右——OpenForge 训练的模型在 6 种 Harness、6 个 Claw/GUI 环境上评测但问题来了开源社区想端到端改进这些 Agent面临两堵墙Harness 把推理变成了有状态、多进程的过程——嵌套工具调用、子 Agent、长程上下文开源训练栈veRL、slime 等原生表达不了。大家只能在训练时重新实现一个”简化版 Harness”于是产生train–deploy mismatch训练-部署错配。Harness rollout 需要容器化环境大量 CPU/内存无法和训练节点共置而大多数开源 RL 框架默认 rollout 在 trainer 本地跑。二、OpenForge RL 怎么做的Proxy 拦截 K8s 远程沙箱OpenForge RL 的核心思路是把训练和推理解耦靠两个轻量组件Figure 2OpenForge RL 架构总览轻量 Proxy包在推理服务器如 vLLM外面拦截 Harness 发出的所有模型调用路由给 RL 框架的推理引擎同时把每一对 prompt-responseio-pair记录为训练轨迹。rollout 结束后Proxy 收集终端奖励 把轨迹重构成标准样本 其中 通常 。重构出来的是标准 RL 样本格式所以后端用 GRPO、PPO 还是 REINFORCE 都行Harness 内部怎么折腾训练器完全不用管。Kubernetes 编排器基于 Orchard每个 rollout 在云上Microsoft Azure起一个独立远程容器弹性伸缩支持任意并发环境。三、数据从哪来五阶段自动合成流水线代码之外的第二个贡献是一条任务/环境自动合成流水线。原因很简单浏览器操作、桌面操作这些领域不像编程公开可用的 RL-ready 任务和环境少得可怜。流水线搭建在 Claude Agent SDK 上各模块由 Opus 4.6 驱动模仿人类策展任务的过程五个阶段Figure 3数据/任务合成流水线总览。Propose提案基于真实场景的参考资产池起草候选指令Claw 领域用 ClawHub 技能 ZClawBench 任务Computer-Use 用 X 搜索 API AgentNet 2.2 万条指令 Synthetic-Computer-Use 合成文件所有提案写入共享 SQLite 去重Prune剪枝从提案中挑出质量最高、最多样的 N 条Build构建为每条指令造出完整可执行环境——工具服务器、mock 网站、mock 数据、Dockerfile以及打分的 verifier 脚本Test测试让另一个开源模型Claw 用 MiniMax-M2.5Computer-Use 用 Kimi-K2.5实际跑一遍暴露环境缺陷和指令歧义Refine修复检查轨迹和 verifier 打分修补环境或改写指令循环直到通过。成本上有个务实的取舍SFT 任务的成功信号只做一次性过滤所以跳过 Test-Refine直接用 GPT-5.4 当 judgeRL 任务的 verifier 要被反复调用必须保留完整的测试-修复循环。平均下来合成一个 SFT 任务花 5.2 分钟 / 0.86 美元一个 RL 任务花 16.1 分钟 / 4.36 美元。最终的数据规模Table 1小得令人意外——几百到几千个任务ClawGUIComputerGUIBrowserHarnessReACT*、ZeroClaw、OpenClaw、CodexKimi-Agent*修改版Molmo-Web*修改版SFT 轨迹数8927951,496RL 任务数343252900Figure 4 三个领域 RL 任务的类别分布自上而下Claw、Computer-Use、Browser-Use训练配置Claw 线基座是Qwen3-30B-A3B-ThinkingSFT 从 MiniMax-M2.5 蒸馏每任务采样 3 条只留成功轨迹RL 从 SFT checkpoint 出发用 GRPObatch 8 × group 8单台 8×B200 节点GUI 线基座是Qwen3-VL-8B-ThinkingSFT 从 Kimi-K2.5 蒸馏浏览器环境用 Xvfb 虚拟显示 Browser-Use 远程浏览器服务GPT-4.1 做成功判定。四、实验结果同尺寸开源第一梯队GUI 越级打大模型4.1 Claw Agent日常工具使用在 ClawEval、QwenClawBench、MCPAtlas 三个基准上两个看点一是相对同尺寸基座14.3 → 31.7 pass³和 Qwen3-Coder 都有明显优势同尺寸~30B / 3B 激活开源模型里全面领先二是 RL 在 SFT 之上又带来一大截提升pass³ 21.7→31.7MCPAtlas 23.6→28.1证明”在真实 Harness 里在线交互学习”这件事本身有不可替代的价值——这是纯蒸馏拿不到的信号。4.2 GUI Agent8B 越级挑战8B 模型、只用 30 步对手普遍 50–100 步OSWorld-Verified 37.7 已经逼近 235B 的 Qwen3-VL38.1Online-Mind2Web 63.0 反超 Kimi K2.5 的 60.4——匹配甚至超越数倍于己的模型。Figure A1OpenForge-Claw 的 RL 训练曲线成功率稳步上升的同时轨迹在变短五、三个有意思的发现Harness 本身成了研究对象因为训练就在真实 Harness 里进行OpenForge RL 第一次让开源社区能系统地问”Harness 怎么塑造 Agent 行为”。发现一有些 Harness 天生难学同一个 OpenForge-Claw 模型在 ClawEval 上换四种 Harness 评测SFTRLpass1规律很直白能直接注册自定义工具的轻量 HarnessReACT、ZeroClaw学得最好OpenClaw 这种高度复杂、不支持自定义工具论文靠 SKILL.md 把工具暴露给它、prompt/context 还长得多的 HarnessSFTRL 的提升幅度明显更小。这给所有做 Harness 工程的人提了个醒工具和控制流不是越多越好和模型能力对齐的简单设计才是性能基础。发现二在一个 Harness 上训练能迁移到没见过的 Harness只用 ZeroClaw 训练在从未见过的 OpenClaw/Codex 上也能涨 3–5 分而混合三种 Harness 训练效果全面最好越复杂的 Harness 涨幅越大Codex 20.3连 ZeroClaw 本身都比单训更高48.5 vs 46.0。原因模型见到了更多样的工具调用语法和控制流鲁棒性随之增强。发现三RL 到底学会了什么Figure 5对比 SFT 与 SFTRL 各 100 条 ClawEval 轨迹Figure 5a ZeroClaw 下的工具使用分布。RL 把万能 shell 调用占比从 22.6% 压到 13.9%转而调用专用服务工具且轨迹略变短奖励只告诉模型”任务成没成功”从没教它用哪个工具——但 RL 自己学会了放下万能 shell、拿起专用工具。合理解释专用工具的参数 schema 和返回结构明确成功轨迹里更容易拿到 creditshell 自由度高但引号、路径、解析的错误会不断累积。Figure 5b Codex 下的行为画像雷达图SFT vs SFTRLRL 主要提升的是Agentic 可靠性自我验证写完再读回来确认、工具覆盖把任务需要的多个服务都调到、多步计划完成度。代价是步骤效率略降验证行为多花几步。最值得警惕的是错误恢复命令失败后诊断状态、另辟蹊径即使经过 RL 也只有 26 分仍是五项能力中最弱的——论文推测这类能力很难靠终端奖励的 RL 单独习得可能需要专门的数据或训练方法。附录GUI Agent 长什么样Figure A3 Computer-Use 的一个输入输出对——给定任务指令和当前截图模型单次生成推理 工具调用tool_call图中叠加了预测的归一化点击坐标Figure A4 Browser-Use 在 Online-Mind2Web 任务上的代表性一步Chromium 视口固定 1280×720坐标归一化到 [0,1]这篇论文的真正价值Harness从部署时的外围工程提升为可被训练、可被研究的一等公民Train where you deploy成为开源可选项。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】