--- title: "Agent 原生训练 (Agent-Native Training)" created: 2026-07-13 updated: 2026-07-13 type: concept tags: [agent, training, rl, coevolution] sources: - arxiv:2606.20683 --- # Agent 原生训练 ## 定义 Agent 工程第四范式(Phase 4)的第一方向。**Agent 原生训练**将 Agent 行为——规划、工具使用、验证、恢复——通过交互环境训练内化到模型参数中,而非完全依赖 prompt、workflow 或运行时编排。 ## 两条子路径 ### 1. 推理→行动行为的强化学习内化 通过 RL 训练将多步推理、行动选择和验证作为可训练行为: - **DeepSeek-R1 / DAPO**:将推理和验证作为可训练行为而非纯 prompt 诱导 - **ProRL / WebRL / ComputerRL**:在接近部署的交互环境中训练 Agent,减少 train-test mismatch ### 2. 训练-部署失配的缩小 在部署级环境中训练 Agent: - daVinci-Dev、Kimi-Dev:在真实 dev 环境中训练编码 Agent - Environment Tuning:将任务环境本身作为可优化参数 ## 内部化的分工转移 行为内部化的结果是分工转移而非消除脚手架: | 之前(外部化) | 之后(部分内化) | |--------------|---------------| | 规划由 prompt 诱导 | 部分规划能力在参数中 | | 工具使用依赖指令 | 工具使用模式通过学习获得 | | 验证靠外部 checker | 部分验证直觉在模型内 | 更短视界的行为可移入模型参数,而运行时仍提供**环境访问、状态管理和安全控制**。 ## 与 Phase 3 的关系 Phase 4 建立在 Phase 3([[harness-engineering|脚手架工程]])的可组合、多模型运行时之上。问题不再是"如何设计脚手架",而是"哪些行为值得内化到模型参数中、哪些应留在运行时、全栈如何安全地随时间改进"。 ## 参考 - [[agent-harness-survey-2026|Agent Harness Survey (2026)]] - [[model-harness-coevolution|模型-脚手架协同演化]] - [[four-paradigms-agent-engineering|Agent 工程四范式]] - [[harness-engineering|脚手架工程]]