This commit is contained in:
2026-07-20 14:14:55 +08:00
parent 24b006225b
commit ebb0e425ca
88 changed files with 3995 additions and 6 deletions

View File

@@ -0,0 +1,52 @@
---
title: "Agent 原生训练 (Agent-Native Training)"
created: 2026-07-13
updated: 2026-07-13
type: concept
tags: [agent, training, rl, coevolution]
sources:
- arxiv:2606.20683
---
# Agent 原生训练
## 定义
Agent 工程第四范式Phase 4的第一方向。**Agent 原生训练**将 Agent 行为——规划、工具使用、验证、恢复——通过交互环境训练内化到模型参数中,而非完全依赖 prompt、workflow 或运行时编排。
## 两条子路径
### 1. 推理→行动行为的强化学习内化
通过 RL 训练将多步推理、行动选择和验证作为可训练行为:
- **DeepSeek-R1 / DAPO**:将推理和验证作为可训练行为而非纯 prompt 诱导
- **ProRL / WebRL / ComputerRL**:在接近部署的交互环境中训练 Agent减少 train-test mismatch
### 2. 训练-部署失配的缩小
在部署级环境中训练 Agent
- daVinci-Dev、Kimi-Dev在真实 dev 环境中训练编码 Agent
- Environment Tuning将任务环境本身作为可优化参数
## 内部化的分工转移
行为内部化的结果是分工转移而非消除脚手架:
| 之前(外部化) | 之后(部分内化) |
|--------------|---------------|
| 规划由 prompt 诱导 | 部分规划能力在参数中 |
| 工具使用依赖指令 | 工具使用模式通过学习获得 |
| 验证靠外部 checker | 部分验证直觉在模型内 |
更短视界的行为可移入模型参数,而运行时仍提供**环境访问、状态管理和安全控制**。
## 与 Phase 3 的关系
Phase 4 建立在 Phase 3[[harness-engineering|脚手架工程]])的可组合、多模型运行时之上。问题不再是"如何设计脚手架",而是"哪些行为值得内化到模型参数中、哪些应留在运行时、全栈如何安全地随时间改进"。
## 参考
- [[agent-harness-survey-2026|Agent Harness Survey (2026)]]
- [[model-harness-coevolution|模型-脚手架协同演化]]
- [[four-paradigms-agent-engineering|Agent 工程四范式]]
- [[harness-engineering|脚手架工程]]