53 lines
2.0 KiB
Markdown
53 lines
2.0 KiB
Markdown
---
|
||
title: "Agent 原生训练 (Agent-Native Training)"
|
||
created: 2026-07-13
|
||
updated: 2026-07-13
|
||
type: concept
|
||
tags: [agent, training, rl, coevolution]
|
||
sources:
|
||
- arxiv:2606.20683
|
||
---
|
||
|
||
# Agent 原生训练
|
||
|
||
## 定义
|
||
|
||
Agent 工程第四范式(Phase 4)的第一方向。**Agent 原生训练**将 Agent 行为——规划、工具使用、验证、恢复——通过交互环境训练内化到模型参数中,而非完全依赖 prompt、workflow 或运行时编排。
|
||
|
||
## 两条子路径
|
||
|
||
### 1. 推理→行动行为的强化学习内化
|
||
|
||
通过 RL 训练将多步推理、行动选择和验证作为可训练行为:
|
||
|
||
- **DeepSeek-R1 / DAPO**:将推理和验证作为可训练行为而非纯 prompt 诱导
|
||
- **ProRL / WebRL / ComputerRL**:在接近部署的交互环境中训练 Agent,减少 train-test mismatch
|
||
|
||
### 2. 训练-部署失配的缩小
|
||
|
||
在部署级环境中训练 Agent:
|
||
- daVinci-Dev、Kimi-Dev:在真实 dev 环境中训练编码 Agent
|
||
- Environment Tuning:将任务环境本身作为可优化参数
|
||
|
||
## 内部化的分工转移
|
||
|
||
行为内部化的结果是分工转移而非消除脚手架:
|
||
|
||
| 之前(外部化) | 之后(部分内化) |
|
||
|--------------|---------------|
|
||
| 规划由 prompt 诱导 | 部分规划能力在参数中 |
|
||
| 工具使用依赖指令 | 工具使用模式通过学习获得 |
|
||
| 验证靠外部 checker | 部分验证直觉在模型内 |
|
||
|
||
更短视界的行为可移入模型参数,而运行时仍提供**环境访问、状态管理和安全控制**。
|
||
|
||
## 与 Phase 3 的关系
|
||
|
||
Phase 4 建立在 Phase 3([[harness-engineering|脚手架工程]])的可组合、多模型运行时之上。问题不再是"如何设计脚手架",而是"哪些行为值得内化到模型参数中、哪些应留在运行时、全栈如何安全地随时间改进"。
|
||
|
||
## 参考
|
||
- [[agent-harness-survey-2026|Agent Harness Survey (2026)]]
|
||
- [[model-harness-coevolution|模型-脚手架协同演化]]
|
||
- [[four-paradigms-agent-engineering|Agent 工程四范式]]
|
||
- [[harness-engineering|脚手架工程]]
|