Files
myWiki/concepts/agent-native-training.md
2026-07-20 14:14:55 +08:00

53 lines
2.0 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
title: "Agent 原生训练 (Agent-Native Training)"
created: 2026-07-13
updated: 2026-07-13
type: concept
tags: [agent, training, rl, coevolution]
sources:
- arxiv:2606.20683
---
# Agent 原生训练
## 定义
Agent 工程第四范式Phase 4的第一方向。**Agent 原生训练**将 Agent 行为——规划、工具使用、验证、恢复——通过交互环境训练内化到模型参数中,而非完全依赖 prompt、workflow 或运行时编排。
## 两条子路径
### 1. 推理→行动行为的强化学习内化
通过 RL 训练将多步推理、行动选择和验证作为可训练行为:
- **DeepSeek-R1 / DAPO**:将推理和验证作为可训练行为而非纯 prompt 诱导
- **ProRL / WebRL / ComputerRL**:在接近部署的交互环境中训练 Agent减少 train-test mismatch
### 2. 训练-部署失配的缩小
在部署级环境中训练 Agent
- daVinci-Dev、Kimi-Dev在真实 dev 环境中训练编码 Agent
- Environment Tuning将任务环境本身作为可优化参数
## 内部化的分工转移
行为内部化的结果是分工转移而非消除脚手架:
| 之前(外部化) | 之后(部分内化) |
|--------------|---------------|
| 规划由 prompt 诱导 | 部分规划能力在参数中 |
| 工具使用依赖指令 | 工具使用模式通过学习获得 |
| 验证靠外部 checker | 部分验证直觉在模型内 |
更短视界的行为可移入模型参数,而运行时仍提供**环境访问、状态管理和安全控制**。
## 与 Phase 3 的关系
Phase 4 建立在 Phase 3[[harness-engineering|脚手架工程]])的可组合、多模型运行时之上。问题不再是"如何设计脚手架",而是"哪些行为值得内化到模型参数中、哪些应留在运行时、全栈如何安全地随时间改进"。
## 参考
- [[agent-harness-survey-2026|Agent Harness Survey (2026)]]
- [[model-harness-coevolution|模型-脚手架协同演化]]
- [[four-paradigms-agent-engineering|Agent 工程四范式]]
- [[harness-engineering|脚手架工程]]