2.0 KiB
2.0 KiB
title, created, updated, type, tags, sources
| title | created | updated | type | tags | sources | |||||
|---|---|---|---|---|---|---|---|---|---|---|
| Agent 原生训练 (Agent-Native Training) | 2026-07-13 | 2026-07-13 | concept |
|
|
Agent 原生训练
定义
Agent 工程第四范式(Phase 4)的第一方向。Agent 原生训练将 Agent 行为——规划、工具使用、验证、恢复——通过交互环境训练内化到模型参数中,而非完全依赖 prompt、workflow 或运行时编排。
两条子路径
1. 推理→行动行为的强化学习内化
通过 RL 训练将多步推理、行动选择和验证作为可训练行为:
- DeepSeek-R1 / DAPO:将推理和验证作为可训练行为而非纯 prompt 诱导
- ProRL / WebRL / ComputerRL:在接近部署的交互环境中训练 Agent,减少 train-test mismatch
2. 训练-部署失配的缩小
在部署级环境中训练 Agent:
- daVinci-Dev、Kimi-Dev:在真实 dev 环境中训练编码 Agent
- Environment Tuning:将任务环境本身作为可优化参数
内部化的分工转移
行为内部化的结果是分工转移而非消除脚手架:
| 之前(外部化) | 之后(部分内化) |
|---|---|
| 规划由 prompt 诱导 | 部分规划能力在参数中 |
| 工具使用依赖指令 | 工具使用模式通过学习获得 |
| 验证靠外部 checker | 部分验证直觉在模型内 |
更短视界的行为可移入模型参数,而运行时仍提供环境访问、状态管理和安全控制。
与 Phase 3 的关系
Phase 4 建立在 Phase 3(harness-engineering)的可组合、多模型运行时之上。问题不再是"如何设计脚手架",而是"哪些行为值得内化到模型参数中、哪些应留在运行时、全栈如何安全地随时间改进"。