Files
myWiki/concepts/agent-native-training.md
2026-07-20 14:14:55 +08:00

2.0 KiB
Raw Blame History

title, created, updated, type, tags, sources
title created updated type tags sources
Agent 原生训练 (Agent-Native Training) 2026-07-13 2026-07-13 concept
agent
training
rl
coevolution
arxiv:2606.20683

Agent 原生训练

定义

Agent 工程第四范式Phase 4的第一方向。Agent 原生训练将 Agent 行为——规划、工具使用、验证、恢复——通过交互环境训练内化到模型参数中,而非完全依赖 prompt、workflow 或运行时编排。

两条子路径

1. 推理→行动行为的强化学习内化

通过 RL 训练将多步推理、行动选择和验证作为可训练行为:

  • DeepSeek-R1 / DAPO:将推理和验证作为可训练行为而非纯 prompt 诱导
  • ProRL / WebRL / ComputerRL:在接近部署的交互环境中训练 Agent减少 train-test mismatch

2. 训练-部署失配的缩小

在部署级环境中训练 Agent

  • daVinci-Dev、Kimi-Dev在真实 dev 环境中训练编码 Agent
  • Environment Tuning将任务环境本身作为可优化参数

内部化的分工转移

行为内部化的结果是分工转移而非消除脚手架:

之前(外部化) 之后(部分内化)
规划由 prompt 诱导 部分规划能力在参数中
工具使用依赖指令 工具使用模式通过学习获得
验证靠外部 checker 部分验证直觉在模型内

更短视界的行为可移入模型参数,而运行时仍提供环境访问、状态管理和安全控制

与 Phase 3 的关系

Phase 4 建立在 Phase 3harness-engineering)的可组合、多模型运行时之上。问题不再是"如何设计脚手架",而是"哪些行为值得内化到模型参数中、哪些应留在运行时、全栈如何安全地随时间改进"。

参考