69 lines
3.8 KiB
Markdown
69 lines
3.8 KiB
Markdown
---
|
||
title: "Agent Harness Survey — From QA to Task Completion (2026)"
|
||
created: 2026-07-13
|
||
updated: 2026-07-13
|
||
type: paper
|
||
tags: [agent, harness, survey, agent-engineering, execution-harness]
|
||
sources:
|
||
- https://arxiv.org/abs/2606.20683
|
||
- https://github.com/ggjy/Awesome-Agent-Engineering
|
||
---
|
||
|
||
# Agent Harness Survey — From QA to Task Completion
|
||
|
||
## 中文摘要
|
||
|
||
LLM Agent 正从被动问答转向主动任务完成。这篇综述通过 **模型-脚手架(Model-Harness)透镜** 审视整个 Agent 系统:模型提供认知引擎,而执行脚手架(execution harness)决定系统能观察什么、如何行动、状态如何持久、错误如何检测和恢复。
|
||
|
||
核心论点:Agent 质量(成功率、效率、安全性、泛化能力)**不取决于模型能力本身**,而取决于模型能力、运行时基础设施、任务结构和评估设计四者之间的交互。
|
||
|
||
## 核心问题
|
||
|
||
> 模型规模扩展能否填补 Agent 任务上的性能缺口?答案是不能——瓶颈正在从模型推理能力向脚手架设计转移。
|
||
|
||
传统 benchmark(MMLU、GPQA、HumanEval)趋于饱和,而 Agent 任务的 benchmark(SWE-bench、WebArena、OSWorld、Terminal-Bench)仍有巨大空间。这说明**脚手架设计是 Agent 性能的关键杠杆**。
|
||
|
||
## 四个工程范式演化
|
||
|
||
1. **[[prompt-engineering|提示工程]]** → 解决"如何提问"的表达问题,不解决信息问题
|
||
2. **[[context-engineering|上下文工程]]** → 从静态 prompt 到动态组装的信息生命周期管理(RAG、记忆、工具定义)
|
||
3. **[[harness-engineering|脚手架工程]]** → 闭环执行:观测→决策→行动→验证→恢复,六组件运行时
|
||
4. **[[agent-native-training|Agent 原生训练]]** → 规划/工具使用/验证内部化为模型参数,模型-脚手架协同演化
|
||
|
||
## 脚手架六组件解耦
|
||
|
||
形式化定义:**A_LLM = ⟨M, H⟩ = ⟨M, I_obs, C, L, I_act, S, V⟩**
|
||
|
||
| 组件 | 职责 | 核心权衡 |
|
||
|------|------|----------|
|
||
| [[observation-interface|I_obs 观测接口]] | 环境信号→模型可读形式 | 丰富性 vs. 可处理性 |
|
||
| [[context-manager|C 上下文管理]] | 动态选择/压缩/刷新上下文信息 | 保真度 vs. 可管理性 |
|
||
| [[control-loop|L 控制循环]] | 编排执行步骤、委托、终止 | 适应性 vs. 稳定性 |
|
||
| [[action-interface|I_act 行动接口]] | 模型输出→可执行操作 | 灵活性 vs. 可控性 |
|
||
| [[state-artifact-store|S 状态/产物存储]] | 跨步骤/跨会话持久化 | 完整性 vs. 可用性 |
|
||
| [[verification-governance|V 验证与治理]] | 检查、约束、修复执行 | 自主性 vs. 鲁棒性 |
|
||
|
||
这六个组件是 [[cross-layer-interaction|耦合系统]],而非独立模块——优化某一层可能把风险转移到其他层。
|
||
|
||
## 关键洞察
|
||
|
||
1. **Agent ≠ 模型 + 工具**:可靠的长期任务完成依赖于可组合、可优化的多模型运行时
|
||
2. **脚手架正在成为可学习对象**([[learnable-harness|可学习脚手架]]):NLAH、Meta-Harness、AHE 把运行时策略本身作为优化目标
|
||
3. **多模型脚手架**([[multi-model-harness|多模型脚手架]]):不同模型负责规划/编码/验证/检索等不同角色
|
||
4. **模型-脚手架协同演化**([[model-harness-coevolution|模型-脚手架协同演化]]):部署过程中模型、脚手架、改进策略三者联合更新
|
||
|
||
## 相关概念
|
||
|
||
- [[execution-harness|执行脚手架]]
|
||
- [[agent-harness|Agent 脚手架]]
|
||
- [[four-paradigms-agent-engineering|Agent 工程四范式]]
|
||
- [[harness-six-components|脚手架六组件模型]]
|
||
- [[harness-task-mapping|脚手架-任务映射]]
|
||
- [[agentic-evaluation|Agent 评估]]
|
||
|
||
## 来源
|
||
|
||
- [原始存档](raw/papers/agent-harness-survey-2026.md)
|
||
- arXiv: https://arxiv.org/abs/2606.20683
|
||
- Awesome Agent Engineering: https://github.com/ggjy/Awesome-Agent-Engineering
|