20260720
This commit is contained in:
35
concepts/agentic-evaluation.md
Normal file
35
concepts/agentic-evaluation.md
Normal file
@@ -0,0 +1,35 @@
|
||||
---
|
||||
title: "Agent 评估 (Agentic Evaluation)"
|
||||
created: 2026-07-13
|
||||
updated: 2026-07-13
|
||||
type: concept
|
||||
tags: [agent, evaluation, benchmarks]
|
||||
sources:
|
||||
- arxiv:2606.20683
|
||||
---
|
||||
|
||||
# Agent 评估
|
||||
|
||||
## 核心观察
|
||||
|
||||
传统 benchmark(MMLU、GPQA、HumanEval)趋于饱和,但 Agent 任务 benchmark(SWE-bench、WebArena、OSWorld、Terminal-Bench、TheAgentCompany)仍有巨大空间。**这一分歧揭示了模型规模扩展无法独立填补 Agent 任务缺口。**
|
||||
|
||||
## 关键 Benchmark
|
||||
|
||||
| Benchmark | 领域 | 评估重点 |
|
||||
|-----------|------|----------|
|
||||
| SWE-bench | 软件工程 | 端到端 issue 修复 |
|
||||
| WebArena | Web 交互 | 多步 web 任务 |
|
||||
| OSWorld | 桌面操作 | 操作系统级任务 |
|
||||
| Terminal-Bench | 命令行 | CLI 交互能力 |
|
||||
| MCPWorld | 工具协议 | MCP 协议互操作 |
|
||||
|
||||
## 评估方法论转变
|
||||
|
||||
从"答案是否正确"→"组装的上下文是否能支撑多步任务完成"→"执行轨迹在长视界上是否稳定、可验证、可恢复"。
|
||||
|
||||
这是从**静态 QA 评估到交互式多步任务完成评估**的根本转变。
|
||||
|
||||
## 参考
|
||||
- [[agent-harness-survey-2026|Agent Harness Survey (2026)]]
|
||||
- [[harness-engineering|脚手架工程]]
|
||||
Reference in New Issue
Block a user