1.2 KiB
1.2 KiB
title, created, updated, type, tags, sources
| title | created | updated | type | tags | sources | ||||
|---|---|---|---|---|---|---|---|---|---|
| Agent 评估 (Agentic Evaluation) | 2026-07-13 | 2026-07-13 | concept |
|
|
Agent 评估
核心观察
传统 benchmark(MMLU、GPQA、HumanEval)趋于饱和,但 Agent 任务 benchmark(SWE-bench、WebArena、OSWorld、Terminal-Bench、TheAgentCompany)仍有巨大空间。这一分歧揭示了模型规模扩展无法独立填补 Agent 任务缺口。
关键 Benchmark
| Benchmark | 领域 | 评估重点 |
|---|---|---|
| SWE-bench | 软件工程 | 端到端 issue 修复 |
| WebArena | Web 交互 | 多步 web 任务 |
| OSWorld | 桌面操作 | 操作系统级任务 |
| Terminal-Bench | 命令行 | CLI 交互能力 |
| MCPWorld | 工具协议 | MCP 协议互操作 |
评估方法论转变
从"答案是否正确"→"组装的上下文是否能支撑多步任务完成"→"执行轨迹在长视界上是否稳定、可验证、可恢复"。
这是从静态 QA 评估到交互式多步任务完成评估的根本转变。