AGENT EVAL / BENCHMARK
从 0 到 1,
搭建可信的 Agent Eval 体系。
这里写 Agent Eval 里遇到的具体问题:指标怎么定、任务怎么设计、Grader 和 Harness 怎么写、怎么接进 CI/CD、出了问题怎么复盘。
开始阅读 →最新文章
全部文章 →为什么 Agent Eval 不能只看分数:从静态 Benchmark 到可执行任务
解释 Agent Eval 中对象、环境、证据与 oracle 如何共同限定一个分数可支持的结论,以及为何评测还应进入失败学习循环。
#agent-eval#benchmark#学习记录#HELM#AgentBench#SWE-bench#tau-bench
订阅入口(即将开放)
Newsletter 准备好后,这里会提供邮件订阅。现在可以先用 RSS 跟踪更新。
订阅 RSS →