TAG
#AgentBench
为什么 Agent Eval 不能只看分数:从静态 Benchmark 到可执行任务
解释 Agent Eval 中对象、环境、证据与 oracle 如何共同限定一个分数可支持的结论,以及为何评测还应进入失败学习循环。
#agent-eval#benchmark#学习记录#HELM#AgentBench#SWE-bench#tau-bench
TAG
解释 Agent Eval 中对象、环境、证据与 oracle 如何共同限定一个分数可支持的结论,以及为何评测还应进入失败学习循环。