Interview AiBoxInterview AiBox 实时 AI 助手,让你自信应答每一场面试
Agent 评估面试:测试全绿,为什么重试后还是错了?
用工具调用超时的具体案例准备 Agent 评估面试:检查实际结果、重复执行与多次试验,避免把模型说“完成了”当成成功。
- sellAI 洞察
- sell面试技巧

Agent 说“已完成”,你打开数据库,却发现同一项操作执行了两次。Agent 评估要检查实际结果,不能只给最后一句话打分。 Anthropic 在 2026 年 1 月的评估指南中区分了执行轨迹与最终状态。下面是我们设计的重试练习,不是某家公司公开的面试原题。
把评估拆成任务、轨迹、状态和判断
可以把评估拆成四层。第一层是任务合同,明确什么结果算完成;第二层看执行轨迹,包括工具选择、调用顺序和多余调用;第三层检查运行后的文件、数据和权限状态;第四层由人判断测试无法表达的工程取舍。回答时把四层连起来,比只报一个 benchmark 分数更有说服力。
评估器意见不一致时怎么处理
让不同评估器形成有用的分歧。代码评估器负责可确定的事实,例如失败测试是否变绿;模型评估器负责解释质量和范围控制;人工抽样处理边界情况。还要说清楚如何调查分歧:如果模型评估器认为完成,但集成测试失败,就以可执行结果为准,并把这次分歧沉淀成回归样例。
用失败证据讲清楚改进方案
面试中被问到如何改进 Agent 时,先拿出一条失败回执,不要先罗列功能。依次说明观察到的行为、被破坏的不变量、能复现问题的最小测试,以及准备增加的边界。这样你的推理可审计,也能在压力下保持答案具体。
推演:创建工单超时,到底要不要重试?
设定一个虚构练习:编程 Agent 修完 bug 后创建跟踪工单。服务端已经写入记录,但响应在网络中丢失,Agent 只看到超时,于是再创建一次。请使用测试环境,不要为了练习在真实工单系统制造重复数据。
先定义成功,再看执行轨迹
本次任务的成功条件是:一个逻辑任务只对应一张工单,工单关联正确补丁,其他记录没有被修改。如果无法确认结果,Agent 必须说明不确定性。不要要求每次都走固定的读文件顺序;只要行为和权限边界正确,合理的不同路径应该被接受。
给逻辑操作分配标识,记录每次尝试前后的服务端状态。确定性检查负责数工单、核对补丁关联和重试身份。文本评估器可以检查最终说明是否诚实,却不能因为模型写得流畅,就把数据库里的两条记录判成一条。
专门测试最容易含糊的时间点
准备三种情况:写入前失败、写入后但确认前失败、正常成功。第二种才是无脑重试的陷阱。可讨论服务端幂等键,或接口提供的操作状态查询;仅凭标题搜索不够可靠,因为标题可能重复。如果接口两者都不支持,自动重试就应该停下来,先暴露结果不确定的状态。
还要区分:是服务端真正拦住重复写入,还是这一次 Agent 恰好没有重复?前者是机制保证,后者只是一次行为结果。每轮测试都要重置环境,否则上一轮遗留的工单可能让失败运行看起来成功。
面试官追问“十次过九次”,怎么接?
你可以先说:“我会在服务端提交后注入超时,再验证最终只存在一张工单。同一场景重复运行,完整记录分母和失败状态。发布条件包含不重复写入,不能只看平均分。”
接下来明确能力和稳定性的区别:一次成功说明存在成功路径,多次试验才有助于观察可靠性。小样本不能直接换算成生产故障率。哪怕整体平均分提高,少量会产生危险副作用的失败仍然可能阻止发布。
练习时请同伴改变故障发生时间,让你根据证据判断:哪些已经确定,哪些仍然未知,是否还能安全地写一次。能接住这个追问,比背熟“多种评估器结合”更有用。
常见问题
Agent 评估可以替代单元测试吗?
不可以。单元测试只是评估器之一,无法单独衡量工具选择、权限范围和失败恢复。
什么是轨迹评估器?
它评估 Agent 的动作序列,包括工具调用、重试和中间状态,而不只看最后的文字或补丁。
面试中怎么讲 benchmark 分数?
先交代环境、任务分布和盲区,再说明对产品真正有价值的本地回放是什么。
参考来源
下一步
接着阅读LLM 评估工程师岗位指南。练习时可以把自己的案例整理进 Interview AiBox 面试档案,但工具不会自动替你核实项目成果。
Interview AiBoxInterview AiBox — 面试搭档
不只是准备,更是实时陪练
Interview AiBox 在面试过程中提供实时屏幕提示、AI 模拟面试和智能复盘,让你每一次回答都更有信心。
AI 助读
一键发送到常用 AI
智能总结
深度解读
考点定位
思路启发
分享文章
复制链接,或一键分享到常用平台


