一个 Agent 调用外部工具时失败了,可能有哪些原因?你会如何设计失败恢复和防止无限循环?
好的回答应覆盖参数校验、工具超时、权限失败、网络错误、业务错误、幂等性、重试次数、错误分类、人工接管、执行日志和最大步数限制。还应说明哪些错误可以自动重试,哪些必须停止或让用户补充信息。
题目背景
Agent 上线后最常见的问题是工具失败、参数错、循环调用、权限越界和状态不一致。
完整回答
好的回答应覆盖参数校验、工具超时、权限失败、网络错误、业务错误、幂等性、重试次数、错误分类、人工接管、执行日志和最大步数限制。还应说明哪些错误可以自动重试,哪些必须停止或让用户补充信息。
加分信息
- 能结合 AI Agent 工程师 的真实工作场景回答。
- 能结合 后端工程师 的真实工作场景回答。
常见问题
- 只给概念定义,没有说明工程场景。
- 没有提到验证、监控或失败处理。
面试官可能追问
- 如果工具执行了一半成功一半失败,状态怎么恢复?
- Agent 执行写操作前应该有哪些确认机制?
回答时尽量连接到一个可运行项目、评测记录、日志或复盘材料。