AGENT ENGINEERING
Agent 是一套受控执行系统
模型只是决策核心。真正决定可靠性的,是工具契约、状态控制、终止条件、可观测性和人工确认。
MODEL+TOOLS+STATE
核心链路
一次 Agent 执行发生了什么
01
模型决策
理解目标与当前状态,选择回答、工具或停止。
02
受控工具
以明确输入、输出和权限执行真实世界动作。
03
状态循环
保存观察结果,控制重试、最大步数与终止条件。
04
追踪评估
记录每一步决策,用样例和指标判断是否可靠。
05
安全边界
高风险动作需要最小权限、输入校验和人工确认。
KNOWLEDGE
核心知识
什么是 Agent入门函数调用与工具回路进阶Prompt Injection 防护高级Agent Loop进阶工具契约设计进阶Agent 状态与记忆进阶规划、路由与确定性流程高级Agent 终止条件与预算高级Human in the Loop高级多 Agent 与 Handoff高级MCP Host、Client 与 Server进阶MCP Tools、Resources 与 Prompts进阶MCP Transport:stdio 与 Streamable HTTP进阶MCP 会话生命周期与错误码进阶MCP 权限与传输安全高级Agent Trace 与可观测性进阶Agent 结果与轨迹评估高级密钥与数据边界入门阅读 Agent LoopINTERVIEW
高频追问
Agent 和普通聊天机器人的本质区别是什么?初级什么是工具调用(function calling)?为什么 Agent 离不开它?初级Agent 和普通 Chatbot 有什么区别?初级一个可靠 Agent Loop 至少包含什么?中级Agent 工具 Schema 怎样设计更容易被正确调用?中级如何设计 Agent 的停止条件?中级Agent 的 state 和 memory 有什么区别?中级Agent 的 planning 和 routing 分别解决什么?中级哪些 Agent 动作应该加入人工确认?中级工具调用失败时 Agent 应该怎样处理?中级如何限制 Agent 的工具权限?高级什么时候值得使用多 Agent 和 handoff?高级Agent 什么时候可以并行执行步骤?高级长时间运行的 Agent 怎样支持断点恢复?高级浏览器 Agent 的主要风险是什么?高级代码 Agent 为什么需要沙箱?高级什么时候应该用工作流,而不是 Agent?中级常见 Agent 失败模式有哪些?中级Guardrails 在 Agent 系统中能解决什么,不能解决什么?高级Agent 宣称任务完成时如何验证?高级MCP 是什么,为什么它对 Agent 重要?初级MCP Host、Client、Server 分别负责什么?中级MCP Tools、Resources、Prompts 有什么区别?中级stdio 和 Streamable HTTP 传输如何选择?中级MCP 为什么需要能力协商?高级接入第三方 MCP Server 时如何做安全评审?高级如何设计一个高质量 MCP Server?高级MCP 工具无法调用时怎样排查?中级MCP 有哪几种传输方式?stdio 和 Streamable HTTP 分别适合什么场景?初级MCP 的 initialize 握手做什么?协议版本协商是怎么进行的?初级tools/list 和 tools/call 分别是什么?一个 MCP Client 从连接到调用工具要走哪几步?初级调用 MCP 工具时返回错误码 -32601 或 -32602 是什么意思?怎么排查?初级Agent 评估为什么要同时看结果和轨迹?中级怎样建立有价值的 AI 评估数据集?中级AI 应用的评估指标应该怎样选?中级使用 LLM as Judge 有哪些风险?高级Agent Trace 应记录哪些关键事件?中级如何把 Eval 接入发布流程?高级怎样评估 Agent 的工具调用质量?高级AI 应用上线后应该监控什么?中级PROJECTS