受控任务执行 Agent
用显式状态机控制计划、工具调用、重试、审批和终止,并保留可回放的确定性执行轨迹。
Next.jsTypeScriptZodNode Test
目标用户
需要自动化多步骤内部流程的团队。
面试价值
系统展示 Agent Loop、状态、工具安全、可观测性和 Eval。
当前交付状态
可运行原型
站内已提供服务端 Agent 运行 API,能够通过严格工具 Schema 和权限守卫读取真实证据,并具备签名会话隔离、Checkpoint v2、Redis 断点恢复和受审批的幂等学习笔记写入。生产发布门禁与跨部署恢复已经验证通过;当前仅缺真实模型密钥和 Schema v2 的 20 条在线基线报告,因此仍为 prototype。
验证命令
npm run test:unitnpm run buildnpm run test:e2e验证产物
- POST /api/agent/run 服务端运行契约与最多四步工具预算
- 真实知识检索和项目证据读取两个只读工具
- OpenAI Responses 严格函数调用适配器与缺少持久化限流时的失败关闭
- Upstash/Vercel Redis 原子限流、24 小时运行仓储和 runId 回放
- RuntimeCheckpoint v2、无重复工具恢复测试和跨部署恢复发布门禁
- 20 条规划契约评测、五类安全轨迹回放与 Schema v2 真实模型基线报告器
- 签名会话、Redis 原子限流和逐次审批幂等写入的生产冒烟证据
目标架构
控制层维护任务状态、预算和终止条件,模型负责受约束决策,工具层执行最小权限动作,事件日志支持断点恢复与审计。
目标实现步骤
- 01定义状态与工具契约
- 02实现循环和预算
- 03加入确认点与补偿操作
- 04建立轨迹评估集
目标功能
- 任务拆解
- 工具选择
- 状态持久化
- 人工确认
- Trace 复盘
预期难点
- 终止条件
- 幂等与补偿
- 权限边界
- 长任务恢复
交付与验收
测试策略
- 状态转换单元测试覆盖完成、阻塞、失败和取消
- 工具契约测试验证参数、权限、幂等和错误分类
- 轨迹评估检查任务成功、合法工具集合与步骤预算
部署步骤
- 控制服务与工具执行器使用独立身份和权限
- 任务状态与事件先持久化,再确认外部副作用
- 灰度发布新模型和工具版本,异常时恢复旧执行策略
验收清单
- 最大步数、时间、Token 和工具预算均可生效
- 副作用工具重试不会重复执行业务动作
- 人工拒绝后 Agent 不得绕过确认继续执行
- 进程重启后可从最后检查点恢复任务
3 分钟讲解
- 30 秒说明开放任务为何需要受控循环
- 60 秒讲状态、工具、预算和事件日志架构
- 60 秒演示审批、失败补偿和断点恢复
- 30 秒总结成功率、平均步骤和越权测试
目标简历表达 · 完成验收后使用
实现受控任务 Agent,支持工具白名单、状态持久化、人工审批、失败补偿和执行轨迹评估。