Agent 控制与编排
设计并迭代长任务 Agent 的执行行为与工具策略。
ROLE CALIBRATION WORKSPACE
选择一份真实公开 JD,把岗位信号映射到现有项目成熟度,再用固定五题检查回答是否包含概念、取舍、项目证据和失败验证。
TARGET ROLE
岗位页面可能更新或下线,样本保留访问日期和原始链接。校准分只代表当前作品集证据覆盖,不代表录用概率。
San Francisco / New York / Seattle / London
强调长任务 Agent 行为、真实任务评测、工具策略、上下文构造和生产可靠性。
查看原始岗位EVIDENCE COVERAGE
当前没有 `verified` 项目,因此原型不会被计算为强证据。
设计并迭代长任务 Agent 的执行行为与工具策略。
运行评测并定位回归、失败模式和边界情况。
分析生产失败,持续改善可靠性、延迟与成本边界。
通过提示词、上下文构造和模型实验改善行为。
把模型能力转化为可衡量的用户结果并与产品协作。
具备 LLM 产品工程和现代 ML 工具经验。
EVIDENCE INTERVIEW
回答时必须说明「Agent 评估与追踪控制台」目前是 prototype,并引用一个可复算结果。
这套工具评的是证据准备程度。它不读取语音、不判断答案真实性、不预测面试结果;每个勾选项都需要你能现场展开并接受追问。