你会如何为一个企业知识库问答系统建立评测集?上线前如何判断新版本比旧版本更好?
好的回答应包含真实用户问题采样、人工构造边界问题、标准答案或证据文档、按问题类型分层、自动指标和人工评审结合、回归测试、失败样例沉淀。还应说明不能只看单次 demo,需要比较准确性、引用正确性、拒答能力、成本和延迟。
题目背景
AI 应用不是靠感觉上线,必须有回归样例和质量指标。
完整回答
好的回答应包含真实用户问题采样、人工构造边界问题、标准答案或证据文档、按问题类型分层、自动指标和人工评审结合、回归测试、失败样例沉淀。还应说明不能只看单次 demo,需要比较准确性、引用正确性、拒答能力、成本和延迟。
加分信息
- 能结合 AI 产品工程师 的真实工作场景回答。
- 能结合 测试工程师 的真实工作场景回答。
常见问题
- 只给概念定义,没有说明工程场景。
- 没有提到验证、监控或失败处理。
面试官可能追问
- 如果自动评分和人工评分冲突,你相信哪个?
- 如何评估模型应该拒答的问题?
回答时尽量连接到一个可运行项目、评测记录、日志或复盘材料。