如何评估 AI 应用质量
从准确性、稳定性、引用、拒答、成本和延迟看 AI 应用质量。
为什么重要
从准确性、稳定性、引用、拒答、成本和延迟看 AI 应用质量。
核心原理
不要只看 demo AI 应用很容易在单个 demo 上表现不错,但上线后面对真实用户问题会暴露大量边界情况。 建议指标 答案正确性。 是否引用了正确资料。 不知道时能否拒答。 输出格式是否稳定。 延迟是否可接受。 单次请求成本是否可控。 评测集来源 评测集可以来自真实用户问题、人工构造问题、历史故障案例和产品边界问题。每次 prompt、模型、检索策略变化后,都应该跑一次回归。
工程实现
- 先把概念落到输入、处理、输出和验证链路里。
- 用固定样例或日志验证改动效果,避免只凭一次演示判断质量。
展开说明
不要只看 demo
AI 应用很容易在单个 demo 上表现不错,但上线后面对真实用户问题会暴露大量边界情况。
建议指标
- 答案正确性。
- 是否引用了正确资料。
- 不知道时能否拒答。
- 输出格式是否稳定。
- 延迟是否可接受。
- 单次请求成本是否可控。
评测集来源
评测集可以来自真实用户问题、人工构造问题、历史故障案例和产品边界问题。每次 prompt、模型、检索策略变化后,都应该跑一次回归。
常见误区
- 只背术语,不说明工程取舍。
- 忽略评测、日志、成本和失败边界。
面试怎么说
从准确性、稳定性、引用、拒答、成本和延迟看 AI 应用质量。