Jixue AI学习库
返回知识库
评估入门

如何评估 AI 应用质量

从准确性、稳定性、引用、拒答、成本和延迟看 AI 应用质量。

evaluationgolden-setquality
01

为什么重要

从准确性、稳定性、引用、拒答、成本和延迟看 AI 应用质量。

02

核心原理

不要只看 demo AI 应用很容易在单个 demo 上表现不错,但上线后面对真实用户问题会暴露大量边界情况。 建议指标 答案正确性。 是否引用了正确资料。 不知道时能否拒答。 输出格式是否稳定。 延迟是否可接受。 单次请求成本是否可控。 评测集来源 评测集可以来自真实用户问题、人工构造问题、历史故障案例和产品边界问题。每次 prompt、模型、检索策略变化后,都应该跑一次回归。

03

工程实现

  • 先把概念落到输入、处理、输出和验证链路里。
  • 用固定样例或日志验证改动效果,避免只凭一次演示判断质量。
04

展开说明

不要只看 demo

AI 应用很容易在单个 demo 上表现不错,但上线后面对真实用户问题会暴露大量边界情况。

建议指标

  • 答案正确性。
  • 是否引用了正确资料。
  • 不知道时能否拒答。
  • 输出格式是否稳定。
  • 延迟是否可接受。
  • 单次请求成本是否可控。

评测集来源

评测集可以来自真实用户问题、人工构造问题、历史故障案例和产品边界问题。每次 prompt、模型、检索策略变化后,都应该跑一次回归。

05

常见误区

  • 只背术语,不说明工程取舍。
  • 忽略评测、日志、成本和失败边界。
06

面试怎么说

从准确性、稳定性、引用、拒答、成本和延迟看 AI 应用质量。