← 全部文章

上线前先建评测集:比再换一个模型更重要

模型迭代很快,但没有评测的团队只会被动追新。一套小而真的用例,能把「感觉变好了」变成「哪里变好了」。

很多团队的节奏是:效果不好 → 换模型 → 调提示词 → 再换模型。三个月后,成本上升,质量却说不清。问题通常不在模型清单太短,而在缺少稳定的评价尺子。

评测集不必大,但必须真

从线上真实请求里抽样,覆盖高频、高风险、边界三类即可。初期 80 条也能用:40 条日常、20 条刁钻、20 条绝不能错。每条写清期望输出、可接受变体、以及不可接受的失败。

指标要服务决策

  • 任务成功与否(业务定义,而不是文笔分数)
  • 关键字段正确率(抽槽、分类、引用)
  • 拒答是否得当(不知道时该不该编)
  • 延迟与单价(同样正确率下更便宜才算进步)
评测的目标不是得到一个漂亮分数,而是决定下一步该不该改、改哪里。

把它嵌进发布流程

每次改提示词、换检索、升级模型,都跑同一套评测。回归失败就阻断发布。这样「追新模型」会变成可选优化,而不是唯一抓手。

如果你只能做一件事来提升 AI 项目成熟度,先建评测集。它比再买一张更贵的 API 账单更划算。