LLM evaluation 到底在评什么?从指标、数据集到上线前回归的完整思路
LLM evaluation(大语言模型评测)的核心,是把“这个输出好不好”从主观感觉变成可重复、可比较的评分。它评的不是模型本身有多聪明,而是你的应用在真实任务上是否稳定达标。适用条件很明确:只要你在上线或迭代一个基于 LLM 的功能——客服机器人、文档问答、Agent 工作流——就需要它;如果你只是本地试玩、没有发布计划,可以先不做完整评测,但至少要有一组固定样例。
评测评的是“任务表现”,不是“模型排名”
同一个模型,在不同提示词、不同工具、不同数据下表现差异很大。所以 LLM evaluation 的对象通常是你的应用配置:提示词版本、模型选择、检索策略、工具调用链。Braintrust 把这件事拆成三个相互衔接的部分——观测(看生产里实际发生了什么)、评测(用数据集和评分器量化质量)、发现(从 trace 里找出值得改的模式),三者共用同一套系统,避免评测结果和线上表现脱节。
常见评测维度
不要只盯“回答对不对”。一个可用的评测集通常覆盖以下几类,按你的场景取舍:
| 维度 | 评什么 | 典型检查方式 |
|---|---|---|
| 正确性 | 事实是否准确、是否回答了问题 | 参考答案比对、LLM 评分 |
| 相关性 | 是否切题、有无跑题或冗余 | 人工或 LLM 打分 |
| 格式合规 | 是否符合 JSON、字段、长度等约束 | 代码/规则校验 |
| 安全性 | 是否输出有害、越权或泄露内容 | 规则 + 分类器 |
| 延迟与成本 | 响应时间、token 消耗是否可接受 | 生产监控指标 |
| 多轮与工具调用 | 上下文是否保持、工具参数是否正确 | trace 逐步检查 |
多轮对话和 Agent 场景要额外看:工具调用是否选对、参数是否合法、失败后能否恢复。这类问题在单轮问答评测里看不出来,必须看完整 trace。
三种评分方式,各有边界
- 规则/代码评分:适合格式、关键词、数值、结构校验。快、稳定、零成本,但只能覆盖能写成规则的部分。
- LLM-as-judge:用模型给输出打分,适合正确性、相关性等开放式判断。扩展性好,但要注意评分器本身的偏差——它会偏好冗长回答、对位置敏感,所以评分标准要写具体,并定期用人工样本校准。
- 人工标注:最贴近真实判断,适合建立黄金标准、校准自动评分器。成本高、速度慢,通常用于抽样而非全量。
实际做法是组合:用代码评分卡硬性约束,用 LLM 评分覆盖开放维度,用人工标注校准前两者。Braintrust 支持这三种评分方式并存,便于交叉验证。
数据集:从生产流量来,回到生产去
评测集的质量决定评测的价值。几个可操作的要点:
- 从真实 trace 采样,而不是自己编例子。Braintrust 的观测能力可以搜索海量日志、按模式筛选,把线上真实出现的输入变成评测用例。
- 分层构造:正常用例、边界用例、已知失败用例各占一部分,后者最能防止回归。
- 版本化数据集。数据集会随产品演进而更新,必须能追溯“这次评测用的是哪一版”,否则结果无法比较。
- 避免过拟合:如果团队反复针对同一批样例调提示词,评测分数会虚高。定期补充新样例,或留一部分不参与日常调优的保留集。
上线前回归与持续监控
评测要接进发布流程,而不是做完一次就放着:
- 上线前:对候选版本跑完整评测集,和当前线上版本做并排对比(prompt、模型、参数逐项对照),分数不达标就拦住发布。
- 上线后:持续监控延迟、成本、质量指标。LLM 应用会静默漂移——模型更新、数据分布变化都可能让质量下滑而不报错。Braintrust 的定位正是“主动观测”:自动浮现模式,让团队针对期望做评测并持续迭代。
- 发现失败模式:从 trace 里做主题分类、失败诊断,找出反复出现的问题,再把它变成新的评测用例。这样评测集会随生产经验增长。
常见卡点与排查方向
- 评测结果不稳定:同一输入多次跑分数波动大。先检查评分器是否用了随机采样(把 temperature 调低)、评分标准是否模糊,再确认数据集里是否有本身就有歧义的用例。
- 评分器与人工判断不一致:拿一批人工标注样本对比 LLM 评分,找出分歧点,把判断标准写进评分 prompt,而不是笼统说“给质量打分”。
- 数据集过时或过拟合:分数很高但线上仍出问题,通常是用例太旧或太窄。回到生产 trace 重新采样,补充近期真实失败案例。
- 只看总分:总分掩盖了具体失败类型。按维度、按用例类别拆分看,才能定位该改提示词、改检索还是改工具。
从哪里开始
如果你还没有评测体系,最小可行路径是:先接上 trace 观测,拿到一批真实输入;从中挑 20–50 条构造第一版数据集;用代码评分 + 一个 LLM 评分器跑通;把它接进发布检查。之后随着生产 trace 积累,逐步扩充数据集和评分维度。Braintrust 提供从记录第一条 trace、跑第一次 eval 到 trace 调查的完整链路,适合按这个顺序逐步搭建,而不必一次性设计完整体系。