模型评估与基准
“模型好不好”要量化。面试主线:主流基准、能力维度、评估方法、Agent 评估的特殊性。
主流基准
| 基准 | 测什么 | 形式 |
|---|---|---|
| MMLU | 多学科知识(57 科) | 选择题 |
| GSM8K | 数学推理 | 应用题 |
| HumanEval | 代码生成 | 函数补全 + 单测 |
| BBH | 复杂推理(Big-Bench 子集) | 多种任务 |
| HellaSwag | 常识推理 | 选择 |
| GPQA | 研究生级科学问题 | 选择 |
面试要点:MMLU 看知识广度、GSM8K 看推理、HumanEval 看代码。榜单分数是基准参考,别只看总分(模型各有强弱项)。
评估的层次
评估层次: 基准 → 任务 → 生产
- 基准:通用能力对比(选模型用)
- 任务评估:在你的数据上测(选 prompt/参数用)
- 生产指标:真实效果(上线后持续观测)
任务评估方法
| 方法 | 做法 | 适用 |
|---|---|---|
| 人工评估 | 人打分/对比 | 质量主判(最终标准) |
| 规则评估 | 精确匹配、包含、正则 | 结构化输出 |
| LLM-as-judge | 用强模型打分 | 规模化人工评估(有偏差要校准) |
| 对比评估 | A/B 两个版本输出对比 | Prompt/模型迭代 |
评估集建设:覆盖正常 + 边界 + 失败案例,定期回归(模型更新后全量重测)。
Agent 评估的特殊性
- 轨迹评估:既要看最终结果,也要看过程(工具用对没、顺序合理没)
- 多轮:单轮评估覆盖不了 Agent 的对话/循环
- 环境依赖:工具、数据、外部服务(评估要可控环境)
- 工具:LangSmith 数据集(见 LangChain 生态篇)、τ-bench(工具智能)、SWE-bench(真实代码任务)
面试话术:Agent 评估 = 结果指标 + 轨迹指标 + 回归集,比单轮 LLM 评估复杂一个维度。
面试追问
- 主流基准怎么看? MMLU 知识、GSM8K 推理、HumanEval 代码。各测各的,别只看总分
- 评估分几层? 基准(选模型)→ 任务集(调优)→ 生产指标(上线)。层层递进
- LLM-as-judge 靠谱吗? 可规模化但有权衡偏差(偏好长答案、位置偏差),要抽样人工校准
- Agent 怎么评估? 结果 + 轨迹(工具使用)+ 回归集。环境要可控
- 评估集怎么建? 正常 + 边界 + 失败案例,模型更新后全量回归