Skip to content

模型评估与基准

基准测试、能力维度、评估方法、Agent 评估。

Updated View as Markdown
For humans

模型评估与基准

“模型好不好”要量化。面试主线:主流基准、能力维度、评估方法、Agent 评估的特殊性。

主流基准

基准 测什么 形式
MMLU 多学科知识(57 科) 选择题
GSM8K 数学推理 应用题
HumanEval 代码生成 函数补全 + 单测
BBH 复杂推理(Big-Bench 子集) 多种任务
HellaSwag 常识推理 选择
GPQA 研究生级科学问题 选择

面试要点:MMLU 看知识广度、GSM8K 看推理、HumanEval 看代码。榜单分数是基准参考,别只看总分(模型各有强弱项)。

评估的层次

评估层次: 基准 → 任务 → 生产

  • 基准:通用能力对比(选模型用)
  • 任务评估:在你的数据上测(选 prompt/参数用)
  • 生产指标:真实效果(上线后持续观测)

任务评估方法

方法 做法 适用
人工评估 人打分/对比 质量主判(最终标准)
规则评估 精确匹配、包含、正则 结构化输出
LLM-as-judge 用强模型打分 规模化人工评估(有偏差要校准)
对比评估 A/B 两个版本输出对比 Prompt/模型迭代

评估集建设:覆盖正常 + 边界 + 失败案例,定期回归(模型更新后全量重测)。

Agent 评估的特殊性

  • 轨迹评估:既要看最终结果,也要看过程(工具用对没、顺序合理没)
  • 多轮:单轮评估覆盖不了 Agent 的对话/循环
  • 环境依赖:工具、数据、外部服务(评估要可控环境)
  • 工具:LangSmith 数据集(见 LangChain 生态篇)、τ-bench(工具智能)、SWE-bench(真实代码任务)

面试话术:Agent 评估 = 结果指标 + 轨迹指标 + 回归集,比单轮 LLM 评估复杂一个维度。

面试追问

  1. 主流基准怎么看? MMLU 知识、GSM8K 推理、HumanEval 代码。各测各的,别只看总分
  2. 评估分几层? 基准(选模型)→ 任务集(调优)→ 生产指标(上线)。层层递进
  3. LLM-as-judge 靠谱吗? 可规模化但有权衡偏差(偏好长答案、位置偏差),要抽样人工校准
  4. Agent 怎么评估? 结果 + 轨迹(工具使用)+ 回归集。环境要可控
  5. 评估集怎么建? 正常 + 边界 + 失败案例,模型更新后全量回归
Navigation

Type to search…

↑↓ navigate↵ selectEsc close