Skip to content

预训练与微调

三阶段训练、SFT、RLHF/DPO、LoRA 与 PEFT。

Updated View as Markdown
For humans

预训练与微调

LLM 的能力分阶段获得。面试主线:三阶段各干什么、微调方式对比、LoRA 原理、微调 vs RAG。

三阶段训练

三阶段: 知识 → 指令 → 对齐

阶段 数据 目标 成本
预训练 TB 级文本 语言能力 + 世界知识 极高(千卡月级)
SFT 万-百万级指令对 指令跟随、问答格式
RLHF/DPO 人类偏好标注 有用、无害、诚实
  • RLHF:奖励模型打分 + PPO 强化学习(复杂、不稳定)
  • DPO:直接偏好优化,用偏好对直接训练(简单、稳定),现代开源主流

微调方式对比

方式 更新参数 成本 适用
全参微调 全部 极高 领域大模型
LoRA 低秩适配器(<1% 主流选择
QLoRA LoRA + 量化 更低 单卡微调
Prompt/上下文学习 无(改输入) 快速适配

LoRA 原理:权重更新 ΔW 是低秩矩阵,分解成 A×B 两个小矩阵(如 rank=8),只训练小矩阵,冻结原模型

W' = W + α·A·B
A: (d×r), B: (r×d), r << d
  • 显存和训练量降一个量级,效果接近全参微调
  • 可插拔:多个 LoRA 适配器共用一个基座模型,按任务切换(推理服务常见)

微调 vs RAG vs 提示工程

方案 解决 代价
提示工程 快速适配、零成本 能力有限、占上下文
RAG 外部知识、实时更新 检索质量决定上限
微调 风格/格式/领域知识内化 成本高、更新慢

面试话术:知识更新用 RAG,行为改变用微调。先提示工程,再 RAG,再微调(成本递增)。

面试追问

  1. 三阶段各干什么? 预训练学知识、SFT 学指令、RLHF/DPO 学对齐。成本递减
  2. RLHF 和 DPO 的区别? RLHF 是奖励模型 + PPO(复杂),DPO 直接偏好优化(简单稳定)。开源主流用 DPO
  3. LoRA 原理? 权重更新分解为低秩小矩阵,只训小矩阵冻结原模型。显存降一个量级,可插拔
  4. 微调和 RAG 怎么选? 知识更新用 RAG(实时),行为/风格用微调。成本递增:提示 → RAG → 微调
  5. 全参微调为什么贵? 优化器状态 + 梯度都按全模型存。LoRA 只存小矩阵,显存大降
Navigation

Type to search…

↑↓ navigate↵ selectEsc close