Skip to content

LLM 概述与演进★

大语言模型是什么、能力来源、演进脉络、面试定位。

Updated View as Markdown
For humans

LLM 概述与演进

LLM(大语言模型)是 Agent 时代的引擎。面试主线:它是什么、能力从哪来、和传统 NLP 的区别。

是什么

  • LLM = 大规模 Transformer 语言模型:在海量文本上训练,学习“下一个词”的预测
  • 核心能力:续写、理解、推理(涌现)、指令跟随、工具调用
  • 规模效应:参数量(亿到万亿级)+ 数据量 + 算力 → 能力跃迁
输入: 用户指令 + 上下文
输出: 逐 token 生成(自回归)

能力来源

阶段 给模型什么 得到什么
预训练 海量文本 语言知识、世界知识
SFT 指令-回答对 指令跟随
RLHF/DPO 人类偏好 对齐、有用性

能力 = 知识(预训练)+ 行为(对齐)。面试话术:模型先学“会说话”,再学“听指令”,再学“说人话”(见预训练与微调篇)。

演进脉络

节点 意义
Transformer(2017) 架构革命,注意力机制
GPT 系列(2018-) 规模法则:越大越强
ChatGPT(2022) RLHF 对齐,产品化拐点
开源模型(Llama/Qwen) 本地部署、微调成为可能
多模态/长上下文 能力扩展

与传统 NLP 的区别

维度 传统 NLP LLM
范式 任务专用模型 通用模型 + 提示
新任务 重新训练 改提示词
知识 任务内 世界知识
部署 小模型快 大模型贵(推理成本)

面试定位

  • Agent 面试的“引擎知识”:理解能力边界(幻觉、上下文)比背模型参数重要
  • 常考:Transformer 架构、注意力、tokenization、幻觉、评估(本分类各篇)
  • 工程视角:怎么调用、怎么降低成本(见 LLM 应用工程分类)

面试追问

  1. LLM 的能力从哪来? 预训练学知识 + 对齐学行为。规模(参数/数据/算力)是基础
  2. 和传统 NLP 的区别? 通用性:新任务改提示词而非重新训练。知识来自预训练
  3. 涌现是什么? 规模超过阈值后出现的能力跃迁(推理、少样本学习)。机制未完全解释
  4. 为什么自回归? 逐 token 生成,训练目标简单(下一个词预测),效果最好
  5. LLM 的局限? 幻觉、上下文有限、知识截止、推理成本高。工程上要认知边界(见幻觉篇)
Navigation

Type to search…

↑↓ navigate↵ selectEsc close