LLM 概述与演进
LLM(大语言模型)是 Agent 时代的引擎。面试主线:它是什么、能力从哪来、和传统 NLP 的区别。
是什么
- LLM = 大规模 Transformer 语言模型:在海量文本上训练,学习“下一个词”的预测
- 核心能力:续写、理解、推理(涌现)、指令跟随、工具调用
- 规模效应:参数量(亿到万亿级)+ 数据量 + 算力 → 能力跃迁
输入: 用户指令 + 上下文
输出: 逐 token 生成(自回归)
能力来源
能力 = 知识(预训练)+ 行为(对齐)。面试话术:模型先学“会说话”,再学“听指令”,再学“说人话”(见预训练与微调篇)。
演进脉络
与传统 NLP 的区别
面试定位
- Agent 面试的“引擎知识”:理解能力边界(幻觉、上下文)比背模型参数重要
- 常考:Transformer 架构、注意力、tokenization、幻觉、评估(本分类各篇)
- 工程视角:怎么调用、怎么降低成本(见 LLM 应用工程分类)
面试追问
- LLM 的能力从哪来? 预训练学知识 + 对齐学行为。规模(参数/数据/算力)是基础
- 和传统 NLP 的区别? 通用性:新任务改提示词而非重新训练。知识来自预训练
- 涌现是什么? 规模超过阈值后出现的能力跃迁(推理、少样本学习)。机制未完全解释
- 为什么自回归? 逐 token 生成,训练目标简单(下一个词预测),效果最好
- LLM 的局限? 幻觉、上下文有限、知识截止、推理成本高。工程上要认知边界(见幻觉篇)