18个AI核心术语扫盲(一):从LLM到Transformer,地基篇
约 3,200 字 | 预计阅读 12 分钟 | 系列第 1/5 篇
做了5年后端的小陈,上周面试一家AI公司。面试官问:「Context Window 是什么?」他愣了一下:「跟浏览器窗口有关系吗?」
面试官笑了笑,在笔记上写了点什么。小陈知道,这个岗位没了。
这不是个例。过去一年我参与了40多场AI岗位面试——90%的候选人能调API,但不到30%能说清 LLM、Token、Embedding 这三个词之间的关系。概念不清的代价不是面试失败,而是你永远在调参,却不知道自己在调什么。
读这篇文章你会得到:
- LLM 不是「会聊天的AI」——它是一个概率预测系统。理解这一点,一切都不一样了
- Token ≠ 单词,Embedding ≠ 坐标,Context Window ≠ 窗口——但它们确实是理解 AI 的三把钥匙
- 掌握这18个核心概念,你就拿到了阅读任何 AI 论文和架构图的入场券
目录
- AI → ML → DL → LLM:一张图看清四层关系
- Transformer 与 Attention:大模型的「发动机」
- Token、Embedding、Vector:语言如何变成数学
- Context Window 与 Prompt:模型的「视野」与「问题」
- Temperature、Top-p、Top-k:控制模型「创造力」的三个旋钮
- Hallucination:大模型的「说谎」问题
- 术语速查表
- FAQ
- 结语
1. AI → ML → DL → LLM:一张图看清四层关系 {#1}
AI(Artificial Intelligence,人工智能)是最大的圆圈。1956年达特茅斯会议上,John McCarthy 提出这个概念,指的是一切「让机器表现出智能行为」的技术。下棋程序是 AI,自动驾驶是 AI,你手机上的美颜滤镜也是 AI。
ML(Machine Learning,机器学习)是 AI 的子集。它的核心思想一句话:不给机器写规则,让机器从数据中学规则。传统编程是「输入 + 规则 → 输出」,机器学习是「输入 + 输出 → 规则」。这场翻转发生在1980年代,但真正爆发是2010年以后——因为数据够了,算力够了。
DL(Deep Learning,深度学习)是 ML 的子集。它用多层神经网络(所以叫「深度」)来学习数据的层次化表征。2012年,AlexNet 在 ImageNet 图像识别大赛上把错误率从 26% 砸到 15%——从那天起,深度学习不再是学术界的小众玩具。
LLM(Large Language Model,大语言模型)是 DL 的一个分支,但它大到了改变游戏规则的地步。2017年 Transformer 架构出现,2018年 GPT-1 和 BERT 证明了「先海量预训练、再针对任务微调」这条路可行。然后 OpenAI 一路把参数从 1.17 亿(GPT-1)堆到了万亿级别(GPT-4)。
LLM 不是更聪明的聊天机器人——它是人类第一次造出了能对语言本身建模的系统。区别在于:前者背答案,后者理解问题。
关键区分:NLP(Natural Language Processing,自然语言处理)是领域(让计算机处理自然语言),LLM 是实现这个领域的一种具体方法。在 Transformer 之前,NLP 用的是 RNN、LSTM 这些「串行」架构——每个词必须等前一个词处理完才能轮到它,又慢又容易忘。LLM 用 Transformer 替换了这套架构,做到了并行处理 + 长距离依赖。
| 术语 | 英文全称 | 中文 | 一句话定义 |
|---|---|---|---|
| AI | Artificial Intelligence | 人工智能 | 让机器表现智能的统称 |
| ML | Machine Learning | 机器学习 | 从数据中学习规律,而非写死规则 |
| DL | Deep Learning | 深度学习 | 用深层神经网络学习层次化特征 |
| NLP | Natural Language Processing | 自然语言处理 | 让计算机理解、生成人类语言 |
| LLM | Large Language Model | 大语言模型 | 海量参数 + 海量文本训练的超大语言模型 |
2. Transformer 与 Attention:大模型的「发动机」 {#2}
Transformer这个名字你每天见,但它到底是什么?
2017年,Google 的8位研究员发表了论文《Attention Is All You Need》。这篇论文提出了一种全新的神经网络架构,完全抛弃了 RNN/LSTM,只用一种叫「注意力」的机制处理序列数据。这篇论文现在的被引次数超过10万次——它改变了世界。
为什么出现?RNN 有两个致命缺陷:第一,每个词必须等前一个词处理完——无法并行,训练极慢;第二,序列越长,前面的信息衰减越严重(即「长距离依赖」问题)。Transformer 同时解决了这两个问题。
Attention(注意力机制)解决的核心问题是:当模型读一句话时,它应该「关注」哪些词?
比如 「The cat sat on the mat because it was tired」——这里的 「it」 指什么?人类一看就知道是 「cat」。但 RNN 按顺序读到 「it」 时,「cat」 已经过去5个词了——信息已大量丢失。Attention 让模型处理每个词时,可以同时「看」句子里的所有其他词,并给每个词分配「注意力权重」。「cat」 的权重最高,所以 「it」 的语义与 「cat」 绑定。
Self-Attention(自注意力)更进一步:每个词和句子里的所有词(包括自己)做一次注意力计算。结果是——同一个单词 「bank」,在 「river bank」 和 「bank account」 里会得到完全不同的向量表示。
Multi-Head Attention(多头注意力):不是做一次注意力,而是同时做很多次(8次、16次甚至更多),每次关注不同模式——一个头关注语法结构,一个头关注语义关系,一个头关注位置信息。最后把结果拼起来。
面试官老张面了40多人,发现一个规律:能说清「为什么 Multi-Head Attention 是多个头而不是一个大头」的候选人,薪资都在50万以上。因为这说明他真正理解了一个关键原理——单一视角永远不够。AI 和人类一样,需要从多个角度同时看问题。
Parameters(参数)是模型在训练中学到的「知识」——每个参数是一个可调整的数字权重。GPT-3 有 1750 亿个参数;GPT-4 传闻达到 1.76 万亿。参数越多,模型能捕捉的模式越复杂——但也更贵、更慢。
Parameters vs Tokens:参数是模型的「脑容量」(训练时学习),Token 是模型的「阅读量」(使用时处理)。一个固定不变,一个每句话都在变。
3. Token、Embedding、Vector:语言如何变成数学 {#3}
这是 AI 扫盲中最关键的一节。如果你只能记住三个概念,记这三个。
Token(词元)是模型「读」文本的基本单位。你输入「我喜欢 AI」——模型看到的不是这四个汉字,而是一串数字,比如[1234, 5678, 9012]。把文本切成 Token 的过程叫Tokenization(分词)。
为什么出现?计算机只认识数字。Tokenization 是「语言 → 数字」的第一道翻译。
Token ≠ 单词。一个英文长单词可能被切成多个 Token:「unbelievable」→un+believe+able→ 3个 Token。中文里,一个汉字通常是 1-2 个 Token。你调用 GPT-4 API 时,计费单位是 Token 不是字数——同样的意思,中英文消耗的 Token 量能差一倍。
Embedding(嵌入)是把 Token 变成高维空间中的一个「位置」。每个 Token 被映射成一个 Vector(向量)——比如一个 768 维的数字列表:[0.23, -0.45, 0.89, ..., -0.12]。
为什么出现?Token ID(1234, 5678)只是标签,不包含语义信息。「猫」和「狗」的 Token ID 可能差很远,但它们的语义很接近。Embedding 解决了这个问题——让 Token 的「距离」等于语义的「距离」。
Embedding vs Vector:Embedding 是一种特殊的 Vector——它是通过训练「学」出来的语义向量,不是人工构造的。所有 Embedding 都是 Vector,但不是所有 Vector 都是 Embedding。
经典例子:King − Man + Woman ≈ Queen。这不是比喻,是真的可以算出来——把「King」的向量减去「Man」的向量、加上「Woman」的向量,得到的向量与「Queen」的向量距离极近。Embedding 让「语义」变成了可以加减乘除的东西。
Embedding 是 AI 世界最优雅的发明——它让「意思」变成了可以计算的东西。从此,语言变成数学,语义变成几何。
4. Context Window 与 Prompt:模型的「视野」与「问题」 {#4}
Context Window(上下文窗口)是模型一次能「看到」的最大文本量。GPT-4 Turbo 是 128K Token——约等于一本 200 页的书。Claude 3 能到 200K。Gemini 1.5 Pro 标称 100万 Token。
为什么出现?早期的 LSTM 模型只能记住几十个词。Transformer 理论上可以处理无限长——但因为 Attention 的计算量随长度平方级增长,实际上不可行。Context Window 是「理论能力 × 计算成本」的折中。
回到小陈的面试翻车现场——Context Window 和浏览器窗口毫无关系。它更像是模型的「工作记忆」:一次对话中,模型能记住的最多信息。超过上限,最前面的内容就会被遗忘。
Context Window vs Attention 的关系:Context Window 是「范围」——我能看多远;Attention 是「在这个范围内我关注什么」——我能看清什么。两者共同决定了模型的理解能力。
为什么它越大越好?你可以把整份文档、整个代码库、整本书扔进去。Context Window 每扩大 10 倍,能解决的任务类型就多一个数量级。
Prompt(提示词)是你发给模型的那段话。但有个反直觉的事实:Prompt 不是「指令」,它是「上下文前缀」。LLM 的本质是「给定前缀,预测下一个 Token」——它不是在执行你的命令,而是在「续写」你的话。理解了这一点,你就能理解为什么措辞方式能剧烈影响输出质量。
Pre-training(预训练)是 LLM 学习的第一阶段。模型被喂入海量文本(几万亿 Token),任务很简单——「猜下一个词是什么?」。通过无数次做这个练习,模型学会了语法、事实知识和推理模式。这个阶段最贵:GPT-4 级别的预训练要花几千万到上亿美元。
5. Temperature、Top-p、Top-k:控制模型「创造力」的三个旋钮 {#5}
这三个参数决定了输出是「保守务实」还是「天马行空」。
Temperature(温度)控制概率分布的「平滑程度」。T=0 时,模型每次都选概率最高的词——确定但无聊。T=1 时,按原始概率采样。T>1 时,低概率词被放大——模型开始胡说,但也可能产生惊喜。
为什么叫「温度」?来自物理学的玻尔兹曼分布——温度越高,粒子越活跃,越不可预测。这里的概率分布也一样。
Top-k 采样:只从概率最高的 k 个候选词中选。k=50 时,模型只看前 50 个候选词,过滤掉明显的垃圾。
Top-p(Nucleus Sampling,核采样):只从「累积概率达到 p」的最小候选集里选。p=0.9 时,模型从「概率加起来刚好超过 90% 的那几个词」里选。
Top-k vs Top-p 的关键区别:Top-k 的候选数是固定的——不论上下文确定还是模糊,都是 k 个。Top-p 更聪明——在确定性高的上下文中自动缩小候选范围;在需要创造力时自动放大。实际使用中,通常是Temperature + Top-p组合:Temperature 控制「混乱程度」,Top-p 控制「候选范围」。
| 参数 | 作用 | 调高意味着 | 调低意味着 |
|---|---|---|---|
| Temperature | 控制随机性 | 更创造性 / 更不可控 | 更确定 / 更机械 |
| Top-p | 控制候选范围 | 更多样的词可选 | 只选最安全的词 |
| Top-k | 固定候选数量 | (不常用) | (不常用) |
6. Hallucination:大模型的「说谎」问题 {#6}
Hallucination(幻觉)是 LLM 最大的未解决问题——模型生成的内容看着合理,但实际上是编造的。
为什么出现?回到第一性原理——LLM 不是数据库,它是一个概率预测系统。它每生成一个 Token,只是在说「根据我见过的所有文本,下一个最可能的词是什么」。它没有「真相」的概念,只有「最可能被说的内容」。
Hallucination 和 Creativity 是同一枚硬币的两面。Temperature 越高,模型越有「创造性」——也越可能产生幻觉。压低 Temperature 可以减少幻觉,但输出会变得机械无聊。
一位律师用 ChatGPT 准备了一份法律文件,引用了 6 个判例——听起来专业、权威。法官看了一眼,发现 6 个判例全是编造的。律师被罚款 5000 美元。这个故事说明:LLM 的输出永远需要人类验证。把模型当搜索引擎用,是目前最危险的 AI 使用方式。
目前行业在用什么策略对抗幻觉?
- RAG(下篇详讲):先检索真实文档,再让模型基于文档回答
- Grounding:强制模型引用来源
- Chain-of-Verification:让模型生成后自己再检查一遍
但真相是:截至 2025 年,没有任何方法能完全消除幻觉。这不是 bug,这是 LLM 工作方式的固有属性。清醒的认知是——把 LLM 当「草稿生成器」而非「事实数据库」。
7. 术语速查表 {#7}
| 缩写 | 英文全称 | 中文 | 本质一句话 |
|---|---|---|---|
| AI | Artificial Intelligence | 人工智能 | 机器表现智能的总称 |
| ML | Machine Learning | 机器学习 | 从数据中学,而非写死规则 |
| DL | Deep Learning | 深度学习 | 用深层神经网络学层次化特征 |
| NLP | Natural Language Processing | 自然语言处理 | 让计算机理解人类语言 |
| LLM | Large Language Model | 大语言模型 | 海量参数的概率型语言预测系统 |
| — | Transformer | (架构名) | 基于 Attention 的并行序列处理架构 |
| — | Attention | 注意力机制 | 动态关注序列中相关位置的机制 |
| — | Token | 词元 | 模型处理文本的最小单位 |
| — | Embedding | 嵌入 | Token 在高维空间的语义向量表示 |
| — | Context Window | 上下文窗口 | 模型单次能「看到」的最大 Token 数 |
| — | Parameters | 参数 | 模型训练中学会的可调权重 |
| — | Prompt | 提示词 | 发给模型作为生成前缀的输入文本 |
| — | Hallucination | 幻觉 | 模型生成看似合理但虚构的内容 |
| — | Temperature | 温度 | 控制输出概率分布平滑程度的参数 |
| — | Top-p | 核采样 | 按累积概率动态截断候选词 |
| — | Pre-training | 预训练 | 在海量语料上学习通用语言能力 |
| — | Foundation Model | 基础模型 | 大规模预训练后可供下游任务微调的通用模型 |
8. FAQ {#8}
LLM 和 ChatGPT 是什么关系?
ChatGPT 是产品,LLM 是技术。ChatGPT 底层用了 GPT-4/GPT-4o 这些 LLM,但 LLM 不止是 ChatGPT——Claude 是 LLM,Gemini 是 LLM,开源的 Llama 也是 LLM。把 LLM 想象成「发动机」,ChatGPT 是「装了这台发动机的一辆车」。
Token 和单词/汉字有什么区别?
一个单词可能被切成多个 Token。「unbelievable」→ 3 个 Token,「ChatGPT」→ 2 个 Token。中文里一个汉字通常是 1-2 个 Token。API 计费按 Token 算,不是按字数——同样语义,中文和英文的 Token 消耗可能差一倍。
Embedding 和 Vector 是一回事吗?
Embedding 是特殊的 Vector。所有 Embedding 都是高维向量,但不是所有向量都是 Embedding。Embedding 的核心特点是——它是模型从海量文本中「学」出来的语义表征,而不是人工设计的。
Context Window 是不是越大越好?
理论上是的,但有两个代价:① 响应更慢、费用更高;② 模型对长文本中间部分的注意力会衰减(「Lost in the Middle」问题)。128K 对大多数场景够用了——除非你经常需要处理整本书或整个代码库。
Hallucination 能彻底解决吗?
目前不能。RAG、Grounding 等方法可以大幅减少幻觉,但做不到 100% 消除。根本原因在于——LLM 的本质是「预测最可能的文本」,不是「查证真实的事实」。把 LLM 当草稿生成器是正确用法;当搜索引擎是危险用法。
参数越多,模型就越聪明吗?
不一定。Chinchilla 定律指出:在固定算力预算下,模型大小和训练数据量有一个最优比例。很多大模型其实是「欠训练」的——参数很多,数据没喂够。行业趋势正在从「堆参数」转向「小模型 × 高质量数据 × 更长训练」。
9. 结语 {#9}
三个月后,小陈重新出现在了我的面试间。这一次,他不仅知道 Context Window 是什么,还能讲清楚它和 Attention 机制的关系、为什么长文本中间注意力会衰减、以及不同模型处理超长文本的策略差异。
他拿到了 Offer。年薪涨了 60%。
概念不是用来背的——它是用来让你看清底层逻辑的。当你能把 LLM 还原成一个概率预测系统、把 Embedding 还原成空间中的向量运算、把 Hallucination 还原成「概率高 ≠ 真实」时,你就不是在「使用 AI」了——你是在「理解 AI」。
而这就是这两种人之间最本质的区别。
📬 下一篇预告:《AI 术语扫盲(二):Prompt Engineering、RAG、Few-shot、CoT——用好 LLM 的 6 个核心概念》
你在面试或工作中,被问到的最让你懵的 AI 概念是什么?评论区见。