大语言模型:AI 如何学会"说话"
想象一下,有一个朋友读遍了互联网上的每一本书、每一篇文章、每一条评论。你问它任何问题——从"黑洞是什么?"到"帮我写一首关于夏天的小诗"——它都能给出一个像模像样的回答。这个朋友不是一个人类,它是一个大语言模型(LLM)。但它到底是怎么"学会"这一切的?它真的"理解"语言吗?让我们一起走进 LLM 的世界,揭开它神秘的面纱!
什么是大语言模型?
大语言模型(Large Language Model,简称 LLM)是一种人工智能程序,它最擅长的事情就是理解和生成人类的语言。
你也许已经用过 LLM 了——ChatGPT、文心一言、通义千问,这些都是 LLM 的典型代表。它们可以:
- 💬 和你聊天、回答问题
- ✍️ 写文章、诗歌、故事
- 🌐 翻译不同语言
- 💻 编写和解释代码
- 🧠 总结长篇文章的要点
但 LLM 并不是一个"知识库"——它不会把答案存储在一个巨大的表格里然后去查找。它的工作原理更像是一个超级猜词游戏:给它一段文字,它预测接下来最可能出现的词是什么。
LLM 的本质是一个"下一个词预测器"。它不存储答案,而是根据它读过的海量文本,计算出在当前上下文中,哪个词最应该出现在下一个位置。这个简单的机制,经过大规模训练后,产生了令人惊叹的语言能力。
词语的"数字身份证"——分词
在 LLM 开始"阅读"之前,它需要先把文字转换成自己能理解的格式。这个过程叫做分词(Tokenization)。
什么是 Token?
Token 是 LLM 处理文本的最小单位。它不一定是一个完整的词——有时候一个词会被拆成好几个 token。
比如中文句子 "我喜欢吃苹果" 可能被切分成:
"我"→ Token 1"喜欢"→ Token 2"吃"→ Token 3"苹果"→ Token 4
每个 token 都会被分配一个独一无二的数字编号,就像每个人都有身份证号一样。LLM 只"看"这些数字,然后把它们转换成内部的数学表示。
为什么需要分词?
- 🔢 计算机只能处理数字,不能直接理解文字
- 🧩 分词把语言拆成可控的小块,让模型能高效学习
- 🌍 好的分词方法能让模型处理从未见过的词(通过拆成更小的子词)
了解更多:BPE 分词算法
现代 LLM 大多使用一种叫 BPE(Byte Pair Encoding,字节对编码) 的分词方法。
它的基本思路是:
- 从单个字符开始
- 统计哪些字符对最常一起出现
- 把最常见的字符对合并成一个新的 token
- 不断重复,直到词汇表达到预定大小
这就像把常用的词组"粘"在一起——比如 "tion" 在英文中非常常见,所以它可能成为一个独立的 token,而不需要每次都拆成 t + i + o + n。
Token ≠ 词。Token 是 LLM 的"字母表",它可以是一个完整的词、一个标点符号、一个字的偏旁部首,甚至是几个字母的组合。LLM 的一切操作都建立在 token 之上。
猜词游戏:LLM 如何预测下一个词
这是 LLM 最核心的秘密!LLM 生成文本的方式就是不断预测下一个 token。
一个简单的例子
假设我们给 LLM 这样一句话的开头:
"天空中飘着朵朵"
LLM 会根据它学到的知识,给每个可能的"下一个词"打分:
- 🥇
"白云"——概率最高(比如 42%) - 🥈
"乌云"——第二高(比如 18%) - 🥉
"彩霞"——第三(比如 8%) - ...还有成千上万个其他可能性
然后,LLM 根据这些概率随机选择一个词(不是永远选最高的那个!),把选中的词加到句子末尾,再用新的句子继续预测下一个词。
这就是为什么每次向 LLM 问同样的问题,你可能会得到不同的回答——因为它每次的选择都带有一定的随机性!
上面的公式表示:给定前面所有的词( 到 ),下一个词 出现的条件概率。LLM 的核心工作就是计算这个概率分布,然后从中采样。
🤔 想一想:如果 LLM 永远选择概率最高的那个词,会发生什么?
如果 LLM 永远只选概率最高的词,它生成的文本会变得非常无聊和重复——就像一个人每次说话都用最"安全"的词语。这种策略叫做"贪婪解码"(Greedy Decoding)。
加入一定的随机性(这个随机程度由"温度"参数控制),可以让 LLM 的回复更加多样化和有创造性。但随机性太高又会让回复变得混乱、前后矛盾。找到平衡点,是使用 LLM 的一个重要技巧!
LLM 的"大脑"里面有什么?
现在我们知道了 LLM 做什么(预测下一个 token),那它是怎么做到的呢?
LLM 的内部结构叫做神经网络(Neural Network),它受到人类大脑的启发——由大量简单的"神经元"组成,每个神经元只做非常简单的数学运算,但数十亿个神经元连接在一起,就能完成极其复杂的任务。
神经网络的结构
想象一个巨大的多层"三明治":
- 输入层:接收 token,把它们转换成数字向量
- 隐藏层:几十到上百层,每层包含数百万到数十亿个参数
- 输出层:输出每个可能的下一个 token 的概率
信息从输入层一层层传递到输出层,每经过一层都会进行数学变换,逐渐"理解"输入的含义。
参数:LLM 的"知识"
神经网络中的参数(parameters)就像一个个可以调节的"旋钮"。训练的过程就是不断调整这些旋钮,让模型的预测越来越准确。
参数越多,模型能学到的知识就越丰富、越细腻——但同时也需要更多的数据和计算资源。下面这张图展示了近年来主要 LLM 的参数量增长:
参数越多 ≠ 一定越好。虽然更大的模型通常能力更强,但它们也需要更多训练数据、更多电力、更贵的硬件。近年来,很多研究者致力于让小模型也具备强大能力,让 AI 更加高效和普及。
注意力机制:找到关键词
这是 LLM 最重要的"超能力"——注意力机制(Attention Mechanism)。
一个类比
想象你在读下面这个句子:
"小明把苹果给了小红,因为她很饿。"
当你在理解"她"指的是谁时,你的大脑会自动关注前面出现的人物——"小红",而不是"小明"或"苹果"。
注意力机制做的就是类似的事情:在处理每个词的时候,模型会同时"看"句子中的其他所有词,并决定哪些词与当前词最相关。
自注意力(Self-Attention)
LLM 使用的是"自注意力":句子中的每个词都会和所有其他词(包括自己)计算一个注意力权重——表示"我有多应该关注你"。
- 在理解
"她"时,注意力权重会集中在"小红"上 - 在理解
"吃"时,注意力权重会集中在"苹果"上 - 在理解代词、指代关系时,注意力机制至关重要
多头注意力(Multi-Head Attention)
LLM 不会只用一个"注意力视角",而是同时使用多个注意力头——每个头关注不同类型的语言特征:
- 🔍 一个头可能关注语法关系(主语-谓语)
- 🔍 另一个头可能关注指代关系(代词-先行词)
- 🔍 还有一个头可能关注语义相似性(近义词)
这些不同的"视角"合在一起,让 LLM 能够从多个维度理解语言的丰富含义。这就是 Transformer 架构的核心创新——也是 GPT 中"T"的真正含义!
注意力机制让 LLM 能够"看到"整个上下文,而不只是前一个词。这是它区别于传统语言模型的关键所在。无论句子有多长,注意力机制都能帮模型找到词语之间的关联。
LLM 是如何学习的?
LLM 的学习过程可以分成几个阶段,就像一个学生从"大量阅读"到"专项训练"的成长过程:
阶段一:预训练(Pre-training)——"海量阅读"
这是最耗时、最昂贵的阶段。LLM 被"喂"给来自互联网的海量文本——书籍、网页、文章、代码……可能达到数万亿个 token。
在这个阶段,模型的训练目标很简单:预测被遮住的(或下一个)词。通过无数次尝试和纠错,模型中的参数被不断调整,让它越来越擅长"猜词"。
这就像让一个学生读遍图书馆里的所有书——虽然没人直接教他语法规则,但他会逐渐"感觉"到什么句子是通顺的,什么词应该出现在什么语境中。
graph TD A["📚 收集海量文本数据"] --> B["🔧 预处理与分词"] B --> C["🏋️ 预训练 (Pre-training)"] C --> D["🎯 指令微调 (Fine-tuning)"] D --> E["👍 人类反馈强化学习 (RLHF)"] E --> F["🚀 部署使用"] C -.->|"计算成本最高<br/>需要数千块GPU<br/>持续数周到数月"| C
阶段二:指令微调(Instruction Fine-tuning)——"学会听指令"
预训练之后,模型很擅长"续写"文本,但它还不知道怎么回答问题或遵循指令。指令微调就是用大量"问题-答案"对来训练模型,让它学会:
- 当用户问问题时,应该给出有帮助的回答
- 当用户给出指令时,应该按照要求执行
- 当不确定时,应该诚实地表达不确定性
阶段三:RLHF(基于人类反馈的强化学习)——"对齐人类偏好"
这是让 LLM 变得"好用"的关键步骤。人类评估者会对模型的多个回答进行排名(哪个更好、更有用、更安全),然后模型学习人类的偏好。
了解更多:什么是 RLHF?
RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习) 是让 LLM 与人类价值观"对齐"的关键技术。
基本流程:
- 让模型对同一个问题生成多个不同回答
- 人类评估者对这些回答进行排名(不是打分,而是比较"哪个更好")
- 训练一个"奖励模型"来模仿人类的偏好
- 用这个奖励模型来指导 LLM 的进一步训练
这就是为什么 ChatGPT 的回答通常比原始 GPT-3 更有用、更安全——RLHF 让它学会了"什么样的回答是人类喜欢的"。
但 RLHF 也有争议:谁来定义"好"的标准?不同文化、不同价值观的人可能有不同的偏好。这是 AI 安全研究中的一个重要话题。
LLM 的学习是多阶段的:先通过海量阅读学会语言的基本规律(预训练),再通过针对性训练学会遵循指令和符合人类偏好(微调 + RLHF)。这三个阶段缺一不可。
考考你!
LLM 的核心机制就是"下一个 token 预测"。它不存储答案,也不联网搜索(除非特别配置),而是根据上下文计算每个可能的下一个词出现的概率,然后从中选择。
Token 不一定是完整的词。比如 "playing" 可能被拆成 "play" 和 "ing" 两个 token。中文也需要分词。Token 的数量通常比词的数量多。
注意力机制让模型在处理每个词时,能同时"看"到句子中的所有其他词,并根据相关性分配不同的注意力权重。这让模型能理解代词指代、语法关系等复杂的语言现象。
LLM 在生成文本时,会根据概率分布随机采样下一个词,而不是永远选择概率最高的那个。这种随机性让回复更加多样化和自然,但也意味着每次结果可能不同。这个随机程度由"温度"(temperature)参数控制。
总结:LLM 的"思维地图"
恭喜你!现在你已经了解了 LLM 的核心工作原理。让我们回顾一下这段旅程:
🗺️ LLM 知识地图
| 概念 | 一句话解释 |
|---|---|
| 大语言模型(LLM) | 一个超级"猜词"程序,能理解和生成人类语言 |
| Token(分词) | LLM 处理文本的最小单位,每个 token 有一个数字编号 |
| 下一个 Token 预测 | LLM 的核心机制:根据上文预测下文 |
| 神经网络 | LLM 的内部结构,由数十亿个可调参数组成 |
| 注意力机制 | 让 LLM 能关注句子中所有相关词语的能力 |
| 预训练 | 在海量文本上学习语言基本规律 |
| RLHF | 根据人类偏好调整模型行为,让它更有用、更安全 |
- LLM 不是魔法——它的核心只是"预测下一个 token",但这个简单的机制经过大规模训练后产生了惊人的智能表现。
- 注意力机制是 LLM 的关键创新——它让模型能够理解长距离的词语依赖关系,这是传统方法做不到的。
- LLM 是工具,不是真理之源——它可能会犯错、产生幻觉,也可能反映训练数据中的偏见。使用 LLM 时需要保持批判性思维!
🚀 下一步探索
LLM 的世界远不止这些!如果你对这个领域感兴趣,以下是一些可以继续探索的方向:
- 提示工程(Prompt Engineering):如何写出更好的提示词来让 LLM 给出更优质的回答
- 开源 LLM:在个人电脑上运行小型的开源模型(如 LLaMA、Mistral)
- 多模态模型:不仅能理解文字,还能"看"图像、"听"声音的 AI 模型
- AI 安全与伦理:如何确保 AI 的发展对人类有益
记住:理解工具的原理,才能更好地使用工具。你已经迈出了第一步!🎉