← 首页
United States (US) — Middle school (Grades 6–8, typical); learner level: Grades 6–8, varies by district

大语言模型:AI 如何学会"说话"

想象一下,有一个朋友读遍了互联网上的每一本书、每一篇文章、每一条评论。你问它任何问题——从"黑洞是什么?"到"帮我写一首关于夏天的小诗"——它都能给出一个像模像样的回答。这个朋友不是一个人类,它是一个大语言模型(LLM)。但它到底是怎么"学会"这一切的?它真的"理解"语言吗?让我们一起走进 LLM 的世界,揭开它神秘的面纱!

什么是大语言模型?

大语言模型(Large Language Model,简称 LLM)是一种人工智能程序,它最擅长的事情就是理解和生成人类的语言

你也许已经用过 LLM 了——ChatGPT、文心一言、通义千问,这些都是 LLM 的典型代表。它们可以:

  • 💬 和你聊天、回答问题
  • ✍️ 写文章、诗歌、故事
  • 🌐 翻译不同语言
  • 💻 编写和解释代码
  • 🧠 总结长篇文章的要点

但 LLM 并不是一个"知识库"——它不会把答案存储在一个巨大的表格里然后去查找。它的工作原理更像是一个超级猜词游戏:给它一段文字,它预测接下来最可能出现的词是什么。

KEY POINT
核心理解

LLM 的本质是一个"下一个词预测器"。它不存储答案,而是根据它读过的海量文本,计算出在当前上下文中,哪个词最应该出现在下一个位置。这个简单的机制,经过大规模训练后,产生了令人惊叹的语言能力。

词语的"数字身份证"——分词

在 LLM 开始"阅读"之前,它需要先把文字转换成自己能理解的格式。这个过程叫做分词(Tokenization)

什么是 Token?

Token 是 LLM 处理文本的最小单位。它不一定是一个完整的词——有时候一个词会被拆成好几个 token。

比如中文句子 "我喜欢吃苹果" 可能被切分成:

  • "我" → Token 1
  • "喜欢" → Token 2
  • "吃" → Token 3
  • "苹果" → Token 4

每个 token 都会被分配一个独一无二的数字编号,就像每个人都有身份证号一样。LLM 只"看"这些数字,然后把它们转换成内部的数学表示。

为什么需要分词?

  • 🔢 计算机只能处理数字,不能直接理解文字
  • 🧩 分词把语言拆成可控的小块,让模型能高效学习
  • 🌍 好的分词方法能让模型处理从未见过的词(通过拆成更小的子词)
演示 1 · s2·b2-demo
了解更多:BPE 分词算法

现代 LLM 大多使用一种叫 BPE(Byte Pair Encoding,字节对编码) 的分词方法。

它的基本思路是:

  1. 从单个字符开始
  2. 统计哪些字符对最常一起出现
  3. 把最常见的字符对合并成一个新的 token
  4. 不断重复,直到词汇表达到预定大小

这就像把常用的词组"粘"在一起——比如 "tion" 在英文中非常常见,所以它可能成为一个独立的 token,而不需要每次都拆成 t + i + o + n

KEY POINT
记住

Token ≠ 词。Token 是 LLM 的"字母表",它可以是一个完整的词、一个标点符号、一个字的偏旁部首,甚至是几个字母的组合。LLM 的一切操作都建立在 token 之上。

猜词游戏:LLM 如何预测下一个词

这是 LLM 最核心的秘密!LLM 生成文本的方式就是不断预测下一个 token。

一个简单的例子

假设我们给 LLM 这样一句话的开头:

"天空中飘着朵朵"

LLM 会根据它学到的知识,给每个可能的"下一个词"打分:

  • 🥇 "白云"——概率最高(比如 42%)
  • 🥈 "乌云"——第二高(比如 18%)
  • 🥉 "彩霞"——第三(比如 8%)
  • ...还有成千上万个其他可能性

然后,LLM 根据这些概率随机选择一个词(不是永远选最高的那个!),把选中的词加到句子末尾,再用新的句子继续预测下一个词。

这就是为什么每次向 LLM 问同样的问题,你可能会得到不同的回答——因为它每次的选择都带有一定的随机性!

上面的公式表示:给定前面所有的词(),下一个词 出现的条件概率。LLM 的核心工作就是计算这个概率分布,然后从中采样。

演示 2 · s3·b3-demo
🤔 想一想:如果 LLM 永远选择概率最高的那个词,会发生什么?

如果 LLM 永远只选概率最高的词,它生成的文本会变得非常无聊和重复——就像一个人每次说话都用最"安全"的词语。这种策略叫做"贪婪解码"(Greedy Decoding)。

加入一定的随机性(这个随机程度由"温度"参数控制),可以让 LLM 的回复更加多样化和有创造性。但随机性太高又会让回复变得混乱、前后矛盾。找到平衡点,是使用 LLM 的一个重要技巧!

LLM 的"大脑"里面有什么?

现在我们知道了 LLM 做什么(预测下一个 token),那它是怎么做到的呢?

LLM 的内部结构叫做神经网络(Neural Network),它受到人类大脑的启发——由大量简单的"神经元"组成,每个神经元只做非常简单的数学运算,但数十亿个神经元连接在一起,就能完成极其复杂的任务。

神经网络的结构

想象一个巨大的多层"三明治":

  • 输入层:接收 token,把它们转换成数字向量
  • 隐藏层:几十到上百层,每层包含数百万到数十亿个参数
  • 输出层:输出每个可能的下一个 token 的概率

信息从输入层一层层传递到输出层,每经过一层都会进行数学变换,逐渐"理解"输入的含义。

参数:LLM 的"知识"

神经网络中的参数(parameters)就像一个个可以调节的"旋钮"。训练的过程就是不断调整这些旋钮,让模型的预测越来越准确。

参数越多,模型能学到的知识就越丰富、越细腻——但同时也需要更多的数据和计算资源。下面这张图展示了近年来主要 LLM 的参数量增长:

KEY POINT
要点

参数越多 ≠ 一定越好。虽然更大的模型通常能力更强,但它们也需要更多训练数据、更多电力、更贵的硬件。近年来,很多研究者致力于让小模型也具备强大能力,让 AI 更加高效和普及。

注意力机制:找到关键词

这是 LLM 最重要的"超能力"——注意力机制(Attention Mechanism)

一个类比

想象你在读下面这个句子:

"小明把苹果给了小红,因为她很饿。"

当你在理解"她"指的是谁时,你的大脑会自动关注前面出现的人物——"小红",而不是"小明"或"苹果"。

注意力机制做的就是类似的事情:在处理每个词的时候,模型会同时"看"句子中的其他所有词,并决定哪些词与当前词最相关

自注意力(Self-Attention)

LLM 使用的是"自注意力":句子中的每个词都会和所有其他词(包括自己)计算一个注意力权重——表示"我有多应该关注你"。

  • 在理解 "她" 时,注意力权重会集中在 "小红"
  • 在理解 "吃" 时,注意力权重会集中在 "苹果"
  • 在理解代词、指代关系时,注意力机制至关重要
演示 3 · s5·b5-demo

多头注意力(Multi-Head Attention)

LLM 不会只用一个"注意力视角",而是同时使用多个注意力头——每个头关注不同类型的语言特征:

  • 🔍 一个头可能关注语法关系(主语-谓语)
  • 🔍 另一个头可能关注指代关系(代词-先行词)
  • 🔍 还有一个头可能关注语义相似性(近义词)

这些不同的"视角"合在一起,让 LLM 能够从多个维度理解语言的丰富含义。这就是 Transformer 架构的核心创新——也是 GPT 中"T"的真正含义!

KEY POINT
关键洞察

注意力机制让 LLM 能够"看到"整个上下文,而不只是前一个词。这是它区别于传统语言模型的关键所在。无论句子有多长,注意力机制都能帮模型找到词语之间的关联。

LLM 是如何学习的?

LLM 的学习过程可以分成几个阶段,就像一个学生从"大量阅读"到"专项训练"的成长过程:

阶段一:预训练(Pre-training)——"海量阅读"

这是最耗时、最昂贵的阶段。LLM 被"喂"给来自互联网的海量文本——书籍、网页、文章、代码……可能达到数万亿个 token

在这个阶段,模型的训练目标很简单:预测被遮住的(或下一个)词。通过无数次尝试和纠错,模型中的参数被不断调整,让它越来越擅长"猜词"。

这就像让一个学生读遍图书馆里的所有书——虽然没人直接教他语法规则,但他会逐渐"感觉"到什么句子是通顺的,什么词应该出现在什么语境中。

graph TD
  A["📚 收集海量文本数据"] --> B["🔧 预处理与分词"]
  B --> C["🏋️ 预训练 (Pre-training)"]
  C --> D["🎯 指令微调 (Fine-tuning)"]
  D --> E["👍 人类反馈强化学习 (RLHF)"]
  E --> F["🚀 部署使用"]
  C -.->|"计算成本最高<br/>需要数千块GPU<br/>持续数周到数月"| C

阶段二:指令微调(Instruction Fine-tuning)——"学会听指令"

预训练之后,模型很擅长"续写"文本,但它还不知道怎么回答问题遵循指令。指令微调就是用大量"问题-答案"对来训练模型,让它学会:

  • 当用户问问题时,应该给出有帮助的回答
  • 当用户给出指令时,应该按照要求执行
  • 当不确定时,应该诚实地表达不确定性

阶段三:RLHF(基于人类反馈的强化学习)——"对齐人类偏好"

这是让 LLM 变得"好用"的关键步骤。人类评估者会对模型的多个回答进行排名(哪个更好、更有用、更安全),然后模型学习人类的偏好。

了解更多:什么是 RLHF?

RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习) 是让 LLM 与人类价值观"对齐"的关键技术。

基本流程:

  1. 让模型对同一个问题生成多个不同回答
  2. 人类评估者对这些回答进行排名(不是打分,而是比较"哪个更好")
  3. 训练一个"奖励模型"来模仿人类的偏好
  4. 用这个奖励模型来指导 LLM 的进一步训练

这就是为什么 ChatGPT 的回答通常比原始 GPT-3 更有用、更安全——RLHF 让它学会了"什么样的回答是人类喜欢的"。

但 RLHF 也有争议:谁来定义"好"的标准?不同文化、不同价值观的人可能有不同的偏好。这是 AI 安全研究中的一个重要话题。

KEY POINT
记住

LLM 的学习是多阶段的:先通过海量阅读学会语言的基本规律(预训练),再通过针对性训练学会遵循指令和符合人类偏好(微调 + RLHF)。这三个阶段缺一不可。

考考你!

QUIZ
LLM 生成文本的基本方式是什么?

LLM 的核心机制就是"下一个 token 预测"。它不存储答案,也不联网搜索(除非特别配置),而是根据上下文计算每个可能的下一个词出现的概率,然后从中选择。

QUIZ
关于 Token(分词),以下哪项是正确的?

Token 不一定是完整的词。比如 "playing" 可能被拆成 "play" 和 "ing" 两个 token。中文也需要分词。Token 的数量通常比词的数量多。

QUIZ
注意力机制(Attention)的作用是什么?

注意力机制让模型在处理每个词时,能同时"看"到句子中的所有其他词,并根据相关性分配不同的注意力权重。这让模型能理解代词指代、语法关系等复杂的语言现象。

QUIZ
为什么每次问 LLM 同样的问题,可能会得到不同的回答?

LLM 在生成文本时,会根据概率分布随机采样下一个词,而不是永远选择概率最高的那个。这种随机性让回复更加多样化和自然,但也意味着每次结果可能不同。这个随机程度由"温度"(temperature)参数控制。

总结:LLM 的"思维地图"

恭喜你!现在你已经了解了 LLM 的核心工作原理。让我们回顾一下这段旅程:


🗺️ LLM 知识地图

概念 一句话解释
大语言模型(LLM) 一个超级"猜词"程序,能理解和生成人类语言
Token(分词) LLM 处理文本的最小单位,每个 token 有一个数字编号
下一个 Token 预测 LLM 的核心机制:根据上文预测下文
神经网络 LLM 的内部结构,由数十亿个可调参数组成
注意力机制 让 LLM 能关注句子中所有相关词语的能力
预训练 在海量文本上学习语言基本规律
RLHF 根据人类偏好调整模型行为,让它更有用、更安全

KEY POINT
最重要的三件事
  1. LLM 不是魔法——它的核心只是"预测下一个 token",但这个简单的机制经过大规模训练后产生了惊人的智能表现。
  2. 注意力机制是 LLM 的关键创新——它让模型能够理解长距离的词语依赖关系,这是传统方法做不到的。
  3. LLM 是工具,不是真理之源——它可能会犯错、产生幻觉,也可能反映训练数据中的偏见。使用 LLM 时需要保持批判性思维!

🚀 下一步探索

LLM 的世界远不止这些!如果你对这个领域感兴趣,以下是一些可以继续探索的方向:

  • 提示工程(Prompt Engineering):如何写出更好的提示词来让 LLM 给出更优质的回答
  • 开源 LLM:在个人电脑上运行小型的开源模型(如 LLaMA、Mistral)
  • 多模态模型:不仅能理解文字,还能"看"图像、"听"声音的 AI 模型
  • AI 安全与伦理:如何确保 AI 的发展对人类有益

记住:理解工具的原理,才能更好地使用工具。你已经迈出了第一步!🎉

继续探索