零 基 础 · 可 视 化 · 可 动 手

大语言模型,
其实只是一台「文字接龙机」

不用公式、不用代码。通过 8 个可以亲手玩的小实验,
你会真正看懂 ChatGPT 这样的 AI 是怎么"思考"的。

开始探索 ↓
向下滚动
01 · 核心本质

它只做一件事:猜下一个词

忘掉"人工智能"这个吓人的词。大模型做的唯一一件事就是:给定前面的文字,计算每个可能的下一个词的概率,然后挑一个接上去。不断重复这个动作,就"写"出了整篇文章。点击按钮,亲眼看它接龙:

下方的概率条就是模型的"大脑输出"——每一步它都在为所有候选词打分。

深入一步:分数是怎么变成概率的?

上面那张概率表不是模型直接吐出来的。模型内部先给每个候选词打一个原始分数(logit), 可正可负、没有上限。然后用一个叫 Softmax 的公式把它变成概率: P(词) = e分数 ÷ 所有词的 e分数 之和。 指数放大会让"强者更强"。拖动滑块改变每个词的原始分数,看概率怎么此消彼长:

注意:一个词的分数升高,其他所有词的概率都会被挤压——因为总和永远是 100%。这就是 Softmax 的"零和"特性。

02 · 模型的眼睛

它看到的不是文字,是碎片(Token)

模型读不懂"字"和"词",它先把文本切成一个个小碎片,叫 Token。每个 Token 对应一个数字编号。在模型眼里,你打的一句话其实是一串数字,比如 [520, 1314, 88, 2046]。试着输入任何文字,看它如何被切碎:

03 · 模型的"感觉"

意思被变成了空间里的坐标

切碎之后,每个 Token 会被转换成一个由几百上千个数字组成的向量——可以想象成地图上的坐标。意思越相近的词,坐标越靠近。把下面的词画在一张简化的二维地图上看看(真实模型用的是上千维空间):

注意看:动物聚成一团,皇室词汇聚成一团,水果聚成一团——这不是人告诉它的,是它从海量文本里自己"感觉"出来的。

国王 男人+ 女人= 女王

更神奇的是:向量还能做算术!模型发现"国王−男人+女人"指向的位置,正好站着"女王"。语义关系被编码成了几何关系。

04 · 超级武器

注意力机制:读每个词时,知道该看谁

2017 年的 Transformer 架构靠"注意力(Attention)"一举改变了 AI。它让模型在处理每个词时,都能回头看整句话,判断哪些词跟自己最相关。下面这句话里有两个"他",把鼠标悬停(或点击)在任意词上,看看模型在理解它时关注了谁:

关注很强
关注中等
关注很弱

悬停在「他」上试试——模型正是靠这种连线搞懂了"他"指谁,这也是它能写长文、能聊上下文的原因。

深入一步:不是一个头,而是一群头

真实模型里,上面这种"互看"机制会同时跑很多份,每份叫一个注意力头(Attention Head), 各自学会关注不同种类的关系——有的专管指代(他=谁),有的专管语法搭配,有的专管位置顺序。 最后把所有头的观察结果拼起来,才是完整的理解。点击下面的头,切换它们的"视角":

GPT-3 的每一层有 96 个这样的头,一共 96 层——近万个"观察员"同时工作。

05 · 全景地图 · 动画演示

跟着一个 Token,走完 Transformer 全程

前面几节我们认识了所有零件。现在把它们运转起来——跟着「今天的天气很」这句话,亲眼看它如何被切碎、翻译、加工,最后"长"出下一个词。点击播放:

就绪点击「播放旅程」,动画将带你走完一句话在模型内部的完整一生。
分词 = 第 2 节数字身份证向量 = 第 3 节注意力 = 第 4 节前馈消化概率表 = 第 1 节

动画里发生的每一步,都对应前面某一节讲过的零件——这就是把整本书串起来的一刻。

06 · 它是怎么学会的 · 全景拆解

训练一个 ChatGPT,要过四道关卡

从一堆杂乱的互联网文字,到一个会聊天、懂分寸的助手,要经历四个阶段。每一关解决的问题完全不同——这一节我们把每一关拆开细看,每个都可以动手玩。

STAGE 0
数据清洗
从互联网的垃圾场里淘出黄金教材
STAGE 1
预训练
万亿次完形填空 → 学会语言+知识
STAGE 2
指令微调 SFT
看人工范例 → 学会听指令办事
STAGE 3
对齐 RLHF/DPO
人类打分 → 学会什么是"好回答"
第 0 关:数据清洗 —— 垃圾进,垃圾出

原始互联网文本里充满了广告、乱码、复读机内容。直接喂给模型,它就会学成喷子+营销号。 所以第一步是大规模清洗。点击按钮,模拟一次清洗过程:

原始抓取:60 份网页文本(广告 / 乱码 / 重复 / 正经内容混在一起)
过滤
去低质
删掉广告、乱码、机器生成的垃圾、过短过长的内容。
去重
去重复
网上大量内容是互相抄的。重复数据会让模型浪费算力学同一件事。
配比
调比例
像配营养餐:网页+书籍+论文+代码按比例混合,决定模型的"知识结构"。

真实规模:GPT-3 训练前把 45TB 原始文本清洗到只剩 570GB —— 扔掉了 98.7%。数据质量比数量更重要,是今天所有大模型公司的共识。

第 1 关:预训练(Pre-training)—— 完形填空练出"语感"

这是最烧钱的一关:GPT-4 级别模型的预训练花费据估计超过 1 亿美元。 玩法就是第 1 节那个猜词游戏,但重复几万亿次。具体怎么"练"?看下面这个微观循环:

① 输入一句话,遮住最后一个词
"巴黎是法国的首___"
② 模型猜:都 40% · 市 30% · 城 15%…
一开始是乱猜,正确答案「都」概率不高
③ 计算损失(Loss)
"错的有多离谱"被打成一个分数:猜得越偏,Loss 越大
④ 反向传播:微调所有参数
像拧旋钮一样,把上千亿个参数各自拧动一丝丝,让「都」的概率下次变高一点点
↻ 换一句话,再来一遍…… × 3,000,000,000,000 次
GPT-3 读了约 3000 亿个 Token;更新的模型超过 10 万亿

所谓"参数",就是上面说的旋钮。GPT-3 有 1750 亿个。 下面是一小面"旋钮墙"(48 个作示意)和真实的训练过程:点击"开始训练",看旋钮被一点点拧动、错误率随之下降:

关键认知:这一关结束后的模型叫基座模型(Base Model)——它博古通今但不会聊天。你问它问题,它可能把问题也接龙一遍。它还需要下一关。

第 2 关:指令微调(SFT)—— 从"接龙机"到"助手"

人类专家手写成千上万条"标准问答范例"(问题 + 理想回答), 让基座模型继续做完形填空——但这次只学这些范例。几十万个范例就能让它脱胎换骨。 一条训练数据长这样:

{ "role": "user", "content": "怎么学习编程?" }, { "role": "assistant", "content": "可以分四步走:① 选一门入门语言…" } ← 模型要学着把 assistant 部分一字不差地"猜"出来

微调前后差别有多大?点按钮切换看看(同一个问题):

SFT 只用预训练 1% 不到的数据量,却教会了模型"对话的格式"——但回答的品味和分寸还没保证,这是下一关的事。

第 3 关:对齐(RLHF / DPO)—— 学会"什么叫好"

SFT 之后模型会回答了,但可能啰嗦、冒犯、或教人干坏事。怎么定义"好回答"?没法写成规则—— 于是让真人当评委:两个回答摆在一起,你选哪个好?现在你就是评委,认真选三次:

一表总结:四关各自解决什么问题
阶段学什么数据规模成本占比像什么
数据清洗准备干净教材45TB → 570GB淘金沙
预训练语言能力 + 世界知识数千亿~十万亿 Token≈99%九年义务教育
SFT对话格式、听指令几万~几十万条范例<1%入职培训
RLHF/DPO品味、分寸、价值观几万~几十万条偏好<1%师傅带徒弟

所以你平时用的 ChatGPT / Claude / 豆包 = 基座模型 + SFT + 对齐。所谓"开源模型"(如 Llama、Qwen)通常开放的是基座+SFT 版本。

07 · 创造力的旋钮

同一个问题,答案为什么每次不一样

还记得第 1 节那张概率表吗?模型可以每次都选概率最高的词(很"乖"),也可以故意给低概率的词一些机会(很"野")。控制这个乖/野程度的旋钮叫温度(Temperature)。拖动滑块,再点"抽一个词"感受差别:

上文:「今天天气很」→ 下一个词抽谁?
温度 0.3
低:保守、稳定、几乎不变高:发散、创意、可能离谱
「今天天气很 ___」

写文章、写代码时用低温度求稳;头脑风暴、写诗时用高温度求新。

08 · 避坑指南

现在,你可以看穿这些常见误解

理解了原理,下面这些流行说法你就能自己判断对错了:

"AI 像搜索引擎一样,在数据库里查答案"
不对。模型里没有存任何一篇文章。它只是把"文字的统计规律"压缩进了上千亿个参数。每次回答都是现场一个字一个字现编的(回想第 1 节的接龙)。所以它既能写出从未存在过的诗,也会一本正经地编造不存在的事实。
"AI 像人一样真正理解了我说的话"
要打个问号。它没有意识、没有情绪、没有目的,有的只是一张极其精密的"词语关联地图"(第 3、4 节)。它的"理解"和我们的理解是不是一回事,科学界还在争论。但可以确定的是:它不会累、不会烦、也不会真的在乎你
"AI 说的肯定是对的,它那么聪明"
危险的想法。它的目标是"接出最像人话的词",而不是"说出真话"。当知识有缺口时,它不会说"我不知道",而是按概率编一个看起来最合理的——这叫"幻觉"。查论文、查法条、查数据这类事,一定要核实原始来源。
"同一个问题问两遍,答案必须一样"
不会一样。生成过程自带"掷骰子"环节(第 7 节的温度和采样)。这不是 bug,而是特性——正是这点随机性让它能创作,而不是复读机。
那……它到底厉害在哪?
厉害在:一个简单到可笑的规则(猜下一个词),在足够大的数据和算力下,竟然涌现出了推理、翻译、编程、创作的能力。就像亿万个简单的神经元涌现出了人类智能一样——这至今仍让科学家们感到震撼和好奇。