不用公式、不用代码。通过 8 个可以亲手玩的小实验,
你会真正看懂 ChatGPT 这样的 AI 是怎么"思考"的。
忘掉"人工智能"这个吓人的词。大模型做的唯一一件事就是:给定前面的文字,计算每个可能的下一个词的概率,然后挑一个接上去。不断重复这个动作,就"写"出了整篇文章。点击按钮,亲眼看它接龙:
下方的概率条就是模型的"大脑输出"——每一步它都在为所有候选词打分。
上面那张概率表不是模型直接吐出来的。模型内部先给每个候选词打一个原始分数(logit), 可正可负、没有上限。然后用一个叫 Softmax 的公式把它变成概率: P(词) = e分数 ÷ 所有词的 e分数 之和。 指数放大会让"强者更强"。拖动滑块改变每个词的原始分数,看概率怎么此消彼长:
注意:一个词的分数升高,其他所有词的概率都会被挤压——因为总和永远是 100%。这就是 Softmax 的"零和"特性。
模型读不懂"字"和"词",它先把文本切成一个个小碎片,叫 Token。每个 Token 对应一个数字编号。在模型眼里,你打的一句话其实是一串数字,比如 [520, 1314, 88, 2046]。试着输入任何文字,看它如何被切碎:
切碎之后,每个 Token 会被转换成一个由几百上千个数字组成的向量——可以想象成地图上的坐标。意思越相近的词,坐标越靠近。把下面的词画在一张简化的二维地图上看看(真实模型用的是上千维空间):
注意看:动物聚成一团,皇室词汇聚成一团,水果聚成一团——这不是人告诉它的,是它从海量文本里自己"感觉"出来的。
更神奇的是:向量还能做算术!模型发现"国王−男人+女人"指向的位置,正好站着"女王"。语义关系被编码成了几何关系。
2017 年的 Transformer 架构靠"注意力(Attention)"一举改变了 AI。它让模型在处理每个词时,都能回头看整句话,判断哪些词跟自己最相关。下面这句话里有两个"他",把鼠标悬停(或点击)在任意词上,看看模型在理解它时关注了谁:
悬停在「他」上试试——模型正是靠这种连线搞懂了"他"指谁,这也是它能写长文、能聊上下文的原因。
真实模型里,上面这种"互看"机制会同时跑很多份,每份叫一个注意力头(Attention Head), 各自学会关注不同种类的关系——有的专管指代(他=谁),有的专管语法搭配,有的专管位置顺序。 最后把所有头的观察结果拼起来,才是完整的理解。点击下面的头,切换它们的"视角":
GPT-3 的每一层有 96 个这样的头,一共 96 层——近万个"观察员"同时工作。
前面几节我们认识了所有零件。现在把它们运转起来——跟着「今天的天气很」这句话,亲眼看它如何被切碎、翻译、加工,最后"长"出下一个词。点击播放:
动画里发生的每一步,都对应前面某一节讲过的零件——这就是把整本书串起来的一刻。
从一堆杂乱的互联网文字,到一个会聊天、懂分寸的助手,要经历四个阶段。每一关解决的问题完全不同——这一节我们把每一关拆开细看,每个都可以动手玩。
原始互联网文本里充满了广告、乱码、复读机内容。直接喂给模型,它就会学成喷子+营销号。 所以第一步是大规模清洗。点击按钮,模拟一次清洗过程:
真实规模:GPT-3 训练前把 45TB 原始文本清洗到只剩 570GB —— 扔掉了 98.7%。数据质量比数量更重要,是今天所有大模型公司的共识。
这是最烧钱的一关:GPT-4 级别模型的预训练花费据估计超过 1 亿美元。 玩法就是第 1 节那个猜词游戏,但重复几万亿次。具体怎么"练"?看下面这个微观循环:
所谓"参数",就是上面说的旋钮。GPT-3 有 1750 亿个。 下面是一小面"旋钮墙"(48 个作示意)和真实的训练过程:点击"开始训练",看旋钮被一点点拧动、错误率随之下降:
关键认知:这一关结束后的模型叫基座模型(Base Model)——它博古通今但不会聊天。你问它问题,它可能把问题也接龙一遍。它还需要下一关。
人类专家手写成千上万条"标准问答范例"(问题 + 理想回答), 让基座模型继续做完形填空——但这次只学这些范例。几十万个范例就能让它脱胎换骨。 一条训练数据长这样:
微调前后差别有多大?点按钮切换看看(同一个问题):
SFT 只用预训练 1% 不到的数据量,却教会了模型"对话的格式"——但回答的品味和分寸还没保证,这是下一关的事。
SFT 之后模型会回答了,但可能啰嗦、冒犯、或教人干坏事。怎么定义"好回答"?没法写成规则—— 于是让真人当评委:两个回答摆在一起,你选哪个好?现在你就是评委,认真选三次:
| 阶段 | 学什么 | 数据规模 | 成本占比 | 像什么 |
|---|---|---|---|---|
| 数据清洗 | 准备干净教材 | 45TB → 570GB | 低 | 淘金沙 |
| 预训练 | 语言能力 + 世界知识 | 数千亿~十万亿 Token | ≈99% | 九年义务教育 |
| SFT | 对话格式、听指令 | 几万~几十万条范例 | <1% | 入职培训 |
| RLHF/DPO | 品味、分寸、价值观 | 几万~几十万条偏好 | <1% | 师傅带徒弟 |
所以你平时用的 ChatGPT / Claude / 豆包 = 基座模型 + SFT + 对齐。所谓"开源模型"(如 Llama、Qwen)通常开放的是基座+SFT 版本。
还记得第 1 节那张概率表吗?模型可以每次都选概率最高的词(很"乖"),也可以故意给低概率的词一些机会(很"野")。控制这个乖/野程度的旋钮叫温度(Temperature)。拖动滑块,再点"抽一个词"感受差别:
写文章、写代码时用低温度求稳;头脑风暴、写诗时用高温度求新。
理解了原理,下面这些流行说法你就能自己判断对错了: