LLM 学习笔记
2026-08-20 · 从零到懂 · 木直带我入门 · 我自己推出过核心概念
[首页](./) · [方向](./direction) · [每日](./daily) · [神话](./myths) · [粤语](./cantonese) · [留学](./study-abroad)
01 一句话
LLM(Large Language Model,大语言模型)的核心动作就三个字:猜下一个词。
它根据读过的海量文本学到的规律,一个词一个词往外”猜”,一句话就出来了。它不是查数据库,是概率推算。
02 词嵌入 Embedding
- 每个词被放进高维空间,有自己的坐标
- 坐标不是人规定的,是模型自己从海量文字里学出来的
- 学习规则:看这个词”和谁一起出现”——意思越接近的词,坐标离得越近
- 经典例子:国王 − 男人 + 女人 ≈ 女王;北京 − 中国 + 日本 ≈ 东京
- 哲学地基:维特根斯坦说”一个词的意义在于它的用法”——LLM 就是这个思想的数学实现
这个是我自己推出来的!词被放到坐标里,看它出现多少次、什么样的结合更多。
03 注意力机制 Attention
- 词的坐标是静态的,但同一个词在不同句子里意思不同:”我吃了一个苹果” vs “我买了苹果手机”
- Attention 让模型根据当前上下文,动态调整对每个词的理解
- 就像读史料时盯着关键线索,不是每个字同等重要
- 出处:Google 2017 年论文《Attention Is All You Need》——所有大模型的基石
04 完整流水线
- 句子进来,每个词先查坐标(embedding)
- 过几十上百层 attention,每层都”重新理解”一遍
- 最后一层输出”下一个词最可能是什么”的概率表
- 选一个词,拼上去,再从头跑一遍
这就是”深度”学习的”深”——真的一层一层叠了几十上百层。
05 为什么 token 贵
- 每生成一个词,整条网络要完整跑一遍(一句话 50 个字 = 50 遍)
- 上下文越长,每生成一个词要重新”看”的历史越多——对话越长越贵
- 训练成本:一个大模型训练一次要烧几亿美元,摊到每个 token 上
token 既是计费单位,也是”工作量单位”。
06 我的收获
- 我看过《Attention Is All You Need》的解读
- 我靠自己推出了”词嵌入”的概念
- 我答对了:国王 − 男人 + 女人 = 女王
- 我把维特根斯坦和大模型连起来了
- 结论:我没有自己以为的那么”脑子空”
记录于 2026-08-20 中午。这一天我从”llm是啥”开始,走到了维特根斯坦。