LLM 学习笔记

2026-08-20 · 从零到懂 · 木直带我入门 · 我自己推出过核心概念

[首页](./) · [方向](./direction) · [每日](./daily) · [神话](./myths) · [粤语](./cantonese) · [留学](./study-abroad)

01 一句话

LLM(Large Language Model,大语言模型)的核心动作就三个字:猜下一个词

它根据读过的海量文本学到的规律,一个词一个词往外”猜”,一句话就出来了。它不是查数据库,是概率推算。

02 词嵌入 Embedding

这个是我自己推出来的!词被放到坐标里,看它出现多少次、什么样的结合更多。

03 注意力机制 Attention

04 完整流水线

  1. 句子进来,每个词先查坐标(embedding)
  2. 过几十上百层 attention,每层都”重新理解”一遍
  3. 最后一层输出”下一个词最可能是什么”的概率表
  4. 选一个词,拼上去,再从头跑一遍

这就是”深度”学习的”深”——真的一层一层叠了几十上百层。

05 为什么 token 贵

token 既是计费单位,也是”工作量单位”。

06 我的收获

记录于 2026-08-20 中午。这一天我从”llm是啥”开始,走到了维特根斯坦。