从一句翻译,看懂完整计算链

看得见的
Transformer

以“我爱水课 → I love easy courses”为例,逐帧观察 token 如何变成向量、注意力、概率和梯度。

切换步骤 Space 播放 / 暂停
输入
#1#2#3#4
右移目标
<BOS>t0It1lovet2easyt3coursest4
监督标签Iloveeasycourses<EOS>
STEP 01 · TOKENIZATION01 / 09

一句话,拆成四个可计算的 token

源句按汉字切分;训练目标按英文单词切分。解码器看到的是右移后的正确答案,而监督标签整体向左错一位。

OPERATION我爱水课 → [我, 爱, 水, 课]源序列 4 tokens · 目标序列 5 positions

源 token 的示例 one-hot 嵌入

每行对应一个汉字,每列是 d_model 的一个维度。

d₀d₁d₂d₃
1.0000000
01.000000
001.00000
0001.0000
!

训练时加入 <BOS> 作为起点,用 <EOS> 教模型何时停止。

AFTER TRAINING

推理时,答案是一个词一个词长出来的

训练可以并行处理五个目标位置;真正翻译时只能从 <BOS> 开始,把上一步输出重新送回解码器。

<BOS>
I
love
easy
courses
<EOS>