STEP 01 · TOKENIZATION01 / 09
一句话,拆成四个可计算的 token
源句按汉字切分;训练目标按英文单词切分。解码器看到的是右移后的正确答案,而监督标签整体向左错一位。
OPERATION
我爱水课 → [我, 爱, 水, 课]源序列 4 tokens · 目标序列 5 positions源 token 的示例 one-hot 嵌入
每行对应一个汉字,每列是 d_model 的一个维度。
d₀d₁d₂d₃
我1.0000000
爱01.000000
水001.00000
课0001.0000
!
训练时加入 <BOS> 作为起点,用 <EOS> 教模型何时停止。