◎ 交互式可视化

Transformer 自注意力机制

Transformer 中每个词通过 Q/K/V 矩阵 计算与其他词的相关性。 不同的「注意力头」捕捉不同类型的语言模式——主谓关系、修饰关系、远程依存…… 下面通过真实例子来感受这个过程。

选择示例句子:

切换注意力头(每个头捕捉不同语言模式):

主语「猫」高度关注动词「坐」,捕捉主谓依存关系

悬停任意格子查看权重数值 · 颜色越亮 = 注意力权重越高

垫子
垫子
← 被关注的词 (Key)
↑ 发出注意力的词 (Query)

自注意力机制原理

Query (Q)

「我想关注什么?」每个词生成一个查询向量,表达自己的检索意图

Key (K)

「我能提供什么?」每个词生成一个键向量,描述自己的语义内容

Value (V)

「我实际携带的信息」加权求和后形成新的词表示

Attention(Q,K,V) = softmax(QKT / √dk) · V

延伸学习

→ 阅读第 3 章《Transformer 架构深度解析》,了解多头注意力和位置编码的完整原理

→ 现实中的大模型(如 GPT-4)有 96 层、96 个注意力头,每个头学到的模式远比这里复杂

Flash Attention 通过分块计算显著降低内存消耗,是当前推理优化的核心技术