Transformer 中每个词通过 Q/K/V 矩阵 计算与其他词的相关性。 不同的「注意力头」捕捉不同类型的语言模式——主谓关系、修饰关系、远程依存…… 下面通过真实例子来感受这个过程。
选择示例句子:
切换注意力头(每个头捕捉不同语言模式):
主语「猫」高度关注动词「坐」,捕捉主谓依存关系
悬停任意格子查看权重数值 · 颜色越亮 = 注意力权重越高
「我想关注什么?」每个词生成一个查询向量,表达自己的检索意图
「我能提供什么?」每个词生成一个键向量,描述自己的语义内容
「我实际携带的信息」加权求和后形成新的词表示
→ 阅读第 3 章《Transformer 架构深度解析》,了解多头注意力和位置编码的完整原理
→ 现实中的大模型(如 GPT-4)有 96 层、96 个注意力头,每个头学到的模式远比这里复杂
→ Flash Attention 通过分块计算显著降低内存消耗,是当前推理优化的核心技术