可视化专区

核心 AI 概念的交互式动画,帮你真正理解抽象原理 · 共 15 个可视化

Transformer 自注意力机制

第 3 章

悬停探索注意力热图,切换多头视角,直观感受 Q/K/V 如何捕捉语言中的依存关系

Q/K/V 矩阵多头注意力注意力热图

位置编码热图

第 3 章

点击热图格子查看 sin/cos 位置编码数值,切换曲线模式观察不同频率维度如何随位置变化

正弦编码频率分析RoPE 对比

反向传播梯度流动

第 2 章

逐步演示前向传播、损失计算、链式法则求导到权重更新的完整过程,悬停查看每个连接的梯度数值

梯度下降链式法则权重更新

梯度下降优化器对比

第 2 章

在 2D 损失曲面上同时展示 SGD、Momentum、RMSProp、Adam 的收敛轨迹,动态演示各优化器收敛速度差异

SGDAdam收敛轨迹
ƒ

激活函数与梯度消失

第 2 章

对比 Sigmoid、Tanh、ReLU、Leaky ReLU、GELU 函数曲线及其导数,开启导数模式直观理解梯度消失问题

ReLUGELU梯度消失
🎲

LLM 采样策略

第 8 章

实时调整 Temperature / Top-K / Top-P,观察候选词概率分布变化,点击采样按钮模拟真实生成过程

TemperatureTop-P核采样

Transformer 完整数据流

第 3 章

逐层点击展示 Token 从 Embedding 到输出 Logits 的完整前向传播,查看每层公式、维度变化与作用

前向传播残差连接维度变化

词向量语义空间

第 4 章

2D 语义聚类散点图,悬停查看近邻词,一键演示 king−man+woman=queen 向量类比运算

Word2Vec语义类比向量空间

BPE 分词过程

第 4 章

逐步演示 Byte Pair Encoding 字符对合并操作,观察子词词表是如何从字符级一步步构建出来的

BPE子词切分OOV 处理

LoRA 低秩矩阵分解

第 6 章

拖动秩 r 滑块,对比全参微调与 LoRA 的参数量差异,热图可视化 W₀、A、B 矩阵及合并后的权重

低秩分解参数高效QLoRA

RLHF 三阶段流程

第 7 章

逐步演示 SFT → 奖励模型训练 → PPO 对齐三个阶段,揭示 ChatGPT 式模型「被训练出来」的完整过程

SFT奖励模型PPO

KV Cache 推理加速

第 8 章

动画对比有无 KV Cache 时自回归生成的计算量差异,直观理解为何 Cache 能将推理从 O(n²) 降至 O(n)

KV Cache推理加速显存管理

模型量化精度对比

第 8 章

切换 FP32/INT8/INT4 等格式,对比权重直方图、量化误差与 7B/70B 模型显存占用的实时变化

INT4/INT8量化误差显存压缩

MoE 混合专家路由

第 10 章

选择不同 Token 观察路由器如何动态分配 Top-2 专家,对比稀疏激活与 Dense 模型的参数效率差异

稀疏激活专家路由Mixtral

RAG 检索增强全流程

第 9 章

可视化向量空间中的语义检索,逐步演示 Embedding → 相似度检索 → 上下文增强 → LLM 生成的完整 RAG 链路

向量检索文档召回增强生成