transformer 8 GPT 参数量从哪里来:结构拆解、估算公式与显存下限 2026/08/04 从 Transformer 到 KV Cache:注意力、推理阶段与前缀复用 2026/08/04 从词向量到 ChatGPT:预训练语言模型如何把 NLP 变成通用能力 2026/08/04 从输入表示到文本生成:Transformer 三类架构与多模态 Token 2026/07/27 Transformer 推理系列(三):从 PagedAttention 到 Prefix Caching 2026/06/13 Transformer 推理系列(二):从 Prefill 到 Decode 2026/06/13 Softmax:把分数变成概率分布 2026/06/13 Transformer 推理系列(一):从 Attention 到 KV Cache 2026/06/12