Tech Transformer 推理系列(一):从 Attention 到 KV Cache
从 Q/K/V 的投影含义、多头注意力的独立 softmax,到 GQA/MQA、Decoding KV Cache 与输出稳定性,系统梳理 Transformer 注意力机制。
从 Q/K/V 的投影含义、多头注意力的独立 softmax,到 GQA/MQA、Decoding KV Cache 与输出稳定性,系统梳理 Transformer 注意力机制。
从局部编码加速为何没有缩短需求交付出发,梳理快手万人研发团队如何用研发地基、流程重构、成熟度分级和效能度量推动组织级 AI 转型。
解释机器学习框架为何需要计算图和自动微分,以及现代框架如何兼顾即时执行、编译优化与大模型分布式运行。
拆解 GPT 的 embedding、Attention 和 FFN 参数,推导参数量近似公式,并说明参数量如何转化为权重与真实推理显存。
解释大语言模型如何通过行动闭环、工具协议、状态管理和上下文工程变成可执行、可控制的智能体系统。
从向量与矩阵的几何含义出发,厘清线性变换、仿射变换、左右乘约定、激活函数与多种归一化操作在神经网络中的不同角色。
用一套形状推导方法串起 PyTorch Tensor 的 dim、softmax、transpose、squeeze、view、NumPy 互转与批量矩阵乘法。
从 QKV 与多头注意力出发,串起 decoder-only、训练并行、Prefill/Decode、KV Cache、PagedAttention、Prefix Caching 与 PD 分离。
沿着表示学习、预训练、上下文学习与人类反馈四条线,解释 NLP 如何从每个任务单独建模演进为用一个通用模型响应自然语言指令。
沿着统计模型、传统机器学习和深度学习的演进顺序,科普算法如何表示数据、学习规律,并解决非线性与泛化问题。