Tech Transformer 推理系列(一):从 Attention 到 KV Cache
从 Q/K/V 的投影含义、多头注意力的独立 softmax,到 GQA/MQA、Decoding KV Cache 与输出稳定性,系统梳理 Transformer 注意力机制。
从 Q/K/V 的投影含义、多头注意力的独立 softmax,到 GQA/MQA、Decoding KV Cache 与输出稳定性,系统梳理 Transformer 注意力机制。
从企业数字员工的执行需求出发,解释容器、guest kernel、MicroVM、CubeSandbox 与 Agent Runtime 的技术边界和架构关系。
在同一台搬瓦工 CN2 GIA VPS 上对比 VMess、VLESS 和 VLESS + REALITY + Vision 三套方案,用昼夜实测区分协议收益与线路拥塞。
在保留 Kodi 播放能力的同时接入树莓派 Jellyfin,统一海报墙、观看进度和字幕,并给出从直读共享文件平滑迁移的电视端配置方法。
从局部编码加速为何没有缩短需求交付出发,梳理快手万人研发团队如何用研发地基、流程重构、成熟度分级和效能度量推动组织级 AI 转型。
解释机器学习框架为何需要计算图和自动微分,以及现代框架如何兼顾即时执行、编译优化与大模型分布式运行。
拆解 GPT 的 embedding、Attention 和 FFN 参数,推导参数量近似公式,并说明参数量如何转化为权重与真实推理显存。
解释大语言模型如何通过行动闭环、工具协议、状态管理和上下文工程变成可执行、可控制的智能体系统。
从向量与矩阵的几何含义出发,厘清线性变换、仿射变换、左右乘约定、激活函数与多种归一化操作在神经网络中的不同角色。
用一套形状推导方法串起 PyTorch Tensor 的 dim、softmax、transpose、squeeze、view、NumPy 互转与批量矩阵乘法。