Tech Transformer 推理系列(三):从 PagedAttention 到 Prefix Caching
接着 KV Cache、Prefill 和 Decode,继续理解 PagedAttention 与 Prefix Caching:它们分别解决显存利用率和跨请求前缀复用问题,以及为什么生成阶段通常不能直接复用别人的 KV。
接着 KV Cache、Prefill 和 Decode,继续理解 PagedAttention 与 Prefix Caching:它们分别解决显存利用率和跨请求前缀复用问题,以及为什么生成阶段通常不能直接复用别人的 KV。
以一个两层 Transformer 的例子完整拆解 LLM 推理中的 prefill 和 decode:每层如何写入和读取 KV Cache,为什么 prefill 是并行的,decode 为什么只算当前 token。
让 AI 帮你调 GitHub API 时,Token 很容易不小心出现在对话记录里。关键不是 AI 能不能拿到 Token,而是 Token 有没有出现在对话文本里。
记录 Chirpy Mermaid 节点 label 被裁修复:webfont 未就绪时测宽偏小。
从直觉、公式、数值例子、Sigmoid 对比和温度参数理解 Softmax:它如何把任意实数分数转换为概率分布。
一次完整的前端排查实录:用无头 Chromium 搭建截图验证闭环,从 Mermaid 文字被裁一路追到 webfont 时序、对比度、fonts.ready 假性 resolve、渲染早于容器创建、中文字符越界;最后停下来质疑这一路的补丁,用一行字体配置从根上消除“测宽字体≠绘制字体”,把两百行自愈逻辑删回一百行。
一次围绕 Tmux 重启后如何恢复 session 结构的实践记录:理解边界、安装插件、配置自动保存,并明确恢复流程。
一次将 README、AGENTS.md、CLAUDE.md 与项目内 skills 重新分层的实践记录。
一次由 ZeroOmega 弹窗引发的代理排查,最终发现根本不是代理配置问题,而是 GitHub 遥测服务本身从中国大陆访问返回 503。
一次 V2RayN 突然无法使用的排查过程,涉及 geosite.dat 文件错位、Windows 端口保留、V2RayN 多核心架构设计缺陷的深层分析。