Tech Transformer 推理系列(一):从 Attention 到 KV Cache
从 Q/K/V 的投影含义、多头注意力的独立 softmax,到 GQA/MQA、Decoding KV Cache 与输出稳定性,系统梳理 Transformer 注意力机制。
从 Q/K/V 的投影含义、多头注意力的独立 softmax,到 GQA/MQA、Decoding KV Cache 与输出稳定性,系统梳理 Transformer 注意力机制。
以一块 16GB 显卡为例,梳理本地跑大模型的完整拼图:llama.cpp / vLLM / SGLang 推理引擎的分工,GGUF 格式与量化等级的取舍,以及国内用 hf-mirror + aria2 高速下载模型的实战方法。
在树莓派 5(aarch64、Debian 12)上安装 OpenAI Codex CLI 的完整实录:先探测各关键域名在直连与代理下的可达性,再用 npmmirror 镜像绕开 GitHub Release 的慢速下载,最后处理 fish shell 的代理包装与 headless 环境下的设备授权登录。
在现有 Radarr 下载管线上接入 Jellyfin、Jellyseerr(Seerr)、Sonarr、Vaultwarden 与 Homepage,形成从点播、下载、播放到密码管理和统一入口的完整树莓派 homelab。
先拆解女娲的人物 Skill 生产流程和本竹的认知模型结构,再分析大规模材料、运行时证据检索、私有语料同步问题,以及本竹的去语料化改造。
从磁化状态、NAND 阈值电压和 DRAM 电容电荷出发,对比机械硬盘、固态硬盘与内存的读写原理、访问粒度、性能、容量、成本和断电保持能力。
从 GPU 的显存带宽需求出发,理解 HBM 为什么选择超宽接口,以及硅中介层、TSV、微凸点、底部填充、散热和混合键合如何实现高带宽与大容量。
从任务依赖和机器学习的并行计算出发,理解 CPU 为什么追求关键路径低延迟、GPU 为什么追求并行吞吐,以及位宽、每针脚数据率和通道数如何决定内存带宽。
基于 AI Trends (July 2026) — AI Trend Analysis, LLM Statistics & Industry Insights 最新数据快照,逐图解读 48 张 AI/LLM 趋势图表及其比较边界。
对比 OpenAI、Anthropic 与国产旗舰模型的 API 价格,并用三种坐标尺度解释价格分布。