Tech Transformer 推理系列(一):从 Attention 到 KV Cache
从 Q/K/V 的投影含义、多头注意力的独立 softmax,到 GQA/MQA、Decoding KV Cache 与输出稳定性,系统梳理 Transformer 注意力机制。
从 Q/K/V 的投影含义、多头注意力的独立 softmax,到 GQA/MQA、Decoding KV Cache 与输出稳定性,系统梳理 Transformer 注意力机制。
以节点、边和结构化状态解释 Graph Engineering,说明它与 Loop Engineering、LangGraph、Claude Code workflow 和 Multica 控制面的关系,并梳理适用边界。
用 60 张图理解大模型量化:数值表示、线性映射、校准、PTQ、GPTQ、GGUF、QAT、BitNet 与 1.58-bit LLM。
从一张 FP16 位结构图切入,逐步解释指数偏置、二进制循环小数,以及 0.1 + 0.2 不等于 0.3 的根源。
基于 AI Trends (August 2026) — AI Trend Analysis, LLM Statistics & Industry Insights 最新数据快照,逐图解读 48 张 AI/LLM 趋势图表及其比较边界。
从人类控制点逐层上移的视角梳理 Prompt、Context、Harness 与 Loop Engineering,并说明内外循环、可靠闭环和 Multica 外循环控制面的关系。
分清 Billion、Giga、Byte 三套记号,并用一条公式快速估算不同精度 LLM 的纯权重空间。
区分 Agent 的任务规划能力与搜索服务的检索能力,梳理二者如何协作交付证据,并比较 SimpleQA、FreshQA、BrowseComp-ZH 与 XBench-DeepSearch 的评测边界。
沿着信息进入模型、形成上下文表示并生成输出的路径,理解 Encoder-Only、Decoder-Only 与 Encoder-Decoder 的结构差异、适用场景,以及视觉 Token 如何把图像接入语言模型。
介绍 Multica 的用途和自托管架构,说明 --with-server 安装脚本的工作流程,并记录 macOS 上的实际部署与运行方式。