Tech 大模型量化可视化指南:从 FP32、INT8 到 GPTQ、GGUF 与 BitNet
用 60 张图理解大模型量化:数值表示、线性映射、校准、PTQ、GPTQ、GGUF、QAT、BitNet 与 1.58-bit LLM。
用 60 张图理解大模型量化:数值表示、线性映射、校准、PTQ、GPTQ、GGUF、QAT、BitNet 与 1.58-bit LLM。
从一张 FP16 位结构图切入,逐步解释指数偏置、二进制循环小数,以及 0.1 + 0.2 不等于 0.3 的根源。
基于 AI Trends (August 2026) — AI Trend Analysis, LLM Statistics & Industry Insights 最新数据快照,逐图解读 48 张 AI/LLM 趋势图表及其比较边界。
从人类控制点逐层上移的视角梳理 Prompt、Context、Harness 与 Loop Engineering,并说明内外循环、可靠闭环和 Multica 外循环控制面的关系。
分清 Billion、Giga、Byte 三套记号,并用一条公式快速估算不同精度 LLM 的纯权重空间。
区分 Agent 的任务规划能力与搜索服务的检索能力,梳理二者如何协作交付证据,并比较 SimpleQA、FreshQA、BrowseComp-ZH 与 XBench-DeepSearch 的评测边界。
沿着信息进入模型、形成上下文表示并生成输出的路径,理解 Encoder-Only、Decoder-Only 与 Encoder-Decoder 的结构差异、适用场景,以及视觉 Token 如何把图像接入语言模型。
介绍 Multica 的用途和自托管架构,说明 --with-server 安装脚本的工作流程,并记录 macOS 上的实际部署与运行方式。
以一块 16GB 显卡为例,梳理本地跑大模型的完整拼图:llama.cpp / vLLM / SGLang 推理引擎的分工,GGUF 格式与量化等级的取舍,以及国内用 hf-mirror + aria2 高速下载模型的实战方法。
在树莓派 5(aarch64、Debian 12)上安装 OpenAI Codex CLI 的完整实录:先探测各关键域名在直连与代理下的可达性,再用 npmmirror 镜像绕开 GitHub Release 的慢速下载,最后处理 fish shell 的代理包装与 headless 环境下的设备授权登录。