Tech Transformer 推理系列(一):从 Attention 到 KV Cache
从 Q/K/V 的投影含义、多头注意力的独立 softmax,到 GQA/MQA、Decoding KV Cache 与输出稳定性,系统梳理 Transformer 注意力机制。
从 Q/K/V 的投影含义、多头注意力的独立 softmax,到 GQA/MQA、Decoding KV Cache 与输出稳定性,系统梳理 Transformer 注意力机制。
同样理解自然语言,大模型面向人的表达,Jev 面向程序的判断:从三个原语、完整调用到 Agent 平台分工与 Rerank 实测。
对照 Unstructured、Docling、RAGFlow、LangChain、LlamaIndex 和 Azure 的官方文档与源码,用同一份虚构表格展示实际预处理表示、切块参数、召回路径及能力边界。
从一次知识漏召回出发,理解 Ragas 与 TREC 的不同目标、标准构建和覆盖判定,进而设计适合私有知识库的 Evidence 评测与定位方法。
先理解 Spec、Plan、Tasks、Validation 的分工,再用共享相册案例完整走过需求、方案、实现、验收与需求变更,最后介绍 Codex 接入和团队协作。
按 MCP 2026-07-28 规范,以 Memos 为例对比 REST 与 MCP 的请求响应、工具发现和输入输出契约,解释 stdio、Streamable HTTP,并以 HATEOAS 番外区分操作发现与业务决策。
从 CPython 的 GIL 讲起:Java 线程既能并发也能并行,默认启用 GIL 的单个 CPython 解释器只能并发;threading 和 asyncio 都走这条路,协程在调度上像单条 carrier 上的虚拟线程,await 是一次显式暂停。
从一个启动期 CPU 探测方案出发,解释 Spring Boot 的 readiness、liveness 默认生命周期、Kubernetes 切流机制,以及 readiness 与慢启动的职责边界。
从一次 Memos 0.29.1 到 0.30.0 的 Docker 升级出发,梳理 SQLite 备份、REST API 与 MCP 调用链,以及 Codex 使用 PAT 和环境变量时的权限边界。
Andrej Karpathy 提出的个人知识库新模式:不让 LLM 在每次提问时临时检索拼凑原文(RAG),而是让它增量维护一个持久 wiki——知识只编译一次并持续保鲜,随收录和提问不断复利增长。