Tech Transformer 推理系列(一):从 Attention 到 KV Cache
从 Q/K/V 的投影含义、多头注意力的独立 softmax,到 GQA/MQA、Decoding KV Cache 与输出稳定性,系统梳理 Transformer 注意力机制。
从 Q/K/V 的投影含义、多头注意力的独立 softmax,到 GQA/MQA、Decoding KV Cache 与输出稳定性,系统梳理 Transformer 注意力机制。
从一份自包含的订单 Skill 出发,区分知识复用与格式标准化,再通过示例说明 OKF 的字段、知识包和计算契约,以及何时值得采用这套知识交换约定。
同样理解自然语言,大模型面向人的表达,Jev 面向程序的判断:从三个原语、完整调用到 Agent 平台分工与 Rerank 实测。
对照 Unstructured、Docling、RAGFlow、LangChain、LlamaIndex 和 Azure 的官方文档与源码,用同一份虚构表格展示实际预处理表示、切块参数、召回路径及能力边界。
从一次知识漏召回出发,理解 Ragas 与 TREC 的不同目标、标准构建和覆盖判定,进而设计适合私有知识库的 Evidence 评测与定位方法。
先理解 Spec、Plan、Tasks、Validation 的分工,再用共享相册案例完整走过需求、方案、实现、验收与需求变更,最后介绍 Codex 接入和团队协作。
按 MCP 2026-07-28 规范,以 Memos 为例对比 REST 与 MCP 的请求响应、工具发现和输入输出契约,解释 stdio、Streamable HTTP,并以 HATEOAS 番外区分操作发现与业务决策。
从 CPython 的 GIL 讲起:Java 线程既能并发也能并行,默认启用 GIL 的单个 CPython 解释器只能并发;threading 和 asyncio 都走这条路,协程在调度上像单条 carrier 上的虚拟线程,await 是一次显式暂停。
从一个启动期 CPU 探测方案出发,解释 Spring Boot 的 readiness、liveness 默认生命周期、Kubernetes 切流机制,以及 readiness 与慢启动的职责边界。
从一次 Memos 0.29.1 到 0.30.0 的 Docker 升级出发,梳理 SQLite 备份、REST API 与 MCP 调用链,以及 Codex 使用 PAT 和环境变量时的权限边界。