Tech Transformer 推理系列(一):从 Attention 到 KV Cache
从 Q/K/V 的投影含义、多头注意力的独立 softmax,到 GQA/MQA、Decoding KV Cache 与输出稳定性,系统梳理 Transformer 注意力机制。
从 Q/K/V 的投影含义、多头注意力的独立 softmax,到 GQA/MQA、Decoding KV Cache 与输出稳定性,系统梳理 Transformer 注意力机制。
树莓派上全部服务的集中登记表:影音下载管线、统一入口、DNS 与三套代理、系统监控,以及新服务的上架约定。
开着 TUN 代理,国内网站却奇慢——从一次真实排障拆清 mihomo、macOS scoped resolver、路由器与 DoH 的关系,并给出 TUN 代理和企业 VPN 长期共存的单入口方案。
给树莓派 5 装上带风扇的主动散热器后,通过三阶段压力实验实测风扇的启停温度、换挡逻辑和满载散热能力:4 核满载稳定在 72.2°C,远低于 85°C 降频线。
从一个解析到内网 IP 的公网域名出发,顺着问题逐层下钻:VPN 如何把整个 IP 包寄进内网,代理如何用三条连接接力,以及系统代理、TUN、NAT、四元组各自扮演什么角色。
在树莓派上安装 PandaFan 机场的 mihomo 客户端,用 systemd 用户服务托管,与已有的 v2ray、xray 两套自建代理并存,并实测三套代理在高峰时段的速度差异。
从企业数字员工的执行需求出发,解释容器、guest kernel、MicroVM、CubeSandbox 与 Agent Runtime 的技术边界和架构关系。
在同一台搬瓦工 CN2 GIA VPS 上对比 VMess、VLESS 和 VLESS + REALITY + Vision 三套方案,用昼夜实测区分协议收益与线路拥塞。
在保留 Kodi 播放能力的同时接入树莓派 Jellyfin,统一海报墙、观看进度和字幕,并给出从直读共享文件平滑迁移的电视端配置方法。
从局部编码加速为何没有缩短需求交付出发,梳理快手万人研发团队如何用研发地基、流程重构、成熟度分级和效能度量推动组织级 AI 转型。