会加减乘除就够:十个问题,手算读懂 Kimi K3 心脏里的全部数学
上一篇 KDA 深读里的公式劝退你了?这篇是零基础陪读:用一块 2×2 的迷你内存和十个问题,每一步都能用小学算术手算,算完你能逐个符号读懂 KDA 的核心公式。
Archive
上一篇 KDA 深读里的公式劝退你了?这篇是零基础陪读:用一块 2×2 的迷你内存和十个问题,每一步都能用小学算术手算,算完你能逐个符号读懂 KDA 的核心公式。
一个常见直觉的精确化:KV cache 层确实对应操作系统内存管理——PagedAttention 就是把虚拟内存搬进显存,前缀缓存的 ref_cnt 就是字面意义的引用计数 GC;但语义层的上下文管理对应的不是 GC,而是页面置换加有损压缩。给出三问判据。
深度拆解 Claude Code / Codex 的上下文淘汰策略:分层压缩管道、compaction 幸存规则、KV cache 淘汰的同构问题,以及 arXiv 论文给出的反直觉证据——简单丢弃常常不输昂贵的摘要。
拆解 Claude Code / Codex 的代码检索机制:为什么两家都放弃了向量索引式 RAG,改用 agentic search(grep + 模型闭环);Fetch 工具到底是干什么的;以及 arXiv 论文链条给出的证据与边界。
Codex 真读真写 · 论文/趋势/技能/工具/行动。这是 Codex 深读版。今天读完 24 条候选、拿到 23 条正文后,最值得提前建立判断的不是又一个模型 headline,而是三条更耐久的线索:开源 MoE 正在从“更便宜”转向“更强但更贵”;科研和工业都在把 memory、planning、data pi…
精读设计稿出码方向的两篇奠基论文——2017 年 pix2code(CNN+LSTM 学「截图→DSL」)与 2024 年斯坦福 Design2Code(多模态 LLM 直接出前端代码)。不只讲模型,重点拆解一个更隐蔽的问题:这个任务到底该怎么「评好坏」,以及为什么「元素召回」和「布局」始终是最难啃的骨头。
结合 MIT 的 EEG 实验、Nature Human Behaviour 的人机协作元分析等一手论文,论证 AI 时代思考能力的分水岭不是「用不用 AI」,而是「卸载哪一层思考」——机械层可以外包,判断与综合层不能,否则你在借「认知债」。
结合论文与 KaiHub、Echo Builder、设计上下文、物料渲染等实现,解读 Skills & MCP、提示词与上下文工程、D2D 如何组成公司级 AI 研发生产线。
基于长上下文与多轮对话论文,拆解上下文里哪些信息最能干预模型输出、哪些信息会被有效淘汰,以及如何安排系统提示、历史、摘要和当前任务。
从系统提示词、用户提示词、会话上下文、检索上下文、Token 窗口、幻觉抑制和提示词模板库出发,结合 arXiv 论文解释为什么 LLM 应用的核心工程对象正在从 prompt 变成 context。
Codex 真读真写 · 今天先读/论文/趋势/技能/工具/行动。这是 Codex 深读版,不是关键词拼装。今天最值得记录的不是单条新闻,而是三条更耐久的工程信号正在收敛:AI 工程的重心从模型本体转向 harness、loop 和 eval;代理开始需要按任务复杂度控制执行范围,而不是默认全仓审计;设备侧与本地化代…
解释 dense model、MoE、router、expert、active parameters、hybrid model 和 MRV2,并分析为什么 vLLM 0.25.0 先让 dense models 默认走 Model Runner V2。
从 PagedAttention 论文、MRv2 默认化、Transformers backend 提速和 TLI speculative decoding,看 vLLM 0.25.0 为什么是一次执行路径收口。
解释 vLLM 使用 Qwen、Llama、Gemma 或 Transformers backend 时,谁加载权重、谁驱动 forward、谁分配 KV cache,以及为什么这不是调用外部模型自己的 generate。
结合 Superpowers 的 brainstorming、TDD、worktree、writing-skills 设计,以及 Agent Skills、Externalization、SkillsBench、Parametric Skills、HASP 等论文,解释为什么 skill 的本质不是更多 prompt,而是把 Agent 的工作上下文做成可触发、可验证、可复盘的结构。
与其把每篇论文当孤立的知识点去背,不如握住一副望远镜。这篇把整部 AI 史压成一句话,再展开成 12 条跨时代的顶级原理——每条都配一个从"老 AI"到今天的例子和一个透镜问题。读到发懵的论文,往这 12 条上一映射,雾气就散了。
Codex 真读真写 · 论文/趋势/技能/工具/行动。这是 Codex 深读版。今天先读完 25 条原文后,我认为最值得抓住的不是某一个模型 headline,而是四条线同时变清楚了:模型正在从“单点能力”变成“路由与预算系统”,评估正在从最终分数转向过程与偏差机制,记忆与技能正在被包装成可迁移资产,agent 安…
深读发表于 Nature 的 DeepSeek-R1 论文——它证明了一件反直觉的事:复杂推理不必靠人类标注的思维链一步步教,而是用对了奖励,让模型在强化学习里自己长出来。从 GRPO、规则奖励、"aha moment"到四段式流水线与蒸馏,一条主线讲透当前推理模型这一代范式。
用 BPE、Transformer、RoPE、GQA、FlashAttention、PagedAttention 等论文作纵轴,串起 Qwen2.5-7B 在 llama.cpp 上的 tokenizer、forward、KV cache、benchmark、PPL 和 sampling 实验。
深读 Externalization、Toolformer、TInR、RISE、Agent Skills 等论文:哪些 Agent 外部系统会被模型内化,哪些不会,未来研发竞争力会迁移到哪里。
Codex 真读真写 · 论文/趋势/技能/工具/行动。这是 Codex 深读版。今天最值得调整的判断,不是又一个模型名次变化,而是 agent 已经开始同时侵入研发生产函数和基础设施设计:上游是 Fable 写 GPU kernel、AtCoder 竞赛表现、Remote Labor Index 这类能力信号,下游…
用一个 X @ W 小例子讲清张量并行里的本地分片计算、Column Parallel、Row Parallel、all-gather、all-reduce、reduce-scatter,以及它们在 Transformer 里的位置。
用 FlashAttention 官方论文和 CUDA 源码拆解 attention fusion:从 QK、softmax、PV 的普通三段式,到 online softmax、HBM 读写减少、边界条件和 kernel 正确性风险。
从人话直觉、小数字张量形状和 Qwen2.5-7B 的真实参数出发,讲清 KV cache 公式、GQA 为什么省 7 倍,以及 100 并发为什么会变成 11.7GB。