全部专题

Reading path

AI 数学入门

从线性代数、概率统计、Attention、Grokking 到高维几何,把大模型需要的数学拆成可读路径。

60 篇文章

Archive

专题归档

第 1 / 3 页

DeepSeek Harness 开源了什么:连 Agent Loop 都能拔的插件系统,和给它撑腰的一篇论文

DeepSeek 于 2026-08-13 以 MIT 协议开源 agent harness「dsh」。深读其架构(turn/step 事件模型、会话日志唯一事实源、能力接缝、profile 配置分层)与理论底座 Cordis 论文《A Programming Paradigm for Spatiotemporal Composability》:可撤销效应 + 反应式余效应 + 合流定理,把「热替换插件不炸」从工程纪律升格为数学性质。附与 SWE-agent、Claude Code、Prime Agent 的谱系对照。

Hello-Agents 720 页拆一条线:同一个循环,三次搬家

深度解读 Datawhale 开源书《Hello-Agents 从零开始构建智能体》(V1.0.3,720 页 16 章):ReAct 循环先活在提示词里(第四章三大范式),再固化成框架代码(第七章 HelloAgents 自研框架的"万物皆为工具"),最后被 GRPO 训进模型权重(第十一章,Qwen3-0.6B 在 GSM8K 上 5%→40-50%→60-70%)——评估(第十二章)则是跨载体的账本。附全书地图、GRPO/PPO 对照、记忆评分公式与已核实的论文清单。

深入理解 AI Agent 拆一条线:上下文学习是检索,不是推理

深度解读李博杰《深入理解 AI Agent:设计原理与工程实践》(v1.1,307 页):一个公式(Agent = LLM + 上下文 + 工具)、一条机制假设(上下文学习≈检索而非推理),推出全书几乎所有反直觉工程结论——状态栏让弱模型准确率涨 40-54 个百分点、系统提示词里一个时间戳让 TTFT 从 0.5s 涨到 3-5s、状态栏没覆盖的维度准确率从 100% 塌到 7.6%、RLVP 用"不对称验证器"补 GRPO 的方差、多 Agent 唯一有效判据是"是否引入生成时不存在的新信息"。

SGLang 内幕:RadixAttention、超售调度与期货流水线的源码深读

基于 SGLang 主干源码 commit b20c375 逐模块解读核心实现:radix tree 怎么给 KV cache 记账、疾驰匹配为什么快 370 倍、调度器如何像航空公司一样超售显存、撤退机制怎么选牺牲者、零开销调度的"期货 token"如何让 CPU 和 GPU 不再互等、约束解码的位掩码怎么挤进流水线——把论文里的三大招式落到具体函数名上。

帕累托的两副面孔:LLM 工程里的 80/20 杠杆,和「无法白嫖」的取舍前沿

一个 1896 年的意大利经济学家,名字反复出现在 2022-2024 年的大模型论文里——但「帕累托」其实是两个不同的数学对象:重尾分布(80/20,告诉你杠杆藏在哪)和帕累托前沿(告诉你免费午餐吃完没有)。用八篇论文把两副面孔各自在 LLM 里的三次现身讲清楚:数据侧的 LIMA 与数据剪枝、注意力侧的 H2O、请求侧的路由前提;成本-质量前沿的 FrugalGPT/RouteLLM、算力分配的 Chinchilla、多目标对齐的 Rewarded Soups/Panacea。最后给一条可复用的心法:前沿的每一次外推,都始于发现一条新的重尾。

记忆的内化:Metis 把 Agent 记忆从提示词搬进前向计算

做出外挂记忆操作系统 MemOS 的 MemTensor 团队,自己发布了外挂路线的'反面':Metis(arXiv:2607.26760),第一个把记忆做成原生能力的基础模型——记忆不再是数据库+检索+拼提示词,而是一块随对话演化的参数状态:写入靠前向计算,读取靠 memory attention,全程没有一次反向传播。本文沿论文的三轴对比(架构、优化、效率)拆它的设计,再用诚实的数字给它定位:原生记忆今天的处境,约等于 LRM 出现之前的推理。

上下文不是平的:位置与结构如何决定一条信息对输出的干预力

同一条信息放在上下文的开头、中间、结尾,对最强模型输出的影响力可以差出几十个百分点——而且这个"位置地形"会随上下文填充率动态变形:塞满一半之后,经典的 U 形曲线塌掉,只剩结尾优势。从注意力机制的三个根本约束出发,讲清位置偏差的成因、衰减的动态过程,以及"结构"为什么本质上是在地形上打人工锚点。