2026年9月18日SLSA 和 in-toto 是两栈叠加,不是二选一SLSA 和 in-toto 都在回答'这件软件是不是按声称的流程走出来的',但切在不同关节——in-toto 是可以在图上跑的验证算法,SLSA 是对签发方的等级承诺。手算 MATCH 规则看清算法本体。工程实践系统设计论文深读
2026年9月17日System One 模型:放弃生成字符串,到底买到了什么TypeSafe 的 Jev 号称比 LLM 快 40–200 倍。我在本机用同一个 7B 模型搭了个「穷人版 System One」做对照:同样的 10 个问题,读单 token 概率比生成 JSON 快 1.8–4.1 倍,不是 100 倍;而「一问一次调用」的朴素写法反而比它要取代的东西慢 2.4 倍。AI InfraLLMllama.cpp系统设计
2026年9月15日Parasma 深读:把 Friston 的自由能原理装进 Y Combinator 的湿件赌注一家 YC S26 湿件公司拿人脑细胞做 next-token prediction,网站上那句「Biological compute with living neurons」背后是四条被压缩的决策链——基质、训练算法、读出、经济学,每一条都能挂到一篇 20 世纪或 21 世纪初的老论文上。AIAI Infra论文深读系统设计
2026年9月10日那张「AI 这十年」的成长图画反了:2026 栏的 22 个词,19 个不在模型里一张三代身高对比图把十年画成「模型长大了」。我数了一遍 2026 栏的 22 个词,只有 3 个动模型权重。再用自己这个 337 篇的博客仓库算一笔账:把全部内容塞进上下文,连最宽松的估法都装不下 1M 窗口——那 19 个词是这道算术题的产物,不是模型的成长纹。AI Infra上下文工程Agent 工程系统设计
2026年9月9日一个模型的一生:从受孕定形到夕阳反哺,一张横图看完八格流水线把大模型从架构定形、预训练、后训练、评测、部署、Agent 产品一路到退役反哺画成一张横向的生命线,再顺着这张图立一个主线:这八格是一条单向压缩管道,每格都在把上游更大的东西压成更小的表示且丢弃不可逆,而整条链上只有最后一格会产出新信息——这解释了 2026 年的热点为什么全挤在末端。AILLM模型训练Agent 工程系统设计
2026年9月8日面向 Agent 封装业务流程:把状态、约束和判据搬进 schema92% 的官方 MCP 服务器只是端点的薄壳,而写在散文里的参数约束会让 Agent 静默失败、41% 直接对用户说“没有数据”。本文给出一套封装方法:把状态、约束、判据从人脑和界面搬进 schema,按“可回滚的最小承诺单元”重切刀口,并说明新能力具体开在哪四处。AILLMAgentAgent 工程MCP工具调用系统设计
2026年9月8日两个模型之间只差一个旋转:把「隐藏状态直连」拆到根本本机实测:Qwen2.5-7B 读进一个 token 比写出一个便宜 26 倍,而它每个 token 的 KV cache 有 56 KiB,吐出的那个 token 只有 2.15 字节。这两个数字就是「让模型跳过文本、直接传隐藏状态」的全部动机。本文把这条路拆到根本:为什么表示空间的坐标系是任意的、为什么两个独立训练的模型之间的映射恰好是一个正交变换(附本机 Procrustes 实验:d 维旋转需要且只需要 d 对锚点)、桥能装在哪三个位置、以及连续通道会把人名和数字弄丢这个真实代价。顺带核实了 Mostik 那条 GLM→Qwen 新闻里哪几句站得住。AILLMAI Infra论文深读系统设计
2026年9月3日深读 OpenRouter:它不是一个聪明路由器,是一个开源模型推理的现货市场同一个 Llama 3.3 70B,OpenRouter 上挂着 13 家供应方,prompt 报价差 10.4×、量化精度混着 fp8/bf16/fp16。这不是路由问题,是市场问题。本文用亲手跑的 API 数据 + 7 篇 arXiv 论文把 OpenRouter 拆到根本约束:开源权重让推理商品化,边际买家要的是发现与切换、不是智能。围绕这条主线看 provider preference(拍卖)、Auto Router(Hayek 价格系统聚合)、BYOK 5% 抽成、per-provider sticky 缓存怎么各自落成市场机制,以及在闭源模型面前先崩在哪里。AILLMAI Infra论文深读系统设计
2026年9月2日RouteLLM 深读:把「谁来做这题」压缩成一个胜率,就是所有 LLM 路由的钥匙RouteLLM 论文最漂亮的一个数字:只需 14% 的 GPT-4 调用就能保住 95% 的 GPT-4 质量。这个数字背后是一整套可测量、可校准的路由体系。本文从「胜率预测」这条主线拆解四种路由器的算法差异、Chatbot Arena 偏好数据的稀疏性处理、PGR/APGR/CPT 三个校准指标,以及一次 completion 请求进入 openai_server 到最终转发给 strong/weak backend 的完整调用链。AILLM论文深读LLM Serving系统设计
2026年8月31日每次醒来都是陌生人:Agent 的“自我”到底存在哪里?一次模型调用结束后,刚才那个“它”已经消失。本文从记忆、权限、承诺和审计四本账出发,解释 Agent 如何跨会话、模型升级与子任务分叉维持可验证的身份连续性。AILLMAgentAgent 工程系统设计
2026年8月27日当评测系统成为攻击目标:1200 个 Agent 如何自组织、越界与篡改证据深度拆解 METR、OpenAI 与 Hugging Face 的 2026 年事件报告:从不可能任务、未授权消息板、群体协作到工具调用伪造,建立一套可迁移的 Agent 评测安全模型与工程检查清单。AILLMAgentAgent 工程评测AI 安全AI Infra系统设计
2026年8月25日会用 Coding Agent,不等于会做 AI Engineering:四项差距能力与训练法用一个订单 CSV 导出案例,具体定义需求规格、Agent 操作、Eval 回归与部署观测四项能力,并结合 SWE-bench、SWE-agent、MAST、AgentOps 等论文给出可练习、可验收的进阶路径。AIAgent 工程评测工程实践系统设计
2026年8月25日从 Pending 到 Ready:一套可迁移的 Kubernetes 部署排障方法用控制器、调度与存储、容器启动、健康探针和发布收敛五层心智模型,系统判断 Pending、ImagePullBackOff、CrashLoopBackOff 与 rollout 卡住,并选择 Deployment、StatefulSet、Job 及共享基础设施隔离策略。工程实践系统设计自动化
2026年8月17日多 Agent 的内存问题,其实是分布式系统的老问题换了张脸一篇 2026 年 3 月的计算机体系结构立场论文,把多 Agent 系统的记忆管理拆成 I/O / Cache / Memory 三层,指出两个协议缺口(跨 Agent 缓存共享、结构化访问控制),并把核心难题钉在"内存一致性"上——这篇把它和本站已有的三篇"Agent=操作系统"文章接起来,看这个类比在哪里站得住、在哪里第一次真正碰壁。Agent 工程记忆系统设计论文深读
2026年8月11日Veral:把一次模型调用变成可回滚的路由策略一张图读懂公司级 LLM 评测与智能路由平台的理想全貌:在线路由与离线评测如何隔离,Trace 如何变成冻结数据、能力标签和策略版本,以及为什么真正的产品单位是一次可追溯、可灰度、可回滚的策略变化。AILLM评测AI Infra系统设计
2026年8月9日评测平台产品化:接口清单、开源底座与前端模块——平台管自动化,用户管场景评测路由系列第五篇:把评测系统从「自己搭给自己用」升级成「全公司业务团队自助使用的平台」。一条分界判据(换一个业务方要不要重做)切出平台与用户的责任边界;七组后端 API 端点清单(场景/评分器/运行/模型/报告/集成/标签与路由供给,每个端点标注它传递的是场景知识还是自动化);LLM-as-judge 的五元组定义与平台强制的裁判三纪律(钉版本/换位/避自家,校准不达标即拦截);开源底座对比(Langfuse MIT / Opik Apache-2.0 / Phoenix ELv2 + Inspect AI 执行引擎);前端八模块含裁判校准中心;15 分钟自助用户旅程时序图与三阶段落地顺序。AILLM评测AI Infra系统设计
2026年8月9日数据规格书:把「网关产 Trace,Trace 产评测集,评测产标签」落到字段级施工图篇的下一层细化:四段数据链每段一份可直接建表的规格——五块式 Trace schema(贴 OTel GenAI 属性名 + 路由决策扩展 + 三级采样)、评测集生产漏斗(八类挖掘信号、样本封闭化、审核状态机、版本化)、两种标签的生产口径(Wilson 区间 + 最小样本量 + 失效规则)、路由器偏好对的 SQL 导出与冷启动,以及贯穿全链的「字段三问」数据契约定律。AILLM评测AI Infra系统设计
2026年8月8日从 JD 到施工图:公司级大模型路由与评测系统的完整落地方案把米哈游「大模型路由与评测工程师」JD 的六条工作内容翻译成可施工的系统方案:十个模块的职责与接口、六层架构图、三张关键时序图(在线路由、策略灰度、评测闭环)、每个模块的开源选型与自研分界(LiteLLM/semantic-router/RouteLLM/Langfuse/Inspect AI/EvalScope/Promptfoo/GrowthBook),以及一条「先评测后路由」的施工顺序定律和四阶段路线图。决策地图系列「评测路由篇」的施工图姊妹篇。AILLM评测AI Infra系统设计
2026年7月31日别把批处理器当交互后端:解剖一条 codex exec 冷启动链一个 Tauri 桌面应用把 codex exec 用作本地 AI 执行后端,每个任务都要冷启动整条链:Node harness、run-scoped CODEX_HOME、MCP server、进程级 hook、workspace 物化、依赖预热。慢的根因不是模型,而是三种天然生命周期不同的东西被焊死在同一个进程生命周期上。本文给出完整的成本解剖、两个容易被忽略的反模式(双重观测、per-run store 打败内容寻址缓存),以及从 batch executor 迁移到常驻 runtime 的架构路线——包括为什么"审计性应该来自事件日志而不是进程短命"。CodexAgent系统设计自动化
2026年7月28日场景控制包:把 Agent 经验从提示词推进到可执行契约结合 AI Chains、PromptChainer、ReAct、RAG、Self-RAG、DSPy、AutoGen、MetaGPT、Reflexion、Voyager、AgentBench 和 SWE-agent,判断 AIHub 场景控制包有没有同类论文思想:没有找到完整同款,但能看到清晰的相邻研究脉络。AIAgentAI InfraRAG系统设计
2026年7月17日搭建系统最会流血的两处,其实是同一种病:PRD 抽取与双向同步系列深挖篇。把「PRD→交互规格的 intake agent」和「schema↔代码的 round-trip」这两个搭建系统里最疼的单点挖到底,并揭示它们是同一种病——同一份信息在两种表示之间来回翻译时的边界问题。前者会静默编造缺失的逻辑,后者会静默漂移。负责任的解法都是同一句:把有损与歧义的部分显式化,而不是替它糊过去。含 intake 的完备性矩阵设计与 round-trip 四种策略的取舍。AIAgent系统设计
2026年7月17日物料驱动的页面搭建:一份提前避坑的问题地图如果不走「设计稿端到端出码」,而是先沉淀高还原物料、再组合搭建页面——这条路会撞上哪些问题?本文用「一个活页面 = 5 层」的心智模型做主线,尽可能穷举物料设计、匹配、布局、业务逻辑、工程化到度量的全部坑点,并收敛到一个反直觉的结论:搭建范式的命门不是物料好不好看,而是「业务逻辑既不在设计稿也不在物料里」。系统设计
2026年7月17日物料搭建 × AI Harness:一套完整表达生产级页面的协议族设计本系列的规范篇。为「基于物料的 UI 还原 + AI Harness 控制的业务逻辑还原」这套架构,负责任地穷举出需要的全部协议/Schema——分六层、23 个协议,共享一个 Envelope、彼此用 id 交叉引用,逐一给出结构、关键字段与含义。目标是让这套协议族能完整表达复杂场景与真实应用页面,逼近生产运行表现;同时诚实标注它的边界与未解难点。AI系统设计
2026年7月17日把协议族跑起来:一个协议驱动的 TODO 应用(含可运行 demo)系列实现篇。用 React + Vite + TS 把前面设计的协议族真正实现成一个可运行的 TODO 应用——整个 app 的视觉、数据、业务逻辑、边界态全部是一份声明式协议数据,运行时解释它渲染而成,换掉这份数据就换掉整个应用。接口用 mock 拦截真实 fetch 模拟真实行为(状态码/延迟/持久化/错误注入)。因为逻辑与 DOM 分离,同一个运行时能被无头单测完整覆盖。附可在线体验的 demo 与全部源码结构。AI系统设计