2026年9月21日RLCD 拆解:Jev 训练招牌里,多少是新的?TypeSafe 把 Jev 的训练招牌叫 RLCD。arXiv 上有个近亲 2025-07 就交了叫 RLCR,Brier 直接进奖励;Kadavath 2022 甚至一个 T=2.5 就能事后修一半。本机 Qwen3-4B 跑 30 个是非题:平均自信 99.9%、准确率 90%。AI InfraLLM论文深读模型训练
2026年9月18日Shiplight 全栈拆解:Agent 原生测试平台如何把意图变成可持续回归我实际走查 Shiplight 官网、67 个文档入口、公开 Agent Skill、npm 包与 Trust Center,拆开它的 MCP 浏览器、YAML 意图层、Playwright 执行层、Action Cache、自愈、CI 归因和云端商业飞轮,并给出一条不照抄产品表面的 clean-room 自研路线。AIAgent自动化AI Infra评测
2026年9月17日System One 模型:放弃生成字符串,到底买到了什么TypeSafe 的 Jev 号称比 LLM 快 40–200 倍。我在本机用同一个 7B 模型搭了个「穷人版 System One」做对照:同样的 10 个问题,读单 token 概率比生成 JSON 快 1.8–4.1 倍,不是 100 倍;而「一问一次调用」的朴素写法反而比它要取代的东西慢 2.4 倍。AI InfraLLMllama.cpp系统设计
2026年9月15日现代 AI 工具生态勾勒:11 层 82 款产品与它们的官方链接按 Rathnakumar Udayakumar 的《Modern AI Ecosystem – Tools》一图,逐层拆解 11 个能力层里的 82 款产品;每条给一句话定位与官方链接。附本机跑过的 46 家 GitHub star 数、5 处 org 迁移与 4 处跨层重复的观察。AIAI InfraAgentMCPRAG自动化
2026年9月15日Parasma 深读:把 Friston 的自由能原理装进 Y Combinator 的湿件赌注一家 YC S26 湿件公司拿人脑细胞做 next-token prediction,网站上那句「Biological compute with living neurons」背后是四条被压缩的决策链——基质、训练算法、读出、经济学,每一条都能挂到一篇 20 世纪或 21 世纪初的老论文上。AIAI Infra论文深读系统设计
2026年9月14日两张架构图里藏着 890 字节:把 DeepSeek V4.1 Flash 的 43 层排班表算出来2017 原版 Transformer 与 DeepSeek V4.1 Flash 的对照图上,每个标签都对应 config.json 里的一个键。顺着这条线可以手算出官方那个 890 B/token,并发现 40 层里只有 4 层真的在往缓存里写东西。AI InfraLLM源码阅读
2026年9月14日KV cache 的 12 种省法:把 Avi Chawla 那张总表在自己机器上跑了一遍Avi Chawla 把 12 种 KV cache 优化按「减公式哪一项」归成一张表。我在 M5 Pro 上把其中能验的三项真跑了:公式对到兆字节,但量化省的不是 50% 而是 47%——差额正好是每块的 scale 元数据。AI InfraLLM ServingLLM
2026年9月14日投机解码的四种变体,和我笔记本上那道 8 个 token 的悬崖在 M5 Pro 上把两模型投机解码完整跑了一遍:教科书说 2-3×,实测峰值 1.16×;草稿长度从 4 加到 11,端到端反而从 1.11× 掉到 0.49×。根因是 ggml Metal 里一行 ne11 > 8,以及草稿成本 γ 的硬地板。AIAI InfraLLM Servingllama.cpp源码阅读
2026年9月11日小模型的「小」在 2026 年裂成了两半:一台 24GB Mac 上的三笔账把 2026 年的 SLM 趋势放到一台 24GB Mac 上验一遍:Qwen3.5-4B 默认配置下 20 件抽取活可用率 0/20,关掉思考后 20/20;35B-A3B 的 Q4 权重 20.50 GiB 装不进 17.76 GiB 的 GPU 工作集。参数量这个坐标失效了。LLMAI Infrallama.cppLLM Serving工程实践
2026年9月10日那张「AI 这十年」的成长图画反了:2026 栏的 22 个词,19 个不在模型里一张三代身高对比图把十年画成「模型长大了」。我数了一遍 2026 栏的 22 个词,只有 3 个动模型权重。再用自己这个 337 篇的博客仓库算一笔账:把全部内容塞进上下文,连最宽松的估法都装不下 1M 窗口——那 19 个词是这道算术题的产物,不是模型的成长纹。AI Infra上下文工程Agent 工程系统设计
2026年9月8日两个模型之间只差一个旋转:把「隐藏状态直连」拆到根本本机实测:Qwen2.5-7B 读进一个 token 比写出一个便宜 26 倍,而它每个 token 的 KV cache 有 56 KiB,吐出的那个 token 只有 2.15 字节。这两个数字就是「让模型跳过文本、直接传隐藏状态」的全部动机。本文把这条路拆到根本:为什么表示空间的坐标系是任意的、为什么两个独立训练的模型之间的映射恰好是一个正交变换(附本机 Procrustes 实验:d 维旋转需要且只需要 d 对锚点)、桥能装在哪三个位置、以及连续通道会把人名和数字弄丢这个真实代价。顺带核实了 Mostik 那条 GLM→Qwen 新闻里哪几句站得住。AILLMAI Infra论文深读系统设计
2026年9月8日本地部署到底看哪些本机参数:同一台机器上,GPU 让 prefill 快 38 倍、让 decode 只快 2.5 倍在 24GB M5 Pro 上实测 llama.cpp 的容量、带宽、算力、核数、上下文与并发六组参数,给出一张「参数 → 它管哪一段 → 一行换算公式」的表,和一个 15 分钟自测流程。AI InfraLLM评测llama.cppLLM Serving
2026年9月7日Magnitude 源码深读:它不是又一个 Ollama,而是一台本地 Agent 推理控制器从源码、实测与论文出发,拆解 Magnitude 如何完成硬件探测、模型选型、投机解码、驻留管理与 Agent 接入。AI InfraLLMAgent源码阅读
2026年9月6日面向 Agent 的门禁产品设计:当提交变更、执行检查、读判决的都是 Agent,人只在 HOLD 时出现门禁的一等用户正从人变成 Agent。本文从产品与链路视角给出面向 Agent 的门禁体系:变更全生命周期时序图、六层架构、七个领域对象、判决 schema 与状态机、三条防 Agent 钻空子的规则,并以 Shiplight 为参照指出它做对与缺失之处。AILLMAgent评测AI Infra自动化
2026年9月5日交付门禁施工图:和评测共用一副骨架,在 Oracle 处分叉,每一格配一个开源底座评测与门禁共用「资产/目标/Runner」骨架,却在 oracle 处分叉:门禁靠确定性规格,评测靠采样式裁判。本文补齐门禁六元组,每格配开源底座(Playwright、Midscene、Testcontainers、Pact、Argo Rollouts、promptfoo),附伪代码与 Wilson 下界手算。AILLM评测AI Infra自动化
2026年9月4日给 Agent 用的浏览器地图:Playwright、browser-use、ego-lite 到 Computer Use 之间的六个决策点从一次 Playwright MCP 的锁冲突翻车讲起,用「浏览器的第二用户是谁」这条约束把 11 款产品串成五代演进:传统开发者工具、LLM 决策层、像素级 GUI Agent、云端浏览器基础设施、双用户浏览器;辅以 arXiv 论文与本机字节实测。AgentAgent 工程AI Infra自动化
2026年9月4日交付门禁 vs 评测系统:一对被反复混淆的角色,和一条「传感器/执行器」定律业界经常把「大模型评测系统」和「大模型交付门禁」当成一回事,结果就是评测跑通了却拦不住线上翻车,或者门禁很严却测不到关键翻车方式。本文把两者按角色分开:评测系统是传感器(持续量),交付门禁是执行器(一次决策)。用五篇 2026 年的 arXiv 论文(Automated Self-Testing 2603.15676、LLM Readiness Harness 2603.27355、Test Before You Deploy 2604.27789、Predicting LLM Safety Before Release 2607.07184、含 HELM 2211.09110 的坐标系)+ Google SRE 错误预算+决策地图系列前作,给出七维度对照表、四种失配病理、以及一条把两者接起来的「传感器/执行器阻抗匹配」定律。AILLM评测门禁AI Infra论文深读
2026年9月3日约束解码深读:把 mask 做到零开销之前,我们跨过了四道坎沿一条主线拆 constrained decoding / grammar-based sampling:所有算法都在实现同一个「可延伸性 oracle」,四代论文(Outlines / DOMINO / XGrammar / SGLang / GAD)各推进一关——token-字符错位、mask 成本、确定性片段的浪费、分布扭曲。附伪代码骨架、亲手实测 96.4% 的确定性 token 占比、以及一个手算完的分布扭曲例子。AILLMAI InfraLLM Serving论文深读
2026年9月3日Hermes 4 深读:一个把「拒绝率」当成产品规格来打的开源模型Nous Research 的 Hermes 4 在自家 RefusalBench 上打 57.1,同一张表 GPT-4o 17.67、Sonnet 4 是 17、GPT-5 是 11.34——这不是能力差,是产品哲学差。本文按 arXiv 2508.18255 技术报告逐节拆:base model 拼装(405B/70B 是 Llama 3.1、14B 是 Qwen3)、DataForge 图式合成数据、Atropos 千验证器拒绝采样、30K token 强制截断这一手漂亮的 length control、192 张 B200 训一次要多少钱。结尾接回昨天那篇 OpenRouter:Hermes 4 405B 全网只 1 家 provider——「意见型微调」不进入商品市场。AILLMAI Infra论文深读模型训练
2026年9月3日深读 OpenRouter:它不是一个聪明路由器,是一个开源模型推理的现货市场同一个 Llama 3.3 70B,OpenRouter 上挂着 13 家供应方,prompt 报价差 10.4×、量化精度混着 fp8/bf16/fp16。这不是路由问题,是市场问题。本文用亲手跑的 API 数据 + 7 篇 arXiv 论文把 OpenRouter 拆到根本约束:开源权重让推理商品化,边际买家要的是发现与切换、不是智能。围绕这条主线看 provider preference(拍卖)、Auto Router(Hayek 价格系统聚合)、BYOK 5% 抽成、per-provider sticky 缓存怎么各自落成市场机制,以及在闭源模型面前先崩在哪里。AILLMAI Infra论文深读系统设计
2026年8月27日当评测系统成为攻击目标:1200 个 Agent 如何自组织、越界与篡改证据深度拆解 METR、OpenAI 与 Hugging Face 的 2026 年事件报告:从不可能任务、未授权消息板、群体协作到工具调用伪造,建立一套可迁移的 Agent 评测安全模型与工程检查清单。AILLMAgentAgent 工程评测AI 安全AI Infra系统设计
2026年8月26日什么是一个好的评测样本?不是一道难题,而是一份决策证据结合 ECBD、CheckList、Dynabench、SWE-bench 与 LiveBench,建立一套判断 LLM/Agent 评测样本是否有效、可判、可复现、能区分且不过期的工程框架。AILLM评测AgentAI Infra论文深读
2026年8月24日10% 更差、100 倍便宜、10000 倍快:AI 生产线被自己吃掉的八次深读 Latent Space 2026-08-22 那期 AINews:把 2022 到 2026 每年一次的"人类输入变成模型输出"演化拆成八个阶段,每一格给 patient zero 论文和该阶段的验证机制;并挑出作者只在页脚点了一下的元规律——合成前沿不是被"生成"推动的,是被"验证"推动的。这条思路和昨天那篇 attention-interface 是同一个抽象上升一层:agent harness 被模型吸收,是这条大曲线在 agent 内部的投影。AILLMAI Infra评测论文深读
2026年8月20日Codex 怎样接进公司的评测链路:先摆正 Langfuse 与 Inspect AI 的坐标「让 Codex 集成 Langfuse 做 Inspect AI 评测」这句话把两个不在同一节点的组件当成了需要搭桥的对等系统。翻开本站评测路由系列的施工图:Langfuse 是 Trace 节点(M5),Inspect AI 是评测执行引擎(M8),中间隔着数据集(M6)。这篇把 Codex 放回这条「请求→路由→Trace→评测→策略」的闭环里,讲清它从哪个节点进场、trace 走哪两条路、以及它同时是 trace 生产者又是被评对象。CodexAgentAI InfraLLM评测