2026年9月21日RLCD 拆解:Jev 训练招牌里,多少是新的?TypeSafe 把 Jev 的训练招牌叫 RLCD。arXiv 上有个近亲 2025-07 就交了叫 RLCR,Brier 直接进奖励;Kadavath 2022 甚至一个 T=2.5 就能事后修一半。本机 Qwen3-4B 跑 30 个是非题:平均自信 99.9%、准确率 90%。AI InfraLLM论文深读模型训练
2026年9月17日System One 模型:放弃生成字符串,到底买到了什么TypeSafe 的 Jev 号称比 LLM 快 40–200 倍。我在本机用同一个 7B 模型搭了个「穷人版 System One」做对照:同样的 10 个问题,读单 token 概率比生成 JSON 快 1.8–4.1 倍,不是 100 倍;而「一问一次调用」的朴素写法反而比它要取代的东西慢 2.4 倍。AI InfraLLMllama.cpp系统设计
2026年9月15日五种 embedding 压缩,我把它们跑了一遍:96 字节能打赢 1024 字节1000 条真实 embedding、18 组配置、recall@10 全部本机实测。int8 几乎免费(4× 压缩,0.9950);二值化单独用只有 0.4673,加一次 float 重排就跳到 0.9524;而占 10 倍存储的 MRL 截断到 256 维只有 0.6832,打不过 96 字节的 PQ。AILLMRAG工程实践源码阅读
2026年9月15日从 ELIZA 到 Kimi K3:大模型 60 年,真正跨过的是四道门槛一张 AI 时间线把 ELIZA、感知机、反向传播、Word2Vec、Transformer 和前沿模型串在一起。真正值得带走的不是年份,而是表示、学习、路由与规模四道瓶颈如何依次被解除。AILLMTransformer零基础学习笔记
2026年9月15日X 上值得长期关注的 20 个大模型与 Agent 英文账号从 Avi Chawla 出发,实看 25 个 X 账号后留下 20 个英文一手信息源,按教程、Agent 工程、研究与行业反方四层整理;附只关注 6 人的精简版和四张可直接照抄的 X Lists。AILLMAgentAgent 工程学习笔记
2026年9月14日两张架构图里藏着 890 字节:把 DeepSeek V4.1 Flash 的 43 层排班表算出来2017 原版 Transformer 与 DeepSeek V4.1 Flash 的对照图上,每个标签都对应 config.json 里的一个键。顺着这条线可以手算出官方那个 890 B/token,并发现 40 层里只有 4 层真的在往缓存里写东西。AI InfraLLM源码阅读
2026年9月14日KV cache 的 12 种省法:把 Avi Chawla 那张总表在自己机器上跑了一遍Avi Chawla 把 12 种 KV cache 优化按「减公式哪一项」归成一张表。我在 M5 Pro 上把其中能验的三项真跑了:公式对到兆字节,但量化省的不是 50% 而是 47%——差额正好是每块的 scale 元数据。AI InfraLLM ServingLLM
2026年9月14日11 种 LLM 评估方法,其实只在回答一个问题:参照物从哪来三句话喂给三代指标:真实排序 A>C>B,ROUGE-L 给 C>B>A,BERTScore 给 B>A>C,没一个排对。附本地 Qwen2.5-7B 的分数 token 概率分布、30 次采样的裁判方差,以及 DeepEval DAG 源码究竟把什么变确定了。AILLM评测论文深读工程实践
2026年9月14日六种位置编码,其实只在争两个插入点同一个 Qwen2.5-7B、同一段文本、同样是把窗口放大 4 倍:线性插值让 PPL 从 8.18 崩到 173.57,YaRN 只涨到 8.90。差别全在一张波长表——我手算出 YaRN 放过了 64 个维度对里转得最快的 30 对。附 llama.cpp 源码定位与三个 token 的置换等变手算。AILLMTransformer论文深读源码阅读
2026年9月14日把工具调用数据反着造:ToolGrad 用 500 条样本追平闭源大模型的那件事ToolBench 用 12.6 万条 SFT 数据把开源模型教会 tool-use,方式是「先给用户问题、DFS 搜工具链」。ToolGrad 反着来:先造链、再回头写用户 query。500 条样本训练出的 Gemma-3-12B 在 BFCL 上 83.1 分,等于 gemini-2.5-pro、高于 GPT-5。这篇把它的四模块管线拆到源码位置,把「textual gradient」追溯到 TextGrad,并和 APIGen、ToolACE 拉一张四家决策矩阵。AILLM工具调用论文深读模型训练
2026年9月14日12 种微调技术不是 12 个选项,是三张账单的折扣券图上写 BitFit「约占全部参数的 0.08%」。我按真模型的张量表数了一遍:129,024 个 bias,占 0.001694%,差 47 倍——而且它已经不是最省的那个。顺着这条线把 12 种技术钉进显存、标注、数据位置三张账单。AILLM模型训练工程实践
2026年9月11日小模型的「小」在 2026 年裂成了两半:一台 24GB Mac 上的三笔账把 2026 年的 SLM 趋势放到一台 24GB Mac 上验一遍:Qwen3.5-4B 默认配置下 20 件抽取活可用率 0/20,关掉思考后 20/20;35B-A3B 的 Q4 权重 20.50 GiB 装不进 17.76 GiB 的 GPU 工作集。参数量这个坐标失效了。LLMAI Infrallama.cppLLM Serving工程实践
2026年9月10日AFlow 到底在搜什么:读一遍 FoundationAgents 的自动 workflow 发现AFlow 的名字里挂着 MCTS,但真读源码,它不是一棵树;它是「LLM 当搜索算子 + 数值验收当奖励 + softmax 混合选父」的三件套。本文从根本约束、崩点、代码定位到手算 selection 概率,把这套结构拆到能自己复刻的分辨率。AILLMAgentAgent 工程论文深读
2026年9月10日Agent 自进化不是一张全景图,是一架四层可回滚阶梯——每往下一层 credit 就贵一个数量级把 9 篇「Agent 自进化」论文挂进一架四层可回滚阶梯:L1 Skill 文档(分钟级、git diff)、L2 Skill Bank(小时级、可 prune)、L3 Harness / 元进化(会话级、Pareto 归档)、L4 模型权重(不可逆)。每下一层,回滚成本 × 传导广度跳一个数量级,credit assignment 门槛也跳——L1 靠「≥2 条轨迹独立提议同一编辑」的投票几何就够(K=8 时假/真比 1:72),L4 必须靠 GiGPO 的 anchor state、LLM 语义自归因或 privileged teacher(OPSD)。附三笔 Python 手算:Trace2Skill 的投票几何、GiGPO 在不同状态空间下的 anchor 复用率、AgentEvolver 55% 步数节省背后的信号密度倍率。AILLMAgentAgent 工程论文深读模型训练
2026年9月10日GiGPO 到底靠什么工作:Agent 训练里的 credit assignment 廉价补丁GiGPO 把 GRPO 从"一整条轨迹一个 advantage"升级为"episode 组 + step 组 相加",在 ALFWorld/WebShop 上比 GRPO 高 12/9 个百分点。但它的核心机制既不是嵌套树,也不是嵌入相似度——就是 hash(str(observation))。这一切建立在一个物理假设上:多条 rollout 会撞到同一个中间状态。撞不到,方法退化。AILLMAgentAgent 工程论文深读模型训练
2026年9月10日LLM 评测的 25 个坑:一张五层管线地图与论文索引上一篇从一次 finish_reason=length 翻车讲了静默失败。这篇把视野拉满:按评测管线把 LLM 评测的坑切成数据、生成、评分、统计、链路五层共 25 个,每个坑给症状、论文证据(带具体数字)和防线;末尾收三条跨层主线和一份评测前中后防坑清单。AILLM评测论文深读工程实践
2026年9月10日一次 finish_reason=length 翻车:LLM 评测的静默失败分几层Veral 跑 Kimi K2 多选评测翻车:reasoning 吃光 4096 token、content 为空、finish_reason=length,评分器抓不到答案。以这次为锚点,把 LLM 评测里的静默失败排成五层——生成层、评分层、统计层、数据层、链路层——每层给症状、根因、探测方法与 arXiv 出处。AILLM评测Agent论文深读工程实践
2026年9月9日BFCL v3 深读:多轮函数调用的评测口径,从「对答案」换成「diff 状态」Berkeley 那篇 BFCL v3 博客表面在讲 1000 条新多轮题目,底下真正换掉的是评测口径:从 AST 匹配一条正确轨迹,变成让代码跑进沙盒后比对对象属性。附源码定位、条数核对、四类多轮任务的判据分工,以及一处被注释掉的更严判据留下的证据。AILLMAgent评测工具调用源码阅读
2026年9月9日什么是大模型的环境工程:一道题只有「不全对也不全错」才算数从 GRPO 组内优势的手算出发:8 次 rollout 全对或全错,优势严格为 0,算力白花。由此推出难度有效带 p∈[0.25,0.75],并结合 SWE-bench 字段清单、DAPO 动态采样与 rollout 吞吐工程,说清环境工程到底在工程什么。AILLMAgent论文深读
2026年9月9日图像识别做得更好,卡点不在「看清」而在「定位」——三因子拆解与 2026 年的三记反手把图像识别拆成采样、定位、表征三道闸门:我亲手跑的脚本量出 resize 在模型看到图之前就丢掉 99% 像素的物理边界,再用 NaViT 到 FAVE 十余篇论文定位每条路线在修哪一道;重点是 2026 年的三篇论文如何反手拆掉「用图思考」的一半叙事——承重的是坐标文本,不是回传的像素。AILLM论文深读Transformer工程实践
2026年9月9日大模型热词地图 2026-09:把 63 个关键词按「谁是当下的瓶颈」排成一条链从可验证奖励、环境工程、test-time scaling,到 MoE 与混合线性注意力、PD 分离、MCP/A2A、致命三要素与评测饱和——按瓶颈迁移的顺序枚举当下热词,每个词给一句人话解释、为什么现在热,以及它是新瓶颈、旧词回温还是营销词。AILLMAgentAgent 工程
2026年9月9日一个模型的一生:从受孕定形到夕阳反哺,一张横图看完八格流水线把大模型从架构定形、预训练、后训练、评测、部署、Agent 产品一路到退役反哺画成一张横向的生命线,再顺着这张图立一个主线:这八格是一条单向压缩管道,每格都在把上游更大的东西压成更小的表示且丢弃不可逆,而整条链上只有最后一格会产出新信息——这解释了 2026 年的热点为什么全挤在末端。AILLM模型训练Agent 工程系统设计
2026年9月8日多轮 Agent 信用分配深读:奖励「给谁」是二阶问题,「覆盖多广」才是一阶深读 arXiv:2609.02417《Coverage, Not Targeting》:终态验证的多轮 Agent 里,验证器只暴露 k=1 步、成功却要 C=5–8 步硬前置链(V_d≈0.15);这时把奖励「对准关键步」是二阶的,把固定预算铺到覆盖全链才是一阶——shuffled 对照证明定向本身不带来收益,相位边界在 V_d*≈0.8。附我用 numpy 按附录 C 复现的两条扫描,和两笔能拿笔算完的账。AgentAgent 工程论文深读LLM模型训练
2026年9月8日Agent 记忆的前沿玩法:从存聊天记录,到主动寻找可用证据结合 Hindsight、EviMem、RLM、MemSkill、AgeMem 与最新隐式记忆评测,拆解有效的记忆和知识获取路线,附版本冲突小实验、成本复算与落地顺序。AILLMAgent记忆RAG论文深读评测