2026年9月21日RLCD 拆解:Jev 训练招牌里,多少是新的?TypeSafe 把 Jev 的训练招牌叫 RLCD。arXiv 上有个近亲 2025-07 就交了叫 RLCR,Brier 直接进奖励;Kadavath 2022 甚至一个 T=2.5 就能事后修一半。本机 Qwen3-4B 跑 30 个是非题:平均自信 99.9%、准确率 90%。AI InfraLLM论文深读模型训练
2026年9月14日把工具调用数据反着造:ToolGrad 用 500 条样本追平闭源大模型的那件事ToolBench 用 12.6 万条 SFT 数据把开源模型教会 tool-use,方式是「先给用户问题、DFS 搜工具链」。ToolGrad 反着来:先造链、再回头写用户 query。500 条样本训练出的 Gemma-3-12B 在 BFCL 上 83.1 分,等于 gemini-2.5-pro、高于 GPT-5。这篇把它的四模块管线拆到源码位置,把「textual gradient」追溯到 TextGrad,并和 APIGen、ToolACE 拉一张四家决策矩阵。AILLM工具调用论文深读模型训练
2026年9月14日12 种微调技术不是 12 个选项,是三张账单的折扣券图上写 BitFit「约占全部参数的 0.08%」。我按真模型的张量表数了一遍:129,024 个 bias,占 0.001694%,差 47 倍——而且它已经不是最省的那个。顺着这条线把 12 种技术钉进显存、标注、数据位置三张账单。AILLM模型训练工程实践
2026年9月10日Agent 自进化不是一张全景图,是一架四层可回滚阶梯——每往下一层 credit 就贵一个数量级把 9 篇「Agent 自进化」论文挂进一架四层可回滚阶梯:L1 Skill 文档(分钟级、git diff)、L2 Skill Bank(小时级、可 prune)、L3 Harness / 元进化(会话级、Pareto 归档)、L4 模型权重(不可逆)。每下一层,回滚成本 × 传导广度跳一个数量级,credit assignment 门槛也跳——L1 靠「≥2 条轨迹独立提议同一编辑」的投票几何就够(K=8 时假/真比 1:72),L4 必须靠 GiGPO 的 anchor state、LLM 语义自归因或 privileged teacher(OPSD)。附三笔 Python 手算:Trace2Skill 的投票几何、GiGPO 在不同状态空间下的 anchor 复用率、AgentEvolver 55% 步数节省背后的信号密度倍率。AILLMAgentAgent 工程论文深读模型训练
2026年9月10日GiGPO 到底靠什么工作:Agent 训练里的 credit assignment 廉价补丁GiGPO 把 GRPO 从"一整条轨迹一个 advantage"升级为"episode 组 + step 组 相加",在 ALFWorld/WebShop 上比 GRPO 高 12/9 个百分点。但它的核心机制既不是嵌套树,也不是嵌入相似度——就是 hash(str(observation))。这一切建立在一个物理假设上:多条 rollout 会撞到同一个中间状态。撞不到,方法退化。AILLMAgentAgent 工程论文深读模型训练
2026年9月9日一个模型的一生:从受孕定形到夕阳反哺,一张横图看完八格流水线把大模型从架构定形、预训练、后训练、评测、部署、Agent 产品一路到退役反哺画成一张横向的生命线,再顺着这张图立一个主线:这八格是一条单向压缩管道,每格都在把上游更大的东西压成更小的表示且丢弃不可逆,而整条链上只有最后一格会产出新信息——这解释了 2026 年的热点为什么全挤在末端。AILLM模型训练Agent 工程系统设计
2026年9月8日多轮 Agent 信用分配深读:奖励「给谁」是二阶问题,「覆盖多广」才是一阶深读 arXiv:2609.02417《Coverage, Not Targeting》:终态验证的多轮 Agent 里,验证器只暴露 k=1 步、成功却要 C=5–8 步硬前置链(V_d≈0.15);这时把奖励「对准关键步」是二阶的,把固定预算铺到覆盖全链才是一阶——shuffled 对照证明定向本身不带来收益,相位边界在 V_d*≈0.8。附我用 numpy 按附录 C 复现的两条扫描,和两笔能拿笔算完的账。AgentAgent 工程论文深读LLM模型训练
2026年9月3日Hermes 4 深读:一个把「拒绝率」当成产品规格来打的开源模型Nous Research 的 Hermes 4 在自家 RefusalBench 上打 57.1,同一张表 GPT-4o 17.67、Sonnet 4 是 17、GPT-5 是 11.34——这不是能力差,是产品哲学差。本文按 arXiv 2508.18255 技术报告逐节拆:base model 拼装(405B/70B 是 Llama 3.1、14B 是 Qwen3)、DataForge 图式合成数据、Atropos 千验证器拒绝采样、30K token 强制截断这一手漂亮的 length control、192 张 B200 训一次要多少钱。结尾接回昨天那篇 OpenRouter:Hermes 4 405B 全网只 1 家 provider——「意见型微调」不进入商品市场。AILLMAI Infra论文深读模型训练
2026年8月17日模型配置到底在配置什么:从 Megatron 源码读懂 Config、Spec、Builder 三层基于 Megatron 训练侧 GPTModelConfig/GPTModelBuilder 源码,把「模型配置」拆成三个正交问题:模型长什么样(Config)、每层用哪套实现(Spec)、切成几块放在哪张卡上(Builder)。含词表 padding 手算、layer spec 决策树伪代码和 MTP 支线,末尾给一张读任何训练框架配置都能用的三问速查表。AI InfraLLM源码阅读模型训练
2026年8月17日二十行骨架与四本账:Megatron 预训练主循环源码深读基于 Megatron 训练侧 training.py 真实源码,把预训练主循环拆成「二十行理想骨架 + 四本工程账(记账/容错/性能/并行胶水)」。含 FLOPs 公式与 6ND 的手算对照、packed sequence 的 L² 记账、跨 rank 对齐 GC 等细节,末尾给一张读任何训练框架主循环都能用的六问清单。AI InfraLLM源码阅读模型训练
2026年8月8日SFT 是解锁器,不是灌装机:从 FLAN 到 LIMO,重新认识监督微调把 2021–2025 年关于监督微调的十一篇关键论文串成一条线索:SFT 用的还是预训练那个交叉熵,它几乎教不会模型新知识——1000 条样本就能对齐(LIMA)、改变的主要是风格 token(URIAL)、硬灌新知识反而教出幻觉(EMNLP 2024)。SFT 的真正身份是解锁器:把预训练已有的能力接上开关。文末给出工程速查表和一个本地就能跑的验证实验。LLM模型训练论文深读
2026年8月4日训练小模型的三条路,和每条路背后站着的那个大模型陪读一份流传很广的《2026 小语言模型训练完全指南》:先修正它引用错的基准数字,再把从零训练、微调、蒸馏三条路径还原成同一个问题的三种答案——你的模型的知识从哪里来。结论藏在路径背后:2026 年每个能打的小模型身后,都站着一个大模型。模型训练工程实践LLM
2026年7月28日nanoGPT config 不是参数表:一张 LLM 训练配方地图从 LLM 训练的大背景出发,系统讲解 nanoGPT config 目录里的训练、微调、评估配置,以及 batch、context、模型大小、AdamW、学习率、DDP、dtype 等参数如何在源码中生效。AIAI InfraLLMTransformer模型训练源码阅读学习笔记
2026年7月25日同济高数第八版上册到模型学习:25道核心题按同济高数第八版上册主线,围绕极限、导数、Taylor、积分和微分方程设计25道原创题,题题带详细答案,并说明它们如何服务模型学习。AI 数学模型训练零基础
2026年7月14日任务能力怎样写进 LLM 权重:从一次梯度更新到预训练与对齐沿着一条训练信号的旅程,解释 loss、gradient、AdamW 怎样改变权重,并串起预训练、SFT、RLHF、DPO、LoRA 与上下文学习。AILLM模型训练学习笔记
2026年7月14日一组权重,为什么能学会许多任务:条件化计算、梯度冲突与多任务收敛从一个根本无解的双标签训练集出发,解释任务条件、不同激活、梯度夹角、Pareto 折中,以及怎样让一个模型可靠地同时学会 A、B 和更多任务。AILLM模型训练