2026年8月4日训练小模型的三条路,和每条路背后站着的那个大模型陪读一份流传很广的《2026 小语言模型训练完全指南》:先修正它引用错的基准数字,再把从零训练、微调、蒸馏三条路径还原成同一个问题的三种答案——你的模型的知识从哪里来。结论藏在路径背后:2026 年每个能打的小模型身后,都站着一个大模型。模型训练工程实践LLM
2026年8月3日从能跑到可托付:顶级 Agent 应用工程师的六层系统与三条闭环写给已经在做 Agent 的工程师:从目标契约、上下文状态、决策控制、工具环境、运行时信任到评测学习,用六层系统与三条闭环重新理解 Agent 应用层,并给出从功能实现者走向系统负责人的进阶路径。AILLMAgentAgent 工程上下文工程AI Infra论文深读
2026年8月3日当 Agent 开始说“物化”:一张大模型工程术语地图从物化、编排、轨迹、检查点到 Harness 和 Verifier,按任务闭环梳理 60 多个 Agent 工程术语,并追问哪些是真问题的新名字、哪些只是旧概念迁移,以及模型为何偏爱这种语言。AILLMAgentAgent 工程论文深读
2026年8月3日Agent 的断点续传:任务如何中断、恢复,并且不把效果丢在路上结合分布式快照、Saga、LogAct、Crab、RAC、Plans Don’t Persist 与 τ-bench,解释 Agent 长任务如何用任务契约、事件日志、副作用账本、恢复对账和外部验证器实现可中断、可恢复且效果可验收。AILLMAgent论文深读
2026年8月3日Agent 如何控制浏览器:从 HTTP、DOM、CDP 到视觉与混合自动化系统拆解 Browser Agent 的控制通道与页面表示:比较 HTTP/API、WebDriver、Playwright、DOM、Accessibility Tree、CDP、浏览器扩展、视觉坐标和 Agent-aware browser runtime,并结合论文讨论评测、安全与选型。AILLMAgent论文深读
2026年8月3日大模型为什么要用 osascript 操作桌面:从可访问性树到视觉 GUI Agent从一条 macOS UI 探测命令出发,解释大模型如何观察、定位、操作并验证桌面软件,比较 Accessibility Tree、视觉坐标、DOM、API/CLI 与混合控制的取舍和局限。AILLMAgent论文深读
2026年8月3日大企业的大模型到底在搞什么:一张"四个缺口"全景图把大企业"能搞的大模型内容"收敛成四个缺口——知识、行动、信任、成本。用 20 余篇可查证的 arXiv 论文标出每个缺口下值得立项的方向、已知的坑与真实完成度,并给出一张立项检查单。LLMAI InfraRAGAgent
2026年8月3日按场景看提示词工程与上下文工程:一个优化问题的两端提示词工程和上下文工程不是两门手艺,而是同一个优化问题在不同场景下的解。用 Mei et al. 2025 综述的形式化定义 C = A(c_instr, c_know, c_tools, c_mem, c_state, c_query) 做骨架,沿"单轮闭卷 → 开卷问答 → 长对话 → 动手 agent → 多智能体"五级场景阶梯,讲清每登一级、上下文里多了哪个成分、工程问题怎么变形——以及为什么提示词工程没有死,只是降级成了子模块。AILLMPrompt 工程上下文工程Agent论文深读
2026年8月3日小公司如何构建自己的大模型:一条论文铺出来的决策阶梯把"自建大模型"拆成从 RAG 到从零预训练的四级阶梯,用 12 篇可查证的 arXiv 论文标出每一级的成本量级、升级信号与踩坑边界——BloombergGPT 与 DeepSeek-V3 是两端的对照案例。LLMAI Infra
2026年8月2日上下文不是平的:位置与结构如何决定一条信息对输出的干预力同一条信息放在上下文的开头、中间、结尾,对最强模型输出的影响力可以差出几十个百分点——而且这个"位置地形"会随上下文填充率动态变形:塞满一半之后,经典的 U 形曲线塌掉,只剩结尾优势。从注意力机制的三个根本约束出发,讲清位置偏差的成因、衰减的动态过程,以及"结构"为什么本质上是在地形上打人工锚点。AILLM上下文工程
2026年7月31日当你对 Claude Code 说 hello:一次请求日志里的上下文工程哲学以一份真实的 Claude Code 请求日志为标本,结合 Lost in the Middle、MemGPT、SWE-agent、Manus 与 Anthropic 的上下文工程实践,解剖一个 hello 背后数万 token 的信息环境设计。上下文工程AgentLLM
2026年7月29日遗忘是一种能力:五篇论文看懂长程 Agent 的记忆管理,正在重演操作系统内存史精读 AgentFold、IterResearch、AgentSwing、ContextBudget、Self-GC 五篇 2025.10–2026.07 的论文:为什么"记住一切"的 agent 反而答得更差?用 Pass@1 = η×ρ 这个分解式看懂 context rot 的本质,以及上下文管理如何从启发式规则一步步演化成垃圾回收、预算分配和运行时调度——操作系统内存管理史的完整重演。AILLMAgent上下文工程论文深读
2026年7月29日一个 search 工具能挖多深:解剖 Agent 工具箱里最不起眼的函数search(query) -> results,看起来是 agent 工具箱里最简单的函数。结合 SWE-agent、SLIM(Lost in the Maze)、ParallelSearch、Search-R1、ZeroSearch 五篇论文,逐层解剖它的设计空间:返回什么、问什么、怎么学会用、搜索引擎本身要不要是真的——每一层都藏着能让性能翻倍或减半的决定。AILLMAgent搜索RAG论文深读
2026年7月29日删掉 80% 系统提示词之后:Claude 5 时代的上下文工程新规则Anthropic 为 Claude 5 代模型删掉了 Claude Code 超过 80% 的系统提示词,编码评测没有任何可测的下降。深读这篇官方博客:为什么"给模型写规则"是有保质期的负债,五个 Then vs Now 的转变背后是苦涩的教训在提示词层重演,以及怎么把这套经验用到你自己的 agent 上。AILLMAgent上下文工程
2026年7月29日什么才是好的 Harness:判断归模型,物理归代码同一个模型,换个 harness 性能能差 6 倍。结合 SWE-agent(ACI 开山之作)、How Much Heavy Lifting、Inside the Scaffold、Code as Agent Harness、Fork-Explore-Commit 等论文,深度拆解好 harness 的三件本职工作:把世界翻译成模型好用的接口、把确定性工作从模型手里拿走、让错误变便宜——以及为什么"提示词里的规则是恳求,harness 里的规则是物理法则"。AILLMAgent上下文工程论文深读
2026年7月29日模型为什么会伸手:工具使用不是被教会的,是目标函数的影子一个只会预测下一个 token 的模型,凭什么会去调用计算器和搜索引擎?从 Toolformer 的自监督起源(一次调用能留下的唯一理由是降低未来 token 的 loss),到 RLVR 时代的工具滥用幻觉(无成本时任何 ΔP>0 都值得调用),再到 knowing-doing gap(知道该用和真的去用在残差流里是两个方向)——结合五篇论文回答:模型为什么会用工具、为什么会滥用、以及为什么"知道"不等于"做到"。AILLMAgent论文深读
2026年7月28日Agent 平台正在重新发明操作系统:美团 CatPaw 架构深读逐段拆解美团 CatPaw Managed Agents 的"脑手分离"架构,把每个组件映射回它的操作系统祖先:Session 恢复是进程切换,上下文压缩是虚拟内存,Sandbox Gateway 是调度器,模型路由网关是硬件抽象层。结合 ReAct、MemGPT、AIOS、Firecracker、CaMeL 等论文,解释为什么相同的资源约束必然长出相同的架构形状——以及这个类比在哪里失效。AIAgentLLM论文深读
2026年7月28日LLM 与 Agent 源码品读地图:11 层、50+ 个值得逐行读的开源项目把大模型与 Agent 开源栈拆成 11 层,每层回答"被什么稀缺资源塑形",再给出代表项目与具体的"读什么"。从 micrograd 到 vLLM,从 LangGraph 到 OpenHands,一张可以按图索骥的源码阅读地图。LLMAgentAI Infra源码阅读
2026年7月28日Scaling 没有死,它换了坐标轴:2026 年 LLM 研究与产品的五条主线推理模型、智能体、上下文工程、MoE 与稀疏注意力、扩散 LLM、世界模型……热门方向看似散乱,其实都在回答同一个问题:预训练的规模红利递减之后,去哪里找新的增长轴?这篇把它们收拢成五根杠杆——推理时算力、经验、上下文、单位成本、生成范式——并附上可核查的 arXiv 论文与开源产品索引。LLM
2026年7月28日nanoGPT config 不是参数表:一张 LLM 训练配方地图从 LLM 训练的大背景出发,系统讲解 nanoGPT config 目录里的训练、微调、评估配置,以及 batch、context、模型大小、AdamW、学习率、DDP、dtype 等参数如何在源码中生效。AIAI InfraLLMTransformer模型训练源码阅读学习笔记
2026年7月28日从 65 个字符开始:nanoGPT 的 Shakespeare 字符级语言模型数据准备用 nanoGPT 的 shakespeare_char prepare.py 串起字符到整数 id、train.bin/val.bin、meta.pkl、next-token 训练样本,以及它和 BPE/GPT-2 路线的差别。AIAI InfraLLM源码阅读学习笔记
2026年7月28日一个循环,六种填法:用伪代码把 LLM 后训练一次排黑把 SFT、奖励模型、RLHF-PPO、拒绝采样、DPO、KTO、GRPO 全部写成能逐行读懂的伪代码。你会发现它们是同一个训练循环的六种填法,区别只在三个槽位:回答谁生成、信号谁给、信号怎么变成梯度。文末给出全景对比表和三条真实流水线(InstructGPT、Llama 2、DeepSeek-R1)的组装方式。LLM
2026年7月28日读懂训练曲线:从一张 val/loss 图判断模型有没有真的变好用一张验证损失曲线拆解训练图的读法:先看坐标和指标方向,再看趋势、噪声、对照和决策,最后用 train loss、val loss、数据切分和优化过程串起因果链。AILLM学习笔记
2026年7月27日当写界面和看界面的都不再只是人:大模型时代前端的三条战线前端建立在"界面由人写、给人看"两个隐含假设上,大模型正在同时拆除它们。结合 Design2Code、Agentic Web、Generative UI 等十余篇论文,推演前端各领域与工程化的整改趋势。LLM论文深读