全部专题

Reading path

大模型论文精读

沿论文原文拆解模型结构、训练方法、评测与工程权衡,不追热点标题,追可复用的理解框架。

171 篇文章

Archive

专题归档

第 5 / 7 页

Scaling 没有死,它换了坐标轴:2026 年 LLM 研究与产品的五条主线

推理模型、智能体、上下文工程、MoE 与稀疏注意力、扩散 LLM、世界模型……热门方向看似散乱,其实都在回答同一个问题:预训练的规模红利递减之后,去哪里找新的增长轴?这篇把它们收拢成五根杠杆——推理时算力、经验、上下文、单位成本、生成范式——并附上可核查的 arXiv 论文与开源产品索引。

涌现是真是幻?大模型"突然开窍"的本质——一场跨越四年的论文辩论

为什么三位数加法这种能力会在模型变大时"突然出现"?沿着 Wei 2022 定名、Schaeffer 2023 质疑(海市蜃楼)、Du 2024 反转(损失阈值)、Michaud 量子模型、grokking 显微镜、Arora & Goyal 技能组合的论文接力,把涌现拆成一个可复用的心智模型:底层的进步几乎总是连续的,"涌现"是连续进步穿过非线性读出面时投下的阶跃阴影。

一文讲透大模型格式化输出:从预训练先验到约束解码的五层保障

为什么"请只输出 JSON"的哀求会失灵,而 response_format 一开就稳?沿训练到推理的完整链路拆解格式保障的五层机制:预训练给先验、后训练给服从、提示接口表达意图、约束解码给硬保证、系统校验兜底。结合 PICARD、Outlines、XGrammar、SGLang 与 Let Me Speak Freely 等论文,讲清 FSM 掩码的原理、tokenizer 错位难题、约束解码的分布扭曲代价,以及生产系统为什么五层全都要。

穿透控制面:你写进 CLAUDE.md 的每一行,最后变成了模型内部的什么

上一篇找齐了 Agent 的控制面,这一篇把 X 光打进去:指令、示例、人格设定、测试反馈,穿过 tokenizer 之后分别控制了 Transformer 内部的哪个机制?结合 induction heads、task vectors、persona vectors 三条机制学证据链,得到一个统一答案——上下文控制的从来不是模型会什么,而是在一座冻结的能力库上做"寻址":选择并组合已有的回路。