热词不是一份并列的清单。它们是同一条约束链上的不同位置——一个词之所以现在热,通常是因为它上游那一层刚刚被解决,于是它成了新的瓶颈。
这就是这篇的主线,也是它和「又一份术语表」的区别:想判断一个词值不值得你花时间,先问它在链上的哪一段,以及它上游那段是不是真的通了。
举个眼前的例子:2024 年大家谈「更大的模型」,2025 年谈「更长的思考链」,2026 年谈的是「谁来造题」——因为算力和数据都不再是最紧的那个环,能自动判对错的任务成了最紧的。链往前挪了一格,热词就整体换了一批。
本站之前写过一张Agent 工程术语地图,那篇管的是「物化、编排、轨迹、Harness」这类Agent 工程内部的词,追问它们各自命名了什么。这篇不重复那 60 个词,管的是整个领域当下的热度分布:训练信号、架构、推理系统、协议、安全、评测、经济各占一段。两篇可以对着看:那篇是横切面的词典,这篇是纵向的瓶颈链。
怎么读下面的表
每张表三列,第三列是我的判断,判据写在这里,方便你反驳:
| 分级 | 可复核判据 |
|---|---|
| 新瓶颈 | 2025–2026 有论文或生产系统在专门讨论「怎么做它」,而 2023 年的同类文章里这个词还不存在、或不是主角 |
| 旧词回温 | 这个词在 RL / 数据库 / 分布式系统 / 认知科学的旧文献里已有明确定义,现在换了载体重新变紧 |
| 营销词 | 把这个词从句子里删掉,信息量不减 |
「旧词回温」不是贬义。回温的词往往有五十年的现成工具箱可借,反而是杠杆最高的一批。真该警惕的只有第三档。
分级是我的判断,不是客观事实——判据摆在上面,就是为了你能拿着判据反驳某一行。另外全文所有 arXiv 编号我都通过 API 逐个回查过,具体数字的档位标在它出现的那句话里。
链条自上而下是这样一段接一段的:能力从哪来(训练信号)→ 算力往哪放(推理时计算)→ 模型长什么样(架构)→ 记什么忘什么(上下文与记忆)→ 怎么服务(推理系统)→ 怎么互联(协议与外壳)→ 怎么不出事(权限与安全)→ 怎么承认它行了(评测与经济)。
第一段 · 能力从哪来:训练信号与环境
这一段的瓶颈:不缺算力也不缺参数,缺的是「能被程序自动判对错」的题。
| 关键词 | 一句话人话 | 为什么现在热 | 分级 |
|---|---|---|---|
| RLVR(可验证奖励强化学习) | 只在答案能被程序判对错的任务上做强化学习:数学题比答案、代码跑测试 | R1 之后开源推理模型的主配方 | 新瓶颈 |
| 环境(environment)/ 环境工程 | 模型练手的那个可交互世界:初始状态、可用工具、判完成的规则 | 关注点从「模型怎么学」移到「谁来造题」,造环境比调算法更卡人 | 新瓶颈 |
| Agentic RL | 把模型当成在部分可观测环境里做序贯决策的策略来训,而不是句子补全器 | 单轮推理指标见顶后,训练目标整体换成多轮任务 | 新瓶颈 |
| GRPO | 去掉价值网络的 PPO 变体:同一道题采样一组答案,用组内相对好坏当优势 | 省显存、长链条上稳,成了开源 RL 训练的默认起点 | 旧词回温 |
| 信用分配(credit assignment) | 一次多步任务成功或失败,功过该记到哪一步上 | RL 的老问题,在多轮 Agent 上重新成为第一障碍 | 旧词回温 |
| 奖励攻击(reward hacking) | 模型学会讨好打分器,而不是真把事做对 | 打分器越来越常是另一个模型,攻击面随之变大 | 旧词回温 |
| 测试时强化学习(TTRL) | 没有标签也训:把多次采样的多数票当奖励 | 把「推理时多花算力」和「训练」接成了一条路 | 新瓶颈 |
| 蒸馏(distillation) | 用强模型的输出教小模型 | 小模型上牌桌的主要手段 | 旧词回温 |
| 合成数据 / 自反馈偏差 | 用模型造训练数据;以及「自己教自己越教越偏」 | 数据问题从「量不足」转向「质不高」(二手综述口径,我未核实原始统计) | 旧词回温 |
我的判断:这一段里最实心的词是环境。理由是它是唯一一个「概念清楚、但没人有现成答案」的词——RLVR 的算法骨架已经公开,GRPO 有开源实现,而「你的业务任务怎么变成一个可自动判定的环境」没有通解,每家都得自己啃。这也是它值得投时间的原因。
反过来,Agentic 这个前缀本身几乎不携带信息(那篇术语地图里已经算过这笔账),它热是因为好卖,不是因为它命名了新东西。
一个容易被忽略的坑:可验证 ≠ 多试几次就更准。本站从可验证奖励到环境工程那篇里手算了一个反例——验证器排序正确,但少了一个数,多采样反而选错。RL 训练侧还可以回看DeepSeek-R1 那篇和SFT 是解锁器不是灌装机。
第二段 · 算力往哪放:推理时计算
这一段的瓶颈:预训练那条曲线变贵了,于是同一份算力被挪到生成的时候花。
| 关键词 | 一句话人话 | 为什么现在热 | 分级 |
|---|---|---|---|
| test-time scaling(推理时扩展) | 不换模型,靠在回答时多花算力换准确率 | 已经分化成「并行」(多采几个答案投票)和「串行」(想得更长)两条路 | 新瓶颈 |
| long CoT / 思考预算 | 让模型先写一长段思考再作答;预算是你愿意为这段思考付多少 token | 从研究技巧变成了 API 上的一个可调参数 | 新瓶颈 |
| pass@k / maj@n | 采 k 个答案里有一个对就算对 / n 个答案的多数票 | 前者是能力天花板,后者是你真能交付的东西,两者常被混着报 | 旧词回温 |
| best-of-N / 自一致性 | 多采几个再挑一个,或投票 | 最便宜的推理时扩展,也最容易被当成「模型变强了」 | 旧词回温 |
| 投机解码(speculative decoding) | 小模型先猜一串 token,大模型一次性批量验证 | 它不省算力,省的是权重搬运次数 | 旧词回温 |
| 推理时自我改进 / 在上下文里做 RL | 不更新权重,只靠这一轮的反馈把策略调好 | 是「测试时扩展」和「训练」之间那块空地 | 新瓶颈 |
我的判断:这一段最值得警惕的话术是拿 pass@k 当战绩。pass@k 高只说明正确答案在候选集里,不说明你能把它挑出来——挑出来的那一步是验证器的活,而验证器就是第一段的瓶颈。所以这两段是扣在一起的:推理时扩展的上限,等于你的验证器的上限。 这是我从这条链上拿到的最有用的一条推论。
数字上有一条可引的锚:TTRL 论文摘要自称,仅用无标签测试数据,Qwen-2.5-Math-7B 在 AIME 2024 上的 pass@1 提升约 211%(二档证据:论文摘要原文,我未复现)。
搬运问题那条线可以接Medusa 深读;「单轮见顶、长程接棒」这个判断本站在Fable 5.1 的数据增长在说什么里展开过。
第三段 · 模型长什么样:架构
这一段的瓶颈:参数还想涨,但每个 token 都激活全部参数已经付不起了。
| 关键词 | 一句话人话 | 为什么现在热 | 分级 |
|---|---|---|---|
| MoE(混合专家) | 模型里有很多组前馈网络,每个 token 只路由到其中几组 | 2026 年新开源权重模型的默认设计(二手综述口径,我未逐一核对型号) | 旧词回温 |
| 激活参数(如 35B-A3B 式命名) | 总参数 35B,但每个 token 只用到 3B | 「显存按总参数付,速度按激活参数拿」——规格表读法变了 | 新瓶颈 |
| 共享专家(shared expert) | 留几个专家永远参与,专门装公共知识 | 减少每个专家里的重复内容 | 新瓶颈 |
| 线性注意力 / SSM | 把注意力换成一个固定大小、会随时间衰减的状态,代价从 O(n²) 降到 O(n) | 长上下文变成 Agent 的常态负载后重新变紧 | 旧词回温 |
| 混合注意力(hybrid attention) | 几层线性、几层标准注意力交替叠 | 现在的实际主流不是二选一,是掺着用 | 新瓶颈 |
| 潜在注意力 / KV 压缩(如 MLA 系) | 把 K、V 投影到低维再缓存 | 直接打 KV cache 的显存账 | 新瓶颈 |
| 扩散语言模型 | 不逐字往下写,而是从一片噪声里并行地把整段话「显影」出来 | 是自回归之外少数被认真验证过的替代路线 | 新瓶颈 |
| 量化(FP8 / 4-bit / FP4) | 用更少的位数存权重和激活 | 4/8 位部署已是常态而非折衷(二手口径,未核实) | 旧词回温 |
| 1M 上下文 / YaRN | 上下文窗口做到百万 token;YaRN 是一类把窗口外推的手法 | 头部模型的标配宣传项 | 旧词回温 |
我的判断:这一段的热词里,混合注意力是我认为最被低估的。原因是它承认了一件不讨好的事——线性注意力单独用会掉能力,标准注意力单独用付不起长上下文,所以最后赢的是掺着用。这种「没有干净胜者」的结论不好卖,但架构演进这两年基本都长成了这个样子。本站深读 Kimi K3 的 KDA就是从「把注意力换成一块会遗忘的内存」这个角度啃的。
另一头,扩散语言模型我给的判断是「买到了并行、亏在了缓存」——这不是一句立场,是有账可算的,扩散语言模型不是物理定律那篇算过一遍。
需要诚实说明:这一段里具体的型号名与版本号(哪家在 2026 年发了什么、稀疏比多少)我这次只见于二手综述博客,没有逐个回到官方模型卡核实,所以正文里我不写具体型号。
第四段 · 记什么忘什么:上下文与记忆
这一段的瓶颈:窗口已经足够大了,但「放进窗口」和「记住」是两回事。
| 关键词 | 一句话人话 | 为什么现在热 | 分级 |
|---|---|---|---|
| 上下文工程(context engineering) | 为这一次决策,挑选、组织、更新塞进模型的那些信息 | 从「写好提示词」升级成了系统工程 | 新瓶颈 |
| 上下文压缩(compaction) | 在保住任务目标和关键证据的前提下把上下文缩短 | 长程任务跑久了必然撞到窗口上限 | 旧词回温 |
| 上下文腐化(context rot,社区词非论文术语) | 上下文越长,中段的信息越容易被忽略 | 「大窗口≠好记性」的通俗说法 | 新瓶颈 |
| 中间遗忘(lost in the middle / U 形曲线) | 模型用得好开头和结尾,中段最差 | 同一现象的学术说法 | 旧词回温 |
| 情景记忆 / 分层记忆 | 把经历按事件存下来,或分层组织后按需取用 | 认知科学借词;现在是 Agent 记忆系统的主流骨架 | 旧词回温 |
| 测试时训练当记忆(TTT 系) | 把读过的长上下文压进权重里,推理时就地更新 | 把长上下文重新定义成一个持续学习问题 | 新瓶颈 |
| KV cache | 注意力的中间结果缓存,省掉对已生成 token 的重复计算,代价是显存 | 它是长上下文和高并发的共同账单 | 旧词回温 |
| 前缀缓存 / RadixAttention | 共享同一段开头的请求,复用那段已经算好的 KV | Agent 负载里前缀重复率极高,收益直接 | 新瓶颈 |
我的判断:这一段被误用最狠的一组词是「长上下文」和「记忆」被当成同义词。它们的区别很物理:上下文是这一次调用能读到的,记忆是跨调用还在的。把 1M 窗口当记忆系统卖,是这一段最常见的偷换。
至于「遗忘」,本站的观点是它是能力而不是缺陷——遗忘是一种能力那篇用五篇论文串了长程 Agent 的记忆管理正在重演操作系统内存史;更新的玩法在Agent 记忆的前沿玩法。KV cache 当内存管理来读的那条类比在把 LLM 推理栈当操作系统读一遍,前缀复用的源码级细节在vLLM Automatic Prefix Caching 源码精读。
第五段 · 怎么服务:推理系统与成本
这一段的瓶颈:模型不动,同样一张卡上能服务多少人、每百万 token 卖多少钱。
| 关键词 | 一句话人话 | 为什么现在热 | 分级 |
|---|---|---|---|
| prefill / decode | 推理的两个阶段:把输入整段一次算完 vs 之后逐 token 往外蹦 | 两段被两个不同的物理量卡住,这是整段的地基 | 旧词回温 |
| PD 分离(prefill/decode disaggregation) | 把两个阶段放到不同机器上,各自配硬件和并行策略 | 2026 年正在从「默认最佳实践」被拉回「取决于负载」 | 新瓶颈 |
| KV 卸载 / 分层显存 | KV cache 在 GPU 显存、主机内存、SSD 之间分层存放 | 长上下文下 KV 比权重还占地方 | 新瓶颈 |
| 连续批处理(continuous batching) | 一个请求结束就立刻把新请求塞进同一批,不等整批跑完 | 高吞吐服务的地基默认项 | 旧词回温 |
| 超售调度 / 抢占 | 按预期而不是最坏情况分配显存,撞上了再回收重算 | 吞吐提升主要来自敢不敢超售 | 旧词回温 |
| 路由(router / semantic router) | 一个请求该交给哪个模型、哪个副本 | 便宜模型能接住的活越多,账单越薄 | 新瓶颈 |
| 推理市场 / 每百万 token 单价 | 同一个开源权重被多家供应商同时托管,价格与延迟公开竞争 | 模型能力趋同后,竞争点转移到了供给侧 | 新瓶颈 |
| 序列并行分 KV | 超长请求的 KV cache 摊到一圈 GPU 上 | 单请求 KV 装不下一张卡时唯一的解法 | 旧词回温 |
我的判断:这一段今年最值得记的一条变化是 PD 分离的降级。2024–2025 它几乎是「先进架构」的同义词,而 2026 的论文开始正面写它的反面:KV cache 跨机搬运本身有开销、两边各存一份权重会吃掉有效缓存容量、流量倾斜时两个集群互相闲置。更有意思的是一条二阶效应——当缓存复用和卸载做得很足时,prefill 也开始变成带宽受限,于是「给 prefill 配算力猛的卡」这个前提本身松动了(二档证据:KV 卸载瓶颈分析、对话级分离调度与DuetServe 的单卡内切分方案,我未复现其实验)。
这一段我有一个亲手测出的数字可以当地基(一档证据):同一台机器、同一个 7B 模型、同一条 llama-bench 命令,只把权重从 CPU 挪到 GPU,prefill 从 40.42 tok/s 涨到 1541.65 tok/s(38 倍),decode 从 21.37 tok/s 只涨到 53.33 tok/s(2.5 倍)。完整方法和另外两条独立探针在本地部署到底看哪些本机参数。这组数对着上面整张表的用处是:你在读任何服务端优化方案时,先问它优化的是算力题还是搬运题,两者的杠杆点完全不同。
系统侧的源码线索:SGLang 内幕(RadixAttention、超售调度)、RouteLLM 深读、深读 OpenRouter。顺带一个反直觉的实测:temperature=0 不等于 deterministic——批处理和调度会让同一个提示的输出漂移。
第六段 · 怎么互联:协议与运行外壳
这一段的瓶颈:模型和工具、Agent 和 Agent 之间那层接口该由谁定。
| 关键词 | 一句话人话 | 为什么现在热 | 分级 |
|---|---|---|---|
| MCP(Model Context Protocol) | 一套让 Agent 连外部工具和数据源的标准接口 | 工具接入层基本定了,现在的问题是怎么设计一个好的 server | 新瓶颈 |
| Agent Skills | 把一组能力、说明和资源打包成 Agent 能按需加载的东西 | 已进入 MCP 官方文档的构建路径(一手:MCP 文档导航含「Build with Agent Skills」) | 新瓶颈 |
| A2A(Agent2Agent) | Agent 之间互相发现、委派任务、交换消息的协议 | 由 Linux Foundation 下的 Agentic AI Foundation 托管(一手:A2A 官网公告与页脚版权) | 新瓶颈 |
| Agent Card | A2A 里那份自我介绍:我会哪些技能、走什么传输、怎么鉴权 | 放在 /.well-known/agent-card,服务发现的老套路搬到 Agent 上(一手:A2A 官方文档时序图) | 旧词回温 |
| 协议动物园(ACP / ANP / AG-UI 等) | 分别管多 Agent 协商语义、去中心化发现、Agent 与界面交互 | 层还在分,短期内别指望一套通吃 | 旧词回温 |
| Harness / 运行外壳 | 包住模型的循环、工具、状态、权限、恢复与验证 | 同一个模型换个外壳,表现差一档 | 新瓶颈 |
| 子 Agent / 委派 | 父任务把子任务交给另一个执行者,通常还保留总责任 | 上下文隔离的主要手段 | 旧词回温 |
| 治理缺口 | 三个协议都不管「这件事该不该做」,只管「怎么送到」 | 多 Agent 系统在生产上翻车的常见位置 | 新瓶颈 |
我的判断:MCP 该接就接,A2A 大多数团队现在还用不上。 判据是这样一条:如果你的多个 Agent 跑在同一个进程、同一个团队维护、共享同一套类型定义,那 A2A 给你的(传输 + Agent Card 握手)你本来就有,而它不给你的(这两个 Agent 到底在就什么达成一致)恰恰是你真正缺的。跨团队、跨框架、跨组织时它才开始值钱。这是一条可证伪的判断——如果谁能给出一个单团队内部因为上了 A2A 而明显变好的案例,我就该改。
学术侧有一篇 2026 年的论文正面写这个缺口:《Governance Gaps in Agent Interoperability Protocols》,标题就是「MCP、A2A、ACP 表达不了什么」;协议全景可看这篇综述(二档证据:均已回 arXiv 核实编号与标题)。
本站的相关旧文:MCP 史上最大改版的本质——状态不会消失只会搬家、Agent Skills 与 MCP 的研究前线、2026 年前沿在 Harness 上玩出的三条物理化战线。
一个小的一手观察:MCP 规范页当前标注的版本是 2026-07-28,而官方文档的「Get started」里已经并列了「Build with Agent Skills」——也就是说Skills 不再是某一家客户端的私有概念,它在往协议侧靠。这条我今天查文档时看到,可自行复核。
第七段 · 怎么不出事:权限与安全边界
这一段的瓶颈:能力越接近「读我的数据 + 看外部内容 + 能动手」,风险越是结构性的。
| 关键词 | 一句话人话 | 为什么现在热 | 分级 |
|---|---|---|---|
| 提示注入(prompt injection) | 把指令藏在模型会读到的内容里,让它改听你的 | 模型把系统提示、用户输入、检索内容压成同一条 token 序列,没有可靠的权限边界 | 旧词回温 |
| 间接注入(indirect / 二阶注入) | 指令藏在网页、文档、工具返回值里,不是用户亲手输的 | Agent 会主动去读外部内容,这是它的常态入口 | 新瓶颈 |
| 致命三要素(lethal trifecta) | 私有数据访问 + 接触不可信内容 + 有外发通道,三者齐了就危险 | Simon Willison 的提法;它解释了绝大多数已知案例的结构 | 新瓶颈 |
| Rule of Two | 一次无人审批的会话里,三要素最多占两个 | 一条能直接写进设计评审的硬约束(二手转述,我未核到一手出处) | 新瓶颈 |
| 爆炸半径(blast radius) | 假设它已经被攻陷,它最多能造成多大破坏 | 防线从「拦住注入」转向「限制被攻陷后能做什么」 | 旧词回温 |
| 工具投毒 / MCP 供应链 | 工具描述或 server 本身带着隐藏指令 | 你接的每个 MCP server 都是一次依赖引入 | 新瓶颈 |
| 沙箱与允许清单 | 限制 Agent 能执行什么、能碰哪些文件和网络 | 必要但会漏——允许清单反而可能给攻击者铺路 | 旧词回温 |
| 人在回路审批 | 高风险动作必须人点一下 | 目前唯一没被绕开的那道 | 旧词回温 |
我的判断:这一段的关键认知转向,是从「怎么识别恶意输入」变成「假设它一定会被骗,那它最多能干什么」。前者是分类问题,注定有漏检;后者是权限设计问题,有确定的工具。允许清单这个反例特别值得记:把 git branch 这类命令自动放行,等于把攻击者最需要的那步免去了审批——这是 2026 年安全厂商与 OWASP 会议侧反复举的模式(二手转述,我未核实具体 CVE 细节,也没有复现)。
学术侧两篇可查的锚:《The Promptware Kill Chain》追踪注入怎么演化成多步投递链,LivePI在做更贴近真实的间接注入评测(二档:编号已核实)。本站相关:当提示词成为依赖——读 Warp 的 skills-lock.json、当评测系统成为攻击目标。
第八段 · 怎么承认它行了:评测与验收
这一段的瓶颈:链条前七段都动了,判断「到底有没有变好」的那把尺却在失效。
| 关键词 | 一句话人话 | 为什么现在热 | 分级 |
|---|---|---|---|
| 饱和与换轴(saturation) | 一个基准被刷到接近满分,社区就换一个更难的轴 | 分数不再区分模型时,进步只能靠换题来看见 | 旧词回温 |
| 污染(contamination) | 测试题以某种方式进了训练数据 | 高分越来越难解读 | 旧词回温 |
| 状态式评测 | 不比最终答案的文字,比任务结束后世界的状态差异 | 多轮工具调用的对错本来就不在文字上 | 新瓶颈 |
| LLM-as-judge / rubric | 用模型当阅卷人,按维度和等级打分 | 大量任务没有硬对错,只能这么办;也是奖励攻击的入口 | 旧词回温 |
| 任务时长(time horizon) | 模型能独立撑住多长的任务,而不是答对多难的题 | 单轮题目见顶后,横轴换成了「能连续干多久」 | 新瓶颈 |
| 交付门(gate) | 不满足条件就不许进下一阶段的自动检查 | CI/CD 的老概念,比「请模型自觉」可靠 | 旧词回温 |
| 环境即评测 | 训练用的可验证环境同时就是验收口径 | 第一段和这一段在这里闭环 | 新瓶颈 |
我的判断:这一段最实用的一条是状态式评测。以多轮函数调用为例,把口径从「对答案」换成「比任务结束后的状态 diff」,能一次性解决好几类误判——本站BFCL v3 深读就在拆这个换轴动作。基准全景在大模型 Benchmark 地图,产品化那一侧在交付门与评测系统的分工。
注意这一段和第一段其实是同一件事的两面:能自动判对错的题,既是训练信号,也是验收口径。 整条链在这里合上了——这也是我认为「环境」是当下最实心那个词的第二个理由。
我认为被高估的四个词
有立场、可证伪,欢迎打脸:
- Agentic(当形容词用时)。删掉它,句子信息量不减 → 按前面的判据就是营销词。「agentic RAG」到底比 RAG 多了什么,说话的人多半答不上。
- 1M 上下文(当能力指标用时)。它是一个容量参数,不是一个能力参数。中段利用率不报,这个数字就只是账单。
- PD 分离(当默认架构用时)。见第五段:2026 年的论文正在把它拉回「取决于负载」。
- 多 Agent(当架构选择用时)。见第六段:单 Agent 产品套一层多 Agent 外衣,买到复杂度但没买到能力。
对称地,我认为被低估的三个:环境工程(没有通解,得自己啃)、混合注意力(结论不好卖但事实如此)、爆炸半径(把安全从分类问题换成了权限问题)。
一个最低成本的亲手验证实验
上面整条链里,只有一个数字是我亲手测的(第五段那组 38× / 2.5×)。这里给一个你十分钟能跑完、能自己验掉「prefill 是算力题、decode 是搬运题」的实验——它是第五段一整张表的物理地基:
拿任意一个 GGUF 量化模型,同一条 llama-bench 跑两遍,只改一个开关(-ngl 0 换成 -ngl 99,即权重放 CPU 还是放 GPU),对比 pp(prefill)和 tg(decode)两列的倍数差。如果你看到的也是 prefill 涨了一个数量级、decode 只涨了个位数倍,那么第五段里所有「该给哪一段配什么硬件」的讨论你就都能自己判断了,不需要引用任何论文。进一步的做法(同一模型三种量化、反推可达带宽)在那篇实测里。
通俗总结:整条链就是一条流水线
63 个词太多,记不住是正常的。这一节把整篇压成一个不用术语的画面。
把大模型这门生意想象成一条培养流水线,从「教出来」到「验收合格」,八道工位:
| 工位 | 大白话在干什么 | 当下最紧的是 |
|---|---|---|
| 1. 出题 | 给它出能自动判对错的练习题 | 这一道最紧:出题比教法难 |
| 2. 考试策略 | 交卷前让它多想一会儿、或多写几份挑一份 | 挑得准不准,取决于工位 1 |
| 3. 造脑子 | 脑容量还想涨,但不能每个字都动用全部脑细胞 | 掺着用,没有干净的胜者 |
| 4. 记性 | 一次能读多少 vs 隔天还记不记得,是两件事 | 常被当成一件事卖 |
| 5. 开门营业 | 同一张卡上能同时服务多少人、每笔多少钱 | 先分清你卡在算力还是搬运 |
| 6. 接线 | 它和工具、和别的同类之间怎么对话 | 接工具已定标准,同类互联多数人还用不上 |
| 7. 安保 | 假设它一定会被骗,那它最多能干多大的坏事 | 从「拦住骗子」改成「限制权限」 |
| 8. 验收 | 怎么承认它真的变强了,而不是把考卷背下来了 | 尺子在失效,只能不停换尺子 |
关键的一句话:热词会换,是因为流水线上「最紧的那道工位」在往前挪。 三年前最紧的是工位 3(脑子不够大),两年前是工位 2(不会多想一会儿),今天是工位 1(没人会出题)。所以判断一个新词值不值得学,不是看它听起来多先进,而是看它管的那道工位,现在是不是正卡着。
还有一条我觉得最反直觉、也最实用的:工位 1 和工位 8 其实是同一道工位。 能自动判对错的题,既是拿来练的题,也是验收用的考卷——你的验收能力有多强,它最多能练到多强。所以「多想一会儿」再怎么加钱也突破不了这个上限:想得再多,也得有人能认出哪个答案是对的。
一句能讲给同事听的话:
大模型的热词换得快,是因为卡点在往前挪:以前卡在模型不够大,现在卡在没人会出能自动判对错的题——而这道题既决定它能练到多强,也决定我们能不能看出它变强了。
顺手带走的三问(下次撞上新词,按这三问过一遍,比读十篇解读快):
- 它管哪道工位? 定不了位的词,先怀疑它是外套。
- 上一道工位通了吗? 通了它就是真瓶颈,值得投时间;没通,它现在热是提前的——比如验证器不行的时候谈 pass@k,等于在算一个用不上的上限。
- 删掉这个词,句子还剩什么? 剩得多就是好词,什么都不剩就是营销。
参考来源
arXiv 论文(编号与标题已逐个回查核实)
- TTRL: Test-Time Reinforcement Learning
- Generative AI Act II: Test Time Scaling Drives Cognition Engineering
- Rethinking Agentic Reinforcement Learning In Large Language Models
- DeepSeekMath(GRPO 的出处)
- VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool Use
- Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving
- Towards Efficient LLM Serving: A Survey on System-Aware KV Cache Optimization
- Understanding Bottlenecks for Efficiently Serving LLM Inference With KV Offloading
- Observation, Not Prediction: Conversation-Level Disaggregated Scheduling for Agentic Serving
- DuetServe: Harmonizing Prefill and Decode for LLM Serving
- The Workload-Router-Pool Architecture for LLM Inference Optimization
- A Survey of Agent Interoperability Protocols(MCP / ACP / A2A / ANP)
- Governance Gaps in Agent Interoperability Protocols
- The Promptware Kill Chain
- LivePI: More Realistic Benchmarking of Agents Against Indirect Prompt Injection
一手文档
- Model Context Protocol 官方文档(本文引用的规范版本标注与 Agent Skills 构建路径)
- A2A Protocol 官方文档(Agent Card 路径、任务时序、Agentic AI Foundation 归属)
本站相关旧文
术语层:Agent 工程术语地图。训练与环境:可验证奖励到环境工程、DeepSeek-R1、SFT 是解锁器。架构:Kimi K3 KDA、扩散语言模型不是物理定律。上下文与记忆:遗忘是一种能力、Agent 记忆前沿、推理栈当操作系统。系统:本地部署本机参数实测、SGLang 内幕、vLLM APC 源码、Medusa、RouteLLM、OpenRouter、temperature=0。协议与外壳:MCP 状态搬家、Skills 与 MCP 研究前线、Harness 三条战线、skills-lock.json。评测:BFCL v3、Benchmark 地图、交付门与评测系统、Fable 5.1 数据增长、评测系统成为攻击目标。