一页 API 文档的考古学:八个"进阶功能",三条论文谱系

某大模型平台的"进阶使用"页列了八个功能:续写模式、批量推理、视觉定位、上下文缓存、文件输入、云部署 MCP、3D 生成、GUI 任务处理。看起来是产品经理排的功能清单,其实是一张考古地图——每个卡片下面都埋着一条"论文→系统→产品"的谱系。本文把八个功能归并成三条:给稀缺资源定价(KV Cache 经济学)、把世界变成 token(表示的进出口)、闭合反馈环(从会说到会做),每条配已核实的 arXiv 论文链,结尾给一套看任何 API 新功能都能用的三问。

打开任何一家大模型平台的 API 文档,翻到”进阶使用”那页,你会看到一排功能卡片:续写模式、批量推理、视觉定位、上下文缓存、文件输入、云部署 MCP、3D 生成、GUI 任务处理。第一眼像产品经理排的功能清单——八个互不相干的开关。但换一副眼镜看,这页文档是一张考古地图:每个卡片都是一条研究谱系跑完”论文→开源系统→商业产品”流水线之后,露出地表的那一小截。露头彼此相距很远,地下的矿脉却只有三条。

一句话主线

八个”进阶功能”不是八个孤立特性,而是三条研究谱系的地表露头:①给稀缺资源定价(续写、缓存、批量),②把世界变成 token(文件、定位、3D),③闭合反馈环(MCP、GUI)。读懂谱系,你不仅能看懂这页文档,还能预测下一页文档长什么样。

顺带一个侦探小发现:这八个功能里同时出现”3D 生成(多边形面片 + PBR 材质)“和”GUI 任务处理”,而 Seed3D 和 UI-TARS 恰好都是字节跳动 Seed 团队的论文——所以这页文档大概率来自火山引擎。这不影响本文结论:换成任何一家平台的进阶页,矿脉还是这三条。

graph LR
    subgraph 谱系一:给稀缺资源定价
        A1[续写模式] --- A2[上下文缓存] --- A3[批量推理]
    end
    subgraph 谱系二:把世界变成 token
        B1[文件输入] --- B2[视觉定位] --- B3[3D 生成]
    end
    subgraph 谱系三:闭合反馈环
        C1[云部署 MCP] --- C2[GUI 任务处理]
    end
    A2 -.KV Cache.- A3
    B2 -.坐标即 token.- C2

注意那条虚线:视觉定位是谱系二和谱系三的接缝——一个 agent 想点击屏幕,先得会”指”。这是八个功能里最重要的一处地质构造,后面会讲到。

谱系一:同一个瓶颈的三次定价——续写、缓存、批量

先立根本约束。自回归模型生成分两个阶段:prefill(把整段输入并行算一遍,算力密集)和 decode(逐 token 往外吐,每吐一个都要把全部权重从显存搬进计算单元,带宽密集)。两个阶段成本结构完全不同,而 decode 阶段最大的动态显存占用是 KV Cache——每个请求的注意力键值缓存,随生成长度增长。显存和带宽是稀缺资源,KV Cache 是稀缺资源里最大的可变开销——这一个物理事实,平台变现了三次。

第一次变现:续写模式。 预填一段 assistant 消息,模型从你写的半句话继续往下接。机制上没有任何新东西——你只是把”模型输出的开头”挪进了 prefill 阶段:用便宜的并行计算,买到了对昂贵的逐 token 生成的控制权。强制输出以 {"result": 开头、续写被截断的长文、锁定回复语言,全是这一招。用我之前那篇概率内核与确定性外壳的话说:这是外壳往概率内核里钉的一枚确定性的钉子——钉在序列开头,是因为自回归的每个 token 都条件于前缀,开头是杠杆最长的位置。

第二次变现:上下文缓存。 既然很多请求共享同一段前缀(系统提示词、few-shot 例子、同一份文档),那这段前缀的 KV Cache 为什么每次都重算?两篇论文给出两种答案:Prompt Cache (arXiv:2311.04934) 用显式 schema 声明可复用的”提示词模块”,连非前缀段落都能复用;SGLang 的 RadixAttention (arXiv:2312.07104) 更彻底——用一棵基数树自动匹配所有请求的公共前缀,不需要用户做任何标注。SGLang 论文自述,上线一个月实测缓存命中率 52.4%(LLaVA-Next-34B)到 74.1%(Vicuna-33B),首 token 延迟平均降为原来的 1/1.7。API 文档上”命中缓存的 token 按低价计费”那行字,就是这条谱系的定价化。

第三次变现:批量推理。 decode 是带宽密集的,单个请求根本喂不饱 GPU——权重搬一次,只算一个 token,太亏。解法是把很多请求拼在一起,权重搬一次给所有人用。Orca (OSDI ‘22) 提出 continuous batching:不等整个批次都生成完,每个迭代步都可以插入新请求、送走完成的请求;vLLM 的 PagedAttention (arXiv:2309.06180) 解决了拼批的显存障碍——像操作系统管虚拟内存一样,把 KV Cache 切成非连续的块,碎片近乎归零,同等延迟下吞吐提高 2–4 倍(论文自述)。API 上的批量推理端点以明显低于实时接口的单价定价,本质是一笔交换:你把”即时响应”卖回给平台,平台拿它去填 GPU 的空隙

三个功能,一句话收束:续写是把控制权挪进 prefill,缓存是不重算 prefill,批量是摊薄 decode——同一个瓶颈,三次定价。

谱系二:表示的进出口——文件输入、视觉定位、3D 生成

第二条矿脉回答一个更古老的问题:表示决定成败。Transformer 只吃 token 序列;任何模态想进这扇门,先回答”你的 token 是什么”。三个功能分别是这个问题的输入端、指针端、输出端。

输入端:文件输入。 图片的 token 化方案由 ViT (arXiv:2010.11929) 定调:把图切成 16×16 的 patch,线性投影后当词用。但固定分辨率是削足适履,Qwen2-VL (arXiv:2409.12191) 的 Naive Dynamic Resolution 让任意分辨率的图产出相应数量的视觉 token,再用 M-RoPE 把位置编码拆成时间/高/宽三个分量——图片占用高宽两维,视频每帧递增时间维。看懂这个,你就看懂了 File API”上传并预处理视频、图片、PDF”里”预处理”二字的分量:它不是格式转换,是一座 token 化工厂——抽帧、切 patch、渲染页面,把一切压成模型唯一认识的东西。

指针端:视觉定位。 “图里有一只猫”是描述;“猫在 (312, 208) 到 (569, 447)“是定位。差别在于:坐标本身也得变成 token。2023 年 6 月,相隔三天挂出的两篇论文给了两种方案:Kosmos-2 (arXiv:2306.14824) 引入离散的 location token,把”文本片段+框”写成 Markdown 链接的样子;Shikra (arXiv:2306.15195) 更朴素——不加任何新词表、不外挂检测器,直接用自然语言输出数字坐标。方案不同,意义相同:这是模型从”会看”到”会指”的分水岭。记住这一步,谱系三要用。

输出端:3D 生成。 输出侧的表示问题更难:3D 资产的 token 是什么?Hunyuan3D 2.0 (arXiv:2501.12202) 的答案:先用 ShapeVAE 把多边形网格压成隐空间里的连续 token 序列,再训一个 flow-based DiT 在这个隐空间里做生成,形状和纹理解耦成两阶段(PBR 材质合成是 2.1 版 (arXiv:2506.15442) 的主打)。Seed3D 1.0 (arXiv:2510.19944) 把目标再推一步:单图生成”仿真就绪”的资产——几何、多视角纹理、PBR 材质、UV 补全四个组件,产物可以直接丢进物理引擎。注意它论文里的动机:不是给美术省钱,是给具身智能造可交互的训练环境。文档页上”多边形面片与 PBR 材质”那行小字,地下埋的是这条线。

三个功能,同一个问句问三遍:进来的东西怎么变成 token,指出去的坐标怎么变成 token,出去的资产怎么变成 token。

谱系三:从会说到会做——MCP、GUI 任务处理

第三条矿脉是反馈闭环:模型的输出不再给人读,而是给环境执行,环境的返回值再喂回模型。一旦闭环,模型就从文本生成器变成了 agent。

有 API 的世界:工具调用 → MCP。 谱系从三篇论文长出来:ReAct (arXiv:2210.03629) 确立了”推理轨迹与动作交错生成”的范式——想一步、做一步、看一步,至今仍是绝大多数 agent 框架的骨架;Toolformer (arXiv:2302.04761) 证明模型可以自监督地学会何时调用哪个 API、传什么参数;Gorilla (arXiv:2305.15334) 把 API 调用的准确性做成专项,配上检索器还能适应接口版本变化。能力成熟之后,瓶颈移到接口碎片化——每家一套 function calling 格式,每个工具接一遍。MCP(Anthropic 2024 年 11 月发布的开放协议,不是论文)把”模型↔工具”的接口标准化,相当于给工具生态定了 USB 接口;“云部署 MCP”则是平台把工具的运行端也托管了——你连服务器都不用起。

没有 API 的世界:屏幕就是 API。 大量软件没有接口,只有像素。CogAgent (arXiv:2312.08914) 用高低分辨率双编码器支持 1120×1120 输入,只看截图,在网页和安卓导航任务上打赢了靠 HTML 文本的方法;UI-TARS (arXiv:2501.12326) 做成端到端原生 agent——输入只有截图,输出直接是键盘鼠标动作。现实检验来自 OSWorld (arXiv:2404.07972):369 个真实电脑任务,人类完成率 72.36%,发布时最好的模型只有 12.24%,失败主要卡在 GUI 定位和操作知识上(以上均为论文自述数字)。

现在回收谱系二埋的伏笔:GUI agent 每一次点击,都是一次视觉定位——“点哪里”就是”猫在哪里”。文档页上”视觉定位”和”GUI 任务处理”是两张卡片,地下是同一条矿脉的上下游:定位是能力,GUI 任务是这个能力接上反馈环之后的产品形态。这也解释了为什么 OSWorld 里模型摔得最惨的地方恰恰是 grounding——闭环的强度,取决于最弱的那节链条。

把地图叠回文档页

八个功能、三条谱系、十四篇来源,叠成一张表:

功能卡片谱系核心论文/来源一句话原理
续写模式稀缺资源定价自回归分解 + prefill/decode 成本差用便宜的 prefill 买对昂贵 decode 的控制权
上下文缓存稀缺资源定价Prompt Cache 2311.04934 / SGLang 2312.07104公共前缀的 KV Cache 不重算
批量推理稀缺资源定价Orca OSDI’22 / vLLM 2309.06180拿”即时性”换 GPU 利用率
文件输入表示ViT 2010.11929 / Qwen2-VL 2409.12191一切模态先变 token
视觉定位表示(→闭环)Kosmos-2 2306.14824 / Shikra 2306.15195坐标也是 token,从会看到会指
3D 生成表示Hunyuan3D 2501.12202、2506.15442 / Seed3D 2510.19944网格压成隐 token,输出端的表示问题
云部署 MCP反馈闭环ReAct 2210.03629 / Toolformer 2302.04761 / Gorilla 2305.15334有 API 的世界,接口标准化
GUI 任务处理反馈闭环CogAgent 2312.08914 / UI-TARS 2501.12326 / OSWorld 2404.07972没 API 的世界,屏幕就是 API

比这张表更值得带走的,是三个可复用的问句。下次任何平台的文档页冒出新功能,先问:

  1. 它在给哪个稀缺资源定价?(显存、带宽、算力空隙——凡是打折的功能,背后都有一个被摊薄的成本)
  2. 它在把什么变成 token?(新模态进门,先看 token 化方案,那决定了能力上限)
  3. 它在闭合哪个反馈环?(输出给谁执行、返回值回不回得来——回得来才是 agent,回不来只是生成)

谱系还在往前跑。论文里已经出现、文档页上还没出现的东西,就是下一页文档的样子:Seed3D 的”仿真就绪”指向具身智能的训练环境,OSWorld 的 12.24% 指向 GUI agent 还有六倍的提升空间要变成产品卖点。API 文档是滞后指标,arXiv 才是领先指标。

诚实声明:本文是文献梳理。文中吞吐 2–4 倍、命中率 52.4%/74.1%、完成率 72.36% vs 12.24% 等数字均为论文自述,我尚未亲手复现,按我的”论断-数字账本”规则一律标注未验证。给自己留的 rollout 作业:用同一段长系统提示词发两次请求,实测上下文缓存命中前后的首 token 延迟差——这是这张地图上离我最近、最便宜的一次亲手挖掘。

参考文献

推理系统(谱系一)

多模态表示(谱系二)

Agent 与闭环(谱系三)