拿你手机相册里任意一张 4032×3024 的照片,喂给一个 CLIP ViT-L/14@336 视觉编码器。在模型的第一层卷积开始工作之前,这张图已经被缩成 336×336——99.07% 的像素被丢掉了,剩下 0.93%。如果照片里那块路牌上的字原本只有 20 像素高,它现在是 1.7 像素高。模型答错不是因为它笨,是因为答案已经不在输入里了。
这篇要立的主线只有一句:「让 AI 更好地识别图像」在 2026 年已经不再主要是「把编码器练得更聪明」的问题,而是修补信息在编码器前后两处漏水口的问题——而更反直觉的是,下游那处漏水口的修法,收益并不来自「重新看见像素」,而来自「说出坐标」。
站内前置:这条「瓶颈往下游挪」的读法,和我在《大模型热词地图 2026-09》里用的是同一把尺子——一个方向之所以现在热,通常是因为它上游那层刚被解决。视觉这条链上,上游(表征)被 CLIP/DINO 修了十年,下游(采样与定位)才刚开始被当成主角。
名词速查
| 术语 | 一句话解释 |
|---|---|
| ViT / patch | 把图切成固定大小的小方块(如 14×14 像素),每块当一个 token 送进 Transformer |
| CLIP | 用「图-文配对」的对比学习训出来的视觉编码器,是绝大多数多模态大模型的眼睛 |
| 自监督(SSL) | 不用文字标注、只用图像自己训练表征的路线,DINO 系列是代表 |
| 原生分辨率 | 不把图强行缩到固定尺寸,按原始像素数和长宽比生成对应数量的 token |
| slice 编码 | 把大图切成若干小片各自过编码器,与「整图一次性过」(global 编码)相对 |
| 视觉搜索 | 模型先判断「该看哪一小块」,再把那一块放大重新读一遍 |
| logit lens | 把中间层的隐藏状态直接乘上输出词表矩阵,读出这一层「已经想到了什么词」 |
| TTFT | time-to-first-token,从收到请求到吐出第一个 token 的延迟 |
| Nyquist 极限 | 采样定理的结论:采样间隔为 k 时,周期小于 2k 的结构无法被还原 |
一、把「识别」拆成三道串联的闸门
一次图像识别要答对,得连过三关:
先说清这个式子不是什么:它不是能代数字算出准确率的公式,三个因子也不独立(定位失败常常正是因为采样已经把线索抹掉了)。它是一个记账用的分解——它唯一的用处是让你在模型答错时,能问出”漏在哪一道闸门”,而不是笼统地”再加点参数”。下面每一节对应一道闸门,最后给一张按症状查因子的表。
三道闸门的研究投入极不均衡:
| 闸门 | 主要在哪些年被攻 | 当下状态(我的判断) |
|---|---|---|
| 采样 | 2023 起(NaViT → 动态分辨率 → 2026 的 slice/global 之争) | 路线已通,还在争”怎么做最省” |
| 表征 | 2020–2025 主战场(ViT → CLIP → DINOv2/v3) | 远未饱和,但失败模式很窄 |
| 定位 | 2023 末起,2026 集中爆发 | 收益最大、也最没被理解清楚 |
二、采样:99% 的损失发生在模型看到图之前
固定分辨率是从 CNN 时代继承的一个默认值
ViT 的标题就写着它的输入假设:An Image is Worth 16x16 Words(arXiv:2010.11929,2020-10-22)。主力配置是把任意图缩到 224×224、切成 16×16 的 patch,得到 个 token。CLIP 常用的 ViT-L/14@336 是 个 token。
NaViT 那篇(arXiv:2307.06304,2023-07-12)在摘要第一句就把这件事点名了,原文措辞值得抄下来:“把图像缩到固定分辨率再送进视觉模型这个做法既普遍、又可证明是次优的,但至今没有被成功挑战。“(ubiquitous and demonstrably suboptimal)
我亲手量了一下这个”次优”到底有多贵
抽象的”次优”不够有说服力,所以我写了个 20 行、零依赖的脚本量它。做法:造一张 4032 像素宽的黑白条纹图,条纹周期从 4 到 128 像素不等,然后 box 平均下采样到 336 宽(缩放因子 ),看每种周期还剩多少对比度(原图对比度恒为 1.0)。
W, TARGET = 4032, 336
k = W // TARGET # 12:每 12 个原始像素被平均成 1 个
for period in (4, 8, 16, 24, 32, 48, 64, 128):
row = [1.0 if (x // (period // 2)) % 2 == 0 else 0.0 for x in range(W)]
down = [sum(row[i*k:(i+1)*k]) / k for i in range(TARGET)]
print(period, period / k, max(down) - min(down)) # 周期、缩放后周期、保留对比度
跑出来的结果(这一档是亲手测出的,你复制上面几行就能复现):
| 条纹周期(原图 px) | 缩放后周期(px) | 保留对比度 |
|---|---|---|
| 4 | 0.33 | 0.0% |
| 8 | 0.67 | 33.3% |
| 16 | 1.33 | 33.3% |
| 24 | 2.00 | 100.0% |
| 32 | 2.67 | 100.0% |
| 48 | 4.00 | 100.0% |
| 128 | 10.67 | 100.0% |
分界线落在 像素,正是 Nyquist 极限的位置:原图里周期小于 24 像素的任何结构,缩到 336² 之后基本不存在了。 对一张 4032 宽的照片,这意味着高度不足 24 像素的文字、远处的车牌、界面里的小图标,全部在第一道闸门就阵亡——后面无论接多大的语言模型、思考多少步,都是在猜。
两处诚实标注:表里 8px 和 16px 都是 33.3%,这个非单调是 box 滤波加整数对齐造成的 aliasing 假象,不是什么规律;真实推理管线用的双线性/双三次插值带抗锯齿,这几档会被抹得更平滑,但 24 像素这条分界线不会动,它由采样间隔决定,与滤波器无关。想深挖采样定理的位置,见《AI 数学全景拆解》里信号与概率那一支。
顺带还有第二层挤压,容易被忽略:patch 14 在 336 的图上覆盖 14 个缩放后像素,折算回原图是 168 个原始像素。就算那条 24 像素的条纹活了下来,它在一个 patch 里也只占 2/14 的宽度——一个 token 要同时承载 168 像素的内容,细节被平均掉是结构性的,不是训练不足。
于是路线转向”原生分辨率”,然后 2026 年吵了起来
修法很直接:不缩图,按原始像素生成对应数量的 token。
- NaViT(2023-07)用 sequence packing 把不同分辨率、不同长宽比的图打包进一个 batch 训练,摘要点明了一个副产品:推理时可以靠调分辨率平滑地在成本-精度曲线上移动。
- Qwen2-VL(arXiv:2409.12191,2024-09-18)把它产品化为 Naive Dynamic Resolution,配 M-RoPE 统一处理图像与视频的位置信息。这是”任意分辨率”进入主流开源模型的节点。
代价是二次的。按 patch 14 手算:1568×1568 的图是 个 token,而 336×336 是 576 个——token 数 21.8 倍,注意力的成对计算量 474 倍。这个数字解释了 2026 年这场争论的全部动机。
LLaVA-UHD v3(arXiv:2511.21150,2025-11-26)摘要里的观察是:越来越多模型偏好 global 原生分辨率编码而非 slice 切片,系统对比后发现 global “提升了整体能力,代价是更大的计算开销”;他们的 PVC(渐进式视觉压缩)把 ViT 改造成 ViT-UHD,在同架构下相对 MoonViT 把 TTFT 降到 1/2.4,整体相对 Qwen2-VL 再降到 1/1.9。
半年后,同一系列的 LLaVA-UHD v4(arXiv:2605.08985,2026-05-09)标题直接问”到底什么才是高效的视觉编码”,给了两条结论,第一条和 v3 的表述反向:受控实验显示 slice 切片编码在各项基准上优于 global 编码,“保留局部细节可能比施加全局注意力对细粒度感知更有益”。第二条是 intra-ViT early compression——在 ViT 的浅层就压掉 token,而不是等整个 ViT 算完再压(后者要先付完整的二次注意力成本)。合起来视觉编码 FLOPs 降 55.8%,精度持平或更好。
我的判断(观点,非事实):这半年的反向不是谁错了,而是”slice 还是 global”这个问法本身依赖于压缩发生在哪一层。v3 在 post-ViT 压缩的框架里比较,global 的全局注意力还有信息优势;v4 把压缩挪到 ViT 浅层之后,局部细节的保全变成了主导项。必须标注的局限:我读的是两篇摘要,没有逐篇通读全文,两者的基线与评测集合可能不能直接对齐——这个反转值得你自己去核,不要拿我这段当结论用。
三、表征:CLIP 的盲点不是”看不清”,是”分不开”
第二道闸门是十年主战场,但它 2024 年被一篇诊断性论文打开了一个新口子。
Eyes Wide Shut?(arXiv:2401.06209,2024-01-11)的做法很巧:既然多模态大模型的眼睛几乎都是 CLIP,那就去找 CLIP-blind pairs——两张肉眼一看就不同、但 CLIP 认为高度相似的图。用这些对子建成 MMVP 基准,覆盖 9 类基础视觉模式,结果连当时的 GPT-4V 都在”极其直白的问题”上答错,还会给出编造的解释。他们进一步验证:难住 CLIP 的视觉模式,和难住多模态大模型的视觉模式显著相关——眼睛的病,脑子治不好。初步解法是 MoF(Mixture of Features),把纯视觉自监督特征混进去。
这就是为什么自监督那条线一直没死。DINOv3(arXiv:2508.10104,2025-08-13)的核心贡献叫 Gram anchoring,对付的是一个具体病灶:长训练日程下 dense feature map(每个 patch 各自的特征,分割/检测这类任务要用)会逐渐退化——摘要的措辞是”已知但未解决”的问题。
这里要给出一个区分,它是本节的价值所在:第二道闸门的失败模式很窄。 它的典型症状是”两张明显不同的图被判为相同”(判别性不足),而不是”小字看不见”(那是第一道闸门)或”没往那儿看”(第三道)。把三者混作一谈,就会做出”细节题答错 → 换个更大的视觉编码器”这种昂贵且无效的决策。
四、定位:2026 年最热的一道闸门,和拆它的三记反手
正手:从 V* 到单次前向的视觉搜索
V*/SEAL(arXiv:2312.14135,2023-12-21)最早把这件事讲成机制问题:模型缺少”选择性地看”的能力,处理高分辨率、视觉拥挤的图时就抓不住关键细节。方案是让语言模型用它的世界知识来引导视觉查询(“要找钥匙?先看桌面和口袋”),并配了 V*Bench 专测这件事。
DeepEyes(arXiv:2505.14362,2025-05-20)把它变成可训练的:端到端强化学习,不需要预先收集推理数据做冷启动 SFT,主动感知的能力”原生涌现”,用的是模型自己的 grounding 能力而不是外挂检测器。摘要里那句观察挺有意思:他们看到主动感知从”初期的探索”演化为”高效准确的利用”。
VisLens(arXiv:2608.30705,2026-08-31)解决的是成本。此前两条路各有毛病:免训练的注意力/置信度方法准但慢(每个样本要查询模型多次),RL 训出来的工具调用快但不可解释。VisLens 用 logit lens 加一个轻量 tuned-lens,把浅层隐藏状态映射到最终层空间,于是视觉 token 在浅层就能被读成词,直接和问题里的目标词匹配、裁出区域、连原图一起回喂——整个过程在一次前向里完成,比 Thyme 快 8.5–9.9 倍,比免训练的多次查询方法快至多 22.2 倍。(“中间层的隐藏状态本身就是可读、可搬运的载体”这个前提,和我在《两个模型之间只差一个旋转》里拆的是同一个假设,只是那篇用它做跨模型直连,这里用它做区域定位。)
最硬的一条证据:这不是算力不够
FAVE(arXiv:2609.04392,2026-09-03)做了一件方法论上很干净的事:把”该看哪里”和”看到之后怎么编码”显式拆开,自己只做后者,用 oracle 真值裁剪把前者的干扰隔离掉。在 ImageNet 小目标(原生最大边 96 像素)上,这个变分辨率 ViT 比同一裁剪窗口下的固定分辨率 ViT Top-1 高 9.4 个点,FLOPs 低 12.7 倍。
然后是摘要里我认为全篇最有信息量的一句:“提高全局分辨率或加大 backbone 容量,都无法恢复到同一个工作点。”
这句话把”再加点算力”这条退路堵死了。它说明小目标识别的差距不是分辨率或参数量的连续函数——把高清晰度的编码容量选择性地分配到该去的地方,和均匀地铺更多算力,是两件不同的事。
三记反手:「用图思考」的收益,可能不来自图
2025 年”用图思考”(thinking with images)成了显学,综述都出了(arXiv:2506.23918,2025-06-30)。但 2026 年有三篇论文从不同方向拆它,这是本文最值得你带走的一段。
反手一,也是最狠的一记:TextCall(arXiv:2608.09682,2026-08-10),标题就是结论——Thinking With Tools, Not With Pixels。他们的出发点是既有工作用盲测、增益分解和注意力分析发现”回传的图像贡献很小”,于是提出假设:真正承重的信号是在任何像素回传之前模型就已经吐出的那段结构化文本——工具名、坐标、目标描述、意图。这段文本编码了”去哪儿看、找什么”。
验证方式干脆:保留工具调用的文本脚手架,但把回传图像换成占位符 [Image output skipped]。结果三条:
- 回传像素非必要:在 LoRA、全量微调、RL 三种设置下,TextCall 追平或超过完整的”用图思考”。RL 下还避免了一个失效模式——在匹配设置下,看到回传图像会让模型干脆不调工具、直接作答。
- 脚手架充分:在匹配的训练查询上,只给脚手架文本的准确率与给回传图像等价。
- 成分特异:把脚手架拆成推理文本和空间坐标,两者都有贡献,主导项随任务变化。
代价端:延迟降 29–46%,工具执行的 API 调用彻底消失。作者自己划了边界,我原样转述:结论只对当前的 thinking-with-images 基准分布成立,“构造出像素真正承重的任务仍是一个开放方向”。
反手二:Imagine-OPD(arXiv:2606.08719,2026-06-07),标题叫 Thinking Without Images。它承认放大裁剪确实能拿到全局图里拿不到的局部证据,但代价是冗余的工具调用和更长的轨迹;而且只靠结果奖励学出来的中间裁剪可能是噪声,未必真的对上了任务相关的证据。它的做法是把这套行为内化成”想象”:模型自己决定该看哪里、并想象凑近看会看到什么,训练时由一个拿到特权 zoom 视图的教师做 on-policy 自蒸馏。
反手三:医学域的反转(arXiv:2603.06665,2026-03-02)。在医学视觉问答上,思维链常常不如直接作答。作者的归因是”医学感知瓶颈”:细微的领域线索会削弱视觉 grounding,此时思维链会放大早期的感知不确定性而不是纠正它。两种免训练的推理期 grounding 干预(用 ROI 线索做感知锚定、用高质量文本描述做描述锚定)能提升准确率,在若干设置下把这个反转再反转回来。
我的判断
把这四篇(FAVE 拆开 where/what,TextCall 证明 where 的载体是文本,Imagine-OPD 把 where 内化,医学那篇证明缺了 where 时链式思考反而有害)摆在一起,我认为一个说法站得住:
在当前的基准分布下,「用图思考」这个名字起错了;它实际发生的是「用坐标思考」。 它带来的增益主要不是”重新看见了更多像素”,而是”把注意力预算定向到了正确的区域”,而定向这件事的信息载体是那几个数字和那句目标描述。
这是个可证伪的说法,反驳路径也很清楚,正是 TextCall 作者点出的开放方向:构造一类必须真正读回像素才能答对的任务(比如答案依赖裁剪区域内的精细纹理或不可言说的细节,无法被”坐标 + 目标词”概括),在那类任务上 TextCall 应该显著掉点。如果掉了,我这段话就该改。
顺便一处跨领域的对照,我把它记为观察而非规律:我上一篇写多轮 Agent 的信用分配(《覆盖是一阶、定向是二阶》)得出的排序恰好相反——那里”定向”是二阶的、“覆盖”才是一阶的。两个结论并不矛盾,因为稀缺的东西不同:RL 那边验证器只暴露极少的步骤,稀缺的是信号覆盖;视觉这边像素冗余度极高(第二节量过,99% 可以扔掉还剩下能用的),稀缺的是注意力预算的投向。同一个词在两个领域里排序相反,判据是”当前谁更稀缺”——这也是我不愿意把它升格成什么定律的原因。
五、带得走的东西:按症状查该修哪道闸门
这张表是全文的实际用途。左列是你观察到的现象,右列给出下一步最便宜的动作。每行都配了一个可执行的判据,你能自己复核,不必信我的分类。
| 症状(可复核的判据) | 漏在哪道闸门 | 最便宜的动作 | 不该做什么 |
|---|---|---|---|
| 把原图手动裁剪放大后重问,答对了 | 采样 | 上原生分辨率 / slice 编码,或按目标尺寸提高输入上限 | 换更大的语言模型 |
| 全局性问题答对,细节问题答错;给出正确 crop 就答对 | 定位 | 加视觉搜索;或在 prompt 里直接给坐标与目标描述 | 无脑加分辨率(成本二次涨,474 倍那笔账) |
| 给了正确 crop 仍答错,且两张明显不同的图被判为相同 | 表征 | 混入自监督特征(MoF 思路)、或换 DINO 系编码器 | 继续加思考步数 |
| 开了思维链后准确率反而下降 | 定位(且感知已不确定) | 先做推理期 grounding(ROI 锚定 / 文本描述锚定),再谈长链 | 加长思维链 |
| 精度够但 TTFT 爆了 | 采样的实现层 | 把 token 压缩挪到 ViT 浅层,别等 post-ViT 再压 | 直接降输入分辨率(等于回到第一道闸门漏水) |
一条独立的工程建议:做任何视觉系统的第一件事,是先跑一遍”crop 消融”——同一个问题分三路喂:(a) 全图、(b) 人工标注的 oracle crop、(c) 全图 + 正确坐标的文本提示。三个准确率一比,你的失败落在哪道闸门就一目了然。FAVE 用 oracle crop 隔离编码问题、TextCall 用 (c) 对照 (b),本质都是这个消融的严格版本。这个实验不需要训练,一个下午能跑完。
六、诚实的提醒
- 哪些是亲手测的:只有第二节那张 Nyquist 对比度表,以及文中的 token 数、注意力成对计算量(474 倍、21.8 倍)、像素丢弃率(99.07%)这几笔算术——都用一次性脚本验算过,脚本已贴在正文里。
- 哪些没有亲手复现:全部论文数字(55.8% FLOPs、2.4×/1.9× TTFT、+9.4 点 / 12.7× FLOPs、8.5–9.9×/22.2× 加速、29–46% 延迟下降)。我核实的是 arXiv ID、版本号、投递日期与摘要原文措辞;论文全文我没有逐篇通读,实验设置的可比性、基线选择这些只有读全文才能判断的问题,我没有资格下结论。
- 最需要你自己去核的一处:LLaVA-UHD v3 与 v4 对 slice/global 的表述反向。这是我读两篇摘要得到的观察,我给的解释(“取决于压缩发生在哪一层”)是猜想,没有证据支持,别引用。
- 成本最低的验证实验(你和我都能跑):把第二节那个 20 行脚本里的
W和TARGET换成你实际业务图的宽度和模型输入宽度,算出你自己的 分界线,然后去量一下业务图里关键目标(文字高度、缺陷尺寸、图标边长)的实际像素数。如果它小于 ,那么在换模型、加数据、调 prompt 之前,你唯一该做的事是提高输入分辨率或改成 slice 编码——其余一切都是在猜。
参考来源
表征(闸门三)
- ViT — An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale,arXiv:2010.11929(2020-10-22)
- CLIP — Learning Transferable Visual Models From Natural Language Supervision,arXiv:2103.00020(2021-02-26)
- DINOv2 — Learning Robust Visual Features without Supervision,arXiv:2304.07193(2023-04-14)
- DINOv3,arXiv:2508.10104(2025-08-13)
- MMVP — Eyes Wide Shut? Exploring the Visual Shortcomings of Multimodal LLMs,arXiv:2401.06209(2024-01-11)
采样(闸门一)
- NaViT — Patch n’ Pack: NaViT, a Vision Transformer for any Aspect Ratio and Resolution,arXiv:2307.06304(2023-07-12)
- Qwen2-VL — Enhancing Vision-Language Model’s Perception of the World at Any Resolution,arXiv:2409.12191(2024-09-18)
- LLaVA-UHD v3 — Progressive Visual Compression for Efficient Native-Resolution Encoding in MLLMs,arXiv:2511.21150(2025-11-26)
- LLaVA-UHD v4 — What Makes Efficient Visual Encoding in MLLMs?,arXiv:2605.08985(2026-05-09)
定位(闸门二)
- V*/SEAL — Guided Visual Search as a Core Mechanism in Multimodal LLMs,arXiv:2312.14135(2023-12-21)
- DeepEyes — Incentivizing “Thinking with Images” via Reinforcement Learning,arXiv:2505.14362(2025-05-20)
- 综述 — Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future Frontiers,arXiv:2506.23918(2025-06-30)
- VisLens — Single-Pass Interpretable Visual Search for Multimodal LLMs,arXiv:2608.30705(2026-08-31)
- FAVE — Foveated Adaptive Visual Encoding for Efficient Fine-Grained Visual Understanding,arXiv:2609.04392(2026-09-03)
2026 年的反手
- TextCall — Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning,arXiv:2608.09682(2026-08-10)
- Imagine-OPD — Thinking Without Images: Internalizing Visual Manipulation with On-Policy Self-Distillation,arXiv:2606.08719(2026-06-07)
- Better Eyes, Better Thoughts: Why Vision Chain-of-Thought Fails in Medicine,arXiv:2603.06665(2026-03-02)