没有新方法、新模型、新数据集。就是一张归一化过的横向 leaderboard:6 个通用多模态系统跑 55 个视觉 benchmark,每个任务的分数除以"专用模型或人类"里更强的那个,得到一个百分比,再把 34 个百分比排成一条队。novelty 在这条队本身读出的分界线——凡是输出可以是文字或物体级结构的任务(识别、OCR、检测、分割、3D grounding、驾驶/具身理解),通用模型已经追平甚至超过专用模型;凡是输出必须数值精确、像素保真、跨帧一致,或需要细粒度领域视觉知识的任务(metric depth、多视图重建、图像复原、病理细胞分型),还差 1.5–3 倍。换句话说:难的不再是"看懂",难的是"量准"和"还原"。
论文大量使用抽象名词,先落地成这份论文里具体的东西:
| 论文用词 | 在这篇论文里具体是什么 |
|---|---|
capability(能力) | 若干 benchmark 的聚合分数。例:Segmentation = RefCOCO + ReasonSeg 上的 gIoU;Visual Counting = PixMo-Count + CountQA + VLMsAreBiased 的准确率 |
reference(参考) | 对比基线,取专家模型 (S) 与 人类 (H) 中更强的那个。S 有时是真专用模型(SAM 3 Agent、ViTPose++、VGGT-1B),有时只是"上一代通用 SOTA"(Gemini-2.5-Pro、GPT4-o1) |
maturity tier(成熟度档) | 纯百分比分桶:>110% exceeds / 100–110% at / 85–100% approaching / <85% substantial gap |
structured prediction | 输出不是文字,而是 bbox 坐标、多边形 mask、depth 锚点、3D cuboid 的 center+dims+rotation、逐帧 mask 序列 |
output processing | 把语言模型吐出的文本/代码翻译成 benchmark 能打分的格式的那一层胶水代码(本文最实在的工程贡献,见方法第 3 节) |
specialist-as-tool | 通用模型当调度者,调用专用模型拿视觉结果。例:调 SAM 数实例来计数,调 depth 模型比较远近,调 grounding 模型定位遥感小目标 |
reasoning effort | API 的五档推理预算:low / medium / high / xhigh / max |
n/s | not supported。Fable 5 与 Kimi K3 无图像输出通道,故生成/编辑行留空 |
这是评测论文,"方法"就是评测设计本身。四个决定结论可信度的设计选择:
不按"模态"也不按"论文习惯的子领域",而按能力切分,且刻意挑仍有 headroom 的难 benchmark(ZeroBench、VisualPuzzles、Dense200、Anywhere3Dv2 等),避免天花板效应。关键是同一领域内部被拆开:3D 拆成 depth / 3D detection / 3D grounding / reconstruction 四项,视频拆成 understanding / temporal localization / segmentation 三项——正是这种拆分让"领域内部分叉"暴露出来。
GPT-6 Astra、Fable 5、Kimi K3、Gemini 3.1 Pro、Qwen 3.8-Max、Muse Spark 1.3,收到相同的指令、相同视觉输入、相同样本,用 benchmark 原生指标打分,推理档位取各系统支持的最强档。图像生成/编辑任务采用推理模型 + 配对图像模型的分工:Astra 配 GPT Image 2.5 Sunburst,Qwen 3.8-Max 配 Qwen Image 3 Pro,Muse Spark 1.3 配 Muse Image,Gemini 3.1 Pro 配 Gemini 3.1 Flash Image。
这是整篇论文最容易被忽略、却最工程化的一环。通用模型不会直接输出一张 depth map,所以需要一层翻译:
直观理解:论文实际上在问"如果我们肯为通用模型写足够多的 adapter,它能顶替多少专用模型"。这层胶水的存在也意味着分数里混入了胶水质量,不是纯模型能力。
flowchart LR
A["Image / Video"] --> B["Frontier System"]
B -->|"text, coords, code"| C["Output Processing"]
C --> D["mask / depth map / point cloud / cuboid"]
D --> E["Benchmark Metric"]
E --> F["ratio vs reference"]
G["Specialist S"] --> F
H["Human H"] --> F
F --> I["Maturity Tier"]
每项能力取专家模型 (S) 与人类 (H) 中更强的一个当分母,lower-is-better 指标(AbsRel、重建误差)取倒数。四档阈值是硬编码的百分比区间。人类参考来自各 benchmark 自报的人类表现——这是后面批评的主要抓手。
把 34 项能力放到同一条"相对参考水平百分比"轴上,就会看到一条不沿领域走、而沿输出类型走的分界线:语义解释与物体级预测已在线上,metric 几何、保真重建、稠密时序一致性、稀有领域细粒度判别仍在线下。
横轴 = 最强通用模型分数 / 最强可用参考(100% = 参考水平)。颜色按四档分桶。
下表挑出最能说明"语义 vs 精度分叉"的成对能力。粗体行为差距最大的一侧。
| 领域 | 能力 | GPT-6 Astra | 参考 | 相对水平 |
|---|---|---|---|---|
| 3D | 3D Visual Grounding | 73.8 | 46.5 (S) / 95.0 (H) | 78% (对人类) |
| Depth Estimation (AbsRel ↓) | 0.63 | 0.44 (DA3) | 70% | |
| 视频 | Video Understanding | 74.3 | 71.5 (S) / 82.6 (H) | 92% |
| Video Segmentation (J&F) | 84.5 | 91.0 (BEE) | 93%(次优仅 57.9) | |
| 图像生成 | Instruction-Guided Editing | 4.80 / 5 | 4.64 (S) | 103% |
| Image Restoration (PSNR) | 17.7 dB | 30.7 dB (MIRAGE) | 58% | |
| 医学 | Medical Understanding | 86.0 | 81.5 (S) | 106% |
| Microscopy & Pathology (Macro-F1) | 23.8 | 57.1 (S) / 82.0 (H) | 29% |
注意 3D Visual Grounding:全部六个模型都超过了论文选的"专家"(Gemini-2.5-Pro,46.5),但离人类 95.0 还差 21 分。参考选谁,结论就能反过来。
GPT-6 Astra 在 2D 检测(89.1 vs Rex-Omni 78.4,+10.7)与分割(81.3 vs SAM 3 Agent 77.0,+4.3)上超过专用模型;grounding 93.1 逼近人类 96.2。而且不是孤例——Qwen 3.8-Max 的检测也超专家 +8.6。这是"通用接口取代专用检测器/分割器"最硬的证据。
六个模型全部在 3D visual grounding 上超过所选专家,Astra 的 3D 检测(17.3 AP3D)也逼近 WildDet3D 的 16.8。但 metric depth 与多视图重建仍显著落后——最强重建结果的误差约为 VGGT-1B 的 2.3 倍。
Astra 84.5 J&F,次优通用模型仅 32.0–57.9,领先 +26.6——全文最大单项差距。但仍比专用 BEE 低 7.9 分。剩下的难点集中在精确边界、小结构、邻近实例的区分,以及把这些区分跨帧保持一致。
全部通用模型在图像复原上挤在 17.2–17.7 dB,专用 MIRAGE 30.7 dB。原因不是"修得不好看",而是修出了不存在的内容:4 个保龄球瓶变 5 个,空球道上长出球瓶,横幅文字与球道号被改写。casual 照片能接受,医学影像不能。
Astra 在 3D 医学 grounding 上 73.9 mIoU 超过 M3D-LaMed(59.4),2D 医学 grounding 61.5 mAP 但仍低于 RadVLM 81.8。病理是最惨的一项:全部模型 14.1–23.8 Macro-F1,专家 57.1,人类 82.0。定性观察说得很清楚:细胞核能框出来,但分不清是哪一类——定位能力不等于领域专业知识。
EB-Navigation (AI2-THOR) 上 Astra 达到 78% 成功率,其他模型 48–70%。论文给的 episode 里,agent 只有第一人称 RGB,无地图无目标坐标,被障碍挡住后倒车绕行再接近目标——17 个动作、7 次模型调用、3 次被阻挡;其余五个模型全部未解出这一集。
提高 reasoning effort 能把 2D 空间推理、3D 检测、生成编辑推到专家水平,但收益与成本严重不对称:
| 手段 | 任务 | 分数比 | 成本比 | 是否补上专家差距 |
|---|---|---|---|---|
| Reasoning effort (low → max) | 3D Object Detection | 1.75× | 6.75× | ✔ 追平专家 |
| 2D Spatial Reasoning | 1.03× | 4.28× | ✔(本来已接近) | |
| Segmentation | 1.04× | 8.33× | ✘ high 档后饱和 | |
| Tool use (xhigh 档) | Counting | 1.04× | 1.20× | ✔ 先逐个指点再计数 |
| OCR | 1.01× | 1.04× | —(本已 98.1) |
规律:额外算力在"能力已萌芽但发挥不稳定"的地方最有用,在已经很强或根本缺失的地方都白花。工具调用的性价比(1.04–1.20×)远高于加推理(最高 13.22×)。差距大的地方则靠 specialist-as-tool:分割模型给计数提供实例,depth 模型给空间推理提供距离,grounding 模型解决遥感小目标。
| 能力 | Astra | Fable 5 | Kimi K3 | Gemini 3.1 Pro | Qwen 3.8 Max | Muse Spark 1.3 | 参考 S | 人类 H |
|---|---|---|---|---|---|---|---|---|
| Visual Recognition | 77.0 | 71.5 | 70.9 | 69.6 | 72.7 | 72.7 | 61.1 | 98.9 |
| Fine-Grained Discrimination | 86.1 | 70.0 | 64.0 | 69.5 | 75.6 | 77.0 | — | 96.5 |
| Visual Counting | 82.7 | 69.6 | 74.0 | 78.5 | 80.3 | 76.1 | — | 94.0 |
| OCR & Text Recognition | 98.1 | 97.5 | 96.3 | 93.8 | 94.8 | 96.3 | — | 98.0 |
| Doc & Chart Understanding | 92.8 | 91.7 | 90.3 | 89.8 | 91.2 | 89.5 | — | 89.3 |
| Visual Logical Reasoning | 81.1 | 61.3 | 61.2 | 60.5 | 67.5 | 57.6 | — | 87.0 |
| Visual Math Reasoning | 92.5 | 78.8 | 80.4 | 82.3 | 82.0 | 79.3 | — | 78.7 |
| Scientific Reasoning | 86.8 | 81.2 | 81.6 | 80.5 | 82.3 | 81.2 | — | 88.6 |
| 2D Spatial Reasoning | 96.0 | 79.3 | 87.0 | 84.2 | 89.1 | 82.6 | — | 95.8 |
| 3D & Multiview Reasoning | 89.6 | 75.2 | 76.8 | 66.8 | 77.0 | 77.2 | — | 94.1 |
| 2D Object Detection | 89.1 | 31.1 | 67.7 | 69.7 | 87.0 | 46.5 | 78.4 | — |
| 2D Visual Grounding | 93.1 | 87.0 | 77.4 | 79.6 | 87.7 | 82.5 | — | 96.2 |
| Segmentation | 81.3 | 70.9 | 41.3 | 56.6 | 68.0 | 47.3 | 77.0 | — |
| 2D Pose Estimation | 75.2 | 19.6 | 43.5 | 32.0 | 52.5 | 38.1 | 83.6 | — |
| Depth Estimation (↓) | 0.63 | 0.89 | 1.00 | 1.19 | 1.29 | 0.82 | 0.44 | — |
| 3D Object Detection | 17.3 | 13.8 | 8.0 | 6.6 | 7.1 | 7.9 | 16.8 | — |
| 3D Visual Grounding | 73.8 | 63.1 | 55.8 | 59.4 | 48.1 | 62.1 | 46.5 | 95.0 |
| 3D Reconstruction (↓) | 1.40 | 1.85 | 1.96 | 1.81 | 1.72 | 1.89 | 0.61 | — |
| Video Understanding | 74.3 | 59.0 | 64.1 | 53.0 | 70.2 | 75.6 | 71.5 | 82.6 |
| Temporal Localization | 38.6 | 23.7 | 24.6 | 22.6 | 28.6 | 25.3 | 35.9 | — |
| Video Segmentation | 84.5 | 57.9 | 34.5 | 34.9 | 32.0 | 33.8 | 91.0 | — |
| Text-to-Image Generation | 96.2 | n/s | n/s | 67.4 | 92.1 | 92.4 | 92.6 | — |
| Instruction-Guided Editing | 4.80 | n/s | n/s | 4.20 | 4.67 | 4.40 | 4.64 | — |
| Image Restoration | 17.7 | n/s | 17.3 | 17.5 | 17.4 | 17.2 | 30.7 | — |
| Image Quality Assessment | 86.2 | n/s | 83.1 | 79.5 | 81.1 | 78.4 | 84.9 | — |
| Driving-Scene Reasoning | 80.8 | 75.8 | 71.6 | 71.2 | 77.1 | 76.5 | 73.1 | 88.1 |
| Embodied Understanding | 82.3 | 70.0 | 65.2 | 68.0 | 77.8 | 76.5 | 78.5 | — |
| Robotic Navigation | 78.0 | 64.0 | 48.0 | 60.0 | 70.0 | 67.0 | — | — |
| Medical Understanding | 86.0 | 79.7 | 73.9 | 78.3 | 78.1 | 78.3 | 81.5 | — |
| 2D Medical Grounding | 61.5 | 35.9 | 20.8 | 35.0 | 58.2 | 37.8 | 81.8 | — |
| 3D Medical Grounding | 73.9 | 38.0 | 38.4 | 24.4 | 46.0 | 43.8 | 59.4 | — |
| Microscopy & Pathology | 23.8 | 22.1 | 16.7 | 14.1 | 21.4 | 23.1 | 57.1 | 82.0 |
| Remote-Sensing Reasoning | 46.3 | 42.7 | 39.7 | 50.0 | 48.2 | 45.8 | 43.9 | — |
| Remote-Sensing Grounding | 26.4 | 16.8 | 20.2 | 11.2 | 16.1 | 13.1 | 75.5 | — |
↓ = 越低越好。n/s = 该系统无图像输出通道。Visual Recognition 一行值得盯:对 S=61.1 是 126%,对 H=98.9 只有 78%。
| 能力 | 指标 | 专家模型 | 是否真专用模型 |
|---|---|---|---|
| Visual Recognition | Accuracy | SEAL; Gemini 3 Pro | 部分(Gemini 是通用模型) |
| 2D Object Detection | F1@IoU=0.5 | Rex-Omni | ✔ |
| Segmentation | gIoU | SAM 3 Agent | ✔ |
| 2D Pose Estimation | OKS AP | ViTPose++-L | ✔ |
| Depth Estimation | AbsRel ↓ | Depth Anything 3 | ✔ |
| 3D Object Detection | AP3D | WildDet3D | ✔ |
| 3D Visual Grounding | [email protected] | Gemini-2.5-Pro | ✘ 通用模型 |
| 3D Reconstruction | Error ↓ | VGGT-1B | ✔ |
| Video Understanding | Accuracy | GPT4-o1; Cambrian-S-7B | ✘ 部分通用模型 |
| Temporal Localization | R@1 IoU=0.7 | TRACE | ✔ |
| Video Segmentation | J&F | BEE (SAM2 适配) | ✔ |
| Text-to-Image Generation | Soft-TIFA GM | Structured Conditioning + Qwen-Image | ✔ |
| Instruction-guided Editing | Score (1–5) | Boogu-Image-0.1-Edit-Thinking | ✔ |
| Image Restoration | PSNR | MIRAGE | ✔ |
| Image Quality Assessment | Accuracy | CoInstruct; UniPercept | ✔ |
| Driving-scene Reasoning | Accuracy | Qwen-Drive-1.0-SFT; GPT4-o1 | ✘ 部分通用模型 |
| Embodied Understanding | Accuracy | Gemini Robotics-ER 2 | ✔(领域专用) |
| Medical Understanding | Accuracy | GPT-5.6 Sol | ✘ 通用模型 |
| 2D Medical Grounding | [email protected] | RadVLM | ✔ |
| 3D Medical Grounding | mIoU | M3D-LaMed-Llama-2-7B | ✔ |
| Microscopy & Pathology | Macro-F1 | HoVer-NeXt | ✔ |
| Remote-sensing Reasoning | Accuracy | GPT-5.4 | ✘ 通用模型 |
| Remote-sensing Grounding | mIoU | RSRefSeg 2 | ✔ |
高亮行的"专家"其实是上一代通用模型。这几行里"超过专家"只意味着"超过上一代通用模型"。
论文标题问的"什么变容易、什么还难",答案不按领域划,按输出属性划:
flowchart TD
Q["Output requirement"] --> E["Semantic or object-level"]
Q --> H["Metric or faithful or dense"]
E --> E1["OCR, Doc, Recognition"]
E --> E2["Detection, Segmentation"]
E --> E3["3D Grounding, Driving, Embodied"]
E --> E4["Generation, Editing, IQA"]
H --> H1["Metric Depth"]
H --> H2["Multiview Reconstruction"]
H --> H3["Video Segmentation"]
H --> H4["Image Restoration"]
H --> H5["Pathology, RS Grounding"]
通用模型没有替代专用视觉模型,而是重画了通用与专用之间的边界。
| 应内化进通用模型 | 应留给专用工具 |
|---|---|
| 语义解释 | metric 几何 |
| 语言条件下的推理 | 保真重建 |
| 任务规划与协调 | 稠密对应(dense correspondence) |
| — | 高保真复原 |
| — | 稀有专业领域的细粒度判别 |
随之而来的新研究问题(论文最后一段点出、但未解决):通用模型何时该自己做、何时该调专用模型、以及如何验证专用模型返回的结果——并且要在准确率、成本、延迟三者间取舍。这已经是 agent 调度问题,不是 CV 问题。
把 gap 的预测因子从"任务领域"换成"输出属性",并给出一个可检验的假设:凡输出可被语言或离散结构表达的视觉任务,通用模型会先追平;凡输出必须连续、精确、保真、跨帧一致的,会最后追平。这个假设能被将来的模型证伪(如果下一代模型 metric depth 突然追平而 OCR 没进步,假设就错了),因此比"某模型某榜第一"有信息量。它也直接对应一个架构主张:generalist 做调度与语义,specialist 做测量与还原。
这篇论文是 2023 年"VLM 能看图吗"(BLINK、Eyes Wide Shut)那条线的终点,也是"hybrid generalist-specialist 系统"那条线的起点。2023–2025 年的争论是通用模型能不能做视觉任务,2026 年的答案基本是"语义类可以、测量类不行",于是真问题转向调度:路由策略(何时调工具)、验证策略(怎么知道专用模型的输出对不对)、成本模型(13× 推理成本换 75% 分数值不值)。这三个问题都不在传统 CV 的方法论里,更接近 agent/system 研究。对做 3D 生成与几何的人,本文的实际含义是:几何精度仍是护城河,而语义接口正在商品化——把管线设计成"通用模型出意图、专用模块出几何"比等通用模型自己学会测量更划算。