Contents

Hard Vision, Easy Vision: What GPT-6 Astra Reveals Across Computer Vision


作者Hanoona Rasheed, Mohammed Irfan Kurpath, Bin Ren, Hisham Cholakkal, Fahad Shahbaz Khan, Salman Khan
机构Mohamed bin Zayed University of Artificial Intelligence (MBZUAI) · Apertix
链接arxiv.org/abs/2609.35718 · 项目页 · GitHub
日期2026-09-28(arXiv v1, cs.CV)

没有新方法、新模型、新数据集。就是一张归一化过的横向 leaderboard:6 个通用多模态系统跑 55 个视觉 benchmark,每个任务的分数除以"专用模型或人类"里更强的那个,得到一个百分比,再把 34 个百分比排成一条队。novelty 在这条队本身读出的分界线——凡是输出可以是文字或物体级结构的任务(识别、OCR、检测、分割、3D grounding、驾驶/具身理解),通用模型已经追平甚至超过专用模型;凡是输出必须数值精确、像素保真、跨帧一致,或需要细粒度领域视觉知识的任务(metric depth、多视图重建、图像复原、病理细胞分型),还差 1.5–3 倍。换句话说:难的不再是"看懂",难的是"量准"和"还原"。

Figure 1
Fig 1. 覆盖范围:9 大领域、34 项能力、55 个 benchmark。左右两侧分别是"通用接口已可达"与"专用模型仍必需"的地图。
34项能力
55个 benchmark
6个前沿系统
29–126%相对参考水平跨度

研究动机

术语速查

论文大量使用抽象名词,先落地成这份论文里具体的东西:

论文用词在这篇论文里具体是什么
capability(能力)若干 benchmark 的聚合分数。例:Segmentation = RefCOCO + ReasonSeg 上的 gIoU;Visual Counting = PixMo-Count + CountQA + VLMsAreBiased 的准确率
reference(参考)对比基线,取专家模型 (S) 与 人类 (H) 中更强的那个。S 有时是真专用模型(SAM 3 Agent、ViTPose++、VGGT-1B),有时只是"上一代通用 SOTA"(Gemini-2.5-Pro、GPT4-o1)
maturity tier(成熟度档)纯百分比分桶:>110% exceeds / 100–110% at / 85–100% approaching / <85% substantial gap
structured prediction输出不是文字,而是 bbox 坐标、多边形 mask、depth 锚点、3D cuboid 的 center+dims+rotation、逐帧 mask 序列
output processing把语言模型吐出的文本/代码翻译成 benchmark 能打分的格式的那一层胶水代码(本文最实在的工程贡献,见方法第 3 节)
specialist-as-tool通用模型当调度者,调用专用模型拿视觉结果。例:调 SAM 数实例来计数,调 depth 模型比较远近,调 grounding 模型定位遥感小目标
reasoning effortAPI 的五档推理预算:low / medium / high / xhigh / max
n/snot supported。Fable 5 与 Kimi K3 无图像输出通道,故生成/编辑行留空

核心方法

这是评测论文,"方法"就是评测设计本身。四个决定结论可信度的设计选择:

1. 能力分解:9 领域 → 34 能力 → 55 benchmark

不按"模态"也不按"论文习惯的子领域",而按能力切分,且刻意挑仍有 headroom 的难 benchmark(ZeroBench、VisualPuzzles、Dense200、Anywhere3Dv2 等),避免天花板效应。关键是同一领域内部被拆开:3D 拆成 depth / 3D detection / 3D grounding / reconstruction 四项,视频拆成 understanding / temporal localization / segmentation 三项——正是这种拆分让"领域内部分叉"暴露出来。

2. 六个系统,同一套输入

GPT-6 Astra、Fable 5、Kimi K3、Gemini 3.1 Pro、Qwen 3.8-Max、Muse Spark 1.3,收到相同的指令、相同视觉输入、相同样本,用 benchmark 原生指标打分,推理档位取各系统支持的最强档。图像生成/编辑任务采用推理模型 + 配对图像模型的分工:Astra 配 GPT Image 2.5 Sunburst,Qwen 3.8-Max 配 Qwen Image 3 Pro,Muse Spark 1.3 配 Muse Image,Gemini 3.1 Pro 配 Gemini 3.1 Flash Image。

3. Output processing:让语言输出能被视觉指标打分

这是整篇论文最容易被忽略、却最工程化的一环。通用模型不会直接输出一张 depth map,所以需要一层翻译:

  1. 分割:模型输出的多边形 → 栅格化成像素 mask(部分工具路径直接产出 mask)
  2. 深度:模型预测的表面与 depth anchor → 渲染成 dense depth map,或直接执行模型写的代码生成深度图
  3. 3D 重建:depth 预测 + 相机参数 → 统一坐标系下的点云 / 逐帧 point map
  4. 3D 检测与 grounding:预测的 center、dimensions、rotation → box 边界 / cuboid 八角点
  5. 病理:instance/class map → 带标签的细胞核多边形;核中心用于检测打分,组织 mask 用于分割打分

直观理解:论文实际上在问"如果我们肯为通用模型写足够多的 adapter,它能顶替多少专用模型"。这层胶水的存在也意味着分数里混入了胶水质量,不是纯模型能力。

flowchart LR
  A["Image / Video"] --> B["Frontier System"]
  B -->|"text, coords, code"| C["Output Processing"]
  C --> D["mask / depth map / point cloud / cuboid"]
  D --> E["Benchmark Metric"]
  E --> F["ratio vs reference"]
  G["Specialist S"] --> F
  H["Human H"] --> F
  F --> I["Maturity Tier"]
          
drag to pan · scroll to zoom
Fig 2. 评测管线。通用模型只输出文本/坐标/代码,由 output processing 层翻译成视觉格式,再用 benchmark 原生指标打分,最后除以专家或人类参考得到百分比并分档。

4. 双参考 + 四档分桶

每项能力取专家模型 (S) 与人类 (H) 中更强的一个当分母,lower-is-better 指标(AbsRel、重建误差)取倒数。四档阈值是硬编码的百分比区间。人类参考来自各 benchmark 自报的人类表现——这是后面批评的主要抓手。

5. 最关键的一句话

把 34 项能力放到同一条"相对参考水平百分比"轴上,就会看到一条不沿领域走、而沿输出类型走的分界线:语义解释与物体级预测已在线上,metric 几何、保真重建、稠密时序一致性、稀有领域细粒度判别仍在线下。

主要实验结果

能力成熟度全图(本文核心结论)

横轴 = 最强通用模型分数 / 最强可用参考(100% = 参考水平)。颜色按四档分桶。

Fig 3. 33 项有参考的能力,按成熟度排序。左端 4 项(病理 29%、遥感 grounding 35%、3D 重建 44%、图像复原 58%)是真正的 hard vision;右端 5 项(3D 医学 grounding 124%、视觉识别 126%、视觉数学 118%、遥感推理 114%、2D 检测 114%)已越过参考线。数据复算自论文 Table 1 / Figure 9。

关键行:同一领域内部的分叉

下表挑出最能说明"语义 vs 精度分叉"的成对能力。粗体行为差距最大的一侧。

领域能力GPT-6 Astra参考相对水平
3D3D Visual Grounding73.846.5 (S) / 95.0 (H)78% (对人类)
Depth Estimation (AbsRel ↓)0.630.44 (DA3)70%
视频Video Understanding74.371.5 (S) / 82.6 (H)92%
Video Segmentation (J&F)84.591.0 (BEE)93%(次优仅 57.9)
图像生成Instruction-Guided Editing4.80 / 54.64 (S)103%
Image Restoration (PSNR)17.7 dB30.7 dB (MIRAGE)58%
医学Medical Understanding86.081.5 (S)106%
Microscopy & Pathology (Macro-F1)23.857.1 (S) / 82.0 (H)29%

注意 3D Visual Grounding:全部六个模型都超过了论文选的"专家"(Gemini-2.5-Pro,46.5),但离人类 95.0 还差 21 分。参考选谁,结论就能反过来。

2D 定位:结构化预测已跨过专家线

GPT-6 Astra 在 2D 检测(89.1 vs Rex-Omni 78.4,+10.7)与分割(81.3 vs SAM 3 Agent 77.0,+4.3)上超过专用模型;grounding 93.1 逼近人类 96.2。而且不是孤例——Qwen 3.8-Max 的检测也超专家 +8.6。这是"通用接口取代专用检测器/分割器"最硬的证据。

Figure 2
Fig 4. 左:密集拥挤场景的目标检测。右:纹身轮廓的精细分割。这些输出传统上必须由专用模型产出。

3D:物体级已通,几何级未通

六个模型全部在 3D visual grounding 上超过所选专家,Astra 的 3D 检测(17.3 AP3D)也逼近 WildDet3D 的 16.8。但 metric depth 与多视图重建仍显著落后——最强重建结果的误差约为 VGGT-1B 的 2.3 倍。

Figure 3
Fig 5. 中:被指代黑板的 3D 定位准确(领先次优模型 +10.7)。右:3D bbox 连贯。左:depth 图捕捉到整体布局,但把表面与边界细节抹平了——这是"看懂"与"量准"之间的落差。

视频分割:单模型突起,但未成共识能力

Astra 84.5 J&F,次优通用模型仅 32.0–57.9,领先 +26.6——全文最大单项差距。但仍比专用 BEE 低 7.9 分。剩下的难点集中在精确边界、小结构、邻近实例的区分,以及把这些区分跨帧保持一致。

Figure 4
Fig 6. 主体形状与多实例区分都拿到了,边界精度与近邻实例分离仍差;关键在跨帧一致性。

复原:看起来好 ≠ 还原对

全部通用模型在图像复原上挤在 17.2–17.7 dB,专用 MIRAGE 30.7 dB。原因不是"修得不好看",而是修出了不存在的内容:4 个保龄球瓶变 5 个,空球道上长出球瓶,横幅文字与球道号被改写。casual 照片能接受,医学影像不能。

Figure 7
Fig 7. LOL-v1 低光增强。Astra+Sunburst 17.5 dB / SSIM 0.74,MIRAGE 28.1 dB / SSIM 0.91。生成式复原在 fidelity-sensitive 场景是致命的。

专家领域:会定位不等于会认

Astra 在 3D 医学 grounding 上 73.9 mIoU 超过 M3D-LaMed(59.4),2D 医学 grounding 61.5 mAP 但仍低于 RadVLM 81.8。病理是最惨的一项:全部模型 14.1–23.8 Macro-F1,专家 57.1,人类 82.0。定性观察说得很清楚:细胞核能框出来,但分不清是哪一类——定位能力不等于领域专业知识。

Figure 5
Fig 8. 左:腹部 CT 中胰腺的 3D 定位(轴位/矢状/冠状三视图)。中:胸片"左肺中野斑片状实变"的 2D 定位。右:细胞核边界勾勒准确,但细粒度类型判别仍远低于专家。

具身导航:从理解走到执行

EB-Navigation (AI2-THOR) 上 Astra 达到 78% 成功率,其他模型 48–70%。论文给的 episode 里,agent 只有第一人称 RGB,无地图无目标坐标,被障碍挡住后倒车绕行再接近目标——17 个动作、7 次模型调用、3 次被阻挡;其余五个模型全部未解出这一集。

Figure 6
Fig 9. 导航轨迹。左侧俯视图仅用于展示,agent 从未看到。距离从 2.62 m 收敛到 0.95 m(1 m 成功半径内)。

推理预算与工具:能补,但不划算

提高 reasoning effort 能把 2D 空间推理、3D 检测、生成编辑推到专家水平,但收益与成本严重不对称:

Fig 10. 实线 = 分数比(左轴),虚线 = 推理成本比(右轴,对数),均以 low effort 为 1.00×。3D 检测靠推理能拿 +75% 分数,代价是 6.75–13.22× 成本;分割只涨 4–5% 就在 high 档饱和,却一路烧到 8.33×。
手段任务分数比成本比是否补上专家差距
Reasoning effort
(low → max)
3D Object Detection1.75×6.75×✔ 追平专家
2D Spatial Reasoning1.03×4.28×✔(本来已接近)
Segmentation1.04×8.33×✘ high 档后饱和
Tool use
(xhigh 档)
Counting1.04×1.20×✔ 先逐个指点再计数
OCR1.01×1.04×—(本已 98.1)

规律:额外算力在"能力已萌芽但发挥不稳定"的地方最有用,在已经很强或根本缺失的地方都白花。工具调用的性价比(1.04–1.20×)远高于加推理(最高 13.22×)。差距大的地方则靠 specialist-as-tool:分割模型给计数提供实例,depth 模型给空间推理提供距离,grounding 模型解决遥感小目标。

完整 Table 1:34 项能力 × 6 个系统 × 双参考(点击展开)
能力AstraFable 5Kimi K3Gemini 3.1 ProQwen 3.8 MaxMuse Spark 1.3参考 S人类 H
Visual Recognition77.071.570.969.672.772.761.198.9
Fine-Grained Discrimination86.170.064.069.575.677.0—96.5
Visual Counting82.769.674.078.580.376.1—94.0
OCR & Text Recognition98.197.596.393.894.896.3—98.0
Doc & Chart Understanding92.891.790.389.891.289.5—89.3
Visual Logical Reasoning81.161.361.260.567.557.6—87.0
Visual Math Reasoning92.578.880.482.382.079.3—78.7
Scientific Reasoning86.881.281.680.582.381.2—88.6
2D Spatial Reasoning96.079.387.084.289.182.6—95.8
3D & Multiview Reasoning89.675.276.866.877.077.2—94.1
2D Object Detection89.131.167.769.787.046.578.4—
2D Visual Grounding93.187.077.479.687.782.5—96.2
Segmentation81.370.941.356.668.047.377.0—
2D Pose Estimation75.219.643.532.052.538.183.6—
Depth Estimation (↓)0.630.891.001.191.290.820.44—
3D Object Detection17.313.88.06.67.17.916.8—
3D Visual Grounding73.863.155.859.448.162.146.595.0
3D Reconstruction (↓)1.401.851.961.811.721.890.61—
Video Understanding74.359.064.153.070.275.671.582.6
Temporal Localization38.623.724.622.628.625.335.9—
Video Segmentation84.557.934.534.932.033.891.0—
Text-to-Image Generation96.2n/sn/s67.492.192.492.6—
Instruction-Guided Editing4.80n/sn/s4.204.674.404.64—
Image Restoration17.7n/s17.317.517.417.230.7—
Image Quality Assessment86.2n/s83.179.581.178.484.9—
Driving-Scene Reasoning80.875.871.671.277.176.573.188.1
Embodied Understanding82.370.065.268.077.876.578.5—
Robotic Navigation78.064.048.060.070.067.0——
Medical Understanding86.079.773.978.378.178.381.5—
2D Medical Grounding61.535.920.835.058.237.881.8—
3D Medical Grounding73.938.038.424.446.043.859.4—
Microscopy & Pathology23.822.116.714.121.423.157.182.0
Remote-Sensing Reasoning46.342.739.750.048.245.843.9—
Remote-Sensing Grounding26.416.820.211.216.113.175.5—

↓ = 越低越好。n/s = 该系统无图像输出通道。Visual Recognition 一行值得盯:对 S=61.1 是 126%,对 H=98.9 只有 78%。

各能力的专家参考模型(Table 2)
能力指标专家模型是否真专用模型
Visual RecognitionAccuracySEAL; Gemini 3 Pro部分(Gemini 是通用模型)
2D Object DetectionF1@IoU=0.5Rex-Omni✔
SegmentationgIoUSAM 3 Agent✔
2D Pose EstimationOKS APViTPose++-L✔
Depth EstimationAbsRel ↓Depth Anything 3✔
3D Object DetectionAP3DWildDet3D✔
3D Visual Grounding[email protected]Gemini-2.5-Pro✘ 通用模型
3D ReconstructionError ↓VGGT-1B✔
Video UnderstandingAccuracyGPT4-o1; Cambrian-S-7B✘ 部分通用模型
Temporal LocalizationR@1 IoU=0.7TRACE✔
Video SegmentationJ&FBEE (SAM2 适配)✔
Text-to-Image GenerationSoft-TIFA GMStructured Conditioning + Qwen-Image✔
Instruction-guided EditingScore (1–5)Boogu-Image-0.1-Edit-Thinking✔
Image RestorationPSNRMIRAGE✔
Image Quality AssessmentAccuracyCoInstruct; UniPercept✔
Driving-scene ReasoningAccuracyQwen-Drive-1.0-SFT; GPT4-o1✘ 部分通用模型
Embodied UnderstandingAccuracyGemini Robotics-ER 2✔(领域专用)
Medical UnderstandingAccuracyGPT-5.6 Sol✘ 通用模型
2D Medical Grounding[email protected]RadVLM✔
3D Medical GroundingmIoUM3D-LaMed-Llama-2-7B✔
Microscopy & PathologyMacro-F1HoVer-NeXt✔
Remote-sensing ReasoningAccuracyGPT-5.4✘ 通用模型
Remote-sensing GroundingmIoURSRefSeg 2✔

高亮行的"专家"其实是上一代通用模型。这几行里"超过专家"只意味着"超过上一代通用模型"。

Easy / Hard 分界线

论文标题问的"什么变容易、什么还难",答案不按领域划,按输出属性划:

flowchart TD
  Q["Output requirement"] --> E["Semantic or object-level"]
  Q --> H["Metric or faithful or dense"]
  E --> E1["OCR, Doc, Recognition"]
  E --> E2["Detection, Segmentation"]
  E --> E3["3D Grounding, Driving, Embodied"]
  E --> E4["Generation, Editing, IQA"]
  H --> H1["Metric Depth"]
  H --> H2["Multiview Reconstruction"]
  H --> H3["Video Segmentation"]
  H --> H4["Image Restoration"]
  H --> H5["Pathology, RS Grounding"]
          
drag to pan · scroll to zoom
Fig 11. 左支(Easy Vision)通用模型已达到或超过参考水平;右支(Hard Vision)仍需专用模型。分界的判据不是"3D 还是视频",而是输出是否必须 metric 精确、像素保真、跨帧一致,或依赖稀有领域的细粒度知识。

通用模型没有替代专用视觉模型,而是重画了通用与专用之间的边界。

论文给出的分工建议

应内化进通用模型应留给专用工具
语义解释metric 几何
语言条件下的推理保真重建
任务规划与协调稠密对应(dense correspondence)
—高保真复原
—稀有专业领域的细粒度判别

随之而来的新研究问题(论文最后一段点出、但未解决):通用模型何时该自己做、何时该调专用模型、以及如何验证专用模型返回的结果——并且要在准确率、成本、延迟三者间取舍。这已经是 agent 调度问题,不是 CV 问题。

局限与展望

论文自述的局限

怀疑者会怎么说(本文的诚实评估)

真正新的那一件事

把 gap 的预测因子从"任务领域"换成"输出属性",并给出一个可检验的假设:凡输出可被语言或离散结构表达的视觉任务,通用模型会先追平;凡输出必须连续、精确、保真、跨帧一致的,会最后追平。这个假设能被将来的模型证伪(如果下一代模型 metric depth 突然追平而 OCR 没进步,假设就错了),因此比"某模型某榜第一"有信息量。它也直接对应一个架构主张:generalist 做调度与语义,specialist 做测量与还原。

研究趋势定位

这篇论文是 2023 年"VLM 能看图吗"(BLINK、Eyes Wide Shut)那条线的终点,也是"hybrid generalist-specialist 系统"那条线的起点。2023–2025 年的争论是通用模型能不能做视觉任务,2026 年的答案基本是"语义类可以、测量类不行",于是真问题转向调度:路由策略(何时调工具)、验证策略(怎么知道专用模型的输出对不对)、成本模型(13× 推理成本换 75% 分数值不值)。这三个问题都不在传统 CV 的方法论里,更接近 agent/system 研究。对做 3D 生成与几何的人,本文的实际含义是:几何精度仍是护城河,而语义接口正在商品化——把管线设计成"通用模型出意图、专用模块出几何"比等通用模型自己学会测量更划算。