Contents

SAGE: Point Cloud as a Foreign Language for Multi-modal Large Language Model


作者Sneha Paul, Zachary Patterson, Nizar Bouguila
机构Concordia University, Canada
arXivhttps://arxiv.org/abs/2603.09173
代码https://github.com/snehaputul/SAGE3D

现有 3D MLLM 依赖预训练 3D encoder 导致语义对齐困难、分辨率固定、推理慢,SAGE 用轻量 VQ tokenizer 将 point cloud 离散化为 token,直接扩展 LLM 词表,实现端到端、encoder-free 的 3D 理解。

SAGE architecture overview
SAGE 整体架构(左)与对话示例(右)——无需任何预训练 3D encoder,直接从 point cloud 生成自然语言响应。

研究动机

核心方法

1. 轻量 3D Tokenizer:几何采样与局部聚合

3D tokenizer 接受原始 point cloud,输出定长 token 序列。第一步是几何降采样与局部群组化:用 Farthest Point Sampling(FPS)从 N 个点中均匀采 N_s=512 个中心点,再以 KNN(K_g=81)为每个中心构建局部邻域子云,保留邻域几何。局部子云内对每个点特征做线性投影 + 相对位置编码 + global max-pooling,得到紧凑的几何特征矩阵。直观理解:FPS 保证空间均匀覆盖,KNN 邻域保留局部曲率、法线等几何信息,max-pooling 聚合成固定维度 token。

2. 投影到 LLM 空间与 Vector Quantization

聚合特征通过可学习矩阵线性投影到 LLM embedding 空间,随后进行 vector quantization(VQ):维护大小为 C=8192 的可学习 codebook,对每个特征取最近邻 code,输出量化表示。由于 argmin 不可微,用经典 VQ loss:codebook loss 拉动 code 靠近 projected feature,commitment loss(权重 β=0.25)约束 feature 不偏离 codebook,stop-gradient 阻断对应方向梯度。直观理解:VQ 强制几何特征落在有限离散词表内,与 LLM text tokenizer 的离散 token 结构同构——3D token 成了"第二语言"的词,可以直接拼接进文本序列。

SAGE architecture detail
架构细节——3D tokenizer 输出的量化 token 与 text token 在同一序列中被 LLM 联合处理,<p_start> 和 <p_end> 标记 3D token 段。

3. 混合模态序列构造与端到端训练

量化后的 3D token embedding 直接与 text token embedding 拼接,形成单一混合序列送入 LLM decoder。全局目标为 next-token prediction loss 加权 VQ loss(λ=0.5)。整个框架端到端联合优化,codebook 随训练自动学习对齐几何和语言语义的离散 primitive。

4. 三阶段训练流程

Stage 1(3D tokenizer warm-up):冻结 LLM 大部分层,仅训练 3D tokenizer 和 LLM 前 4 个 transformer 层,在 3D captioning 数据上用 next-token prediction 预热,使几何 token embedding 初步对齐语言表示空间。

Stage 2(instruction tuning):端到端微调整个模型,使用多模态 instruction-response pairs,提升跨模态推理和指令跟随能力。数据集使用 PointLLM 的 730K point-text pairs。

Stage 3(GRPO-based preference optimization):针对 3D 理解任务的开放式描述性答案,引入基于语义对齐的 reward 函数,用 GRPO(Group Relative Policy Optimization)做 RL 微调。每条指令采样 m=8 个候选响应,reward 由两部分组成:语义相似度用 Sentence-BERT 计算候选与参考答案的 cosine similarity;长度 reward 用高斯衰减惩罚偏离参考长度的响应;最终加权组合(α=0.95 偏重语义)。直观理解:Stage 3 解决了 GRPO 在描述性任务上无法验证正确性的问题——Sentence-BERT 提供连续语义 reward,既可梯度化,又对不同表述方式的等效答案鲁棒。

Three-stage training pipeline
三阶段训练流程——warm-up、instruction tuning、GRPO preference optimization 依次递进。

主要实验结果

Resolution robustness
SAGE 在 2K/4K/8K 点输入下 captioning 性能几乎平稳,而 PointLLM 在低分辨率下显著下降,体现 encoder-free 设计的分辨率鲁棒性。

局限与展望