把一个 3D 形状压缩成一个不携带任何空间坐标的 latent 向量集合,再用 cross attention 代替传统的距离插值去查询任意位置的占据值,从而让 3D shape 的神经场表示天然适配 transformer 和 latent diffusion。
经典的 radial basis function (RBF) 表示把一个连续函数写成若干"锚点权重 × 距离核"的加权和,每个锚点都必须显式存一个坐标。论文的关键改动是把核函数里的"坐标距离"换成"cross attention 相似度":latent set 表示里的每个 latent fi 不再绑定任何 3D 坐标,查询点 x 通过可学习的线性投影 q() 和 k() 计算点积相似度,再做 softmax 归一化当作插值权重。
要把一个可能高达数十万点的点云压缩成 M 个 latent,论文设计了一个 set 到 set 的 cross attention 编码器,并比较了两种 Query 设计:可学习 Query 集(一组与输入无关的固定参数)vs. 先用 furthest point sampling 从点云本身降采样出 M 个点,再以这些点的位置编码作为 Query(Point Queries)。实验证明 Point Queries 在所有类别上都优于 Learnable Queries。最终配置取 M=512 个 latent、每个 512 维。
借鉴 latent diffusion 对图像 VAE 的做法,在 latent set 后接两个线性层分别预测均值和方差,做 reparameterization 采样,并加 KL 散度正则化(权重 0.001)。压缩后的 {zi} 才是第二阶段扩散模型训练的对象,推荐压缩通道数 C0=32。
编码得到的 latent 集合先经过若干层 self attention 相互交换信息,然后对任意查询坐标 x,用前述 cross attention 机制从精炼后的 latent 里插值出一个特征向量,最后接一个全连接层输出占据值(0 到 1),用 Marching Cubes 在 128³ 分辨率网格上重建出 mesh 表面。
第二阶段在 KL 瓶颈输出的压缩 latent {zi} 上训练扩散模型,去噪网络本身是一个 set-to-set 的 self attention transformer:每一层先做一次 self attention 让 latent 集合内部交换信息,再做一次 cross attention 把条件信息(类别 embedding、ResNet-18 图像特征、BERT 文本特征,或部分点云的 shape encoder 特征)作为 key/value 注入进来。采样时只需 18 步去噪。
把"给定坐标查 latent"的空间插值问题,重新表述成"给定 query 查 key-value"的 cross attention 问题,latent 因此摆脱了显式坐标的束缚,整套表示从编码、解码到生成都可以用同一套 transformer 结构端到端处理。