Contents

InfiniteDiffusion: Bridging Learned Fidelity and Procedural Utility for Open-World Terrain Generation


作者Alexander Goslin
机构Independent Researcher, Sunnyvale, USA
链接https://arxiv.org/abs/2512.08309

通过将 diffusion model 的 sampling 重新表述为惰性求值(lazy evaluation),在无界无限平面上实现种子一致、常数时间随机访问的地形生成,并以 9× 实时速率在消费级 GPU 上运行。

Figure 1
Figure 1:Terrain Diffusion 生成的世界一角。最左跨度约 500 万平方公里,红框逐级放大,展示跨越四个数量级的连贯地形结构。

研究动机

核心方法

1. InfiniteDiffusion — 无界惰性 diffusion

MultiDiffusion 对有界图像的去噪预测为所有重叠窗口的加权平均:

\[ \Psi(J_t \mid z)[R] = \frac{\sum_{i \in \kappa(R)} U_i\bigl(W_i \otimes \Phi(J_t[R_i] \mid y_i)\bigr)}{\sum_{j \in \kappa(R)} U_j(W_j)}[R] \]

其中 \(\kappa(R)\) 为与查询区域 R 重叠的窗口集,\(U_i\) 将窗口 \(i\) 的输出放置到全局坐标,\(\otimes\) 为逐元素乘。InfiniteDiffusion 将此式改写为惰性求值:维护两个稀疏无界累加器 \(A_t\)(分子)和 \(B_t\)(分母),以及已处理窗口集 \(P_t\)。查询区域 R 时只触发与 R 重叠且尚未计算的窗口,其余保持缓存。LRU 淘汰时将对应窗口从 \(P_t\) 中移除,视为未处理,下次重查即可。

Figure 2
Figure 2:InfiniteDiffusion 滑窗惰性求值示意。\(J_2[R_1]\)(底)先从纯噪声生成,为上层 \(J_1[R_0]\)(中)提供上下文,最终输出 \(J_0[R]\)(顶)。

三个关键性质(附录 B 形式证明):

为避免 diffusion 的 50+ 步在无界场景下导致指数爆炸,将内部的 \(\Phi\) 定义为少步 consistency model(T=1 或 T=2),彻底解耦混合步数 T 与 diffusion schedule。

2. Terrain Diffusion — 三级层次地形生成

Figure 3
Figure 3:Terrain Diffusion 完整 pipeline。(a) 用户草图/程序噪声 → (b) 粗粒度星球地图 → (c1,c2) 潜在 diffusion 同时生成低频 + 残差潜变量 → (d,e) Laplacian 去噪修正低频 → (f) 残差解码 → (g) 合并输出最终高程图。

三级 cascade 由粗到细:

第一级:粗粒度星球模型(23 km/像素)。用 EDM2(去除上下采样以限制感受野)接受用户草图或程序噪声,输出 4×4 粗高程块及气候条件向量(均温、温差、降水、季节性)。不使用 diffusion blending,直接作为下游的全局上下文。

第二级:核心潜在 diffusion 模型(46 km/瓦片,T=2 InfiniteDiffusion)。以粗高程 + 气候条件为 conditioning,同时生成 64×64 低频高程 channel 和残差潜变量。训练目标为 L1 + LPIPS + 弱 KL 损失。

第三级:Consistency 解码器(90 m 分辨率,T=1 单步)。以潜变量为输入,输出 512×512 全分辨率残差。滑窗大小 512×512、步长 384(75% overlap)。

3. 高程稳定化技巧

Signed Square-Root 变换将高程 z 映射为 \(\text{sign}(z)\sqrt{|z|}\),压缩大值,使瓦片均值与对数标准差的相关系数从 0.66 降至 0.31,显著改善 diffusion 的噪声分布适配性。

Figure 12
Figure 12:Signed-sqrt 变换前后标准差分布对比。变换后标准差对均值高程的依赖大幅降低,分布更均匀。

Laplacian 分解 + Re-extraction 去噪:将高程分解为低频层 L(8× 降采样 + σ=5 模糊)和高频残差 H,分别在潜空间中建模。解码后对 L+H 重新下采样模糊,得到修正低频 \(\hat{L}\),最终输出 \(\hat{L} + H\)。此步骤将核心模型 FID 从 21.51 降至 8.11,consistency 模型 FID 从 75.15 降至 12.72。

N. 最关键的一句话

将 MultiDiffusion 改写为惰性稀疏累加,加上 Laplacian 分解稳定高程建模,使 diffusion model 首次具备对无界地形的 O(1) 随机访问能力并跑到实时。

主要实验结果

方法FID-50k ↓
Perlin Blending (Jain et al., 2023)186.70
Naive Tiling74.44
Naive InfiniteDiffusion (T=0)27.61
InfiniteDiffusion (T=1)19.78
InfiniteDiffusion (T=2)14.78
Non-tiled consistency model12.72
Non-tiled full diffusion8.11
方法TTFT (s)TTST (s)
InfiniteDiffusion (T=2)1.72 ± 0.190.66 ± 0.18
InfiniteDiffusion (T=1)1.39 ± 0.200.63 ± 0.16
Naive InfiniteDiffusion2.05 ± 0.221.60 ± 0.17
Independent Tiles0.51 ± 0.050.22 ± 0.02
Figure 6a
Figure 6:MultiDiffusion(上)vs. InfiniteDiffusion T=1(中)vs. T=2(下)的视觉对比。T=2 显著减少拼接 artifact。
Figure 4
Figure 4:同一世界种子下 20 个不同 1024×1024 区域,涵盖火山岛、高山系、夷平面,展示生成多样性。
不同区域大小的延迟细节(T=2)
区域大小TTFT (s)TTST (s)显存 (MB)
1024×10242.96 ± 0.351.79 ± 0.272214
512×5121.72 ± 0.190.66 ± 0.182214
256×2561.25 ± 0.190.26 ± 0.182214
128×1281.06 ± 0.140.10 ± 0.152214
Stable Diffusion 上的 InfiniteDiffusion 验证(Table 1)
方法FID
Stable Diffusion (full)1.94
MultiDiffusion (T=50)5.75
InfiniteDiffusion (T=2)5.83
InfiniteDiffusion (T=1)7.20

T=2 与完整 MultiDiffusion (50步) 几乎持平,验证了少步 consistency 近似的有效性。

局限与展望