ScaffDiff训练秘籍:45分钟混合支架微调实现部署级性能
【免费下载链接】scaffdiff项目地址: https://ai.gitcode.com/hf_mirrors/businesslion/scaffdiff
ScaffDiff是一款基于支架主导扩散技术的3D场景补全工具,通过创新的混合支架微调方法,仅需45分钟即可实现部署级性能。该项目在SemanticKITTI数据集上表现卓越,单步扩散推理速度达209ms/帧(4.78 FPS),比传统方法快138倍,同时在关键指标上超越同类技术69-72%。
为什么选择ScaffDiff?
突破性性能表现 🚀
ScaffDiff采用支架主导设计,通过GT坐标支架引导扩散过程,而非从零生成点云。这种创新方法带来了显著的性能提升:
- 在v2 GT(ICP优化)数据集上,CD²(平方Chamfer距离)达到0.024 ± 0.005 m²
- 混合支架微调后,在无支架协议下CD²为0.968 ± 0.194 m²,比LiDiff和ScoreLiDAR低69-72%
- 端到端延迟仅209ms/帧,在RTX 4090上实现4.78 FPS的实时性能
高效微调流程 ⏱️
ScaffDiff的混合支架微调方案专为快速部署设计:
- 仅需3个epoch(约45分钟)即可完成微调
- 学习率5e-5,30% LiDAR裁剪支架混合比例
- 时间步长t ∈ [50, 400],编码器保持冻结
- 6个微调种子的平均性能稳定可靠
核心技术架构
模型组件解析 🔍
ScaffDiff的架构设计兼顾效率与性能:
- 编码器:冻结的Point Transformer V3/Sonata(108M参数),0.05m体素大小,处理20,000输入点
- 去噪器:8.9M参数的PTv3风格分组向量注意力网络,余弦调度下的ε预测(1,000时间步)
- 推理:基于支架的单步x₀采样(t=200,ᾱ₂₀₀≈0.897,SNR≈8.8)
- 优化:轻量级kNN插值(约10ms)
多令牌高斯VAE创新 ✨
项目包含一个7.1M参数的多令牌高斯VAE:
- 残差PointNet编码器+32查询交叉注意力池化器
- 生成32×32维高斯潜在令牌(共1,024维)
- 5个交叉注意力块的Transformer解码器重建8,000个场景点
- 平方CD达0.120 ± 0.026 m²,推理仅需1.6ms/帧
快速开始指南
环境准备
git clone https://gitcode.com/hf_mirrors/businesslion/scaffdiff cd scaffdiff # 请参考官方文档配置依赖环境关键检查点使用
| 检查点路径 | 大小 | 用途 |
|---|---|---|
teacher_v2gt/best_model.pth | 542 MB | GT坐标支架训练的扩散教师模型 |
teacher_v2gt_ft/best_model.pth | 470 MB | 混合支架微调模型(部署推荐) |
teacher_v1gt/best_model.pth | 542 MB | v1 GT训练模型(用于对比) |
vae_v3/best_point_vae.pth | ~85 MB | 多令牌高斯VAE |
常用脚本
| 使用场景 | 脚本 |
|---|---|
| 全量验证评估 | evaluate_ral_metrics.py --config teacher_v2gt_lidar_v2 --num_frames 4071 |
| 自定义序列评估 | evaluate_ral_metrics_v2.py --config ... --sequence 00 --num_frames 500 |
| 无支架协议对比 | run_scaffoldfree_fair_str80.py(微调前)/run_scaffoldfree_fair_finetuned.py(微调后) |
| 混合支架微调 | finetune_mixed_scaffold.py |
| VAE重建评估 | evaluate_vae_v3.py |
评估结果深度解析
数据集对比
ScaffDiff在不同数据集上表现稳定:
| 序列 | 帧数 | CD² (m²) | F@0.2 | H₉₅ (m) |
|---|---|---|---|---|
| Seq 00 | 500 | 0.024 ± 0.004 | 0.844 | 0.284 |
| Seq 05 | 500 | 0.026 ± 0.004 | 0.825 | 0.293 |
| Seq 08 | 4,071 | 0.024 ± 0.005 | 0.844 | 0.285 |
与主流方法对比
在配对50帧协议下,ScaffDiff微调后性能显著领先:
| 方法 | 变体 | CD² (m²) ↓ |
|---|---|---|
| LiDiff | 50-step DDPM | 3.41 ± 2.55 |
| LiDiff | + refine head | 3.50 ± 2.62 |
| ScoreLiDAR | 8-step | 3.19 ± 2.59 |
| ScoreLiDAR | + refine head | 3.15 ± 2.60 |
| ScaffDiff(微调后) | single-step x₀ | 0.968 ± 0.194 |
学术引用
如果您在研究中使用ScaffDiff,请引用以下论文:
@inproceedings{agbasiere2026clouddiffusion, title = {CloudDiffusion: Diffusion-Based Scene Completion in the Point Cloud Domain}, author = {Agbasiere, Chidera and Sannikov, Mikhail and Ogunwoye, Faith and Shaikhiev, Erik and Kozinov, Alex and Mikhalchuk, Ilya and Zhura, Iana and Tsetserukou, Dzmitry}, booktitle = {Proc. IEEE Int. Conf. on Systems, Man, and Cybernetics (SMC)}, year = {2026} } @article{zhura2026scaffdiff, title = {ScaffDiff: Scaffold-Dominant Diffusion for 3D Scene Completion}, author = {Zhura, Iana and Sannikov, Mikhail and Agbasiere, Chidera and Shaikhiev, Erik and Ogunwoye, Faith and Kozinov, Alex and Mikhalchuk, Ilya and Tsetserukou, Dzmitry}, journal = {IEEE Robotics and Automation Letters (under review)}, year = {2026} }常见问题解答
Q: 如何选择合适的检查点?
A: 对于研究和对比,使用teacher_v2gt/best_model.pth;对于实际部署场景,推荐使用混合支架微调后的teacher_v2gt_ft/best_model.pth。
Q: 微调需要什么硬件配置?
A: 单个NVIDIA RTX 4090(24GB)足够完成训练(约10小时,30个epoch)和推理(4.78 FPS)。
Q: 支持哪些输入模态?
A: ScaffDiff支持LiDAR点云和Depth Anything V2单目伪LiDAR,两种模态性能差异在测量误差范围内。
ScaffDiff通过创新的支架主导设计和高效微调流程,为3D场景补全任务提供了部署级解决方案。无论是学术研究还是工业应用,都能从中受益于其卓越的性能和效率。
【免费下载链接】scaffdiff项目地址: https://ai.gitcode.com/hf_mirrors/businesslion/scaffdiff
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考