产品概述
Zero123 是由哥伦比亚大学团队开发的一种视图条件扩散模型,能够从任意单张 RGB 图像生成同一物体在不同视角下的新视图,并进一步实现单视图3D重建。其稳定版 Stable Zero123 在 Zero123-XL 基础上大幅提升质量和效率,基于 Stable Diffusion 1.5 架构,消耗与 SD1.5 相同显存即可生成新视图。模型已开源,供研究人员和非商业用户使用。
核心优势
- **高质量训练数据**:对 Objaverse 数据集进行严格过滤,仅保留高质量3D对象,并采用更真实的渲染方式,显著提升生成质量。
- **摄像机海拔调节**:在训练和推理中提供估计的摄像机角度(海拔),使模型能做出更合理、更准确的视角预测。
- **训练效率提升40倍**:通过预计算数据集(预处理潜在变量)和优化数据加载器,支持更大批大小,相比 Zero123-XL 训练效率提升40倍。
- **强大的零样本泛化**:即使在合成数据上训练,也能直接应用于真实世界图像、不同分布数据集甚至印象派画作,无需微调。
适用场景
- 从单张图片生成物体的多个视角视图(新视图合成)
- 单张图片到3D对象的重建(利用分数蒸馏采样 SDS 优化 NeRF)
- 文本生成3D:先用 SDXL 生成一张图,再用 Zero123 生成3D对象
- 辅助3D内容创建、游戏资产制作、AR/VR 原型设计