报告嘉宾:姚遥 (南京大学)
报告时间:2026年1月28日 (星期三)晚上20:30 (北京时间)
报告题目:Direct 3D Diffusion: Geometry, Texture, and Beyond
报告人简介:
姚遥,南京大学智能科学与技术学院副教授、南京大学-影石创新智能影像校企联合实验室主任,国家级青年人才、苏州青年科学家。长期从事三维重建与生成方向研究,曾任三维视觉创业公司Altizure创始团队成员,2020年随公司收购加入苹果,任高级研究员。代表工作包括MVSNet系列工作、NeILF系列工作以及Direct3D系列工作,谷歌学术引用超7000次,曾获华为火花奖 (2024)、国际模式识别大会最佳学生论文奖 (2020)。现作为负责人承担国自然专项项目、面上项目、科技部重点研发计划课题、华为校企合作项目等项目。
个人主页:
https://yoyo000.github.io/
报告摘要:
近年来,三维生成,特别是原生三维生成 (Native 3D Generation)领域得到了快速发展。本次报告将介绍课题组在该领域的最新进展,重点涵盖 Direct3D、Direct3D-S2 与 Textrix 三项工作。Direct3D 利用 3D VAE 与 3D DiT 在三平面隐空间实现高质量几何生成;Direct3D-S2 通过空间稀疏注意力机制 (Spatial Sparse Attention, SSA),高效低成本的实现了高精度10亿体素三维生成;Textrix 通过引入 Latent 3D Attribute 表征机制,将几何、纹理、BRDF及语义分割信息统一编码,实现了高分辨率、多属性的原生三维内容生成。报告最后将探讨原生三维生成的未来发展趋势与挑战。
参考文献:
[1] TEXTRIX: Latent Attribute Grid for Native Texture Generation and Beyond[J]. Zeng Y, Bao Y, Qian J, et al. arXiv preprint arXiv:2512.02993, 2025.
[2] Direct3d: Scalable image-to-3d generation via 3d latent diffusion transformer[J].Wu S, Lin Y, Zhang F, et al. Advances in Neural Information Processing Systems, 2024, 37: 121859-121881.
[3] Direct3d-s2: Gigascale 3d generation made easy with spatial sparse attention[J].Wu S, Lin Y, Zhang F, et al. arXiv preprint arXiv:2505.17412, 2025.
[4] Spatialvid: A large-scale video dataset with spatial annotations[J].Wang J, Yuan Y, Zheng R, et al. arXiv preprint arXiv:2509.09676, 2025.