DiGS-Avatar: Single-Image Animatable 3D Human Reconstruction via UV-Space Diffusion

📅 2026-08-21
📈 Citations: 0
Influential: 0
📄 PDF
🤖 AI Summary
为解决单图像3D人体重建中的纹理平滑和几何不一致问题,提出DiGS-Avatar方法,通过UV空间扩散模型结合教师-学生框架生成高质量可动画3D人体。
📝 Abstract
Single-image 3D human reconstruction often suffers from over-smoothed textures and geometric inconsistencies. While diffusion models improve generative quality, their reliance on multi-view synthesis prior to 3D reconstruction is computationally expensive and prone to view inconsistency. We propose DiGS-Avatar, which reformulates this task as an efficient, diffusion-based UV-latent completion task, ensuring 3D consistency by design. To capture accurate spatial structure, we introduce a teacher-student framework where a multi-view teacher provides geometrically aligned pseudo-ground-truth latents to supervise a single-view diffusion student. Treating this inferred latent as a robust structural skeleton, our method injects high-level semantic features to accurately recover fine textural details without disrupting spatial integrity. The refined representation is then decoded into 3D Gaussian primitives. Extensive experiments demonstrate that DiGS-Avatar achieves state-of-the-art or highly competitive visual fidelity and zero-shot generalization, while reconstructing a fully animatable 3D avatar in just 0.71 seconds. Code is available at https://github.com/KLMAV-CUC/DiGS-Avatar.
Problem

Research questions and friction points this paper is trying to address.

single-image 3D human reconstruction
over-smoothed textures
geometric inconsistencies
diffusion models
multi-view synthesis
Innovation

Methods, ideas, or system contributions that make the work stand out.

UV-space diffusion
teacher-student framework
pseudo-ground-truth latents
semantic features
3D Gaussian primitives
J
Jiakun Li
Key Laboratory of Media Audio and Video (Communication University of China), Ministry of Education, Beijing 100024, China
L
Li Fang
Key Laboratory of Media Audio and Video (Communication University of China), Ministry of Education, Beijing 100024, China
Hao Zhu
Hao Zhu
Nanjing University
3D VisionDigital HumanSpatial Intelligence
F
Fei Hu
Key Laboratory of Media Audio and Video (Communication University of China), Ministry of Education, Beijing 100024, China
Long Ye
Long Ye
Communication University of China
Multimedia Signal ProcessingArtificial Intelligence
Y
Yuan Zhang
Key Laboratory of Media Audio and Video (Communication University of China), Ministry of Education, Beijing 100024, China
Jinyao Yan
Jinyao Yan
Key Laboratory of Media Audio and Video (Communication University of China), Ministry of Education, Beijing 100024, China