ID-Booth: Identity-consistent Face Generation with Diffusion Models
Existing diffusion models for face synthesis suffer from a fundamental trade-off between identity consistency and generation diversity: optimizing solely for image quality often compromises identity fidelity, whereas identity-supervised training tends to overfit. This paper proposes ID-Booth—a novel framework that decouples identity representation from the generative process without fine-tuning the backbone diffusion model. It introduces a first-of-its-kind triplet-based identity training objective, jointly optimizing generation quality, identity preservation, and semantic controllability. Built upon a latent diffusion model (LDM), ID-Booth integrates a VAE, text encoder, and a customized denoising network to enable both text-guided and identity-anchored synthesis. Experiments demonstrate significant improvements across multiple benchmarks: +12.7% intra-class identity consistency, +9.3% inter-class separability, and +21% image diversity. Moreover, it enhances few-shot face recognition performance without requiring access to original face data.