COutfitGAN: Learning to Synthesize Compatible Outfits Supervised by Silhouette Masks and Fashion Styles
This paper introduces a novel task—fashion outfit generation from an arbitrary number of given clothing items—aiming to synthesize visually realistic and stylistically harmonious complementary garments. Methodologically, it proposes the first generative framework for completing outfits from partial inputs, featuring a pyramid-style extractor to model multi-granularity fashion features, and a dual-discriminator joint optimization scheme: a U-Net-based discriminator assesses image realism, while a relational discriminator models cross-item compatibility. Additionally, contour mask supervision is incorporated to enhance fine-grained structural consistency. Evaluated on a large-scale dataset comprising 200K outfits and 800K individual items, the method achieves significant improvements over state-of-the-art approaches across quantitative metrics—including image fidelity, outfit compatibility, and visual similarity—demonstrating both effectiveness and generalizability.