Multivariate Diffusion Transformer with Decoupled Attention for High-Fidelity Mask-Text Collaborative Facial Generation
arXiv:2511.12631v3 Announce Type: replace-cross Abstract: While significant progress has been achieved in multimodal facial generation using semantic masks and textual…

