J
John Cavil
Text
Hierarchical Vision-Language Alignment for Text-to-Image Generation via Diffusion Models Emily
This paper introduces VLAD (Vision-Language Aligned Diffusion), a text-to-image generation framework that couples semantic alignment with a multi-stage diffusion process. A Contextual Composition Mod…