Conceptual

Entity-Level Controlled Text-to-Image Generation with Regional Attention in Diffusion Transformers

A framework for entity-level control in text-to-image diffusion transformers whose parameter-free regional-attention mechanism binds each entity prompt to an arbitrary-shaped spatial mask, enabling precise multi-entity layout and attribute control, an inpainting-fusion pipeline for multi-entity inpainting, and composition with adapters and multimodal LLMs.