Resolution-Guided Latent Diffusion for Multi-Resolution Image Generation
A conditioning technique for latent diffusion models that injects an explicit resolution embedding into every denoising step, so the same foundation model can generate images at a user-specified spatial resolution. Resolution-specific information is encoded and added to the denoising network's conditioning (alongside text via cross-attention) at each diffusion timestep, guiding noise prediction toward the requested resolution. Introduced in Text2Earth for global-scale remote-sensing generation, it overcomes prior models' fixed-size limitation and enables multi-resolution controllable synthesis.
D
Data
Text
Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a
Text2Earth introduces a resolution-guided latent diffusion foundation model (1.3B params) for global-scale remote-sensing text-to-image generation, trained on the new Git-10M dataset (10.5M image-tex…