Conceptual

Resolution-Guided Latent Diffusion for Multi-Resolution Image Generation

A conditioning technique for latent diffusion models that injects an explicit resolution embedding into every denoising step, so the same foundation model can generate images at a user-specified spatial resolution. Resolution-specific information is encoded and added to the denoising network's conditioning (alongside text via cross-attention) at each diffusion timestep, guiding noise prediction toward the requested resolution. Introduced in Text2Earth for global-scale remote-sensing generation, it overcomes prior models' fixed-size limitation and enables multi-resolution controllable synthesis.