Conceptual

Diffusion-Based Contrastive Learning with Semantic Alignment for Multimodal Recommendation

DiffCL uses a diffusion model to generate denoised contrastive views for self-supervised contrastive learning in multimodal recommendation, aligns each item's visual and textual semantics through stable ID embeddings, and introduces an Item-Item Graph to enrich representations under data sparsity, jointly improving recommendation accuracy from noisy multimodal item features.