MGA-CLIP: A Multigranularity Attribution Framework for Cross-Modal Explainability in CLIP
{{output}}
The contrastive language-image pretraining (CLIP) model has demonstrated remarkable performance in multimodal tasks, but the interpretability of its similarity-based cross-modal alignment mechanism has attracted considerable attention. However, existing visual... ...