首页 正文

MGA-CLIP: A Multigranularity Attribution Framework for Cross-Modal Explainability in CLIP

{{output}}
The contrastive language-image pretraining (CLIP) model has demonstrated remarkable performance in multimodal tasks, but the interpretability of its similarity-based cross-modal alignment mechanism has attracted considerable attention. However, existing visual... ...