Learning to Rematch Mismatched Pairs for Robust Cross-Modal Retrieval

Haochen Han, Qinghua Zheng, Guang Dai, Minnan Luo, Jingdong Wang

2024-03-08CVPR 2024 1Cross-Modal Retrieval Cross-modal retrieval with noisy correspondence Semantic Similarity Semantic Textual Similarity Retrieval

Paper PDF Code(official)

Abstract

Collecting well-matched multimedia datasets is crucial for training cross-modal retrieval models. However, in real-world scenarios, massive multimodal data are harvested from the Internet, which inevitably contains Partially Mismatched Pairs (PMPs). Undoubtedly, such semantical irrelevant data will remarkably harm the cross-modal retrieval performance. Previous efforts tend to mitigate this problem by estimating a soft correspondence to down-weight the contribution of PMPs. In this paper, we aim to address this challenge from a new perspective: the potential semantic similarity among unpaired samples makes it possible to excavate useful knowledge from mismatched pairs. To achieve this, we propose L2RM, a general framework based on Optimal Transport (OT) that learns to rematch mismatched pairs. In detail, L2RM aims to generate refined alignments by seeking a minimal-cost transport plan across different modalities. To formalize the rematching idea in OT, first, we propose a self-supervised cost function that automatically learns from explicit similarity-cost mapping relation. Second, we present to model a partial OT problem while restricting the transport among false positives to further boost refined alignments. Extensive experiments on three benchmarks demonstrate our L2RM significantly improves the robustness against PMPs for existing models. The code is available at https://github.com/hhc1997/L2RM.

Results

Task	Dataset	Metric	Value	Model
Image Retrieval with Multi-Modal Query	COCO-Noisy	Image-to-text R@1	80.2	L2RM-SCARF
Image Retrieval with Multi-Modal Query	COCO-Noisy	Image-to-text R@10	98.5	L2RM-SCARF
Image Retrieval with Multi-Modal Query	COCO-Noisy	Image-to-text R@5	96.3	L2RM-SCARF
Image Retrieval with Multi-Modal Query	COCO-Noisy	R-Sum	524.7	L2RM-SCARF
Image Retrieval with Multi-Modal Query	COCO-Noisy	Text-to-image R@1	64.2	L2RM-SCARF
Image Retrieval with Multi-Modal Query	COCO-Noisy	Text-to-image R@10	95.4	L2RM-SCARF
Image Retrieval with Multi-Modal Query	COCO-Noisy	Text-to-image R@5	90.1	L2RM-SCARF
Image Retrieval with Multi-Modal Query	CC152K	Image-to-text R@1	43	L2RM-SGRAF
Image Retrieval with Multi-Modal Query	CC152K	Image-to-text R@10	75.7	L2RM-SGRAF
Image Retrieval with Multi-Modal Query	CC152K	Image-to-text R@5	67.5	L2RM-SGRAF
Image Retrieval with Multi-Modal Query	CC152K	R-Sum	374.2	L2RM-SGRAF
Image Retrieval with Multi-Modal Query	CC152K	Text-to-image R@1	42.8	L2RM-SGRAF
Image Retrieval with Multi-Modal Query	CC152K	Text-to-image R@10	77.2	L2RM-SGRAF
Image Retrieval with Multi-Modal Query	CC152K	Text-to-image R@5	68	L2RM-SGRAF
Image Retrieval with Multi-Modal Query	Flickr30K-Noisy	Image-to-text R@1	77.9	L2RM-SGRAF
Image Retrieval with Multi-Modal Query	Flickr30K-Noisy	Image-to-text R@10	97.8	L2RM-SGRAF
Image Retrieval with Multi-Modal Query	Flickr30K-Noisy	Image-to-text R@5	95.2	L2RM-SGRAF
Image Retrieval with Multi-Modal Query	Flickr30K-Noisy	R-Sum	503.8	L2RM-SGRAF
Image Retrieval with Multi-Modal Query	Flickr30K-Noisy	Text-to-image R@1	59.8	L2RM-SGRAF
Image Retrieval with Multi-Modal Query	Flickr30K-Noisy	Text-to-image R@10	89.5	L2RM-SGRAF
Image Retrieval with Multi-Modal Query	Flickr30K-Noisy	Text-to-image R@5	83.6	L2RM-SGRAF
Cross-Modal Information Retrieval	COCO-Noisy	Image-to-text R@1	80.2	L2RM-SCARF
Cross-Modal Information Retrieval	COCO-Noisy	Image-to-text R@10	98.5	L2RM-SCARF
Cross-Modal Information Retrieval	COCO-Noisy	Image-to-text R@5	96.3	L2RM-SCARF
Cross-Modal Information Retrieval	COCO-Noisy	R-Sum	524.7	L2RM-SCARF
Cross-Modal Information Retrieval	COCO-Noisy	Text-to-image R@1	64.2	L2RM-SCARF
Cross-Modal Information Retrieval	COCO-Noisy	Text-to-image R@10	95.4	L2RM-SCARF
Cross-Modal Information Retrieval	COCO-Noisy	Text-to-image R@5	90.1	L2RM-SCARF
Cross-Modal Information Retrieval	CC152K	Image-to-text R@1	43	L2RM-SGRAF
Cross-Modal Information Retrieval	CC152K	Image-to-text R@10	75.7	L2RM-SGRAF
Cross-Modal Information Retrieval	CC152K	Image-to-text R@5	67.5	L2RM-SGRAF
Cross-Modal Information Retrieval	CC152K	R-Sum	374.2	L2RM-SGRAF
Cross-Modal Information Retrieval	CC152K	Text-to-image R@1	42.8	L2RM-SGRAF
Cross-Modal Information Retrieval	CC152K	Text-to-image R@10	77.2	L2RM-SGRAF
Cross-Modal Information Retrieval	CC152K	Text-to-image R@5	68	L2RM-SGRAF
Cross-Modal Information Retrieval	Flickr30K-Noisy	Image-to-text R@1	77.9	L2RM-SGRAF
Cross-Modal Information Retrieval	Flickr30K-Noisy	Image-to-text R@10	97.8	L2RM-SGRAF
Cross-Modal Information Retrieval	Flickr30K-Noisy	Image-to-text R@5	95.2	L2RM-SGRAF
Cross-Modal Information Retrieval	Flickr30K-Noisy	R-Sum	503.8	L2RM-SGRAF
Cross-Modal Information Retrieval	Flickr30K-Noisy	Text-to-image R@1	59.8	L2RM-SGRAF
Cross-Modal Information Retrieval	Flickr30K-Noisy	Text-to-image R@10	89.5	L2RM-SGRAF
Cross-Modal Information Retrieval	Flickr30K-Noisy	Text-to-image R@5	83.6	L2RM-SGRAF
Cross-Modal Retrieval	COCO-Noisy	Image-to-text R@1	80.2	L2RM-SCARF
Cross-Modal Retrieval	COCO-Noisy	Image-to-text R@10	98.5	L2RM-SCARF
Cross-Modal Retrieval	COCO-Noisy	Image-to-text R@5	96.3	L2RM-SCARF
Cross-Modal Retrieval	COCO-Noisy	R-Sum	524.7	L2RM-SCARF
Cross-Modal Retrieval	COCO-Noisy	Text-to-image R@1	64.2	L2RM-SCARF
Cross-Modal Retrieval	COCO-Noisy	Text-to-image R@10	95.4	L2RM-SCARF
Cross-Modal Retrieval	COCO-Noisy	Text-to-image R@5	90.1	L2RM-SCARF
Cross-Modal Retrieval	CC152K	Image-to-text R@1	43	L2RM-SGRAF
Cross-Modal Retrieval	CC152K	Image-to-text R@10	75.7	L2RM-SGRAF
Cross-Modal Retrieval	CC152K	Image-to-text R@5	67.5	L2RM-SGRAF
Cross-Modal Retrieval	CC152K	R-Sum	374.2	L2RM-SGRAF
Cross-Modal Retrieval	CC152K	Text-to-image R@1	42.8	L2RM-SGRAF
Cross-Modal Retrieval	CC152K	Text-to-image R@10	77.2	L2RM-SGRAF
Cross-Modal Retrieval	CC152K	Text-to-image R@5	68	L2RM-SGRAF
Cross-Modal Retrieval	Flickr30K-Noisy	Image-to-text R@1	77.9	L2RM-SGRAF
Cross-Modal Retrieval	Flickr30K-Noisy	Image-to-text R@10	97.8	L2RM-SGRAF
Cross-Modal Retrieval	Flickr30K-Noisy	Image-to-text R@5	95.2	L2RM-SGRAF
Cross-Modal Retrieval	Flickr30K-Noisy	R-Sum	503.8	L2RM-SGRAF
Cross-Modal Retrieval	Flickr30K-Noisy	Text-to-image R@1	59.8	L2RM-SGRAF
Cross-Modal Retrieval	Flickr30K-Noisy	Text-to-image R@10	89.5	L2RM-SGRAF
Cross-Modal Retrieval	Flickr30K-Noisy	Text-to-image R@5	83.6	L2RM-SGRAF

Abstract

Results

Task	Dataset	Metric	Value	Model
Image Retrieval with Multi-Modal Query	COCO-Noisy	Image-to-text R@1	80.2	L2RM-SCARF
Image Retrieval with Multi-Modal Query	COCO-Noisy	Image-to-text R@10	98.5	L2RM-SCARF
Image Retrieval with Multi-Modal Query	COCO-Noisy	Image-to-text R@5	96.3	L2RM-SCARF
Image Retrieval with Multi-Modal Query	COCO-Noisy	R-Sum	524.7	L2RM-SCARF
Image Retrieval with Multi-Modal Query	COCO-Noisy	Text-to-image R@1	64.2	L2RM-SCARF
Image Retrieval with Multi-Modal Query	COCO-Noisy	Text-to-image R@10	95.4	L2RM-SCARF
Image Retrieval with Multi-Modal Query	COCO-Noisy	Text-to-image R@5	90.1	L2RM-SCARF
Image Retrieval with Multi-Modal Query	CC152K	Image-to-text R@1	43	L2RM-SGRAF
Image Retrieval with Multi-Modal Query	CC152K	Image-to-text R@10	75.7	L2RM-SGRAF
Image Retrieval with Multi-Modal Query	CC152K	Image-to-text R@5	67.5	L2RM-SGRAF
Image Retrieval with Multi-Modal Query	CC152K	R-Sum	374.2	L2RM-SGRAF
Image Retrieval with Multi-Modal Query	CC152K	Text-to-image R@1	42.8	L2RM-SGRAF
Image Retrieval with Multi-Modal Query	CC152K	Text-to-image R@10	77.2	L2RM-SGRAF
Image Retrieval with Multi-Modal Query	CC152K	Text-to-image R@5	68	L2RM-SGRAF
Image Retrieval with Multi-Modal Query	Flickr30K-Noisy	Image-to-text R@1	77.9	L2RM-SGRAF
Image Retrieval with Multi-Modal Query	Flickr30K-Noisy	Image-to-text R@10	97.8	L2RM-SGRAF
Image Retrieval with Multi-Modal Query	Flickr30K-Noisy	Image-to-text R@5	95.2	L2RM-SGRAF
Image Retrieval with Multi-Modal Query	Flickr30K-Noisy	R-Sum	503.8	L2RM-SGRAF
Image Retrieval with Multi-Modal Query	Flickr30K-Noisy	Text-to-image R@1	59.8	L2RM-SGRAF
Image Retrieval with Multi-Modal Query	Flickr30K-Noisy	Text-to-image R@10	89.5	L2RM-SGRAF
Image Retrieval with Multi-Modal Query	Flickr30K-Noisy	Text-to-image R@5	83.6	L2RM-SGRAF
Cross-Modal Information Retrieval	COCO-Noisy	Image-to-text R@1	80.2	L2RM-SCARF
Cross-Modal Information Retrieval	COCO-Noisy	Image-to-text R@10	98.5	L2RM-SCARF
Cross-Modal Information Retrieval	COCO-Noisy	Image-to-text R@5	96.3	L2RM-SCARF
Cross-Modal Information Retrieval	COCO-Noisy	R-Sum	524.7	L2RM-SCARF
Cross-Modal Information Retrieval	COCO-Noisy	Text-to-image R@1	64.2	L2RM-SCARF
Cross-Modal Information Retrieval	COCO-Noisy	Text-to-image R@10	95.4	L2RM-SCARF
Cross-Modal Information Retrieval	COCO-Noisy	Text-to-image R@5	90.1	L2RM-SCARF
Cross-Modal Information Retrieval	CC152K	Image-to-text R@1	43	L2RM-SGRAF
Cross-Modal Information Retrieval	CC152K	Image-to-text R@10	75.7	L2RM-SGRAF
Cross-Modal Information Retrieval	CC152K	Image-to-text R@5	67.5	L2RM-SGRAF
Cross-Modal Information Retrieval	CC152K	R-Sum	374.2	L2RM-SGRAF
Cross-Modal Information Retrieval	CC152K	Text-to-image R@1	42.8	L2RM-SGRAF
Cross-Modal Information Retrieval	CC152K	Text-to-image R@10	77.2	L2RM-SGRAF
Cross-Modal Information Retrieval	CC152K	Text-to-image R@5	68	L2RM-SGRAF
Cross-Modal Information Retrieval	Flickr30K-Noisy	Image-to-text R@1	77.9	L2RM-SGRAF
Cross-Modal Information Retrieval	Flickr30K-Noisy	Image-to-text R@10	97.8	L2RM-SGRAF
Cross-Modal Information Retrieval	Flickr30K-Noisy	Image-to-text R@5	95.2	L2RM-SGRAF
Cross-Modal Information Retrieval	Flickr30K-Noisy	R-Sum	503.8	L2RM-SGRAF
Cross-Modal Information Retrieval	Flickr30K-Noisy	Text-to-image R@1	59.8	L2RM-SGRAF
Cross-Modal Information Retrieval	Flickr30K-Noisy	Text-to-image R@10	89.5	L2RM-SGRAF
Cross-Modal Information Retrieval	Flickr30K-Noisy	Text-to-image R@5	83.6	L2RM-SGRAF
Cross-Modal Retrieval	COCO-Noisy	Image-to-text R@1	80.2	L2RM-SCARF
Cross-Modal Retrieval	COCO-Noisy	Image-to-text R@10	98.5	L2RM-SCARF
Cross-Modal Retrieval	COCO-Noisy	Image-to-text R@5	96.3	L2RM-SCARF
Cross-Modal Retrieval	COCO-Noisy	R-Sum	524.7	L2RM-SCARF
Cross-Modal Retrieval	COCO-Noisy	Text-to-image R@1	64.2	L2RM-SCARF
Cross-Modal Retrieval	COCO-Noisy	Text-to-image R@10	95.4	L2RM-SCARF
Cross-Modal Retrieval	COCO-Noisy	Text-to-image R@5	90.1	L2RM-SCARF
Cross-Modal Retrieval	CC152K	Image-to-text R@1	43	L2RM-SGRAF
Cross-Modal Retrieval	CC152K	Image-to-text R@10	75.7	L2RM-SGRAF
Cross-Modal Retrieval	CC152K	Image-to-text R@5	67.5	L2RM-SGRAF
Cross-Modal Retrieval	CC152K	R-Sum	374.2	L2RM-SGRAF
Cross-Modal Retrieval	CC152K	Text-to-image R@1	42.8	L2RM-SGRAF
Cross-Modal Retrieval	CC152K	Text-to-image R@10	77.2	L2RM-SGRAF
Cross-Modal Retrieval	CC152K	Text-to-image R@5	68	L2RM-SGRAF
Cross-Modal Retrieval	Flickr30K-Noisy	Image-to-text R@1	77.9	L2RM-SGRAF
Cross-Modal Retrieval	Flickr30K-Noisy	Image-to-text R@10	97.8	L2RM-SGRAF
Cross-Modal Retrieval	Flickr30K-Noisy	Image-to-text R@5	95.2	L2RM-SGRAF
Cross-Modal Retrieval	Flickr30K-Noisy	R-Sum	503.8	L2RM-SGRAF
Cross-Modal Retrieval	Flickr30K-Noisy	Text-to-image R@1	59.8	L2RM-SGRAF
Cross-Modal Retrieval	Flickr30K-Noisy	Text-to-image R@10	89.5	L2RM-SGRAF
Cross-Modal Retrieval	Flickr30K-Noisy	Text-to-image R@5	83.6	L2RM-SGRAF

Learning to Rematch Mismatched Pairs for Robust Cross-Modal Retrieval

Abstract

Results

Related Papers

Learning to Rematch Mismatched Pairs for Robust Cross-Modal Retrieval

Abstract

Results

Related Papers