Multi-View Attention Network for Visual Dialog

Sungjin Park, Taesun Whang, Yeochan Yoon, Heuiseok Lim

2020-04-29Visual Dialog

Abstract

Visual dialog is a challenging vision-language task in which a series of questions visually grounded by a given image are answered. To resolve the visual dialog task, a high-level understanding of various multimodal inputs (e.g., question, dialog history, and image) is required. Specifically, it is necessary for an agent to 1) determine the semantic intent of question and 2) align question-relevant textual and visual contents among heterogeneous modality inputs. In this paper, we propose Multi-View Attention Network (MVAN), which leverages multiple views about heterogeneous inputs based on attention mechanisms. MVAN effectively captures the question-relevant information from the dialog history with two complementary modules (i.e., Topic Aggregation and Context Matching), and builds multimodal representations through sequential alignment processes (i.e., Modality Alignment). Experimental results on VisDial v1.0 dataset show the effectiveness of our proposed model, which outperforms the previous state-of-the-art methods with respect to all evaluation metrics.

Results

Task	Dataset	Metric	Value	Model
Dialogue	VisDial v0.9 val	MRR	0.6765	MVAN
Dialogue	VisDial v0.9 val	Mean Rank	3.73	MVAN
Dialogue	VisDial v0.9 val	R@1	54.65	MVAN
Dialogue	VisDial v0.9 val	R@10	91.47	MVAN
Dialogue	VisDial v0.9 val	R@5	83.85	MVAN
Dialogue	Visual Dialog v1.0 test-std	MRR (x 100)	64.84	MVAN
Dialogue	Visual Dialog v1.0 test-std	Mean	3.97	MVAN
Dialogue	Visual Dialog v1.0 test-std	NDCG (x 100)	59.37	MVAN
Dialogue	Visual Dialog v1.0 test-std	R@1	51.45	MVAN
Dialogue	Visual Dialog v1.0 test-std	R@10	90.65	MVAN
Dialogue	Visual Dialog v1.0 test-std	R@5	81.12	MVAN
Visual Dialog	VisDial v0.9 val	MRR	0.6765	MVAN
Visual Dialog	VisDial v0.9 val	Mean Rank	3.73	MVAN
Visual Dialog	VisDial v0.9 val	R@1	54.65	MVAN
Visual Dialog	VisDial v0.9 val	R@10	91.47	MVAN
Visual Dialog	VisDial v0.9 val	R@5	83.85	MVAN
Visual Dialog	Visual Dialog v1.0 test-std	MRR (x 100)	64.84	MVAN
Visual Dialog	Visual Dialog v1.0 test-std	Mean	3.97	MVAN
Visual Dialog	Visual Dialog v1.0 test-std	NDCG (x 100)	59.37	MVAN
Visual Dialog	Visual Dialog v1.0 test-std	R@1	51.45	MVAN
Visual Dialog	Visual Dialog v1.0 test-std	R@10	90.65	MVAN
Visual Dialog	Visual Dialog v1.0 test-std	R@5	81.12	MVAN

Multi-View Attention Network for Visual Dialog

Abstract

Results

Related Papers

Multi-View Attention Network for Visual Dialog

Abstract

Results

Related Papers