Tackling Background Distraction in Video Object Segmentation

Suhwan Cho, Heansung Lee, Minhyeok Lee, Chaewon Park, Sungjun Jang, Minjung Kim, Sangyoun Lee

2022-07-14Semi-Supervised Video Object Segmentation Semantic Segmentation Video Object Segmentation Video Semantic Segmentation

Paper PDF Code(official)

Abstract

Semi-supervised video object segmentation (VOS) aims to densely track certain designated objects in videos. One of the main challenges in this task is the existence of background distractors that appear similar to the target objects. We propose three novel strategies to suppress such distractors: 1) a spatio-temporally diversified template construction scheme to obtain generalized properties of the target objects; 2) a learnable distance-scoring function to exclude spatially-distant distractors by exploiting the temporal consistency between two consecutive frames; 3) swap-and-attach augmentation to force each object to have unique features by providing training samples containing entangled objects. On all public benchmark datasets, our model achieves a comparable performance to contemporary state-of-the-art approaches, even with real-time performance. Qualitative results also demonstrate the superiority of our approach over existing methods. We believe our approach will be widely used for future VOS research.

Results

Task	Dataset	Metric	Value	Model
Video	DAVIS (no YouTube-VOS training)	D16 val (F)	86.2	TBD
Video	DAVIS (no YouTube-VOS training)	D16 val (G)	86.8	TBD
Video	DAVIS (no YouTube-VOS training)	D16 val (J)	87.5	TBD
Video	DAVIS (no YouTube-VOS training)	D17 test (F)	72.2	TBD
Video	DAVIS (no YouTube-VOS training)	D17 test (G)	69.4	TBD
Video	DAVIS (no YouTube-VOS training)	D17 test (J)	66.6	TBD
Video	DAVIS (no YouTube-VOS training)	D17 val (F)	82.3	TBD
Video	DAVIS (no YouTube-VOS training)	D17 val (G)	80	TBD
Video	DAVIS (no YouTube-VOS training)	D17 val (J)	77.6	TBD
Video	DAVIS (no YouTube-VOS training)	FPS	50.1	TBD
Video Object Segmentation	DAVIS (no YouTube-VOS training)	D16 val (F)	86.2	TBD
Video Object Segmentation	DAVIS (no YouTube-VOS training)	D16 val (G)	86.8	TBD
Video Object Segmentation	DAVIS (no YouTube-VOS training)	D16 val (J)	87.5	TBD
Video Object Segmentation	DAVIS (no YouTube-VOS training)	D17 test (F)	72.2	TBD
Video Object Segmentation	DAVIS (no YouTube-VOS training)	D17 test (G)	69.4	TBD
Video Object Segmentation	DAVIS (no YouTube-VOS training)	D17 test (J)	66.6	TBD
Video Object Segmentation	DAVIS (no YouTube-VOS training)	D17 val (F)	82.3	TBD
Video Object Segmentation	DAVIS (no YouTube-VOS training)	D17 val (G)	80	TBD
Video Object Segmentation	DAVIS (no YouTube-VOS training)	D17 val (J)	77.6	TBD
Video Object Segmentation	DAVIS (no YouTube-VOS training)	FPS	50.1	TBD
Semi-Supervised Video Object Segmentation	DAVIS (no YouTube-VOS training)	D16 val (F)	86.2	TBD
Semi-Supervised Video Object Segmentation	DAVIS (no YouTube-VOS training)	D16 val (G)	86.8	TBD
Semi-Supervised Video Object Segmentation	DAVIS (no YouTube-VOS training)	D16 val (J)	87.5	TBD
Semi-Supervised Video Object Segmentation	DAVIS (no YouTube-VOS training)	D17 test (F)	72.2	TBD
Semi-Supervised Video Object Segmentation	DAVIS (no YouTube-VOS training)	D17 test (G)	69.4	TBD
Semi-Supervised Video Object Segmentation	DAVIS (no YouTube-VOS training)	D17 test (J)	66.6	TBD
Semi-Supervised Video Object Segmentation	DAVIS (no YouTube-VOS training)	D17 val (F)	82.3	TBD
Semi-Supervised Video Object Segmentation	DAVIS (no YouTube-VOS training)	D17 val (G)	80	TBD
Semi-Supervised Video Object Segmentation	DAVIS (no YouTube-VOS training)	D17 val (J)	77.6	TBD
Semi-Supervised Video Object Segmentation	DAVIS (no YouTube-VOS training)	FPS	50.1	TBD

Tackling Background Distraction in Video Object Segmentation

Abstract

Results

Related Papers

Tackling Background Distraction in Video Object Segmentation

Abstract

Results

Related Papers