GLM: General Language Model Pretraining with Autoregressive Blank Infilling

Zhengxiao Du, Yujie Qian, Xiao Liu, Ming Ding, Jiezhong Qiu, Zhilin Yang, Jie Tang

2021-03-18ACL 2022 5Abstractive Text Summarization Natural Language Understanding Document Summarization General Classification Classification Language Modelling

Paper PDF Code Code Code Code Code(official)Code Code Code

Abstract

There have been various types of pretraining architectures including autoencoding models (e.g., BERT), autoregressive models (e.g., GPT), and encoder-decoder models (e.g., T5). However, none of the pretraining frameworks performs the best for all tasks of three main categories including natural language understanding (NLU), unconditional generation, and conditional generation. We propose a General Language Model (GLM) based on autoregressive blank infilling to address this challenge. GLM improves blank filling pretraining by adding 2D positional encodings and allowing an arbitrary order to predict spans, which results in performance gains over BERT and T5 on NLU tasks. Meanwhile, GLM can be pretrained for different types of tasks by varying the number and lengths of blanks. On a wide range of tasks across NLU, conditional and unconditional generation, GLM outperforms BERT, T5, and GPT given the same model sizes and data, and achieves the best performance from a single pretrained model with 1.25x parameters of BERT Large , demonstrating its generalizability to different downstream tasks.

Results

Task	Dataset	Metric	Value	Model
Language Modelling	WikiText-103	Test perplexity	11.33	GLM-XXLarge (bidirectional)
Language Modelling	WikiText-103	Test perplexity	12.22	GLM-XXLarge (unidirectional)
Language Modelling	LAMBADA	Accuracy	72.35	GLM-XXLarge (bidirectional)
Language Modelling	LAMBADA	Accuracy	67.18	GLM-XXLarge (unidirectional)
Text Summarization	CNN / Daily Mail	ROUGE-1	44.7	GLM-XXLarge
Text Summarization	CNN / Daily Mail	ROUGE-2	21.4	GLM-XXLarge
Text Summarization	CNN / Daily Mail	ROUGE-L	41.4	GLM-XXLarge
Text Summarization	CNN / Daily Mail	ROUGE-1	44.7	GLM-XXLarge
Text Summarization	CNN / Daily Mail	ROUGE-2	21.4	GLM-XXLarge
Text Summarization	CNN / Daily Mail	ROUGE-L	41.4	GLM-XXLarge
Abstractive Text Summarization	CNN / Daily Mail	ROUGE-1	44.7	GLM-XXLarge
Abstractive Text Summarization	CNN / Daily Mail	ROUGE-2	21.4	GLM-XXLarge
Abstractive Text Summarization	CNN / Daily Mail	ROUGE-L	41.4	GLM-XXLarge
Document Summarization	CNN / Daily Mail	ROUGE-1	44.7	GLM-XXLarge
Document Summarization	CNN / Daily Mail	ROUGE-2	21.4	GLM-XXLarge
Document Summarization	CNN / Daily Mail	ROUGE-L	41.4	GLM-XXLarge

GLM: General Language Model Pretraining with Autoregressive Blank Infilling

Abstract

Results

Related Papers

GLM: General Language Model Pretraining with Autoregressive Blank Infilling

Abstract

Results

Related Papers