变压器是一种神经网络,应用于序列处理领域,如文本或语音。
与早期的模型如RNN或LSTM不同,变压器同时处理所有输入元素,并利用所谓的注意力机制。
该机制允许模型评估输入中不同部分的重要性,并结合来自不同位置的相关信息。
变压器模型通常由多层自注意力(Self-Attention)和前馈神经网络组成,共同生成深层表示。
知名应用包括基于变压器架构的语言模型,如BERT或GPT。