Plain-language definition
一句话定义
一种靠「注意力机制」理解上下文的神经网络架构,是 GPT、BERT、ChatGPT 等几乎所有现代大模型的「引擎」。
Original definition
英文原文定义
The Transformer is a neural network architecture based entirely on self-attention mechanisms, dispensing with recurrence and enabling highly parallelizable sequence modeling.
Two levels
分难度讲解
入门版
之前的模型像「一个字一个字读」,Transformer 像「一眼看全句,重点地方多看几眼」。它能并行处理、理解长距离依赖,因此训练又快又好。
进阶版
Transformer 由 Encoder/Decoder 堆叠组成,核心是 Scaled Dot-Product Attention:Attention(Q,K,V)=softmax(QKᵀ/√dₖ)V,加上 Multi-Head、位置编码、残差连接与 LayerNorm。GPT 系列只用 Decoder,BERT 只用 Encoder。
Real-world example
真实例子
ChatGPT 能流畅对话、能写代码、能总结文章——底层架构就是 Transformer。
Keep exploring