AI Terms Academy
深度学习 · Deep Learning

Transformer

一种靠「注意力机制」理解上下文的神经网络架构,是 GPT、BERT、ChatGPT 等几乎所有现代大模型的「引擎」。

Transformer 架构

高阶 · Advanced#Transformer#大模型

Plain-language definition

一句话定义

一种靠「注意力机制」理解上下文的神经网络架构,是 GPT、BERT、ChatGPT 等几乎所有现代大模型的「引擎」。

Original definition

英文原文定义

The Transformer is a neural network architecture based entirely on self-attention mechanisms, dispensing with recurrence and enabling highly parallelizable sequence modeling.

Two levels

分难度讲解

入门版

之前的模型像「一个字一个字读」,Transformer 像「一眼看全句,重点地方多看几眼」。它能并行处理、理解长距离依赖,因此训练又快又好。

进阶版

Transformer 由 Encoder/Decoder 堆叠组成,核心是 Scaled Dot-Product Attention:Attention(Q,K,V)=softmax(QKᵀ/√dₖ)V,加上 Multi-Head、位置编码、残差连接与 LayerNorm。GPT 系列只用 Decoder,BERT 只用 Encoder。

Real-world example

真实例子

ChatGPT 能流畅对话、能写代码、能总结文章——底层架构就是 Transformer。

Keep exploring

相关术语