人工智能transformer是什么(20分钟读懂AI史上最重要论文:Transformer到底是什么?)

人工智能transformer是什么(20分钟读懂AI史上最重要论文:Transformer到底是什么?)
20分钟读懂AI史上最重要论文:Transformer到底是什么?

今天我们用20分钟,彻底读懂AI史上最重要的一篇论文,没有之一,就是2017年谷歌团队发表的《Attention Is All You Need》。到目前为止,该论文已被引用超过18万次!

我们现在用的ChatGPT、DeepSeek、文心一言、Claude,包括能生成视频的Sora,它们底层的核心架构,全都出自这篇论文提出的Transformer。可以说,没有这篇论文,就没有今天的AI革命

很多人认为这篇论文是写给专家看的,全是数学公式,看不懂。今天我尝试用简单的数学,把核心逻辑、Q/K/V、多头注意力、位置编码,还有Decoder的mask机制,全部讲透。

我们先回到2017年,看看当时的AI世界是什么样的。

在Transformer诞生之前,自然语言处理领域(NLP领域),被两大架构统治:RNN(循环神经网络),还有它的升级版LSTM(长短期记忆,是一种特殊的递归神经网络)

这两种模型有一个共同特点:串行处理。就像我们看书,必须从第一个字读到最后一个字,不能跳着读。AI处理一句话,也得先处理第一个词,把状态记下来,再处理第二个词,以此类推。

这种方式有三个致命缺陷。

  1. 无法并行计算。因为后一个词的处理依赖前一个词,所以就算你有一万张GPU,也只能一个接一个算,训练速度极慢
  2. 长距离依赖丢失。比如一句话:“小明去超市买了苹果,他觉得它很甜。”RNN 处理到 “它” 的时候,早就把 “苹果” 的信息忘得差不多了,很难建立长距离的关联。
  3. 梯度消失或爆炸。训练深层网络时,信息传着传着就没了,或者变得无限大,导致模型学不进去

为了解决这些问题,学界后来引入了“注意力机制”,但当时的注意力,只是RNN的配角,用来辅助提升一点效果,核心还是循环结构。

直到2017年,《Attention Is All You Need》横空出世,构建了一个全新的架构:Transformer。它 由Self-Attenion和FeedForward Neural Network组成,一个基于Transformer的神经网络可以通过堆叠Transformer的形式进行搭建,具有更好的并行性能,在处理长序列数据方面有着极大的优势。

接下来,我们进入核心,先搞懂第一个概念:自注意力机制(Self-Attention)

自注意力机制又称内部注意力机制,顾名思义,是一种将单个序列的不同位置关联起来以计算同一序列的表示的注意机制。这种机制允许模型在处理序列数据时,动态地调整对每个元素的关注程度,从而捕捉序列内部的复杂依赖关系。

这意味着,当AI处理一个词的时候,它会同时看这句话里的所有其他词,然后给每个词分配一个权重,重要的词权重高,不重要的权重低。最后,把这些词的信息加权汇总,就得到了这个词在当前语境下的全新含义

比如这句话:“老鹰捉小鸡,它跑得很快。”

当AI处理“它”的时候,会给“小鸡”分配极高的权重,给“老鹰”分配较低的权重,给“捉”分配更低的权重。这样,AI 就精准知道,“它”指的是小鸡

这就是自注意力的核心:让AI学会“抓重点”,建立全局关联

那问题来了,AI是怎么计算这个权重的?这就用到了论文里最经典的三个向量:Q、K、V

这三个名字听起来很高大上,其实我们用一个“查字典”的例子,就能秒懂。

假设你现在要查 “苹果” 这个词的含义,Q、K、V分别对应三个角色:

  • Q(Query,查询向量):就是你要查的问题——“苹果是什么?”
  • K(Key,键向量):就是字典里每个词条的标题——“苹果:水果”“苹果:公司”“苹果:手机”。
  • V(Value,值向量):就是字典里每个词条的具体解释。

计算权重的过程,就是用Q去和所有的K做匹配。匹配度越高,权重就越高;匹配度越低,权重就越低。

比如你的Q是“苹果的味道”,那和K“苹果:水果”的匹配度最高,权重就最高;和“苹果:公司”的匹配度为0,权重就为0。

最后,用这个权重,去加权求和所有的V,就得到了“苹果”在“味道”这个语境下的最终含义

这就是Q/K/V的本质,没有任何复杂的数学,就是一个“查询 - 匹配 - 取值”的过程。

理解了自注意力和Q/K/V,我们再看第二个核心创新:多头注意力(Multi-Head Attention)

什么是多头?你可以理解为多个人一起查字典

一个人查“苹果”,可能只看到了“水果”的属性;但如果有8个人一起查,一个人看“水果”,一个人看“营养”,一个人看“产地”,一个人看“价格”…… 最后把8个人的结果合起来,对“苹果” 的理解就会无比全面

论文里用的是8个头,这就是“多头注意力”的由来。

它的作用,就是让AI从不同的角度去理解同一个词,捕捉更丰富的语义信息。比如处理 “乔布斯”,一个头关注“企业家”,一个头关注“苹果”,一个头关注“Iphone”,这样对“乔布斯”的表征就会更完整

人工智能transformer是什么(20分钟读懂AI史上最重要论文:Transformer到底是什么?)

到这里,我们解决了“理解”的问题,但还有一个关键问题:顺序

因为自注意力是并行处理的,所有词一起算,AI根本不知道这句话的顺序是什么。比如“我吃饭”和“饭吃我”,词是一样的,权重计算结果也差不多,但意思完全相反

怎么解决这个问题?论文的第三个核心创新:位置编码(Positional Encoding)

就是给每个词,加上一个“位置标签”,告诉AI:这个词在第1位,那个词在第2位。

那这个标签怎么加?论文里用的是正弦和余弦函数,为什么用这个?因为它有两个好处:

第一,能给每个位置一个独特的编码;第二,能让模型学到相对位置。比如第3个词和第5个词的距离,和第10个词和第12个词的距离,编码的规律是一样的。

这样,AI 就知道了词的顺序,“我吃饭” 和 “饭吃我”,就有了本质的区别

到这里,Transformer的Encoder(编码器)核心就讲完了。Encoder的作用,是把输入的文本,变成一组包含语义和位置信息的“向量”。

接下来,我们讲Decoder(解码器),它的作用,是把这些向量,变成输出的文本,比如翻译后的句子,或者ChatGPT的回答。

Decoder的结构,和Encoder很像,但多了一个关键机制:Masked Multi-Head Attention(掩码多头注意力)

什么是Mask?就是“遮挡”。

因为AI生成文本,是逐字生成的。比如生成“我爱足球”,它先生成“我”,再生成“爱”,再生成“足”,最后生成“球”。

当它生成“我”的时候,还不知道后面会生成“爱”“足”“球”,所以必须把后面的词遮挡住,不让AI“作弊”。

这就是Mask的作用:在训练时,把未来的位置全部屏蔽,只让AI根据前面已经生成的词,去预测下一个词。

除了掩码注意力,Decoder还有一个编码器 - 解码器注意力层,它的作用,是让Decoder“关注”Encoder的输出。比如机器翻译,把中文翻译成英文,Decoder会关注中文句子里的关键信息,确保翻译准确。

到这里,整个Transformer 的架构,就全部讲透了:

  • Encoder,由6个相同的层堆叠而成,每层包含多头注意力和前馈神经网络;
  • Decoder,也由6个相同的层堆叠而成,每层包含掩码多头注意力、编码器—解码器注意力和前馈神经网络;
  • 输入经过位置编码,进入Encoder;
  • Encoder的输出,进入Decoder;
  • Decoder最终输出概率分布,预测下一个词。

就是这么一个简单的架构,在性能上吊打了当时所有的模型,在英德翻译任务上,Transformer的BLEU值(翻译质量指标)比当时最好的模型高了2.0;在英法翻译任务上,训练时间从3.5 天缩短到了14 小时。这就是技术的降维打击

当时谁也没想到,这篇论文会掀起一场席卷全球的AI革命。可以说,Transformer开创了继MLP、CNN、RNN之后的第四大类模型,成为深度学习近10年最重要的工作。

讲到这里,这篇《Attention Is All You Need》的核心,就全部讲完了。我们回顾一下:

  1. 它抛弃了串行的RNN,用并行的自注意力机制,解决了训练慢、长距离依赖丢失的问题;
  2. 它用Q/K/V,实现了权重的精准计算;
  3. 它用多头注意力,让AI从多个角度理解语义;
  4. 它用位置编码,解决了词的顺序问题;
  5. 它用Decoder的mask机制,实现了逐字生成。

这5个创新构建了现代AI的基石

随着Transformer架构的出现,RNN类结构(LSTM)已经逐渐退出历史舞台,CNN也被抢占了大部分市场。Transformer架构为几乎所有的AI任务提供了统一的底层模型架构,形成实质上的底层结构大一统,促进了各个模态之间的融合。基于Transformer-Decoder 结构的堆叠,是当今所有主流大模型的结构。

当然,我们也需要明白,所谓AI,就是一台基于数学的猜测机器,计算过程充满了不确定性。从我的介绍中也能看出,全靠算!

来,做个小测试,看看你学到了多少?

你觉得Transformer最核心的创新是哪一个?

  1. 自注意力(QKV)
  2. 多头注意力
  3. 位置编码
  4. Decoder 的 Mask 机制

评论区直接打数字!

#AI #大模型 #Transformer #Attention #AI 论文 #技术科普 #机器学习 #人工智能

文章版权声明:除非注明,否则均为边学边练网络文章,版权归原作者所有

最新文章

热门文章

本栏目文章