发布时间:2026/8/27 13:32:43
一文搞懂Transformer架构的三种注意力机制 前言大家对注意力机制多少都有所耳闻毕竟在自然语言处理NLP和大型语言模型LLM领域2017年《Attention Is All You Need》这篇论文是里程碑式的存在几乎所有的LLM都是基于注意力机制构建的甚至最新的多模态或基于视觉的模型也在某种程度上都运用了它今天我们将深入探讨注意力机制。01什么是注意力当人类的视觉机制察觉到一个物体时通常不会从头到尾地扫视整个场景一般会根据个人的需求集中关注特定的部分。比如下面这张图我们第一眼应该是看到一只动物然后眼睛会先注意到动物的脸然后得出初步结论这应该是一只狼就像右边注意力图所示颜色更深的部分表示一般是我们人类最先看见注意的。注意力最早应用在机器视觉领域CVComputer Vision后来才应用到NLP和LLM领域。多头2头自注意力可视化如下动画所示注意力在Transformer中被应用于机器翻译02Transformer的注意力层在Transformer架构中有两大的组件,分别是编码器Encoder和解码器Decoder 编码器主要是将输入序列映射到潜在语义空间注意力****向量也叫上下文向量但其实上下文向量是注意力机制内部对输入向量的叫法本文中编码器输出向量都只叫作注意力向量以示区分而解码器则是将潜在语义空间注意力****向量映射到输出序列。在Transformer架构中有3种不同的注意力层解码器中的交叉注意力层Cross attention layer编码器中的全局自注意力层Global self attention layer解码器中的因果自注意力层Causal attention layer如下图所示注意力机制基础注意力机制的数学表示如下表达式中QK和V分别指的是查询Query键Key以及值Value矩阵这三种矩阵中每一行都对应了输入文本中的一个分词每一列则对应了这个分词的某一个特性Feature或者维度简单来说查询矩阵里的数据代表了我们关注的词键矩阵里的数据用来帮我们计算这些词之间的相似度即注意力分数attention score向量点乘可以计算相似度而值矩阵里的数据则用来根据这些相似度计算出最终的输出结果为了确保计算过程中的数据不会因为维度即键的大小太大而爆炸或者太小而消失注意力分数会通过键的维度的平方根来进行调整接着通过softmax函数把这些分数转化成权重最后这些权重会和值矩阵相乘得到最后的输出注意力向量。注意力分数可视化为热力图后能清晰地显示出在序列中哪些单词对于预测每个输出单词更重要。下图是在机器翻译中的例子纵轴是英语原文横轴是对应的葡萄牙语翻译以下是计算自注意力机制输出注意力向量的过程。不包括Scale和SoftMax理解QKV注意力机制中有两个输入查询序列Q正在处理的序列在底部。上下文序列KV被关注的序列在左侧。输出序列的维度与查询序列相同。这个操作常常被比作字典查找但是是一个模糊的可微分的向量化的字典查找。举个例子假设有一个普通的Python字典有 3 个键和 3 个值被传递了一个单独的查询d {‘color’: ‘blue’, ‘age’: 22, ‘type’: ‘pickup’}result d[‘color’]这里查询Q是你要找的内容键K表示字典里有什么样的信息而值V则是对应的信息在普通的字典查找中字典会找到匹配的键并返回其对应的值如果查询找不到完全匹配的键也许你会期望返回最接近的值比如在上面的例子中如果你查找 d[“species”]你可能会期望返回 “pickup”因为它是最接近查询的匹配。一个注意力层就像是这样的一个模糊查找但它不仅仅是寻找最佳键它结合了查询Q和键K向量来确定它们匹配的程度也就是“注意力分数”。然后根据“注意力分数”对所有值进行加权平均在注意力层中每个位置的查询Q序列都提供一个查询向量而上下文序列则充当了一个字典每个位置提供一个键和值向量在使用这些向量之前注意力层会用一个全连接层对输入向量进行投影。交叉注意力层在 Transformer 中交叉注意力层位于字面上的中心位置它连接了编码器和解码器是在模型中使用注意力最直接的方式。要实现这一点需要将目标序列作为查询将上下文序列作为键/值传递。Q 解码器中因果注意力层的输出向量K 编码器输出的注意力向量V 编码器输出的注意力向量如下所示每一列代表了对上下文序列的加权求和。为了简化起见没有显示残差连接。全局自注意力层全局自注意力层是Transformer编码器的一部分它的作用是负责处理整个输入序列。它允许每个序列元素直接访问其他所有序列元素只需将整个输入序列作为 QKV即可所有输出可以并行计算。Q 输入序列中的当前位置词向量K 输入序列中的所有位置词向量V 输入序列中的所有位置词向量因果注意力层因果注意力层对解码器中输出序列执行类似于全局自注意力层的工作但与编码器的全局自注意力层有不同的处理方式。Transformer 是一个“自回归”模型它逐个标记地生成文本并将输出反馈到输入中为了使这个过程高效这些模型确保每个序列元素的输出只依赖于前面的序列元素这些模型是“因果”的。要构建一个因果自注意力层在计算注意力分数和求和注意力值时需要使用适当的掩码因为输出序列也是一次性输入的但在计算前面分词的时候是不希望它后面的分词也参与计算的。Q 输出序列中的当前位置词向量K 输出序列中的所有位置词向量V 输出序列中的所有位置词向量03位置编码与RNNLSTM等按顺序逐个接收输入分词计算天然就带有位置信息不同Transformer是一次性处理所有输入分词虽然这使得 Transformer更快但是会丢失与分词顺序相关的信息然而位置信息对于大多数信息处理是至关重要的比如“我爱你”和“你爱我”是完全不一样的语义为了解决这个问题需要把位置编码加入输入序列使得最终的注意力向量是包含位置信息的。位置编码可以通过多种方式实现包括使用学习分词在Bert中使用正弦函数或相对位置我们将重点介绍正弦定位编码这也是Vaswani等人在原始论文中采用的方法。正弦定位编码是一个将Token的位置映射到大小为d的向量的函数其中d是输入和输出向量的维度。其中pos表示token所在的位置而i代表向量的维数正弦位置编码对每一个维度使用不同频率这样就为每一个位置创造了一个既独特又有规律的模式与学习得到的嵌入方式相比正弦位置编码有几个明显的优点它是固定的、可以泛化到未见过的数据、以及易于扩展。位置编码应与输入序列应有相同的维度以便两个向量可以相加本质上是将位置信息注入到输入嵌入表示中04多头注意力机制多头注意力机制是在注意力机制基础上的一个创新它让模型能同时关注输入和输出序列的多个不同特征或维度简单来说它通过把查询Q键K值V这三个矩阵分成好几个小块每一块称为一个“头”每个“头”都会独立进行自注意力运算然后把所有“头”的结果拼接在一起再进行一次特定的变换得到最终的输出。数学表示如下与传统的单头自注意力相比多头注意力有几大优点比如它能辨识出分词之间的各种关系无论是主谓、动宾还是名形关系同时多头注意力还能提升模型的能力和表现力因为模型能从序列的多种表现形式中同时学习此外多头注意力还能让模型在运算时更高效、更便于并行处理因为它将每个头的维度降低了从而可以同时处理多个头。另外Transformer还可以叠加多个层进一步提升模型的能力和表现力。05总结我们介绍了Transformer中的三种不同的注意力层以及注意力的实现方法位置编码和多头注意力机制涵盖了大部分注意力相关的知识点希望朋友们对它有了近一步的了解。Transformer利用注意力机制做出了更好的预测从ChatGPT的成功已经得到了验证尽管循环神经网络RNN也试图实现类似的功能但由于它们受到短期记忆的限制因此在处理长序列时特别是在编码或生成长序列时Transformer更为出色由于Transformer架构自然语言处理NLP行业取得了前所未有的成果。最后的最后感谢你们的阅读和喜欢我收藏了很多技术干货可以共享给喜欢我文章的朋友们如果你肯花时间沉下心去学习它们一定能帮到你。因为这个行业不同于其他行业知识体系实在是过于庞大知识更新也非常快。作为一个普通人无法全部学完所以我们在提升技术的时候首先需要明确一个目标然后制定好完整的计划同时找到好的学习方法这样才能更快的提升自己。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】大模型知识脑图为了成为更好的 AI大模型 开发者这里为大家提供了总的路线图。它的用处就在于你可以按照上面的知识点去找对应的学习资源保证自己学得较为全面。经典书籍阅读阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。实战案例光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。面试资料我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下640套AI大模型报告合集这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻

2026/8/27 13:32:43

自来水漏损率高怎么办?智慧供水监管怎么做?

家里的水表走得比想象快,小区管网年年修、年年漏,供水企业产销差居高不下……漏水这件事,普通用户看到的是水费,水务管理者看到的却是效率与安全的双重压力。近年来,很多城市都在推进智慧供水建设,把DMA分区…

2026/8/27 13:27:43

低成本搭建医疗管理系统,低代码平台成企业首选

上个月,我一个开诊所的朋友跟我抱怨,说想上一套管理系统,结果问了一圈,动辄几十万起步,还得等上大半年。他那小本经营,哪扛得住这个?其实不只是他,很多医疗相关企业都有这个痛点。买…

2026/8/27 13:27:43

政企转型必备,程序员力荐的低代码管理平台选型指南

兄弟们,最近是不是被各种“数字化转型”搞得头大?尤其咱们搞技术的,在政企项目里,最怕听到“需求又变了”、“这个月底能上线吗”。传统开发模式,业务部门等不起,咱们开发兄弟也熬不起。我去年就经历过一个…

2026/8/27 14:07:49

AI模型训练到底在训练什么?看完这篇你就知道了!!

一、前言 AI 模型训练是指通过数据驱动的方式,让人工智能(AI)系统从经验中学习,以便在给定的任务上进行预测、分类或生成等操作。这个过程通过优化模型的参数(如神经网络的权重和偏置)来最小化预测误差或损…

2026/8/27 14:07:49

【AI大模型部署】保姆级教程:从零开始部署Ollma和Qwen大模型

前言 我们平时使用的ChatGPT、kimi、豆包等Ai对话工具,其服务器都是部署在各家公司的机房里,如果我们有一些隐私数据发到对话中,很难保证信息是否安全等问题,如何在保证数据安全的情况下,又可以使用大语言模型&#xf…

2026/8/27 14:07:49

【AI大模型】Agent规划大揭秘!这才是真正的planning

planning agent 的核心是负责解决用户所提出的任务。这个任务由目标和约束条件定义。 例如,一个任务是安排一次从上海到北京为期两周的旅行,预算为 5000。 目标是为期两周的旅行,约束条件是预算。 复杂的任务需要规划。规划过程的输出是一个计…

2026/8/27 14:07:49

免安装LabelImg工具:VOC/YOLO数据标注与数据集构建实战指南

简介:在计算机视觉项目中,数据标注是模型训练前的关键环节,其核心在于将原始图像中的目标物体通过边界框等形式进行定位与分类,形成结构化标注数据。这一过程的原理涉及将视觉信息转化为机器可读的坐标与类别标签,其技…

2026/8/27 14:02:49

RAG技术全面解析:解决大模型幻觉、知识滞后与私有知识难题!

RAG (Retrieval-Augmented Generation,检索增强生成)是目前大模型(LLM)落地应用中最核心、最热门的技术方案之一。简单来说,RAG 就是给大模型配上了一个“外部知识库”或“搜索引擎”。 接下来我会从我们“为什么需要它”、“它是…

2026/8/26 9:13:28

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/27 10:58:22

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/27 7:46:21

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/27 0:01:16

Go语言构建企业级AI服务网关:统一管理英伟达等AI接口调用

1. 项目概述:从零构建一个企业级的AI服务网关 最近在帮一个做内容审核的团队做技术架构升级,他们原来的业务里,每天有几十万张图片和短视频需要过审,最初是接了几个开源的AI模型自己部署,但效果和性能一直不太稳定。后…

2026/8/27 0:01:16

LeetCode Hot100(51-60)算法精解与面试技巧

1. 题目背景与核心价值"hot100(51-60)"这个标题看起来像是某个编程题库或算法练习集中的一组题目编号。在技术社区中,类似命名通常指向LeetCode、牛客网等平台的热门题目集合。作为刷过300题的算法老手,我理解这类题目的核心价值在于&#xff…

2026/8/27 0:01:16

CRC校验实战:从模2除法到HJ212协议排错

1. 为什么一个“校验码”能扛住工业现场90%的数据 corruption? 你有没有遇到过这样的场景:嵌入式设备通过RS-485上传温湿度数据,上位机偶尔收到一帧乱码——温度显示成-273℃,湿度跳到999%,但串口波形看起来完全正常&a…

2026/8/26 19:34:06

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/26 19:17:08

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/26 19:34:05

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…