0

0

阶跃公开了自家新型注意力机制:KV缓存消耗直降93.7%,性能不减反增

心靈之曲

心靈之曲

发布时间:2025-01-17 14:48:30

|

1123人浏览过

|

来源于php中文网

原创

aixiv专栏长期致力于分享学术和技术前沿内容,已发表2000余篇来自全球顶尖高校和企业实验室的文章,为学术交流和传播做出了重要贡献。欢迎各位专家学者投稿或联系报道,投稿邮箱:liyazhou@jiqizhixin.com;zhaoyunfeng@jiqizhixin.com

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

图片

大语言模型的广泛应用带来了大规模推理的巨大挑战。传统注意力机制中的键值缓存(KV Cache)随着批处理大小和序列长度线性增长,成为限制大模型规模化应用和推理效率的瓶颈。

虽然MQA、GQA、MLA等改进方案已出现,但它们或难以在严格的显存限制下保持性能,或引入额外的复杂度,造成工程难题和兼容性问题。

阶跃星辰、清华大学等机构近期发表的论文《Multi-matrix Factorization Attention》提出了一种新型注意力机制——多矩阵分解注意力(MFA)及其变体MFA-Key-Reuse(MFA-KR)。该方法在显著降低推理成本的同时,提升了模型性能。

图片

论文链接:https://www.php.cn/link/aac8f7d518e4300ab8031d6709164f1d

实验表明,MFA和MFA-KR不仅性能超越MLA,而且在KV Cache使用量减少高达93.7%的情况下,性能与传统MHA相当。MFA易于实现和复现,对超参数不敏感,并兼容各种位置编码。

图片

图片

MFA方法及分析

研究团队通过对注意力机制的容量分析,确定了影响其容量的关键维度,并提出了一系列分析方法和设计原则。

图片

研究团队提出了广义多头注意力(GMHA)框架,统一理解不同MHA变体。他们从推理角度研究键值的计算和存储,从分解角度探讨模型容量特征,为理解不同策略的权衡提供了新视角。

研究团队将完全参数化双线性注意力(FPBA)作为理论性能上限,发现现有MHA及其变体都是FPBA的低秩分解版本。他们分析了MQA和MLA两种代表性改进方案:MQA采用激进的参数共享策略,降低内存使用但可能影响表达能力;MLA引入共享潜在空间,但表达能力受限于最小维度。

Magic Eraser
Magic Eraser

AI移除图片中不想要的物体

下载

基于以上分析,研究团队提出了MFA,旨在最大限度地节省资源并接近理论性能上限。MFA的三个关键创新:突破传统设计限制,增加注意力头的数量和维度;采用创新的低秩分解策略,提高参数效率;采用单键值头设计,降低内存使用。

图片

为了对比MFA和其他注意力机制,研究团队引入了两个关键指标:模型总有效秩TER和共享隐空间维度SLSD。TER越高,模型容量越高;SLSD代表所有注意力头共同使用的隐空间维度。KV Cache占用受制于FRH和SLSD中的较大值。

分析表明,MFA在参数预算下比MQA拥有更高的SLSD和TER;比MLA拥有更小的KV Cache尺寸和更高的TER,同时保持相当的SLSD;比MHA拥有更高的TER,解释了其性能优势。

实验结果

研究团队进行了大规模扩展性实验(1B到7B参数,10B到1T训练数据),MFA展现出与传统MHA相当的扩展能力。MFA和MFA-KR在内存节省方面优势显著,最大规模模型上分别实现87.5%和6.25%的内存节省。

图片

消融实验验证了MFA和MFA-KR设计的有效性,并在其他主流位置编码上也验证了其性能优势。

图片

图片

展望

MFA以简洁的设计解决了LLM高效推理的显存瓶颈问题,并能无缝集成到现有Transformer生态中。这项创新将加速大语言模型的应用。

相关文章

数码产品性能查询
数码产品性能查询

该软件包括了市面上所有手机CPU,手机跑分情况,电脑CPU,电脑产品信息等等,方便需要大家查阅数码产品最新情况,了解产品特性,能够进行对比选择最具性价比的商品。

下载

相关标签:

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
http与https有哪些区别
http与https有哪些区别

http与https的区别:1、协议安全性;2、连接方式;3、证书管理;4、连接状态;5、端口号;6、资源消耗;7、兼容性。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

1994

2024.08.16

PS使用蒙版相关教程
PS使用蒙版相关教程

本专题整合了ps使用蒙版相关教程,阅读专题下面的文章了解更多详细内容。

23

2026.01.19

java用途介绍
java用途介绍

本专题整合了java用途功能相关介绍,阅读专题下面的文章了解更多详细内容。

15

2026.01.19

java输出数组相关教程
java输出数组相关教程

本专题整合了java输出数组相关教程,阅读专题下面的文章了解更多详细内容。

4

2026.01.19

java接口相关教程
java接口相关教程

本专题整合了java接口相关内容,阅读专题下面的文章了解更多详细内容。

2

2026.01.19

xml格式相关教程
xml格式相关教程

本专题整合了xml格式相关教程汇总,阅读专题下面的文章了解更多详细内容。

4

2026.01.19

PHP WebSocket 实时通信开发
PHP WebSocket 实时通信开发

本专题系统讲解 PHP 在实时通信与长连接场景中的应用实践,涵盖 WebSocket 协议原理、服务端连接管理、消息推送机制、心跳检测、断线重连以及与前端的实时交互实现。通过聊天系统、实时通知等案例,帮助开发者掌握 使用 PHP 构建实时通信与推送服务的完整开发流程,适用于即时消息与高互动性应用场景。

13

2026.01.19

微信聊天记录删除恢复导出教程汇总
微信聊天记录删除恢复导出教程汇总

本专题整合了微信聊天记录相关教程大全,阅读专题下面的文章了解更多详细内容。

93

2026.01.18

高德地图升级方法汇总
高德地图升级方法汇总

本专题整合了高德地图升级相关教程,阅读专题下面的文章了解更多详细内容。

112

2026.01.16

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
最新Python教程 从入门到精通
最新Python教程 从入门到精通

共4课时 | 5.6万人学习

Node.js 教程
Node.js 教程

共57课时 | 8.9万人学习

CSS3 教程
CSS3 教程

共18课时 | 4.7万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号