Llama 3低比特量化性能下降显著！全面评估结果来了 | 港大&北航Ð

WBOY

发布时间：2024-04-28 09:01:12

923人浏览过

来源于51CTO.COM

转载

大模型力大砖飞，让llama3演绎出了新高度：

经过超大规模预训练的15T+ Token数据上，已实现了令人印象深刻的性能提升，也因远超Chinchilla推荐量再次引爆开源社区讨论。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

与此同时，在实际应用层面上，另一个热点话题也浮出水面：

资源有限场景下，LLaMA3的量化表现又会如何？

香港大学、北京航空航天大学、苏黎世联合邦理工学院联合推出了一项实证研究，全面揭示了LLaMA3的低比特量化能力。

Llama 3低比特量化性能下降显著！全面评估结果来了 | 港大&北航Ð

研究人员使用现有的10种训练后量化的LoRA微调方法，评估了LLaMA3与1-8比特和各种评估数据集上的结果。他们发现：

尽管性能令人印象深刻，LLaMA3在低比特量化下仍然遭受了不可忽视的退化，特别是在超低位宽上。

Llama 3低比特量化性能下降显著！全面评估结果来了 | 港大&北航Ð

项目已在GitHub上开源，量化模型也已登陆HuggingFace。

具体来看实证结果。

轨道1：训练后量化

表1和表2中分别提供了LLaMA3-8B和LLaMA3-70B在8种不同的PTQ方法下的低比特性能表现，覆盖了从1比特到8比特的广泛比特宽度。

1.低比特权重

其中，Round-To-Nearest (RTN) 是一种基本的舍入量化方法。

GPTQ是当前最有效率和有效的仅限权重的量化方法之一，它利用量化中的误差补偿。但在2-3比特下，当量化LLaMA3时，GPTQ会导致严重的准确性崩溃。

AWQ采用异常通道抑制方法来降低权重量化的难度，而QuIP通过优化矩阵计算来确保权重和Hessian之间的不一致性。它们都能保持LLaMA3在3比特时的能力，甚至将2比特量化推向有希望的水平。

2.超低比特权重

最近出现的二值化LLM量化方法实现了超低比特宽度LLM权重压缩。

PB-LLM采用混合精度量化策略，保留一小部分重要权重的全精度，同时将大部分权重量化为1比特。

零沫AI工具导航

零沫AI工具导航-AI导航新标杆,探索全球实用AI工具

下载

DB-LLM通过双重二值化权重分割实现高效的LLM压缩，并提出偏差感知蒸馏策略以进一步增强2比特LLM性能。

BiLLM通过显著权重的残差逼近和非显著权重的分组量化，进一步将LLM量化边界推低至1.1比特。这些为超低比特宽度专门设计的LLM量化方法可以实现更高精度的量化LLaMA3-8B，在⩽2比特时远远超过如GPTQ、AWQ和QuIP等方法，在2比特（甚至在某些情况下3比特）下的表现。

3.低比特量化激活

还通过SmoothQuant对量化激活进行了LLaMA3评估，SmoothQuant将量化难度从激活转移到权重，以平滑激活异常值。评估显示，SmoothQuant可以在8比特和6比特的权重和激活下保留LLaMA3的准确性，但在4比特时面临崩溃。

Llama 3低比特量化性能下降显著！全面评估结果来了 | 港大&北航Ð

轨道2：LoRA微调量化

在MMLU数据集上，对于LoRA-FT量化下的LLaMA3-8B，最显著的观察是，在Alpaca数据集上低秩微调不仅不能补偿量化引入的错误，甚至使性能下降更加严重。

具体来说，各种LoRA-FT量化方法在4比特下获得的量化LLaMA3性能，比没有使用LoRA-FT的4比特对应版本要差。这与LLaMA1和LLaMA2上的类似现象形成鲜明对比，在LLAMA1和LLAMA2中，4比特低秩微调量化版本甚至能轻松超过MMLU上的原始FP16对应版本。

根据直观分析，这一现象的主要原因是由于LLaMA3强大的性能得益于其大规模的预训练，这意味着原始模型量化后的性能损失不能通过在一小部分低秩参数数据上进行微调来补偿（这可以被视为原始模型的一个子集）。

尽管量化导致的显著下降不能通过微调来补偿，但4比特LoRA-FT量化的LLaMA3-8B在各种量化方法下显著优于LLaMA1-7B和LLaMA2-7B。例如，使用QLoRA方法，4比特LLaMA3-8B的平均准确率为57.0（FP16: 64.8），超过4比特LLaMA1-7B的38.4（FP16: 34.6）18.6，超过4比特LLaMA2-7B的43.9（FP16: 45.5）13.1。这表明在LLaMA3时代需要一种新的LoRA-FT量化范式。

在CommonSenseQA基准测试中也出现了类似的现象。与没有使用LoRA-FT的4比特对应版本相比，使用QLoRA和IR-QLoRA微调的模型性能也有所下降（例如，QLoRA平均下降2.8% vs IR-QLoRA平均下降2.4%）。这进一步展示了在LLaMA3中使用高质量数据集的优势，而且通用数据集Alpaca并没有对模型在其他任务中的性能作出贡献。

结论

这篇论文全面评估了LLaMA3在各种低比特量化技术（包括训练后量化和LoRA微调量化）中的性能。

此研究发现表明，尽管LLaMA3在量化后仍然展现出优越的性能，但与量化相关的性能下降是显著的，甚至在许多情况下可以导致更大的下降。

这一发现突显了在资源受限环境中部署LLaMA3可能面临的潜在挑战，并强调了在低比特量化背景下增长和改进的充足空间。通过解决低比特量化引起的性能下降，预期后续的量化范式将使LLMs在较低的计算成本下实现更强的能力，最终推动代表性的生成式人工智能达到新的高度。

论文链接：https://arxiv.org/abs/2404.14047。

项目链接：https://github.com/Macaronlin/LLaMA3-Quantizationhttps://huggingface.co/LLMQ。

怎么用ai生成图片_ai人工智能生成图片的操作方法【详解】

人工智能如何评估模型准确率_人工智能计算PrecisionRecall指标教程

人工智能怎么加载预训练BERT_人工智能调用BERT做文本分类教程

人工智能怎么实现GAN图像生成_人工智能使用DCGAN生成新图片步骤

CHAT人工智能免费入口 ChatGPT官网免费在线使用入口

数码产品性能查询

该软件包括了市面上所有手机CPU，手机跑分情况，电脑CPU，电脑产品信息等等，方便需要大家查阅数码产品最新情况，了解产品特性，能够进行对比选择最具性价比的商品。

下载

相关专题

登录token无效

登录token无效解决方法：1、检查token的有效期限，如果token已经过期，需要重新获取一个新的token；2、检查token的签名，如果签名不正确，需要重新获取一个新的token；3、检查密钥的正确性，如果密钥不正确，需要重新获取一个新的token；4、使用HTTPS协议传输token，建议使用HTTPS协议进行传输；5、使用双因素认证，双因素认证可以提高账户的安全性。

6629

2023.09.14

登录token无效怎么办

登录token无效的解决办法有检查Token是否过期、检查Token是否正确、检查Token是否被篡改、检查Token是否与用户匹配、清除缓存或Cookie、检查网络连接和服务器状态、重新登录或请求新的Token、联系技术支持或开发人员等。本专题为大家提供token相关的文章、下载、课程内容，供大家免费下载体验。

843

2023.09.14

token怎么获取

获取token值的方法：1、小程序调用“wx.login()”获取临时登录凭证code，并回传到开发者服务器；2、开发者服务器以code换取，用户唯一标识openid和会话密钥“session_key”。想了解更详细的内容，可以阅读本专题下面的文章。

1092

2023.12.21

token什么意思

token是一种用于表示用户权限、记录交易信息、支付虚拟货币的数字货币。可以用来在特定的网络上进行交易，用来购买或出售特定的虚拟货币，也可以用来支付特定的服务费用。想了解更多token什么意思的相关内容可以访问本专题下面的文章。

2190

2024.03.01

github中文官网入口 github中文版官网网页进入

github中文官网入口https://docs.github.com/zh/get-started，GitHub 是一种基于云的平台，可在其中存储、共享并与他人一起编写代码。通过将代码存储在GitHub 上的“存储库”中，你可以： “展示或共享”你的工作。持续“跟踪和管理”对代码的更改。

4237

2026.01.21

http与https有哪些区别

http与https的区别：1、协议安全性；2、连接方式；3、证书管理；4、连接状态；5、端口号；6、资源消耗；7、兼容性。本专题为大家提供相关的文章、下载、课程内容，供大家免费下载体验。

2915

2024.08.16

Python异步编程与Asyncio高并发应用实践

本专题围绕 Python 异步编程模型展开，深入讲解 Asyncio 框架的核心原理与应用实践。内容包括事件循环机制、协程任务调度、异步 IO 处理以及并发任务管理策略。通过构建高并发网络请求与异步数据处理案例，帮助开发者掌握 Python 在高并发场景中的高效开发方法，并提升系统资源利用率与整体运行性能。

2026.03.12

C# ASP.NET Core微服务架构与API网关实践

本专题围绕 C# 在现代后端架构中的微服务实践展开，系统讲解基于 ASP.NET Core 构建可扩展服务体系的核心方法。内容涵盖服务拆分策略、RESTful API 设计、服务间通信、API 网关统一入口管理以及服务治理机制。通过真实项目案例，帮助开发者掌握构建高可用微服务系统的关键技术，提高系统的可扩展性与维护效率。

136

2026.03.11

Go高并发任务调度与Goroutine池化实践

本专题围绕 Go 语言在高并发任务处理场景中的实践展开，系统讲解 Goroutine 调度模型、Channel 通信机制以及并发控制策略。内容包括任务队列设计、Goroutine 池化管理、资源限制控制以及并发任务的性能优化方法。通过实际案例演示，帮助开发者构建稳定高效的 Go 并发任务处理系统，提高系统在高负载环境下的处理能力与稳定性。

2026.03.10

热门下载

网站特效

网站源码

网站素材

前端模板