单卡跑Llama 70B快过双卡，微软硬生生把FP6搞到了A100里 | 开源

PHPz

发布时间：2024-04-29 16:55:12

1385人浏览过

来源于51CTO.COM

转载

fp8和更低的浮点数量化精度，不再是h100的“专利”了！

老黄想让大家用INT8/INT4，微软DeepSpeed团队在没有英伟达官方支持的条件下，硬生生在A100上跑起FP6。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

测试结果表明，新方法TC-FPx在A100上的FP6量化，速度接近甚至偶尔超过INT4，而且拥有比后者更高的精度。

在此基础之上，还有端到端的大模型支持，目前已经开源并集成到了DeepSpeed等深度学习推理框架中。

这一成果对大模型的加速效果也是立竿见影——在这种框架下用单卡跑Llama，吞吐量比双卡还要高2.65倍。

一名机器学习研究人员看了后表示，微软的这项研究简直可以用crazy来形容。

单卡跑Llama 70B快过双卡，微软硬生生把FP6搞到了A100里 | 开源

表情包也第一时间上线，be like：

英伟达：只有H100支持FP8。

微软：Fine，我自己搞定。

单卡跑Llama 70B快过双卡，微软硬生生把FP6搞到了A100里 | 开源

那么，这个框架到底能实现什么样的效果，背后又采用了什么样的技术呢？

用FP6跑Llama，单卡比双卡还快

在A100上使用FP6精度，带来的是内核级的性能提升。

研究人员选取了不同大小的Llama模型和OPT模型之中的线性层，在NVIDIA A100-40GB GPU平台上，使用CUDA 11.8进行了测试。

结果相比于英伟达官方的cuBLAS（W16A16）和TensorRT-LLM（W8A16），TC-FPx（W6A16）速度提升的最大值分别是2.6倍和1.9倍。

相比于4bit的BitsandBytes（W4A16）方法，TC-FPx的最大速度提升则是达到了8.9倍。

（W和A分别代表权重量化位宽和激活量化位宽）

单卡跑Llama 70B快过双卡，微软硬生生把FP6搞到了A100里 | 开源

△归一化数据，以cuBLAS结果为1

同时，TC-FPx内核还减少了对DRAM内存的访问，并提高了DRAM带宽利用率和Tensor Cores利用率，以及ALU和FMA单元的利用率。

单卡跑Llama 70B快过双卡，微软硬生生把FP6搞到了A100里 | 开源

在TC-FPx基础之上设计的端到端推理框架FP6-LLM，也给大模型带来了显著的性能提高。

以Llama-70B为例，用FP6-LLM在单卡上的运行吞吐量，比FP16在双卡上还要高出2.65倍，在16以下的批大小中的延迟也低于FP16。

单卡跑Llama 70B快过双卡，微软硬生生把FP6搞到了A100里 | 开源

而对于参数量小一些的模型OPT-30B（FP16也使用单卡），FP6-LLM同样带来了明显的吞吐量提升和延迟降低。

而且单卡FP16在这种条件下最多支持的批大小只有4，FP6-LLM却可以在批大小为16的情况下正常运行。

Cutout.Pro

AI驱动的视觉设计平台

下载

单卡跑Llama 70B快过双卡，微软硬生生把FP6搞到了A100里 | 开源

那么，微软团队是怎样实现在A100上运行FP16量化的呢？

重新设计内核方案

为了实现对包括6bit在内精度的支持，TC-FPx团队设计了一个统一的内核方案，可以支持不同位宽的量化权重。

相比于传统的双内核方法，TC-FPx通过将去量化和矩阵乘法融合在单个内核中，减少了内存访问次数，提高了性能。

实现低精度量化的核心奥义则是通过去量化方式，将FP6精度的数据“伪装”成FP16，然后按照FP16的格式交给GPU进行运算。

单卡跑Llama 70B快过双卡，微软硬生生把FP6搞到了A100里 | 开源

同时团队还利用了位级预打包技术，解决GPU内存系统对非2的幂次位宽（如6-bit）不友好的问题。

具体来说，位级预打包是在模型推理之前对权重数据进行重新组织，包括将6-bit量化的权重重新排列，以便它们能够以GPU内存系统友好的方式进行访问。

此外，由于GPU内存系统通常以32位或64位的块进行数据访问，位级预打包技术将还会6-bit权重打包，使得它们能够以这些对齐的块的形式存储和访问。

单卡跑Llama 70B快过双卡，微软硬生生把FP6搞到了A100里 | 开源

预打包完成后，研究团队使用SIMT核心的并行处理能力，对寄存器中的FP6权重执行并行去量化，生成FP16格式的权重。

去量化后的FP16权重在寄存器中被重构，然后送入Tensor Core，使用重构后的FP16权重执行矩阵乘法运算，完成线性层的计算。

在此过程中，团队利用了SMIT核心的位级并行性，提高了整个去量化过程的效率。

单卡跑Llama 70B快过双卡，微软硬生生把FP6搞到了A100里 | 开源

而为了权重重构任务能够并行运行，团队还使用了一种并行权重拼接技术。

具体来说，每个权重被分割成几个部分，每个部分的位宽是2的幂次（如把6分割成2+4或4+2）。

在去量化之前，权重首先从共享内存加载到寄存器中。由于每个权重被分割成多个部分，需要在运行时在寄存器级别重构完整的权重。

为了减少运行时的开销，TC-FPx提出了一种并行提取和拼接权重的方法。这种方法使用两组寄存器来存储32个FP6权重的片段，并行地重构这些权重。

同时，为了并行提取和拼接权重，需要确保初始数据布局满足特定的顺序要求，因此TC-FPx通过在运行前对权重片段进行重排。

单卡跑Llama 70B快过双卡，微软硬生生把FP6搞到了A100里 | 开源

此外，TC-FPx还设计了一个软件流水线，将去量化步骤与Tensor Core的矩阵乘法操作融合在一起，通过指令级并行性提高了整体的执行效率。

单卡跑Llama 70B快过双卡，微软硬生生把FP6搞到了A100里 | 开源

论文地址：https://arxiv.org/abs/2401.14112

Perplexity免费版和Pro版区别_Perplexity付费订阅价值分析教程【对比】

OpenClaw启动时卡在加载界面怎么办_OpenClaw加载卡死常见原因与对策【教程】

OpenClaw最新版与旧版有什么区别_OpenClaw主要版本功能差异对比【汇总】

Perplexity Chrome插件怎么用_Perplexity浏览器扩展一键搜索教程【指南】

WorkBuddy技能包有哪些类型_常见Skills技能包分类与用途介绍

相关专题

http与https有哪些区别

http与https的区别：1、协议安全性；2、连接方式；3、证书管理；4、连接状态；5、端口号；6、资源消耗；7、兼容性。本专题为大家提供相关的文章、下载、课程内容，供大家免费下载体验。

2927

2024.08.16

TypeScript类型系统进阶与大型前端项目实践

本专题围绕 TypeScript 在大型前端项目中的应用展开，深入讲解类型系统设计与工程化开发方法。内容包括泛型与高级类型、类型推断机制、声明文件编写、模块化结构设计以及代码规范管理。通过真实项目案例分析，帮助开发者构建类型安全、结构清晰、易维护的前端工程体系，提高团队协作效率与代码质量。

2026.03.13

Python异步编程与Asyncio高并发应用实践

本专题围绕 Python 异步编程模型展开，深入讲解 Asyncio 框架的核心原理与应用实践。内容包括事件循环机制、协程任务调度、异步 IO 处理以及并发任务管理策略。通过构建高并发网络请求与异步数据处理案例，帮助开发者掌握 Python 在高并发场景中的高效开发方法，并提升系统资源利用率与整体运行性能。

2026.03.12

C# ASP.NET Core微服务架构与API网关实践

本专题围绕 C# 在现代后端架构中的微服务实践展开，系统讲解基于 ASP.NET Core 构建可扩展服务体系的核心方法。内容涵盖服务拆分策略、RESTful API 设计、服务间通信、API 网关统一入口管理以及服务治理机制。通过真实项目案例，帮助开发者掌握构建高可用微服务系统的关键技术，提高系统的可扩展性与维护效率。

273

2026.03.11

Go高并发任务调度与Goroutine池化实践

本专题围绕 Go 语言在高并发任务处理场景中的实践展开，系统讲解 Goroutine 调度模型、Channel 通信机制以及并发控制策略。内容包括任务队列设计、Goroutine 池化管理、资源限制控制以及并发任务的性能优化方法。通过实际案例演示，帮助开发者构建稳定高效的 Go 并发任务处理系统，提高系统在高负载环境下的处理能力与稳定性。

2026.03.10

Kotlin Android模块化架构与组件化开发实践

本专题围绕 Kotlin 在 Android 应用开发中的架构实践展开，重点讲解模块化设计与组件化开发的实现思路。内容包括项目模块拆分策略、公共组件封装、依赖管理优化、路由通信机制以及大型项目的工程化管理方法。通过真实项目案例分析，帮助开发者构建结构清晰、易扩展且维护成本低的 Android 应用架构体系，提升团队协作效率与项目迭代速度。

2026.03.09

JavaScript浏览器渲染机制与前端性能优化实践

本专题围绕 JavaScript 在浏览器中的执行与渲染机制展开，系统讲解 DOM 构建、CSSOM 解析、重排与重绘原理，以及关键渲染路径优化方法。内容涵盖事件循环机制、异步任务调度、资源加载优化、代码拆分与懒加载等性能优化策略。通过真实前端项目案例，帮助开发者理解浏览器底层工作原理，并掌握提升网页加载速度与交互体验的实用技巧。

105

2026.03.06

Rust内存安全机制与所有权模型深度实践

本专题围绕 Rust 语言核心特性展开，深入讲解所有权机制、借用规则、生命周期管理以及智能指针等关键概念。通过系统级开发案例，分析内存安全保障原理与零成本抽象优势，并结合并发场景讲解 Send 与 Sync 特性实现机制。帮助开发者真正理解 Rust 的设计哲学，掌握在高性能与安全性并重场景中的工程实践能力。

230

2026.03.05

PHP高性能API设计与Laravel服务架构实践

本专题围绕 PHP 在现代 Web 后端开发中的高性能实践展开，重点讲解基于 Laravel 框架构建可扩展 API 服务的核心方法。内容涵盖路由与中间件机制、服务容器与依赖注入、接口版本管理、缓存策略设计以及队列异步处理方案。同时结合高并发场景，深入分析性能瓶颈定位与优化思路，帮助开发者构建稳定、高效、易维护的 PHP 后端服务体系。

618

2026.03.04

热门下载

网站特效

网站源码

网站素材

前端模板