0

0

AI大牛李沐装机视频来了!你也能练100亿的大模型

WBOY

WBOY

发布时间:2023-04-11 23:40:23

|

1576人浏览过

|

来源于51CTO.COM

转载

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

图片

在还没出装机视频前,李沐老师曾发起了一个小小的问卷调查,趁着显卡降价,看下童鞋们对装机跑Transformer有多大兴趣。

当时,就连华为天才少年「稚晖君」都来点赞了,足见大家还是很期待的。

图片

这不,沐神带着他的装机视频来了。怎样用最低的成本训练一个100亿模型?

而就在最近,币圈也在一直降温,同时GPU也明显降价了不少,就比如英伟达3090TI现在售价1600美元(原价2000美元)。

图片

在这个项目的开始,先装了2台原型机,每台机器都是双卡RTX 3090TI,采用了水冷散热系统,减少了噪音。

一台机器装下来,造价有5000多美元,大约3万5人民币。

话不多说,来看看沐神如何装机的吧~

装机清单

装机的需求,首先就要是足够安静。不然太吵的话没法工作。

第二个需求就是散热要好。不然温度过高的话会导致GPU降频。

第三个,重点来了,因为需要跑比较大的Transformer模型,所以GPU的带宽必须足够好。

如果之前装过GPU服务器用来跑CNN的话,跟跑Transformer模型的需求会不太一样。因为Transformer模型比CNN模型要更大,对内存的占有率会更高。所以GPU的内存大小非常重要。

图片

之前沐神也讲过,要把这样大的Transformer模型放到多个GPU上训练,来自谷歌、微软等的工程师都是使用类似DGA X100这样的机器来跑的。即使在这样的机器上,GPU的带宽仍然是一个瓶颈。

购买这种服务器GPU和游戏GPU的区别就在于,前者不在于单卡能跑多快,而是卡与卡之间能够多快地连接出来。

因此装机理念的重点就是:尽量增大GPU内存,以及GPU之间互联的一个带宽,

如果一台机器想放很多卡的话,就要买涡轮的散热。

如果想要安静的话,就买水冷的散热,沐神买的是4块3090 TI。用水冷的好处是比较安静,坏处就是特别占地方。

所以,如果要在机箱放四块卡的话,就不要买水冷的版本,而是要买只有一个涡轮风扇的版本。

而且机箱里风的流向是一个特别重要的问题。如果买带3个风扇的卡,风是从正面进入机箱,然后从四面八方散热,卡挨得紧的话,机箱里的温度就会非常高。

沐神也说,自己在多年前,买了四块2个大风扇的卡放在一起,结果就导致一块卡温度过高烧掉了。

GPU选好以后(华硕的ROG), 剩下的配置就比较简单。CPU用的是AMD的12核CPU,主板是号称PCIE 4.0 16的某牌子,硬盘是2 TB的M.2的硬盘,风扇是120毫米水冷风扇,加一个全尺寸机箱。

图片

装机步骤

装机清单完成后,接下来就是具体的装机过程了。步骤如下:

首先放GPU。注意,放的过程中一定不能用手碰金属的地方,如果有静电的话非常容易造成GPU导电。

图片

把GPU放进去之后,把螺丝拧上。然后把风扇装进去。

插上电源后,把电源线和水管线绑在一起。然后把NVLink的桥给连上去。

AI大牛李沐装机视频来了!你也能练100亿的大模型

最后连上电源,机器就可以运行了。

知识画家
知识画家

AI交互知识生成引擎,一句话生成知识视频、动画和应用

下载

图片

压力测试

在装机完成后,下一步的任务就是继续装上操作系统。

沐神装的是ubuntu22,装上之后就靠远程连上去了。

当然了,沐神也是把各种情况说的比较详细,除了ubuntu22以外,windows和linux在不同的需求下也是可以的。

这里沐神用的SSH进行的远程连接。

图片

沐神的系统已经装上了驱动,同时,他也指出如果还没有驱动的话,也可以用apt-get装上nvidia-driver-515。

图片

装好之后,就可以运行nvidia-smi,看到系统了。

图片

从中可以看到各项信息。比如GPU的数量、温度、瓦数、内存使用等等。

接下来还可以通过nvidia-smi的topo-m矩阵看到nv-link是否正常。

图片

可以看到两个GPU由NV4连接。4表示4个通道,这就代表连接是正常的。

下一题,是测试系统在满负荷的情况下的温度。

沐神表示,测试GPU的是一个叫gpu-burn的小程序,github上可以下载。

这里沐神模拟跑了十分钟,也是看到了两个GPU的温度。沐神还打趣说,都能感觉到GPU在呼呼吹热风。

同理,CPU也可以用这种办法测试温度,用的是cpu-burn。

最终两个GPU的温度停留在58度和55度,功耗拉到了440多瓦(满功耗480瓦),还挺好的。

最后的一项参数是机器的耗电情况。沐神的测试大概用了1241240瓦,意味着每小时用电1.5度。

图片

从目前的数据来看,稳定性还ok。

至于用这台机器跑Transformer性能怎么样,还得等下期视频了。

网友热评

视频发出后,b站的网友也表示出了极大的兴趣。

有满分课代表同学出没,列出了视频中提到的完整配置清单。图片

还有网友火速前来围观,「跟李沐学装机」。

图片


沐神自己表示,感觉3090ti的卡不是太行。马上有网友搭腔,「不行就抽了送人吧。」

图片

当然了,这种硬核装机视频下的评论肯定少不了幽默因素。

图片

只能说,太真实了。

热门AI工具

更多
DeepSeek
DeepSeek

幻方量化公司旗下的开源大模型平台

豆包大模型
豆包大模型

字节跳动自主研发的一系列大型语言模型

通义千问
通义千问

阿里巴巴推出的全能AI助手

腾讯元宝
腾讯元宝

腾讯混元平台推出的AI助手

文心一言
文心一言

文心一言是百度开发的AI聊天机器人,通过对话可以生成各种形式的内容。

讯飞写作
讯飞写作

基于讯飞星火大模型的AI写作工具,可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

即梦AI
即梦AI

一站式AI创作平台,免费AI图片和视频生成。

ChatGPT
ChatGPT

最最强大的AI聊天机器人程序,ChatGPT不单是聊天机器人,还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

相关专题

更多
github中文官网入口 github中文版官网网页进入
github中文官网入口 github中文版官网网页进入

github中文官网入口https://docs.github.com/zh/get-started,GitHub 是一种基于云的平台,可在其中存储、共享并与他人一起编写代码。 通过将代码存储在GitHub 上的“存储库”中,你可以: “展示或共享”你的工作。 持续“跟踪和管理”对代码的更改。

1029

2026.01.21

windows查看端口占用情况
windows查看端口占用情况

Windows端口可以认为是计算机与外界通讯交流的出入口。逻辑意义上的端口一般是指TCP/IP协议中的端口,端口号的范围从0到65535,比如用于浏览网页服务的80端口,用于FTP服务的21端口等等。怎么查看windows端口占用情况呢?php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

788

2023.07.26

查看端口占用情况windows
查看端口占用情况windows

端口占用是指与端口关联的软件占用端口而使得其他应用程序无法使用这些端口,端口占用问题是计算机系统编程领域的一个常见问题,端口占用的根本原因可能是操作系统的一些错误,服务器也可能会出现端口占用问题。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

1129

2023.07.27

windows照片无法显示
windows照片无法显示

当我们尝试打开一张图片时,可能会出现一个错误提示,提示说"Windows照片查看器无法显示此图片,因为计算机上的可用内存不足",本专题为大家提供windows照片无法显示相关的文章,帮助大家解决该问题。

804

2023.08.01

windows查看端口被占用的情况
windows查看端口被占用的情况

windows查看端口被占用的情况的方法:1、使用Windows自带的资源监视器;2、使用命令提示符查看端口信息;3、使用任务管理器查看占用端口的进程。本专题为大家提供windows查看端口被占用的情况的相关的文章、下载、课程内容,供大家免费下载体验。

454

2023.08.02

windows无法访问共享电脑
windows无法访问共享电脑

在现代社会中,共享电脑是办公室和家庭的重要组成部分。然而,有时我们可能会遇到Windows无法访问共享电脑的问题。这个问题可能会导致数据无法共享,影响工作和生活的正常进行。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

2355

2023.08.08

windows自动更新
windows自动更新

Windows操作系统的自动更新功能可以确保系统及时获取最新的补丁和安全更新,以提高系统的稳定性和安全性。然而,有时候我们可能希望暂时或永久地关闭Windows的自动更新功能。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

823

2023.08.10

windows boot manager
windows boot manager

windows boot manager无法开机的解决方法:1、系统文件损坏,使用Windows安装光盘或USB启动盘进入恢复环境,选择修复计算机,然后选择自动修复;2、引导顺序错误,进入恢复环境,选择命令提示符,输入命令"bootrec /fixboot"和"bootrec /fixmbr",然后重新启动计算机;3、硬件问题,使用硬盘检测工具进行扫描和修复;4、重装操作系统。本专题还提供其他解决

1646

2023.08.28

C++ 设计模式与软件架构
C++ 设计模式与软件架构

本专题深入讲解 C++ 中的常见设计模式与架构优化,包括单例模式、工厂模式、观察者模式、策略模式、命令模式等,结合实际案例展示如何在 C++ 项目中应用这些模式提升代码可维护性与扩展性。通过案例分析,帮助开发者掌握 如何运用设计模式构建高质量的软件架构,提升系统的灵活性与可扩展性。

8

2026.01.30

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Django 教程
Django 教程

共28课时 | 3.7万人学习

Go 教程
Go 教程

共32课时 | 4.4万人学习

TypeScript 教程
TypeScript 教程

共19课时 | 2.6万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号