ICode9

精准搜索请尝试: 精确搜索
首页 > 其他分享> 文章详细

Nvidia GPU风扇和电源显示ERR! 解决办法

2021-06-19 19:35:10  阅读:304  来源: 互联网

标签:200 Nvidia ERR sudo 风扇 smi nvidia GPU


训练模型时,风扇异常响,然后输入nvidia-smi发现风扇异常如下图(网上找的图)

 

 

nvidia论坛有人给出了解决方案,即问题的根源可能是风扇转速不足使GPU过热导致的。

首先开启GPU的persistent mode,再设置风扇的功率,重启即可生效。其中200代表的是风扇的最大功率限制,可以将其设置为最大,这样过热的时候风扇就会自动加大功率。

sudo nvidia-smi -pm 1
sudo nvidia-smi -pl 200 -i 1 # 最高250,指定运行的1卡最高功率为200,从而降低发热

手动风扇控制

此外,还可以将GPU风扇的手动风速控制打开。方法为:

首先,使用sudo nvidia-xconfig --enable-all-gpus命令打开所有gpu在xserver中的设置(不使用sudo可能无权限写入新配置)
然后修改配置文件:sudo vim /etc/X11/xorg.conf,在其中的DeviceSection中加入Option "Coolbits" "4"如下图所示:

 

 

  • 如果机器上有多块gpu,在第一步命令执行后,会在这个xorg.conf中出现多个Device Section,都依次执行第三步操作。重启机器后,命令行执行nvidia-settings,会打开设置界面,在其中的会显示所有GPU的设置选项,每个GPU控制选项下面都有一个Thermal settings,进入后打开enable GPU Fan Setting即可对风扇进行手动风速调整了。

标签:200,Nvidia,ERR,sudo,风扇,smi,nvidia,GPU
来源: https://www.cnblogs.com/xiaoaoran/p/14904624.html

本站声明: 1. iCode9 技术分享网(下文简称本站)提供的所有内容,仅供技术学习、探讨和分享;
2. 关于本站的所有留言、评论、转载及引用,纯属内容发起人的个人观点,与本站观点和立场无关;
3. 关于本站的所有言论和文字,纯属内容发起人的个人观点,与本站观点和立场无关;
4. 本站文章均是网友提供,不完全保证技术分享内容的完整性、准确性、时效性、风险性和版权归属;如您发现该文章侵犯了您的权益,可联系我们第一时间进行删除;
5. 本站为非盈利性的个人网站,所有内容不会用来进行牟利,也不会利用任何形式的广告来间接获益,纯粹是为了广大技术爱好者提供技术内容和技术思想的分享性交流网站。

专注分享技术,共同学习,共同进步。侵权联系[81616952@qq.com]

Copyright (C)ICode9.com, All Rights Reserved.

ICode9版权所有