試與顯卡驗(yàn)機(jī)完整教程)
gpu-burn 使用指南多 GPU 壓力測(cè)試與顯卡驗(yàn)機(jī)完整教程【免費(fèi)下載鏈接】gpu-burnMulti-GPU CUDA stress test項(xiàng)目地址: https://gitcode.com/gh_mirrors/gp/gpu-burn剛組好一臺(tái)裝 8 張顯卡的服務(wù)器部署訓(xùn)練任務(wù)前總擔(dān)心某張卡在高負(fù)載下悄悄出錯(cuò)。gpu-burn 是一款多 GPU CUDA 壓力測(cè)試工具讓所有顯卡同時(shí)跑滿(mǎn)浮點(diǎn)運(yùn)算并自動(dòng)校驗(yàn)計(jì)算結(jié)果、逐卡輸出 OK/FAULTY。 適合誰(shuí)用如果你維護(hù)帶多張 NVIDIA GPU 的機(jī)器——新機(jī)器驗(yàn)收、上架前烤機(jī)、或者想排查某張卡是不是壞了——它都能派上用場(chǎng)。不用搭深度學(xué)習(xí)環(huán)境一條命令就能讓所有卡同時(shí)滿(mǎn)載省去了逐張卡測(cè)試的時(shí)間。 快速上手三步跑通每步都很短1?? 克隆源碼到本地git clone https://gitcode.com/gh_mirrors/gp/gpu-burn cd gpu-burn2?? 編譯Makefile 會(huì)自動(dòng)探測(cè) CUDA 安裝位置make3?? 先列出全部顯卡再做一次 5 分鐘冒煙測(cè)試./gpu_burn -l ./gpu_burn 300結(jié)束時(shí)每張卡都會(huì)打印 OK 或 FAULTY全綠就可以放心繼續(xù)。 核心特性 燃燒時(shí)長(zhǎng)直接寫(xiě)進(jìn)命令不需要任何配置文件命令行最后一個(gè)參數(shù)就是秒數(shù)到點(diǎn)自動(dòng)停。./gpu_burn 600 顯存占用精確可控-m決定吃多少顯存可以給固定 MB 數(shù)也可以給可用顯存的百分比默認(rèn) 90%。機(jī)器上還有別的進(jìn)程時(shí)用百分比更穩(wěn)./gpu_burn -m 4096 1200 # 固定 4GB跑 20 分鐘 ./gpu_burn -m 50% 60 # 半塊顯存跑 1 分鐘 單卡定點(diǎn)測(cè)試-i N只壓編號(hào)為 N 的那張卡用來(lái)隔離嫌疑對(duì)象非常順手。./gpu_burn -i 2 1800 雙精度與 Tensor 核心模式-d切換成雙精度浮點(diǎn)運(yùn)算精度更高、更吃算力-tc嘗試調(diào)用 Tensor 核心GPU 里專(zhuān)門(mén)加速矩陣運(yùn)算的硬件單元。./gpu_burn -d 3600 ./gpu_burn -tc 600? 自帶結(jié)果校驗(yàn)它不是單純把風(fēng)扇吹熱內(nèi)核在持續(xù)比較運(yùn)算結(jié)果的差值錯(cuò)誤數(shù)會(huì)實(shí)時(shí)累計(jì)。任何一張卡被判 FAULTY把該卡下線(xiàn)檢修就行不用整臺(tái)機(jī)器陪跑。 進(jìn)階玩法 Docker 一鍵部署服務(wù)器環(huán)境臟、不想動(dòng)系統(tǒng)里的 CUDA 版本時(shí)直接打容器鏡像docker build -t gpu-burn . docker run --rm --gpus all gpu-burn鏡像默認(rèn)跑 60 秒構(gòu)建時(shí)可用--build-arg COMPUTE75 --build-arg CUDA_VERSION13.0.0指定計(jì)算能力和 CUDA 版本。?? 構(gòu)建時(shí)指定計(jì)算能力計(jì)算能力是 NVIDIA 給每代 GPU 架構(gòu)的編號(hào)編譯參數(shù)要和你的卡匹配默認(rèn) 7.5Turing30 系用 8640 系用 89H100 用 90。make COMPUTE89CUDA 裝在非默認(rèn)路徑時(shí)加make CUDAPATH/usr/local/cuda-12.0。 Windows 版本win/ 目錄是官方 Windows 移植版需要 CMake 和 Visual Studio 的 C 工具鏈build.bat -c 86編譯出的 gpu_burn.exe 參數(shù)和 Linux 版完全一致共享同一套內(nèi)核。 實(shí)戰(zhàn)案例場(chǎng)景一新服務(wù)器 24 小時(shí)驗(yàn)收./gpu_burn -d 86400雙精度全卡燃燒一整天另開(kāi)終端watch -n 5 nvidia-smi盯溫度和功耗整夜無(wú) FAULTY 再交付。場(chǎng)景二定位偶發(fā)卡死的嫌疑卡先./gpu_burn -l確認(rèn)編號(hào)再只壓那張可疑的卡./gpu_burn -i 1 -m 80% 3600單卡 80% 顯存壓 1 小時(shí)復(fù)現(xiàn) FAULTY 基本可以斷定是硬件問(wèn)題直接走售后。? 常見(jiàn)問(wèn)題Qmake 提示找不到 nvccACUDA 工具鏈沒(méi)裝或不在默認(rèn)路徑裝上后執(zhí)行make CUDAPATH/usr/local/cuda-12.0。Q新架構(gòu)的卡該填多少 COMPUTEA對(duì)照架構(gòu)查20 系 75、30 系 86、40 系 89、H100 為 90。Q提示顯存不足但 nvidia-smi 明明還有空余A先確認(rèn)沒(méi)有別的進(jìn)程占卡再把-m降到 50% 留出余量重試。寫(xiě)在最后壓力測(cè)試是確認(rèn) GPU 可靠性的最硬核方式建議長(zhǎng)夜掛機(jī)后再?gòu)?fù)測(cè)一輪。現(xiàn)在就可以克隆倉(cāng)庫(kù)、編譯然后跑一次./gpu_burn 300的 5 分鐘冒煙測(cè)試。【免費(fèi)下載鏈接】gpu-burnMulti-GPU CUDA stress test項(xiàng)目地址: https://gitcode.com/gh_mirrors/gp/gpu-burn創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考