
大模型顯卡需求速查表推理、訓練、微調顯存公式與選型指南選型最怕拍腦袋。一張卡到底能不能跑下某個模型核心看顯存和算力兩個維度。本文給出可落地的估算公式和主流顯卡對照采購/部署前花 5 分鐘算一遍少踩坑。一、顯存需求估算1.1 推理inference推理只需存模型權重 少量激活值。顯存 ≈ 參數量 × 每參數字節數精度每參數字節7B 模型顯存70B 模型顯存FP16/BF162 B≈ 14 GB≈ 140 GBFP81 B≈ 7 GB≈ 70 GBINT4量化0.5 B≈ 3.5 GB≈ 35 GB經驗公式每 10 億參數1B約需 1~4 GB 顯存取決于量化程度。INT4 量化后 7B 只要 3.5~4 GB消費級 8GB 卡都能跑。1.2 訓練 / 微調training / fine-tuning訓練時顯存 參數 梯度 優化器狀態 激活值遠大于推理全精度FP32訓練約 12~16 倍參數量7B ≈ 84~112 GB混合精度FP16/BF16訓練約 6~10 倍參數量7B ≈ 42~70 GBLoRA 等參數高效微調PEFT只訓練少量適配器顯存可壓到 2~3 倍參數量7B LoRA ≈ 15~20 GB經驗公式混合精度訓練每 1B 參數約需 6~10 GBLoRA 微調可降一個數量級。1.3 一個常用近似公式顯存 ≈ 1.2 × (模型參數 × 2) (batch_size × seq_len × d_model × 8)前半段是權重常量的基準開銷后半段是激活值隨 batch/序列長度線性增長的部分。公式用于快速估算上限精確值以實測為準。二、算力需求訓練涉及前向 反向 優化器更新算力需求遠高于推理。通常需要 A100/H100 級卡且多卡并行數據并行 / 張量并行 / 流水線并行。7B 全參訓練單卡 A100 80GB混合精度 梯度累積勉強可行100B需 8~32 張 A100/H100 配合模型并行。推理僅前向對算力要求低。中端卡3090/4090或推理卡T4/L4即可重點看顯存和吞吐/延遲。三、訓練 vs 推理的顯存比例以顯存為基準訓練與推理需求比例約5:1 ~ 10:1訓練需要 5~10 倍顯存。例如訓練 7B1 張 A100 80GB 或 2 張 4090 48GB推理 7B單張 3090 24GBFP16甚至 8GB 卡INT4 量化。四、主流顯卡速查顯卡顯存定位可跑典型模型推理RTX 3090/409024 GB消費級旗艦7B~13B FP16 / 7B~34B INT4RTX 6000 Ada48 GB專業級13B~34B FP16 / 70B INT4A10040/80 GB數據中心70B FP16 / 多卡訓練H10080 GB數據中心旗艦大模型訓練首選T4 / L416/24 GB推理專用7B~13B 推理五、降低顯存的關鍵手段量化GPTQ / AWQ / GGUF 把權重壓到 INT4/INT8顯存直接砍半到 1/4模型并行張量并行 流水線并行分攤單卡壓力代價是通信開銷參數高效微調LoRA / QLoRA 只訓適配器Q-LoRA 還能在 4-bit 量化上微調24GB 卡也能微調 7B梯度檢查點 / 激活重計算用時間換空間降低激活值顯存。六、選型一句話建議只做推理先看顯存夠不夠放權重量化后4090/3090 性價比最高做微調LoRA 優先24GB 卡可玩 7B70B 需 80GB做預訓練直接上 A100/H100 多卡集群別指望消費級卡。參考資料微信公眾號《大模型微調顯存優化》系列知乎「不同精度下算力/顯存對比」討論個人部署實踐整理