MoE Offload 完全拆解:為什麼 671B 模型只吃 17GB VRAM 還能跑,以及 DeepSeek 從 V3 到 V4 怎麼讓它越跑越快
一個 671B 參數的模型,VRAM 只佔 17GB 就能跑推理——靠的是 MoE expert offload,把 97% 閒置的 expert 權重卸到 CPU RAM。這篇從原理拆起:MoE 為什麼天生適合 offload、offload 的機械結構(什麼放 GPU、什麼放 CPU)、PCIe 頻寬瓶頸怎麼緩解,以及 DeepSeek 從 V3 到 V4 在激活比例、KV Cache 壓縮、expert 體積三個維度上如何系統性降低 offload 的 PCIe 壓力。附 RTX Pro 6000 實測數據。