Skip to main content

GPU Memory Utilization 建議值

適用平台: NVIDIA H100 SXM5(每張實際可用 VRAM 約 79 GB)
可選配置: 1 / 2 / 4 / 8 張 H100
配置原則: 預留空間供 Embedding 模型共置及 KV Cache 使用


最終 gpu-memory-utilization 建議值

模型類型卡數建議值備注
Llama3.1-FFM-8BLLM1 張0.35預留空間共置 embedding
Llama3.2-FFM-11B視覺 LLM1 張0.45預留空間共置 embedding
Llama3.3-FFM-70BLLM4 張0.80建議 4 張,2 張 VRAM 緊張
gpt-oss-20b推理 LLM1 張0.45CoT 預留緩衝
gpt-oss-120b推理 LLM2 張0.75正式環境標準雙卡
gemma-4-26B-A4B-it多模態 MoE1 張0.80長上下文建議升 2 張
gemma-4-31B-it多模態1 張0.90長上下文建議升 2 張
FFM-Embedding-v2.1Embedding1 張0.10可共置
llama-nemotron-embed-vl-1b-v2Embedding1 張0.10可共置
llama-nemotron-rerank-vl-1b-v2Rerank1 張0.10可共置
llama-embed-nemotron-8bEmbedding1 張0.30較大,共置需注意剩餘空間