GPU Memory Utilization 建議值
適用平台: NVIDIA H100 SXM5(每張實際可用 VRAM 約 79 GB)
可選配置: 1 / 2 / 4 / 8 張 H100
配置原則: 預留空間供 Embedding 模型共置及 KV Cache 使用
最終 gpu-memory-utilization 建議值
| 模型 | 類型 | 卡數 | 建議值 | 備注 |
|---|---|---|---|---|
| Llama3.1-FFM-8B | LLM | 1 張 | 0.35 | 預留空間共置 embedding |
| Llama3.2-FFM-11B | 視覺 LLM | 1 張 | 0.45 | 預留空間共置 embedding |
| Llama3.3-FFM-70B | LLM | 4 張 | 0.80 | 建議 4 張,2 張 VRAM 緊張 |
| gpt-oss-20b | 推理 LLM | 1 張 | 0.45 | CoT 預留緩衝 |
| gpt-oss-120b | 推理 LLM | 2 張 | 0.75 | 正式環境標準雙卡 |
| gemma-4-26B-A4B-it | 多模態 MoE | 1 張 | 0.80 | 長上下文建議升 2 張 |
| gemma-4-31B-it | 多模態 | 1 張 | 0.90 | 長上下文建議升 2 張 |
| FFM-Embedding-v2.1 | Embedding | 1 張 | 0.10 | 可共置 |
| llama-nemotron-embed-vl-1b-v2 | Embedding | 1 張 | 0.10 | 可共置 |
| llama-nemotron-rerank-vl-1b-v2 | Rerank | 1 張 | 0.10 | 可共置 |
| llama-embed-nemotron-8b | Embedding | 1 張 | 0.30 | 較大,共置需注意剩餘空間 |