AFS AI Hub 模型及對應 GPU 型號
適用對象: IT 採購 / AI Agent 開發人員
平台規格: NVIDIA H100 SXM5(每張實際可用 VRAM 約79 GB)
可選配置: 1 / 2 / 4 / 8 張 H100
一、計算方法與公式
1.1 基本公式
最低所需 VRAM(GB)= 模型參數量(B)× 精度係數 × 1.25(安全係數)
精度係數對照表
| 模型格式 / 精度 | 每參數佔用 | 精度係數 |
|---|---|---|
| FP16 | 2 bytes | 2.0 |
| BF16 | 2 bytes | 2.0 |
| MXFP4 | 0.5 bytes | 0.5 |
安全係數 1.25 說明: 在模型權重之外,還需額外預留約 20–25% VRAM 供 KV Cache(推論時的注意力快取)、運算圖與系統框架使用。上下文長度越長,KV Cache 消耗越大,建議高並發或長上下文場景下安全係數提高至 1.4。
1.2 計算範例
以 Llama3.3-FFM-70B(FP16) 為例:
最低 VRAM = 70B × 2.0 × 1.25 = 175 GB
單張 H100 = 80 GB
所需 GPU 數 = ⌈175 ÷ 80⌉ = 3 張 → 選 4 張(最近的 2 的冪次)
1.3 選卡原則
- 計算「最低所需 VRAM」後,向上取最接近的可選配置(1 / 2 / 4 / 8 張)。
- 多張 GPU 之間採用 Tensor Parallelism(張量並行),需配置數為 1、2、4、8 其中之一(每次翻倍)。
- 若同時有大量並發請求,建議再往上一檔配置以提升吞吐量(throughput)。
二、各模型建議 GPU 配置
2.1 語言模型 / 視覺語言模型
| 模型名稱 | 參數量 | 精度 | 模型 VRAM | 含安全係數 | 建議配置 | 備注 |
|---|---|---|---|---|---|---|
| Llama3.3-FFM-70B | 70B | FP16 | 140 GB | 175 GB | 2 or 4(推薦) 張 | 2卡接近上限,長上下文建議 4 張 |
| Llama3.2-FFM-11B | 11B | FP16 | 22 GB | 27.5 GB | 1 張 | 視覺語言模型;含影像編碼器,建議 1 張即可 |
| Llama3.1-FFM-8B | 8B | FP16 | 16 GB | 20 GB | 1 張 | 單卡充裕 |
| Gemma3-4B | 4B | BF16 | 8 GB | 10 GB | 1 張 | 輕量,適合低延遲場景 |
2.2 大型多模態模型
| 模型名稱 | 參數量 | 精度 | 模型 VRAM | 含安全係數 | 建議配置 | 備注 |
|---|---|---|---|---|---|---|
| gemma-4-31B-it | 31B | BF16 | 62 GB | 77.5 GB | 1 張 | 單卡接近上限,長上下文建議 2 張 |
| gemma-4-26B-A4B-it | 26B(MoE) | BF16 | 52 GB | 65 GB | 1 張 | MoE 架構,每 token 實際啟用約 4B;長上下文建議 2 張 |
說明: MoE(Mixture of Experts)模型需將所有專家權重載入 VRAM,但每次推論只啟用部分專家,計算量遠低於同等參數的稠密模型,推論速度較快。
2.3 推理模型(Reasoning Model)
| 模型名稱 | 參數量 | 精度 | 模型 VRAM | 含安全係數 | 建議配置 | 備注 |
|---|---|---|---|---|---|---|
| gpt-oss-20B | 20B | MXFP4 | 10 GB | 12.5 GB | 1 張 | MXFP4 量化,顯著降低顯存佔用 |
| gpt-oss-120B | 120B | MXFP4 | 60 GB | 75 GB | 2 張 | 單卡僅適合開發環境且容易OOM;正式環境或長鏈推理(long CoT)建議 2 張 |
說明: 推理模型在回答時會產生大量中間推理步驟(chain-of-thought),KV Cache 消耗比一般語言模型更大,長上下文場景下建議提高配置。
2.4 向量模型 / 再排序模型
| 模型名稱 | 參數量 | 精度 | 模型 VRAM | 含安全係數 | 建議配置 | 備注 |
|---|---|---|---|---|---|---|
| FFM-Embedding-v2.1 | 1B | FP16 | 2 GB | 2.5 GB | 1 張 | 可與其他小模型共存於同一張卡 |
| llama-nemotron-embed-vl-1b-v2 | 1B | BF16 | 2 GB | 2.5 GB | 1 張 | 同上 |
| llama-embed-nemotron-8b | 7.5B | BF16 | 15 GB | 18.75 GB | 1 張 | 高精度向量;單卡充裕 |
| llama-nemotron-rerank-vl-1b-v2 | 1B | BF16 | 2 GB | 2.5 GB | 1 張 | 再排序模型,推論批次小,單卡即可 |
三、配置情境與效能說明
3.1 單張 H100(80 GB)
適用模型: Llama3.1-FFM-8B、Llama3.2-FFM-11B、Gemma3-4B、gpt-oss-20B、gpt-oss-120B(標準上下文)、gemma-4-31B-it(標準上下文)、gemma-4-26B-A4B-it(標準上下文)、所有向量 / 再排序模型
| 項目 | 說明 |
|---|---|
| 可用 VRAM | 79 GB |
| 適合場景 | 低至中度並發、上下文長度 ≤ 32K |
| 限制 | 超大模型無法載入;高並發時吞吐量受限 |
3.2 兩張 H100(160 GB,Tensor Parallel)
適用模型: Llama3.3-FFM-70B(可行)、gemma-4-31B-it(長上下文)、gpt-oss-120B(長鏈推理)
| 項目 | 說明 |
|---|---|
| 可用 VRAM | 158 GB |
| 適合場景 | 中大型模型、中度並發、上下文長度 ≤ 128K |
| 限制 | 70B FP16 模型在 2 張卡時 VRAM 略顯緊張,推薦 4 張 |
3.3 四張 H100(320 GB,Tensor Parallel)
適用模型: Llama3.3-FFM-70B(推薦)
| 項目 | 說明 |
|---|---|
| 可用 VRAM | 316 GB |
| 適合場景 | 70B 等級大模型、高並發、長上下文(32K) |
| 優勢 | VRAM 充裕,可支撐更多並發請求與更長 KV Cache |
3.4 八張 H100(640 GB,Tensor Parallel)
適用模型: 無當前列表中的單一模型需要 8 張,但適用於以下情境
| 項目 | 說明 |
|---|---|
| 可用 VRAM | 632 GB |
| 適合場景 | 極高並發的 70B 模型服務、多模型共存佈署(見第四章) |
| 優勢 | 最高吞吐量,支援最多並行請求 |
四、多模型同時佈署建議
當需要在同一節點上同時提供多個模型的推論服務時,所有模型的 VRAM 需求必須加總計算。
4.1 VRAM 加總計算方式
總需 VRAM = Σ(各模型含安全係數的 VRAM)
4.2 常見多模型組合範例
組合 A:RAG 場景(向量 + 語言)
| 模型 | 建議 VRAM |
|---|---|
| FFM-Embedding-v2.1(向量) | 2.5 GB |
| llama-nemotron-rerank-vl-1b-v2(排序) | 2.5 GB |
| Llama3.1-FFM-8B(語言生成) | 20 GB |
| 合計 | 25 GB → 1 張 H100 |
組合 B:多語言 + 視覺問答
| 模型 | 建議 VRAM |
|---|---|
| Llama3.2-FFM-11B(視覺語言) | 27.5 GB |
| Llama3.1-FFM-8B(純文字) | 20 GB |
| 合計 | 47.5 GB → 1 張 H100 |
組合 C:進階推理 + 嵌入服務
| 模型 | 建議 VRAM |
|---|---|
| gpt-oss-120B(推理) | 75 GB |
| llama-embed-nemotron-8b(向量) | 18.75 GB |
| 合計 | 93.75 GB → 2 張 H100 |
組合 D:全能平台(語言 + 視覺 + 推理 + 向量)
| 模型 | 建議 VRAM |
|---|---|
| Llama3.3-FFM-70B(主力語言) | 175 GB |
| Llama3.2-FFM-11B(視覺) | 27.5 GB |
| FFM-Embedding-v2.1(向量) | 2.5 GB |
| 合計 | 205 GB → 4 張 H100 |
組合 E:大型推理 + 向量 + 排序(完整 RAG 推理管線)
| 模型 | 建議 VRAM |
|---|---|
| gpt-oss-120B(推理) | 75 GB |
| llama-nemotron-embed-vl-1b-v2(向量) | 2.5 GB |
| llama-nemotron-rerank-vl-1b-v2(再排序) | 2.5 GB |
| 合計 | 80 GB → 需 2 張 H100 |
⚠️ 注意: 此組合合計 80 GB,超過單張卡實際可用的 79 GB,必須使用 2 張 H100。2 張合計可用 158 GB,VRAM 空間充裕,可支撐高並發與長上下文推理。
五、快速選卡決策表
| 您選擇的模型 | 建議 GPU 數量 | 最大上下文 | 備注 |
|---|---|---|---|
| Llama3.1-FFM-8B | 1 張 | 32K | |
| Llama3.2-FFM-11B | 1 張 | 32K | 視覺語言 |
| Llama3.3-FFM-70B | 2 or 4(推薦) 張 | 32K | 2 張也可,但 VRAM 緊張 |
| FFM-Embedding-v2.1 | 1 張 | 8K | 可共置 |
| gpt-oss-20B | 1 張 | 128K | |
| gpt-oss-120B | 2 張 | 128K | |
| llama-nemotron-rerank-vl-1b-v2 | 1 張 | 8K | 可共置 |
| llama-nemotron-embed-vl-1b-v2 | 1 張 | 10K | 可共置 |
| llama-embed-nemotron-8b | 1 張 | 32K | |
| gemma-4-31B-it | 1 張(標準)/ 2 張(長上下文) | 256K | 影片推理尚未啟用 |
| gemma-4-26B-A4B-it(MoE) | 1 張(標準)/ 2 張(長上下文) | 256K | 影片推理尚未啟用 |
| Gemma3-4B | 1 張 | 128K |
附錄:術語說明
| 術語 | 說明 |
|---|---|
| VRAM | GPU 顯示記憶體,模型權重與 KV Cache 存放於此 |
| Tensor Parallelism | 將模型張量切割分散到多張 GPU,需 NVLink 互連 |
| KV Cache | 推論時儲存注意力機制中間結果的快取,隨上下文長度線性增長 |
| FP16 / BF16 | 半精度浮點格式,各佔 2 bytes,為目前主流推論精度 |
| MXFP4 | 微縮 4-bit 浮點量化格式,佔 0.5 bytes,大幅降低 VRAM 需求 |
| MoE | Mixture of Experts,混合專家架構,推論時只啟用部分參數 |
| Throughput | 單位時間內處理的 token 數,配置越多 GPU 通常越高 |
| Chain-of-Thought (CoT) | 推理模型產生的逐步思考鏈,會顯著增加 KV Cache 消耗 |