雲端 GPU 帳單來了。這筆費用是原本預算的三倍。
這不是帳單錯誤。這是一種可預測的結果,源於一種旨在隱藏其真正成本的定價模式——直到更換供應商變得痛苦為止。
雲端 GPU 的廣告標價——行銷頁面上的每小時美元費率——很少是真正的成本。對於在主要雲端供應商上運行生產工作負載的許多企業 AI 團隊來說,有效成本是廣告價格的兩到三倍,因為隱藏的乘數已經包含在內。
了解這個差距從何而來,是縮小它的第一步。
三個隱藏的成本乘數
1. 出口費用:企業資料傳輸的隱藏成本
雲端業者對於資料離開其環境會收取額外費用。這包括資料傳輸到網際網路、跨區域傳輸,以及在不同服務之間移動資料。
對 AI 工作負載而言,資料移動是持續發生的:
- 訓練資料寫入儲存
- 模型檢查點與梯度在節點間交換
- 評估結果、日誌與輸出檔案匯出到下游系統
以每月處理約 10 TB 訓練資料的中型 AI 團隊為例,單是儲存與出口費用就可能達到數萬美元——這些成本不會反映在 GPU 每小時的報價上。
主流大型雲端業者對一般出口通常收取每 GB 約 0.08–0.12 美元的費用,依數量、區域與目標服務採取分級計價。對於跨多區域的分散式訓練,這些費用很容易快速累積,且難以精準預估。
因此,採用固定費率且零出口費用的定價,不只是預算方便而已。它往往是「基礎設施成本可預測」與「帳單持續衝擊」之間的關鍵差別。
2. 虛擬化開銷:隱藏的效能損耗
多數雲端 GPU 產品都跑在 hypervisor(虛擬化層)之上——這層軟體會把實體硬體切分給多個虛擬執行個體。對供應商來說這種設計很有效率,但對高強度的 AI 訓練來說,卻會造成實質的效能損耗。
虛擬化開銷通常會讓實際可用的 GPU 輸送量降低約 10–15%,視工作負載與平台而定。在單張 GPU 上,這種損失已經讓人感覺明顯;換到 64 張 GPU 的訓練叢集,就等於白白損失 6–10 張 GPU 的運算能力,卻還是得付 64 張的錢。
具體影響包括:
- 原始輸送量下降,訓練時間拉長
- 分散式工作負載的額外延遲(GPU 之間的通訊必須經過 hypervisor)
對時間敏感的訓練與大規模推論來說,這些影響會直接轉為更長的執行時間與更高的成本。
裸金屬 GPU 存取——直接使用實體硬體、無需 hypervisor——就能徹底消除這層效能損耗,讓團隊真正發揮所付費硬體的完整能力。
3. 預留容量複雜性:定價迷宮
超大規模雲端業者提供複雜的定價結構:
- 隨選實例:靈活但昂貴
- 預留實例:較便宜但需要長期承諾
- ** spot 實例**:最低的標稱費率,但可能受到中斷
- ** savings plans 和積分**:折扣與特定消費水平或期限掛鉤
結果是定價迷宮,優化的是金融工程而非營運透明度。許多企業最終處於次優位置——為應該預留的工作負載支付隨需費用,或預留仍然利用率不足的容量。
行業分析反覆表明,糟糕的預留實例和 savings plans 優化可能使整體雲端計算支出比最佳情況增加 30–40%,這完全是由於定價結構複雜性。
真實計算:8 顆 H100 的實際成本
考慮一個常見的企業 AI 配置:8 顆 NVIDIA H100 GPU 連續運行一個月(約 720 小時)。
在主要超大規模雲端上:
- GPU 計算:8 顆 H100 實例(如 AWS p5.48xlarge)的定價約為每小時 98.32 美元,即每 GPU 小時約 12.30 美元。一個月下來,僅 GPU 計算就約為 70,848 美元(98.32 × 720)。
- 出口:以每 GB 約 0.08–0.09 美元的典型費率傳輸 100 TB 資料,每月就會多出約 8,000–9,000 美元。
- 儲存:訓練資料集、檢查點與日誌的持續儲存,按每 GB 0.02–0.08 美元/月計算,依保留政策很容易再增加數千美元。
- 效能開銷:虛擬化導致 10–15% 的效能損失,意味著為八顆 GPU 付費,同時實際獲得大約七顆的工作。
全部計算在內,8-GPU 叢集在超大規模雲端上很容易超過每月 80,000 美元。
在專業 GPU 雲端,採用固定費率、裸金屬定價:
- GPU 計算:專業和新型雲端供應商的 H100 通常定價在每小時 2.49–4.76 美元範圍內,部分平台和市場低至約 2–3 美元。以每 GPU 小時 2.50 美元計算,8 顆 H100 運行 720 小時每月約為 14,400 美元。
- 出口:許多裸金屬和專業 GPU 供應商捆綁無計量或固定費率網路,有效將邊際出口成本降至 0 美元。
- 儲存:通常簡化並打包在方案內,或相對於 GPU 用量有更透明的計價方式。
超大規模雲端上約 80,000 美元與專業 GPU 雲端上約 14,400 美元之間的差距,對於單個 8-GPU 訓練叢集來說約為 60,000–70,000 美元/月,或每年超過 700,000 美元。
在這個規模上,選擇不是一個小的採購優化。這是關於 AI 預算是資助計算容量還是供應商利潤的戰略決策。
為何企業仍留在超大規模雲端
如果經濟效益如此明顯,為何如此多的企業繼續在超大規模雲端上運行重型 AI 工作負載?
幾個結構性原因使大型組織保持現狀:
採購慣性。 很多企業的採購系統本來就是圍繞 AWS、Azure 或 GCP 建立的。這些供應商早就通過內部審核,合約和安全評估都已經準備好。要換新的供應商,通常還得再跑一輪盡職調查,時間和人力成本都不小。
綁定服務。 大型雲端業者提供完整的整合生態系:儲存、網路、資料庫、託管式 ML 平台、身分與存取管理,以及合規工具,全都綁在同一份合約裡。深度使用這些服務的團隊,轉換時會面臨相當高的成本。
風險考量。 專業 GPU 供應商和新型雲端相對較新,許多企業的 IT 與風險團隊對它們還不夠熟悉。選擇跳出三大雲端業者,往往會引發額外的審查、稽核與風險評估。
這些考量是真實的。然而,這些考量都不足以成為無限期地支付純 GPU 工作負載市場價三到五倍的理由。
高效能團隊的做法
最有效的企業 AI 團隊不會將超大規模雲端和專業 GPU 供應商視為互斥的選擇。他們策略性地結合兩者。
一種常見模式:
- 超大規模雲端處理需要與託管服務深度整合的工作負載:資料倉庫、身分系統、分析堆棧、合規敏感的處理。
- 專業 GPU 雲端處理計算密集型的訓練和推論,在這些地方,原始效能和成本效率是主導因素。
這種雙供應商方法捕獲了雙方的優勢:
- 在生態系統深度和現有控制真正增加價值的地方使用它們
- 在 GPU 支出最集中的地方,採用固定費率、裸金屬存取、零出口費用,以及更簡單的計價方式
對於許多企業來說,訓練和推論工作負載代表 GPU 支出的大部分。對於這些工作負載來說,專業供應商的案例現在很簡單:清晰的定價、完整的硬體效能,以及無需導航的定價迷宮。
在這個模型中,工程團隊專注於模型效能和產品交付,而不是解讀複雜的雲端帳單儀表板。
TW Compute 這類供應商正是專注在這個領域,在全球 200 多個地點提供數十萬顆 GPU 的裸金屬叢集,採用固定費率與零出口費用的計價方式。