AI 正在改變的不僅是資料中心的運作方式,更包括其設計方式。在 Meta 涵蓋訓練、推論、推薦與排序、內容,以及服務數十億用戶的全新 AI 體驗等領域,對 AI 基礎設施的需求正快速成長。在 Advancing AI 2026 大會上,AMD 董事長暨執行長蘇姿丰博士與 Meta 基礎設施負責人 Santosh Janardhan 展開對談,說明 Meta 如何因應下一階段的成長,以及和 AMD 等夥伴深化合作的重要性。
Meta 持續擴大 AMD AI 產品部署
打造 Gigawatt 等級規模的 AI 基礎設施
傳統資料中心架構通常著重於最佳化個別伺服器或元件,而 AI 改變了這個模式。如今,AI 平台的效能取決於運算、網路、記憶體、電力、散熱與軟體之間協同運作的效率。以 Meta 的規模而言,這些元素已無法各自獨立設計。
整個基礎設施必須被視為單一整合式 AI 系統的方式進行工程設計,以在 Gigawatt 等級規模下高效且穩定地運作。
這樣的轉變,為基礎設施營運商與技術夥伴之間更深入的合作開啟了大門。Meta 與 AMD 並非在開發週期尾聲才選用現成元件,而是從晶片到軟體,共同校準需求與工程決策。彈性與規模同等重要,包括訓練、推論、推薦系統以及新興代理型應用,各自對基礎設施提出不同的需求。
攜手 AMD EPYC 共同擴展 AI 規模
開放式異質架構讓 Meta 能夠針對不同工作負載搭配合適的硬體,同時維持整體機隊的高使用率。這正是 Meta 與 AMD 持續深化合作的基礎:共同打造多元且快速演進的 AI 工作負載組合所需的晶片、系統與軟體。
此次合作橫跨 AMD EPYC 處理器的多個世代,包括 Milan、Bergamo、Turin,以及現在的 Venice。Meta 已在其基礎設施中部署數百萬顆 EPYC CPU,並以「Venice」主要客戶的身分與 AMD 緊密合作,預期將為 Meta 的工作負載帶來更多核心數、更高效能、更佳效率,以及在 Meta 特別重視領域的客製化能力。Meta 目前正在實驗室中驗證以「Venice」為基礎的平台,初步結果令人振奮,團隊也正為規模化部署做準備。
隨著 AI 系統日益走向代理化,CPU 所扮演的角色也持續擴大。GPU 仍是訓練與推論的核心,但 CPU 正逐漸承擔協調代理、執行工具、運行程式碼、管理資料,並協調 AI 模型周邊更廣泛系統運作的責任。隨著這些工作負載持續成長,CPU 與 GPU 效能之間的平衡也變得更加關鍵。Meta 計劃在既有「Venice」部署的基礎上,持續與 AMD 合作推進「Verano」以及未來世代的 EPYC 產品藍圖。
攜手 Instinct GPU 共同打造 AI 基礎設施
雙方在 GPU 與機櫃級系統領域的合作,同樣也大幅成長。今年稍早,Meta 透過 Open Compute Project 發表了 Open Rack Wide (ORW) 規範,定義出專為 AI 規模基礎設施打造的開放式機櫃架構。
AMD Helios 機櫃級解決方案即建構於 ORW 標準之上,將 AMD 對開放性的承諾,從晶片與軟體延伸至系統、機櫃與大規模叢集。Helios 整合了 AMD Instinct GPU、EPYC 處理器、AMD Pensando 網路技術以及 ROCm 軟體,打造出一套完整工程化的機櫃級平台,滿足 Gigawatt 等級規模下所需的效能、能源效率與可維護性。
這樣共同的架構願景,讓雙方得以在每個世代的 Instinct 加速器上展開更深入的合作。這項合作始於 MI300X,讓雙方累積了在超大規模環境下運行 AMD Instinct,同時於 AMD ROCm 軟體上最佳化生產工作負載的經驗。MI350 系列則將合作延伸至 AI 訓練領域,包括 Meta 平台核心的推薦與排序模型。
如今,Meta 計劃部署以 Instinct MI450 為基礎的客製化 GPU,展現雙方的合作已從產品部署,邁向深度、端到端的平台共同設計。
Meta 已搶先取得 Helios 的使用權限,並已與雙方工程師攜手,在硬體、軟體與系統整合等面向共同測試該平台,為工作負載部署做準備。
這項工作將支援 Meta 部署最高達 6 Gigawatts 規模、採用 AMD GPU 之基礎設施的計畫。在這樣的規模下,及早展開合作至關重要,因為電力、散熱、網路、記憶體與軟體等相關決策,無法等到最終驗證階段才進行,而必須從一開始就一併考量。
攜手打造下一世代 AI 基礎設施
下一代 AI 基礎設施的打造,將把資料中心視為一個完整系統,並在設計流程中更早期就校準工作負載、晶片、網路、系統與軟體。
這樣的合作,已開始影響 AMD 未來的平台發展,包括 AMD Instinct MI500 加速器以及下一代機櫃級系統。結合 Meta 為數十億用戶營運基礎設施的經驗,以及 AMD 在 CPU、GPU 與系統藍圖上的規劃,雙方期望能以更快的速度、更高的效率部署 AI 容量,並具備未來工作負載所需的彈性。





