科技
SEMI大師論壇》AI網路利用率逾90%、遠高於雲端約60%!博通:乙太網路須一路串到跨資料中心
加入為 Google 偏好來源
將 Yahoo 設為首選來源,在 Google 上查看更多我們的精彩報導
Semicon Taiwan 2026 CEO 大師論壇2日於南港展覽館舉行,圖為博通核心交換事業部高級副總裁兼總經理Asad Khamisy。(劉偉宏攝)
AI訓練把成千上萬顆GPU綁在同一項工作上,網路只要延遲升高或發生封包重傳,昂貴加速器就可能停下等待。博通(Broadcom,NASDAQ:AVGO)核心交換器事業群資深副總裁暨總經理Asad Khamisy 2日在SEMICON Taiwan 2026大師論壇指出,傳統雲端網路利用率約60%,AI網路目前則已超過90%;在高負載下仍要壓低延遲、封包遺失與故障影響,網路架構必須從機櫃內Scale-up,一路延伸至建築內Scale-out及跨建築、跨園區的Scale-across。
Khamisy表示,雲端運算的主要工作是讓不同客戶與應用的虛擬機器共享CPU,同時維持隔離;AI訓練則因模型無法放進單一GPU,必須拆分到數十、數百甚至數千顆GPU上,讓所有加速器共同處理同一任務。因此,網路不只是傳輸資料的外部配備,而是直接決定GPU利用率與每個輸出Token所需時間的運算環節。
博通以一個4,000億參數、FP16模型分散在576顆GPU的模擬說明,隨著張量平行度提高,每顆GPU負責的計算量與HBM存取時間會下降,但參與運算的GPU愈多,彼此通信造成的網路延遲反而上升。若網路層級更多、延遲較高,新增GPU帶來的效益便會被通信時間抵銷;降低網路延遲,才能繼續增加可有效利用的GPU數量。
他說,AI網路除了低延遲,也必須具備擴充性、故障韌性與低封包遺失率。「在雲端,我們看到客戶的網路利用率大約是60%;在AI環境,目前已超過90%。」問題在於,網路愈接近滿載,壅塞與重傳愈容易放大,因此流量工程、壅塞控制及故障復原的重要性也隨之提高。
博通把AI網路分為三個層次。Scale-up多位於單一機櫃內,GPU進行記憶體載入與儲存操作,封包短且對延遲敏感;Scale-out把多個機櫃連成建築內叢集,主要採Clos或Fat-tree拓撲,可向上擴充至約10萬顆GPU;當單棟建築電力不足、算力必須分散到多棟建築或不同區域時,則進入Scale-across。
產品配置上,Tomahawk Ultra鎖定Scale-up,64 Byte封包延遲約250奈秒;Tomahawk 6用於Scale-up及Scale-out,交換容量達102.4 Tbps,可配置512條200G或1,024條100G SerDes;Jericho 4則以深度緩衝、線速加解密與流量工程,處理跨建築及跨區域連線。
Khamisy認為,AI後端網路若在三個層次採用相同乙太網路技術,可共用管理工具與軟體堆疊,並依工作負載重新分配介面與加速器資源。他總結:「網路就是電腦,而乙太網路是端到端建構這套網路的方式。」隨AI叢集從數千顆擴大至數十萬、甚至百萬顆加速器,網路也將從資料中心配套,轉變為AI系統本身的一部分。
更多風傳媒報導
AI交換器功耗跨過1,500瓦就要液冷!博通揭CPO、封裝與散熱三大瓶頸
美光加碼AI研發與新創!100億美元攻長期技術、2.5億美元基金找下一代應用
1% Guide》天婦羅跟天丼差在哪?從麵衣、醬汁到上桌節奏,看懂江戶料理的兩種吃法
將 Yahoo 設為首選來源,在 Google 上查看更多我們的精彩報導
Semicon Taiwan 2026 CEO 大師論壇2日於南港展覽館舉行,圖為博通核心交換事業部高級副總裁兼總經理Asad Khamisy。(劉偉宏攝)
AI訓練把成千上萬顆GPU綁在同一項工作上,網路只要延遲升高或發生封包重傳,昂貴加速器就可能停下等待。博通(Broadcom,NASDAQ:AVGO)核心交換器事業群資深副總裁暨總經理Asad Khamisy 2日在SEMICON Taiwan 2026大師論壇指出,傳統雲端網路利用率約60%,AI網路目前則已超過90%;在高負載下仍要壓低延遲、封包遺失與故障影響,網路架構必須從機櫃內Scale-up,一路延伸至建築內Scale-out及跨建築、跨園區的Scale-across。
Khamisy表示,雲端運算的主要工作是讓不同客戶與應用的虛擬機器共享CPU,同時維持隔離;AI訓練則因模型無法放進單一GPU,必須拆分到數十、數百甚至數千顆GPU上,讓所有加速器共同處理同一任務。因此,網路不只是傳輸資料的外部配備,而是直接決定GPU利用率與每個輸出Token所需時間的運算環節。
博通以一個4,000億參數、FP16模型分散在576顆GPU的模擬說明,隨著張量平行度提高,每顆GPU負責的計算量與HBM存取時間會下降,但參與運算的GPU愈多,彼此通信造成的網路延遲反而上升。若網路層級更多、延遲較高,新增GPU帶來的效益便會被通信時間抵銷;降低網路延遲,才能繼續增加可有效利用的GPU數量。
他說,AI網路除了低延遲,也必須具備擴充性、故障韌性與低封包遺失率。「在雲端,我們看到客戶的網路利用率大約是60%;在AI環境,目前已超過90%。」問題在於,網路愈接近滿載,壅塞與重傳愈容易放大,因此流量工程、壅塞控制及故障復原的重要性也隨之提高。
博通把AI網路分為三個層次。Scale-up多位於單一機櫃內,GPU進行記憶體載入與儲存操作,封包短且對延遲敏感;Scale-out把多個機櫃連成建築內叢集,主要採Clos或Fat-tree拓撲,可向上擴充至約10萬顆GPU;當單棟建築電力不足、算力必須分散到多棟建築或不同區域時,則進入Scale-across。
產品配置上,Tomahawk Ultra鎖定Scale-up,64 Byte封包延遲約250奈秒;Tomahawk 6用於Scale-up及Scale-out,交換容量達102.4 Tbps,可配置512條200G或1,024條100G SerDes;Jericho 4則以深度緩衝、線速加解密與流量工程,處理跨建築及跨區域連線。
Khamisy認為,AI後端網路若在三個層次採用相同乙太網路技術,可共用管理工具與軟體堆疊,並依工作負載重新分配介面與加速器資源。他總結:「網路就是電腦,而乙太網路是端到端建構這套網路的方式。」隨AI叢集從數千顆擴大至數十萬、甚至百萬顆加速器,網路也將從資料中心配套,轉變為AI系統本身的一部分。
更多風傳媒報導
AI交換器功耗跨過1,500瓦就要液冷!博通揭CPO、封裝與散熱三大瓶頸
美光加碼AI研發與新創!100億美元攻長期技術、2.5億美元基金找下一代應用
1% Guide》天婦羅跟天丼差在哪?從麵衣、醬汁到上桌節奏,看懂江戶料理的兩種吃法
新聞來源: 原始來源
尚無評論,成為第一個發言的人吧!