AI對電力的巨大需求早已人盡皆知,但一個更隱蔽、更棘手的問題正浮出水面:數據中心用電量的劇烈波動正在損毀關鍵設備,威脅設施可靠性,並向整個電網輸出不穩定風險。
據彭博8月6日報道,電池、發電機、冷卻裝置等AI計算設施的核心繫統正因承受異常電力衝擊而出現故障或提前報廢。在xAI位於田納西州孟菲斯的Colossus超算設施,燃氣輪機已出現裂縫;英國多處規模較小的數據中心同樣出現輪機開裂問題。部分已安裝的穩壓電池在高強度運行下,數周乃至數月內便需更換。
這一問題的市場影響正在顯現。據報道,一位參與數據中心孖展的知情人士透露,部分設施的實際運行時間已降至80%左右,遠低於全年不間斷運行的設計預期,若問題未能解決,未來12至24個月內將對相關項目投資者造成直接衝擊。與此同時,北美電力可靠性公司(NERC)今年早些時候發出罕見的三級警報,要求大型數據中心立即應對電網穩定性風險。
電力波動的根源:GPU集群的"毫秒級"衝擊
AI數據中心的用電模式與傳統數據中心存在本質差異。傳統設施的用電量相對平穩,而AI計算——尤其是模型訓練階段——會驅動數十萬塊GPU同步啓停,用電量在毫秒級時間內大幅躍升或驟降。
Mainspring Energy Inc.創始人兼總裁Shannon Miller將這一現象形象地描述為:一座相當於波士頓規模的1吉瓦數據中心,其中一半的用電量可能每隔數秒便閃爍開關。而德克薩斯州和美國中西部規劃中的部分AI園區規模超過5吉瓦,平均用電量接近紐約市全市水平。
前特斯拉高管、Heron Power Electronics Co.創始人Drew Baglino指出,AI數據中心的瞬時用電量有時會飆升至設計容量的50%以上——"一座1吉瓦的設施可能在瞬間消耗1.5吉瓦"。其公司正為英偉達預計於2027年推出的下一代服務器開發電力波動管理設備。
Uptime Institute英國首席顧問Amber Villegas-Williamson將這種衝擊比作駕車時反覆猛踩油門:
"就像不斷超速運轉發動機,比勻速行駛磨損快得多。"
設備損毀已成現實:從裂縫到電弧閃絡
據彭博採訪的逾三十位美歐電力專業人士,AI數據中心對物理設備造成的壓力已有目共睹。
報道稱,多位知情人士表示,數據中心所用小型天然氣內燃機的曲軸已出現斷裂。xAI的Colossus設施中,燃氣輪機出現裂縫,運營方隨後安裝電池以平滑電力波動、減輕輪機負荷。GeoPura Ltd.首席執行官Andrew Cunningham亦證實,英國多處規模較小的數據中心同樣出現輪機開裂問題。
UL Solutions Inc.首席執行官Jennifer Scanlon指出,設備裂損或磨損可能引發電弧閃絡——即電流在導體間跳躍——進而損毀AI芯片。
Uptime Institute及多位業內人士表示,為穩壓而安裝的電池有時在數周乃至數月內便需更換。電池、電容器、變壓器、飛輪等穩壓設備雖已存在,但在搶速建設AI算力的浪潮中,新建數據中心對這些技術的部署明顯不足。
值得注意的是,這一問題遍及全球,從中東、非洲到歐洲和美國均有出現。
可靠性下滑直擊營收:每分鐘損失可達數十萬美元
設備損毀帶來的直接後果是設施停機,而停機的代價極為高昂。
Switch數據中心首席戰略官Jason Hoffman表示,關鍵設備提前損毀的財務代價,"主要不是更換一個泵或斷路器的成本,而是昂貴算力資產因離線而無法創造收入的損失"。據估算,停機造成的收入損失從每分鐘數千美元到數十萬美元不等,因設施類型和工作負載而異。
據報道,一個具體案例是:為確保微軟要求的99.999%可靠性,Joulent Inc.與雪佛龍聯合開發的德克薩斯州西部2.67吉瓦AI園區,不得不在工期中預留額外工程時間,供電啓動時間因此從2027年推遲至2028年。Joulent首席執行官Chris James表示,這一調整正是為了應對電力波動帶來的工程挑戰。
報道稱,據一位參與數據中心孖展的知情人士透露,行業普遍假設設施上線後將全年不間斷運行,但現實中部分設施的實際運行率已接近80%。若問題無法解決,未來12至24個月內將對相關項目投資者產生實質衝擊。
分析指出,超大規模雲廠商數千億美元的資本開支已令投資者和貸款方神經緊繃。設備損毀加速折舊的問題,與此前市場對GPU機架折舊速度的質疑相互疊加,令外界對AI數據中心能否兌現其盈利承諾產生更深層的疑慮。
即便數分鐘的停機,也會直接侵蝕數據中心開發商的營收。而若實際運行率長期低於預期,項目的財務模型將面臨根本性重估。在AI基礎設施投資熱潮尚未退溫之際,這一結構性風險正成為投資者不得不正視的新變量。
電網穩定性告急:監管機構發出罕見警報
值得注意的是,AI數據中心的電力波動不僅威脅設施自身,還向更廣泛的電網輸出不穩定性。
據報道,施耐德電氣電能質量專家、全球產品經理Sreemant Roy警告稱,這類高度動態的負荷"會導致電網不穩定,若不加以糾正,可能引發停電或斷電"。他特別指出,數據中心可能引發次同步振盪,損壞電網其他節點的連接設備,"這已令全球電力公司深感憂慮"。
監管層面,NERC在過去兩年內多次發出警告,將數據中心列為電網穩定性的最大風險之一。
據NERC去年9月的報告,在對美國逾33吉瓦在運數據中心的評估中,約四分之三的負荷模型"不足以反映數據中心的動態行為"。今年早些時候,NERC發出罕見的三級警報,要求大型數據中心於8月3日前提交應對方案。
面對上述挑戰,產業鏈各環節正積極尋求解決方案。
英偉達表示,自2024年發布Blackwell GPU起,已加強與電力專家的合作。英偉達超大規模基礎設施解決方案高級總監Dion Harris表示,公司正致力於在數據中心建設、設計、工程及電力輸送各環節實現更平穩的部署。
在運營層面,部分數據中心用戶已採用"側邊計算"技術——運行不屬於訓練流程的虛擬計算任務,以維持GPU穩定運行、平滑用電波動。但批評者指出,這一方法在電力需求本已高漲之際造成了額外的電力浪費。
在政策層面,美國能源部去年委託科羅拉多州丹佛附近的國家洛基山實驗室(NLR)建立測試平台,專門研究如何將AI安全接入電網。
NLR項目經理Martha Symko-Davies表示,該平台配備GPU和發電設備,供開發者測試其系統能否應對AI負荷的波動性,並將用於測試電池、軟件及其他穩壓設備。"我們現在有機會把這件事做對,"她說。