第176章 消失的三十GB

投票推薦 加入書籤 小說報錯

  第十二次廢土之行,第六十二天。

  前哨站新增的光伏陣列、八十千瓦時儲能系統,以及二號工作間內的獨立計算母線,剛剛通過連續負載驗證。

  角落裡,四台伺服器依舊沉睡在斷電狀態中,而兩組龐大的存儲設備也僅喚醒了一半。

  工作檯中央,A100基準節點已經悄無聲息地運轉了十二個小時。

  核心熱點、顯存溫度與電源模塊均呈現出令人安心的穩定曲線。

  這得益於江臨歷經四次修改的散熱路徑。

  伺服器排出的滾滾熱流被精準導入機架側面的板式換熱器,隨後順著外部低速風道,無聲地消散在前哨站外的荒原中。

  計算節點停機後,江臨將完整的啟動記錄封裝成只讀基準。

  【A100基準節點/運行環境完成】

  【基準卡:A100 PCIe 40GB】

  【連續負載:12h】

  【ECC不可糾正錯誤:0】

  【熱路徑:穩定】

  【供電權限:三級可中斷負載】

  這不是170HX解除限制後必然會呈現的模樣。

  板卡設計、供電能力、製造篩選和產品定位都可能存在差異。

  這張A100隻負責提供一套公開、完整、且具備可重複測量性的GA100參照環境。

  江臨調出A100從上電到建立計算上下文的完整記錄,將整個啟動過程抽絲剝繭般拆分為六個層級:從物理連接(L0)、身份配置(L1)、安全固件與HBM訓練(L2)、資源表生成(L3)、主機驅動映射(L4),直到最終的運行時與任務接口(L5)。

  信息彼此咬合,毫無罅隙。

  五組HBM完成訓練,物理資源順利進入設備資源表並向主機公開40GB顯存。

  驅動建立完整地址空間,運行時最終握住了全部40GB的可分配容量。

  江臨保存好最後一組數據,轉身將C170-01接入了同一套記錄系統。

  板卡邊緣貼著醒目的紅色標籤。

  【允許拆解】

  【允許失效】

  伴隨著供電建立,板卡身份讀取完成。

  五組HBM堆棧依次進入訓練流程,主機完成設備枚舉。

  PCIe物理寬度僅有四通道,當前協商狀態停滯在Gen1。

  江臨強制執行鏈路重訓練,又在設備負載狀態下重新讀取鏈路狀態。

  結果依舊停在Gen1×4。

  這種差異從設備枚舉階段便初露端倪,它或許源於板卡布線,或許來自啟動配置,但暫時不能與顯存容量混為一談。

  真正值得追蹤的幽靈,潛伏在另一條路徑里。

  直到L2結束之前,C170-01對外呈現的五組HBM訓練行為,與A100有著極高的相似度。

  然而,一旦跨入L3的門檻,結果驟然收縮。

  【GPU架構:GA100】

  【設備身份:CMP 170HX】

  【HBM2e:10240MiB】

  【總線寬度:5120-bit】

  【PCIe當前協商:Gen1×4】

  【計算資源:限制配置】

  五組HBM堆棧仍然被識別,但每組僅僅吝嗇地向主機交付2GB容量。

  江臨將兩份記錄重疊對比。

  差異沒有出現在主機驅動,也不在CUDA運行時。

  當主機第一次拿到這張卡的可用資源描述時,10GB已經是被底層處理過的最終答案。

  現有記錄只能確認,主機可見顯存的第一次明確分歧,出現在L2結束至L3資源描述提交之間。

  至於差異來自熔絲、板卡配置,還是固件映射,仍需繼續拆分。

  他在任務表上寫下了第一組判斷。

  【PCIe鏈路限制:獨立問題】

  【物理HBM容量:尚未確認】


  【熔絲/板卡配置限制:待排查】

  【主機驅動/運行時限制:低概率】

  【固件資源映射限制:高優先級候選】

  隨後,他從測試架上取下C170-01。

  拆除散熱器,剝離屏蔽罩。

  板邊快閃記憶體、啟動配置器件,以及一排沒有公開定義的測試點,毫無保留地暴露在工作檯慘白的燈光下。

  第一年,江臨試圖在主機端尋找突破口。

  他嘗試修改開放內核模塊、調整運行時分配器、為10GB以外的空間預留地址,甚至替換板卡身份試圖欺騙驅動。

  然而,只要安全固件交出的資源表不變,主機的視界就永遠被禁錮在十GB內。

  修改顯示值,不過是把儀錶盤上的數字撥大,油箱裡並不會憑空多出30升油。

  只要嘗試越界,安全固件便會無情地拒載。

  第二年,戰場轉移至板級隔離台。

  邏輯分析儀接入啟動配置鏈路,同一次冷啟動被撕裂成數十萬條地址波形。

  江臨猶如在浩如煙海的亂碼中淘金,與A100進行逐一對照。

  排除序列號、電源、傳感器等干擾項,差異點從40多萬個被一路壓縮至九百七十一處,最終僅剩五個無法破譯的未知區域。

  第三年春天,第一次物理干預付出了沉痛代價。

  頻繁的拆焊讓C170-01的焊盤出現剝離,哪怕江臨用飛線勉強重建連接,冷啟動十九次,設備仍然無法完成資源映射階段。

  一萬三千元的板卡宣告報廢,換來了一個冰冷的結論。

  直接替換簽名配置未能繞過校驗。

  繼續沿這條路徑試錯,破壞成本已經超過了能夠獲得的信息價值。

  紅色標籤旁多了一張白色紙條。

  【價值已用完】

  第四年,C170-09接手。

  江臨不再硬闖,而是製作了中間板去監聽。

  兩千六百多次冷啟動,橫跨零下15度到45度的劇烈溫差,所有逾越時序邊界的嘗試,都被安全固件毫不留情地終結。

  這條路同樣走到了盡頭。

  直到第五年冬天,MPS-FaultLedger從兩千多次失敗記錄中標出了一組異常。

  異常來自C170-29。

  前兩次冷啟動失敗,它竟然完成了五組HBM訓練,卻沒能生成資源表。

  江臨將其接入中間板重現波形,終於在L2末尾,捕捉到了一段被延長了零點八秒的底層維護串流。

  在那殘缺的數據中,五組HBM堆棧的訓練記錄後方,都跟隨著同一個容量欄位。

  【單組容量:8192MiB】

  五組相加,共四萬零九百六十MiB。

  也就是產品標稱中的四十GB。

  五組通道都完成了訓練。

  至少在這一階段,日誌沒有顯示30GB整體缺失。

  至於隱藏空間裡是否存在壞區,只能通過後續全地址讀寫與長期清洗確認。

  這30GB的幽靈,在下一層資源表生成時,被悄無聲息地藏在了主機永遠看不到的暗室里。

  知道30GB在哪,與真正使用它,中間橫亘著整套安全鏈路。

  江臨沒有簽名密鑰,但他敏銳地盯上了那零點八秒的維護窗口。

  第六年,一萬一千次冷啟動。

  江臨發現,當啟動配置鏈路上的電平轉換器出現時序漂移時,安全固件會短暫進入一條正常驅動無法識別的恢復路徑。

  他於是將這段過渡狀態暫時標記為【SERVICE_RECOVERY】。

  這只是根據行為做出的工程命名,並不代表製造商公開定義過同名模式。

  接下來,他花了整整半年時間,用中間板通過受控時序延遲,將這個極其嚴苛的窗口從零點八秒拉長到了六點四秒。

  六點四秒不足以讓完整驅動棧完成設備枚舉、資源映射和上下文建立。

  江臨於是繞開通用驅動,自己寫了一套最小加載器。

  不加載CUDA,也不創建計算上下文,只做一件事。

  向這張卡逼問它的真實底細。

  第七年二月,C170-29第一次在恢復狀態下返回了完整物理描述。

  PHYSICAL_HBM_STACKS:5

  PHYSICAL_HBM_CAPACITY:40960MiB

  40GB的貨架就在門後,只是門外還沒有路。

  同年的秋天,C170-29在長周期的恢復實驗中喪失了全部響應。

  現實世界裡連續兩次啟動失敗的樣品沒能撐到最後,但它用自己的死亡,交出了鎖孔的位置。

  第八年,漫長的地址測繪。

  狀態更穩定的C170-09重新進入測試台。

  牆上的地址草圖換了十六版,江臨像個耐心的破譯者,通過全零、交錯位、偽隨機序列的讀寫反饋,一點點拼湊出隱藏空間的物理拓撲。

  連續地址折返、通道交織、行列位置映射……

  第一百零九次,邊界發生折返。

  第三百七十六次,10GB以外第一次返回了非零數據。

  那是HBM訓練階段留下的一段測試圖樣。

  證明他的維護請求,確實踏入了隱藏區的大地。

  第九年六月。

  江臨向10GB邊界外的第一個有效地址寫入了四個字節。

  【寫入:0xA5A5A5A5】

  【讀回:0xA5A5A5A5】

  這四個字節是一座里程碑。

  因為它證明了外部加載器可以讀寫這片禁區。

  10GB的邊界開始緩慢向外推演。

  15、20、30……

  伴隨著容量激活,散發的熱量逼迫江臨重新製作導熱墊、調整風道。

  三周後,測試重新啟動。

  第九年七月二十一日,凌晨三點十七分。

  C170-09完成第一輪全物理地址空間寫入與讀取。

  【檢測物理容量:40960MiB】

  【可尋址容量:40960MiB】

  【單輪數據錯誤:0】

  但他沒有停下。

  一千小時的連續顯存清洗、高低溫循環、隨機斷點恢復。

  第一百零七天,兩處壞區被隔離。

  測試結果最終封裝。

  【物理容量:40960MiB】

  【穩定可用容量:39424MiB】

  【隔離容量:1536MiB】

  【不可糾正錯誤:0】

  【狀態:維護級顯存節點】

  它依然不是A100,通用CUDA程序依然無法調用它,受限的PCIe鏈路依然存在。

  但對於MPS-Agent而言,計算與存儲未必要捆綁在同一張卡上。

  這三萬九千四百二十四MiB,已經能夠承擔檢查點、失敗帳本、只讀證據庫和低頻訪問數據的冷層存儲。

  但在計算上下文尚未開放、PCIe鏈路仍然受限的情況下,它還不能充當A100的高帶寬緩存,更不能直接承擔模型分片計算。

  要讓五千一百二十位HBM總線真正產生價值,下一步必須讓板上的計算單元直接訪問隱藏地址空間。

  凌晨四點零二分。

  工作檯左側的A100基準節點屏幕上亮著:HBM2:40960MiB。

  右側隔離架上,歷經滄桑的C170-09屏幕上顯示著:穩定維護映射:39424MiB。

  兩張卡的外觀已經天差地別。

  A100金屬外殼依舊光潔,而C170-09被拆解了十幾次,板邊掛著中間板,測試點焊著凌亂的飛線。

  那張褪色的紅色標籤下,還能隱約看到當年礦場運維人員留下的半枚藍色記號。


  一張九萬二千元的A100,提供了完整參照。

  C170-09則用九年時間證明,被裁掉的三十GB中,大部分並未從物理層消失。

  少數區域確實存在缺陷,其餘容量只是沒有進入面向主機的產品資源表。

  江臨打開第十二次傳送任務表,平靜地敲下結語。

  【設備側資源映射限制已確認】

  【限制來源:熔絲/板卡配置/固件策略,尚未完全拆分】

  【單樣本隱藏容量恢復完成】

  【當前方法依賴維護映射,暫不具備現實交付條件】

  隨後,他建立了一個新的項目目錄:MPS-NearMemory_Runtime_v0.1。

  壓在A100運輸箱旁的那張紙,已經在前哨站里沉睡了九年。

  紙面失去了最初的平整,邊緣微微泛黃。

  周志華當年寫下的問題依然清晰。

  【壓縮之後,什麼不能丟?】

  江臨拿起筆,在下方補了一行字。

  【裁剪之後,什麼還在?】

  那三十GB並不是被重新創造出來的。

  它們中的大部分一直都在。

  只是直到今天,才第一次進入一套能夠讀取、校驗並隔離壞區的系統。

章節目錄