第176章 消失的三十GB
第十二次廢土之行,第六十二天。
前哨站新增的光伏陣列、八十千瓦時儲能系統,以及二號工作間內的獨立計算母線,剛剛通過連續負載驗證。
角落裡,四台伺服器依舊沉睡在斷電狀態中,而兩組龐大的存儲設備也僅喚醒了一半。
工作檯中央,A100基準節點已經悄無聲息地運轉了十二個小時。
核心熱點、顯存溫度與電源模塊均呈現出令人安心的穩定曲線。
這得益於江臨歷經四次修改的散熱路徑。
伺服器排出的滾滾熱流被精準導入機架側面的板式換熱器,隨後順著外部低速風道,無聲地消散在前哨站外的荒原中。
計算節點停機後,江臨將完整的啟動記錄封裝成只讀基準。
【A100基準節點/運行環境完成】
【基準卡:A100 PCIe 40GB】
【連續負載:12h】
【ECC不可糾正錯誤:0】
【熱路徑:穩定】
【供電權限:三級可中斷負載】
這不是170HX解除限制後必然會呈現的模樣。
板卡設計、供電能力、製造篩選和產品定位都可能存在差異。
這張A100隻負責提供一套公開、完整、且具備可重複測量性的GA100參照環境。
江臨調出A100從上電到建立計算上下文的完整記錄,將整個啟動過程抽絲剝繭般拆分為六個層級:從物理連接(L0)、身份配置(L1)、安全固件與HBM訓練(L2)、資源表生成(L3)、主機驅動映射(L4),直到最終的運行時與任務接口(L5)。
信息彼此咬合,毫無罅隙。
五組HBM完成訓練,物理資源順利進入設備資源表並向主機公開40GB顯存。
驅動建立完整地址空間,運行時最終握住了全部40GB的可分配容量。
江臨保存好最後一組數據,轉身將C170-01接入了同一套記錄系統。
板卡邊緣貼著醒目的紅色標籤。
【允許拆解】
【允許失效】
伴隨著供電建立,板卡身份讀取完成。
五組HBM堆棧依次進入訓練流程,主機完成設備枚舉。
PCIe物理寬度僅有四通道,當前協商狀態停滯在Gen1。
江臨強制執行鏈路重訓練,又在設備負載狀態下重新讀取鏈路狀態。
結果依舊停在Gen1×4。
這種差異從設備枚舉階段便初露端倪,它或許源於板卡布線,或許來自啟動配置,但暫時不能與顯存容量混為一談。
真正值得追蹤的幽靈,潛伏在另一條路徑里。
直到L2結束之前,C170-01對外呈現的五組HBM訓練行為,與A100有著極高的相似度。
然而,一旦跨入L3的門檻,結果驟然收縮。
【GPU架構:GA100】
【設備身份:CMP 170HX】
【HBM2e:10240MiB】
【總線寬度:5120-bit】
【PCIe當前協商:Gen1×4】
【計算資源:限制配置】
五組HBM堆棧仍然被識別,但每組僅僅吝嗇地向主機交付2GB容量。
江臨將兩份記錄重疊對比。
差異沒有出現在主機驅動,也不在CUDA運行時。
當主機第一次拿到這張卡的可用資源描述時,10GB已經是被底層處理過的最終答案。
現有記錄只能確認,主機可見顯存的第一次明確分歧,出現在L2結束至L3資源描述提交之間。
至於差異來自熔絲、板卡配置,還是固件映射,仍需繼續拆分。
他在任務表上寫下了第一組判斷。
【PCIe鏈路限制:獨立問題】
【物理HBM容量:尚未確認】
【熔絲/板卡配置限制:待排查】
【主機驅動/運行時限制:低概率】
【固件資源映射限制:高優先級候選】
隨後,他從測試架上取下C170-01。
拆除散熱器,剝離屏蔽罩。
板邊快閃記憶體、啟動配置器件,以及一排沒有公開定義的測試點,毫無保留地暴露在工作檯慘白的燈光下。
第一年,江臨試圖在主機端尋找突破口。
他嘗試修改開放內核模塊、調整運行時分配器、為10GB以外的空間預留地址,甚至替換板卡身份試圖欺騙驅動。
然而,只要安全固件交出的資源表不變,主機的視界就永遠被禁錮在十GB內。
修改顯示值,不過是把儀錶盤上的數字撥大,油箱裡並不會憑空多出30升油。
只要嘗試越界,安全固件便會無情地拒載。
第二年,戰場轉移至板級隔離台。
邏輯分析儀接入啟動配置鏈路,同一次冷啟動被撕裂成數十萬條地址波形。
江臨猶如在浩如煙海的亂碼中淘金,與A100進行逐一對照。
排除序列號、電源、傳感器等干擾項,差異點從40多萬個被一路壓縮至九百七十一處,最終僅剩五個無法破譯的未知區域。
第三年春天,第一次物理干預付出了沉痛代價。
頻繁的拆焊讓C170-01的焊盤出現剝離,哪怕江臨用飛線勉強重建連接,冷啟動十九次,設備仍然無法完成資源映射階段。
一萬三千元的板卡宣告報廢,換來了一個冰冷的結論。
直接替換簽名配置未能繞過校驗。
繼續沿這條路徑試錯,破壞成本已經超過了能夠獲得的信息價值。
紅色標籤旁多了一張白色紙條。
【價值已用完】
第四年,C170-09接手。
江臨不再硬闖,而是製作了中間板去監聽。
兩千六百多次冷啟動,橫跨零下15度到45度的劇烈溫差,所有逾越時序邊界的嘗試,都被安全固件毫不留情地終結。
這條路同樣走到了盡頭。
直到第五年冬天,MPS-FaultLedger從兩千多次失敗記錄中標出了一組異常。
異常來自C170-29。
前兩次冷啟動失敗,它竟然完成了五組HBM訓練,卻沒能生成資源表。
江臨將其接入中間板重現波形,終於在L2末尾,捕捉到了一段被延長了零點八秒的底層維護串流。
在那殘缺的數據中,五組HBM堆棧的訓練記錄後方,都跟隨著同一個容量欄位。
【單組容量:8192MiB】
五組相加,共四萬零九百六十MiB。
也就是產品標稱中的四十GB。
五組通道都完成了訓練。
至少在這一階段,日誌沒有顯示30GB整體缺失。
至於隱藏空間裡是否存在壞區,只能通過後續全地址讀寫與長期清洗確認。
這30GB的幽靈,在下一層資源表生成時,被悄無聲息地藏在了主機永遠看不到的暗室里。
知道30GB在哪,與真正使用它,中間橫亘著整套安全鏈路。
江臨沒有簽名密鑰,但他敏銳地盯上了那零點八秒的維護窗口。
第六年,一萬一千次冷啟動。
江臨發現,當啟動配置鏈路上的電平轉換器出現時序漂移時,安全固件會短暫進入一條正常驅動無法識別的恢復路徑。
他於是將這段過渡狀態暫時標記為【SERVICE_RECOVERY】。
這只是根據行為做出的工程命名,並不代表製造商公開定義過同名模式。
接下來,他花了整整半年時間,用中間板通過受控時序延遲,將這個極其嚴苛的窗口從零點八秒拉長到了六點四秒。
六點四秒不足以讓完整驅動棧完成設備枚舉、資源映射和上下文建立。
江臨於是繞開通用驅動,自己寫了一套最小加載器。
不加載CUDA,也不創建計算上下文,只做一件事。
向這張卡逼問它的真實底細。
第七年二月,C170-29第一次在恢復狀態下返回了完整物理描述。
PHYSICAL_HBM_STACKS:5
PHYSICAL_HBM_CAPACITY:40960MiB
40GB的貨架就在門後,只是門外還沒有路。
同年的秋天,C170-29在長周期的恢復實驗中喪失了全部響應。
現實世界裡連續兩次啟動失敗的樣品沒能撐到最後,但它用自己的死亡,交出了鎖孔的位置。
第八年,漫長的地址測繪。
狀態更穩定的C170-09重新進入測試台。
牆上的地址草圖換了十六版,江臨像個耐心的破譯者,通過全零、交錯位、偽隨機序列的讀寫反饋,一點點拼湊出隱藏空間的物理拓撲。
連續地址折返、通道交織、行列位置映射……
第一百零九次,邊界發生折返。
第三百七十六次,10GB以外第一次返回了非零數據。
那是HBM訓練階段留下的一段測試圖樣。
證明他的維護請求,確實踏入了隱藏區的大地。
第九年六月。
江臨向10GB邊界外的第一個有效地址寫入了四個字節。
【寫入:0xA5A5A5A5】
【讀回:0xA5A5A5A5】
這四個字節是一座里程碑。
因為它證明了外部加載器可以讀寫這片禁區。
10GB的邊界開始緩慢向外推演。
15、20、30……
伴隨著容量激活,散發的熱量逼迫江臨重新製作導熱墊、調整風道。
三周後,測試重新啟動。
第九年七月二十一日,凌晨三點十七分。
C170-09完成第一輪全物理地址空間寫入與讀取。
【檢測物理容量:40960MiB】
【可尋址容量:40960MiB】
【單輪數據錯誤:0】
但他沒有停下。
一千小時的連續顯存清洗、高低溫循環、隨機斷點恢復。
第一百零七天,兩處壞區被隔離。
測試結果最終封裝。
【物理容量:40960MiB】
【穩定可用容量:39424MiB】
【隔離容量:1536MiB】
【不可糾正錯誤:0】
【狀態:維護級顯存節點】
它依然不是A100,通用CUDA程序依然無法調用它,受限的PCIe鏈路依然存在。
但對於MPS-Agent而言,計算與存儲未必要捆綁在同一張卡上。
這三萬九千四百二十四MiB,已經能夠承擔檢查點、失敗帳本、只讀證據庫和低頻訪問數據的冷層存儲。
但在計算上下文尚未開放、PCIe鏈路仍然受限的情況下,它還不能充當A100的高帶寬緩存,更不能直接承擔模型分片計算。
要讓五千一百二十位HBM總線真正產生價值,下一步必須讓板上的計算單元直接訪問隱藏地址空間。
凌晨四點零二分。
工作檯左側的A100基準節點屏幕上亮著:HBM2:40960MiB。
右側隔離架上,歷經滄桑的C170-09屏幕上顯示著:穩定維護映射:39424MiB。
兩張卡的外觀已經天差地別。
A100金屬外殼依舊光潔,而C170-09被拆解了十幾次,板邊掛著中間板,測試點焊著凌亂的飛線。
那張褪色的紅色標籤下,還能隱約看到當年礦場運維人員留下的半枚藍色記號。
一張九萬二千元的A100,提供了完整參照。
C170-09則用九年時間證明,被裁掉的三十GB中,大部分並未從物理層消失。
少數區域確實存在缺陷,其餘容量只是沒有進入面向主機的產品資源表。
江臨打開第十二次傳送任務表,平靜地敲下結語。
【設備側資源映射限制已確認】
【限制來源:熔絲/板卡配置/固件策略,尚未完全拆分】
【單樣本隱藏容量恢復完成】
【當前方法依賴維護映射,暫不具備現實交付條件】
隨後,他建立了一個新的項目目錄:MPS-NearMemory_Runtime_v0.1。
壓在A100運輸箱旁的那張紙,已經在前哨站里沉睡了九年。
紙面失去了最初的平整,邊緣微微泛黃。
周志華當年寫下的問題依然清晰。
【壓縮之後,什麼不能丟?】
江臨拿起筆,在下方補了一行字。
【裁剪之後,什麼還在?】
那三十GB並不是被重新創造出來的。
它們中的大部分一直都在。
只是直到今天,才第一次進入一套能夠讀取、校驗並隔離壞區的系統。
前哨站新增的光伏陣列、八十千瓦時儲能系統,以及二號工作間內的獨立計算母線,剛剛通過連續負載驗證。
角落裡,四台伺服器依舊沉睡在斷電狀態中,而兩組龐大的存儲設備也僅喚醒了一半。
工作檯中央,A100基準節點已經悄無聲息地運轉了十二個小時。
核心熱點、顯存溫度與電源模塊均呈現出令人安心的穩定曲線。
這得益於江臨歷經四次修改的散熱路徑。
伺服器排出的滾滾熱流被精準導入機架側面的板式換熱器,隨後順著外部低速風道,無聲地消散在前哨站外的荒原中。
計算節點停機後,江臨將完整的啟動記錄封裝成只讀基準。
【A100基準節點/運行環境完成】
【基準卡:A100 PCIe 40GB】
【連續負載:12h】
【ECC不可糾正錯誤:0】
【熱路徑:穩定】
【供電權限:三級可中斷負載】
這不是170HX解除限制後必然會呈現的模樣。
板卡設計、供電能力、製造篩選和產品定位都可能存在差異。
這張A100隻負責提供一套公開、完整、且具備可重複測量性的GA100參照環境。
江臨調出A100從上電到建立計算上下文的完整記錄,將整個啟動過程抽絲剝繭般拆分為六個層級:從物理連接(L0)、身份配置(L1)、安全固件與HBM訓練(L2)、資源表生成(L3)、主機驅動映射(L4),直到最終的運行時與任務接口(L5)。
信息彼此咬合,毫無罅隙。
五組HBM完成訓練,物理資源順利進入設備資源表並向主機公開40GB顯存。
驅動建立完整地址空間,運行時最終握住了全部40GB的可分配容量。
江臨保存好最後一組數據,轉身將C170-01接入了同一套記錄系統。
板卡邊緣貼著醒目的紅色標籤。
【允許拆解】
【允許失效】
伴隨著供電建立,板卡身份讀取完成。
五組HBM堆棧依次進入訓練流程,主機完成設備枚舉。
PCIe物理寬度僅有四通道,當前協商狀態停滯在Gen1。
江臨強制執行鏈路重訓練,又在設備負載狀態下重新讀取鏈路狀態。
結果依舊停在Gen1×4。
這種差異從設備枚舉階段便初露端倪,它或許源於板卡布線,或許來自啟動配置,但暫時不能與顯存容量混為一談。
真正值得追蹤的幽靈,潛伏在另一條路徑里。
直到L2結束之前,C170-01對外呈現的五組HBM訓練行為,與A100有著極高的相似度。
然而,一旦跨入L3的門檻,結果驟然收縮。
【GPU架構:GA100】
【設備身份:CMP 170HX】
【HBM2e:10240MiB】
【總線寬度:5120-bit】
【PCIe當前協商:Gen1×4】
【計算資源:限制配置】
五組HBM堆棧仍然被識別,但每組僅僅吝嗇地向主機交付2GB容量。
江臨將兩份記錄重疊對比。
差異沒有出現在主機驅動,也不在CUDA運行時。
當主機第一次拿到這張卡的可用資源描述時,10GB已經是被底層處理過的最終答案。
現有記錄只能確認,主機可見顯存的第一次明確分歧,出現在L2結束至L3資源描述提交之間。
至於差異來自熔絲、板卡配置,還是固件映射,仍需繼續拆分。
他在任務表上寫下了第一組判斷。
【PCIe鏈路限制:獨立問題】
【物理HBM容量:尚未確認】
【熔絲/板卡配置限制:待排查】
【主機驅動/運行時限制:低概率】
【固件資源映射限制:高優先級候選】
隨後,他從測試架上取下C170-01。
拆除散熱器,剝離屏蔽罩。
板邊快閃記憶體、啟動配置器件,以及一排沒有公開定義的測試點,毫無保留地暴露在工作檯慘白的燈光下。
第一年,江臨試圖在主機端尋找突破口。
他嘗試修改開放內核模塊、調整運行時分配器、為10GB以外的空間預留地址,甚至替換板卡身份試圖欺騙驅動。
然而,只要安全固件交出的資源表不變,主機的視界就永遠被禁錮在十GB內。
修改顯示值,不過是把儀錶盤上的數字撥大,油箱裡並不會憑空多出30升油。
只要嘗試越界,安全固件便會無情地拒載。
第二年,戰場轉移至板級隔離台。
邏輯分析儀接入啟動配置鏈路,同一次冷啟動被撕裂成數十萬條地址波形。
江臨猶如在浩如煙海的亂碼中淘金,與A100進行逐一對照。
排除序列號、電源、傳感器等干擾項,差異點從40多萬個被一路壓縮至九百七十一處,最終僅剩五個無法破譯的未知區域。
第三年春天,第一次物理干預付出了沉痛代價。
頻繁的拆焊讓C170-01的焊盤出現剝離,哪怕江臨用飛線勉強重建連接,冷啟動十九次,設備仍然無法完成資源映射階段。
一萬三千元的板卡宣告報廢,換來了一個冰冷的結論。
直接替換簽名配置未能繞過校驗。
繼續沿這條路徑試錯,破壞成本已經超過了能夠獲得的信息價值。
紅色標籤旁多了一張白色紙條。
【價值已用完】
第四年,C170-09接手。
江臨不再硬闖,而是製作了中間板去監聽。
兩千六百多次冷啟動,橫跨零下15度到45度的劇烈溫差,所有逾越時序邊界的嘗試,都被安全固件毫不留情地終結。
這條路同樣走到了盡頭。
直到第五年冬天,MPS-FaultLedger從兩千多次失敗記錄中標出了一組異常。
異常來自C170-29。
前兩次冷啟動失敗,它竟然完成了五組HBM訓練,卻沒能生成資源表。
江臨將其接入中間板重現波形,終於在L2末尾,捕捉到了一段被延長了零點八秒的底層維護串流。
在那殘缺的數據中,五組HBM堆棧的訓練記錄後方,都跟隨著同一個容量欄位。
【單組容量:8192MiB】
五組相加,共四萬零九百六十MiB。
也就是產品標稱中的四十GB。
五組通道都完成了訓練。
至少在這一階段,日誌沒有顯示30GB整體缺失。
至於隱藏空間裡是否存在壞區,只能通過後續全地址讀寫與長期清洗確認。
這30GB的幽靈,在下一層資源表生成時,被悄無聲息地藏在了主機永遠看不到的暗室里。
知道30GB在哪,與真正使用它,中間橫亘著整套安全鏈路。
江臨沒有簽名密鑰,但他敏銳地盯上了那零點八秒的維護窗口。
第六年,一萬一千次冷啟動。
江臨發現,當啟動配置鏈路上的電平轉換器出現時序漂移時,安全固件會短暫進入一條正常驅動無法識別的恢復路徑。
他於是將這段過渡狀態暫時標記為【SERVICE_RECOVERY】。
這只是根據行為做出的工程命名,並不代表製造商公開定義過同名模式。
接下來,他花了整整半年時間,用中間板通過受控時序延遲,將這個極其嚴苛的窗口從零點八秒拉長到了六點四秒。
六點四秒不足以讓完整驅動棧完成設備枚舉、資源映射和上下文建立。
江臨於是繞開通用驅動,自己寫了一套最小加載器。
不加載CUDA,也不創建計算上下文,只做一件事。
向這張卡逼問它的真實底細。
第七年二月,C170-29第一次在恢復狀態下返回了完整物理描述。
PHYSICAL_HBM_STACKS:5
PHYSICAL_HBM_CAPACITY:40960MiB
40GB的貨架就在門後,只是門外還沒有路。
同年的秋天,C170-29在長周期的恢復實驗中喪失了全部響應。
現實世界裡連續兩次啟動失敗的樣品沒能撐到最後,但它用自己的死亡,交出了鎖孔的位置。
第八年,漫長的地址測繪。
狀態更穩定的C170-09重新進入測試台。
牆上的地址草圖換了十六版,江臨像個耐心的破譯者,通過全零、交錯位、偽隨機序列的讀寫反饋,一點點拼湊出隱藏空間的物理拓撲。
連續地址折返、通道交織、行列位置映射……
第一百零九次,邊界發生折返。
第三百七十六次,10GB以外第一次返回了非零數據。
那是HBM訓練階段留下的一段測試圖樣。
證明他的維護請求,確實踏入了隱藏區的大地。
第九年六月。
江臨向10GB邊界外的第一個有效地址寫入了四個字節。
【寫入:0xA5A5A5A5】
【讀回:0xA5A5A5A5】
這四個字節是一座里程碑。
因為它證明了外部加載器可以讀寫這片禁區。
10GB的邊界開始緩慢向外推演。
15、20、30……
伴隨著容量激活,散發的熱量逼迫江臨重新製作導熱墊、調整風道。
三周後,測試重新啟動。
第九年七月二十一日,凌晨三點十七分。
C170-09完成第一輪全物理地址空間寫入與讀取。
【檢測物理容量:40960MiB】
【可尋址容量:40960MiB】
【單輪數據錯誤:0】
但他沒有停下。
一千小時的連續顯存清洗、高低溫循環、隨機斷點恢復。
第一百零七天,兩處壞區被隔離。
測試結果最終封裝。
【物理容量:40960MiB】
【穩定可用容量:39424MiB】
【隔離容量:1536MiB】
【不可糾正錯誤:0】
【狀態:維護級顯存節點】
它依然不是A100,通用CUDA程序依然無法調用它,受限的PCIe鏈路依然存在。
但對於MPS-Agent而言,計算與存儲未必要捆綁在同一張卡上。
這三萬九千四百二十四MiB,已經能夠承擔檢查點、失敗帳本、只讀證據庫和低頻訪問數據的冷層存儲。
但在計算上下文尚未開放、PCIe鏈路仍然受限的情況下,它還不能充當A100的高帶寬緩存,更不能直接承擔模型分片計算。
要讓五千一百二十位HBM總線真正產生價值,下一步必須讓板上的計算單元直接訪問隱藏地址空間。
凌晨四點零二分。
工作檯左側的A100基準節點屏幕上亮著:HBM2:40960MiB。
右側隔離架上,歷經滄桑的C170-09屏幕上顯示著:穩定維護映射:39424MiB。
兩張卡的外觀已經天差地別。
A100金屬外殼依舊光潔,而C170-09被拆解了十幾次,板邊掛著中間板,測試點焊著凌亂的飛線。
那張褪色的紅色標籤下,還能隱約看到當年礦場運維人員留下的半枚藍色記號。
一張九萬二千元的A100,提供了完整參照。
C170-09則用九年時間證明,被裁掉的三十GB中,大部分並未從物理層消失。
少數區域確實存在缺陷,其餘容量只是沒有進入面向主機的產品資源表。
江臨打開第十二次傳送任務表,平靜地敲下結語。
【設備側資源映射限制已確認】
【限制來源:熔絲/板卡配置/固件策略,尚未完全拆分】
【單樣本隱藏容量恢復完成】
【當前方法依賴維護映射,暫不具備現實交付條件】
隨後,他建立了一個新的項目目錄:MPS-NearMemory_Runtime_v0.1。
壓在A100運輸箱旁的那張紙,已經在前哨站里沉睡了九年。
紙面失去了最初的平整,邊緣微微泛黃。
周志華當年寫下的問題依然清晰。
【壓縮之後,什麼不能丟?】
江臨拿起筆,在下方補了一行字。
【裁剪之後,什麼還在?】
那三十GB並不是被重新創造出來的。
它們中的大部分一直都在。
只是直到今天,才第一次進入一套能夠讀取、校驗並隔離壞區的系統。