第405章 天權6號熱功耗攻堅
合城未來科技中央研究院的燈光已經連續亮了七十二個小時。
章宸從法蘭克福飛回時是凌晨三點,他沒有回家,直接讓司機開到了研究院樓下。電梯門打開,走廊里的空氣混雜著助焊劑和咖啡的味道——那是晶片驗證團隊連續作戰的標誌性氣息。林薇的辦公室門半掩著,裡面傳出低啞的討論聲。
推門進去,林薇正對著三塊屏幕上的熱成像圖蹙眉。她的眼圈發青,頭髮隨意扎在腦後,白大褂袖口沾著一塊不知什麼時候蹭上的導熱矽脂。張京京坐在她旁邊,手裡捏著一份剛列印出來的失效分析報告,紙面上密密麻麻標註著紅色批註。章宸的突然出現讓兩人同時抬頭,林薇沒有寒暄,直接把中間那塊屏幕轉向他。
「天權6號工程樣片,第二次全工況熱測試。目標功耗四十五瓦,實測峰值五十五瓦,超出目標值百分之二十二。」她用手指在屏幕上的熱成像圖上畫了一個圈,「熱量集中在GPU計算核心區域,這個區域的功率密度已經超過了每平方毫米零點八瓦,比天權5號高出一倍半。再往上加散熱方案就只能上液冷,但我們的目標場景是終端設備,液冷不是選項。」
章宸拉過一把椅子坐下,仔細看了一遍熱成像圖的每一處熱點分布。天權6號採用的是異構計算架構,CPU核心群和自研GPU核心群集成在同一顆晶片上,通過高速互聯總線交換數據。熱成像顯示,CPU核心區域溫度正常,但GPU核心區域出現了三個明顯的熱點——分別對應紋理處理單元、張量計算陣列和緩存控制器。其中張量計算陣列的熱點溫度最高,局部結溫已經逼近一百一十度的安全紅線。
「泄漏源定位了嗎?」章宸問。
張京京把失效分析報告攤開在桌上。她用紅筆圈出了三個位置:「第一泄漏源是張量計算陣列的時鐘樹。我們在設計時為了追求算力密度,把張量陣列的時鐘頻率拉得太高,導致動態功耗超出預算三十一個百分點。第二泄漏源是GPU與共享緩存之間的數據通路,位寬二百五十六比特,全速運行時靜態漏電功耗比仿真數據高了四點七倍。第三泄漏源最麻煩——GPU核心與CPU核心之間的互聯總線,異構調度時頻繁的上下文切換產生了大量的瞬時電流尖峰,這些尖峰在仿真階段被平均化處理了,沒有引起足夠重視。」
「仿真掩蓋了峰值問題。」章宸一語道破。
林薇點頭:「天權5號的冗餘設計仿真良率百分之九十九,這套方法論在5號上很成功,團隊就慣性延續到了6號。但異構計算的動態功耗波動幅度遠大於同構架構,用平均功耗代替峰值功耗做仿真,等於把最危險的部分平滑掉了。」她調出另一組數據,「我們在仿真里看到的是四十五瓦的平均熱功耗,但實際工作負載下,GPU張量陣列被調用的瞬間,功耗會在幾納秒內衝到五十五瓦,然後快速回落。這種尖峰式熱衝擊比持續高溫更致命——它不僅影響穩定性,還會加速電子遷移,縮短晶片壽命。」
問題徹底攤開了。三個泄漏源,兩個在設計層面,一個在方法論層面。留給團隊的時間並不寬裕——天權6號的流片窗口定在十個月後,而解決熱功耗問題需要重新設計GPU核心的部分微架構,從RTL修改到功能驗證再到物理設計,每一步都卡在臨界線上。
章宸沒有急於定方案,而是問了一個問題:「自研GPU架構和之前用的第三方GPU IP相比,設計複雜度增加了多少?」
林薇從抽屜里拿出一張架構對比圖。天權5號使用的是經過深度定製的第三方GPU IP核,性能不錯但架構黑盒,無法做底層的功耗優化。天權6號的自研GPU架構名為「羲和」,從指令集到微架構全部自研,張量計算陣列、紋理處理單元、緩存層次結構都經過了重新設計,算力密度比第三方IP高出百分之四十,但功耗控制也相應複雜了一倍以上。
「自研架構的方向沒有錯。」林薇的語氣很堅定,「第三方GPU IP的黑盒限制我們只能做外圍優化,相當於在別人打好的地基上蓋房子。羲和架構讓我們第一次擁有了GPU底層設計的完整自由度,這次熱功耗問題暴露的恰恰是我們可以通過架構優化來解決的——時鐘樹可以重構,數據通路可以重布,互聯協議可以重寫。如果還在用第三方IP,遇到同樣的功耗問題我們連改的權限都沒有。」
這話讓章宸想起陳醒在啟動「補天」計劃時說的那句「我們也能寫EDA」。自研的代價是踩坑,但不自研的代價是把命脈交在別人手裡。兩害相權,未來科技選前者。
「三個泄漏源,分三條線同時攻堅。」章宸在白板上畫了一個三叉戟結構,「第一條線,張量計算陣列的時鐘樹重構。目標是把動態功耗降回預算線以內,但不能犧牲算力密度——天權6號的AI推理性能是我們的核心賣點,不能因為解決功耗問題就把性能優勢丟掉。」
張京京接話:「可以用多時鐘域設計,把張量陣列按工作負載分成四個獨立的時鐘域。輕負載時只激活一個域,重負載時四個域並行,這樣平均功耗和峰值功耗之間的波動幅度可以壓縮百分之四十以上。代價是控制邏輯複雜一些,RTL代碼量增加大約百分之十五。」
「做。」章宸在白板上寫下一個「鍾」字,「第二條線,數據通路靜態漏電優化。四百七十倍的仿真偏差,說明我們的漏電模型本身就有問題。」
林薇從桌上翻出一份技術文檔,遞給章宸:「根源找到了。GPU與共享緩存之間的數據通路用的是高速LVDS差分信號,仿真時我們用的是常溫下的漏電參數。但實際工作中,GPU核心溫度升高後,差分對的共模電壓會漂移,導致靜態偏置電流增大。這個問題可以通過兩個手段解決——硬體層面引入自適應偏置校準電路,軟體層面讓天罡OS實時監控溫度並動態調整偏置電壓。」
「自適應偏置校準電路的複雜度呢?」
「大概增加百分之三的晶片面積。但可以換來靜態漏電功耗下降六成。」
「值得。」章宸在「鍾」字旁邊寫了一個「漏」字,「第三條線,異構互聯總線的瞬時電流尖峰。這個問題牽涉到CPU和GPU的調度協同——張京京,趙靜那邊的小芯團隊有沒有可能介入?」
林薇和張京京對視了一眼,然後林薇說:「我們討論過。趙靜的小芯3.0在AI任務調度上有非常成熟的預判模型,可以用機器學習提前預測GPU的負載峰值,然後在CPU側做預調度——提前把非緊急任務移出關鍵路徑,拉平瞬時電流尖峰。但這需要羲和架構的GPU驅動層對小芯開放深度接口。」
「開放。」章宸沒有任何猶豫,「告訴趙靜,從今天起小芯團隊正式加入天權6號的功耗攻堅組。她的預判模型需要什麼數據,羲和架構就開放什麼數據。權限不夠就改權限,接口不夠就加接口。」
他在白板上的「鍾」和「漏」旁邊,又寫了一個大大的「調」字。時鐘重構、漏電優化、調度協同——三條線構成了天權6號熱功耗攻堅的核心路線圖。
方案確定後,團隊開始分工推進。張京京負責多時鐘域設計的RTL修改,她帶著八名微架構工程師直接搬進了研究院的封閉開發區,桌上堆滿了時序分析報告和功耗仿真腳本。林薇親自盯著自適應偏置校準電路的模擬驗證,這個電路需要和羲和架構的物理設計緊密耦合,任何一個版圖調整都可能影響到其他模塊的布局布線。
趙靜接到通知後不到一小時就趕到了中央研究院。她帶著小芯團隊的三名核心工程師,在會議室里和林薇的GPU架構團隊進行了一場長達四個小時的技術對接。雙方在開放接口的深度上反覆拉扯——GPU團隊擔心開放過多底層接口會影響晶片安全性,小芯團隊則認為接口深度不夠就做不出精準的負載預判。最終章宸親自拍板:羲和架構的GPU驅動層向小芯開放全部性能監控接口和百分之八十的調度控制接口,核心安全接口保留,但設立聯合安全審計機制,小芯團隊可以查看安全接口的調用日誌但不直接操作。
「這是未來科技內部最大規模的一次跨團隊技術融合。」林薇在當晚的進展總結會上說,「天權6號不是一顆傳統意義上的晶片,它是CPU、自研GPU、小芯AI調度引擎和天罡OS的深度耦合體。熱功耗攻堅看上去是硬體問題,實際上需要軟硬體協同才能徹底解決。」
攻堅進行了整整一周。
張京京的多時鐘域設計方案在第三天完成了RTL初版,經過兩輪功能驗證後進入功耗仿真。初步仿真結果顯示,四時鐘域架構將張量陣列的動態功耗波動幅度壓縮了百分之四十三,略超預期。但時序收斂成了新的痛點——四個時鐘域之間的數據交換需要一個額外的同步緩衝層,這個緩衝層引入了大約零點三納秒的延遲。
「零點三納秒。」張京京盯著時序報告,手指無意識地敲著桌面,「在GPU主頻兩吉赫茲的情況下,零點三納秒等於百分之六十個時鐘周期。對於實時渲染和AI推理這種對延遲敏感的任務,這個代價太大了。」
她和團隊在封閉開發區里又熬了兩天,最終找到了一個精巧的解決方案:把同步緩衝層從數據通路中拆出來,改為一個獨立的「影子寄存器組」,四個時鐘域各自配一個影子寄存器,域間數據交換通過影子寄存器異步完成,不經過主數據通路。這個方案增加了一點三平方毫米的晶片面積,但把延遲代價從零點三納秒壓縮到了零點零八納秒。
林薇的自適應偏置校準電路也在第五天通過了模擬驗證。她在SPICE仿真中注入了從零下四十度到一百二十五度的溫度掃描,校準電路在全溫度範圍內將差分對的靜態偏置電流波動控制在正負百分之二以內。加上趙靜團隊的動態偏置電壓調度算法,GPU與共享緩存之間數據通路的靜態漏電功耗下降了百分之六十二,遠超最初設定的目標。
最複雜的是第三條線——異構互聯總線的瞬時電流尖峰。趙靜的小芯預判模型在接入羲和架構的底層數據後,經過三輪疊代訓練,將GPU負載峰值的預測準確率提升到了百分之九十四。但真正的挑戰不在預測,而在於CPU側的預調度能否在納秒級的時間窗口內完成。小芯團隊和GPU驅動團隊聯合攻關了整整六天,重構了CPU的調度棧,將預調度的響應延遲從十二納秒壓縮到了三納秒以內。
第七天下午,三條線的成果在聯合仿真平台上匯合。林薇按下了全工況功耗仿真的啟動鍵,整層樓的技術人員都圍到了屏幕前。仿真數據逐項跳出——CPU核心功耗正常,GPU紋理處理單元功耗正常,張量計算陣列動態功耗下降百分之四十一,數據通路靜態漏電功耗下降百分之六十二,異構互聯瞬時電流尖峰被壓平了百分之七十八。
最後一行數據彈出:全工況實測功耗四十六點三瓦。
比目標值高出一點三瓦。
會議室里安靜了片刻,然後林薇開口了:「一點三瓦,用封裝層面的散熱優化可以吃掉。這不是失敗,是成功。」
章宸看著屏幕上的數據,忽然露出了這七天來的第一個笑容。天權6號的熱功耗攻堅,核心問題已經解決了。剩下的一點三瓦裕量完全在封裝散熱的可控範圍內——梁志遠那邊的追光四期先進封裝團隊已經在做高導熱封裝基板的驗證,實驗室數據顯示可以將封裝熱阻降低百分之十五左右,足夠覆蓋這最後的一點三瓦。
「七個月。」章宸說,「從今天算起,天權6號的流片倒計時還有十個月。扣除三個月的後端物理設計和流片準備,我們還有七個月的時間完成全部前端設計的收斂。熱功耗攻堅打掉了最大的攔路虎,接下來就是穩步推進——時鐘樹、漏電電路、調度接口,三個模塊的優化方案直接寫進羲和架構的正式設計基線。」
林薇已經在安排下一步的工作計劃。張京京負責把時鐘域設計和影子寄存器方案正式合入RTL主線。趙靜負責把預調度接口固化並編寫安全審計文檔。林薇自己則開始籌備天權6號的第一次完整功能驗證。
散會後,章宸單獨叫住了林薇。兩人走到走廊盡頭的窗邊,窗外合城產業園的燈火在夜色中鋪展開來,追光四期廠房的輪廓清晰可見。
「羲和架構的GPU核心,這次從頭到尾都是自研。」章宸說,「天權4號解決了有沒有的問題,天權5號在4號基礎上做了冗餘設計的疊代,天權6號則是第一次真正意義上的架構重構。異構計算這條路走通之後,天權7號的3D堆疊就有了一個堅實的底座。」
林薇看著窗外的燈火,沉默了一會兒,然後說:「自研GPU架構這件事,三年前還寫在風險清單里。現在它變成了我們的護城河。」
「三年。」章宸重複了一遍這個詞,點了點頭。
走廊另一端,章宸的終端震動了一下。他低頭看了一眼,是方程從南洋發來的消息:智慧教室試點在新加坡五所學校全部完成部署,首批數據將在兩周內回收。同時,李明哲從法蘭克福傳來消息,歐羅巴安全協定第七條款的B版本已經進入正式表決程序,表決日期定在十天後。火龍聯盟在表決前夕向所有歐陸成員國發出了一份新的技術安全評估補充報告,措辭比上一版更為強硬。
挑戰不會排隊,它們總是同時抵達。章宸收起終端,拍了拍林薇的肩膀:「讓團隊休息一天。接下來的硬仗還很多。」
他轉身朝電梯走去,身後的中央研究院依舊燈火通明。天權6號的功耗曲線在屏幕上穩定運行著,四十六點三瓦——這個數字像一枚釘子,把未來科技在異構計算領域的旗幟釘在了技術高地上。而在這片高地的更遠處,更複雜的3D堆疊、更嚴苛的先進封裝、以及即將到來的崑崙基金二期課題,正在夜色中等待破曉。
章宸從法蘭克福飛回時是凌晨三點,他沒有回家,直接讓司機開到了研究院樓下。電梯門打開,走廊里的空氣混雜著助焊劑和咖啡的味道——那是晶片驗證團隊連續作戰的標誌性氣息。林薇的辦公室門半掩著,裡面傳出低啞的討論聲。
推門進去,林薇正對著三塊屏幕上的熱成像圖蹙眉。她的眼圈發青,頭髮隨意扎在腦後,白大褂袖口沾著一塊不知什麼時候蹭上的導熱矽脂。張京京坐在她旁邊,手裡捏著一份剛列印出來的失效分析報告,紙面上密密麻麻標註著紅色批註。章宸的突然出現讓兩人同時抬頭,林薇沒有寒暄,直接把中間那塊屏幕轉向他。
「天權6號工程樣片,第二次全工況熱測試。目標功耗四十五瓦,實測峰值五十五瓦,超出目標值百分之二十二。」她用手指在屏幕上的熱成像圖上畫了一個圈,「熱量集中在GPU計算核心區域,這個區域的功率密度已經超過了每平方毫米零點八瓦,比天權5號高出一倍半。再往上加散熱方案就只能上液冷,但我們的目標場景是終端設備,液冷不是選項。」
章宸拉過一把椅子坐下,仔細看了一遍熱成像圖的每一處熱點分布。天權6號採用的是異構計算架構,CPU核心群和自研GPU核心群集成在同一顆晶片上,通過高速互聯總線交換數據。熱成像顯示,CPU核心區域溫度正常,但GPU核心區域出現了三個明顯的熱點——分別對應紋理處理單元、張量計算陣列和緩存控制器。其中張量計算陣列的熱點溫度最高,局部結溫已經逼近一百一十度的安全紅線。
「泄漏源定位了嗎?」章宸問。
張京京把失效分析報告攤開在桌上。她用紅筆圈出了三個位置:「第一泄漏源是張量計算陣列的時鐘樹。我們在設計時為了追求算力密度,把張量陣列的時鐘頻率拉得太高,導致動態功耗超出預算三十一個百分點。第二泄漏源是GPU與共享緩存之間的數據通路,位寬二百五十六比特,全速運行時靜態漏電功耗比仿真數據高了四點七倍。第三泄漏源最麻煩——GPU核心與CPU核心之間的互聯總線,異構調度時頻繁的上下文切換產生了大量的瞬時電流尖峰,這些尖峰在仿真階段被平均化處理了,沒有引起足夠重視。」
「仿真掩蓋了峰值問題。」章宸一語道破。
林薇點頭:「天權5號的冗餘設計仿真良率百分之九十九,這套方法論在5號上很成功,團隊就慣性延續到了6號。但異構計算的動態功耗波動幅度遠大於同構架構,用平均功耗代替峰值功耗做仿真,等於把最危險的部分平滑掉了。」她調出另一組數據,「我們在仿真里看到的是四十五瓦的平均熱功耗,但實際工作負載下,GPU張量陣列被調用的瞬間,功耗會在幾納秒內衝到五十五瓦,然後快速回落。這種尖峰式熱衝擊比持續高溫更致命——它不僅影響穩定性,還會加速電子遷移,縮短晶片壽命。」
問題徹底攤開了。三個泄漏源,兩個在設計層面,一個在方法論層面。留給團隊的時間並不寬裕——天權6號的流片窗口定在十個月後,而解決熱功耗問題需要重新設計GPU核心的部分微架構,從RTL修改到功能驗證再到物理設計,每一步都卡在臨界線上。
章宸沒有急於定方案,而是問了一個問題:「自研GPU架構和之前用的第三方GPU IP相比,設計複雜度增加了多少?」
林薇從抽屜里拿出一張架構對比圖。天權5號使用的是經過深度定製的第三方GPU IP核,性能不錯但架構黑盒,無法做底層的功耗優化。天權6號的自研GPU架構名為「羲和」,從指令集到微架構全部自研,張量計算陣列、紋理處理單元、緩存層次結構都經過了重新設計,算力密度比第三方IP高出百分之四十,但功耗控制也相應複雜了一倍以上。
「自研架構的方向沒有錯。」林薇的語氣很堅定,「第三方GPU IP的黑盒限制我們只能做外圍優化,相當於在別人打好的地基上蓋房子。羲和架構讓我們第一次擁有了GPU底層設計的完整自由度,這次熱功耗問題暴露的恰恰是我們可以通過架構優化來解決的——時鐘樹可以重構,數據通路可以重布,互聯協議可以重寫。如果還在用第三方IP,遇到同樣的功耗問題我們連改的權限都沒有。」
這話讓章宸想起陳醒在啟動「補天」計劃時說的那句「我們也能寫EDA」。自研的代價是踩坑,但不自研的代價是把命脈交在別人手裡。兩害相權,未來科技選前者。
「三個泄漏源,分三條線同時攻堅。」章宸在白板上畫了一個三叉戟結構,「第一條線,張量計算陣列的時鐘樹重構。目標是把動態功耗降回預算線以內,但不能犧牲算力密度——天權6號的AI推理性能是我們的核心賣點,不能因為解決功耗問題就把性能優勢丟掉。」
張京京接話:「可以用多時鐘域設計,把張量陣列按工作負載分成四個獨立的時鐘域。輕負載時只激活一個域,重負載時四個域並行,這樣平均功耗和峰值功耗之間的波動幅度可以壓縮百分之四十以上。代價是控制邏輯複雜一些,RTL代碼量增加大約百分之十五。」
「做。」章宸在白板上寫下一個「鍾」字,「第二條線,數據通路靜態漏電優化。四百七十倍的仿真偏差,說明我們的漏電模型本身就有問題。」
林薇從桌上翻出一份技術文檔,遞給章宸:「根源找到了。GPU與共享緩存之間的數據通路用的是高速LVDS差分信號,仿真時我們用的是常溫下的漏電參數。但實際工作中,GPU核心溫度升高後,差分對的共模電壓會漂移,導致靜態偏置電流增大。這個問題可以通過兩個手段解決——硬體層面引入自適應偏置校準電路,軟體層面讓天罡OS實時監控溫度並動態調整偏置電壓。」
「自適應偏置校準電路的複雜度呢?」
「大概增加百分之三的晶片面積。但可以換來靜態漏電功耗下降六成。」
「值得。」章宸在「鍾」字旁邊寫了一個「漏」字,「第三條線,異構互聯總線的瞬時電流尖峰。這個問題牽涉到CPU和GPU的調度協同——張京京,趙靜那邊的小芯團隊有沒有可能介入?」
林薇和張京京對視了一眼,然後林薇說:「我們討論過。趙靜的小芯3.0在AI任務調度上有非常成熟的預判模型,可以用機器學習提前預測GPU的負載峰值,然後在CPU側做預調度——提前把非緊急任務移出關鍵路徑,拉平瞬時電流尖峰。但這需要羲和架構的GPU驅動層對小芯開放深度接口。」
「開放。」章宸沒有任何猶豫,「告訴趙靜,從今天起小芯團隊正式加入天權6號的功耗攻堅組。她的預判模型需要什麼數據,羲和架構就開放什麼數據。權限不夠就改權限,接口不夠就加接口。」
他在白板上的「鍾」和「漏」旁邊,又寫了一個大大的「調」字。時鐘重構、漏電優化、調度協同——三條線構成了天權6號熱功耗攻堅的核心路線圖。
方案確定後,團隊開始分工推進。張京京負責多時鐘域設計的RTL修改,她帶著八名微架構工程師直接搬進了研究院的封閉開發區,桌上堆滿了時序分析報告和功耗仿真腳本。林薇親自盯著自適應偏置校準電路的模擬驗證,這個電路需要和羲和架構的物理設計緊密耦合,任何一個版圖調整都可能影響到其他模塊的布局布線。
趙靜接到通知後不到一小時就趕到了中央研究院。她帶著小芯團隊的三名核心工程師,在會議室里和林薇的GPU架構團隊進行了一場長達四個小時的技術對接。雙方在開放接口的深度上反覆拉扯——GPU團隊擔心開放過多底層接口會影響晶片安全性,小芯團隊則認為接口深度不夠就做不出精準的負載預判。最終章宸親自拍板:羲和架構的GPU驅動層向小芯開放全部性能監控接口和百分之八十的調度控制接口,核心安全接口保留,但設立聯合安全審計機制,小芯團隊可以查看安全接口的調用日誌但不直接操作。
「這是未來科技內部最大規模的一次跨團隊技術融合。」林薇在當晚的進展總結會上說,「天權6號不是一顆傳統意義上的晶片,它是CPU、自研GPU、小芯AI調度引擎和天罡OS的深度耦合體。熱功耗攻堅看上去是硬體問題,實際上需要軟硬體協同才能徹底解決。」
攻堅進行了整整一周。
張京京的多時鐘域設計方案在第三天完成了RTL初版,經過兩輪功能驗證後進入功耗仿真。初步仿真結果顯示,四時鐘域架構將張量陣列的動態功耗波動幅度壓縮了百分之四十三,略超預期。但時序收斂成了新的痛點——四個時鐘域之間的數據交換需要一個額外的同步緩衝層,這個緩衝層引入了大約零點三納秒的延遲。
「零點三納秒。」張京京盯著時序報告,手指無意識地敲著桌面,「在GPU主頻兩吉赫茲的情況下,零點三納秒等於百分之六十個時鐘周期。對於實時渲染和AI推理這種對延遲敏感的任務,這個代價太大了。」
她和團隊在封閉開發區里又熬了兩天,最終找到了一個精巧的解決方案:把同步緩衝層從數據通路中拆出來,改為一個獨立的「影子寄存器組」,四個時鐘域各自配一個影子寄存器,域間數據交換通過影子寄存器異步完成,不經過主數據通路。這個方案增加了一點三平方毫米的晶片面積,但把延遲代價從零點三納秒壓縮到了零點零八納秒。
林薇的自適應偏置校準電路也在第五天通過了模擬驗證。她在SPICE仿真中注入了從零下四十度到一百二十五度的溫度掃描,校準電路在全溫度範圍內將差分對的靜態偏置電流波動控制在正負百分之二以內。加上趙靜團隊的動態偏置電壓調度算法,GPU與共享緩存之間數據通路的靜態漏電功耗下降了百分之六十二,遠超最初設定的目標。
最複雜的是第三條線——異構互聯總線的瞬時電流尖峰。趙靜的小芯預判模型在接入羲和架構的底層數據後,經過三輪疊代訓練,將GPU負載峰值的預測準確率提升到了百分之九十四。但真正的挑戰不在預測,而在於CPU側的預調度能否在納秒級的時間窗口內完成。小芯團隊和GPU驅動團隊聯合攻關了整整六天,重構了CPU的調度棧,將預調度的響應延遲從十二納秒壓縮到了三納秒以內。
第七天下午,三條線的成果在聯合仿真平台上匯合。林薇按下了全工況功耗仿真的啟動鍵,整層樓的技術人員都圍到了屏幕前。仿真數據逐項跳出——CPU核心功耗正常,GPU紋理處理單元功耗正常,張量計算陣列動態功耗下降百分之四十一,數據通路靜態漏電功耗下降百分之六十二,異構互聯瞬時電流尖峰被壓平了百分之七十八。
最後一行數據彈出:全工況實測功耗四十六點三瓦。
比目標值高出一點三瓦。
會議室里安靜了片刻,然後林薇開口了:「一點三瓦,用封裝層面的散熱優化可以吃掉。這不是失敗,是成功。」
章宸看著屏幕上的數據,忽然露出了這七天來的第一個笑容。天權6號的熱功耗攻堅,核心問題已經解決了。剩下的一點三瓦裕量完全在封裝散熱的可控範圍內——梁志遠那邊的追光四期先進封裝團隊已經在做高導熱封裝基板的驗證,實驗室數據顯示可以將封裝熱阻降低百分之十五左右,足夠覆蓋這最後的一點三瓦。
「七個月。」章宸說,「從今天算起,天權6號的流片倒計時還有十個月。扣除三個月的後端物理設計和流片準備,我們還有七個月的時間完成全部前端設計的收斂。熱功耗攻堅打掉了最大的攔路虎,接下來就是穩步推進——時鐘樹、漏電電路、調度接口,三個模塊的優化方案直接寫進羲和架構的正式設計基線。」
林薇已經在安排下一步的工作計劃。張京京負責把時鐘域設計和影子寄存器方案正式合入RTL主線。趙靜負責把預調度接口固化並編寫安全審計文檔。林薇自己則開始籌備天權6號的第一次完整功能驗證。
散會後,章宸單獨叫住了林薇。兩人走到走廊盡頭的窗邊,窗外合城產業園的燈火在夜色中鋪展開來,追光四期廠房的輪廓清晰可見。
「羲和架構的GPU核心,這次從頭到尾都是自研。」章宸說,「天權4號解決了有沒有的問題,天權5號在4號基礎上做了冗餘設計的疊代,天權6號則是第一次真正意義上的架構重構。異構計算這條路走通之後,天權7號的3D堆疊就有了一個堅實的底座。」
林薇看著窗外的燈火,沉默了一會兒,然後說:「自研GPU架構這件事,三年前還寫在風險清單里。現在它變成了我們的護城河。」
「三年。」章宸重複了一遍這個詞,點了點頭。
走廊另一端,章宸的終端震動了一下。他低頭看了一眼,是方程從南洋發來的消息:智慧教室試點在新加坡五所學校全部完成部署,首批數據將在兩周內回收。同時,李明哲從法蘭克福傳來消息,歐羅巴安全協定第七條款的B版本已經進入正式表決程序,表決日期定在十天後。火龍聯盟在表決前夕向所有歐陸成員國發出了一份新的技術安全評估補充報告,措辭比上一版更為強硬。
挑戰不會排隊,它們總是同時抵達。章宸收起終端,拍了拍林薇的肩膀:「讓團隊休息一天。接下來的硬仗還很多。」
他轉身朝電梯走去,身後的中央研究院依舊燈火通明。天權6號的功耗曲線在屏幕上穩定運行著,四十六點三瓦——這個數字像一枚釘子,把未來科技在異構計算領域的旗幟釘在了技術高地上。而在這片高地的更遠處,更複雜的3D堆疊、更嚴苛的先進封裝、以及即將到來的崑崙基金二期課題,正在夜色中等待破曉。