第272章 最終驗證

投票推薦 加入書籤 小說報錯

  全尺寸的晶片測試,比之前簡單的測試流程要麻煩的多。之前的測試,只是驗證架構可以成功。這次需要測試,各種完整的特徵化數據。

  聖誕前夕,極光集團的幾大頭目,陳一然還有庫克,甲骨文的埃里森,貝恩資本的康納利,以及大通銀行的代表在FlowEDA聽了高德偉的正式匯報,也第一次看到了兩個完整款的摩卡和拿鐵晶片。

  和之前小單元的測試片不同,這次兩個全尺寸版本上面的計算陣列已經是完整版。

  測試片只放了一個最小可驗證單元,摩卡是16乘16的脈動陣列切片,拿鐵是8乘8。

  現在這兩顆,摩卡的裸片比測試片大了將近三倍,三百二十平方毫米的矽片上密布著完整的脈動陣列和周圍一圈SRAM緩存塊,PCIe PHY、四組PLL、DMA引擎全在。

  拿鐵用萬果園的40納米工藝,電晶體本身就比28納米大,全尺寸撐到了四百八十平方毫米,封裝的測試座里金線密度比測試片密了不止一倍。

  高德偉把一顆摩卡樣品放在桌上,開始正式匯報。

  「我們進行了兩周的測試,摩卡三十顆樣品,拿鐵三十二顆。兩邊都過了全部測試項,沒有需要改金屬層的問題。

  先做的是上電。摩卡的七個獨立電源域,我們是按順序一個一個往上加的,先走核心邏輯的電壓,然後接口的,然後PLL模擬的,然後是片上SRAM的獨立供電,再到PCIe收發器的,最後是備用IO的。

  每加一條電源軌的時候,我們同時拿數字萬用表去採樣對地阻抗,這個數字要是掉到了零點幾歐姆那個範圍,那就不用往下測了,說明內部直接短路了。

  最終摩卡的第一顆加完之後,對地阻抗穩在了手冊中值的3%以內。拿鐵那邊是五個電源域,比摩卡少兩個,它的偏差就大了一點,到了5.7%,但也全都在安全區間。

  拿鐵的PDK精度一直就比三星的要差一些,不過這個差距從上一輪測試片的時候就已經是這樣了,到現在也沒繼續擴大,所以問題不大。

  接著是時鐘。摩卡有四組PLL,這四組是各管各的,一組給計算核心供時鐘,一組給存儲控制器,一組給PCIe,還有一組給內存控制器。

  拿鐵就沒有那麼複雜,它一共就兩組,因為它的控制邏輯簡單很多,不需要配那麼多獨立的時鐘域。

  鎖相這個事其實就是拿低頻的參考時鐘往裡面灌,然後一步一步地往高了拉頻率,每一次步進之後等個0.5毫秒,去看PLL的輸出有沒有跟上來。

  摩卡這邊從1.2GHz開始拉的,一直拉到1.6GHz,整個鎖相的曲線很漂亮,基本是線性的,四次的步進每一次鎖相時間都在0.3毫秒以內。

  拿鐵從500MHz拉到800MHz這個過程中間在760MHz附近的時候稍微卡了一下,比正常的鎖相速度慢了0.15毫秒。

  這不是很意外,因為上一輪的拿鐵測試片在PLL這塊已經出過類似的問題了,當時是鎖定範圍窄了一大截。這一次更新了PDK之後鎖定範圍是恢復了,但是這個0.15毫秒的延遲沒完全消掉。

  我們後來分析了一下,覺得應該是40納米工藝下面的壓控振盪器,它的電感Q值在低頻段那個位置建模本身就偏了。

  這個東西靠改設計是改不了的,只能等以後萬果園那邊自己把工藝疊代上去。好在這個不影響功能,不會失鎖。

  掃描鏈就比較簡單了,就是JTAG往裡邊灌一串01的序列,讓它穿過所有的寄存器之後再讀回來。

  摩卡的三十顆全部通過了。拿鐵的三十二顆裡面有兩顆在IO環的位置附近回讀延遲偏高了大概三個時鐘周期,數據倒是沒丟。這個不致命,後續量產的時候跟著看就行。

  SRAM這一塊,上一輪是最讓我們頭疼的。

  摩卡的測試片當時在低壓角那個位置出了兩個連續的弱bit,這次全尺寸版三個電壓角全部通過了,而且當初設計的時候就留了冗餘行替換的空間,真出了問題也能修。

  拿鐵上一輪的問題更麻煩一點,是高頻的時候SRAM比特翻轉,後來查出來是PDK裡邊金屬通孔的寄生電容參數偏了幾飛法,更新了PDK模型之後重新校了一遍,這次測試也是三個電壓角全過了。

  還有個事我覺得值得說一下。摩卡和拿鐵用的是同一個脈動陣列的架構,記憶體接口這塊在設計初期就做成了工藝無關的抽象層,兩邊只換了電晶體的物理實現,沒動任何邏輯結構。


  所以這次SRAM的通過率一致性比我們當初預期的要高不少,說明架構本身是沒問題的。

  當初做工藝無關抽象層的時候,其實組裡有幾個人是反對的,說兩邊分開優化性能會更好。

  但現在回頭看,如果不做成抽象層的話,摩卡和拿鐵就得各自維護一套存儲接口的控制邏輯,到時候哪邊出了bug都得單獨查,搞不好就變成摩卡在修A問題拿鐵在修B問題,兩邊永遠對不齊。

  現在這個結果,我覺得當時那一層抽象沒白做。

  計算單元的功能測試,是過了前面那些電氣驗證之後才開始的。

  我們把預存的矩陣乘法向量加載到片上的SRAM裡面,用DMA引擎推進計算陣列,FP32跑一輪,FP16跑一輪,INT8再跑一輪,每一輪都和CPU那邊的參考值逐位去比對。

  摩卡這邊FP32的偏差只有0.15%,INT8的吞吐量到了規格書的103%。拿鐵FP32偏差0.24%,INT8吞吐量98%,偏差確實比摩卡大了一點,主要是因為40納米的乘法器電晶體匹配精度天生就比不過28納米。

  但是這兩顆晶片的偏差全都在2%的驗收線以內,也都沒問題。

  然後就是跑完整的網絡。因為卷積層和激活函數這些東西組合在一起的時候,硬體上會觸發一些不同的控制流路徑,比如池化、歸一化、跨層的跳躍連接,光是矩陣乘法跑通了不代表這些都沒問題。

  我們加載了一個三層的卷積網絡,又加載了一個小型的殘差網絡,這兩個網是故意設計成不同極端情況的。

  三層那個數據結構比較密集連續,數據在片上的SRAM裡面不怎麼需要頻繁地換入換出。殘差那個有跨層跳躍,主要是為了測控制邏輯能不能正確地管理好幾路數據流同時進出計算陣列。

  摩卡這邊輸出和參考值的均方誤差是3.2e-6,拿鐵是4.1e-6。

  PCIe帶寬這塊,測的是晶片和外界的管子。

  摩卡走的是PCIe 3.0 x16的接口,DMA引擎雙向的實際帶寬跑到了14.8GB/s。理論的物理層天花板是15.75,但是要扣掉鏈路的編碼開銷和事務層的包頭,有效帶寬的上限大概是14.9左右。

  摩卡的14.8離這個天花板差了不到一個百分點,基本上不是瓶頸。拿鐵那邊走的是PCIe 2.0 x8,跑到了3.6GB/s,理論值是4.0,在預期的範圍裡面。

  功耗特徵化,我們是拿不同比例的負載從0%一直拉到100%,每10%記一次電流,同時用熱成像儀去掃描裸片的表面。

  摩卡滿載的功耗是27.3瓦。上一輪的測試片當時為了穩頻被迫提到了0.95V,功耗多了將近10%。

  現在這一版回到了標稱的0.9V之後,功耗完全落在了30瓦的預算裡面,而且27.3這個數字比手冊的典型值還稍微低了那麼一點,說明28納米工藝的漏電流控制比我們預期的要好。

  拿鐵滿載是18.7瓦,它面對的設備場景對功耗的要求本來也沒那麼嚴,用40納米工藝能做到這個數字,算是合格了。

  熱成像的圖上兩顆晶片的熱點都集中在脈動陣列那一塊,拿鐵在靠近IO環的那一側有一個小的局部熱點,這個是大電流IO驅動器本身的固有發熱,不影響功能的。

  最後就是長時的壓力測試了。

  我們在85度的環境溫度下面讓晶片持續跑全速的矩陣乘法,每十五分鐘去採樣一次精度和功耗。

  摩卡這邊整整四個小時沒有出過一個錯誤的bit。

  拿鐵在三個半小時的時候出過一次bit翻轉,但是下一個採樣周期就自動恢復了,重新測也沒復現。團隊判斷是單粒子效應,宇宙射線剛好撞了一個SRAM的存儲單元,跟晶片本身的設計沒關係。

  基本情況就是這樣。九項測試跑下來,摩卡和拿鐵同時通過,所有的偏差都在驗收線以內,沒有需要修版的問題。這個結果說實話比我預期的要好。

  一個三星28納米,一個萬果園40納米,電晶體的溝道摻雜、金屬層數、光刻精度全都不一樣。在這麼多變量的情況下,同一個脈動陣列架構在兩邊的測試數據能一致到這個程度,我覺得架構本身的設計已經證明是對的了。

  三星那邊的封裝產線大概四周之後可以出第一批的量產封測片,萬果園那邊因為40納米線剛磨合沒多久,大概要五周。


  設計這邊可以直接凍結,我已經讓他們準備加密包了。」

  陳一然揮揮手讓匯報完的高德偉出去,然後看向桌子上的其他人問:「現在看,明年第一季度,一定可以正式量產列裝。你們還有什麼問題嗎?」

  康納利不是專業人士,聽了報告也並不是很清楚這個晶片的性能,看了看手中的文件問:「陳先生,所以這個晶片,現在領先多少?可以完全脫離英偉達?」

  「市面上最接近的產品是英偉達Kepler架構的Tesla K20X,但是他畢竟是傳統的GPU。但是我們這個張量處理器,是專門的張量處理器。

  主要不在於性能,在於同等功耗下,我們的晶片更強。當然,現在的設計,只能做推理不能做訓練。不過我已經有完整的解決方法了,把256塊晶片連成一個訓練集群,同時做前向計算和反向傳播的梯度聚合,就可以了。

  最重要的是,我們的晶片和DeepFlow原生的軟硬協同能力。」

  一旁的庫克看著邊上的埃里森問:「只要晶片開始量產,蘋果這邊需要大量的櫃機,希望甲骨文這邊可以提前釋放產能。我們的各個數據中心都建好了,就等著晶片和櫃機了。」

  埃里森點點頭:「放心吧,我會優先供應蘋果的。我還有一個問題啊,這是否意味著,我們要直接和英偉達撕破臉?最近他們挖人挖得很厲害啊。我們的晶片要往外賣還是完全自己用?如果外賣,必須考慮英偉達全面倒向谷歌的情況。」

  陳一然直接給了結論:「賣是一定要賣的,否則我們現在的鏈條太全了,有壟斷的嫌疑。但是我們不會賣訓練的技術,所以理想狀態是,市場上的英偉達還有AMD的晶片用於訓練,我們的晶片用於推理。

  當然,如果英偉達真的狗急跳牆,全面倒向谷歌。那我們就加大萬果園的技術投資,準備全面供應。這裡面還有一個問題,單獨萬果園的產能還有技術,短時間都很難突破28納米。

  所以三星的問題就得解決一下了,要確保他們和我們完全一條心。

  況且天天看著他靠著我們股價飆升,我們吃不到好處,這可不行!」

  康納利笑著說:「交給我好了,我們會想辦法讓他們讓出一些股份給極光集團的。」

  陳一然想了下說:「極光集團本身盤子就大,當初我還留了一些股份留給戰投,三星如果願意,可以承接一點股份,我們可以交叉持股。

  而且,他們得出現金。極光集團馬上成立一年了,不能去年估值一千億,今年估值還是一千億!」

章節目錄