第3章 計劃

投票推薦 加入書籤 小說報錯

  陳陽回到宿舍推開門,室友都已經回來了。

  徐子楓戴著耳機,正打著遊戲,時不時爆出一句:

  「兄弟們頂住!這波能翻!「

  李明軒在坐位上捧著一本厚厚的英文原版書在看;

  趙俊豪則在陽台上打電話。

  「回來了?「

  聽到開門聲,李明軒抬頭看了他一眼。

  「嗯。「

  陳陽打了聲招呼後,便回到床鋪拿出換洗衣服去洗澡。

  熱水沖在身上,水汽驅散了晚飯時的酒意和一身的疲憊。

  洗完澡出來,陳陽擦著頭髮坐到書桌前,打開手機。

  屏幕有一條未讀消息。

  「我到宿舍啦。謝謝你陪我散步,感覺沒那麼緊張了。」

  是沈清雪十幾分鐘前發的。

  陳陽嘴角微微上揚,指尖在屏幕上輕點:

  「早點休息。明天還要領軍訓物資。「

  消息幾乎是秒回。

  「好~室友她們正在熱烈討論咱們學校的男生質量[偷笑]「

  「結論呢?「

  「她們說姚班的大神個個都神神秘秘的,都在猜你是不是那種只會讀書的書呆子。[壞笑]「

  「那你怎麼說?「

  「我說……保密![吐舌頭]「

  陳陽失笑,還學會賣關子了。

  「好啦不逗你了,晚安啦!做個好夢~[月亮]「

  「晚安。「

  放下手機,陳陽爬上床鋪。

  夜色漸深,室友們的聲響逐漸平息,只剩下徐子楓偶爾的滑鼠點擊聲。

  陳陽的思緒徹底沉澱下來,開始梳理後續的計劃。

  考入姚班,只是他龐大計劃的第一步。

  「第一階段:立足」

  軍訓是緩衝期,但真正的戰鬥在九月就要打響。

  姚教授是姚班的靈魂人物,也是國內計算機領域的泰斗。

  他打算在開學後,他需要讓姚教授注意到自己。

  有了初步的關注,下一步就是「成果」。

  暑假參加的那場比賽,結果大概會在10月初公布。

  如果一切順利,那將是他的「敲門磚「。

  但光有敲門磚還不夠。

  他要提前準備相關的論文,把核心說清楚。

  一種全新的「大腦「結構,讓電腦「看「圖片的能力產生質的飛躍。

  在此之前,電腦識別一張貓的照片還很費勁。

  而「啟示網絡「能讓它輕鬆看懂成千上萬種事物。

  這篇論文,將是他在學術界的第一塊招牌。

  但學術聲譽,還不夠。

  陳陽的思緒轉向了更現實的問題。

  錢,做AI,最燒的就是錢。

  論文發表帶來的名氣,還能反哺他現在的「小金庫「——星城數據服務。

  他要趁著這股東風,迅速拓展公司的新業務。

  不再局限於單一的驗證碼識別。

  圖像識別、文字識別、金融票據處理……

  每一個都是金礦。

  這些業務一旦跑通,就能帶來更穩定、更龐大的現金流。

  「必須在10月結果公布之前,把這些功能都做出來。「

  陳陽在心裡盤算著時間。

  接下來這段時間,會很忙。

  之後將進入第二階段:基建。

  名氣有了,業務也在跑。

  但這些錢,還遠遠不夠。

  「錢」

  陳陽想到了A股。

  12年底,全球最大的「提款機「不在納斯達克,而在國內的創業板。

  從12年底到13年上半年,一場圍繞移動網際網路的題材狂歡正在醞釀。


  而手遊,就是這場狂歡的引爆點。

  陳陽的目標是兩隻股票:中青寶(300052)和掌趣科技(300315)。

  「利用星城數據這幾個月賺的錢,全倉賭一個時間差。」

  他要的不是價值投資,而是快速積累資本。

  「到13年5、6月份,手遊概念最瘋狂的時候,準時套現。「

  至少4倍,甚至5倍的利潤。

  這筆錢,將是他啟動「軍火庫「的第一桶金。

  他要用來提前訂購GPU——顯卡。

  做AI的人都知道,GPU才是真正的彈藥。

  陳陽沉吟片刻。

  「憑藉ImageNet冠軍和論文的名氣,在國內找VC融個幾百萬天使輪,應該不難。「

  第三階段:發布模型。

  有了錢,有了名氣。

  他的最終目的,才真正開始。

  陳陽的呼吸微微急促起來。

  「13年顯卡到來之前,必須完成三件事。「

  第一,搭建大模型基礎框架——一套屬於自己的深度學習框架。

  第二,Transformer架構。

  這是他最大的底牌。

  他要提前「發明「這個基於「注意力機制「的劃時代模型。

  它將是未來所有大語言模型的基石。

  第三,小模型。

  基於新框架和Transformer架構,做出一個參數量在20億到30億的「小「模型。

  「這個方案已經是極限了。「

  陳陽在心裡默念:

  「必須在13年底完成訓練。2014年1月,準時發布。「

  「第三階段:發布模型」

  有了錢和名氣,他的最終目的才真正開始。

  「13年,必須完成三件事。」

  大模型基礎框架:搭建一套屬於自己的深度學習框架。

  陳陽在心裡默念著這個計劃的核心。

  深度學習框架,說白了就是AI的「作業系統「。

  它要解決兩個最核心的問題:模型並行和模型通信。

  2012年,單塊顯卡的顯存只有幾個G,根本裝不下一個大模型。

  唯一的辦法,就是把模型「切開「——一部分放在這塊顯卡,一部分放在那塊顯卡,讓它們協同工作。

  就像一本太厚的書,一個人拿不動,只能撕成幾本,分給幾個人同時看。

  這是模型並行。

  但問題來了——這幾個人需要頻繁交流,才能把內容串起來。

  顯卡之間也一樣,它們要不斷傳遞數據,互相配合。

  這就是模型通信。

  如果通信效率低,幾塊顯卡互相等待,再多顯卡也沒用。

  這兩個技術,將是未來做大模型的核心基礎。

  誰掌握了高效的模型並行和通信,誰就能訓練更大的模型。

  陳陽很清楚,現在市面上,這兩塊幾乎還是一片空白。

  他要做的,就是一套支持大規模模型並行和高效通信的框架。

  等這套框架成熟了,別人想做大模型,就得用他的「作業系統「。

  那時候,他就掌握了整個行業的底層規則。

  Transformer架構:

  這是他最大的底牌。

  為什麼Transformer是跨時代的?

  兩個原因。

  第一,它能理解前後關係。

  傳統技術一個字一個字往後看,看到後面,前面就忘了。

  Transformer基於「注意力機制「,能看懂一句話里,哪些詞和哪些詞有關係。

  比如「他拿起蘋果,咬了一口「——它知道「咬「和「蘋果「有關聯。


  這讓AI第一次能真正「讀懂「一段話。

  第二,它能並行處理。

  傳統模型必須一個字一個字按順序處理。

  Transformer可以同時處理所有字,效率高出幾十倍。

  這兩個特性,讓Transformer成為未來所有大語言模型的基石。

  陳陽要提前把它「發明「出來。

  最後基於新的框架和Transformer架構,做出一個參數量在30億(3B)的小模型。

  「30億參數...「

  陳陽很清楚這個數字意味著什麼。

  在FP32精度訓練中,光是模型權重就需要12GB顯存。

  但訓練時,還要存儲梯度、優化器狀態...

  總共需要超過100GB的顯存。

  「2013年11月,K40顯卡發布。「

  陳陽在心裡盤算著時間節點。

  K40是英偉達即將推出的新一代旗艦計算卡,12GB顯存,性能強悍。

  「要容納100GB的訓練顯存,用12GB的K40來算...「

  陳陽在腦海中快速計算。

  「至少需要9張卡,才能勉強裝下這個模型。「

  但他的眉頭很快皺了起來。

  「只有9張卡,訓練速度太慢了。到14年年中?恐怕到15年都訓不完!「

  他的目標是4個月內完成訓練。

  怎麼辦?

  陳陽的眼中閃過一道精光。

  「唯一的辦法——數據並行。「

  把這個9卡組合的最小單元,再複製4套。

  讓4個模型同時開工。

  9張卡× 4套= 36張卡。

  「這樣才能4個月內完成訓練。「

  陳陽在心裡默念。

  「必須提前訂購,等11月硬體到位,立刻開始訓練。「

  「趁著14年初谷歌6億美金收購DeepMind(一個人工智慧公司)的熱度,年中發布模型。「

  到時候,當所有人還在為識別貓狗而歡呼時,他要拿出一個30億參數的語言模型。

  那不是領先一步,而是領先一個時代。

  屆時,全世界的目光,無論是學術界還是投資界,都將被迫匯聚到他身上。

  他將有足夠的資本和話語權,去迎接即將到來的、波瀾壯闊的人工智慧大時代。

  窗外傳來幾聲犬吠,打破了深夜的寂靜。

  陳陽長長地吐出一口氣,接下來有的忙了。

章節目錄