第3章 計劃
陳陽回到宿舍推開門,室友都已經回來了。
徐子楓戴著耳機,正打著遊戲,時不時爆出一句:
「兄弟們頂住!這波能翻!「
李明軒在坐位上捧著一本厚厚的英文原版書在看;
趙俊豪則在陽台上打電話。
「回來了?「
聽到開門聲,李明軒抬頭看了他一眼。
「嗯。「
陳陽打了聲招呼後,便回到床鋪拿出換洗衣服去洗澡。
熱水沖在身上,水汽驅散了晚飯時的酒意和一身的疲憊。
洗完澡出來,陳陽擦著頭髮坐到書桌前,打開手機。
屏幕有一條未讀消息。
「我到宿舍啦。謝謝你陪我散步,感覺沒那麼緊張了。」
是沈清雪十幾分鐘前發的。
陳陽嘴角微微上揚,指尖在屏幕上輕點:
「早點休息。明天還要領軍訓物資。「
消息幾乎是秒回。
「好~室友她們正在熱烈討論咱們學校的男生質量[偷笑]「
「結論呢?「
「她們說姚班的大神個個都神神秘秘的,都在猜你是不是那種只會讀書的書呆子。[壞笑]「
「那你怎麼說?「
「我說……保密![吐舌頭]「
陳陽失笑,還學會賣關子了。
「好啦不逗你了,晚安啦!做個好夢~[月亮]「
「晚安。「
放下手機,陳陽爬上床鋪。
夜色漸深,室友們的聲響逐漸平息,只剩下徐子楓偶爾的滑鼠點擊聲。
陳陽的思緒徹底沉澱下來,開始梳理後續的計劃。
考入姚班,只是他龐大計劃的第一步。
「第一階段:立足」
軍訓是緩衝期,但真正的戰鬥在九月就要打響。
姚教授是姚班的靈魂人物,也是國內計算機領域的泰斗。
他打算在開學後,他需要讓姚教授注意到自己。
有了初步的關注,下一步就是「成果」。
暑假參加的那場比賽,結果大概會在10月初公布。
如果一切順利,那將是他的「敲門磚「。
但光有敲門磚還不夠。
他要提前準備相關的論文,把核心說清楚。
一種全新的「大腦「結構,讓電腦「看「圖片的能力產生質的飛躍。
在此之前,電腦識別一張貓的照片還很費勁。
而「啟示網絡「能讓它輕鬆看懂成千上萬種事物。
這篇論文,將是他在學術界的第一塊招牌。
但學術聲譽,還不夠。
陳陽的思緒轉向了更現實的問題。
錢,做AI,最燒的就是錢。
論文發表帶來的名氣,還能反哺他現在的「小金庫「——星城數據服務。
他要趁著這股東風,迅速拓展公司的新業務。
不再局限於單一的驗證碼識別。
圖像識別、文字識別、金融票據處理……
每一個都是金礦。
這些業務一旦跑通,就能帶來更穩定、更龐大的現金流。
「必須在10月結果公布之前,把這些功能都做出來。「
陳陽在心裡盤算著時間。
接下來這段時間,會很忙。
之後將進入第二階段:基建。
名氣有了,業務也在跑。
但這些錢,還遠遠不夠。
「錢」
陳陽想到了A股。
12年底,全球最大的「提款機「不在納斯達克,而在國內的創業板。
從12年底到13年上半年,一場圍繞移動網際網路的題材狂歡正在醞釀。
而手遊,就是這場狂歡的引爆點。
陳陽的目標是兩隻股票:中青寶(300052)和掌趣科技(300315)。
「利用星城數據這幾個月賺的錢,全倉賭一個時間差。」
他要的不是價值投資,而是快速積累資本。
「到13年5、6月份,手遊概念最瘋狂的時候,準時套現。「
至少4倍,甚至5倍的利潤。
這筆錢,將是他啟動「軍火庫「的第一桶金。
他要用來提前訂購GPU——顯卡。
做AI的人都知道,GPU才是真正的彈藥。
陳陽沉吟片刻。
「憑藉ImageNet冠軍和論文的名氣,在國內找VC融個幾百萬天使輪,應該不難。「
第三階段:發布模型。
有了錢,有了名氣。
他的最終目的,才真正開始。
陳陽的呼吸微微急促起來。
「13年顯卡到來之前,必須完成三件事。「
第一,搭建大模型基礎框架——一套屬於自己的深度學習框架。
第二,Transformer架構。
這是他最大的底牌。
他要提前「發明「這個基於「注意力機制「的劃時代模型。
它將是未來所有大語言模型的基石。
第三,小模型。
基於新框架和Transformer架構,做出一個參數量在20億到30億的「小「模型。
「這個方案已經是極限了。「
陳陽在心裡默念:
「必須在13年底完成訓練。2014年1月,準時發布。「
「第三階段:發布模型」
有了錢和名氣,他的最終目的才真正開始。
「13年,必須完成三件事。」
大模型基礎框架:搭建一套屬於自己的深度學習框架。
陳陽在心裡默念著這個計劃的核心。
深度學習框架,說白了就是AI的「作業系統「。
它要解決兩個最核心的問題:模型並行和模型通信。
2012年,單塊顯卡的顯存只有幾個G,根本裝不下一個大模型。
唯一的辦法,就是把模型「切開「——一部分放在這塊顯卡,一部分放在那塊顯卡,讓它們協同工作。
就像一本太厚的書,一個人拿不動,只能撕成幾本,分給幾個人同時看。
這是模型並行。
但問題來了——這幾個人需要頻繁交流,才能把內容串起來。
顯卡之間也一樣,它們要不斷傳遞數據,互相配合。
這就是模型通信。
如果通信效率低,幾塊顯卡互相等待,再多顯卡也沒用。
這兩個技術,將是未來做大模型的核心基礎。
誰掌握了高效的模型並行和通信,誰就能訓練更大的模型。
陳陽很清楚,現在市面上,這兩塊幾乎還是一片空白。
他要做的,就是一套支持大規模模型並行和高效通信的框架。
等這套框架成熟了,別人想做大模型,就得用他的「作業系統「。
那時候,他就掌握了整個行業的底層規則。
Transformer架構:
這是他最大的底牌。
為什麼Transformer是跨時代的?
兩個原因。
第一,它能理解前後關係。
傳統技術一個字一個字往後看,看到後面,前面就忘了。
Transformer基於「注意力機制「,能看懂一句話里,哪些詞和哪些詞有關係。
比如「他拿起蘋果,咬了一口「——它知道「咬「和「蘋果「有關聯。
這讓AI第一次能真正「讀懂「一段話。
第二,它能並行處理。
傳統模型必須一個字一個字按順序處理。
Transformer可以同時處理所有字,效率高出幾十倍。
這兩個特性,讓Transformer成為未來所有大語言模型的基石。
陳陽要提前把它「發明「出來。
最後基於新的框架和Transformer架構,做出一個參數量在30億(3B)的小模型。
「30億參數...「
陳陽很清楚這個數字意味著什麼。
在FP32精度訓練中,光是模型權重就需要12GB顯存。
但訓練時,還要存儲梯度、優化器狀態...
總共需要超過100GB的顯存。
「2013年11月,K40顯卡發布。「
陳陽在心裡盤算著時間節點。
K40是英偉達即將推出的新一代旗艦計算卡,12GB顯存,性能強悍。
「要容納100GB的訓練顯存,用12GB的K40來算...「
陳陽在腦海中快速計算。
「至少需要9張卡,才能勉強裝下這個模型。「
但他的眉頭很快皺了起來。
「只有9張卡,訓練速度太慢了。到14年年中?恐怕到15年都訓不完!「
他的目標是4個月內完成訓練。
怎麼辦?
陳陽的眼中閃過一道精光。
「唯一的辦法——數據並行。「
把這個9卡組合的最小單元,再複製4套。
讓4個模型同時開工。
9張卡× 4套= 36張卡。
「這樣才能4個月內完成訓練。「
陳陽在心裡默念。
「必須提前訂購,等11月硬體到位,立刻開始訓練。「
「趁著14年初谷歌6億美金收購DeepMind(一個人工智慧公司)的熱度,年中發布模型。「
到時候,當所有人還在為識別貓狗而歡呼時,他要拿出一個30億參數的語言模型。
那不是領先一步,而是領先一個時代。
屆時,全世界的目光,無論是學術界還是投資界,都將被迫匯聚到他身上。
他將有足夠的資本和話語權,去迎接即將到來的、波瀾壯闊的人工智慧大時代。
窗外傳來幾聲犬吠,打破了深夜的寂靜。
陳陽長長地吐出一口氣,接下來有的忙了。
徐子楓戴著耳機,正打著遊戲,時不時爆出一句:
「兄弟們頂住!這波能翻!「
李明軒在坐位上捧著一本厚厚的英文原版書在看;
趙俊豪則在陽台上打電話。
「回來了?「
聽到開門聲,李明軒抬頭看了他一眼。
「嗯。「
陳陽打了聲招呼後,便回到床鋪拿出換洗衣服去洗澡。
熱水沖在身上,水汽驅散了晚飯時的酒意和一身的疲憊。
洗完澡出來,陳陽擦著頭髮坐到書桌前,打開手機。
屏幕有一條未讀消息。
「我到宿舍啦。謝謝你陪我散步,感覺沒那麼緊張了。」
是沈清雪十幾分鐘前發的。
陳陽嘴角微微上揚,指尖在屏幕上輕點:
「早點休息。明天還要領軍訓物資。「
消息幾乎是秒回。
「好~室友她們正在熱烈討論咱們學校的男生質量[偷笑]「
「結論呢?「
「她們說姚班的大神個個都神神秘秘的,都在猜你是不是那種只會讀書的書呆子。[壞笑]「
「那你怎麼說?「
「我說……保密![吐舌頭]「
陳陽失笑,還學會賣關子了。
「好啦不逗你了,晚安啦!做個好夢~[月亮]「
「晚安。「
放下手機,陳陽爬上床鋪。
夜色漸深,室友們的聲響逐漸平息,只剩下徐子楓偶爾的滑鼠點擊聲。
陳陽的思緒徹底沉澱下來,開始梳理後續的計劃。
考入姚班,只是他龐大計劃的第一步。
「第一階段:立足」
軍訓是緩衝期,但真正的戰鬥在九月就要打響。
姚教授是姚班的靈魂人物,也是國內計算機領域的泰斗。
他打算在開學後,他需要讓姚教授注意到自己。
有了初步的關注,下一步就是「成果」。
暑假參加的那場比賽,結果大概會在10月初公布。
如果一切順利,那將是他的「敲門磚「。
但光有敲門磚還不夠。
他要提前準備相關的論文,把核心說清楚。
一種全新的「大腦「結構,讓電腦「看「圖片的能力產生質的飛躍。
在此之前,電腦識別一張貓的照片還很費勁。
而「啟示網絡「能讓它輕鬆看懂成千上萬種事物。
這篇論文,將是他在學術界的第一塊招牌。
但學術聲譽,還不夠。
陳陽的思緒轉向了更現實的問題。
錢,做AI,最燒的就是錢。
論文發表帶來的名氣,還能反哺他現在的「小金庫「——星城數據服務。
他要趁著這股東風,迅速拓展公司的新業務。
不再局限於單一的驗證碼識別。
圖像識別、文字識別、金融票據處理……
每一個都是金礦。
這些業務一旦跑通,就能帶來更穩定、更龐大的現金流。
「必須在10月結果公布之前,把這些功能都做出來。「
陳陽在心裡盤算著時間。
接下來這段時間,會很忙。
之後將進入第二階段:基建。
名氣有了,業務也在跑。
但這些錢,還遠遠不夠。
「錢」
陳陽想到了A股。
12年底,全球最大的「提款機「不在納斯達克,而在國內的創業板。
從12年底到13年上半年,一場圍繞移動網際網路的題材狂歡正在醞釀。
而手遊,就是這場狂歡的引爆點。
陳陽的目標是兩隻股票:中青寶(300052)和掌趣科技(300315)。
「利用星城數據這幾個月賺的錢,全倉賭一個時間差。」
他要的不是價值投資,而是快速積累資本。
「到13年5、6月份,手遊概念最瘋狂的時候,準時套現。「
至少4倍,甚至5倍的利潤。
這筆錢,將是他啟動「軍火庫「的第一桶金。
他要用來提前訂購GPU——顯卡。
做AI的人都知道,GPU才是真正的彈藥。
陳陽沉吟片刻。
「憑藉ImageNet冠軍和論文的名氣,在國內找VC融個幾百萬天使輪,應該不難。「
第三階段:發布模型。
有了錢,有了名氣。
他的最終目的,才真正開始。
陳陽的呼吸微微急促起來。
「13年顯卡到來之前,必須完成三件事。「
第一,搭建大模型基礎框架——一套屬於自己的深度學習框架。
第二,Transformer架構。
這是他最大的底牌。
他要提前「發明「這個基於「注意力機制「的劃時代模型。
它將是未來所有大語言模型的基石。
第三,小模型。
基於新框架和Transformer架構,做出一個參數量在20億到30億的「小「模型。
「這個方案已經是極限了。「
陳陽在心裡默念:
「必須在13年底完成訓練。2014年1月,準時發布。「
「第三階段:發布模型」
有了錢和名氣,他的最終目的才真正開始。
「13年,必須完成三件事。」
大模型基礎框架:搭建一套屬於自己的深度學習框架。
陳陽在心裡默念著這個計劃的核心。
深度學習框架,說白了就是AI的「作業系統「。
它要解決兩個最核心的問題:模型並行和模型通信。
2012年,單塊顯卡的顯存只有幾個G,根本裝不下一個大模型。
唯一的辦法,就是把模型「切開「——一部分放在這塊顯卡,一部分放在那塊顯卡,讓它們協同工作。
就像一本太厚的書,一個人拿不動,只能撕成幾本,分給幾個人同時看。
這是模型並行。
但問題來了——這幾個人需要頻繁交流,才能把內容串起來。
顯卡之間也一樣,它們要不斷傳遞數據,互相配合。
這就是模型通信。
如果通信效率低,幾塊顯卡互相等待,再多顯卡也沒用。
這兩個技術,將是未來做大模型的核心基礎。
誰掌握了高效的模型並行和通信,誰就能訓練更大的模型。
陳陽很清楚,現在市面上,這兩塊幾乎還是一片空白。
他要做的,就是一套支持大規模模型並行和高效通信的框架。
等這套框架成熟了,別人想做大模型,就得用他的「作業系統「。
那時候,他就掌握了整個行業的底層規則。
Transformer架構:
這是他最大的底牌。
為什麼Transformer是跨時代的?
兩個原因。
第一,它能理解前後關係。
傳統技術一個字一個字往後看,看到後面,前面就忘了。
Transformer基於「注意力機制「,能看懂一句話里,哪些詞和哪些詞有關係。
比如「他拿起蘋果,咬了一口「——它知道「咬「和「蘋果「有關聯。
這讓AI第一次能真正「讀懂「一段話。
第二,它能並行處理。
傳統模型必須一個字一個字按順序處理。
Transformer可以同時處理所有字,效率高出幾十倍。
這兩個特性,讓Transformer成為未來所有大語言模型的基石。
陳陽要提前把它「發明「出來。
最後基於新的框架和Transformer架構,做出一個參數量在30億(3B)的小模型。
「30億參數...「
陳陽很清楚這個數字意味著什麼。
在FP32精度訓練中,光是模型權重就需要12GB顯存。
但訓練時,還要存儲梯度、優化器狀態...
總共需要超過100GB的顯存。
「2013年11月,K40顯卡發布。「
陳陽在心裡盤算著時間節點。
K40是英偉達即將推出的新一代旗艦計算卡,12GB顯存,性能強悍。
「要容納100GB的訓練顯存,用12GB的K40來算...「
陳陽在腦海中快速計算。
「至少需要9張卡,才能勉強裝下這個模型。「
但他的眉頭很快皺了起來。
「只有9張卡,訓練速度太慢了。到14年年中?恐怕到15年都訓不完!「
他的目標是4個月內完成訓練。
怎麼辦?
陳陽的眼中閃過一道精光。
「唯一的辦法——數據並行。「
把這個9卡組合的最小單元,再複製4套。
讓4個模型同時開工。
9張卡× 4套= 36張卡。
「這樣才能4個月內完成訓練。「
陳陽在心裡默念。
「必須提前訂購,等11月硬體到位,立刻開始訓練。「
「趁著14年初谷歌6億美金收購DeepMind(一個人工智慧公司)的熱度,年中發布模型。「
到時候,當所有人還在為識別貓狗而歡呼時,他要拿出一個30億參數的語言模型。
那不是領先一步,而是領先一個時代。
屆時,全世界的目光,無論是學術界還是投資界,都將被迫匯聚到他身上。
他將有足夠的資本和話語權,去迎接即將到來的、波瀾壯闊的人工智慧大時代。
窗外傳來幾聲犬吠,打破了深夜的寂靜。
陳陽長長地吐出一口氣,接下來有的忙了。