第144章 唯一的解釋
十二月十六日,上午九點半。
鼎盛大廈四十九層,鄭曉波辦公室。
程遠和劉大海並排坐在沙發上。程遠穿了一身淺灰色的西裝,膝蓋上放著一個黑色文件夾。劉大海還是那件灰色連帽衫。
鄭曉波坐在對面,桌上放了一個杯子,裡面是依雲礦泉水。
「說說吧,復盤一下。」
程遠翻開文件夾。
「鄭總,是我沒做好,整個會議都沒在我的節奏里。」
先把鍋接下來。
鄭曉波挑了挑眉,他沒想到程遠上來就認錯。
程遠翻到第一頁做好標記的地方。
「劉博士先做了展示,他們的反應很平淡,然後直接給我和劉博士做了一個反向展示。」
他看了劉大海一眼。
「技術這方面我不太懂,具體的讓劉博士來講。」
劉大海沒聽出來這話的意思,老老實實接過話頭:「我先給他們展示了坤元,然後他們掏出自己的模型,說是開源7B模型調整的,讓我出題測測。測了三道題,我都是用坤元並行測的,都不是公開的測試題,他們的模型全面的比坤元表現好。」
「然後他們給我們看了跑分,意圖理解這條,他們跑到了85.2分,咱們坤元是78。」劉大海把這話說完,還是帶點苦澀,任誰辛辛苦苦帶著團隊幹了好幾個月的成果被別人碾壓也不會好受程遠看鍋甩乾淨了,趕緊接上:「但他不是來拒絕我們的,他自己帶了一套方案,讓鼎盛以GPU使用權折算投資,換股。」
潛詞是,他們的要求沒在我的權限里,實在是沒法談,非戰之罪。
鄭曉波的眉毛微微一皺:「換誰的股?」
「這是關鍵,不是源碼科技的,是一家新公司。他說他和趙文淵正在籌備,方向就是專門做通用基座模型。」
程遠合上文件夾,兩手搭在上面。
「公司名字沒給,註冊狀態沒給,團隊架構沒給。他只說了個「正在籌備」,要麼是真沒註冊,要麼是故意不讓我們做盡調。」
鄭曉波靜靜地看著程遠,沒有說話。
上周他站在落地窗前,覺得韓路一不知道天高地厚。
沒想到,沒有見識的反而是自己了。
「技術是真的嗎?」鄭曉波問。
作為鼎盛這樣一個科技巨頭的掌舵人,他不需要懂技術細節,但他要保持對技術邊界的敏銳。什麼東西做的到,什麼東西做不到,什麼東西是真的,什麼東西能作假一一這些是他的第一反應。程遠沒回答,轉頭看向劉大海。
劉大海開口道:「我一開始也尋(in)思過,但是應該是真的。」
鄭曉波盯著他。
「有沒有可能是在騙我們?」
劉大海搖頭:「那不能夠的,跑分能刷,但現場的測試是我出的題,這沒法準備,而且那差距,咋說呢,老明顯了。」
鄭曉波往前探了探身。
「過擬合呢?」
劉大海愣了一下,沒想到鄭曉波會問出這麼專業的問題。
「鄭總之前了解過機器學習?」
「你就說有沒有這個可能。」
過擬合不是在大模型時代才有的新概念了。
在機器學習里,數據會分成訓練集和測試集。訓練集用來教模型,測試集用來考模型。
但是你不能直接把訓練集當測試集,因為模型會把答案背下來。
就像你想教一個小學生加法,教一加一,考一加一,你不知道他是背的還是真會了;教一加一,考二十三加十九,才能驗證是不是真會了。
過擬合,就是模型把訓練集的答案背下來了,測出來的分是虛高。
劉大海組織了一下語言,回答道:
「我也想過,不太能夠。三道測試題來源完全不同,一道從鼎盛內部題庫選的,一道我現場手打的,還有一道是我私人題庫里最難的,內部都沒幾個人見過。而且三道題覆蓋了三種不同類型的意圖推斷,他們全部精準命中。最後他們還展示了完整的基準數據,一千兩百道題,十六個場景交叉驗證,不是挑好的給我看的。」
「咋說呢,這個85.2,確實是實打實的。」
辦公室安靜了下來。
空調出風口的聲音突然變得很清晰。
程遠地下意識合上了文件夾,咽了口口水,然後尷尬的聽見自己咽口水的聲音怎麼這麼響。劉大海盯著茶几上的花瓶,裡面插著幾枝幹枯的棉花。
鄭曉波的臉上還是古井無波,但他的手握在杯子上,既沒有拿起來,也沒有鬆開。
過了一會鄭曉波才慢慢開口:「他是怎麼做到的,你有想法嗎?」
劉大海從背包里摸出筆記本電腦,走到鄭曉波的辦公桌前面,打開電腦,屏幕亮了。
上面是一份打開的文檔一
《湯圓模型-意圖理解:可能的技術路徑分析》
「這是我昨晚連夜寫的。」劉大海說。
技術人的邀功還是直白了點。
他把屏幕對著鄭曉波,往前推了推。
「先說排除法,指定不是架構創新。」
「意圖理解這條賽道,OpenAI的GPT現在是公認的天花板,也就78分出頭。他拿一個開源的7B架構,參數量只有人家的零頭,跑出85.2。鄭總,這麼跟您說吧,這就好比一個我們那縣城中學的一個差生,用別人的舊課本自學,高考分數比全省狀元還高三十分。我拍胸脯地說,絕對不是架構創新,7B的架構就那麼點東西,翻不出花來。」
「現在大模型的競爭,已經過了參數軍備競賽的那個階段了。幾百億參數、幾千億參數,架構上大家都整的差不多。Transformer還是那個Transformer,無非是層數擱(gé)那兒多一層少一層,注意力頭多一個少一個。」
劉大海一邊說一邊仔細觀察鄭曉波的表情。
技術人給領導匯報,又怕說多了太多技術細節,領導聽不懂。又怕說的太少太簡略,領導覺得不滿意。只能小心翼翼,隨時調整。
「我能想到唯一的解釋,除非這個縣城學生用的不是別人的舊課本,而是一份全世界別的學生都沒有的,黃金複習資料。」
鄭曉波還是面無表情。
這時程遠插話了一一他沒聽懂,這沒關係,但他主要是怕鄭總也沒聽懂,這種問題不能讓鄭總來問。「劉博士,不好意思,你這個比喻指的是?」
「是標註數據。」劉大海也意識到自己說上頭了,趕緊扯回來,「鄭總也大概了解,我就簡單說一下。」
他把電腦轉過來,去網上搜了一個流程圖,再轉回去面向鄭曉波。
「咱們訓練大模型主要分為幾個階段,先是預訓練,就是堆語料,咱們恨不得把網際網路上所有的東西都給它整進去。」
「然後是監督微調,找一幫人給模型做示範,教它學明白啥是好賴話兒。」
「再往後就是對齊,讓模型學著按人的想法來排,回答得更像正常人說話。」
劉大海指了指屏幕上的流程圖。
「第一步大家用的語料都差不多,網際網路就那麼多東西,你抓我也抓。真正拉開差距的是後面兩步,誰的數據標註質量高,誰訓出來的模型就強。」
「所以我說,那個……對方效果能做的這麼好,一定是有好的標註數據。」
劉大海把韓路一的名字忘了,公司名字也忘了,只好中途改口。
不行,一會回去得查查這個公司,那個技術負責人,看看他的論文。
做出訓練出這種水平的模型,不可能沒有學術積累。
聽到這,一直沉默不語的鄭曉波突然開了口:「ScaleAl。」
鼎盛大廈四十九層,鄭曉波辦公室。
程遠和劉大海並排坐在沙發上。程遠穿了一身淺灰色的西裝,膝蓋上放著一個黑色文件夾。劉大海還是那件灰色連帽衫。
鄭曉波坐在對面,桌上放了一個杯子,裡面是依雲礦泉水。
「說說吧,復盤一下。」
程遠翻開文件夾。
「鄭總,是我沒做好,整個會議都沒在我的節奏里。」
先把鍋接下來。
鄭曉波挑了挑眉,他沒想到程遠上來就認錯。
程遠翻到第一頁做好標記的地方。
「劉博士先做了展示,他們的反應很平淡,然後直接給我和劉博士做了一個反向展示。」
他看了劉大海一眼。
「技術這方面我不太懂,具體的讓劉博士來講。」
劉大海沒聽出來這話的意思,老老實實接過話頭:「我先給他們展示了坤元,然後他們掏出自己的模型,說是開源7B模型調整的,讓我出題測測。測了三道題,我都是用坤元並行測的,都不是公開的測試題,他們的模型全面的比坤元表現好。」
「然後他們給我們看了跑分,意圖理解這條,他們跑到了85.2分,咱們坤元是78。」劉大海把這話說完,還是帶點苦澀,任誰辛辛苦苦帶著團隊幹了好幾個月的成果被別人碾壓也不會好受程遠看鍋甩乾淨了,趕緊接上:「但他不是來拒絕我們的,他自己帶了一套方案,讓鼎盛以GPU使用權折算投資,換股。」
潛詞是,他們的要求沒在我的權限里,實在是沒法談,非戰之罪。
鄭曉波的眉毛微微一皺:「換誰的股?」
「這是關鍵,不是源碼科技的,是一家新公司。他說他和趙文淵正在籌備,方向就是專門做通用基座模型。」
程遠合上文件夾,兩手搭在上面。
「公司名字沒給,註冊狀態沒給,團隊架構沒給。他只說了個「正在籌備」,要麼是真沒註冊,要麼是故意不讓我們做盡調。」
鄭曉波靜靜地看著程遠,沒有說話。
上周他站在落地窗前,覺得韓路一不知道天高地厚。
沒想到,沒有見識的反而是自己了。
「技術是真的嗎?」鄭曉波問。
作為鼎盛這樣一個科技巨頭的掌舵人,他不需要懂技術細節,但他要保持對技術邊界的敏銳。什麼東西做的到,什麼東西做不到,什麼東西是真的,什麼東西能作假一一這些是他的第一反應。程遠沒回答,轉頭看向劉大海。
劉大海開口道:「我一開始也尋(in)思過,但是應該是真的。」
鄭曉波盯著他。
「有沒有可能是在騙我們?」
劉大海搖頭:「那不能夠的,跑分能刷,但現場的測試是我出的題,這沒法準備,而且那差距,咋說呢,老明顯了。」
鄭曉波往前探了探身。
「過擬合呢?」
劉大海愣了一下,沒想到鄭曉波會問出這麼專業的問題。
「鄭總之前了解過機器學習?」
「你就說有沒有這個可能。」
過擬合不是在大模型時代才有的新概念了。
在機器學習里,數據會分成訓練集和測試集。訓練集用來教模型,測試集用來考模型。
但是你不能直接把訓練集當測試集,因為模型會把答案背下來。
就像你想教一個小學生加法,教一加一,考一加一,你不知道他是背的還是真會了;教一加一,考二十三加十九,才能驗證是不是真會了。
過擬合,就是模型把訓練集的答案背下來了,測出來的分是虛高。
劉大海組織了一下語言,回答道:
「我也想過,不太能夠。三道測試題來源完全不同,一道從鼎盛內部題庫選的,一道我現場手打的,還有一道是我私人題庫里最難的,內部都沒幾個人見過。而且三道題覆蓋了三種不同類型的意圖推斷,他們全部精準命中。最後他們還展示了完整的基準數據,一千兩百道題,十六個場景交叉驗證,不是挑好的給我看的。」
「咋說呢,這個85.2,確實是實打實的。」
辦公室安靜了下來。
空調出風口的聲音突然變得很清晰。
程遠地下意識合上了文件夾,咽了口口水,然後尷尬的聽見自己咽口水的聲音怎麼這麼響。劉大海盯著茶几上的花瓶,裡面插著幾枝幹枯的棉花。
鄭曉波的臉上還是古井無波,但他的手握在杯子上,既沒有拿起來,也沒有鬆開。
過了一會鄭曉波才慢慢開口:「他是怎麼做到的,你有想法嗎?」
劉大海從背包里摸出筆記本電腦,走到鄭曉波的辦公桌前面,打開電腦,屏幕亮了。
上面是一份打開的文檔一
《湯圓模型-意圖理解:可能的技術路徑分析》
「這是我昨晚連夜寫的。」劉大海說。
技術人的邀功還是直白了點。
他把屏幕對著鄭曉波,往前推了推。
「先說排除法,指定不是架構創新。」
「意圖理解這條賽道,OpenAI的GPT現在是公認的天花板,也就78分出頭。他拿一個開源的7B架構,參數量只有人家的零頭,跑出85.2。鄭總,這麼跟您說吧,這就好比一個我們那縣城中學的一個差生,用別人的舊課本自學,高考分數比全省狀元還高三十分。我拍胸脯地說,絕對不是架構創新,7B的架構就那麼點東西,翻不出花來。」
「現在大模型的競爭,已經過了參數軍備競賽的那個階段了。幾百億參數、幾千億參數,架構上大家都整的差不多。Transformer還是那個Transformer,無非是層數擱(gé)那兒多一層少一層,注意力頭多一個少一個。」
劉大海一邊說一邊仔細觀察鄭曉波的表情。
技術人給領導匯報,又怕說多了太多技術細節,領導聽不懂。又怕說的太少太簡略,領導覺得不滿意。只能小心翼翼,隨時調整。
「我能想到唯一的解釋,除非這個縣城學生用的不是別人的舊課本,而是一份全世界別的學生都沒有的,黃金複習資料。」
鄭曉波還是面無表情。
這時程遠插話了一一他沒聽懂,這沒關係,但他主要是怕鄭總也沒聽懂,這種問題不能讓鄭總來問。「劉博士,不好意思,你這個比喻指的是?」
「是標註數據。」劉大海也意識到自己說上頭了,趕緊扯回來,「鄭總也大概了解,我就簡單說一下。」
他把電腦轉過來,去網上搜了一個流程圖,再轉回去面向鄭曉波。
「咱們訓練大模型主要分為幾個階段,先是預訓練,就是堆語料,咱們恨不得把網際網路上所有的東西都給它整進去。」
「然後是監督微調,找一幫人給模型做示範,教它學明白啥是好賴話兒。」
「再往後就是對齊,讓模型學著按人的想法來排,回答得更像正常人說話。」
劉大海指了指屏幕上的流程圖。
「第一步大家用的語料都差不多,網際網路就那麼多東西,你抓我也抓。真正拉開差距的是後面兩步,誰的數據標註質量高,誰訓出來的模型就強。」
「所以我說,那個……對方效果能做的這麼好,一定是有好的標註數據。」
劉大海把韓路一的名字忘了,公司名字也忘了,只好中途改口。
不行,一會回去得查查這個公司,那個技術負責人,看看他的論文。
做出訓練出這種水平的模型,不可能沒有學術積累。
聽到這,一直沉默不語的鄭曉波突然開了口:「ScaleAl。」