第119章 平台期
第119章 平台期
十二月的海城已經開始冷了。
韓路一裹著羽絨服走進前灘中心的寫字樓大堂,把工牌在閘機上刷了一下,「滴」的一聲,閘門打開。
他走進電梯,十二樓的按鈕已經亮了。
電梯裡還有兩個人,正在聊天,穿著跟他一樣的工牌,但他不認識。
看到韓路一和張彪進來,兩人停止交談,其中一個看了他一眼,猶豫了一下,叫了聲「韓總」,另一個也跟著打招呼:「韓總早啊」。
韓路一點了下頭,打開視界看了看名字:」小牛,小楊,早啊。」
打完招呼,電梯裡陷入了一陣尷尬的沉默,兩人也不再聊天了。
韓路一確實不認識這兩個人。公司已經招滿了五十人,中間隔了一輪集中招聘,好幾個新面孔他連名字都沒對上號。飛書群里有每個員工的名字和頭像,但他沒來得及一個—
個記下來。
十二樓到了,電梯門一開,走廊里已經有人了。
前台換了個人,上個月的實習生離職了,現在坐著一個娃娃臉的姑娘,見他來了站起來說「韓總早」。
茶水間排著三個人在等咖啡機,有人端著杯子在聊天。走廊盡頭的大會議室拉著百葉簾,裡面影影綽綽坐了一排人,不知道是哪個組在開晨會。
源碼科技更像一家正經公司了。
飛書工作檯上每天早上十點半會自動彈出一個提醒,「你今天最重要的工作是什麼?」,每周五下午還會提醒每個人寫」卡點同步」的文檔。會議室要在系統上預約,超時十五分鐘沒到就自動釋放。考勤制度是彈性的,上午十點前到就行,下午幾點離開公司也會記錄,雖然數據暫時沒有用來計算績效,但沈叢雲說「先都記著」。
這些都是沈叢雲搭起來的。
韓路一在心裡對規範化所帶來的大公司病有一種難言的抗拒,但他到現在還沒有想出什麼更好的辦法來取代這些規範,於是一條一條的慢慢推進。
走到自己辦公室門口的時候,手機震了一下。
是趙文淵的飛書信息:「到了嗎?有進度匯報。」
韓路一回了一句」在辦公室」,推門進去把羽絨服掛在衣架上,打開百葉簾。窗外是黃浦江,連續幾天陰天,今天難得出太陽,江面上有光。
兩分鐘後趙文淵敲門進來了。
他今天沒穿西裝,穿了一件皮夾克,看起來像個摩托車騎士,手裡抱著筆記本電腦,腋下夾著一個本子。他現在的工位在十三樓,模型團隊獨占了半層,招了十幾個人之後坐不下了,上個月剛擴的。
「關門嗎?」趙文淵問。
韓路一點點頭。
趙文淵用腳後跟把門帶上,在沙發上坐下來,打開筆記本,轉過屏幕讓韓路一看。
屏幕上是一張曲線圖。
橫軸是訓練輪次,縱軸是準確率。五個點標在曲線上,第五個點的數字是一84.7%。
「第五輪微調訓練跑完了,」趙文淵說,「初次生成準確率八十四點七。」
韓路一看著這個數字。
乾元最新公布的基準是85%。
只差0.3個百分點。
「演示看看。」
趙文淵點開幾個測試用例,幾個使用不同程式語言在不同應用場景下進行的代碼生成,生成完之後再放進BugKiller掃一遍,看錯誤率。韓路一同時打開視界看了看模型直接生成的代碼。
生成質量確實上了一個台階。
但趙文淵的表情不像是來報喜的。
他翻到下一頁,是一張更詳細的曲線。五輪訓練的提升幅度標得很清楚:第一輪上次會議分享過了,76.8;第二輪到第三輪,提了5個點;第三輪到第四輪,2.8個點;第四輪到第五輪,0.1個點。
曲線在快速變平。
「84.7已經是後訓練能做到的極限了,」趙文淵說,「再往上走,就不是加數據加顯卡能解決的問題了。
L
韓路一看著那條曲線。
他想起上次開會的時候,趙文淵在會議室投屏上放的同一條S形曲線。當時的狀況,準確率還處在ScalingLaw的前半段。
數據點在曲線的極速上升階段。
現在數據點走到高原了,大力出奇蹟,這招在這不再好使了。
「也就是說,」韓路一的手點在辦公桌上,「我們用開源底座做微調這條路,走到頭了。」
「不是走到頭了,是走到平台了。」趙文淵糾正他,「就像減肥,平台期是可以突破的,但是你得換一種方式才能突破。」
「什麼方式?」
趙文淵合上筆記本,從腋下抽出那個本子。韓路一瞄了一眼,牛皮紙封面,上面用黑筆密密麻麻寫了一堆英文縮寫和箭頭,像上學時候的筆記本。
趙文淵翻到其中一頁,把本子攤在茶几上。
「三條路。」
他指著第一行。
「第一條,繼續走RLHF,強化學習加人類反饋。」
RLHF,Reinforcement Learning from Human Feedback,強化學習加人類反饋。簡單說,就是讓真實用戶來當裁判,用戶覺得生成得好,模型記住;用戶覺得不行,模型改。
久而久之,模型就能學會「用戶認為好的內容」。
韓路一沒說話,等他往下講。
「思路很簡單,開物上線這幾個月,真實用戶的操作數據我們全都留著。用戶覺得生成得好的,點了採納;覺得不行的,手動改了或者重新生成。這些行為本身就是最好的反饋信號。用這些數據訓一個獎勵模型,然後用強化學習讓天工去擬合這個獎勵函數。」
「有別於之前我們基於BugKiller數據的反饋訓練,這種訓練可以讓模型更加理解用戶輸入所對應的意圖,這是超越Bug修復的部分,更偏向於語義理解。」
「成本呢?」
「標註基礎設施加上獎勵模型訓練和疊代,大概五百到一千萬,時間三到六個月。上限嘛,」趙文淵想了想,「估計能再提三到五個點,到八十八左右。」
「這個提升不算大。」
「在這個階段每一點提升都很艱難,而且這條路的核心優勢不在上限。」趙文淵說,「開物的真實用戶行為數據,是我們獨有的資產。別人花錢也買不到。
99
韓路一點了下頭。
「第二條,」趙文淵翻到下一頁,「MoE,混合專家模型。」
MoE,MitureofEperts,混合專家模型。不是把一個模型訓得什麼都會,而是訓一群各有專長的小模型,遇到問題再決定派誰上。像一家公司,與其要求每個員工全能,不如讓專業的人做專業的事。
「這個主要是架構層面的改變。不改基座,不改訓練方法,改調用方式、推理方式。
把一個大模型拆成多個專精的子模型——一個擅長Python、一個擅長前端、一個擅長資料庫。推理時根據任務類型自動路由到最合適的專家,同算力下效果更好,應該也能提三到五個點。」趙文淵接著說。
「成本?」韓路一問道。
「一千到兩千萬,架構要重寫,模型要重訓,時間四到八個月。」趙文淵說,「技術上挑戰不算太大,成本主要是要調的模型多。但是需要補人,我們現在的團隊在MoE方面沒有經驗,至少要招兩到三個做過類似架構的人。」
「最後說第三條。」趙文淵又翻了一頁,語氣中有點兒興奮—是他作為科學家的興奮。
>
十二月的海城已經開始冷了。
韓路一裹著羽絨服走進前灘中心的寫字樓大堂,把工牌在閘機上刷了一下,「滴」的一聲,閘門打開。
他走進電梯,十二樓的按鈕已經亮了。
電梯裡還有兩個人,正在聊天,穿著跟他一樣的工牌,但他不認識。
看到韓路一和張彪進來,兩人停止交談,其中一個看了他一眼,猶豫了一下,叫了聲「韓總」,另一個也跟著打招呼:「韓總早啊」。
韓路一點了下頭,打開視界看了看名字:」小牛,小楊,早啊。」
打完招呼,電梯裡陷入了一陣尷尬的沉默,兩人也不再聊天了。
韓路一確實不認識這兩個人。公司已經招滿了五十人,中間隔了一輪集中招聘,好幾個新面孔他連名字都沒對上號。飛書群里有每個員工的名字和頭像,但他沒來得及一個—
個記下來。
十二樓到了,電梯門一開,走廊里已經有人了。
前台換了個人,上個月的實習生離職了,現在坐著一個娃娃臉的姑娘,見他來了站起來說「韓總早」。
茶水間排著三個人在等咖啡機,有人端著杯子在聊天。走廊盡頭的大會議室拉著百葉簾,裡面影影綽綽坐了一排人,不知道是哪個組在開晨會。
源碼科技更像一家正經公司了。
飛書工作檯上每天早上十點半會自動彈出一個提醒,「你今天最重要的工作是什麼?」,每周五下午還會提醒每個人寫」卡點同步」的文檔。會議室要在系統上預約,超時十五分鐘沒到就自動釋放。考勤制度是彈性的,上午十點前到就行,下午幾點離開公司也會記錄,雖然數據暫時沒有用來計算績效,但沈叢雲說「先都記著」。
這些都是沈叢雲搭起來的。
韓路一在心裡對規範化所帶來的大公司病有一種難言的抗拒,但他到現在還沒有想出什麼更好的辦法來取代這些規範,於是一條一條的慢慢推進。
走到自己辦公室門口的時候,手機震了一下。
是趙文淵的飛書信息:「到了嗎?有進度匯報。」
韓路一回了一句」在辦公室」,推門進去把羽絨服掛在衣架上,打開百葉簾。窗外是黃浦江,連續幾天陰天,今天難得出太陽,江面上有光。
兩分鐘後趙文淵敲門進來了。
他今天沒穿西裝,穿了一件皮夾克,看起來像個摩托車騎士,手裡抱著筆記本電腦,腋下夾著一個本子。他現在的工位在十三樓,模型團隊獨占了半層,招了十幾個人之後坐不下了,上個月剛擴的。
「關門嗎?」趙文淵問。
韓路一點點頭。
趙文淵用腳後跟把門帶上,在沙發上坐下來,打開筆記本,轉過屏幕讓韓路一看。
屏幕上是一張曲線圖。
橫軸是訓練輪次,縱軸是準確率。五個點標在曲線上,第五個點的數字是一84.7%。
「第五輪微調訓練跑完了,」趙文淵說,「初次生成準確率八十四點七。」
韓路一看著這個數字。
乾元最新公布的基準是85%。
只差0.3個百分點。
「演示看看。」
趙文淵點開幾個測試用例,幾個使用不同程式語言在不同應用場景下進行的代碼生成,生成完之後再放進BugKiller掃一遍,看錯誤率。韓路一同時打開視界看了看模型直接生成的代碼。
生成質量確實上了一個台階。
但趙文淵的表情不像是來報喜的。
他翻到下一頁,是一張更詳細的曲線。五輪訓練的提升幅度標得很清楚:第一輪上次會議分享過了,76.8;第二輪到第三輪,提了5個點;第三輪到第四輪,2.8個點;第四輪到第五輪,0.1個點。
曲線在快速變平。
「84.7已經是後訓練能做到的極限了,」趙文淵說,「再往上走,就不是加數據加顯卡能解決的問題了。
L
韓路一看著那條曲線。
他想起上次開會的時候,趙文淵在會議室投屏上放的同一條S形曲線。當時的狀況,準確率還處在ScalingLaw的前半段。
數據點在曲線的極速上升階段。
現在數據點走到高原了,大力出奇蹟,這招在這不再好使了。
「也就是說,」韓路一的手點在辦公桌上,「我們用開源底座做微調這條路,走到頭了。」
「不是走到頭了,是走到平台了。」趙文淵糾正他,「就像減肥,平台期是可以突破的,但是你得換一種方式才能突破。」
「什麼方式?」
趙文淵合上筆記本,從腋下抽出那個本子。韓路一瞄了一眼,牛皮紙封面,上面用黑筆密密麻麻寫了一堆英文縮寫和箭頭,像上學時候的筆記本。
趙文淵翻到其中一頁,把本子攤在茶几上。
「三條路。」
他指著第一行。
「第一條,繼續走RLHF,強化學習加人類反饋。」
RLHF,Reinforcement Learning from Human Feedback,強化學習加人類反饋。簡單說,就是讓真實用戶來當裁判,用戶覺得生成得好,模型記住;用戶覺得不行,模型改。
久而久之,模型就能學會「用戶認為好的內容」。
韓路一沒說話,等他往下講。
「思路很簡單,開物上線這幾個月,真實用戶的操作數據我們全都留著。用戶覺得生成得好的,點了採納;覺得不行的,手動改了或者重新生成。這些行為本身就是最好的反饋信號。用這些數據訓一個獎勵模型,然後用強化學習讓天工去擬合這個獎勵函數。」
「有別於之前我們基於BugKiller數據的反饋訓練,這種訓練可以讓模型更加理解用戶輸入所對應的意圖,這是超越Bug修復的部分,更偏向於語義理解。」
「成本呢?」
「標註基礎設施加上獎勵模型訓練和疊代,大概五百到一千萬,時間三到六個月。上限嘛,」趙文淵想了想,「估計能再提三到五個點,到八十八左右。」
「這個提升不算大。」
「在這個階段每一點提升都很艱難,而且這條路的核心優勢不在上限。」趙文淵說,「開物的真實用戶行為數據,是我們獨有的資產。別人花錢也買不到。
99
韓路一點了下頭。
「第二條,」趙文淵翻到下一頁,「MoE,混合專家模型。」
MoE,MitureofEperts,混合專家模型。不是把一個模型訓得什麼都會,而是訓一群各有專長的小模型,遇到問題再決定派誰上。像一家公司,與其要求每個員工全能,不如讓專業的人做專業的事。
「這個主要是架構層面的改變。不改基座,不改訓練方法,改調用方式、推理方式。
把一個大模型拆成多個專精的子模型——一個擅長Python、一個擅長前端、一個擅長資料庫。推理時根據任務類型自動路由到最合適的專家,同算力下效果更好,應該也能提三到五個點。」趙文淵接著說。
「成本?」韓路一問道。
「一千到兩千萬,架構要重寫,模型要重訓,時間四到八個月。」趙文淵說,「技術上挑戰不算太大,成本主要是要調的模型多。但是需要補人,我們現在的團隊在MoE方面沒有經驗,至少要招兩到三個做過類似架構的人。」
「最後說第三條。」趙文淵又翻了一頁,語氣中有點兒興奮—是他作為科學家的興奮。
>