第993章 十五億參數終於橫空出世

投票推薦 加入書籤 小說報錯

  雙十一前夕,九章算力基地。

  地下二層的核心機房裡,新增的液冷機櫃已經占滿兩條走廊。

  狀態燈整齊閃爍,冷卻液沿透明管線持續循環,室內溫度穩定在二十二度。

  過去四個月,九天實驗室的擴張速度快得嚇人。

  後續採購的顯卡也在陸續到貨。

  樓天城帶隊重寫了通信框架,終於將張量並行從實驗代碼變成可用系統。

  與此同時,實驗室又多了五十多名研究員。

  其中既有剛從海外實驗室辭職回來的華人學者,也有被論文吸引來的年輕博士,還有幾個拒絕了網際網路大廠高薪,只想專心研究模型的技術怪人。

  公司給出的條件相當直接。

  算力不設個人額度,論文允許公開發表,研究成果按貢獻署名。

  只要項目需要,實驗設備的採購申請可以直接越過普通財務流程。

  任少卿站在主控制台前,雙眼盯著屏幕上的訓練日誌。

  十五億參數的天問二號已經連續訓練十九天。

  最後一個訓練周期在凌晨結束,現在團隊正在進行模型權重合併和完整性校驗。

  樓天城坐在旁邊,桌上放著兩罐空咖啡。

  他盯著通信監控頁面,手指不斷敲擊鍵盤。

  「第六組節點完成合併。」

  「第七組正常,沒有出現權重損壞。」

  安德烈坐在另一側,快速核對驗證集數據。

  「損失函數已經穩定。」

  「通用語料困惑度比天問一號下降百分之三十七。翻譯和長文本續寫的效果,提高得更明顯。」

  任少卿沒有急著慶祝。

  「先跑完整測試。」

  「模型能啟動,不等於真的跑通。把預設題庫全部過一遍,任何一個核心項目異常,都得重新查。」

  十幾名研究員立即行動起來。

  測試大廳後方,數據團隊也在同步工作。

  數百份經過人工覆核的文本、圖片說明和分類標籤,正通過物理隔離的數據通道進入訓練語料庫。

  「微光計劃」啟動後,九天實驗室每天都能收到一批新數據。

  第一批參與者已經完成培訓,工作內容從簡單的去重、錯別字校正,逐漸擴展到語義分類、敏感信息脫敏和圖文匹配。

  這些任務看起來並不複雜,卻補上了機器清洗無法解決的缺口。

  同一句話是反問還是陳述,一篇文章是否存在邏輯斷裂,一張圖片的文字說明是否準確,都需要人工判斷。

  經過三輪審核後,語料質量明顯提升。

  上午九點二十七分,第一輪測試結果彈出。

  樓天城看了一遍數據,摘下眼鏡擦了擦。

  「基礎測試通過。」

  實驗室里安靜了半秒,緊接著響起了掌聲。

  有人拍桌子,有人直接從椅子上跳起來,還有人衝到走廊里喊後勤送早餐。

  安德烈指著時間提醒道:「現在已經九點半了,你要的是早餐還是午餐?」

  門口的年輕研究員回頭喊道:

  「都送!我們昨晚就沒吃飯,不能在這種問題上做單項選擇!」

  大廳里頓時笑成一片。

  任少卿也笑了笑,很快又拍了兩下手。

  「行了,先別急著開香檳。」

  「十五億參數不是十五億獎金。把內部演示頁面打開,測試生成質量。」

  技術人員在輸入框敲下一行短句。

  請簡述唐朝時期智慧型手機的普及情況及對當時社會的影響。

  點擊生成後,頁面停頓了四秒。

  一段新的文字開始逐行出現。

  模型不僅一本正經地虛構了唐代長安城的信號基站建設,還煞有介事地分析了李白因為沉迷刷短視頻而導致寫詩產量下降的社會現象。

  生成內容超過八百字,不但邏輯自洽,甚至還引用了並不存在的古籍文獻來佐證。


  一名研究員翻到末尾。

  「語句極其通順,沒有發生循環重複,它真的順著我們的荒謬設定理解了語境。」

  樓天城提醒道:「別急著夸。把中間三百字刪掉,讓它補全。」

  第二次生成依舊順利。

  補出的情節和前後文能夠銜接,只是兩處年號描述出現偏差。

  負責評測的研究員立即將問題記錄下來。

  隨後,團隊又測試了摘要、翻譯、古文解釋和簡單代碼補全。

  天問二號可以將一篇五千字報告壓縮成三百字,也可以提取其中的時間、人物和事件。

  但面對知識盲區或邏輯陷阱時,它經常會給出錯誤答案,且措辭十分篤定完整。

  「這個問題必須重點標註,這是典型的模型幻覺。」

  任少卿看著屏幕說道:

  「它不知道答案的時候,也會順著你的邏輯往下編,而且編得很有道理。普通人不一定分辨得出來。」

  安德烈攤開雙手。

  「人類也這樣。」

  「尤其是開會的時候。」

  旁邊幾個人沒忍住笑出了聲。

  上午十點,所有核心測試完成。

  任少卿拿起專用設備,向中關村理想國際大廈發起加密視頻請求。

  十幾秒後,畫面接通。

  顧嶼剛結束一場業務會議,桌面還放著回音商城的雙十一履約報告。

  看到視頻背景里的測試大廳,他將文件合上。

  「出結果了?」

  「十五億參數版本,跑通了。」

  任少卿把核心數據調到共享頁面。

  「訓練使用了目前完成清洗的一千零八十億Token。張量並行和數據並行運行正常,模型權重已經完成合併。」

  「和一億五千萬參數的天問一號相比,通用語料困惑度下降百分之三十七。長文本生成、摘要和翻譯能力都有明顯提高。」

  顧嶼看完幾項測試結果,問道:「穩定性呢?」

  樓天城湊到鏡頭前。

  「連續推理六小時,沒有發生節點崩潰。」

  「但現在的響應速度不夠快。生成五百字平均要十五秒。如果並發用戶超過兩百,伺服器壓力會急劇上升。」

  「顯存利用率也不理想。我還能再壓百分之二十左右。」

  顧嶼點了點頭。

  這個版本當然算不上成熟產品。

  十五億參數放在後世,甚至塞不滿一台消費級顯卡。

  可現在才是2015年,業內主流仍在圍繞循環神經網絡反覆優化。

  九天實驗室已經提前摸到了另一條路。

  「微光計劃的數據怎麼樣?」

  任少卿將數據後台切換出來。

  「第一批三千多人已經開始工作,目前每天可以完成八百萬條基礎任務。質量比純腳本清洗高很多,尤其是文本分類和事實核對。」

  「等後續培訓完成,日處理量還能增加。」

  顧嶼提醒道:「別只盯數量。人工審核、交叉抽檢和任務回溯都要保留。」

  「標錯一條數據不算什麼。幾十萬條同類錯誤被模型學進去,返工成本會很高。」

  「明白,我們已經啟用了三層抽檢。」

  任少卿把一個內網地址發送過去。

  「這是剛搭好的演示網站,只能通過集團專線訪問。你可以自己輸入內容,它會直接調用天問二號。」

  顧嶼打開連結。

  頁面非常簡陋,左邊是輸入框,右邊是參數設置。

  除了生成長度和隨機度,幾乎沒有多餘功能。

  他先輸入了一段雜亂的會議記錄,要求模型整理重點。

  頁面等待數秒,很快生成了項目進度、主要問題、責任部門和截止時間。

  部分表達仍顯生硬,關鍵信息卻沒有遺漏。

  顧嶼又扔進去一份商城客服日誌,甚至包含了昨天剛剛爆發的「黑公關抹黑星火充電寶」的負面評論。


  模型不僅自動將投訴分成物流延遲、商品破損、價格爭議和蓄意抹黑四類,甚至精準提煉出了水軍使用的高頻恐嚇詞彙,並給出了每類問題的出現比例。

  顧嶼看著屏幕上的分類結果,又隨手多測試了幾輪。

  模型並非每次都正確,有時會誤解指令,也會在資料不足時自行補充內容。

  但它已經展現出了真真切切的可用價值,不再是實驗室里只能用來展示曲線的技術樣品。

  任少卿將最後一份測試報告通過專線傳了過來。

  「驗證了你的戰略。『預測下一個Token』這條路,我們走通了。」

  「不過在正式進入下一階段、衝擊百億參數之前,我們想聽聽你的意見。」他看著攝像頭,神色嚴肅了幾分,

  「模型幻覺和胡說八道的問題,單靠堆語料似乎無法根除,還要繼續在這個方向死磕嗎?」

  顧嶼沒有立刻回答。

  他盯著桌面上那份商城客服日誌,又看了一眼大屏幕上跳動的水軍提煉詞彙,心中已然有了決斷。

  「參數繼續往上壓,算力資源我來保證。」顧嶼敲了敲桌面,

  「不過,既然模型已經具備了邏輯歸納的雛形,就不能只讓它待在溫室里。從今天開始,天問要同步開啟應用部署和訓練。」

  視頻那頭,幾名核心研究員都坐直了身體。

  「我們現在手頭就有最龐大、最現成的需求。」顧嶼指著剛才的測試頁面,

  「立刻把天問二號的一個分支埠接入回音商城的客服系統和集團輿情監控中心。既然並發上限只有兩百,那就好鋼用在刀刃上。作為Copilot(副駕駛)後台接入客訴系統,不直接面向消費者,而是生成標準話術輔助我們的人工客服,把單人處理效率提高十倍。同時,抽出一百個並發額度接入輿情監控中心,讓它去龐雜的數據流里排查那些雷同的抹黑話術和水軍群控帳號!」

  「至於解決幻覺的方法,既然我們手握三千多名最優秀的人工標註員,那就給大模型加上教鞭。」

  「我們要引入RLHF,也就是基於人類反饋的強化學習。不管是做智能客服還是查黑公關水軍,我要讓天問不僅會預測下一個詞,還要在真實的實戰中,徹底學會迎合人類的價值觀與規則判斷!」

  PS:感謝【孤苦伶仃(伶)】打賞的【大神認證】,加更一章

章節目錄