第4章 你來自哪?

投票推薦 加入書籤 小說報錯

  註冊推特帳號Light_Chen。

  然後找到對應的人,逐一在他們的推特下面發送:

  「AlphaCode的採樣-過濾策略低估了候選解之間的結構同質性。看起來生成了一百萬個候選,實際仍然會歸結為少數幾類解法的表面變體,相同的不變式、相同的錯誤假設、相同的失效邊界...」

  「代碼生成對於評估規模而言是一個有用的預警信號。模型可以在探索出乎意料的狹窄潛在策略集的同時...。」

  「我同意LLM並非世界模型。但有一點似乎討論不足...」

  餌已經放下,就等人來聯繫自己了,陳曦心想。

  他找了十來個當下ai領域的明星科學家,這些明星科學家屬於典型的關注人數很多,但留言很少。

  因為他們發的推特太專業了,專業到外行壓根看不懂,內行也要花時間來思考。

  在一個碎片化內容也碎片化表達的平台,很少有人有心思和精力去琢磨然後進行探討。

  陳曦的留言很有針對性,短短一兩句話就指出了對方的不足,並且一眼就知道這傢伙很專業。

  只要有一個和他多聊上兩句,陳曦有十足把握能獲得對方的信任背書,進而前往矽谷獲得第一桶金。

  至於為什麼不在華國,一方面矽谷的科技企業們開的價碼更高,另外一方面,他在獲得第一桶金之後就打算去東南亞和北美建立自己的領地。

  法師怎麼能沒有自己的領地呢?華國早就不能成精了。

  另外大量的生物樣本,在東南亞幹這事才能毫無心理壓力。

  華國會是自己的大後方,自己父母在這,這條線就永遠在。

  ......

  餌已經放下,遠在萬里之外矽谷的伊戈爾·巴布希金起床後,像往常一樣,打開電腦,看郵件,回郵件。

  然後打開推特,私信里的名字說出來能讓業界震動——Elon musk。

  這個名字也就還好,讓業界震動的是這件事。

  作為Deepmind的核心成員,他最開始的時候負責Alphastar,一個和人對戰星際的人工智慧,最近負責Alphacode,一個用於編寫代碼的人工智慧。

  兩者都含金量十足。

  這讓對人工智慧野心勃勃的埃隆·馬斯克很是眼饞。

  兩人自從建立聯繫後,馬斯克天天要發推特私信給伊戈爾,試圖撬谷歌的牆角。

  馬斯克試圖挖角谷歌,這會讓業界震動。

  伊戈爾按照慣例回復了馬斯克,他一直都沒想好。

  然後注意到自己的推特有條回復,他順勢點開。

  「...低估了候選解之間的結構同質性...」

  伊戈爾·巴布希金看到之後第一反應就是不虞。

  Alphacode項目剛才Science發表,DeepMind和谷歌對它的評價極高。

  能在Codeforces競賽中達到人類選手中位數的水平。

  在這個Claude還沒有聲名鵲起的時候,毫無疑問,Alphacode就是ai編程領域的No.1

  推特的回覆居然指出了這個項目的不足,伊戈爾頓時抱著我倒是要看看你在說什麼的想法。

  他點進了Light_Chen的主頁,帳號是新註冊的,頭像用的是推特註冊自帶的頭像。

  關注者是零。

  這兩天才開始更新內容。

  沒有機構背書,也沒有過往履歷,至於論文和Github star更是天方夜譚。

  也許是某個人的馬甲,也可能是初生牛犢。

  伊戈爾·巴布希金抱著這樣的想法挨個看了下來,發現有點東西。

  對方的回覆有點東西啊。

  伊戈爾·巴布希金再回過頭去看,Light_Chen在他推特下的回覆,他皺了皺眉,思索片刻後敲了一段回復在底下:

  「詳細說說你會基於什麼進行聚類?抽象語法樹距離和執行軌跡已經涵蓋了部分信息。你的觀點聽起來不錯,但你該如何將其付諸實踐呢?」


  陳曦的回覆總結起來就一個意思,你們輸出的方案看似多,實際上都是一個方案,不過換了個表現形式罷了。

  交好谷歌的媒體把AlphaCode吹成能生成真正理解題意、展開多種算法路線、再從中擇優的編程選手。

  內部人士很清楚,它的智能很大一部分來自採樣規模和過濾機制。

  紐約大學計算機系的戴維斯教授就批評過,這玩意本質上還是猴子打字機。

  打的字夠多,總能敲出莎士比亞。

  過濾和選擇缺乏真正的結構探索。

  對谷歌不滿的媒體,就會引用戴維斯教授的批評。

  陳曦則在此基礎上更進了一步,把這玩意真正的弱點給點了出來。

  這建立在AlphaCode從未真正對外開放過。

  DeepMind開源了訓練和評估模型,發布了演示網站,外界能查看AlphaCode在具體編程問題上的生成解決方案、解釋和可視化,卻不能像使用 ChatGPT那樣輸入一個新問題,讓系統實時生成代碼。

  不到兩分鐘,回復出現了。

  「AST距離捕捉的是程序如何被寫出來。

  執行軌跡捕捉的是程序在採樣輸入上的行為。

  我說的是稍微不同的東西:推斷是哪一類反例生成器殺死了哪些候選程序。

  如果兩個程序需要同一種對抗性輸入才會失敗,那麼即便它們的語法和普通執行軌跡不同,它們也屬於同一個潛在解法家族。」

  伊戈爾端著咖啡回到桌前,想了想,又問:

  「這需要知道反例分布。在編程競賽里,隱藏測試是不可見的。你怎麼避免只是發明出一套帶有自己偏差的基準測試?」

  這次Light_Chen沒有馬上回復。

  過了大約五分鐘,他發來一段更長的回答。

  「我們只需要用一組根據題目描述和候選程序行為生成的探針。

  對每個候選程序,提取它隱含的假設,然後生成小規模的對抗性探針族,專門攻擊這些假設。

  在最終過濾之前,估計候選解的多樣性是否真實存在。如果80%的候選程序都死在同一類探針族上,那麼就可以順利掩蓋一個已經坍縮的策略空間。」

  伊戈爾開始認真起來。

  他回覆:「假設我們接受這個觀點。那麼指標應該長什麼樣?原始聚類數量?失敗家族上的熵?還是別的什麼?」

  「我會定義三個數字。

  原始採樣數:生成了多少個程序。

  行為倖存數:有多少程序通過了可見測試或樣例測試。

  語義有效樣本量:在自適應探針下,還剩下多少個不同的失敗吸引域。

  有用的比率增加語義有效樣本量/原始採樣數和語義有效樣本量/行為倖存數。

  如果第一個比率很小,說明模型採樣到的只是風格。

  如果第二個比率很小,說明過濾器選出來的只是同一個想法的不同變體。

  如果兩個比率都會隨著規模提高而提高,那麼模型確實在學習真正的策略多樣性。」

  伊戈爾靠在椅背上,仔細一想,臥槽大佬啊,對方給的策略有點可行性。

  他看出價值了,沒有再繼續在推特上繼續和對方聊天,而是選擇切換到推特私信里。

  先給Light_Chen點了個關注,然後接著問道:「你認為這是代碼生成特有的問題,還是語言模型的一般性限制?」

  「一般性限制,但代碼把它暴露出來。」

  「在語言裡,表面多樣性甚至更具有欺騙性。十個答案看起來可以完全不同,卻共享同一個隱藏框架。」

  「代碼有用,是因為失敗可以被運行給判斷出來。」

  「如果我們能做到如何在代碼里測量坍縮的策略空間,就能得到一種更廣泛診斷推理系統的方法。」

  伊戈爾想了想,問了個有點尖銳的問題:「如果沒有AlphaCode的內部訪問權限,你怎麼測試這一點?」

  他想看看對方能不能在沒有AlphaCode的內部權限的情況下設計出近似驗證方法。


  過了一會兒,Light_Chen回覆:

  「使用演示題目里的公開樣例足夠做一次合理性檢查。」

  「選擇那些演示中展示了多個生成解法或解釋的題目。」

  「手動重構解法家族。」

  「圍繞可能的不變量生成對抗性變體。」

  「比較這些不同的解法是否會一起失敗。」

  「哪怕只有5到10個例子,也足以判斷這個測量方法是否值得放大。」

  伊戈爾內心已經在為對方鼓掌了。

  「你在OpenAI工作,還是微軟?或者META的人工智慧實驗室?」

  他已經冒出想要挖人的想法了。

  21世紀什麼最重要?當然是人才最重要。

  自己有可能要為馬斯克工作,一個人孤掌難鳴,那麼帶越多的人一起去越好。

  開除一個人太容易了,開除一群人有點難。

  這也是為什麼,在矽谷,印度人在抱團,華國人也在抱團,大家都在抱團。

  來了一個就來兩,來了兩個就來一串。

  你想開除我,先掂量掂量,我們走了,你的業務還能不能運轉。

  「我還在上學。」

  「哦,斯坦福還是MIT?」

  「江城大學。」

章節目錄