第4章 你來自哪?
註冊推特帳號Light_Chen。
然後找到對應的人,逐一在他們的推特下面發送:
「AlphaCode的採樣-過濾策略低估了候選解之間的結構同質性。看起來生成了一百萬個候選,實際仍然會歸結為少數幾類解法的表面變體,相同的不變式、相同的錯誤假設、相同的失效邊界...」
「代碼生成對於評估規模而言是一個有用的預警信號。模型可以在探索出乎意料的狹窄潛在策略集的同時...。」
「我同意LLM並非世界模型。但有一點似乎討論不足...」
餌已經放下,就等人來聯繫自己了,陳曦心想。
他找了十來個當下ai領域的明星科學家,這些明星科學家屬於典型的關注人數很多,但留言很少。
因為他們發的推特太專業了,專業到外行壓根看不懂,內行也要花時間來思考。
在一個碎片化內容也碎片化表達的平台,很少有人有心思和精力去琢磨然後進行探討。
陳曦的留言很有針對性,短短一兩句話就指出了對方的不足,並且一眼就知道這傢伙很專業。
只要有一個和他多聊上兩句,陳曦有十足把握能獲得對方的信任背書,進而前往矽谷獲得第一桶金。
至於為什麼不在華國,一方面矽谷的科技企業們開的價碼更高,另外一方面,他在獲得第一桶金之後就打算去東南亞和北美建立自己的領地。
法師怎麼能沒有自己的領地呢?華國早就不能成精了。
另外大量的生物樣本,在東南亞幹這事才能毫無心理壓力。
華國會是自己的大後方,自己父母在這,這條線就永遠在。
......
餌已經放下,遠在萬里之外矽谷的伊戈爾·巴布希金起床後,像往常一樣,打開電腦,看郵件,回郵件。
然後打開推特,私信里的名字說出來能讓業界震動——Elon musk。
這個名字也就還好,讓業界震動的是這件事。
作為Deepmind的核心成員,他最開始的時候負責Alphastar,一個和人對戰星際的人工智慧,最近負責Alphacode,一個用於編寫代碼的人工智慧。
兩者都含金量十足。
這讓對人工智慧野心勃勃的埃隆·馬斯克很是眼饞。
兩人自從建立聯繫後,馬斯克天天要發推特私信給伊戈爾,試圖撬谷歌的牆角。
馬斯克試圖挖角谷歌,這會讓業界震動。
伊戈爾按照慣例回復了馬斯克,他一直都沒想好。
然後注意到自己的推特有條回復,他順勢點開。
「...低估了候選解之間的結構同質性...」
伊戈爾·巴布希金看到之後第一反應就是不虞。
Alphacode項目剛才Science發表,DeepMind和谷歌對它的評價極高。
能在Codeforces競賽中達到人類選手中位數的水平。
在這個Claude還沒有聲名鵲起的時候,毫無疑問,Alphacode就是ai編程領域的No.1
推特的回覆居然指出了這個項目的不足,伊戈爾頓時抱著我倒是要看看你在說什麼的想法。
他點進了Light_Chen的主頁,帳號是新註冊的,頭像用的是推特註冊自帶的頭像。
關注者是零。
這兩天才開始更新內容。
沒有機構背書,也沒有過往履歷,至於論文和Github star更是天方夜譚。
也許是某個人的馬甲,也可能是初生牛犢。
伊戈爾·巴布希金抱著這樣的想法挨個看了下來,發現有點東西。
對方的回覆有點東西啊。
伊戈爾·巴布希金再回過頭去看,Light_Chen在他推特下的回覆,他皺了皺眉,思索片刻後敲了一段回復在底下:
「詳細說說你會基於什麼進行聚類?抽象語法樹距離和執行軌跡已經涵蓋了部分信息。你的觀點聽起來不錯,但你該如何將其付諸實踐呢?」
陳曦的回覆總結起來就一個意思,你們輸出的方案看似多,實際上都是一個方案,不過換了個表現形式罷了。
交好谷歌的媒體把AlphaCode吹成能生成真正理解題意、展開多種算法路線、再從中擇優的編程選手。
內部人士很清楚,它的智能很大一部分來自採樣規模和過濾機制。
紐約大學計算機系的戴維斯教授就批評過,這玩意本質上還是猴子打字機。
打的字夠多,總能敲出莎士比亞。
過濾和選擇缺乏真正的結構探索。
對谷歌不滿的媒體,就會引用戴維斯教授的批評。
陳曦則在此基礎上更進了一步,把這玩意真正的弱點給點了出來。
這建立在AlphaCode從未真正對外開放過。
DeepMind開源了訓練和評估模型,發布了演示網站,外界能查看AlphaCode在具體編程問題上的生成解決方案、解釋和可視化,卻不能像使用 ChatGPT那樣輸入一個新問題,讓系統實時生成代碼。
不到兩分鐘,回復出現了。
「AST距離捕捉的是程序如何被寫出來。
執行軌跡捕捉的是程序在採樣輸入上的行為。
我說的是稍微不同的東西:推斷是哪一類反例生成器殺死了哪些候選程序。
如果兩個程序需要同一種對抗性輸入才會失敗,那麼即便它們的語法和普通執行軌跡不同,它們也屬於同一個潛在解法家族。」
伊戈爾端著咖啡回到桌前,想了想,又問:
「這需要知道反例分布。在編程競賽里,隱藏測試是不可見的。你怎麼避免只是發明出一套帶有自己偏差的基準測試?」
這次Light_Chen沒有馬上回復。
過了大約五分鐘,他發來一段更長的回答。
「我們只需要用一組根據題目描述和候選程序行為生成的探針。
對每個候選程序,提取它隱含的假設,然後生成小規模的對抗性探針族,專門攻擊這些假設。
在最終過濾之前,估計候選解的多樣性是否真實存在。如果80%的候選程序都死在同一類探針族上,那麼就可以順利掩蓋一個已經坍縮的策略空間。」
伊戈爾開始認真起來。
他回覆:「假設我們接受這個觀點。那麼指標應該長什麼樣?原始聚類數量?失敗家族上的熵?還是別的什麼?」
「我會定義三個數字。
原始採樣數:生成了多少個程序。
行為倖存數:有多少程序通過了可見測試或樣例測試。
語義有效樣本量:在自適應探針下,還剩下多少個不同的失敗吸引域。
有用的比率增加語義有效樣本量/原始採樣數和語義有效樣本量/行為倖存數。
如果第一個比率很小,說明模型採樣到的只是風格。
如果第二個比率很小,說明過濾器選出來的只是同一個想法的不同變體。
如果兩個比率都會隨著規模提高而提高,那麼模型確實在學習真正的策略多樣性。」
伊戈爾靠在椅背上,仔細一想,臥槽大佬啊,對方給的策略有點可行性。
他看出價值了,沒有再繼續在推特上繼續和對方聊天,而是選擇切換到推特私信里。
先給Light_Chen點了個關注,然後接著問道:「你認為這是代碼生成特有的問題,還是語言模型的一般性限制?」
「一般性限制,但代碼把它暴露出來。」
「在語言裡,表面多樣性甚至更具有欺騙性。十個答案看起來可以完全不同,卻共享同一個隱藏框架。」
「代碼有用,是因為失敗可以被運行給判斷出來。」
「如果我們能做到如何在代碼里測量坍縮的策略空間,就能得到一種更廣泛診斷推理系統的方法。」
伊戈爾想了想,問了個有點尖銳的問題:「如果沒有AlphaCode的內部訪問權限,你怎麼測試這一點?」
他想看看對方能不能在沒有AlphaCode的內部權限的情況下設計出近似驗證方法。
過了一會兒,Light_Chen回覆:
「使用演示題目里的公開樣例足夠做一次合理性檢查。」
「選擇那些演示中展示了多個生成解法或解釋的題目。」
「手動重構解法家族。」
「圍繞可能的不變量生成對抗性變體。」
「比較這些不同的解法是否會一起失敗。」
「哪怕只有5到10個例子,也足以判斷這個測量方法是否值得放大。」
伊戈爾內心已經在為對方鼓掌了。
「你在OpenAI工作,還是微軟?或者META的人工智慧實驗室?」
他已經冒出想要挖人的想法了。
21世紀什麼最重要?當然是人才最重要。
自己有可能要為馬斯克工作,一個人孤掌難鳴,那麼帶越多的人一起去越好。
開除一個人太容易了,開除一群人有點難。
這也是為什麼,在矽谷,印度人在抱團,華國人也在抱團,大家都在抱團。
來了一個就來兩,來了兩個就來一串。
你想開除我,先掂量掂量,我們走了,你的業務還能不能運轉。
「我還在上學。」
「哦,斯坦福還是MIT?」
「江城大學。」
然後找到對應的人,逐一在他們的推特下面發送:
「AlphaCode的採樣-過濾策略低估了候選解之間的結構同質性。看起來生成了一百萬個候選,實際仍然會歸結為少數幾類解法的表面變體,相同的不變式、相同的錯誤假設、相同的失效邊界...」
「代碼生成對於評估規模而言是一個有用的預警信號。模型可以在探索出乎意料的狹窄潛在策略集的同時...。」
「我同意LLM並非世界模型。但有一點似乎討論不足...」
餌已經放下,就等人來聯繫自己了,陳曦心想。
他找了十來個當下ai領域的明星科學家,這些明星科學家屬於典型的關注人數很多,但留言很少。
因為他們發的推特太專業了,專業到外行壓根看不懂,內行也要花時間來思考。
在一個碎片化內容也碎片化表達的平台,很少有人有心思和精力去琢磨然後進行探討。
陳曦的留言很有針對性,短短一兩句話就指出了對方的不足,並且一眼就知道這傢伙很專業。
只要有一個和他多聊上兩句,陳曦有十足把握能獲得對方的信任背書,進而前往矽谷獲得第一桶金。
至於為什麼不在華國,一方面矽谷的科技企業們開的價碼更高,另外一方面,他在獲得第一桶金之後就打算去東南亞和北美建立自己的領地。
法師怎麼能沒有自己的領地呢?華國早就不能成精了。
另外大量的生物樣本,在東南亞幹這事才能毫無心理壓力。
華國會是自己的大後方,自己父母在這,這條線就永遠在。
......
餌已經放下,遠在萬里之外矽谷的伊戈爾·巴布希金起床後,像往常一樣,打開電腦,看郵件,回郵件。
然後打開推特,私信里的名字說出來能讓業界震動——Elon musk。
這個名字也就還好,讓業界震動的是這件事。
作為Deepmind的核心成員,他最開始的時候負責Alphastar,一個和人對戰星際的人工智慧,最近負責Alphacode,一個用於編寫代碼的人工智慧。
兩者都含金量十足。
這讓對人工智慧野心勃勃的埃隆·馬斯克很是眼饞。
兩人自從建立聯繫後,馬斯克天天要發推特私信給伊戈爾,試圖撬谷歌的牆角。
馬斯克試圖挖角谷歌,這會讓業界震動。
伊戈爾按照慣例回復了馬斯克,他一直都沒想好。
然後注意到自己的推特有條回復,他順勢點開。
「...低估了候選解之間的結構同質性...」
伊戈爾·巴布希金看到之後第一反應就是不虞。
Alphacode項目剛才Science發表,DeepMind和谷歌對它的評價極高。
能在Codeforces競賽中達到人類選手中位數的水平。
在這個Claude還沒有聲名鵲起的時候,毫無疑問,Alphacode就是ai編程領域的No.1
推特的回覆居然指出了這個項目的不足,伊戈爾頓時抱著我倒是要看看你在說什麼的想法。
他點進了Light_Chen的主頁,帳號是新註冊的,頭像用的是推特註冊自帶的頭像。
關注者是零。
這兩天才開始更新內容。
沒有機構背書,也沒有過往履歷,至於論文和Github star更是天方夜譚。
也許是某個人的馬甲,也可能是初生牛犢。
伊戈爾·巴布希金抱著這樣的想法挨個看了下來,發現有點東西。
對方的回覆有點東西啊。
伊戈爾·巴布希金再回過頭去看,Light_Chen在他推特下的回覆,他皺了皺眉,思索片刻後敲了一段回復在底下:
「詳細說說你會基於什麼進行聚類?抽象語法樹距離和執行軌跡已經涵蓋了部分信息。你的觀點聽起來不錯,但你該如何將其付諸實踐呢?」
陳曦的回覆總結起來就一個意思,你們輸出的方案看似多,實際上都是一個方案,不過換了個表現形式罷了。
交好谷歌的媒體把AlphaCode吹成能生成真正理解題意、展開多種算法路線、再從中擇優的編程選手。
內部人士很清楚,它的智能很大一部分來自採樣規模和過濾機制。
紐約大學計算機系的戴維斯教授就批評過,這玩意本質上還是猴子打字機。
打的字夠多,總能敲出莎士比亞。
過濾和選擇缺乏真正的結構探索。
對谷歌不滿的媒體,就會引用戴維斯教授的批評。
陳曦則在此基礎上更進了一步,把這玩意真正的弱點給點了出來。
這建立在AlphaCode從未真正對外開放過。
DeepMind開源了訓練和評估模型,發布了演示網站,外界能查看AlphaCode在具體編程問題上的生成解決方案、解釋和可視化,卻不能像使用 ChatGPT那樣輸入一個新問題,讓系統實時生成代碼。
不到兩分鐘,回復出現了。
「AST距離捕捉的是程序如何被寫出來。
執行軌跡捕捉的是程序在採樣輸入上的行為。
我說的是稍微不同的東西:推斷是哪一類反例生成器殺死了哪些候選程序。
如果兩個程序需要同一種對抗性輸入才會失敗,那麼即便它們的語法和普通執行軌跡不同,它們也屬於同一個潛在解法家族。」
伊戈爾端著咖啡回到桌前,想了想,又問:
「這需要知道反例分布。在編程競賽里,隱藏測試是不可見的。你怎麼避免只是發明出一套帶有自己偏差的基準測試?」
這次Light_Chen沒有馬上回復。
過了大約五分鐘,他發來一段更長的回答。
「我們只需要用一組根據題目描述和候選程序行為生成的探針。
對每個候選程序,提取它隱含的假設,然後生成小規模的對抗性探針族,專門攻擊這些假設。
在最終過濾之前,估計候選解的多樣性是否真實存在。如果80%的候選程序都死在同一類探針族上,那麼就可以順利掩蓋一個已經坍縮的策略空間。」
伊戈爾開始認真起來。
他回覆:「假設我們接受這個觀點。那麼指標應該長什麼樣?原始聚類數量?失敗家族上的熵?還是別的什麼?」
「我會定義三個數字。
原始採樣數:生成了多少個程序。
行為倖存數:有多少程序通過了可見測試或樣例測試。
語義有效樣本量:在自適應探針下,還剩下多少個不同的失敗吸引域。
有用的比率增加語義有效樣本量/原始採樣數和語義有效樣本量/行為倖存數。
如果第一個比率很小,說明模型採樣到的只是風格。
如果第二個比率很小,說明過濾器選出來的只是同一個想法的不同變體。
如果兩個比率都會隨著規模提高而提高,那麼模型確實在學習真正的策略多樣性。」
伊戈爾靠在椅背上,仔細一想,臥槽大佬啊,對方給的策略有點可行性。
他看出價值了,沒有再繼續在推特上繼續和對方聊天,而是選擇切換到推特私信里。
先給Light_Chen點了個關注,然後接著問道:「你認為這是代碼生成特有的問題,還是語言模型的一般性限制?」
「一般性限制,但代碼把它暴露出來。」
「在語言裡,表面多樣性甚至更具有欺騙性。十個答案看起來可以完全不同,卻共享同一個隱藏框架。」
「代碼有用,是因為失敗可以被運行給判斷出來。」
「如果我們能做到如何在代碼里測量坍縮的策略空間,就能得到一種更廣泛診斷推理系統的方法。」
伊戈爾想了想,問了個有點尖銳的問題:「如果沒有AlphaCode的內部訪問權限,你怎麼測試這一點?」
他想看看對方能不能在沒有AlphaCode的內部權限的情況下設計出近似驗證方法。
過了一會兒,Light_Chen回覆:
「使用演示題目里的公開樣例足夠做一次合理性檢查。」
「選擇那些演示中展示了多個生成解法或解釋的題目。」
「手動重構解法家族。」
「圍繞可能的不變量生成對抗性變體。」
「比較這些不同的解法是否會一起失敗。」
「哪怕只有5到10個例子,也足以判斷這個測量方法是否值得放大。」
伊戈爾內心已經在為對方鼓掌了。
「你在OpenAI工作,還是微軟?或者META的人工智慧實驗室?」
他已經冒出想要挖人的想法了。
21世紀什麼最重要?當然是人才最重要。
自己有可能要為馬斯克工作,一個人孤掌難鳴,那麼帶越多的人一起去越好。
開除一個人太容易了,開除一群人有點難。
這也是為什麼,在矽谷,印度人在抱團,華國人也在抱團,大家都在抱團。
來了一個就來兩,來了兩個就來一串。
你想開除我,先掂量掂量,我們走了,你的業務還能不能運轉。
「我還在上學。」
「哦,斯坦福還是MIT?」
「江城大學。」