第11章 問答
軍訓結束後的第一周,姚班正式開始上課。
陳陽利用重生者的優勢,在課堂上遊刃有餘。
數學分析課上精準回答了關於函數連續性證明的問題,計算機視覺課上提出用深度學習做特徵提取的思路,算法課上對動態規劃的理解讓老師連連點頭。
就連下課後,陳陽也經常主動去老師辦公室請教問題。
一周下來,姚班的幾位核心教授都對這個大一新生留下了深刻印象。
周五下午是姚教授的《計算理論》課。
這是姚班最受重視的課程之一,姚教授每周只講一次,但每次都是精華。
教室里坐得滿滿當當,大家都很認真。
姚教授今天講的是計算複雜性理論,講到P問題和NP問題的關係時,他停下來,看著台下的學生。
「我有一個問題,「
姚教授的聲音不大,但很有穿透力,
「假設我們有一個算法,能在多項式時間內驗證某個問題的解是否正確,那麼我們能不能在多項式時間內找到這個解?「
這是一個經典的思考題,涉及P=NP這個千禧年七大數學難題之一。
教室里安靜了幾秒,大家都在思考。
陳陽舉起手。
姚教授微微點頭:「請講。「
「目前來說,我們不能。「
陳陽站起來,「驗證一個解的正確性,和找到這個解,是兩個不同複雜度的問題。
比如數獨遊戲,驗證一個填好的數獨是否正確很容易,但要找到正確的填法,可能需要嘗試大量組合。這就是NP問題的特點——驗證容易,求解難。「
姚教授眼中閃過一絲讚許:「繼續。「
陳陽頓了頓,「但是,在某些特殊情況下,我們可以通過啟發式算法或者近似算法,在可接受的時間內找到足夠好的解。雖然不一定是最優解,但在實際應用中往往已經夠用了。「
「很好。「姚教授點點頭,
「理論和實踐的結合,這是一個很重要的視角。這位同學叫什麼名字?「
「陳陽。「
「陳陽同學的回答很有深度。
「姚教授對全班說,「大家要記住,學習計算理論不是為了證明數學定理,而是為了理解計算的本質,從而在實踐中做出更好的設計。「
下課後,陳陽收拾東西準備離開。
「陳陽。「
姚教授站在講台上,朝他招手。
「你剛才提到的啟發式算法,「
姚教授看著他,「在什麼樣的實際場景中用過?「
陳陽知道,機會來了。
「我暑假的時候創辦了一個爬蟲公司,做數據分析。「
陳陽說,「在爬取數據的過程中,遇到了一個很棘手的問題,驗證碼識別。「
「驗證碼?「姚教授來了興趣。
「對。傳統的圖像處理方法效果很不穩定,「
陳陽說,「所以我開始研究深度學習的方法來解決這個問題。「
「深度學習?「姚教授眼中的讚許更明顯了,「這個方向很前沿。你遇到什麼困難了嗎?「
「遇到了。「陳陽組織著語言,「當我把網絡層數加深的時候,出現了梯度消失的問題。反向傳播到淺層的時候,梯度已經接近零了,導致淺層根本訓練不動。「
姚教授點點頭,這是深度學習領域人盡皆知的難題。
「我查閱了很多文獻,「
陳陽說,「Geoffrey Hinton的預訓練方法、Yann LeCun的卷積神經網絡,都給了我很多啟發。我嘗試用ReLU激活函數代替Sigmoid,用Dropout防止過擬合,用數據增強擴充訓練集。這些方法確實有效。「
「效果怎麼樣?「
「梯度消失的問題基本解決了。「
陳陽說,「但隨之而來的,出現了一個新的問題。「
「什麼問題?「姚教授明顯更感興趣了。
「退化問題。「陳陽說,「當我把網絡層數從8層增加到20層的時候,理論上模型的表達能力更強了,但實際訓練出來的準確率反而下降了。而且這不是過擬合,因為訓練集上的準確率也下降了。「
姚教授沉思了幾秒:「這很有意思。你確定不是訓練方法的問題?「
「確定。「
陳陽說,「我用完全相同的訓練參數,8層網絡能達到95%的準確率,但20層網絡只有91%。這說明深層網絡並沒有學到更好的特徵,反而退化了。「
「你怎麼解釋這個現象?「
「我覺得,「陳陽說,「問題在於網絡太深之後,優化變得非常困難。即使梯度能傳回來,但優化路徑太長太複雜,很容易陷入次優解。「
「有道理。「姚教授點點頭,「那你是怎麼解決的?「
陳陽深吸一口氣,這是關鍵時刻。
「我嘗試了一個想法,「他說,「改變網絡的連接方式。「
「怎麼改?「
「我在深層和淺層之間加了一些跳躍連接,「陳陽解釋道,「讓淺層的信息可以直接繞過中間層,傳遞到深層。這樣深層網絡在最壞的情況下,也能退化成淺層網絡的效果,不會比淺層網絡差。「
姚教授的眼睛亮了:「這個思路很新穎。具體是怎麼實現的?「
「簡單來說,就是讓每一層學習的不是目標函數本身,而是目標函數和輸入之間的殘差。「陳陽說,「這樣即使某些層學不到東西,也不會影響整體效果。「
「殘差學習。「姚教授若有所思,「這個想法很有創造性。效果怎麼樣?「
「效果很好。「陳陽說,「用了這個方法後,我訓練了一個18層的網絡,準確率達到了98.5%,遠遠超過了淺層網絡。而且訓練速度也比之前快了很多。「
姚教授看著陳陽,沉默了幾秒。
「陳陽,「他說,「你現在有時間嗎?跟我去辦公室,我們詳細聊聊。「
「有。「陳陽說。
姚教授的辦公室在FIT樓五層,很寬敞,書架上擺滿了書籍和論文。
「坐。「姚教授指了指沙發,然後給陳陽倒了杯茶。
「你剛才說的殘差學習,「姚教授坐下來,「能畫個圖給我看看嗎?「
「可以。「陳陽走到白板前,拿起馬克筆。
他在白板上畫了一個簡單的網絡結構圖。
「傳統的網絡,「陳陽指著圖說,「是讓這些層去學習一個映射函數H(x),直接從輸入x映射到輸出y。「
「但在殘差網絡里,「他繼續說,「我們讓這些層去學習F(x)= H(x)- x,也就是輸出和輸入之間的殘差。然後把x通過跳躍連接直接加到輸出上,得到最終的y = F(x)+ x。「
姚教授盯著白板,眼神專註:「為什麼這樣做會更容易優化?「
「因為對於恆等映射來說,「陳陽說,「讓F(x)學習為0,比讓H(x)學習為x要容易得多。而在深層網絡中,很多層確實應該接近恆等映射,這樣才不會破壞淺層學到的特徵。「
「妙啊。「姚教授讚嘆道,「這個想法非常優雅。你是怎麼想到的?「
陳陽早就準備好了說辭:「我在研究Highway Networks的一些早期思想時得到的啟發。他們用門控機制來控制信息流動,但我覺得太複雜了。後來我想,能不能用最簡單的加法連接?試了一下,發現效果特別好。「
「你的網絡現在用在驗證碼識別上?「姚教授問。
「是的。「陳陽說,「我訓練了一個18層的模型,對主流的驗證碼識別準確率都在98%以上。「
「50層?「姚教授有些驚訝。
姚教授站起來,在辦公室里走了幾步:「陳陽,你的這個工作非常有價值。不僅解決了實際問題,而且在理論上也有創新。「
他停頓了一下,轉頭看著陳陽:「你有沒有在更大規模的數據集上測試過這個方法?比如ImageNet?「
「測試過。「陳陽點點頭,「我用ImageNet 2012的數據集訓練了一個152層的深度殘差網絡。「
「152層?!「姚教授眼睛瞪大。
「是的。「陳陽說,「因為有了殘差連接,網絡可以訓練得非常深,而且不會出現退化問題。「
「還用了並行框架」陳陽心裡說道,只是沒表示出來。
「效果怎麼樣?「
陳陽深吸一口氣:「top-5錯誤率,6.7%。「
姚教授的手顫了一下。
辦公室里安靜了幾秒。
「6.7%?「姚教授盯著陳陽,聲音都有些顫抖,「你確定這個數字?「
「確定。「陳陽說,「我跑了三遍驗證,結果都在6.7%左右。「
姚教授走到窗邊,背對著陳陽站了一會兒。
然後他轉過身:「陳陽,你知道這意味著什麼嗎?「
「知道。「陳陽說,「這意味著深度學習在圖像識別領域,已經可以達到一個非常高的水平。「
「不僅如此。「姚教授說,「根據我所知的信息,你的6.7%,是一個質的飛躍。這已經非常接近人類的識別水平了。「
他走到電話前,拿起話筒:「小陳,幫我聯繫一下張文凱老師和李明教授,就說我這裡有個很重要的事情,請他們現在過來一下。「
掛了電話,姚教授轉頭對陳陽說:「你等一下,我請了兩位計算機視覺方向的教授過來。他們需要看看你的工作。「
「好的。「
十分鐘後,兩位教授趕到了。
張文凱老師陳陽見過,是給姚班上計算機視覺課的老師。
另一位李明教授年紀稍大,是清華計算機系視覺方向的學術帶頭人。
「老姚,這麼著急叫我們來幹什麼?「李明教授笑著問。
「你們看看這個學生的工作。「姚教授指著陳陽。
陳陽又把剛才的內容講了一遍,並且在白板上詳細畫出了殘差網絡的結構。
兩位教授一開始還比較隨意,但越聽越認真,到最後都站到了白板前仔細研究。
「你這個跳躍連接,「張文凱問,「會不會導致梯度爆炸?「
「不會。「陳陽說,「因為加法操作的梯度是1,不會放大也不會縮小。反向傳播的時候,梯度可以直接通過跳躍連接傳回去,所以很穩定。「
「你說在ImageNet上測試了?「李明教授問,「能看看結果嗎?「
「可以。「陳陽打開筆記本電腦,調出測試結果和訓練曲線。
兩位教授盯著屏幕看了很久。
訓練曲線很平滑,loss穩定下降,準確率穩步上升。
測試集上的最終結果,清清楚楚寫著:top-5 error: 6.7%。
「6.7%.!「李明教授喃喃自語,「這個數字太驚人了。「
「這不是一個小的改進,「
張文凱說,「這是在說明,網絡深度確實可以帶來性能的巨大提升,前提是你能訓練好它。「
「陳陽,「李明教授轉頭問,「你用了多少層?「
「152層。「
「什麼?!「兩位教授都驚了。
「152層還能訓練?「張文凱難以置信,「不會梯度消失嗎?「
「不會。「陳陽說,「因為殘差連接的存在,梯度可以直接傳播回去。而且我發現,網絡越深,只要能訓練好,效果就越好。「
「你做了消融實驗嗎?「李明教授問,這是一個很專業的問題,「比如對比不同深度的網絡?「
「做了。「陳陽切換PPT,展示了一組對比實驗,「我訓練了18層、34層、50層、101層、152層五個不同深度的網絡。結果顯示,在我的架構下,網絡越深,效果越好。「
屏幕上顯示著一張圖表,橫軸是網絡深度,縱軸是錯誤率。曲線清晰地顯示:隨著深度增加,錯誤率持續下降。
「天才,真是天才。「李明教授感嘆,「大一新生就能做出這樣的工作。「
「不僅是天才,「張文凱說,「更難得的是,他解決了一個困擾深度學習領域很久的問題——如何訓練真正的深層網絡。「
姚教授看著陳陽,眼中滿是讚許:「陳陽,你這個工作必須儘快整理成論文發表。這是深度學習領域的重大突破。「
「我正在整理。「陳陽說,「但我想再做一些補充實驗,比如在其他數據集上驗證,或者探索更多的應用場景。「
「有什麼不懂的隨時來找我們。「張文凱說,「論文寫作、實驗設計、投稿流程,我們都可以幫你。「
「對,「李明教授補充道,「這個工作如果投CVPR或者ICCV,絕對是spotlight甚至best paper級別的。「
「謝謝老師。「
「不用謝。「李明教授笑道,「應該是我們謝謝你,給我們這些老傢伙長了臉。清華能出你這樣的學生,是我們的驕傲。「
姚教授看著陳陽,語氣認真:「陳陽,你打算繼續在姚班讀書嗎?「
「當然。「陳陽有些不解,「為什麼這樣問?「
「因為我擔心,「姚教授笑了笑,「像你這樣的學生,很容易被其他學院或者公司挖走。「
「不會的。「陳陽說,「姚班是最適合我的地方。「
「那我就放心了。「姚教授對兩位教授說,「我們得保護好這個學生。等他的論文發表出來,恐怕Google、Facebook、百度這些公司都會來搶人。「
「對對對。「李明教授點頭,「這樣的學生,一定要留在學術界。至少讀完博士再說。「
「我會好好考慮的。「陳陽說。
幾位教授又問了很多技術細節,從網絡結構到訓練技巧,從數據增強到模型優化。
陳陽一一回答,展現出了遠超大一新生的專業水平。
討論一直持續到晚上七點。
「今天就到這裡吧。「
姚教授看了看時間,「陳陽,你先回去休息。我們會商量一下,看怎麼幫你把這個工作做得更完善。另外,關於論文發表,我們會給你一些建議。「
「好的,謝謝姚教授,謝謝兩位老師。「
陳陽走出辦公室,長出一口氣。
今天的目標完美達成了。
不僅在姚教授面前留下了深刻印象,還得到了兩位計算機視覺教授的認可。
更重要的是,他找到了一個合理的身份。
一個在暑假創業過程中,為了解決實際問題,無意中發現了殘差網絡的天才學生。
這樣一來,等ResNet相關的論文發表時,就不會顯得太突兀了。
陳陽利用重生者的優勢,在課堂上遊刃有餘。
數學分析課上精準回答了關於函數連續性證明的問題,計算機視覺課上提出用深度學習做特徵提取的思路,算法課上對動態規劃的理解讓老師連連點頭。
就連下課後,陳陽也經常主動去老師辦公室請教問題。
一周下來,姚班的幾位核心教授都對這個大一新生留下了深刻印象。
周五下午是姚教授的《計算理論》課。
這是姚班最受重視的課程之一,姚教授每周只講一次,但每次都是精華。
教室里坐得滿滿當當,大家都很認真。
姚教授今天講的是計算複雜性理論,講到P問題和NP問題的關係時,他停下來,看著台下的學生。
「我有一個問題,「
姚教授的聲音不大,但很有穿透力,
「假設我們有一個算法,能在多項式時間內驗證某個問題的解是否正確,那麼我們能不能在多項式時間內找到這個解?「
這是一個經典的思考題,涉及P=NP這個千禧年七大數學難題之一。
教室里安靜了幾秒,大家都在思考。
陳陽舉起手。
姚教授微微點頭:「請講。「
「目前來說,我們不能。「
陳陽站起來,「驗證一個解的正確性,和找到這個解,是兩個不同複雜度的問題。
比如數獨遊戲,驗證一個填好的數獨是否正確很容易,但要找到正確的填法,可能需要嘗試大量組合。這就是NP問題的特點——驗證容易,求解難。「
姚教授眼中閃過一絲讚許:「繼續。「
陳陽頓了頓,「但是,在某些特殊情況下,我們可以通過啟發式算法或者近似算法,在可接受的時間內找到足夠好的解。雖然不一定是最優解,但在實際應用中往往已經夠用了。「
「很好。「姚教授點點頭,
「理論和實踐的結合,這是一個很重要的視角。這位同學叫什麼名字?「
「陳陽。「
「陳陽同學的回答很有深度。
「姚教授對全班說,「大家要記住,學習計算理論不是為了證明數學定理,而是為了理解計算的本質,從而在實踐中做出更好的設計。「
下課後,陳陽收拾東西準備離開。
「陳陽。「
姚教授站在講台上,朝他招手。
「你剛才提到的啟發式算法,「
姚教授看著他,「在什麼樣的實際場景中用過?「
陳陽知道,機會來了。
「我暑假的時候創辦了一個爬蟲公司,做數據分析。「
陳陽說,「在爬取數據的過程中,遇到了一個很棘手的問題,驗證碼識別。「
「驗證碼?「姚教授來了興趣。
「對。傳統的圖像處理方法效果很不穩定,「
陳陽說,「所以我開始研究深度學習的方法來解決這個問題。「
「深度學習?「姚教授眼中的讚許更明顯了,「這個方向很前沿。你遇到什麼困難了嗎?「
「遇到了。「陳陽組織著語言,「當我把網絡層數加深的時候,出現了梯度消失的問題。反向傳播到淺層的時候,梯度已經接近零了,導致淺層根本訓練不動。「
姚教授點點頭,這是深度學習領域人盡皆知的難題。
「我查閱了很多文獻,「
陳陽說,「Geoffrey Hinton的預訓練方法、Yann LeCun的卷積神經網絡,都給了我很多啟發。我嘗試用ReLU激活函數代替Sigmoid,用Dropout防止過擬合,用數據增強擴充訓練集。這些方法確實有效。「
「效果怎麼樣?「
「梯度消失的問題基本解決了。「
陳陽說,「但隨之而來的,出現了一個新的問題。「
「什麼問題?「姚教授明顯更感興趣了。
「退化問題。「陳陽說,「當我把網絡層數從8層增加到20層的時候,理論上模型的表達能力更強了,但實際訓練出來的準確率反而下降了。而且這不是過擬合,因為訓練集上的準確率也下降了。「
姚教授沉思了幾秒:「這很有意思。你確定不是訓練方法的問題?「
「確定。「
陳陽說,「我用完全相同的訓練參數,8層網絡能達到95%的準確率,但20層網絡只有91%。這說明深層網絡並沒有學到更好的特徵,反而退化了。「
「你怎麼解釋這個現象?「
「我覺得,「陳陽說,「問題在於網絡太深之後,優化變得非常困難。即使梯度能傳回來,但優化路徑太長太複雜,很容易陷入次優解。「
「有道理。「姚教授點點頭,「那你是怎麼解決的?「
陳陽深吸一口氣,這是關鍵時刻。
「我嘗試了一個想法,「他說,「改變網絡的連接方式。「
「怎麼改?「
「我在深層和淺層之間加了一些跳躍連接,「陳陽解釋道,「讓淺層的信息可以直接繞過中間層,傳遞到深層。這樣深層網絡在最壞的情況下,也能退化成淺層網絡的效果,不會比淺層網絡差。「
姚教授的眼睛亮了:「這個思路很新穎。具體是怎麼實現的?「
「簡單來說,就是讓每一層學習的不是目標函數本身,而是目標函數和輸入之間的殘差。「陳陽說,「這樣即使某些層學不到東西,也不會影響整體效果。「
「殘差學習。「姚教授若有所思,「這個想法很有創造性。效果怎麼樣?「
「效果很好。「陳陽說,「用了這個方法後,我訓練了一個18層的網絡,準確率達到了98.5%,遠遠超過了淺層網絡。而且訓練速度也比之前快了很多。「
姚教授看著陳陽,沉默了幾秒。
「陳陽,「他說,「你現在有時間嗎?跟我去辦公室,我們詳細聊聊。「
「有。「陳陽說。
姚教授的辦公室在FIT樓五層,很寬敞,書架上擺滿了書籍和論文。
「坐。「姚教授指了指沙發,然後給陳陽倒了杯茶。
「你剛才說的殘差學習,「姚教授坐下來,「能畫個圖給我看看嗎?「
「可以。「陳陽走到白板前,拿起馬克筆。
他在白板上畫了一個簡單的網絡結構圖。
「傳統的網絡,「陳陽指著圖說,「是讓這些層去學習一個映射函數H(x),直接從輸入x映射到輸出y。「
「但在殘差網絡里,「他繼續說,「我們讓這些層去學習F(x)= H(x)- x,也就是輸出和輸入之間的殘差。然後把x通過跳躍連接直接加到輸出上,得到最終的y = F(x)+ x。「
姚教授盯著白板,眼神專註:「為什麼這樣做會更容易優化?「
「因為對於恆等映射來說,「陳陽說,「讓F(x)學習為0,比讓H(x)學習為x要容易得多。而在深層網絡中,很多層確實應該接近恆等映射,這樣才不會破壞淺層學到的特徵。「
「妙啊。「姚教授讚嘆道,「這個想法非常優雅。你是怎麼想到的?「
陳陽早就準備好了說辭:「我在研究Highway Networks的一些早期思想時得到的啟發。他們用門控機制來控制信息流動,但我覺得太複雜了。後來我想,能不能用最簡單的加法連接?試了一下,發現效果特別好。「
「你的網絡現在用在驗證碼識別上?「姚教授問。
「是的。「陳陽說,「我訓練了一個18層的模型,對主流的驗證碼識別準確率都在98%以上。「
「50層?「姚教授有些驚訝。
姚教授站起來,在辦公室里走了幾步:「陳陽,你的這個工作非常有價值。不僅解決了實際問題,而且在理論上也有創新。「
他停頓了一下,轉頭看著陳陽:「你有沒有在更大規模的數據集上測試過這個方法?比如ImageNet?「
「測試過。「陳陽點點頭,「我用ImageNet 2012的數據集訓練了一個152層的深度殘差網絡。「
「152層?!「姚教授眼睛瞪大。
「是的。「陳陽說,「因為有了殘差連接,網絡可以訓練得非常深,而且不會出現退化問題。「
「還用了並行框架」陳陽心裡說道,只是沒表示出來。
「效果怎麼樣?「
陳陽深吸一口氣:「top-5錯誤率,6.7%。「
姚教授的手顫了一下。
辦公室里安靜了幾秒。
「6.7%?「姚教授盯著陳陽,聲音都有些顫抖,「你確定這個數字?「
「確定。「陳陽說,「我跑了三遍驗證,結果都在6.7%左右。「
姚教授走到窗邊,背對著陳陽站了一會兒。
然後他轉過身:「陳陽,你知道這意味著什麼嗎?「
「知道。「陳陽說,「這意味著深度學習在圖像識別領域,已經可以達到一個非常高的水平。「
「不僅如此。「姚教授說,「根據我所知的信息,你的6.7%,是一個質的飛躍。這已經非常接近人類的識別水平了。「
他走到電話前,拿起話筒:「小陳,幫我聯繫一下張文凱老師和李明教授,就說我這裡有個很重要的事情,請他們現在過來一下。「
掛了電話,姚教授轉頭對陳陽說:「你等一下,我請了兩位計算機視覺方向的教授過來。他們需要看看你的工作。「
「好的。「
十分鐘後,兩位教授趕到了。
張文凱老師陳陽見過,是給姚班上計算機視覺課的老師。
另一位李明教授年紀稍大,是清華計算機系視覺方向的學術帶頭人。
「老姚,這麼著急叫我們來幹什麼?「李明教授笑著問。
「你們看看這個學生的工作。「姚教授指著陳陽。
陳陽又把剛才的內容講了一遍,並且在白板上詳細畫出了殘差網絡的結構。
兩位教授一開始還比較隨意,但越聽越認真,到最後都站到了白板前仔細研究。
「你這個跳躍連接,「張文凱問,「會不會導致梯度爆炸?「
「不會。「陳陽說,「因為加法操作的梯度是1,不會放大也不會縮小。反向傳播的時候,梯度可以直接通過跳躍連接傳回去,所以很穩定。「
「你說在ImageNet上測試了?「李明教授問,「能看看結果嗎?「
「可以。「陳陽打開筆記本電腦,調出測試結果和訓練曲線。
兩位教授盯著屏幕看了很久。
訓練曲線很平滑,loss穩定下降,準確率穩步上升。
測試集上的最終結果,清清楚楚寫著:top-5 error: 6.7%。
「6.7%.!「李明教授喃喃自語,「這個數字太驚人了。「
「這不是一個小的改進,「
張文凱說,「這是在說明,網絡深度確實可以帶來性能的巨大提升,前提是你能訓練好它。「
「陳陽,「李明教授轉頭問,「你用了多少層?「
「152層。「
「什麼?!「兩位教授都驚了。
「152層還能訓練?「張文凱難以置信,「不會梯度消失嗎?「
「不會。「陳陽說,「因為殘差連接的存在,梯度可以直接傳播回去。而且我發現,網絡越深,只要能訓練好,效果就越好。「
「你做了消融實驗嗎?「李明教授問,這是一個很專業的問題,「比如對比不同深度的網絡?「
「做了。「陳陽切換PPT,展示了一組對比實驗,「我訓練了18層、34層、50層、101層、152層五個不同深度的網絡。結果顯示,在我的架構下,網絡越深,效果越好。「
屏幕上顯示著一張圖表,橫軸是網絡深度,縱軸是錯誤率。曲線清晰地顯示:隨著深度增加,錯誤率持續下降。
「天才,真是天才。「李明教授感嘆,「大一新生就能做出這樣的工作。「
「不僅是天才,「張文凱說,「更難得的是,他解決了一個困擾深度學習領域很久的問題——如何訓練真正的深層網絡。「
姚教授看著陳陽,眼中滿是讚許:「陳陽,你這個工作必須儘快整理成論文發表。這是深度學習領域的重大突破。「
「我正在整理。「陳陽說,「但我想再做一些補充實驗,比如在其他數據集上驗證,或者探索更多的應用場景。「
「有什麼不懂的隨時來找我們。「張文凱說,「論文寫作、實驗設計、投稿流程,我們都可以幫你。「
「對,「李明教授補充道,「這個工作如果投CVPR或者ICCV,絕對是spotlight甚至best paper級別的。「
「謝謝老師。「
「不用謝。「李明教授笑道,「應該是我們謝謝你,給我們這些老傢伙長了臉。清華能出你這樣的學生,是我們的驕傲。「
姚教授看著陳陽,語氣認真:「陳陽,你打算繼續在姚班讀書嗎?「
「當然。「陳陽有些不解,「為什麼這樣問?「
「因為我擔心,「姚教授笑了笑,「像你這樣的學生,很容易被其他學院或者公司挖走。「
「不會的。「陳陽說,「姚班是最適合我的地方。「
「那我就放心了。「姚教授對兩位教授說,「我們得保護好這個學生。等他的論文發表出來,恐怕Google、Facebook、百度這些公司都會來搶人。「
「對對對。「李明教授點頭,「這樣的學生,一定要留在學術界。至少讀完博士再說。「
「我會好好考慮的。「陳陽說。
幾位教授又問了很多技術細節,從網絡結構到訓練技巧,從數據增強到模型優化。
陳陽一一回答,展現出了遠超大一新生的專業水平。
討論一直持續到晚上七點。
「今天就到這裡吧。「
姚教授看了看時間,「陳陽,你先回去休息。我們會商量一下,看怎麼幫你把這個工作做得更完善。另外,關於論文發表,我們會給你一些建議。「
「好的,謝謝姚教授,謝謝兩位老師。「
陳陽走出辦公室,長出一口氣。
今天的目標完美達成了。
不僅在姚教授面前留下了深刻印象,還得到了兩位計算機視覺教授的認可。
更重要的是,他找到了一個合理的身份。
一個在暑假創業過程中,為了解決實際問題,無意中發現了殘差網絡的天才學生。
這樣一來,等ResNet相關的論文發表時,就不會顯得太突兀了。