這次的主角叫 Giambattista Parascandolo,是 OpenAI 推理模型方向的重要研究者。
2020 年,他去 MIT 麵試教授崗位,做了一場關於用 GPT
做推理的報告。結果,麵試委員會大部分教授把這個方向斥為「無稽之談」(nonsense)。
https://x.com/turingbook/status/2084003612687249836?s=20
這哥們直接貼臉開大,將這段經曆寫進了個人主頁,並附上了當年的報告介紹和幻燈片鏈接。
https://sites.google.com/view/giambattista-parascandolo/home
那份被批「無稽之談」的報告,講了啥?
MIT 官網顯示,這場報告的主題,是如何讓人工神經網絡突破訓練分布,獲得更接近人類的泛化和規劃能力。
Parascandolo
認為,人類能夠重新組合已有知識,識別關鍵不變量,建立抽象模型,並完成長時程規劃。人工神經網絡在這些方麵仍有很大提升空間。
報告最後,他提出了三個未來研究方向:神經網絡中的開放式推理、人工神經網絡中尚未探索的自由度,以及在強化學習中將語言作為推理載體,以提高樣本效率。
其中最關鍵的概念,是「開放式推理」。
Parascandolo
將其定義為:模型可以投入更多時間和計算,持續修正答案。問題越難,模型就應該多想幾步,並讓額外計算轉化為更好的結果。
這聽起來已經很像今天的推理時計算擴展。
當時的標準 Transformer 擁有固定的網絡深度,每個 token
經曆的前向計算量基本確定,問題難度卻與輸入長度沒有穩定關係。一個問題可以很長,答案卻很簡單。另一個問題隻有一句話,可能需要多輪拆解和驗證。
RNN 看起來更加適合這種任務。它可以反複運行,理論上能夠獲得任意長度的思考時間。Parascandolo 在 PPT
中展示的曲線卻表明,RNN 通常隻在訓練時見過的推理步數附近表現最好,繼續增加循環次數,準確率反而可能下降。
這意味著,增加計算量隻是第一步,模型還要學會如何利用這些計算。
當時效果最強的多步規劃,大量依賴模型預測控製和蒙特卡洛樹搜索。神經網絡負責預測環境或評估價值,外部搜索算法負責展開未來路徑。Parascandolo
希望進一步將長程推理能力融入神經網絡。
他的第二個設想,是讓語言成為推理載體。
Parascandolo 用經典遊戲《蒙特祖瑪的複仇》舉例。一個從零開始訓練的強化學習
Agent,需要嚐試大量狀態和動作組合,很多正確操作本身並不複雜,Agent 真正缺少的,是對「什麽行為更合理」的判斷。
GPT
已經從文本中吸收了大量世界知識,語言可以幫助模型描述環境、理解目標、拆解任務和生成高層計劃,也能大幅縮小搜索範圍。
放到今天,這套思路很容易讓人聯想到思維鏈、語言規劃和 Agent 工作流。
Parascandolo
提出的第三個方向是,人工智能係統可以重置任務,回到記憶中的任意狀態,構造反事實場景,還可以調整模擬器中的時間、重力和觀察結果。係統甚至可以直接讀取、複製和修改自身的激活值與神經網絡權重。
這相當於把學習過程本身也納入 Agent
的操作空間。它可以開展刻意練習,生成特殊訓練場景,遷移已有知識,並針對失敗軌跡重新學習。
五年前的 PPT 裏,幾乎寫出了今天的推理模型路線。
我們還扒出了他 2021 年 6 月寫過的一篇博客,題目就是《反向傳播、進化與「兩隻狗」的誤區》。
這篇博客主要反駁「神經網絡需要海量數據,因此不像人腦」的觀點。
Parascandolo
認為,人類隻看幾隻狗就能學會識別,並不代表此前沒有積累經驗。漫長的進化已經把祖先接觸世界的經驗,沉澱為人類大腦的結構和歸納偏置。
按照這一視角,神經網絡的大規模預訓練可以類比生物進化,模型微調和上下文學習才更接近個體一生中的學習。GPT-3讀過的文本遠超任何個人,但其預訓練承擔了壓縮海量經驗、塑造高效學習能力的作用。因此,不能直接拿模型的全部預訓練數據,與一個人出生後的少量學習樣本進行比較。
這種理解也意味著,繼續擴大數據和算力仍可能帶來明顯提升。他類比的是兩者發揮的作用,並沒有認為梯度下降與生物進化的具體機製相同。
這小哥啥來曆?
這哥們相當低調,X 上最新一條帖子還得追溯到 2024 年 11 月,當時他正在為 o1
招聘兩位研究工程師(RE)和軟件工程師(SWE)。
據他個人主頁顯示,Parascandolo 的研究經曆,一直圍繞泛化、規劃和推理展開。
2017 年,他進入馬克斯.普朗克智能係統研究所和蘇黎世聯邦理工學院攻讀博士,師從 Bernhard Schölkopf 和
Thomas Hofmann,博士課題聚焦深度學習中的 OOD 泛化。
博士期間,他在山景城的 Google X 和倫敦的 DeepMind
各做過一段實習,前者參與超大規模模擬器上的自動化設計研究,後者參與分治蒙特卡洛樹搜索研究。
2021 年 9 月博士畢業,他直接加入OpenAI,最初進入 John Schulman 領導的強化學習團隊,隨後轉向
Mark Chen 所在的算法團隊,又加入 Jerry Tworek 帶領的(草莓)團隊。草莓團隊,正是 o1
項目的內部代號。
2023 年,他參與 GPT-4 研發,並組建了一支繼續研究推理的新團隊。後來又參與了 OpenAI o1 和 o3
的基礎研究,推動獎勵建模、環境構建和通用推理算法的擴展。其中一部分算法描述,至今仍被他用黑塊遮住。
2020 年那場麵試,Parascandolo 沒能拿到 MIT 的教職,他去了 OpenAI。
四年後,他幫助構建了 o1。
人生總是妙不可言。
