簡體 | 繁體
loading...
新聞頻道
  • 首頁
  • 新聞
  • 讀圖
  • 財經
  • 教育
  • 家居
  • 健康
  • 美食
  • 時尚
  • 旅遊
  • 影視
  • 博客
  • 群吧
  • 論壇
  • 電台
  • 焦點新聞
  • 圖片新聞
  • 視頻新聞
  • 生活百態
  • 娛樂新聞
您的位置: 文學城 » 新聞 » 焦點新聞 » 5年前被MIT教授罵“無稽之談”的PPT,預言了OpenAI

5年前被MIT教授罵“無稽之談”的PPT,預言了OpenAI

文章來源: 機器之心 於 2026-08-15 19:14:14 - 新聞取自各大新聞媒體,新聞內容並不代表本網立場!
被閱讀次數

這次的主角叫 Giambattista Parascandolo,是 OpenAI 推理模型方向的重要研究者。

2020 年,他去 MIT 麵試教授崗位,做了一場關於用 GPT 做推理的報告。結果,麵試委員會大部分教授把這個方向斥為「無稽之談」(nonsense)。

https://x.com/turingbook/status/2084003612687249836?s=20

這哥們直接貼臉開大,將這段經曆寫進了個人主頁,並附上了當年的報告介紹和幻燈片鏈接。

https://sites.google.com/view/giambattista-parascandolo/home

那份被批「無稽之談」的報告,講了啥?

MIT 官網顯示,這場報告的主題,是如何讓人工神經網絡突破訓練分布,獲得更接近人類的泛化和規劃能力。

Parascandolo 認為,人類能夠重新組合已有知識,識別關鍵不變量,建立抽象模型,並完成長時程規劃。人工神經網絡在這些方麵仍有很大提升空間。

報告最後,他提出了三個未來研究方向:神經網絡中的開放式推理、人工神經網絡中尚未探索的自由度,以及在強化學習中將語言作為推理載體,以提高樣本效率。

其中最關鍵的概念,是「開放式推理」。

Parascandolo 將其定義為:模型可以投入更多時間和計算,持續修正答案。問題越難,模型就應該多想幾步,並讓額外計算轉化為更好的結果。

這聽起來已經很像今天的推理時計算擴展。

當時的標準 Transformer 擁有固定的網絡深度,每個 token 經曆的前向計算量基本確定,問題難度卻與輸入長度沒有穩定關係。一個問題可以很長,答案卻很簡單。另一個問題隻有一句話,可能需要多輪拆解和驗證。

RNN 看起來更加適合這種任務。它可以反複運行,理論上能夠獲得任意長度的思考時間。Parascandolo 在 PPT 中展示的曲線卻表明,RNN 通常隻在訓練時見過的推理步數附近表現最好,繼續增加循環次數,準確率反而可能下降。

這意味著,增加計算量隻是第一步,模型還要學會如何利用這些計算。

當時效果最強的多步規劃,大量依賴模型預測控製和蒙特卡洛樹搜索。神經網絡負責預測環境或評估價值,外部搜索算法負責展開未來路徑。Parascandolo 希望進一步將長程推理能力融入神經網絡。

他的第二個設想,是讓語言成為推理載體。

Parascandolo 用經典遊戲《蒙特祖瑪的複仇》舉例。一個從零開始訓練的強化學習 Agent,需要嚐試大量狀態和動作組合,很多正確操作本身並不複雜,Agent 真正缺少的,是對「什麽行為更合理」的判斷。

GPT 已經從文本中吸收了大量世界知識,語言可以幫助模型描述環境、理解目標、拆解任務和生成高層計劃,也能大幅縮小搜索範圍。

放到今天,這套思路很容易讓人聯想到思維鏈、語言規劃和 Agent 工作流。

Parascandolo 提出的第三個方向是,人工智能係統可以重置任務,回到記憶中的任意狀態,構造反事實場景,還可以調整模擬器中的時間、重力和觀察結果。係統甚至可以直接讀取、複製和修改自身的激活值與神經網絡權重。

這相當於把學習過程本身也納入 Agent 的操作空間。它可以開展刻意練習,生成特殊訓練場景,遷移已有知識,並針對失敗軌跡重新學習。

五年前的 PPT 裏,幾乎寫出了今天的推理模型路線。

我們還扒出了他 2021 年 6 月寫過的一篇博客,題目就是《反向傳播、進化與「兩隻狗」的誤區》。

這篇博客主要反駁「神經網絡需要海量數據,因此不像人腦」的觀點。

Parascandolo 認為,人類隻看幾隻狗就能學會識別,並不代表此前沒有積累經驗。漫長的進化已經把祖先接觸世界的經驗,沉澱為人類大腦的結構和歸納偏置。

按照這一視角,神經網絡的大規模預訓練可以類比生物進化,模型微調和上下文學習才更接近個體一生中的學習。GPT-3讀過的文本遠超任何個人,但其預訓練承擔了壓縮海量經驗、塑造高效學習能力的作用。因此,不能直接拿模型的全部預訓練數據,與一個人出生後的少量學習樣本進行比較。

這種理解也意味著,繼續擴大數據和算力仍可能帶來明顯提升。他類比的是兩者發揮的作用,並沒有認為梯度下降與生物進化的具體機製相同。

這小哥啥來曆?

這哥們相當低調,X 上最新一條帖子還得追溯到 2024 年 11 月,當時他正在為 o1 招聘兩位研究工程師(RE)和軟件工程師(SWE)。

據他個人主頁顯示,Parascandolo 的研究經曆,一直圍繞泛化、規劃和推理展開。

2017 年,他進入馬克斯.普朗克智能係統研究所和蘇黎世聯邦理工學院攻讀博士,師從 Bernhard Schölkopf 和 Thomas Hofmann,博士課題聚焦深度學習中的 OOD 泛化。

博士期間,他在山景城的 Google X 和倫敦的 DeepMind 各做過一段實習,前者參與超大規模模擬器上的自動化設計研究,後者參與分治蒙特卡洛樹搜索研究。

2021 年 9 月博士畢業,他直接加入OpenAI,最初進入 John Schulman 領導的強化學習團隊,隨後轉向 Mark Chen 所在的算法團隊,又加入 Jerry Tworek 帶領的(草莓)團隊。草莓團隊,正是 o1 項目的內部代號。

2023 年,他參與 GPT-4 研發,並組建了一支繼續研究推理的新團隊。後來又參與了 OpenAI o1 和 o3 的基礎研究,推動獎勵建模、環境構建和通用推理算法的擴展。其中一部分算法描述,至今仍被他用黑塊遮住。

2020 年那場麵試,Parascandolo 沒能拿到 MIT 的教職,他去了 OpenAI。

四年後,他幫助構建了 o1。

人生總是妙不可言。

`
  • 辛苦大半年,Labor Day也該給健康放個‘價’!美國專利產品【骨精華】買6送2,買12送5;【心血通】【益腦靈】買5送2,買10送5!
`
查看評論(4)
  • 文學城簡介
  • 廣告服務
  • 聯係我們
  • 招聘信息
  • 注冊筆名
  • 申請版主
  • 收藏文學城

WENXUECITY.COM does not represent or guarantee the truthfulness, accuracy, or reliability of any of communications posted by other users.

Copyright ©1998-2026 wenxuecity.com All rights reserved. Privacy Statement & Terms of Use & User Privacy Protection Policy

24小時熱點排行

阿裏巴巴前高管在美失蹤逾半月後確認身亡 死於車內
馬斯克母親曬新中式造型 點讚成都等四座中國城市
炫富網紅赴泰國"做陰莖增大術"!按摩按一半猝死
399美元“機器鴨”爆火:代購報價遠超官方售價
一頭驢之死,為何能讓整個美國破防?






24小時討論排行

為何中方至今沒發現幸存者?詳解吉隆泥石流毀滅性
美航母林肯號駛離泰國!5000美軍5天狂撒1億泰銖
曾經世界生育率最高,東亞現今超低生育率的真相
白宮:美特使與普京商討結束戰爭,計劃數周內公布
消息人士:習近平擬率“CEO天團”訪美
色情也能救國?烏克蘭擬推「成人產業合法化」
造神與毀神一樣容易:劍橋教授被指論文抄襲後自殺
助特朗普入局委內瑞拉富豪:出賣馬杜羅,侵吞10億
尼泊爾泥石流災害 中國工人獲救:49歲 河南安陽人
直博"進不去",專碩"讀不起":名校學碩停招後
尼泊爾“樓堅強”房主:因為離河近,地基打得很牢
52名新加坡人"涉傳銷"在廣西被捕!中國:依法查處
哈利返英挑戰高空跳傘,兌現與102歲二戰老兵約定
有兄弟姐妹,成了相親鄙視鏈的最底端
華爾街日報:性勒索已滲透到家庭群聊中
在韓遇害中國女生家屬希望“引渡嫌疑人” 訴求已報送
文學城新聞
切換到網頁版

5年前被MIT教授罵“無稽之談”的PPT,預言了OpenAI

機器之心 2026-08-15 19:14:14

這次的主角叫 Giambattista Parascandolo,是 OpenAI 推理模型方向的重要研究者。

2020 年,他去 MIT 麵試教授崗位,做了一場關於用 GPT 做推理的報告。結果,麵試委員會大部分教授把這個方向斥為「無稽之談」(nonsense)。

https://x.com/turingbook/status/2084003612687249836?s=20

這哥們直接貼臉開大,將這段經曆寫進了個人主頁,並附上了當年的報告介紹和幻燈片鏈接。

https://sites.google.com/view/giambattista-parascandolo/home

那份被批「無稽之談」的報告,講了啥?

MIT 官網顯示,這場報告的主題,是如何讓人工神經網絡突破訓練分布,獲得更接近人類的泛化和規劃能力。

Parascandolo 認為,人類能夠重新組合已有知識,識別關鍵不變量,建立抽象模型,並完成長時程規劃。人工神經網絡在這些方麵仍有很大提升空間。

報告最後,他提出了三個未來研究方向:神經網絡中的開放式推理、人工神經網絡中尚未探索的自由度,以及在強化學習中將語言作為推理載體,以提高樣本效率。

其中最關鍵的概念,是「開放式推理」。

Parascandolo 將其定義為:模型可以投入更多時間和計算,持續修正答案。問題越難,模型就應該多想幾步,並讓額外計算轉化為更好的結果。

這聽起來已經很像今天的推理時計算擴展。

當時的標準 Transformer 擁有固定的網絡深度,每個 token 經曆的前向計算量基本確定,問題難度卻與輸入長度沒有穩定關係。一個問題可以很長,答案卻很簡單。另一個問題隻有一句話,可能需要多輪拆解和驗證。

RNN 看起來更加適合這種任務。它可以反複運行,理論上能夠獲得任意長度的思考時間。Parascandolo 在 PPT 中展示的曲線卻表明,RNN 通常隻在訓練時見過的推理步數附近表現最好,繼續增加循環次數,準確率反而可能下降。

這意味著,增加計算量隻是第一步,模型還要學會如何利用這些計算。

當時效果最強的多步規劃,大量依賴模型預測控製和蒙特卡洛樹搜索。神經網絡負責預測環境或評估價值,外部搜索算法負責展開未來路徑。Parascandolo 希望進一步將長程推理能力融入神經網絡。

他的第二個設想,是讓語言成為推理載體。

Parascandolo 用經典遊戲《蒙特祖瑪的複仇》舉例。一個從零開始訓練的強化學習 Agent,需要嚐試大量狀態和動作組合,很多正確操作本身並不複雜,Agent 真正缺少的,是對「什麽行為更合理」的判斷。

GPT 已經從文本中吸收了大量世界知識,語言可以幫助模型描述環境、理解目標、拆解任務和生成高層計劃,也能大幅縮小搜索範圍。

放到今天,這套思路很容易讓人聯想到思維鏈、語言規劃和 Agent 工作流。

Parascandolo 提出的第三個方向是,人工智能係統可以重置任務,回到記憶中的任意狀態,構造反事實場景,還可以調整模擬器中的時間、重力和觀察結果。係統甚至可以直接讀取、複製和修改自身的激活值與神經網絡權重。

這相當於把學習過程本身也納入 Agent 的操作空間。它可以開展刻意練習,生成特殊訓練場景,遷移已有知識,並針對失敗軌跡重新學習。

五年前的 PPT 裏,幾乎寫出了今天的推理模型路線。

我們還扒出了他 2021 年 6 月寫過的一篇博客,題目就是《反向傳播、進化與「兩隻狗」的誤區》。

這篇博客主要反駁「神經網絡需要海量數據,因此不像人腦」的觀點。

Parascandolo 認為,人類隻看幾隻狗就能學會識別,並不代表此前沒有積累經驗。漫長的進化已經把祖先接觸世界的經驗,沉澱為人類大腦的結構和歸納偏置。

按照這一視角,神經網絡的大規模預訓練可以類比生物進化,模型微調和上下文學習才更接近個體一生中的學習。GPT-3讀過的文本遠超任何個人,但其預訓練承擔了壓縮海量經驗、塑造高效學習能力的作用。因此,不能直接拿模型的全部預訓練數據,與一個人出生後的少量學習樣本進行比較。

這種理解也意味著,繼續擴大數據和算力仍可能帶來明顯提升。他類比的是兩者發揮的作用,並沒有認為梯度下降與生物進化的具體機製相同。

這小哥啥來曆?

這哥們相當低調,X 上最新一條帖子還得追溯到 2024 年 11 月,當時他正在為 o1 招聘兩位研究工程師(RE)和軟件工程師(SWE)。

據他個人主頁顯示,Parascandolo 的研究經曆,一直圍繞泛化、規劃和推理展開。

2017 年,他進入馬克斯.普朗克智能係統研究所和蘇黎世聯邦理工學院攻讀博士,師從 Bernhard Schölkopf 和 Thomas Hofmann,博士課題聚焦深度學習中的 OOD 泛化。

博士期間,他在山景城的 Google X 和倫敦的 DeepMind 各做過一段實習,前者參與超大規模模擬器上的自動化設計研究,後者參與分治蒙特卡洛樹搜索研究。

2021 年 9 月博士畢業,他直接加入OpenAI,最初進入 John Schulman 領導的強化學習團隊,隨後轉向 Mark Chen 所在的算法團隊,又加入 Jerry Tworek 帶領的(草莓)團隊。草莓團隊,正是 o1 項目的內部代號。

2023 年,他參與 GPT-4 研發,並組建了一支繼續研究推理的新團隊。後來又參與了 OpenAI o1 和 o3 的基礎研究,推動獎勵建模、環境構建和通用推理算法的擴展。其中一部分算法描述,至今仍被他用黑塊遮住。

2020 年那場麵試,Parascandolo 沒能拿到 MIT 的教職,他去了 OpenAI。

四年後,他幫助構建了 o1。

人生總是妙不可言。