儘管美國封鎖先進運算芯片占據了新聞頭條,但中方AI專家卻警告,事實恐怕會證明,優質資料枯竭,可能成為國家科技雄心的下一個主要瓶頸。
Anthropic在亞馬遜公司支持下,啟動“巴拿馬計劃”(Project Panama)引發廣大爭議。
在打造下一代人工智能(AI)模型的高風險競賽中,大陸正進入一個關鍵新階段。一個較不顯眼,但遠遠更具存亡意義的威脅正逐漸浮現,那就是高品質訓練資料嚴重短缺。
儘管美國封鎖先進運算芯片占據了新聞頭條,但中方AI專家卻日益警告,事實恐怕會證明,優質資料枯竭,可能成為國家科技雄心的下一個主要瓶頸,而這可能是無法輕易靠硬件替代方案來解決的問題。
事實上,《南華早報》8日報導,這挑戰正同時衝擊太平洋兩岸的AI巨頭,而部分美國企業已採取積極手段,以保持領先。美國研究機構Epoch
AI說,全球高品質、公開可用的人類生成文本供應,可能會在未來6年內耗盡。而OpenAI共同創辦人卡帕西(Andrej
Karpathy)也警告,2030年結束前,將出現“資料牆”,若沒有新鮮可靠的資訊喂養,模型能力可能陷入停滯。
美國頂尖實驗室正大手筆投資,挖掘線下的人類知識,引發了激烈的倫理爭論。今年1月《華盛頓郵報》報導的法庭文件顯示,Anthropic在亞馬遜公司支持下,啟動“巴拿馬計劃”(Project
Panama),斥資數千萬美元,收購了數百萬本實體書,拆除裝訂、掃描每一頁後,再加以丟棄。
相關揭露引發作家、檔案管理員與文化資產保存者的強烈譴責,他們指控科技公司把人類遺產當成可拋棄的原料。Anthropic一名代表本月稍早告訴事實查核網Snopes:“我們的資料獲取計劃從未購買並銷毀『稀有』或『古董』書。”
另一方麵,對大陸來說,即將到來的“資料牆”構成了獨特威脅。中國信息通信研究院院長餘曉暉便指出:“人工智能創新的競爭,不僅是模型和算力的競爭,更是高質量數據供給體係的競爭。”而網絡追蹤機構W3Techs本月的數據顯示,英文占全球網絡內容近一半,中文卻僅占1.3%,遠遠落後西班牙文的6%、德文的5.9%與日文的5%。
北京正積極將資料視為核心戰略資產。國家數據局6月公布一項全麵的全國性計劃,目標是提升高品質AI訓練資料的供應、流通與商業化。中方電腦科學家說,國家不能隻依賴標準網絡爬取,而必須係統性推動數位化龐大、尚未開發的離線資產。
中方電腦科學家說,國家不能隻依賴標準網絡爬取,而必須係統性推動數位化龐大、尚未開發的離線資產。清華大學人工智能研究院常務副院長孫茂鬆上個月在《光明日報》撰文指出:“語料庫在大語言模型發展中扮演關鍵角色,已演變成支撐AI能力迭代的核心要素。”他並強調,沒有語料庫,就沒有語言大模型。