簡體 | 繁體
loading...
新聞頻道
  • 首頁
  • 新聞
  • 讀圖
  • 財經
  • 教育
  • 家居
  • 健康
  • 美食
  • 時尚
  • 旅遊
  • 影視
  • 博客
  • 群吧
  • 論壇
  • 電台
  • 焦點新聞
  • 圖片新聞
  • 視頻新聞
  • 生活百態
  • 娛樂新聞
您的位置: 文學城 » 新聞 » 焦點新聞 » Fable 5.1來了:號稱全球最強的模型,有多強?

Fable 5.1來了:號稱全球最強的模型,有多強?

文章來源: 騰訊科技 於 2026-09-01 19:01:13 - 新聞取自各大新聞媒體,新聞內容並不代表本網立場!
被閱讀次數


Anthropic聯創兼CEO達裏奧·阿莫迪。圖片經由AI處理

 

美國當地時間9月1日,Anthropic同時發布了Claude Fable 5.1和Claude Mythos 5.1。

這兩款模型使用相同的底層模型,但安全限製不同。Fable 5.1已經廣泛開放,麵向Pro、Max、Team和Enterprise用戶,並通過Claude API及主流雲平台提供。Mythos 5.1通過審核機製向部分網絡安全和生命科學專業用戶開放,目前訪問範圍仍然非常有限。

Fable 5.1的輸入和輸出價格沒有變化,但緩存讀取價格下降75%。按照Anthropic的測算,典型工作負載的整體成本較Fable 5降低約25%,複雜編碼和高度代理化任務的成本最高可降低約45%。

Anthropic同時推出Enterprise Frontier Safeguards(EFS),允許企業將相關數據保存在自己控製的雲基礎設施中。對於符合條件的客戶,在EFS正式提供之前,也可以使用Fable 5.1的零數據保留模式。

在模型能力方麵,Fable 5.1在編碼、科學研究、知識工作和業務自動化等測試中的成績均高於Fable 5。Anthropic還公布了早期客戶的實際使用案例,包括長時間運行的機器學習任務、軟件故障排查和瀏覽器智能體任務。

01 一項科研Agent測試,得分是GPT-5.6 Sol的2.3倍

Anthropic這次對Fable 5.1的定位發生了明顯變化:模型需要自己處理更長、更複雜的任務,並在執行過程中不斷檢查結果、調用工具和調整路徑。

Anthropic自己公布的測試結果顯示,在Terminal-Bench-Science 0.1中,Fable 5.1得分52.6%,超過GPT-5.6 Sol(22.4%)一倍,Fable 5為24.7%,Opus 5為29.0%。這項測試考察的是AI智能體執行科學研究任務的能力,模型需要在終端環境中完成連續的研究工作。

在Terminal-Bench 4.0中,Fable 5.1得分55.8%,高於Fable 5的42.0%和Opus 5的52.3%。如果放寬安全限製,使用同一底層模型的Mythos 5.1得分進一步提高到60.9%,成為這項測試中成績最高的版本。

類似的提升也出現在知識工作和業務自動化任務中。Fable 5.1在GDPval-AA v2中獲得1853分,高於Opus 5的1824分和Fable 5的1723分;在AutomationBench中獲得31.4%,Fable 5和Opus 5分別為17.1%和26.9%;在CursorBench 3.2.0中則達到73.4%。

這些測試結果反映出的變化,是模型能夠在更長的任務鏈中保持工作狀態。Anthropic公布的早期客戶案例更能說明這一點。

投資公司Millennium遇到過一個極少出現的軟件崩潰問題,大約每運行100萬次才發生一次。這個問題已經困擾該團隊四五年,包括此前使用過的模型在內,都沒有找到原因。Fable 5.1最終對外部供應商的軟件庫進行了反匯編,並將結果與係統崩潰時留下的核心轉儲文件進行比對,最後把問題定位到了該軟件庫中的一個Bug。

Ramp測試的則是一項持續運行的機器學習任務。Fable 5.1在無人值守的情況下運行了38小時,重新檢查此前得到的結果後,判斷其中存在標簽造成的誤差,並進一步啟動6項實驗。實驗運行一夜後,模型返回新的結果以及下一步建議。

還有一些任務更加接近企業日常使用場景。Browserbase讓Fable 5.1執行瀏覽器智能體任務,在其最困難的一項測試中完成率達到82%,高於Opus 5的74%和Fable 5的57%。Jane Street Capital則表示,在內部測試中,Fable 5.1解決的編碼問題多於Fable 5和Opus 5,而且在長時間、多步驟任務中,輸出仍然比較容易理解。

從這些案例看,Fable 5.1需要處理的已經不隻是一個問題對應一個答案。一次任務可能從讀取資料開始,經過代碼分析、工具調用、實驗驗證,再回到前麵的結果重新判斷,最後形成可以交付的結果。

科研任務是Anthropic此次重點展示的另一類應用。

其中最值得關注的是蛋白質設計。現代藥物研發中,很多藥物需要先找到能夠與人體內特定目標結合的蛋白質。Anthropic讓Mythos 5.1使用開源蛋白質設計和折疊工具完成設計,再把模型生成的結果交給兩家外部機構進行實驗驗證。

在12個目標上,Mythos 5.1生成的設計中,接近50%最終被驗證為有效結合劑。Anthropic稱,目前蛋白質設計中的典型命中率大約為10%至15%。

在其中三個目標上,模型設計出的結合劑結合能力達到此前Adaptyv Bio蛋白質設計競賽最佳設計的10倍。

這項測試的意義在於,模型承擔的工作已經涉及實驗之前的設計環節。它可以根據目標生成方案,再利用現有的蛋白質設計和折疊工具進行計算,最後將候選結果交給實驗人員驗證。

Anthropic還公布了一個計算建模案例。Fable 5.1利用NASA的麥哲倫號任務30多年前獲取的雷達圖像,以及覆蓋金星約五分之一範圍的已有地圖,訓練神經網絡,重新生成了覆蓋金星約三分之一範圍的高分辨率高程圖。

新地圖可以看到約2至3公裏尺度的細節,原有地圖的分辨率約為10至20公裏,同時高度測量準確度最多提高25%。Anthropic計劃在NASA的VERITAS任務和ESA的EnVision任務開展後續工作前,以Creative Commons許可證公開這張地圖。

計算生物學方麵,Mythos 5.1把重點放在計算效率上。

科研人員經常需要在GPU上反複運行專門的機器學習模型,而計算速度會直接影響實驗進度。Mythos 5.1通過編寫定製GPU內核,並緩存中間結果,將7個開源深度學習模型的推理速度提高了最高2.5倍,而且輸出結果保持一致。

這些模型包括ChromBPNet、Flashzoi、Enformer、Profluent-E1、ProGen2和不同規模的Evo2。按照Anthropic的估算,在基因組範圍的分析中,優化後的模型可以減少30%至60%的GPU成本。

Anthropic表示,這類優化過去通常需要性能工程團隊花費數周完成,而Mythos 5.1隻用了幾天,並且隻使用公開的源代碼。相關優化計劃後續開源。

02 相同底層模型 兩套安全機製

Fable 5.1和Mythos 5.1雖然是同一個模型,但使用範圍並不一樣。

Fable 5.1已經麵向所有平台提供,包括AWS、Google Cloud和Microsoft Azure,開發者也可以通過Claude API調用claude-fable-5-1。

在安全策略方麵,Anthropic此次重點調整了網絡安全和生命科學領域的限製。

網絡安全方麵,Fable 5.1現在可以幫助用戶發現軟件漏洞,用於防禦性安全工作。Anthropic表示,與此前Fable 5使用的網絡安全防護相比,新的防護機製在Claude Code中的平均幹預次數減少約60%。

生命科學領域則仍然采取更嚴格的方式。普通用戶涉及研究和開發的生命科學任務仍會被轉向Opus模型,而專業人員可以通過生命科學驗證計劃申請Mythos 5.1的訪問權限。該計劃已經與美國政府合作,並已經有首批參與者。

Mythos 5.1還將通過網絡安全驗證計劃向經過審核的網絡安全人員開放。Claude Security目前也已經由Mythos 5.1提供支持,用於掃描代碼庫中的漏洞並提出供人工審核的修複方案。

與此同時,Anthropic也強化了數據隱私和企業安全機製。

新的Enterprise Frontier Safeguards,即EFS,可以讓企業把數據存放在自己控製的雲基礎設施中,而不是Anthropic的係統裏。默認情況下,涉及人工審核的工作也由企業自行完成。EFS將從今年秋季開始分階段推出,在正式支持之前,符合條件的企業可以使用Fable 5.1的零數據保留模式。

Anthropic表示,EFS是在與100多家企業合作後開發的,參與企業覆蓋金融、醫療、製造、電信、法律、零售和公共部門等領域。

從這次發布來看,Fable 5.1的升級集中在幾個非常具體的地方:代碼能力更強,長任務更穩定,科研任務開始出現實際案例,緩存讀取價格下降,同時企業可以獲得更明確的數據控製方式。

對普通用戶來說,最直接的變化可能是模型處理複雜任務時更容易持續完成工作;對企業來說,成本下降和數據保留機製則降低了長期使用的門檻。Anthropic也通過Mythos 5.1把更強的網絡安全和生命科學能力交給經過審核的專業用戶。

Fable 5.1由此成為Anthropic當前麵向生產環境的主力模型之一,而科研和高風險專業場景,則被單獨放進了Mythos 5.1的受控訪問體係。

03 緩存價格降了75%

Fable 5.1這次調整的不隻是模型能力和安全機製,還有使用成本。

Anthropic保留了Fable 5此前的標準API價格,輸入每百萬Token 10美元,輸出每百萬Token 50美元,沒有直接降低基礎價格。但緩存讀取價格從每百萬Token 1美元降到了0.25美元,降幅達到75%。

Anthropic按照2026年8月的實際使用情況測算,典型工作負載的整體成本可以降低約25%。對於高度Agent化、緩存讀取占比較高的任務,成本降幅更高。

不過,第三方測評機構Artificial Analysis的測試顯示,緩存價格下降並不意味著每項任務的實際成本都會下降。其數據顯示,在最高推理強度下,Fable 5.1完成一次Intelligence Index任務的平均成本為3.76美元,比Fable 5高20%。主要原因是Fable 5.1使用的輸出Token約為Fable 5的1.7倍。

緩存價格下調仍然帶來了明顯的成本節省。Artificial Analysis測算,緩存讀取降價平均為每項任務節省約1.40美元,這一變化主要體現在智能體測試中,因為這類任務會反複讀取此前已經處理過的上下文。

如果將推理強度從最高檔調整到xhigh,Fable 5.1的Intelligence Index得分為65,單項任務成本降至2.72美元,比最高強度低1.04美元。不過,這一成本仍高於Opus 5在最高推理強度下2.34美元的水平。

因此,Fable 5.1的成本變化並不是簡單的“價格下降”。Anthropic降低了緩存讀取這一項費用,但模型在複雜任務中消耗的輸出Token更多,最終每項任務的成本還取決於具體的調用方式和推理強度。

此外,Fable 5.1還支持批量處理。對於異步任務,輸入和輸出價格可以降至每百萬token 5美元和25美元。美國境內專用推理的價格係數為1.1倍,網頁搜索價格為每1000次10美元,網頁抓取不單獨收費。

Anthropic也給出了不同模型之間的價格對比。Opus 5的輸入和輸出價格分別為5美元和25美元,緩存讀取為0.50美元;Sonnet 5則分別為2美元、10美元和0.20美元。

Fable 5.1的普通輸入和輸出價格仍高於這兩款模型,但緩存讀取價格已經低於Opus 5,僅比Sonnet 5高0.05美元。

`
  • 月滿中秋,把健康送給自己,也送給最牽掛的人。美國專利產品【骨精華】守護骨骼與關節健康;【心血通】支持心血管健康;【益腦靈】嗬護腦部健康與記憶力。
`
查看評論(1)
  • 文學城簡介
  • 廣告服務
  • 聯係我們
  • 招聘信息
  • 注冊筆名
  • 申請版主
  • 收藏文學城

WENXUECITY.COM does not represent or guarantee the truthfulness, accuracy, or reliability of any of communications posted by other users.

Copyright ©1998-2026 wenxuecity.com All rights reserved. Privacy Statement & Terms of Use & User Privacy Protection Policy

24小時熱點排行

任正非全家失聯傳言滿天飛 小女兒姚安娜終於現身…
翁帆:先生離去已經半年有餘了,我有點後悔
川普球場親吻“緋聞女幕僚”照片瘋傳 真相曝光
瘋傳美球賽“看台站滿印度人” 政客借題發揮掀熱議
時隔三年多!美聯儲重啟加息25個基點 內部預計....






24小時討論排行

硬剛美國,加拿大的底氣從何而來?
美眾院第3度通過決議案:"要求結束伊朗戰爭"
翻舊賬?孫宇晨再杠景甜,提告要拿回天價彩禮
美軍基地受損新照片曝光,“我們就像閉眼挨重拳”
當農村男人發現自己付不起彩禮,會發生什麽
被指“國企黨員搞滿獨” 宋劍仁因煽動民族仇恨罪獲刑
紐約時報:人工智能時代,中國人還需要學英語嗎?
紐約時報:為何這些權勢人物向特朗普卑躬屈膝
蔣介石銅像正式離開東吳大學 網友批“忘恩負義”
夫妻失業患病 欠HOA $977 一套房子竟被8千元拍走
名校光環失靈?牛津碩士畢業做Uber Eats送外賣
孩子連飯都吃不上,這破學校是非上不可嗎?
求不到美國介入,沙特夾在美伊之間“左右為難”
萬斯和川普唱反調?稱:若真在造“科學怪人”請停手
中國女與白女在首爾商場爆扭打 疑因一句辱華言論
就業率僅7%:塔利班掌權下的阿富汗女性生存實錄
文學城新聞
切換到網頁版

Fable 5.1來了:號稱全球最強的模型,有多強?

騰訊科技 2026-09-01 19:01:13


Anthropic聯創兼CEO達裏奧·阿莫迪。圖片經由AI處理

 

美國當地時間9月1日,Anthropic同時發布了Claude Fable 5.1和Claude Mythos 5.1。

這兩款模型使用相同的底層模型,但安全限製不同。Fable 5.1已經廣泛開放,麵向Pro、Max、Team和Enterprise用戶,並通過Claude API及主流雲平台提供。Mythos 5.1通過審核機製向部分網絡安全和生命科學專業用戶開放,目前訪問範圍仍然非常有限。

Fable 5.1的輸入和輸出價格沒有變化,但緩存讀取價格下降75%。按照Anthropic的測算,典型工作負載的整體成本較Fable 5降低約25%,複雜編碼和高度代理化任務的成本最高可降低約45%。

Anthropic同時推出Enterprise Frontier Safeguards(EFS),允許企業將相關數據保存在自己控製的雲基礎設施中。對於符合條件的客戶,在EFS正式提供之前,也可以使用Fable 5.1的零數據保留模式。

在模型能力方麵,Fable 5.1在編碼、科學研究、知識工作和業務自動化等測試中的成績均高於Fable 5。Anthropic還公布了早期客戶的實際使用案例,包括長時間運行的機器學習任務、軟件故障排查和瀏覽器智能體任務。

01 一項科研Agent測試,得分是GPT-5.6 Sol的2.3倍

Anthropic這次對Fable 5.1的定位發生了明顯變化:模型需要自己處理更長、更複雜的任務,並在執行過程中不斷檢查結果、調用工具和調整路徑。

Anthropic自己公布的測試結果顯示,在Terminal-Bench-Science 0.1中,Fable 5.1得分52.6%,超過GPT-5.6 Sol(22.4%)一倍,Fable 5為24.7%,Opus 5為29.0%。這項測試考察的是AI智能體執行科學研究任務的能力,模型需要在終端環境中完成連續的研究工作。

在Terminal-Bench 4.0中,Fable 5.1得分55.8%,高於Fable 5的42.0%和Opus 5的52.3%。如果放寬安全限製,使用同一底層模型的Mythos 5.1得分進一步提高到60.9%,成為這項測試中成績最高的版本。

類似的提升也出現在知識工作和業務自動化任務中。Fable 5.1在GDPval-AA v2中獲得1853分,高於Opus 5的1824分和Fable 5的1723分;在AutomationBench中獲得31.4%,Fable 5和Opus 5分別為17.1%和26.9%;在CursorBench 3.2.0中則達到73.4%。

這些測試結果反映出的變化,是模型能夠在更長的任務鏈中保持工作狀態。Anthropic公布的早期客戶案例更能說明這一點。

投資公司Millennium遇到過一個極少出現的軟件崩潰問題,大約每運行100萬次才發生一次。這個問題已經困擾該團隊四五年,包括此前使用過的模型在內,都沒有找到原因。Fable 5.1最終對外部供應商的軟件庫進行了反匯編,並將結果與係統崩潰時留下的核心轉儲文件進行比對,最後把問題定位到了該軟件庫中的一個Bug。

Ramp測試的則是一項持續運行的機器學習任務。Fable 5.1在無人值守的情況下運行了38小時,重新檢查此前得到的結果後,判斷其中存在標簽造成的誤差,並進一步啟動6項實驗。實驗運行一夜後,模型返回新的結果以及下一步建議。

還有一些任務更加接近企業日常使用場景。Browserbase讓Fable 5.1執行瀏覽器智能體任務,在其最困難的一項測試中完成率達到82%,高於Opus 5的74%和Fable 5的57%。Jane Street Capital則表示,在內部測試中,Fable 5.1解決的編碼問題多於Fable 5和Opus 5,而且在長時間、多步驟任務中,輸出仍然比較容易理解。

從這些案例看,Fable 5.1需要處理的已經不隻是一個問題對應一個答案。一次任務可能從讀取資料開始,經過代碼分析、工具調用、實驗驗證,再回到前麵的結果重新判斷,最後形成可以交付的結果。

科研任務是Anthropic此次重點展示的另一類應用。

其中最值得關注的是蛋白質設計。現代藥物研發中,很多藥物需要先找到能夠與人體內特定目標結合的蛋白質。Anthropic讓Mythos 5.1使用開源蛋白質設計和折疊工具完成設計,再把模型生成的結果交給兩家外部機構進行實驗驗證。

在12個目標上,Mythos 5.1生成的設計中,接近50%最終被驗證為有效結合劑。Anthropic稱,目前蛋白質設計中的典型命中率大約為10%至15%。

在其中三個目標上,模型設計出的結合劑結合能力達到此前Adaptyv Bio蛋白質設計競賽最佳設計的10倍。

這項測試的意義在於,模型承擔的工作已經涉及實驗之前的設計環節。它可以根據目標生成方案,再利用現有的蛋白質設計和折疊工具進行計算,最後將候選結果交給實驗人員驗證。

Anthropic還公布了一個計算建模案例。Fable 5.1利用NASA的麥哲倫號任務30多年前獲取的雷達圖像,以及覆蓋金星約五分之一範圍的已有地圖,訓練神經網絡,重新生成了覆蓋金星約三分之一範圍的高分辨率高程圖。

新地圖可以看到約2至3公裏尺度的細節,原有地圖的分辨率約為10至20公裏,同時高度測量準確度最多提高25%。Anthropic計劃在NASA的VERITAS任務和ESA的EnVision任務開展後續工作前,以Creative Commons許可證公開這張地圖。

計算生物學方麵,Mythos 5.1把重點放在計算效率上。

科研人員經常需要在GPU上反複運行專門的機器學習模型,而計算速度會直接影響實驗進度。Mythos 5.1通過編寫定製GPU內核,並緩存中間結果,將7個開源深度學習模型的推理速度提高了最高2.5倍,而且輸出結果保持一致。

這些模型包括ChromBPNet、Flashzoi、Enformer、Profluent-E1、ProGen2和不同規模的Evo2。按照Anthropic的估算,在基因組範圍的分析中,優化後的模型可以減少30%至60%的GPU成本。

Anthropic表示,這類優化過去通常需要性能工程團隊花費數周完成,而Mythos 5.1隻用了幾天,並且隻使用公開的源代碼。相關優化計劃後續開源。

02 相同底層模型 兩套安全機製

Fable 5.1和Mythos 5.1雖然是同一個模型,但使用範圍並不一樣。

Fable 5.1已經麵向所有平台提供,包括AWS、Google Cloud和Microsoft Azure,開發者也可以通過Claude API調用claude-fable-5-1。

在安全策略方麵,Anthropic此次重點調整了網絡安全和生命科學領域的限製。

網絡安全方麵,Fable 5.1現在可以幫助用戶發現軟件漏洞,用於防禦性安全工作。Anthropic表示,與此前Fable 5使用的網絡安全防護相比,新的防護機製在Claude Code中的平均幹預次數減少約60%。

生命科學領域則仍然采取更嚴格的方式。普通用戶涉及研究和開發的生命科學任務仍會被轉向Opus模型,而專業人員可以通過生命科學驗證計劃申請Mythos 5.1的訪問權限。該計劃已經與美國政府合作,並已經有首批參與者。

Mythos 5.1還將通過網絡安全驗證計劃向經過審核的網絡安全人員開放。Claude Security目前也已經由Mythos 5.1提供支持,用於掃描代碼庫中的漏洞並提出供人工審核的修複方案。

與此同時,Anthropic也強化了數據隱私和企業安全機製。

新的Enterprise Frontier Safeguards,即EFS,可以讓企業把數據存放在自己控製的雲基礎設施中,而不是Anthropic的係統裏。默認情況下,涉及人工審核的工作也由企業自行完成。EFS將從今年秋季開始分階段推出,在正式支持之前,符合條件的企業可以使用Fable 5.1的零數據保留模式。

Anthropic表示,EFS是在與100多家企業合作後開發的,參與企業覆蓋金融、醫療、製造、電信、法律、零售和公共部門等領域。

從這次發布來看,Fable 5.1的升級集中在幾個非常具體的地方:代碼能力更強,長任務更穩定,科研任務開始出現實際案例,緩存讀取價格下降,同時企業可以獲得更明確的數據控製方式。

對普通用戶來說,最直接的變化可能是模型處理複雜任務時更容易持續完成工作;對企業來說,成本下降和數據保留機製則降低了長期使用的門檻。Anthropic也通過Mythos 5.1把更強的網絡安全和生命科學能力交給經過審核的專業用戶。

Fable 5.1由此成為Anthropic當前麵向生產環境的主力模型之一,而科研和高風險專業場景,則被單獨放進了Mythos 5.1的受控訪問體係。

03 緩存價格降了75%

Fable 5.1這次調整的不隻是模型能力和安全機製,還有使用成本。

Anthropic保留了Fable 5此前的標準API價格,輸入每百萬Token 10美元,輸出每百萬Token 50美元,沒有直接降低基礎價格。但緩存讀取價格從每百萬Token 1美元降到了0.25美元,降幅達到75%。

Anthropic按照2026年8月的實際使用情況測算,典型工作負載的整體成本可以降低約25%。對於高度Agent化、緩存讀取占比較高的任務,成本降幅更高。

不過,第三方測評機構Artificial Analysis的測試顯示,緩存價格下降並不意味著每項任務的實際成本都會下降。其數據顯示,在最高推理強度下,Fable 5.1完成一次Intelligence Index任務的平均成本為3.76美元,比Fable 5高20%。主要原因是Fable 5.1使用的輸出Token約為Fable 5的1.7倍。

緩存價格下調仍然帶來了明顯的成本節省。Artificial Analysis測算,緩存讀取降價平均為每項任務節省約1.40美元,這一變化主要體現在智能體測試中,因為這類任務會反複讀取此前已經處理過的上下文。

如果將推理強度從最高檔調整到xhigh,Fable 5.1的Intelligence Index得分為65,單項任務成本降至2.72美元,比最高強度低1.04美元。不過,這一成本仍高於Opus 5在最高推理強度下2.34美元的水平。

因此,Fable 5.1的成本變化並不是簡單的“價格下降”。Anthropic降低了緩存讀取這一項費用,但模型在複雜任務中消耗的輸出Token更多,最終每項任務的成本還取決於具體的調用方式和推理強度。

此外,Fable 5.1還支持批量處理。對於異步任務,輸入和輸出價格可以降至每百萬token 5美元和25美元。美國境內專用推理的價格係數為1.1倍,網頁搜索價格為每1000次10美元,網頁抓取不單獨收費。

Anthropic也給出了不同模型之間的價格對比。Opus 5的輸入和輸出價格分別為5美元和25美元,緩存讀取為0.50美元;Sonnet 5則分別為2美元、10美元和0.20美元。

Fable 5.1的普通輸入和輸出價格仍高於這兩款模型,但緩存讀取價格已經低於Opus 5,僅比Sonnet 5高0.05美元。