Fable 5.1來了:號稱全球最強的模型,有多強?
騰訊科技
2026-09-01 19:01:13
Anthropic聯創兼CEO達裏奧·阿莫迪。圖片經由AI處理
美國當地時間9月1日,Anthropic同時發布了Claude Fable 5.1和Claude Mythos 5.1。
這兩款模型使用相同的底層模型,但安全限製不同。Fable
5.1已經廣泛開放,麵向Pro、Max、Team和Enterprise用戶,並通過Claude API及主流雲平台提供。Mythos
5.1通過審核機製向部分網絡安全和生命科學專業用戶開放,目前訪問範圍仍然非常有限。
Fable
5.1的輸入和輸出價格沒有變化,但緩存讀取價格下降75%。按照Anthropic的測算,典型工作負載的整體成本較Fable
5降低約25%,複雜編碼和高度代理化任務的成本最高可降低約45%。
Anthropic同時推出Enterprise Frontier
Safeguards(EFS),允許企業將相關數據保存在自己控製的雲基礎設施中。對於符合條件的客戶,在EFS正式提供之前,也可以使用Fable
5.1的零數據保留模式。
在模型能力方麵,Fable 5.1在編碼、科學研究、知識工作和業務自動化等測試中的成績均高於Fable
5。Anthropic還公布了早期客戶的實際使用案例,包括長時間運行的機器學習任務、軟件故障排查和瀏覽器智能體任務。
01 一項科研Agent測試,得分是GPT-5.6 Sol的2.3倍
Anthropic這次對Fable
5.1的定位發生了明顯變化:模型需要自己處理更長、更複雜的任務,並在執行過程中不斷檢查結果、調用工具和調整路徑。
Anthropic自己公布的測試結果顯示,在Terminal-Bench-Science 0.1中,Fable
5.1得分52.6%,超過GPT-5.6 Sol(22.4%)一倍,Fable 5為24.7%,Opus
5為29.0%。這項測試考察的是AI智能體執行科學研究任務的能力,模型需要在終端環境中完成連續的研究工作。
在Terminal-Bench 4.0中,Fable 5.1得分55.8%,高於Fable 5的42.0%和Opus
5的52.3%。如果放寬安全限製,使用同一底層模型的Mythos
5.1得分進一步提高到60.9%,成為這項測試中成績最高的版本。
類似的提升也出現在知識工作和業務自動化任務中。Fable 5.1在GDPval-AA v2中獲得1853分,高於Opus
5的1824分和Fable 5的1723分;在AutomationBench中獲得31.4%,Fable 5和Opus
5分別為17.1%和26.9%;在CursorBench 3.2.0中則達到73.4%。
這些測試結果反映出的變化,是模型能夠在更長的任務鏈中保持工作狀態。Anthropic公布的早期客戶案例更能說明這一點。
投資公司Millennium遇到過一個極少出現的軟件崩潰問題,大約每運行100萬次才發生一次。這個問題已經困擾該團隊四五年,包括此前使用過的模型在內,都沒有找到原因。Fable
5.1最終對外部供應商的軟件庫進行了反匯編,並將結果與係統崩潰時留下的核心轉儲文件進行比對,最後把問題定位到了該軟件庫中的一個Bug。
Ramp測試的則是一項持續運行的機器學習任務。Fable
5.1在無人值守的情況下運行了38小時,重新檢查此前得到的結果後,判斷其中存在標簽造成的誤差,並進一步啟動6項實驗。實驗運行一夜後,模型返回新的結果以及下一步建議。
還有一些任務更加接近企業日常使用場景。Browserbase讓Fable
5.1執行瀏覽器智能體任務,在其最困難的一項測試中完成率達到82%,高於Opus 5的74%和Fable 5的57%。Jane
Street Capital則表示,在內部測試中,Fable 5.1解決的編碼問題多於Fable 5和Opus
5,而且在長時間、多步驟任務中,輸出仍然比較容易理解。
從這些案例看,Fable
5.1需要處理的已經不隻是一個問題對應一個答案。一次任務可能從讀取資料開始,經過代碼分析、工具調用、實驗驗證,再回到前麵的結果重新判斷,最後形成可以交付的結果。
科研任務是Anthropic此次重點展示的另一類應用。
其中最值得關注的是蛋白質設計。現代藥物研發中,很多藥物需要先找到能夠與人體內特定目標結合的蛋白質。Anthropic讓Mythos
5.1使用開源蛋白質設計和折疊工具完成設計,再把模型生成的結果交給兩家外部機構進行實驗驗證。
在12個目標上,Mythos
5.1生成的設計中,接近50%最終被驗證為有效結合劑。Anthropic稱,目前蛋白質設計中的典型命中率大約為10%至15%。
在其中三個目標上,模型設計出的結合劑結合能力達到此前Adaptyv Bio蛋白質設計競賽最佳設計的10倍。
這項測試的意義在於,模型承擔的工作已經涉及實驗之前的設計環節。它可以根據目標生成方案,再利用現有的蛋白質設計和折疊工具進行計算,最後將候選結果交給實驗人員驗證。
Anthropic還公布了一個計算建模案例。Fable
5.1利用NASA的麥哲倫號任務30多年前獲取的雷達圖像,以及覆蓋金星約五分之一範圍的已有地圖,訓練神經網絡,重新生成了覆蓋金星約三分之一範圍的高分辨率高程圖。
新地圖可以看到約2至3公裏尺度的細節,原有地圖的分辨率約為10至20公裏,同時高度測量準確度最多提高25%。Anthropic計劃在NASA的VERITAS任務和ESA的EnVision任務開展後續工作前,以Creative
Commons許可證公開這張地圖。
計算生物學方麵,Mythos 5.1把重點放在計算效率上。
科研人員經常需要在GPU上反複運行專門的機器學習模型,而計算速度會直接影響實驗進度。Mythos
5.1通過編寫定製GPU內核,並緩存中間結果,將7個開源深度學習模型的推理速度提高了最高2.5倍,而且輸出結果保持一致。
這些模型包括ChromBPNet、Flashzoi、Enformer、Profluent-E1、ProGen2和不同規模的Evo2。按照Anthropic的估算,在基因組範圍的分析中,優化後的模型可以減少30%至60%的GPU成本。
Anthropic表示,這類優化過去通常需要性能工程團隊花費數周完成,而Mythos
5.1隻用了幾天,並且隻使用公開的源代碼。相關優化計劃後續開源。
02 相同底層模型 兩套安全機製
Fable 5.1和Mythos 5.1雖然是同一個模型,但使用範圍並不一樣。
Fable 5.1已經麵向所有平台提供,包括AWS、Google Cloud和Microsoft
Azure,開發者也可以通過Claude API調用claude-fable-5-1。
在安全策略方麵,Anthropic此次重點調整了網絡安全和生命科學領域的限製。
網絡安全方麵,Fable 5.1現在可以幫助用戶發現軟件漏洞,用於防禦性安全工作。Anthropic表示,與此前Fable
5使用的網絡安全防護相比,新的防護機製在Claude Code中的平均幹預次數減少約60%。
生命科學領域則仍然采取更嚴格的方式。普通用戶涉及研究和開發的生命科學任務仍會被轉向Opus模型,而專業人員可以通過生命科學驗證計劃申請Mythos
5.1的訪問權限。該計劃已經與美國政府合作,並已經有首批參與者。
Mythos 5.1還將通過網絡安全驗證計劃向經過審核的網絡安全人員開放。Claude Security目前也已經由Mythos
5.1提供支持,用於掃描代碼庫中的漏洞並提出供人工審核的修複方案。
與此同時,Anthropic也強化了數據隱私和企業安全機製。
新的Enterprise Frontier
Safeguards,即EFS,可以讓企業把數據存放在自己控製的雲基礎設施中,而不是Anthropic的係統裏。默認情況下,涉及人工審核的工作也由企業自行完成。EFS將從今年秋季開始分階段推出,在正式支持之前,符合條件的企業可以使用Fable
5.1的零數據保留模式。
Anthropic表示,EFS是在與100多家企業合作後開發的,參與企業覆蓋金融、醫療、製造、電信、法律、零售和公共部門等領域。
從這次發布來看,Fable
5.1的升級集中在幾個非常具體的地方:代碼能力更強,長任務更穩定,科研任務開始出現實際案例,緩存讀取價格下降,同時企業可以獲得更明確的數據控製方式。
對普通用戶來說,最直接的變化可能是模型處理複雜任務時更容易持續完成工作;對企業來說,成本下降和數據保留機製則降低了長期使用的門檻。Anthropic也通過Mythos
5.1把更強的網絡安全和生命科學能力交給經過審核的專業用戶。
Fable 5.1由此成為Anthropic當前麵向生產環境的主力模型之一,而科研和高風險專業場景,則被單獨放進了Mythos
5.1的受控訪問體係。
03 緩存價格降了75%
Fable 5.1這次調整的不隻是模型能力和安全機製,還有使用成本。
Anthropic保留了Fable 5此前的標準API價格,輸入每百萬Token 10美元,輸出每百萬Token
50美元,沒有直接降低基礎價格。但緩存讀取價格從每百萬Token 1美元降到了0.25美元,降幅達到75%。
Anthropic按照2026年8月的實際使用情況測算,典型工作負載的整體成本可以降低約25%。對於高度Agent化、緩存讀取占比較高的任務,成本降幅更高。
不過,第三方測評機構Artificial
Analysis的測試顯示,緩存價格下降並不意味著每項任務的實際成本都會下降。其數據顯示,在最高推理強度下,Fable
5.1完成一次Intelligence Index任務的平均成本為3.76美元,比Fable 5高20%。主要原因是Fable
5.1使用的輸出Token約為Fable 5的1.7倍。
緩存價格下調仍然帶來了明顯的成本節省。Artificial
Analysis測算,緩存讀取降價平均為每項任務節省約1.40美元,這一變化主要體現在智能體測試中,因為這類任務會反複讀取此前已經處理過的上下文。
如果將推理強度從最高檔調整到xhigh,Fable 5.1的Intelligence
Index得分為65,單項任務成本降至2.72美元,比最高強度低1.04美元。不過,這一成本仍高於Opus
5在最高推理強度下2.34美元的水平。
因此,Fable
5.1的成本變化並不是簡單的“價格下降”。Anthropic降低了緩存讀取這一項費用,但模型在複雜任務中消耗的輸出Token更多,最終每項任務的成本還取決於具體的調用方式和推理強度。
此外,Fable 5.1還支持批量處理。對於異步任務,輸入和輸出價格可以降至每百萬token
5美元和25美元。美國境內專用推理的價格係數為1.1倍,網頁搜索價格為每1000次10美元,網頁抓取不單獨收費。
Anthropic也給出了不同模型之間的價格對比。Opus
5的輸入和輸出價格分別為5美元和25美元,緩存讀取為0.50美元;Sonnet 5則分別為2美元、10美元和0.20美元。
Fable 5.1的普通輸入和輸出價格仍高於這兩款模型,但緩存讀取價格已經低於Opus 5,僅比Sonnet
5高0.05美元。