Fable 5 自我改进系统实战:14步打造复利AI代理
Fable 5 自我改進系統實戰:14 步打造會「複利」的 AI 代理
多數人把 Fable 5 當成 Sonnet 在用,提示一下、跑五分鐘就關掉。本文用 14 步、3 層架構,拆解 Anthropic 工程師如何以迴圈、動態工作流、Routines 與記憶,打造一個會逐次複利、越跑越聰明的自我改進代理系統。原文作者:@0xCodez (前情提要:Google 推出 Nano Banana 2 Lite!4 秒產圖、每千張僅 0.034 美元,搶攻企業自動化 AI 影像市場)
(背景補充:美國 5 月職缺數飆至 760 萬創兩年新高!就業市場超火熱無視美伊衝突)
多數人使用 Claude Fable 5 的方式,就像在用一個 context window 更大的 Sonnet 4.6。他們丟一個提示,它跑了五分鐘,然後就把分頁關掉。十個使用者裡有九個,從來沒跑過一個「會複利」的代理系統:每一次執行都讓下一次更聰明、每一份狀態檔都在累積、每一個 Skill 都更鋒利。
Fable 5 是為了「連續跑好幾天」而打造的,你卻只用它跑幾分鐘。下文教你用 14 步路線圖,蓋出 Fable 5 真正被設計來運行的那種自我改進系統。
這份 14 步路線圖,教你蓋出 Fable 5 被設計來運行的那種自我改進系統——內容取材自 Anthropic 的工程文章、團隊公開的實驗,並對照截至 2026 年 6 月的上線文件進行查核。
三個層級:Fable 5 究竟解鎖了什麼、讓它得以複利的三個原語(迴圈、動態工作流、Routines),以及把它變成一個「系統」的自我改進層。
PART 1 · Fable 5 究竟解鎖了什麼 01. Fable 5 是 Mythos 等級模型,「連跑數日的自主能力」才是重點 Fable 5 真正能做到、而先前 Claude 模型無法持續維持的事,取自 Anthropic 的上線文件: 連跑數日的自主工作階段。
在 Claude Code 或 Claude Managed Agents(CMA)這類代理 harness 中運行,Fable 5 能工作好幾天——跨階段規劃、委派給子代理,並檢查自己的成果。
內建自我驗證。
自己寫測試來檢查自己的工作。用視覺把輸出對照目標檢查。把教訓蒸餾成通則。測試自己的假設。
最具野心的程式工作。
大型遷移、複雜實作、跨多日的自主編碼。Anthropic 主打的旗艦用例是「把大型專案交辦出去,然後審查完成的交付物」。
多階段的知識工作。
從深度研究與分析,到可供審查的交付物——只需最少的監督。
定價也對應這個等級:每百萬 input token 收 10 美元、每百萬 output token 收 50 美元,並保留既有的 prompt caching 90% input token 折扣。
可在 Claude API、AWS、Amazon Bedrock、Vertex AI、Microsoft Foundry,以及採用量計費的 Enterprise 方案上使用。這不是訂閱制模型。用得兇,帳單就自己長出來。
02. 自我改進不等於自我學習 「自我改進代理系統」這個詞被隨便亂用。真實的版本和炒作的版本是兩回事,在你動手蓋任何東西之前,值得先搞清楚這個落差。
自我學習(Self-learning) ——代理根據所學更新自己的權重。Fable 5 不做這件事。沒有任何公開可用的模型在生產環境做這件事。遞迴自我改進(RSI)是 Anthropic 自己在 2026 年 5 月示警的長期方向,而不是今天出貨的能力。
自我改進(Self-improving) ——代理周圍的系統在複利。每一次工作階段都把教訓寫進記憶。Skills 隨著邊角案例被加入而更鋒利。狀態檔累積已驗證的事實。Eval 迴圈精修提示與評分標準。模型本身不變,它運行所在的環境變得更銳利。
從這個意義上說,自我改進是「你所打造的系統」的一種屬性。Fable 5 具備那種原始能力——長 context、子代理委派、視覺自我檢查、連跑數日的續航力——能把「環境回饋迴圈」變成真正會一輪一輪複利的東西。
Anthropic 的工程團隊講得很直接: 「與其直接提示並引導 Fable 5,通常更好的做法是設計迴圈,讓模型針對環境回饋自我修正(例如 /goal 或 Outcomes),並自己管理自己的 context(例如透過記憶)。」
03. 複利堆疊:四層架構,一個回饋迴圈 本文最上方的 Figure 1 用一張圖展示了整個架構。由下往上讀——那是系統被建構的順序,也是槓桿複利的順序。
Layer 1 · 原語(Primitives)。
Fable 5 本身、子代理、worktrees,以及代理會動用的工具。純粹的原始能力,周圍還沒有任何系統。這是多數人今天在用的層級。
Layer 2 · 編排(Orchestration)。
用 /goal 與 Outcomes 做自我修正迴圈。用動態工作流做複雜的多步驟編排。用 Routines 做「闔上筆電」的雲端執行。這一層把原語變成工作流。
Layer 3 · 記憶(Memory)。
狀態檔、Skills、Knowledge Bases、寫下來的教訓。記憶讓明天的工作階段是「續跑」而不是「重啟」。
Layer 4 · 自我改進(Self-improvement)。
視覺自我檢查、eval 迴圈、規則蒸餾。代理替自己的輸出評分、精修產出它的那個 Skill、把教訓寫回記憶。迴圈閉合。
這個架構之所以複利:Layer 1 的每個輸出都向上流經 Layer 4,在那裡被評分、蒸餾,再寫回 Layer 3。明天在 Layer 1 的執行,會繼承昨天被磨利的記憶與精修過的 Skills。模型是無狀態的,它周圍的系統不是。
04. 何時用 Fable 5 vs Opus 4.8 vs Sonnet 4.6:成本—能力矩陣 Fable 5 每 token 的成本約是 Opus 4.8 的 5 倍。自我改進系統裡並非每一步都需要最頂級的等級。在生產環...
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力