跳到主内容
@wquguru
精选75BlockTempo 动区(RSS)研究与分析

Claude Code官方教学:最大化Session价值,减少Token浪费

Claude Code 官方教學:如何最大化 Sessions 價值,減少 Token 浪費

原文
发到 X

Anthropic 發布官方文章〈Maximizing the value of your Claude Code sessions〉,拆解 Claude Code 的計價機制,點名六個立刻能照做的習慣,並列出最該盯的四個花錢破口。

(前情提要:Claude Code 推出 Monitor 工具:背景監聽取代輪詢,大幅節省 Token 消耗)

(背景補充:Anthropic宣布解鎖Opus 4.6百萬Token不加價!上下文測試碾壓GPT-5.4)

過去寫程式的工具是固定費用甚至免費,編輯器不會因為你今天下午多修了四十九個測試就多收錢,單一任務本身沒有自己的價格。代理式(agentic)程式設計工具把這件事改掉了:同一個任務,用法不同,價格就不同。

Anthropic 在 8 月 14 日發布的官方文章中,用一個很小的例子說明這件事。同樣是修一個壞掉的測試,Session A 讀了測試檔、讀了被測檔案、改完收工,只送出 5 個 request;Session B 先在整個 repo grep 一輪,沿路開啟十幾個檔案才走到同樣那兩個檔,膨脹成 18 個 request — 而且這期間每一輪都還拖著今天早上以來讀進對話的所有東西。

同樣一個修復,先搜尋的 Session B 送出的 request 是 Session A 的三倍以上。圖片來源:Anthropic 文章強調一個關鍵觀念:所謂省 Token 不是總量用得更少,而是確保你花掉的 Token 都真的用在你要求的那件事上。

一個 Token 到底在賣什麼 帳單按 Token 計價,但你實際上付的是推論(inference),也就是 GPU 跑完模型所耗的時間。官方點出三件事決定一個 Token 佔用多少時間:用哪個模型、它是輸入還是輸出、以及有沒有被快取。

模型越大,處理輸入與輸出的工作量都越大,而且底下講的所有成本都會被模型單價再乘一次。官方的建議是:問題真的困難或曖昧時才用大模型,例行工作用小模型就好。

簡單任務上大小模型的品質曲線很快收斂,困難任務上則不會——大模型能用更少 Token 達到同樣品質。(官方註明曲線僅為示意,非真實 benchmark 資料)圖片來源:Anthropic 輸出為什麼貴 5 倍:Prefill 與 Decode 一次請求在 GPU 上會走兩個階段。Prefill(預填)是模型讀進你的請求與脈絡 — 系統提示、你的 CLAUDE.md、你的訊息,加上這段對話至今被塞進來的一切,這些是輸入 Token。Decode(解碼)則是模型寫出輸出 Token:它的思考、工具呼叫、你看到的文字。

差別在於 decode 是一次一個 Token 產生的:一段 200 Token 的回應,就是模型連續跑 200 次。單就每個 Token 而言,decode 佔用 GPU 的時間遠比 prefill 長,這就是輸出定價大約是輸入 5 倍的原因。

Prefill 對整個請求做一次掃描,Decode 則每跑一次只吐一個 Token 再帶著它重跑。圖片來源:Anthropic Session 裡有相當比例的輸出 Token 其實是思考 Token,每輪思考多少由 effort 等級控制。

官方提醒,模型與 effort 都會記住你上次的選擇並沿用到下一個 Session,所以在乾淨的新 Session 先跑一次 /model 和 /effort,確認自己到底在什麼設定上。如果明知這個 Session 就是做粗活,可以用 MAX_THINKING_TOKENS=0 claude 關掉思考(Fable 5 除外),等於比 /effort low 再低一階。

真正的省錢關鍵:不要打掉 Prompt Cache 如果一次請求的開頭跟伺服器剛看過的請求完全一致,這段共同開頭算出來的狀態也會一樣,伺服器就能留著上次的結果,只針對新增的部分做 prefill,這就是 prompt caching。讀取快取只要輸入價的 0.1 倍,寫入快取最高約 2 倍,但寫入每個 Token 只發生一次,之後每一輪都是 0.1 倍的讀取。

Claude Code 每次請求都會自動管理快取,沒有東西要你開啟,但你有辦法把它弄壞。官方特別說明,快取必須從請求的最開頭往後逐字對上,而請求順序永遠固定:工具定義 → 系統提示 → 對話(CLAUDE.md 放在對話最前面)。只要這個字首有任何改變,後面全部得重新 prefill。

會打掉快取的動作包括:對話中途下 /model(每個模型有自己的快取,含每次進出 plan 模式都換模型的 opusplan)、改 /effort、開啟 fast mode(而且重新 prefill 是按 fast mode 價格算),以及 /compact(對話被換成更短的內容,原本的都對不上了)。

還有一個容易被忽略的變數是時間:快取在訂閱制是一小時過期、API key 是五分鐘(ENABLE_PROMPT_CACHING_1H=1 可拉到一小時)。超過才回來,下一輪就會把整段對話重新 prefill;恢復舊 Session 幾乎一定也是如此。

官方的結論是,這不代表你永遠不能換模型或 effort,而是有便宜的時機(Session 剛開始、或剛下完 /clear)和昂貴的時機(一段長對話的中間)。

另外還有一招:如果最近幾輪跑歪了不想留,用 /rewind 退回那幾輪之前,成本為零;而 /compact 會重寫整段對話,一定要花錢。

問法差一個字元,成本差六輪 接著是 Session 會送出多少 Token。最重要的觀念是:沒有任何東西只被送出一次。

任何進到對話裡的東西:Claude 讀的檔案、它跑的指令輸出,都會在之後的每一輪被重新送出,直到 Session 結束。它是走快取的,所以每次重送都很便宜,但便宜不等於免費,而且它同時佔著上下文的空間,模型每一輪都得繞過它去思考。

Claude 讀多少,主要取決於它得自己摸索多少。官方用...

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近