最新模型省錢配對表:Astra、Sol、Fable 5.1、Opus 5 每個檔位多少錢、哪個最划算
如果你是在 IG 留言「省錢」被傳送過來的,對,就是這篇。往下讀五分鐘,看完你會知道自己該用哪一款、開哪一檔。
先講一個比喻:模型是車,effort 是油門
現在兩家(OpenAI 的 ChatGPT、Anthropic 的 Claude)都是這樣賣的:
- 模型等級=車的等級。小車便宜、旗艦貴。
- effort(努力度)=油門。同一台車,你可以叫它想久一點、想仔細一點,代價是吐出更多字、花更多錢。兩家旗艦都有五檔:low、medium、high、xhigh、max。
所以帳單不是「選哪家」決定的,是**「哪台車 × 油門踩多深 × 這件事到底多難」**三個配對決定的。配對錯,就是拿牛刀殺雞。
一、牌價:每百萬 token 多少錢
token 可以想成「字數」,一百萬 token 大約是七十萬個英文字,中文會再多一點。輸入是你丟給它的,輸出是它吐給你的。
| 模型 | 等級 | 輸入 | 重複讀取 | 輸出 |
|---|---|---|---|---|
| GPT-6 Astra(ChatGPT 新旗艦) | 旗艦 | $10 | $1 | $50 |
| Claude Fable 5.1 | 旗艦 | $10 | $0.25 | $50 |
| Claude Opus 5 | 高階 | $5 | $0.50 | $25 |
| GPT-5.6 Sol(ChatGPT 上一代旗艦) | 高階 | $4 | $0.40 | $20 |
| Claude Sonnet 5 | 中階 | $2 | $0.20 | $10 |
| GPT-5.6 Terra | 中階 | $2 | $0.20 | $12 |
| Claude Haiku 4.5 | 小車 | $1 | $0.10 | $5 |
| GPT-5.6 Luna | 小車 | $0.20 | $0.02 | $1.20 |
三個一眼看出來的事:
- Astra 和 Fable 5.1 牌價一模一樣,最便宜的小車跟旗艦差 10 到 50 倍。
- 「重複讀取」是最大的隱藏折扣。同一份資料或指令第二次以後再送,Astra 收 1/10,Fable 5.1 收 1/40。這就是影片說的「用對方法省 10 倍」,只算帳單裡重複讀取那部分。
- 兩家都有批次模式:不急著要答案的工作,排隊跑,全部半價。
二、同一台車,油門差多少錢?
第三方 Artificial Analysis 用同一套綜合智力測驗(九項測驗合併,滿分 100)跑過每個模型的每個檔位,順便算出跑完整套花了多少錢。我把它整理成「分數」和「花費」兩欄,花費看相對倍數就好:
GPT-6 Astra
| 檔位 | 分數 | 跑完整套花費 |
|---|---|---|
| high | 60 | $1,429 |
| xhigh | 61 | $2,004 |
| max | 61 | $3,013 |
從 high 開到 max,分數多 1 分,錢多花 2.1 倍。這就是「油門踩到底不划算」最直白的例子。
Claude Fable 5.1
| 檔位 | 分數 | 跑完整套花費 |
|---|---|---|
| low | 58 | $1,086 |
| medium | 60 | $1,572 |
| high | 62 | $2,386 |
| xhigh | 65 | $5,221 |
| max | 66 | $8,523 |
Fable 5.1 的 max 是全場第一名,但比 xhigh 只多 1 分,錢多花 63%;跟 high 比是 3.6 倍。
Claude Opus 5
| 檔位 | 分數 | 跑完整套花費 |
|---|---|---|
| low | 52 | $555 |
| medium | 59 | $1,116 |
| high | 61 | $1,974 |
| xhigh | 63 | $2,909 |
| max | 63 | $3,836 |
Opus 5 不用開很高,分數就跟 Fable 5.1 差不多:開 high 61 分,跟 Fable 5.1 medium 到 high 一個級距;開 xhigh 63 分,只比 Fable 5.1 high 多 1 分。單價又只有 Fable 的一半,很適合當日常複雜工作的主力。另外它的 xhigh 和 max 同分,max 多花 32%,不用開到底。
GPT-5.6 Sol
| 檔位 | 分數 | 跑完整套花費 |
|---|---|---|
| medium | 56 | $429 |
| high | 57 | $700 |
| max | 61 | $2,017 |
有趣的地方:Sol 開到 max 跟 Astra 開到 max 同分(61),但 Sol 便宜三分之一。 也就是純看「回答難題」,ChatGPT 自己的上一代反而更划算。Astra 贏的地方不在這張表,在下面。
三、真實工作誰強?
上面那張表測的是答題能力。另一個榜 GDPval-AA 測的是真實工作:44 種職業、平均一件要專家做 7 小時的任務,做成文件、試算表、簡報,兩兩比較誰做得好,算成分數(人類專家基準 1,000)。
| 模型 | low | medium | high | xhigh | max |
|---|---|---|---|---|---|
| Claude Fable 5.1 | 1,587 | 1,670 | 1,743 | 1,835 | 1,853 |
| Claude Opus 5 | 1,454 | 1,613 | 1,719 | 1,797 | 1,824 |
| GPT-5.6 Sol | 1,441 | 1,543 | 1,616 | 1,672 | 1,710 |
| GPT-6 Astra | 1,474 | 1,552 | 1,574 | 1,606 | 1,629 |
| Claude Sonnet 5 | 1,219 | 1,299 | 1,397 | 1,493 | 1,584 |
兩個重點:
- 真實工作是 Fable 5.1 贏,而且 xhigh 跟 max 只差 18 分,開 xhigh 就夠。
- Astra 在這張榜比自家上一代 Sol 還低。官方發布時沒公布這一項,這是第三方測的。
四、什麼工作算簡單、中等、複雜?
這是配對的第一步,也是最多人搞混的一步。判斷標準只有一個:做錯的代價,加上要想幾步。
簡單(做錯很好改、一步就好)
- 幫信件、會議記錄、文章寫摘要
- 分類:這封信是客訴還是詢價、這則留言正面還是負面
- 改錯字、翻譯一段話、換一種語氣重寫
- 問答:這個名詞什麼意思、這個功能怎麼開
- 從一段文字裡抓出日期、金額、人名填進表格
中等(要組織、要判斷,但範圍清楚)
- 寫一篇有結構的社群貼文、電子報、產品介紹
- 整理一份筆記成有條理的文件
- 從幾份資料做比較表、寫結論
- 一般程式:寫一個小工具、修一個看得到的 bug
- 資料分析:這份 Excel 告訴我們什麼
複雜(多步驟、牽一髮動全身、做錯代價高)
- 寫程式改到一個系統的多個地方、大規模重構
- 一跑好幾小時的自動化代理任務:自己查資料、自己操作電腦、自己開檔案做完一整件事
- 法律合約找出會影響交易的條款、財務模型多層計算
- 深度研究:跨十幾個來源查證、寫成完整報告
- 上面 GDPval 那種「專家要做 7 小時」的交付物:完整簡報、含公式的試算表、工程圖
一個好用的自我檢查:如果你自己五分鐘能檢查出它有沒有做錯,那是簡單或中等;如果你要花一小時才能驗,那是複雜。
五、推薦配置:怎麼配最省
照上面所有數字,我會這樣配。價格是牌價,「省」是相對同等級開到最貴檔位。
| 你的工作 | 推薦 | 為什麼 |
|---|---|---|
| 簡單、量大 | Sonnet 5 開 low,或 Haiku 4.5;ChatGPT 那邊 Sol 開 medium | Sol medium 56 分只花 $429,全場最省。小事不用旗艦。 |
| 中等、日常主力 | Opus 5 開 medium | 59 分、$1,116,比 Fable 5.1 low(58 分、$1,086)多 1 分、幾乎同價,比 Opus 5 自己開 high 便宜 43%。這是我認為最划算的一格。 |
| 要動腦、要對 | Fable 5.1 開 high,或 Sol 開 max | 62 分 $2,386;Sol max 61 分 $2,017。都比 Astra 開 max(61 分 $3,013)划算。 |
| 真實工作交付物、長任務 | Fable 5.1 開 xhigh | 真實工作榜 1,835,只比 max 少 18 分,錢少很多。要更省用 Opus 5 xhigh(1,797)。 |
| 要它自己操作電腦、找資安漏洞 | Astra 開 high | 這是 Astra 真正領先的地方(看懂螢幕 92.7、找漏洞 100 分)。但開 high 就好,開到 max 多花 2 倍只多 1 分。 |
| 不急的批次工作 | 任何一款,走批次模式 | 兩家都半價。 |
三個心法,比表格更重要:
- 先降油門,再換車。 Anthropic 自己測過:研究、知識類工作把旗艦從預設檔降到 low,只掉 1 到 3 分,錢少三分之一到一半。但大車開低檔不一定比小車便宜:深度研究上 Fable 5.1 開 low 拿 66 分、Sonnet 5 拿 56 分,可是每件事的花費差了大約 4 倍。所以難的事用大車開低檔,簡單的事直接換小車。
- 有辦法檢查對錯的工作,先全部開 low,錯的再開 high 重跑。 Anthropic 的寫程式測試:這樣做通過率不降反而略升,帳單一半。
- 看「每件事花多少」,不看「每次呼叫花多少」。 便宜的模型多跑三次、改兩輪,可能比一次做對的貴。
誠實聲明
- 分數和花費都是第三方 Artificial Analysis 在 2026-09-04 前後跑的,題目是他們的綜合智力測驗與 GDPval-AA v2,不是官方數字。分數差 1、2 分在誤差內。
- 真實工作榜是「兩兩比較由 AI 裁判」的 Elo 分數,不是官方公布的 GDPval。
- 「省 10 倍」只算重複讀取那一部分,整張帳單差距沒那麼大。
- ChatGPT 那邊的牌價是 27 萬 token 以內的價格,超過之後輸入兩倍、輸出 1.5 倍;Sol 的 $4 是促銷價,到 2026 年 11 月 21 日。
- 兩家算 token 的方式不同,Claude 新版模型同一段文字會多算約 30% 的 token,所以「牌價一樣」不等於「帳單一樣」,實際還是要看每件事花多少。
- 定價和檔位會變,用之前請再看一次兩家官方定價頁。
出處
- OpenAI API 定價頁與 GPT-6 Astra、GPT-5.6 Sol 模型頁(牌價、快取價、effort 檔位)
- Anthropic 官方定價頁與 Effort 說明頁(牌價、快取 0.025×、各檔位建議)
- Anthropic 官方「選擇模型」指南與成本最佳化指南(low/medium 掉分與省錢幅度、先全部 low 再重跑的實測)
- Artificial Analysis:各模型各檔位的 Intelligence Index 分數與跑分成本、GDPval-AA v2 排行榜
- OpenAI GDPval 論文(44 種職業、平均 7 小時任務、交付物型態)
- OpenAI 發布會 benchmark 表,新聞轉載(ScreenSpot-Pro 92.7、ExploitBench 100)