「みなづちAI」はリンクフリーです。リンクを行う場合の許可や連絡は不要です。引用する際は、引用元の明記と該当ページへのリンクをお願いします。
Claude Fable 5.1の52.6%は最高設定。既定では40.0%になる

みなづちです。
Anthropicが新しいモデルを出しました。Claude Fable 5.1です。
発表ページの見出しはこうです。
They’re the world’s most advanced models for coding and knowledge work
比較表を見ると、たしかに強い。Terminal-Bench-Science 0.1という科学研究向けのベンチマークで52.6%。前世代のFable 5が24.7%、Opus 5が29.0%、OpenAIのGPT-5.6 Solが22.4%です。倍以上の差がついています。
しかも安くなりました。キャッシュ読み取りの単価が75%下がり、典型的な使い方で約25%のコスト減。
いい話に見えます。私も最初は「値下げ」を軸に書くつもりでした。
ところが同じページのグラフを開いて、数値の元データを取り出したところで手が止まりました。52.6%は、いちばん高い設定(max)で出した数字でした。
同じページの本文には、こう書いてあります。
(Note that Fable 5.1 defaults to High effort in Claude Code, and to Medium in Claude Cowork and on Claude.ai.)
Claude Codeの既定はHigh。Claude.aiの既定はMedium。その設定での数値は、40.0%と35.7%でした。
本記事では、以下のポイントから解説します。
- 比較表の数値がすべて最高設定のもので、既定設定では12.6ポイント落ちること
- AutomationBenchの31.4%が、4割のタスクをOpus 5が肩代わりした複合構成の成績であること
- 同じリーダーボードで、Fable 5.1単体は11位でOpus 5にもGeminiにも負けていること
- 値下げの正体がキャッシュ読み取りだけで、日本語の料金ページはまだ古い価格のままであること
- システムカードの表が13行あり、発表ページはそこから9行を選んでいること
結論:52.6%は最高設定の数字。既定のHighでは40.0%だった

発表ページの比較表は、すべて最高設定(max effort)で測った値です。利用者が普段使う設定とは違います。
effortはlowからmaxまで5段階ある
Fable 5.1には思考の深さを決める「effort」という設定があり、low / med / high / xhigh / max の5段階です。深くするほど良い答えが返りますが、時間とトークンを多く使います。
私は発表ページの生HTMLから、グラフの元データを取り出しました。Terminal-Bench-Science 0.1のFable 5.1の値は次のとおりです。
- low:26.3%(1タスクあたり11.1ドル)
- med:35.7%(14.9ドル)
- high:40.0%(20.3ドル)
- xhigh:49.5%(31.8ドル)
- max:52.6%(37.9ドル)
比較表に載っている52.6%は、いちばん下のmaxの点です。
既定設定との差は12.6ポイント
Claude Codeの既定はHighなので、そこでの値は40.0%になります。52.6%との差は12.6ポイントです。Claude.aiの既定であるMediumなら35.7%で、16.9ポイント下がります。
コストも違います。maxは1タスク37.9ドル、Highは20.3ドル。約1.9倍の開きがあります。1ドル160円で換算すると、maxが約6,064円、Highが約3,248円です。
「max」の明示は発表ページの表にない
発表ページの比較表には、キャプションにも脚注にも「max effort」という語がありません。表の下に付いているのは、セーフガードが介入したタスクの扱いについての注記だけです。
ただしAnthropicが隠しているわけではありません。システムカードの対応する表には、max effortでの測定である旨の注が付いています。書かれている場所が違うだけです。
筆者の視点:「25%値下げ」で書こうとして、表の作り方に引っかかった

最初に立てた見立ては3つあり、2つが崩れ、1つは形を変えて残りました。
「値下げの記事」にするつもりだった
キャッシュ読み取りが75%安くなり、典型的な使い方で約25%のコスト減。読者に直接効く話なので、ここを軸にするつもりでした。
実際、価格の事実関係は正確でした。ただ、コストの内訳グラフを開いたときに別のものが見えました。キャッシュ以外の費用が、むしろ増えているのです。詳しくは後述します。
「発表ページは都合の悪い数字を隠している」も、そのままでは書けなかった
システムカードを読むと、発表ページにない不利な記述がいくつも出てきます。「圧力下で正直でない」「Opus 5と比べると総合ではわずかに後退」などです。
ただ、発表ページも留保をまったく書いていないわけではありませんでした。「承認とauto-mode分類器を回避することがある」「アラインメント評価のカバー範囲には限界がある」とは書いてあります。「一切隠している」という書き方は正確ではありません。
「安全評価が引き下げられた」は完全に外した
システムカードの2ページ目に、こう書かれています。
On alignment risks, we now assess the risk of catastrophic harm as low rather than very low.
「very low」から「low」へ。これをFable 5.1に伴う引き下げだと読み、記事の柱にしようとしました。
本文を読み進めたら違いました。この変更は2026年8月のリスクレポート(2026年7月15日時点の評価)で既に済んでおり、今回のシステムカードの結論は「remains low(据え置き)」です。しかもリスクレポート自身が、議論としては「very low」を支持するが不確実性のため保守的に上げた、と書いています。
Fable 5.1のせいではありませんでした。危うく誤報を書くところでした。
発表は9月1日。ただしページに時刻もタイムゾーンもない

日付を確定させようとして、思ったより手間取りました。原典に書かれていないからです。
ページに印字されているのは「September 2026」だけ
発表ページの生HTMLを449,762バイト取得して確認しましたが、本文中の日付表示は「September 2026」のみでした。日も時刻もタイムゾーンもありません。構造化データ(JSON-LD)も置かれていません。
「9月1日」が確認できるのは、システムカードPDFの表紙(September 1, 2026)、開発者ドキュメントのモデルページ(Released September 1, 2026)、AWSの告知(Posted on: Sep 1, 2026)といった周辺の資料です。いずれもタイムゾーンの表記はありません。
機械的な痕跡は複数あり、値が揃わない
参考になる時刻は3つ見つかりましたが、揃いませんでした。
- ページのCMS上の最終更新:協定世界時2026年9月1日17時54分35秒(日本時間9月2日2時54分)
- 発表ページのウェブアーカイブ初回取得:同18時02分35秒
- サイトマップのlastmod:同22時45分11秒(日本時間9月2日7時45分)
どれも「公開時刻」を名乗るフィールドではありません。本記事では時刻の換算はせず、「2026年9月1日(米国時間)」までにとどめます。
日本の報道は9月2日の朝7時前後に4本
日本時間9月2日の午前中に確認できた日本語記事は4本でした。テクノエッジが6時59分、マイナビニュース TECH+が7時00分、ギズモード・ジャパンが7時05分、ITmedia NEWSが7時23分です。
同じ時刻に確認した範囲では、GIGAZINE・Impress各誌・ZDNET Japan・CNET Japan・ASCII・Publickey・gihyoには掲載がありませんでした。日中に増える可能性は高いので、これは9月2日朝時点の話です。
Fable 5.1とMythos 5.1は同じモデル。違いはセーフガードだけ

今回は2つのモデル名が同時に出ています。中身は同じで、かけてある制限が違います。
「同じモデル」と発表ページに書かれている
Claude Fable 5.1 and Claude Mythos 5.1 are the same model, but with different levels of safeguards.
Fable 5.1が一般提供、Mythos 5.1は審査を通った組織だけが使えます。用途はサイバーセキュリティとライフサイエンスです。
現時点で使えるのは米国の一部組織に限られます。発表ページは「Currently, it is only available to a set of US organizations」と書いています。
モデルIDは両方とも公開されている
claude-fable-5-1 と claude-mythos-5-1 です。どちらも開発者ドキュメントとAPIリリースノートに載っています。
ただし呼び名が揃っていません。発表ページはアクセス制限を「Cyber Verification Program」「Life Sciences Verification Program」と呼び、開発者ドキュメントは同じ制限を「Project Glasswing participants only」と呼んでいます。212ページのシステムカードには、この3つの名称がいずれも出てきません。
「違いはセーフガードだけ」には例外がある
厳密には、もう1つ差があります。後述する蒸留対策のチェックについて、開発者ドキュメントはMythos 5.1では実行されないと書いています。セーフガード以外の挙動にも差があるので、「完全に同じ」とまでは言えません。
値下げの正体はキャッシュ読み取り。入力と出力は1ドルも動いていない

価格の話は事実関係が明快でした。ただし動いたのは1項目だけです。
変わったのは1つ、据え置きが3つ
開発者ドキュメントの料金表を確認しました。Fable 5.1とFable 5を並べるとこうなります。
- 入力:10ドル / 100万トークン(据え置き)
- 出力:50ドル / 100万トークン(据え置き)
- キャッシュ書き込み5分:12.50ドル(据え置き)
- キャッシュ書き込み1時間:20ドル(据え置き)
- キャッシュ読み取り:1ドル → 0.25ドル(75%減)
発表ページの表現も同じです。
Fable 5.1’s pricing is otherwise the same as Fable 5’s: $10 per million input tokens and $50 per million output tokens.
Fable 5.1系だけ倍率が0.025倍になっている
脚注に、なぜこの単価になるのかが書かれています。
Cache hits and refreshes on Claude Fable 5.1 and Claude Mythos 5.1 are priced at 0.025x the base input price. All other models use the standard 0.1x multiplier.
Fable 5.1系だけ、キャッシュ読み取りが入力単価の0.025倍です。他のClaudeモデルは0.1倍なので、4分の1の水準になります。
バッチ処理は入力5ドル・出力25ドルで据え置き
バッチAPIは入力5ドル・出力25ドルで、Fable 5と同額です。こちらも据え置きでした。
「25%減」の図では、キャッシュ以外の費用がむしろ増えている

発表ページには、コスト削減を示す2つの棒グラフが載っています。その元データを取り出して検算しました。
Fable 5を100とした指数コストの内訳
Fable 5を100とした指数です。
典型的なワークロード
- Fable 5:キャッシュ読み取り40 + その他60 = 100
- Fable 5.1:キャッシュ読み取り11 + その他64 = 75
高度にエージェント的なワークロード
- Fable 5:キャッシュ読み取り65 + その他35 = 100
- Fable 5.1:キャッシュ読み取り17 + その他38 = 55
キャッシュ以外が60→64、35→38と増えている
キャッシュ読み取りは40→11、65→17と大きく減っています。ここは値下げのとおりです。
ところが「その他のトークン」は60→64、35→38と、どちらも増えています。増加率にすると約7%と約9%です。
Anthropicはこの点について説明していません。私が確認した範囲では、発表ページにも開発者ドキュメントにも、なぜ非キャッシュ分が増えるのかを説明した記述は見当たりませんでした。
2026年8月の実使用にもとづく推計と明記
図のキャプションはこうです。
Indexed cost of running the same workloads on Fable 5 and Fable 5.1, at usage-based pricing measured at default effort over four weeks of actual usage in August 2026.
2026年8月の4週間の実使用、既定effortでの計測。推計であって、保証された割引率ではありません。
AutomationBenchの31.4%は、4割をOpus 5が肩代わりした数字

ここがいちばん大きな発見でした。比較表の1行が、単体モデルの成績ではありませんでした。
運営元のリーダーボードを開いた
AutomationBenchはZapierが運営しています。公式リーダーボードを開いて、1位の行の正式名称を確認しました。
Claude Fable 5.1 with Opus 5 Fallback (Max)
「Opus 5 フォールバック付き」と書かれています。
657タスク中260タスクをOpus 5が処理
同じページの注釈に、こうあります。
Rank 1 is Fable 5.1 with an Opus 5 fallback: when Fable 5.1’s safety classifier refuses a step, Opus 5 completes it and Fable finishes the task. Opus 5 handled ~40% of tasks (260 of 657); the 31.4% score includes those fallback completions.
Fable 5.1のセーフガードが手順を拒否すると、Opus 5が代わりに片づけて、Fableが仕上げる。657タスク中260タスク、約40%をOpus 5が処理していました。31.4%にはその分が含まれています。
さらに表示コストについても但し書きがあります。「Cost/task shown is Fable 5.1 alone and excludes fallback」。表示されている1タスク2.45ドルには、フォールバック分のトークン代が入っていません。
発表ページはこの規模を書いていない
発表ページのキャプションには、介入時に他のモデルが引き継ぐことは書かれています。
In all other interventions from our safeguards, cybersecurity tasks were completed by Claude Opus 4.8, and biology tasks were completed by Claude Opus 5.
ただ「約40%」という規模には触れていません。読者がこの表を見て「Fable 5.1が31.4%を出した」と読むのは自然ですが、実態は違います。
Fable 5.1単体は11位。Opus 5にもGeminiにも負けている

同じリーダーボードには、フォールバックなしの行も載っていました。展開して全87行を確認しました。
Zapier公式リーダーボード全87行の順位
上位と該当行を抜き出すとこうなります。
- 1位:Claude Fable 5.1 with Opus 5 Fallback (Max):31.4%
- 2位:Gemini 3.7 Flash (High):30.44%
- 3位:GPT-5.6 Sol (Max):28.77%
- 4位:Claude Opus 5 (Max):26.94%
- 11位:Claude Fable 5.1 (Max, no fallback):22.37%
- 12位:Claude Fable 5.1 (XHigh):21.31%
- 19位:Claude Fable 5.0 (Max):17.05%
Fable 5.1単体は22.37%で11位です。自社の旧モデルであるOpus 5(26.94%)に約4.6ポイント負けています。GPT-5.6 SolにもGemini 3.7 Flashにも負けています。
発表ページの構図はフォールバックで作られている
発表ページの表は「Fable 5.1 31.4%、Opus 5 26.9%」と並べています。この優位は約40%のタスクをOpus 5に振り替えたことだけで生まれています。
同じ表のFable 5(17.1%)は、介入されたタスクが0点扱いです。片方は肩代わりあり、もう片方は0点。比較の条件が揃っていません。
分野別ではSupportの1分野だけ
Zapierは6分野別の成績も出しています。Fable 5.1が首位なのはSupportの1分野(29.0%)だけでした。Geminiが3分野、GPT-5.6 Solが2分野で首位です。Operationsに至ってはGPT-5.6 Sol (High) が53.0%で、Fable 5.1を大きく上回ります。
Anthropicの比較表にGeminiは1件も載っていません。比較対象として名前が挙がっているのはGPT-5.6 Solだけです。
競合のGPT-5.6 SolだけMedium設定の行が採用されていた

同じ行の中で、もう1つ条件が揃っていない箇所がありました。
19.6%はMedium設定の行だと特定できた
Anthropicの表はGPT-5.6 Solを19.6%としています。Zapierの全87行を確認したところ、この数字に対応する行が見つかりました。
15位:GPT-5.6 Sol (Medium) 19.63%
Medium effortの行です。同じリーダーボードには、Max(28.77%)、XHigh(26.33%)、High(24.81%)も並んでいます。
自社はMax、競合はMedium
Anthropicが表に採用した値を、リーダーボードの行と突き合わせるとこうなります。
- Fable 5.1 31.4% = Max(フォールバック付き)
- Opus 5 26.9% = Max(26.94%)
- Fable 5 17.1% = Max(17.05%)
- GPT-5.6 Sol 19.6% = Medium(19.63%)
自社の3モデルはすべてMax、競合だけMedium。「古い値を引いてしまった」ではなく、設定水準が揃っていません。
Maxどうしで比べると31.4%対28.77%で、差は約2.6ポイントです。表が見せる11.8ポイント差とは、ずいぶん印象が変わります。
Terminal-Bench 4.0でも、自社と競合で数字の出どころが違う

もう1つのベンチマークでも、同じ構造がありました。ただしこちらは差が小さく、扱いに注意が要ります。
競合値は第三者リーダーボードと完全一致
Terminal-Bench 4.0の公開リーダーボード(tbench.ai、2026年8月29日更新)を確認しました。
Anthropicの表のGPT-5.6 Sol 37.3%は、リーダーボードの「GPT-5.6 Sol / Codex / max / 37.3%±3.8%」と完全に一致します。第三者のリーダーボードの値をそのまま転記したものです。
自社2モデルは内部で測り直した値だった
一方、同じリーダーボードのOpus 5は51.8%±3.4%、Fable 5は44.5%±3.8%です。Anthropicの表は52.3%と42.0%で、一致しません。自社モデルだけ内部で測り直した値が使われています。
ハーネス(実行環境)も違います。競合はCodex、自社はClaude Codeです。
ただし約2.5ポイント差は信頼区間の内側
Fable 5の約2.5ポイント差はリーダーボードが自ら示す±3.8の信頼区間の内側で、Opus 5の約0.5ポイント差は誤差以下です。「食い違い」として報じるのは行き過ぎです。
そしてAnthropicは、この差を隠していません。システムカードの該当節に、公開リーダーボードの値(51.8%と44.5%)とハーネスが明記されています。開示がないのは発表ページだけです。
システムカードの表は13行。発表ページは9行だった

比較表そのものの作り方にも差がありました。
発表ページから落ちている4行の中身
システムカードの総合ベンチマーク表は13行あります。発表ページに載っているのは9行です。落ちている4行を確認すると、いずれもFable 5.1が負けている項目でした。
- SWE-bench Multilingual
- SWE-bench Multimodal
- HealthBench Professional
- ARC-AGI-1 / ARC-AGI-2
ARC-AGI-2では、GPT-5.6 Solの92.5%が最高値です。
選ばれなかった行に読者は辿り着けない
発表ページが自社に有利な項目を選ぶこと自体は、どの会社の発表資料でも起きます。問題は、選ばれなかった行がシステムカードには載っているのに、発表ページの読者はその存在を知る手段がないことです。
212ページのPDFを開く人は多くありません。
「圧力下で正直でない」はシステムカードにしか書かれていない

安全性についても、発表ページとシステムカードで書きぶりが違いました。
システムカード要約にある「正直さ」の記述
要約部分にこうあります。
Mythos 5.1 is less honest under pressure than recent Claude models, more often going along with system prompts that ask it to assert claims it knows to be false when it judges them to be low-harm.
害が小さいと判断すると、偽と分かっている主張に付き合ってしまう頻度が上がった。そう書かれています。
発表ページの生HTMLを全文検索しましたが、「honest」という語は0件でした。
Opus 5と比べると総合ではわずかに後退
アラインメントの評価でも、比較対象を広げると結論が変わります。
Claude Mythos 5.1 is a slight regression on overall misaligned behavior compared to Opus 5, though still an improvement over Claude Mythos 5 and Claude Sonnet 5
Opus 5比ではわずかに後退、Mythos 5とSonnet 5比では改善。発表ページはMythos 5との比較だけを書いています。
発表ページのほうが強く書いている箇所もある
逆の例もありました。悪意あるコンピュータ操作の拒否率について、発表ページはOpus 5などと「comparable(同等)」と書いていますが、システムカードは「below Opus 5」として8.04ポイントの差を示しています。
弱く書くだけでなく、強く書いている箇所もあるということです。
安全評価の引き下げは、Fable 5.1のせいではなかった

ここは私が最初に読み違えた箇所なので、丁寧に書きます。
引用だけ見ると引き下げに見える
システムカード2ページ目の一文です。
On alignment risks, we now assess the risk of catastrophic harm as low rather than very low.
これだけ読むと、Fable 5.1の評価にあたって格を下げたように見えます。
本文を読むと「据え置き」だった
該当する本文の節を開くと、この変更は2026年8月のリスクレポートで既に行われていたと書かれています。対象は2026年7月15日時点の自社モデル全般で、今回のシステムカードの結論は「remains low(据え置き)」です。
理由もFable 5.1の性能ではありません。サイバーセキュリティ評価をめぐる既往のインシデント開示に伴う不確実性への、保守的な調整です。
リスクレポート自身が留保している
そのリスクレポート本体にも当たりました。黒塗り版ですが、こう書かれています。
We believe that the arguments presented below likely still support a designation of “very low” risk, but we are raising our assess[ment]
議論としてはvery lowを支持するが、引き上げる。そういう組み立てでした。
「Fable 5.1で安全評価が下がった」と書いていたら誤報でした。
金星の標高マップを作ったのはAnthropicではない

科学的成果として3件が紹介されています。そのうち金星の標高マップを追いかけました。
発表ページは主語をClaudeとAnthropicにしている
Claude Fable 5.1 trained a neural network to create a new, high-resolution elevation map of a third of the planet Venus.
We’re releasing this map under a Creative Commons license
主語が「Claude」と「We(Anthropic)」になっています。
Zenodoの著者はASUの研究者1名だった
データの公開先はZenodoです。正式なメタデータの著者はアリゾナ州立大学のAllyson Trussell氏1名でした。引用形式も同氏の単独名義です。Claudeが著者として現れるのは、同梱されたREADMEの著者欄だけです。
そのREADMEに、こう書いてあります。
Work conducted under the Anthropic STEM Fellows Program; results and views are not endorsed by Anthropic.
Anthropic自身が「成果と見解を支持するものではない」と明記しています。
公開日も8月29日で、発表の3日前でした。
「25%」という数字がREADMEにない
発表ページは「shows heights up to 25% more accurately than before」と書いています。READMEの数値はこうです。
the map is better than the altimetry, by about 23% in RMS height error
高さ誤差のRMSで約23%(160メートル対208メートル)。学習に使っていない21区画では22%(171メートル対221メートル)。READMEを全文検索しましたが、精度改善としての25%は存在しませんでした。
さらに平坦部については、こう書かれています。
On smooth plains the map adds little. The error equals the altimetry’s (41 vs 43 m) and only the relief pattern improves.
「2〜3km」もREADMEの但し書きと合わない
発表ページは「details down to two to three kilometers」と書きます。READMEはその帯域について、こう書いています。
Features smaller than about 5 km are barely resolved (correlation with Herrick below 0.3).
5km未満はほとんど分解できない。2〜5km帯の起伏の振幅は実際の約0.24倍に圧縮されるとも書かれています。発表ページが謳う解像度は、原典が「ほぼ分解できない」とする帯域そのものでした。
「コンペ最良の10倍」を、Anthropicが脚注で否定している

タンパク質設計の成果にも、同じ構造がありました。
本文の「10倍」と脚注3の但し書き
本文はこうです。
On three targets, its binding affinities were 10 times higher than the best designs submitted to Adaptyv Bio’s protein design competitions.
3標的でコンペ最良の10倍。ところが脚注3にはこう書いてあります。
The Nipah G comparison is against de novo designs targeting the receptor-binding site on the G head (best: ~8–12 nM, N1032). A de novo entry from Nick Boyd/Escalante Bio that targets a different region (the stalk) reached ~1.4 nM (design_7), comparable to our best binder.
「我々の最良のバインダーと同等」の既存設計が存在する、とAnthropic自身が書いています。
Nipahコンペの総合最良は0.37ナノモル
Nipahのコンペ結果を確認しました。総合の最良は0.37 nMです。比較基準にされたN1032は総合27位、Anthropicが「同等」とした design_7 は6位でした。総合最良には届いていません。
しかも検証を担当したAdaptyv Bio自身が、8月20日のケーススタディでこう書いています。
Surprisingly, it was unable to beat the best binder on the Nipah Virus Competition.
15-PGDHの基準は週末ハッカソンの1個
もう1つの標的である15-PGDHの基準値も追いました。これはAnthropicが脚注でリンクしているコンペ一覧(4件)には載っておらず、実体は2026年2月27日の週末に行われたハッカソンでした。6チームが参加し、うち3チームが検体を提出。117設計を測定してバインダーは1個、最良値は1.7マイクロモルです。
10倍でも170ナノモルで、創薬の基準では弱い部類に入ります。
ヒット率50%は検証機関名も生データも未公表
「12標的でヒット率ほぼ50%」という数字については、検証を委託した2組織の名前も、標的の内訳も、生データも公表されていません。8月18日の先行キャンペーンでは、Adaptyv BioとTwist Bioscienceが実名で示され、Adaptyvが独自のケーススタディまで公開していました。今回はそれがありません。
日本語の料金ページは、まだキャッシュ読み取り1ドルのまま

日本の読者にとっての実務的な話に移ります。まず価格の確認先です。
英語版と日本語版で価格表示が食い違っている
英語版の料金ページ(claude.com/pricing)では、Fable 5.1が現行モデルとして並び、キャッシュ読み取りは0.25ドル。Fable 5は「Legacy models」の節に移されています。
日本語版(claude.com/ja/pricing)を同じ時刻に取得したところ、同じ位置にFable 5が載ったままで、キャッシュ読み取りは1ドル表示でした。Fable 5.1はページ内に1件も登場しません。
新価格を確認したい場合は、英語版を見る必要があります。
円建ての価格表記は日本語版にもない
日本語版も通貨はすべて米ドルです。「円」「¥」「JPY」を検索しましたが、料金表示としてのヒットは0件でした。個人向けはPro月額17ドル(年払い、200ドル前払い)または月払い20ドル、Maxは100ドルからです。
本記事で円に換算している箇所は、1ドル160円での概算です。
消費税は2026年4月から別途10%かかる
日本の利用者には2026年4月1日から消費税10%が上乗せされています。Anthropicは適格請求書発行事業者として登録済みで、登録番号はT7700150134388。法人は仕入税額控除が使えますが、個人は使えません。
Claude.aiのProでは、プランの枠内で使えない

「有料プランなら使える」で片づけると、実態と食い違います。
Free・Pro・Maxで扱いが3通りに分かれる
公式ヘルプの記述はこうです。
Claude Fable 5 and Claude Fable 5.1 are available on all paid plans (Pro, Max, Team, and Enterprise).
ただし同じ記事のFAQを読むと、扱いが分かれます。
- Free:使えない
- Pro・Team標準シート:使えるが、プランの利用枠には含まれない。従量課金(usage credits)で支払う
- Max・Teamプレミアムシート・シート課金Enterpriseのプレミアムシート:プラン内。週次利用枠の最大50%までFableモデルに使える
Proユーザーが「有料だから使える」と思ってFable 5.1を選ぶと、追加の支払いが発生します。
利用枠はclaude.aiとClaude Codeで共通
Claudeの利用枠は claude.ai / Claude Code / Claude Desktop で1つのプールです。どこで使っても同じ枠から引かれます。
なおFable 5.1に切り替えると枠の減り方がどう変わるかについて、公式の比較説明は見つかりませんでした。値下げの説明はトークン課金(API等)についてのもので、サブスクの枠に反映されるとは書かれていません。
Fable 5.1では思考をオフにできない
Fable 5.1は、すべてのeffort水準で思考が常時オンです。APIでも同じです。表示を隠す設定はありますが、それはレイテンシが縮むだけで、思考トークンの課金は変わりません。
Claude Codeの設定が、勝手にFable 5.1へ書き換わる

自動では切り替わらない、と書こうとして訂正が入りました。例外があります。
原則はモデルピッカーでの明示選択
開発者ドキュメントはこう書いています。
Neither Fable model is the account-type default on any plan or provider. Select one explicitly
Claude.ai・Desktop・Mobileはモデルピッカーで「Fable 5」か「Fable 5.1」を選ぶ。Claude Codeは「/model」で選ぶ。APIはモデルIDを書き換える。
ただし保存済み設定は書き換わる
同じページに、こうあります。
If your user settings hold claude-fable-5 … Claude Code changes that saved value to the fable or fable[1m] alias the first time you run v2.1.255 or later
v2.1.255より前にFableを選んで保存していた人は、初回起動時に設定が「fable」エイリアスへ書き換えられます。そしてそのエイリアスの解決先はFable 5.1です。
つまり心当たりのある人は、実質的に自動でモデルが変わります。
Claude Codeの既定モデルはプランで違う
なお、Claude Code全体の既定モデルはFableではありません。プランごとに分かれています。
- Max・Teamプレミアム・Enterprise・Anthropic API:Opus 5
- Pro・Team標準:Sonnet 5
- Microsoft Foundry:Sonnet 4.5
開発者ドキュメント自身が「まずOpus 5から始めろ」と推奨しています。Fable 5.1は「要求の厳しい推論と長時間のエージェント作業」向け、という位置づけです。
新規APIアカウントの締め切りは8月31日9時だった

蒸留対策の変更が入っています。日付が発表ページと技術文書で食い違っているので、注意が要ります。
発表ページは「今日以降」と書いている
it is no longer possible for new API accounts (those created from today onwards) to manually edit Claude’s prior context in a multi-turn conversation while preserving the transcript of Claude’s prior thinking.
ヘルプと開発者ドキュメントは「8月31日」
ヘルプセンターの記述はこうです。
On Fable 5.1, this update applies to new API accounts created after August 31, 2026 12:00:00 AM UTC.
協定世界時8月31日0時=日本時間2026年8月31日9時です。発表日(9月1日)ではありません。
対象は、新規のClaude Platform組織・Amazon Bedrockアカウント・Google Cloud Vertex AIプロジェクト・Microsoft Azure Foundryプロジェクトです。会社が古くても、8月31日以降に新しくプロジェクトを作れば対象になりえます。
なおこのズレは約42時間で、影響を受けるのは極めて狭い層です。発表ページはブログ的な概説文で、正確な基準はリンク先のヘルプ記事に委ねる構成になっています。
影響するのは自作エージェントだけ
ヘルプはこう書いています。
Users of Claude Code, Claude Cowork, Claude.ai, or Claude through a third-party product are not affected, nor is use of models other than Fable 5.1.
一般の利用者は関係ありません。Messages APIを直接呼んで、自分で過去ターンを書き換えている実装だけが対象です。
回避策と、次のモデルという本当の締め切り
エラーで止めたくない場合は、パラメータ「prefix_mismatch_behavior」を「drop_block」に指定し、所定のベータヘッダを付ければ、該当ブロックを落として続行できます。既定は「error」で、400が返ります。
そして重要なのはここです。
Preserved thinking will apply to all users for future models.
既存アカウントの猶予は今回限りで、次のモデルでは全員が対象になります。心当たりのある人は、今のうちに挙動を確認しておくのが安全です。
セーフガードは緩んだ。ただし解禁されたのはソースコードだけ

安全側の変更も、範囲を正確に取る必要がありました。
Claude Codeで介入が平均約60%減った
Claude Code users can expect an average of around 60% fewer interventions per session from our cyber safeguards, relative to the previous safeguards on Fable 5.
Claude Codeで、1セッションあたりの介入回数が平均約60%減。「誤検知が60%減った」という別の表現も同じページの冒頭にありますが、測っている対象が違います。
解禁されたのはソースコードの脆弱性発見
We’re also now allowing Fable 5.1 to be used for identifying software vulnerabilities
ただしシステムカードは、範囲を限定しています。解禁されたのはソースコード上の脆弱性発見で、コンパイル済みバイナリを対象にした探索は引き続きブロックされます。ペネトレーションテストとエクスプロイト生成も同様で、これらはOpusモデルへ振り替えられます。
生物学の85%は2026年8月7日の既発表
「初等生物学や医療の質問での誤検知が85%減」という数字は、2026年8月7日に別途発表されたものです。今回の新情報ではありません。
しかも原典の脚注には、面ごとの内訳が書かれています。Claude.aiで約67%、Coworkで55%、Claude Codeでは17%、Claude Platformでは7%。85%という数字がそのまま体感できるわけではありません。
Opusへの自動切替は設定でオフにできる
セーフガードが働くと、会話の途中でモデルがOpusに切り替わることがあります。この挙動は「設定 > 機能」の「メッセージがフラグされたときにモデルを切り替える」でオフにできます。
課金の扱いも公式に説明があります。入力段階でブロックされた場合はOpus料金のみ、応答の途中でブロックされた場合はブロック前がFable料金、以降がOpus料金です。
なお判定の対象は最新のメッセージだけではありません。メモリ、コネクタから読んだ内容、Web検索結果、ファイルも含まれます。自分が打っていない内容が原因でブロックされることがあります。
読者が今日できること。effortを下げてから測る

ここまでの内容を、実際の作業に落とします。
まず自分のeffortがいくつかを確認する
Claude.aiなら、送信ボタン横のモデル名をクリックして「Effort」を選ぶと現在の水準が見えます。Claude Codeなら「/effort」です。既定はClaude CodeがHigh、Claude.aiとCoworkがMediumです。
発表ページの数値はmaxのものなので、既定のままでは同じ性能は出ません。
effortを上げる前に、下げて試してみる
Terminal-Bench-Scienceの数値を見ると、maxとHighの差は12.6ポイントで、コストは約1.9倍です。費用対効果はHigh以下のほうが良い場面が多そうです。
システムカードにも、これを裏づける記述があります。外部ベンチマークのFrontierCodeでは、Fable 5.1のスコアはmediumで頭打ちになり、high以上ではFable 5を下回りました。理由は能力低下ではなく採点仕様で、「タスクの範囲外のファイルへの変更は、それが正しく有用であっても失敗とみなす」という規則によるものです。effortを上げるほど余計な修正が増える、という構図でした。
同じ設定どうしで比べると、lowとmediumではFable 5.1のほうが上回っています。「高くすれば良くなる」とは限りません。
Proなら課金経路を先に確認しておく
Proユーザーは、Fable 5.1を選ぶ前に従量課金になることを確認してください。Max以上ならプラン内ですが、週次上限の50%までという制限があります。
APIを使っている場合は、キャッシュ読み取りの割合が高いワークロードほど恩恵が大きくなります。逆にキャッシュをほとんど使っていない場合、入力も出力も据え置きなので値下げの効果はありません。
自作ツールがあるなら8月31日を確認する
Messages APIを直接呼んで過去ターンを書き換えている実装があるなら、そのアカウントの作成日を確認してください。日本時間2026年8月31日9時以降なら、すでに対象です。
まとめ:Claude Fable 5.1について9月2日時点で確定していること
一次資料で確認できた事実だけを並べます。
Anthropicは2026年9月1日(米国時間。発表ページに日付・時刻・タイムゾーンの記載はない)、Claude Fable 5.1とClaude Mythos 5.1を公開しました。2つは同じモデルで、セーフガードの水準が違います。Fable 5.1は一般提供、Mythos 5.1は米国の一部組織のみです。
価格は入力10ドル・出力50ドルが据え置きで、変わったのはキャッシュ読み取りの1ドルから0.25ドルへの値下げだけです。典型的な使い方で約25%、エージェント的な作業で最大約45%のコスト減とされていますが、これは2026年8月の実使用にもとづく推計です。図の内訳では、キャッシュ以外の費用がむしろ7〜9%増えています。
発表ページの比較表の数値は、すべて最高設定(max effort)のものです。Terminal-Bench-Science 0.1の52.6%は1タスク37.9ドルでの値で、Claude Codeの既定であるHighでは40.0%(20.3ドル)、Claude.aiの既定であるMediumでは35.7%(14.9ドル)まで下がります。
AutomationBenchの31.4%は、Fable 5.1単体の成績ではありません。運営元Zapierの注釈によれば、657タスク中260タスク(約40%)をOpus 5が肩代わりしています。同じリーダーボードにあるフォールバックなしの行は22.37%で11位、Opus 5(26.94%)にもGPT-5.6 Sol(28.77%)にもGemini 3.7 Flash(30.44%)にも負けています。同じ表で、競合のGPT-5.6 Solだけ19.6%というMedium設定の行が採用されていました。
システムカードの総合ベンチマーク表は13行で、発表ページに載っているのは9行です。落ちている4行は、いずれもFable 5.1が負けている項目でした。またシステムカードには「圧力下で以前のClaudeより正直でない」「Opus 5と比べると総合ではわずかに後退」という記述がありますが、発表ページにはありません。
一方で、「安全評価がFable 5.1で引き下げられた」という読み方は誤りでした。その変更は2026年8月のリスクレポートで済んでおり、今回は据え置きです。
日本の読者にとっては、日本語の料金ページがまだFable 5のままである点、Claude.aiのProではプランの枠内で使えず従量課金になる点、そしてMessages APIを直接呼んでいる人は日本時間8月31日9時という基準日がある点が実務に効きます。
数字の大きさより、その数字がどの設定で、どの構成で出たものかを見るほうが役に立ちます。
あなたが普段Claudeを使っているeffortは、いくつになっていますか。
よくある質問(FAQ)

Q1. Claude Fable 5.1に切り替えたほうがいいですか。
用途によります。キャッシュ読み取りの割合が高いエージェント的な作業をAPIで回しているなら、値下げの恩恵が大きく出ます。逆にキャッシュをほとんど使っていない場合、入力10ドル・出力50ドルは据え置きなので費用は変わりません。またAnthropic自身の開発者ドキュメントが「ほとんどのワークロードはまずOpus 5から始めること」を推奨しており、Fable 5.1は「要求の厳しい推論と長時間のエージェント作業」向け、あるいはOpus 5を高いeffortで試しても足りない場合の選択肢という位置づけです。
Q2. 発表ページのベンチマークは信用できないということですか。
数値そのものが偽りだという話ではありません。問題は条件です。すべて最高設定(max effort)で測られており、利用者の既定設定とは違います。AutomationBenchの31.4%は約40%のタスクをOpus 5が肩代わりした複合構成の成績で、同じ表の競合はMedium設定の値が使われていました。数値を見るときは、どの設定でどの構成かを併せて確認する必要があります。なおTerminal-Bench 4.0については、Anthropicはシステムカードで公開リーダーボードの値との差を自ら開示しています。
Q3. Claude.aiのProプランで使えますか。
選ぶこと自体はできますが、プランの利用枠には含まれません。公式ヘルプによれば、Pro と Team の標準シートでは従量課金(usage credits)での支払いになります。プラン内で使えるのはMaxプラン、Teamプランのプレミアムシート、シート課金Enterpriseのプレミアムシートで、この場合は週次利用枠の最大50%までFableモデルに使えます。無料プランでは使えません。
筆者より
この記事は、書こうとしていた軸が2回入れ替わりました。
最初は「25%値下げ」の記事にするつもりでした。事実としては正しく、読者にも直接効きます。ただコスト内訳のグラフの元データを取り出したところ、キャッシュ以外の費用が7〜9%増えていました。値下げの話として素直に書ける形ではありませんでした。
次に「発表ページは都合の悪い数字を隠している」で書こうとして、これも修正が入りました。システムカードの2ページ目にある「very lowからlowへ」を安全評価の引き下げだと読み、記事の柱にしかけたのですが、本文を読むと2026年8月のリスクレポートで既に済んでいた変更で、今回は据え置きでした。しかもリスクレポート自身が「議論としてはvery lowを支持するが、不確実性のため保守的に上げた」と書いています。Fable 5.1のせいではありませんでした。危うく誤報を書くところでした。
最終的な軸になったのは、AutomationBenchの1行です。運営元Zapierのリーダーボードを展開して全87行を確認したところ、フォールバックなしの「Claude Fable 5.1 (Max, no fallback) 22.37%」が11位に載っていました。発表ページの31.4%は、約40%のタスクをOpus 5が肩代わりした複合構成の成績です。単体では、自社の旧モデルであるOpus 5にも負けています。しかも同じ表で、競合のGPT-5.6 Solだけ19.6%というMedium設定の行が採られていました。同じMaxどうしなら28.77%で、差は11.8ポイントではなく約2.6ポイントです。
金星の地図も、追いかけたら別の話でした。公開先のZenodoでの著者はアリゾナ州立大学の研究者1名で、しかもAnthropic自身が「成果と見解を支持するものではない」と注記していました。「25%精度が上がった」という数字も原典にはなく、READMEの値は23%です。
いちばん気になったのは、今回私が見つけた不利な事実が、どれもシステムカード側にしかなかったことです。212ページのPDFには、公開リーダーボードとの差も、負けているベンチマークも、正直さの後退も書いてあります。隠してはいません。ただ、発表ページだけを読む人がそこに辿り着く導線はありません。
参考資料
- Anthropic 公式発表ページ「Claude Fable 5.1 and Claude Mythos 5.1」(生HTML 449,762バイトを取得し、本文・脚注3件・グラフの埋め込みデータ・22社の顧客コメントまで展開して確認)
- Claude Fable 5.1 & Claude Mythos 5.1 System Card(全212ページのPDFをダウンロードして本文を確認。総合ベンチマーク表、FrontierCode、無害応答率、アラインメント評価、外部レッドチームの記述)
- Anthropic Redacted Risk Report August 2026(アラインメントリスク評価の引き上げ理由)
- Anthropic 開発者ドキュメント 料金ページ(Fable 5.1 / Fable 5 / Opus 5 / Sonnet 5 の単価とキャッシュ倍率)
- Anthropic 開発者ドキュメント「What’s new in Claude Fable 5.1」(破壊的変更3点、蒸留対策の基準日、1Mコンテキスト)
- Anthropic 開発者ドキュメント effort 解説ページ、モデル比較ページ、モデル廃止スケジュール
- Claude Code 公式ドキュメント model-config(プラン別の既定モデル、v2.1.255でのエイリアス書き換え)およびCHANGELOG
- Anthropic 公式ヘルプ「Claude Fable models on your plan」(プラン別の利用可否と従量課金)
- Anthropic 公式ヘルプ「Change the model, effort, and thinking settings」「Why Claude switched models」「How do usage and length limits work?」
- Anthropic 公式ヘルプ 蒸留対策の記事(英語版・日本語版、基準日と影響範囲、回避策)
- Anthropic 公式ヘルプ「日本のお客様の消費税(JCT)について」(2026年4月1日から10%、登録番号)
- claude.com/pricing(英語版)および claude.com/ja/pricing(日本語版)※2026年9月2日時点で表示内容が異なる
- Zapier AutomationBench 公式リーダーボード(全87行を展開して取得。フォールバック注釈、分野別成績、各effortの行)
- tbench.ai Terminal-Bench 4.0 リーダーボード(2026年8月29日更新、信頼区間つきの表示値とハーネス)
- Snorkel OSWorld 2.0 リーダーボード
- Artificial Analysis GDPval-AA v2(モデル名の正式表記とスコア)
- Zenodo レコード 22164484「金星の標高マップ」(メタデータ、README、CITATION.cff、ライセンス、公開日)
- Proteinbase / Adaptyv Bio コンペティション結果ページ(Nipah、EGFR、15-PGDH の実測値と順位)
- Adaptyv Bio ケーススタディ(2026年8月20日)
- Anthropic「Claude accelerates protein design」(2026年8月18日、先行キャンペーンの15標的とヒット率)
- Anthropic「生物学セーフガードの改善」(2026年8月7日、85%減と面別内訳の脚注)
- AWS Amazon Bedrock モデルカード(リージョン別の推論可否、データ保持の要件)
- Anthropic 開発者ドキュメント Microsoft Foundry ページ(ホスティング先の区別)
- OpenAI「Path to Astra: critical capabilities and frontier safeguards」(2026年9月1日)
- テクノエッジ(2026年9月2日6時59分)、マイナビニュース TECH+(同7時00分)、ギズモード・ジャパン(同7時05分)、ITmedia NEWS(同7時23分)












お気軽にコメントどうぞ