Codex for Biz
2026/09/04Codex
ツール比較料金・コスト比較AI活用

GPT-6 AstraとClaude Fable 5.1|どちらを使うべきか

GPT-6 AstraとClaude Fable 5.1|どちらを使うべきか

「GPT-6 Astraが出たらしいけれど、結局Fable 5.1とどちらが強いのか」「比較記事を読んでも、書き手によって結論がバラバラで判断できない」——新しいフラグシップモデルが出るたびに、この迷いに戻ってきます。

結論から言うと、この2つは価格で優劣がつく比較ではありません。API標準単価は入力$10・出力$50で完全に同額だからです。しかも、どちらが賢いかを判定しようとしても、OpenAI公式のベンチマークではAstraがほぼ全項目で上回るのに、独立系の集計では総合知能スコアはFable 5.1が上回るという、結論が逆転する現象が起きています。

株式会社Fyveは中小企業向けにAI業務効率化を手がけており、両モデルの公式ドキュメント・料金表・第三者の測定結果を突き合わせて整理しました。ただし先に断っておくと、Astraは私たち自身ではまだ実際の出力を確認できていません。この記事は「使ってみた感想」ではなく、公開されている一次情報と第三者の測定を、出所を区別しながら整理した記事です。

同じ週に出そろった2つのモデル、単価は完全に同額

2026年9月3日(米国時間)、OpenAIはGPT-6 Astraを発表しました。前世代GPT-5.6 Solの後継にあたり、モデルIDはgpt-6-astra、コンテキストウィンドウは1,050,000トークン、最大出力は128,000トークンです。知識カットオフは2026年4月30日。思考の深さを指定するeffortには従来のlow・medium・high・xhighに加えて、新たにmaxが追加されました。

一方のClaude Fable 5.1は、その2日前の2026年9月1日(米国時間)にAnthropicが発表しています。コンテキストは同じく1Mトークン、最大出力も128Kトークンとほぼ同じ器です。effortはAdaptive(常時オン)で、APIとClaude Codeの既定値はhigh。知識カットオフは2026年6月です。

器の大きさが近いこの2モデルを並べたとき、仕様面での差はそれほど大きくありません。

項目

GPT-6 Astra

Claude Fable 5.1

発表日(米国時間)

2026年9月3日

2026年9月1日

モデルID

gpt-6-astra

claude-fable-5-1

コンテキスト

1,050,000トークン

1,000,000トークン

最大出力

128,000トークン

128,000トークン

知識カットオフ

2026年4月30日

2026年6月

effort(思考の深さ)

low / medium / high / xhigh / max

Adaptive(常時オン・既定high)

最初に目を引くのは、この仕様の近さよりもむしろ価格です。

Astraが対応しているツールも公式発表に記載があります。web検索・ファイル検索・画像生成・コードインタープリター・シェル実行・パッチ適用・skills・パソコン操作(computer use)・MCP・ツール検索の10種類で、Codexには文脈をまたいでメモを保持する新機能も実験的に追加されています(数週間かけて既定機能になる予定)。どのツールを組み合わせて使えるかは、単純なベンチマークの点数以上に、実際の業務での使い勝手を左右します。

価格は入力$10・出力$50で、両者まったく同じ

2026年9月4日時点の公式料金表を突き合わせると、100万トークンあたりの標準単価はこうなります。

区分

GPT-6 Astra

Claude Fable 5.1

入力(Standard)

$10.00

$10.00

出力(Standard)

$50.00

$50.00

キャッシュ読み取り

$1.00

$0.25

キャッシュ書き込み

$12.50

$12.50(5分)/$20(1時間)

Batch API

$5.00 / $25.00

$5.00 / $25.00

入力・出力の標準単価は、両モデルとも1トークン単位で完全に一致します。「値段が高いほうが賢い」という単純な比較が、この2モデルの間では成立しません。値段で差がつかない以上、どちらを選ぶかは純粋に性能と用途の話になります。

差がついているのはキャッシュ読み取りです。Astraは入力単価の10%にあたる$1.00、Fable 5.1は0.025倍の$0.25。同じ資料やシステムプロンプトを繰り返し読ませるエージェント運用では、この4倍の差が積み上がっていきます。

もう一つ、見出しの単価だけでは見えない条件があります。Astraは272,000トークンを超えるプロンプトに対して入力2倍・出力1.5倍の倍率がかかり、地域を指定した処理には10%の上乗せもあります。Fast モードを使うと入力$20・出力$100と標準の2倍になります。Fable 5.1は1Mトークンのコンテキスト全域が標準価格で、長文を理由にした追加料金はありません。見出しの単価が同じでも、長いプロンプトを多用する使い方では総額が同じにならない、という点は覚えておく必要があります。

なお、どちらのモデルも月額プラン契約者には、この単価差が直接の請求には影響しません。ChatGPTの有料プランはAstraを既存のサブスクリプション枠内で使え、超過分だけ別途クレジット購入になります。Claude ProやMaxでFable 5.1に切り替えても、公式発表によれば月額プランの請求額自体は変わりません。単価の比較が意味を持つのは、どちらもAPIを従量課金で使っているケースです。

272Kトークン超の倍率がどれくらい効くか、単純な例で見ておきます。仮に30万トークンの資料を1回読ませて1万トークンの出力を得た場合、Astraは超過分に入力2倍・出力1.5倍がかかるぶん、同じ分量をFable 5.1に投げるより実質的な単価が上がります。逆に1回あたりのやり取りが272Kトークンを超えない使い方であれば、この差は発生しません。「同額」という見出しだけを見て契約すると、自分の使い方でどちらが得かを見誤ります。

GPT-6 AstraとClaude Fable 5.1|どちらを使うべきかの解説図

Astraの仕様全体——提供状況・プラン別の違い・思考レベル「max」の詳細は、こちらの完全ガイドにまとめています。

GPT-6 Astraとは|何ができるモデルなのか【完全ガイド】
CodexGPT-6 Astraとは|何ができるモデルなのか【完全ガイド】
読者特典・無料ダウンロードCodexに「課金」する前に読む本無料でダウンロード

公式ベンチマークでは、Astraがほぼ全項目で上回る

前提として、これから示すOpenAI公式のベンチマーク値は、原則としてすべて思考の深さを最大(max effort)に設定した状態での測定です。スコアは上がりますが、応答までの時間とトークン消費もあわせて膨らみます。実務で常時ここまでeffortを上げて運用する場面は限られる、という前提で数字を見てください。

OpenAIが公表した項目のうち、Fable 5.1の数値が直接比較できる形で示されているのは次の8項目です。

分野/ベンチマーク

Astra

Fable 5.1

[業務・コーディング]AutomationBench

41.4%

31.4%

[業務・コーディング]BenchCAD

95.9%

84.3%

[業務・コーディング]Terminal-Bench 4.0

約58%

55.8%

[学術]FrontierMath Tier 4 (v2)

97.6%

87.8%

[学術]Humanity's Last Exam(ツールあり)

57.2%

65.0%

[サイバーセキュリティ]ExploitBench

100.0%

70.0%

[サイバーセキュリティ]ExploitGym

42.4%

30.4%

[サイバーセキュリティ]SRE-Bench(1回で解けた率)

88.0%

12.5%

※ Terminal-Bench 4.0は報道によって57.7%・57.9%と数値が割れているため「約58%」としています。

それぞれ何を測っているベンチマークかを業務の言葉に置き換えると、AutomationBenchとTerminal-Bench 4.0は「決められた業務手順を、人の手を介さずに最後まで一人で完走できるか」、BenchCADは「設計図面のような専門フォーマットを正確に読み書きできるか」、ExploitBench・ExploitGym・SRE-Benchは「システムの弱点を見つけて対応する、防御側のセキュリティ実務がどこまでできるか」を測る内容です。いずれも「知っているかどうか」ではなく「最後までやり切れるかどうか」を見ている点が共通しています。

8項目のうち7項目でAstraが上回っています。特に差が大きいのはサイバーセキュリティ領域で、ExploitBenchは100.0%対70.0%、SRE-Bench(1回で解けた率)は88.0%対12.5%と開きが大きくなっています。

ただし、唯一Fable 5.1が上回っている項目があります。Humanity's Last Exam(ツールあり)で、Astraが57.2%、Fable 5.1が65.0%。日本語では「人類最後の試験」と訳されることが多いこの学術ベンチマークは、Astraが負けている数少ない項目のひとつで、OpenAIの発表本文でも触れられていません。

数字をそのまま受け取る前に、いくつか留保しておきたい点があります。FrontierMathはAstraがFable 5.1に約10ポイントの差をつけている項目ですが、運営元のEpoch AIは「OpenAIが開発資金を出し、一部の問題に独占アクセスを持つ」と明示しています。BenchCADについては、OpenAI自身が「Claude側は評価設定を変更して実行した」と注記しており、両モデルの条件が完全にそろっているとは言い切れません。サイバーセキュリティの3項目も測定条件に注意が必要で、ExploitBenchは両モデルとも安全機構を外した状態、ExploitGymは通常の6時間制限を撤廃した状態での数値です。実運用そのままの条件ではない点は割り引いて読む必要があります。

また、公式が直接比較を出していない領域もあります。コンピュータ操作(OSWorld 2.0でAstraは72.6%、前世代Sol比で約47%の時間短縮)や長文処理(MRCR v2の512K〜1Mトークン帯でAstraは96.3%)は、前世代Solとの比較としては公開されていますが、Fable 5.1との直接比較データはOpenAIから示されていません。Astraが力を入れている領域として押さえる価値はありますが、「この2項目でFable 5.1に勝った」とまでは公式データからは言えないということです。同様にコーディング系のFrontierCode(本体53.3%・1.1拡張64.5%)もFable 5.1のデータがなく、むしろ前世代のFable 5(53.5%・64.9%)にわずかに及んでいません。ARC-AGI-3も99.9%という高い数値が出ていますが、The New Stackは別条件で98.6%と報じており、条件によって値が割れています。

独立系の集計では、総合知能はFable 5.1が上回る

ここまではOpenAIが自社発表として出した数字です。ここで視点を変えます。Artificial Analysisは、OpenAIやAnthropicなど各社が発表するモデルを、独立した第三者の立場で同じ条件のもとに横並びで測定・評価している調査機関です。モデルを開発している会社自身が出す数字ではないという点が、公式ベンチマークとの決定的な違いです。この集計では、結論が逆転します。

指標

Astra

Fable 5.1

Opus 5

Fable 5

Sol

Intelligence Index v4.1.1

61.2

65.7

63.1

62.1

60.9

Coding Agent Index

67.0%

67.2%

68.1%

Intelligence Index v4.1.1では、Astraは61.2。Fable 5.1(65.7)だけでなく、前世代のFable 5(62.1)にもOpus 5(63.1)にも及びません。Artificial Analysisが集計した202モデル中、Astraの順位は8位です。公式ベンチのほぼ総なめとは対照的な結果です。

コーディングに絞ったCoding Agent Indexでは、Astra 67.0%・Fable 5.1 67.2%とほぼ横並びで、実質同点と見てよい差です。おもしろいのは、この指標でもっとも高いのはAstraでもFable 5.1でもなく、前世代のFable 5(68.1%)だということです。「新しいモデルのほうが常に強い」という前提自体、独立系の集計では成り立っていません。

公式発表と独立集計で、なぜここまで結論が変わるのか。理由のひとつは測定条件です。OpenAIの公式値は前述のとおり最大effortでの測定が中心ですが、独立系の集計は各社のモデルを横並びの条件でそろえて測定します。もうひとつは、公表するベンチマークの選び方です。各社の公式発表は、自社が優位に出やすい項目を選んで公表する構造から自由ではありません。どちらが「正しい」と決める話ではなく、測定の立場が違う数字を同じ表に混ぜて語らないことが大事です。

GPT-6 AstraとClaude Fable 5.1|どちらを使うべきかの解説図

結論は1つに決まらない——得意分野で選ぶ

「全部Astraに乗り換えるべきか」「Fable 5.1のほうが総合力で上なのか」——ここまでの材料を見る限り、どちらの問いにも一言では答えられません。単価が同じで、公式値と独立集計で優劣が割れている以上、選び方は「どちらが強いか」ではなく「自分の用途にどちらの得意分野が刺さるか」になります。

判断の順番を整理すると、こうなります。まず、パソコン操作の自動化・長文資料の一括処理・防御的なセキュリティ業務のように、Astraが公式値で明確に強い領域が自分の業務に当てはまるかを確認する。当てはまらない、あるいは総合的な受け答えの質や学術的な正確さを重視するなら、独立集計で上に出ているFable 5.1を軸に考える。どちらの条件にも強く当てはまらない場合は、単価が同額である以上、すでに使い慣れている側・エコシステムが整っている側を選んでも損はしません。

Astraが向いている場面

  • パソコン操作の自動化を任せたい業務:OSWorld 2.0で72.6%、前世代Sol比で約47%の時間短縮を公式が主張しています
  • 長い文書・大量の資料を一度に読ませたい業務:MRCR v2の512K〜1Mトークン帯で96.3%という数値が出ています
  • 社内システムの脆弱性調査や防御目的のセキュリティ業務:ExploitBench 100.0%、SRE-Bench 88.0%と直接比較でも差が大きい領域です。ただしAstraはサイバーセキュリティ領域で初めてPreparedness Frameworkの「Critical」相当と判定されたモデルで、高度なサイバー機能は現時点でDaybreakプログラム参加組織に限定されています。一般利用者がすぐに同じ能力へアクセスできるわけではありません
  • 業務・コーディング系の定型作業が多い現場:AutomationBench・BenchCAD・Terminal-Bench 4.0など、直接比較できる項目の多くでAstraが上回っています

Fable 5.1が向いている場面

  • 独立系の集計で総合的な地力を重視したい業務:Intelligence Index 65.7は、今回比較した5モデルの中で最も高い数値です
  • Humanity's Last Examに近い、正解のはっきりしない学術的・専門的な問い:公式ベンチのうちAstraが唯一負けている項目です
  • すでにAnthropicのエコシステムで運用が固まっている、あるいは今すぐ安定版を使いたい場合:Fable 5.1は発表と同時に一般提供(GA)されています。Astraは発表から数日かけて順次ロールアウト中で、Enterpriseプランは既定でオフのため管理者による有効化作業が必要です

注意したいのは、公式発表・独立集計のどちらの数字も「特定の条件下での平均的な傾向」でしかないということです。OpenAI自身、Astraは前世代Solと比べて「監視可能性(monitorability)が低下した」と開示しており、監視の仕組みが正当な作業まで止めてしまう可能性があるとも書いています。安全機構の挙動は、数字ではなく実際に業務で使い込んでみないと体感できない部分です。

実務——私たちが確かめたこと、確かめていないこと

今回、私たちはFable 5.1については実際に手元で動作確認をしています。2026年9月2日朝、Claude Code v2.1.258の環境でclaude -p --model claude-fable-5-1 "Reply with exactly: OK"を実行したところ、11.5秒で「OK」が返ってきました。JSON形式で出力を取得すると、modelUsageオブジェクトのcanonicalModelclaude-fable-5-1になっていることも確認済みです。リリース翌朝の時点で、個人のサブスクリプション環境(Maxプラン)から追加設定なしで使えていたことになります。

一方でAstraについては、私たちはまだ実際の出力を確認できていません。試したのは、手元のCodex CLI(バージョン0.137.0・ChatGPTアカウント認証)から-m gpt-6-astraを指定する呼び出しだけで、結果は「The 'gpt-6-astra' model is not supported when using Codex with a ChatGPT account.」という400エラーでした。同じ環境で-m gpt-5.5を指定すると正常に応答が返ることも確認しており、環境側の不具合ではなくAstra固有の制限だとわかっています。これは性能の実測ではなく、アクセス経路の制限を確認したにとどまるという点は、正直に書いておきます。

つまりAstraを実際に使うには、ChatGPTアカウント認証のCodex CLIではなく、APIキー経由のアクセスか、対応した新しいCLIへの更新が必要になりそうです。公式はChatGPT Plus・Pro・Business・Enterprise、OpenAI API、AWS(Amazon Bedrock)への順次提供を発表していますが、「発表されている」ことと「自分の環境で今すぐ動く」ことは別の話だというのは、今回の検証からも言えることです。

どちらのモデルを選ぶにせよ、比較表だけで全業務を一括して切り替えるのはおすすめしません。まずはいちばん重い作業、あるいはいちばん時間がかかっている作業を1つだけ選び、同じ入力を両モデルに投げて出力を並べて見比べる。単価が同額である以上、この検証にかかるコストの差もほとんどありません。公式ベンチと独立集計のどちらを信じるかを議論するより、自分の業務での結果を1つ確かめるほうが、判断としては速く確実です。

Fable 5.1の全体像——性能・セーフガードの変化・提供チャネルは、こちらにまとめています。

Claude Fable 5.1とは|何が変わったのか【完全ガイド】

まとめ——比較表だけで決めないためのチェックリスト

  • API標準単価は入力$10・出力$50で両モデル完全に同額(2026年9月4日時点)。「値段が高いほうが賢い」という比較軸は成立しない
  • 差がつくのはキャッシュ読み取り(Astra $1.00・Fable 5.1 $0.25)と、Astra固有の272Kトークン超・地域指定の上乗せ条件
  • 月額プラン(ChatGPT Plus/Pro、Claude Pro/Max)の請求額には、この単価差は直接影響しない
  • OpenAI公式ベンチでは、直接比較できる8項目中7項目でAstraが上回る。ただしHumanity's Last Exam(ツールあり)はFable 5.1が上回り、FrontierCodeではAstraも前世代のFable 5に僅差で及んでいない
  • 公式値は原則すべて最大effort(max)での測定である点を割り引いて読む
  • 独立系のArtificial Analysisでは、総合知能指数はFable 5.1が65.7でAstra(61.2)を上回る。Astraは202モデル中8位
  • コーディングに絞った独立指数はAstra 67.0%・Fable 5.1 67.2%でほぼ横並び。最上位は前世代のFable 5(68.1%)
  • Astraが強いのはコンピュータ操作・長文処理・サイバーセキュリティ。ただしサイバー機能の一部はDaybreakプログラム限定で、一般利用にはまだ制約がある
  • 私たちが実測できたのはFable 5.1の動作確認のみ。Astraはアクセス経路の制限を確認したにとどまり、出力の実測はしていない
  • 「全部Astraに乗り換える」でも「Fable 5.1一択」でもなく、業務内容で使い分けるのが両方の数字が示す結論
この記事を読んでいるあなたへ無料プレゼント

Codexに「課金」する前に読む本

無料枠の限界・プランの選び方・元の取り方を実測で(全26ページ)

課金の答えは、料金表の読み比べからは出ません。無料枠でできること・できないこと、金額でなく「倍率」で覚えるプランの構造、Claude Codeとの二刀流で枠を使い切る配分まで——両方に課金して1人会社を回している実運用から公開します。

  • 無料枠でできる3つ・できない5つの線引き
  • 金額でなく「倍率」で覚えるプラン早見表
  • 週1回30秒で回る使用量の管理ルール(コピペ可)
  • Claude Codeとの二刀流——枠を使い切る係の割り当て

メールアドレス登録で他にも様々な資料を閲覧できます

Fable 5.1、賢さは「どこ」に出たか。Workにしかできない仕事は、2つだけその太字、本物ですかClaudeのこの5つの設定、今すぐ見直した方がいい3モデル実測|単価2倍が、いちばん安いOpus 5 × GPT-5.6 Sol 徹底比較Webデザイン視覚カタログClaude Codeを「素のまま」使うなHermes Agentに「任せる」前に読む本3

PDF 12点・合計305ページ + すぐ使えるzip素材 3点

どれも登録後の受け取りページから、まとめてダウンロードできます。

毎週金曜の無料ニュースレター「まるごとAI経営」の購読特典です。メール登録後すぐ、受け取りページのご案内が届きます。そこにはこの資料に加えて、過去の特典もすべてまとめて置いてあります。あわせて、AI活用に関するお知らせやお役に立てそうなご案内をお送りすることがあります。解除はいつでも1クリック。

← 記事一覧に戻る

御社の業務に合わせたCodex導入支援

「AIツールを導入したが、現場で使われない」を終わらせる。
業務課題のヒアリングから設計、ハンズオン実践、運用定着まで一貫して支援します。

初回無料相談を申し込む相談プランと料金を見る →
© 2025 Fyve Inc. All rights reserved.