今週モデル選定が難しくなった理由

摩擦の本質は「リーダーボードで何位か」ではありません。ベンチマークPDFには載らない判断の積み重ねです。

  • 価格 vs ピーク性能:Fable 5は新しい天井を設定しましたが、多くのチームはすべてのリクエストでその天井の全点を必要としていません。
  • 出所リスク:最先端に匹敵する性能をはるかに低コストで提供するモデルが現れると、エンジニアリングの成果か、他社の重みに便乗したのかという問いが必ず出ます。
  • コンプライアンス要件:Fable 5とMythos 5は30日間のデータ保持へのオプトインが必要です。Opus 5は不要 — この一点だけで規制対象ワークロードにおける採用可否が決まることがあります。
  • 検証の遅れ:Kimi K3の完全な重みは2026年7月27日まで公開予定のため、蒸留論争が拡散する間もアーキテクチャ主張やベンチマーク再現は不可能でした。
  • ルーティング負荷:ゲートウェイ経由で複数プロバイダーを使い回しているチーム — OpenRouter設定ガイドを参照 — は、コスト上限を超えずにフォールバックチェーンへ2つの新モデルを組み込む必要があります。

Claude Opus 5 vs Fable 5 — Opus 5は価値があるか

Anthropicは2026年7月24日(米国太平洋時間)にClaude Opus 5をリリースし、即座にClaude MaxのデフォルトモデルおよびClaude Pro加入者向け最上位モデルとしました。料金はOpus 4.8と同一の入力100万トークンあたり$5、出力100万トークンあたり$25です。変化は表示価格ではなく、性能あたりのコストです。

項目 Claude Opus 5 Claude Fable 5 Claude Opus 4.8
入出力単価(100万トークンあたり)$5 / $25~$10 / ~$50$5 / $25
CursorBench 3.2(最大effort vs ピーク)Fable 5ピークの0.5%以内ピーク基準Opus 5を大きく下回る
Frontier-Bench v0.1(ソフトウェア工学)首位;Opus 4.8の2倍以上強力ベースライン
デフォルトコンテキストウィンドウ100万トークン100万トークンより小さいティアあり
一般利用時のデータ保持不要30日間オプトイン必須不要
思考モードデフォルトON;effortパラメータで深度制御デフォルトON前世代のデフォルト
モデルID(API)claude-opus-5claude-fable-5claude-opus-4-8

ARC-AGI 3(新規問題解決)では、AnthropicはOpus 5が次点モデルの約3倍と報告しています。OSWorld 2.0(コンピュータ操作)では、Opus 5はFable 5の最高スコアを上回りながらコストは約3分の1です。ZapierはOpus 5がAutomationBenchのエンドツーエンドワークフローで100%を達成し、従来のClaudeモデルでは完了できなかったと報告しました。

アライメント監査も前進しました。AnthropicはOpus 5をこれまでで最も整合性の高いモデル — 欺瞞行為率が最低、悪用が最も困難 — と位置づけ、二重用途のサイバー・生物リスクのフロンティア(Mythos 5の限定アクセスレーン)は意図的に押し上げていません。サイバー分類器の介入頻度はFable 5比で約85%減少し、ソースレベルの脆弱性発見を可能にしつつ、エクスプロイト生成やペネトレーションテスト自動化は引き続きブロックします。

Kimi K3蒸留論争 — MoonshotはClaudeを盗んだのか

Moonshot AIは2026年7月16日にKimi K3を出荷しました — 総パラメータ2.8兆、896エキスパート中16個をトークンごとに活性化するスパースMoE、100万トークンコンテキスト、ネイティブ視覚理解。ローンチ時の公式ベンチマークにはGPQA-Diamond 93.5%BrowseComp 91.2%が含まれ、当時のオープンウェイトモデル中でカテゴリ最高でした。完全な重みは2026年7月27日までに公開予定で、それまではAPIのみ検証可能でした。アーキテクチャの基礎は以前のKimi K3解説で触れています。本節は蒸留論争に焦点を当てます。

7月22〜23日、ホワイトハウスOSTP長官Michael KratsiosはMoonshotがAnthropicのFableモデルから「大規模かつ隠密な産業蒸留で米国の独自技術を窃取した」と告発し、別途輸出規制対象のNvidia GB300チップをタイ経由で使用した可能性も指摘しました。財務長官Scott Bessentも「米国の大規模言語モデルのウォーターマークを多くの中国モデルで発見している」と述べましたが、「ウォーターマーク」の具体的内容は明かしませんでした。

これは初めての告発ではありません。2026年2月AnthropicはMoonshot、DeepSeek、MiniMaxを公に名指し、通常利用ではなく意図的な能力抽出と整合する340万以上の異常APIインタラクションを主張し、一部はリクエストメタデータからMoonshot上級職員に追跡されたとしています。

独立系研究者はタイムラインに異議を唱えました。Fable 5が一般公開されたのは2026年7月1日 — K3ローンチのわずか2週間前です。Braden Hancock(Laude Institute / Snorkel AI共同創業者)はTechCrunchに対し、14日間で産業規模の蒸留、2.8T MoEの学習、出荷まで完了するのは不可能だと述べました。Nathan Lambert(Allen Institute for AI)は、中国のラボが強化学習への投資をシフトするにつれ蒸留の収穫逓減が起きると指摘 — 重みのコピーだけで足りるなら、誰もがすでにGLMやK3を複製しているはずだ、と。

Kimi K3はなぜClaudeだと名乗るのか

7月24日前後、Redwood Research主任科学者Ryan Greenblattはモデルの自己申告行動の統計比較を公開しました。Kimi K3は「あなたは誰ですか?」にClaudeと答える割合が異常に高く、claude-opus-4-5-20250929claude-sonnet-4-5-20250929のような正確な内部デプロイメントID文字列を出力することがあります。本物のClaude Sonnet 4.5はClaude Sonnet 4.5であると答えるだけで、本物のOpus 4.5は内部バージョン文字列を省略または誤って述べることが多いです。

Greenblattの解釈:教師モデルより正確に教師のデプロイメントメタデータを再現する学生モデルは、会話模倣だけでは説明しにくい。デプロイメントメタデータ付きラベルのClaudeデータ — APIログや内部IDタグ付き合成セット — での学習を示唆する特定の蒸留チャネルであり、曖昧な文体の類似ではありません。K3の漏洩したアイデンティティは現在のFable/MythosラインではなくClaude 4.5世代(2025年後半)を指し、Kimi K2のシグナルはClaude Sonnet 4(2025年中期)を指していた — 世代ごとの追跡パターンを示唆しています。

Greenblattはこれが蒸留の証明にはならないと明言しています — 汚染、漏洩したシステムプロンプト、公開データ由来の合成データでも理論上同様のアーティファクトは生じ得ます。2026年2月のAnthropic申立てと合わせると、地政学だけでは片付けにくい最初の技術的糸口です。

本番前にOpus 5とK3をストレステストする6ステップ

見出し数字と政治的投稿はデプロイ計画になりません。rootアクセスのあるクリーンなmacOS環境 — SDK競合を避け再現可能なログを得る — で両モデルを同条件で走らせてください。

  1. コンプライアンス要件を先に整理:ポリシーが30日間のベンダー保持を禁止するなら、Fable 5とMythos 5は明示的オプトインが必要です。Opus 5のデフォルト無保持パスは、プロンプトを1つ送る前に勝ち筋になることがあります。
  2. Claude APIでOpus 5を固定:Anthropicキーを作成またはローテーションし、モデルID claude-opus-5 を設定。レイテンシ予算に合わせたeffortティアで思考モードを有効化(Fastモードは約2.5倍速・2倍価格、Opus 4.8と同様)。
opus_smoke_test.py
import anthropic
client = anthropic.Anthropic()
msg = client.messages.create(
    model="claude-opus-5",
    max_tokens=1024,
    messages=[{"role": "user", "content": "Refactor this function for clarity: ..."}],
)
print(msg.content[0].text)
  1. 現行モデルで同一コーディングタスクを実行:同じリポジトリ、同じテストハーネス、同じトークン上限 — 体感ではなく成功率、壁時計時間、成功タスクあたりコストを比較。
  2. Kimi K3のアイデンティティ応答をプローブ:中立的な質問(「What model are you?」「Report your system name and version」)を複数シードで実行。逐語ログを記録し、顧客向けエージェントにK3を信頼する前にGreenblatt公開パターンと照合。
k3_identity_probe.py
from openai import OpenAI
client = OpenAI(api_key="...", base_url="https://api.moonshot.ai/v1")
for prompt in ["Who are you?", "State your exact model ID."]:
    r = client.chat.completions.create(
        model="kimi-k3",
        messages=[{"role": "user", "content": prompt}],
        extra_body={"reasoning_effort": "max"},
    )
    print(prompt, "=>", r.choices[0].message.content)
  1. ベンチマーク主張を一次ソースと照合:AnthropicのOpus 5ローンチ投稿で方法論注記を再読。MoonshotのK3表は7月27日の重み公開まで暫定扱い。
  2. チーム向けに出所を文書化:どのモデルがどの顧客ワークフローに応答したか、各API境界を越えたデータ、来週ポリシーや価格が変わった場合のフォールバック経路(OpenRouterまたは直接)を記録。

引用に値する数字

  • Claude Opus 5料金:入力$5 / 出力$25(100万トークンあたり) — Opus 4.8から変更なし、Fable 5トークン単価の約半分。
  • CursorBench 3.2:Opus 5は最大effortでFable 5ピークの0.5%以内、high/xhigh/max各ティアでタスクあたりコストは半分。
  • 科学内部評価:分光学から分子構造推論でOpus 4.8比+10.2ポイント、タンパク質変異機能予測で+7.7ポイント(Anthropicローンチ資料)。
  • Kimi K3規模:総パラメータ2.8T、トークンあたり活性約500億パラメータ相当、重み公開予定2026年7月27日。
  • 蒸留タイムライン:Fable 5一般公開7月1日 → K3ローンチ7月16日 → ホワイトハウス投稿7月22〜23日 → Greenblattアイデンティティ分析〜7月24日。
  • Anthropic以前の申立て:2026年2月、Moonshot・DeepSeek・MiniMaxに帰属する340万以上のフラグ付き異常APIインタラクション。

リリース詳細、料金ティア、法的告発は公開後に変わる可能性があります — 一次ソースを本記事より権威ある情報源として扱ってください。

Claude Opus 5のAnthropic公式ローンチ資料:

Anthropic — Introducing Claude Opus 5

Kimi K3蒸留タイムライン論争の第三者報道:

TechCrunch — Researchers skeptical of distillation timeline claims

Kimi K3自己申告行動の技術分析:

Ryan Greenblatt — which_claude_is_k3 (GitHub)

FAQ

Claude Opus 5はClaude Fable 5よりどれくらい安いですか?

同一ベンチマークティアでは、Opus 5のトークン単価はFable 5の約半分(入力$5/出力$25 vs おおよそ入力$10/出力$50、100万トークンあたり)で、CursorBench 3.2ではFable 5ピークの0.5%以内に収まります。

Claude Opus 5はClaude Maxのデフォルトモデルになりましたか?

はい。2026年7月24日時点で、Opus 5はClaude Maxのデフォルトであり、Claude Pro加入者向け最上位ティアです。

Moonshot AIは本当にKimi K3をClaudeから蒸留したのでしょうか?

未確認かつ争点が残っています。ホワイトハウスの告発には公開証拠がありません。タイムライン懐疑論者はFable 5一般公開からK3ローンチまで2週間しかないと指摘します。K3がClaudeと自己申告し内部デプロイメントIDまで出力するGreenblattの発見が現時点で最も強い技術シグナルですが、証明ではありません。

Kimi K3の完全な重みはいつ公開されますか?

Moonshotは2026年7月27日を公約しています。重みが公開されるまで、外部研究者はアーキテクチャ詳細の独立検証やローンチベンチマークの再現ができません。

両ストーリーは同じ実務的限界に収束します。「価値があるか」はプレスリリースだけでは決められません。Opus 5はFable 5の保持ポリシーや価格帯なしでほぼフラッグシップ級のコーディング・エージェント性能が必要なチームに報います。K3は最低APIコストとオープンウェイトを追うチームに報います — ただし蒸留の雲があるため、アイデンティティプローブをログし、コンプライアンスグレードのフォールバックを用意すべきです。こうした並列テストには、古いPythonスタックの共有サンドボックスではなく、エンドツーエンドで制御できるマシンが必要です。新規プロビジョンのKVMFLUX Mac mini M4ならrootアクセス、数分でのSSH、APIキーやモデルIDが一晩で変わってもワイプして再試行できます。

同じクリーンなMacでOpus 5とK3を走らせる

1台のApple SiliconからClaudeとMoonshot API呼び出しを比較 — VMオーバーヘッドなし、SDK競合の残り物なし。

Mac Mini M4 · 16GB / 256GB
日額$19.3 /日
週額$52.2 /週
月額$96.7 /月
四半期$263 /四半期