7月31日リリースで押さえるべき五つの摩擦点
見出しのベンチマークは印象的ですが、契約とルーティングを決める前に、再現性と運用面のギャップを先に確認する必要があります。
- パラメータは据え置き:V4-Flash-0731 は 284B 総量・13B 活性のままです。CSA+HCA ハイブリッド注意、mHC、Muon オプティマイザの骨格は V4-Pro プレビューと同一で、伸びは SFT/RL のポストトレーニングのみです。
- Harness は未公開:7月31日に初めて名称が出ましたが、フレームワーク本体はまだありません。公表の Agent ベンチは Harness 最小モードで走っており、ベンダー自身がハーネス感度の高さを注意喚起しています。
- API のみの更新:モバイルアプリと Web チャットは V4 Flash に切り替わっていません。本番トラフィックは
deepseek-chatエンドポイントでdeepseek-v4-flash-0731を明示指定する必要があります。 - 初期運用のノイズ:ローンチ直後、キャッシュヒットの不整合やセーフティ分類器のタイムアウトがユーザー報告として出ています。8月10〜20日の V4-Pro GA 噂や資金調達噂(梁文鋒氏が「梁百开」「梁胜」と呼ばれるニックネームの揺れを含む)はいずれも未確認です。
- 価格対性能の「斩杀线」:中国の開発者コミュニティでは、西側フロンティアモデルが大量トラフィック向けに経済合理性を失う価格帯を「斩杀线」と呼びます。Flash の $0.14/$0.28/M はその線の下に位置づけられ、OpenRouter 7月ランキングで日次約9439億トークン(2位)という使用量とも整合します。
V4-Flash-0731 公式スペックとローンチ数値
| 項目 | DeepSeek V4-Flash-0731 |
|---|---|
| 公開日 | 2026年7月31日(公式 API ベータ) |
| 総 / 活性パラメータ | 284B / 13B(V4-Pro プレビューと同一) |
| 性能の源泉 | ポストトレーニング(SFT + RL)のみ |
| アーキテクチャ | CSA + HCA ハイブリッド注意、mHC、Muon |
| コンテキスト | 100万トークン(V4-Pro は V3.2 比 FLOPs 27% 減・KV キャッシュ 10% 減とベンダー主張) |
| ライセンス | MIT(Hugging Face で open weights) |
| API 入力 / 出力(100万トークン) | $0.14 / $0.28(キャッシュヒット入力 $0.0028) |
| Artificial Analysis 指数 / タスク単価 | 50 / $0.03(独立第三者) |
| Terminal Bench 2.0 | 82.7(V4-Pro プレビュー 67.9、ベンダー+Harness 最小) |
| Agent・コーディングベンチ | 9項目中9項目で V4-Pro プレビュー超え(ベンダー実行) |
| Harness | 7月31日初言及、未公開 |
| アプリ / Web | 未更新(API のみ) |
「独立第三者」以外の行は DeepSeek ローンチ資料、または未公開 Harness 最小モードでのベンダー実行値です。
V4 Flash と Kimi K3・Qwen3.8-Max・フロンティア閉源モデルの比較
同じ週に Kimi K3 の重み公開(7月27日)と Qwen3.8-Max GA(8月3日)が重なり、国産万亿 MoE の価格戦が一段激化しました。
| モデル | 総 / 活性 | API 入力 / 出力(100万トークン) | AA 指数 / $/タスク | 重み | 独立ベンチ |
|---|---|---|---|---|---|
| V4-Flash-0731 | 284B / 13B | $0.14 / $0.28(キャッシュ $0.0028) | 50 / $0.03 | MIT 公開 | AA 指数 50 |
| V4-Pro プレビュー | 284B / 13B | $0.435 / $0.87(キャッシュ $0.003625) | Flash より低い | プレビュー | Terminal Bench 67.9 |
| Kimi K3 | 2.8T / 約104B | $3 / $15(キャッシュ $0.30) | 57 / $0.86 | 7月27日公開 | AA 57、SWE-bench 93.4% |
| Qwen3.8-Max | 2.4T / 95B | $2 / $6 | AA 未公表 | 公開約束・HF 未着 | Arena 暫定5位 |
| GPT-5.6 Sol | 非公開 | 複合約 $1.40 前後 | 約59 / $1.86 | 閉源 | Flash より約9ポイント上(AA) |
| Claude Fable 5 | 非公開 | 約 $10 / $50 | 約59 / $3.15 | 閉源 | Flash より約9ポイント上(AA) |
Claude Opus 4.8 級に「迫る」と言われるのはベンダー主導ベンチの文脈です。独立の Artificial Analysis では Flash は 50 点で、GPT-5.6 Sol と Claude Fable 5 はいずれも約9ポイント上ですが、タスク単価はそれぞれ $1.86・$3.15 と数十倍の差があります。絶対性能が必要な最終段だけフロンティアに逃がし、ボリューム層を Flash に寄せるハイブリッドが現実的です。
パラメータを増やさず伸ばす仕組みと Harness の読み方
DeepSeek の7月31日ナラティブは「同じ 284B/13B、より強い Agent」です。技術的には次の点が中心です。
- CSA + HCA:Compressed Sparse Attention と Hierarchical Context Attention の組み合わせで、100万トークン時の KV キャッシュ圧力を V3.2 比で抑える(ベンダー主張:FLOPs 27% 減、KV 10% 減)。
- mHC + Muon:長いツールチェーン上での RL ポストトレーニングを安定化し、Terminal Bench 82.7 のようなスコアに寄与したとされています。
- Harness 最小モードの限界:公表の9項目 Agent/コーディングベンチはすべてこのモードで計測。フレームワーク未公開のため、自社 Harness との乖離は想定内です。
- V4-Pro 正式版は未着:4月24日のプレビューから三ヶ月、Flash が先に「正式 API ベータ」として出ました。Pro プレビュー利用者はコストとスコアの両面で Flash へ寄せる圧力を受けます。
Opus 4.8 に近いベンダー表は本番保証ではありません。キャッシュ不具合とセーフティ分類器タイムアウトは、表の数字より先に自社ワークロードで再現すべきサインです。
V4 Flash を本番前に評価する6ステップ
ベンチ表だけではルーティング設計になりません。root 権限のあるクリーンな macOS 上で API 並走から始めてください。
- API キーとモデル ID を固定:DeepSeek コンソールでキーを発行し、
deepseek-v4-flash-0731が応答することを確認します。旧deepseek-chat/deepseek-reasonerは7月24日に非推奨化済みです。 - ベースラインを同一 Harness で用意:同一リポジトリ・同一テスト・同一トークン上限で Kimi K3 や Qwen3.8-Max と並走。ベンダー表は自社データの代替になりません。
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
resp = client.chat.completions.create(
model="deepseek-v4-flash-0731",
messages=[{"role": "user", "content": "この関数を挙動を変えずにリファクタして。"}],
)
print(resp.choices[0].message.content)
- キャッシュヒット率を計測:システムプロンプトと RAG コンテキストの再利用で、入力 $0.0028/M と $0.14/M の差が実効コストを左右します。初期報告のキャッシュ不整合はログで追跡してください。
- タスク単価を AA 基準と突合:代表タスク20〜50件で成功あたりコストを算出し、Kimi K3($0.86/タスク)や GPT-5.6 Sol($1.86/タスク)と比較します。
- 多段 Agent を隔離環境で:ツール呼び出し連鎖は wipe 可能な Mac 上で夜間バッチ実行。共有 CI の古い SDK ではベンダー Harness 最小モードすら再現できません。
- Harness 公開と V4-Pro GA を監視:DeepSeek 公式ドキュメントと Hugging Face を定期確認。8月10〜20日 GA 噂は未確認のままタスク管理に残し、フレームワーク公開時にベンチを再実行します。
タイムラインと引用可能な数字・出典
- 2026年4月24日:V4-Pro プレビュー初公開。
- 7月24日:
deepseek-chat/deepseek-reasoner非推奨化、V4 パイプラインへ移行。 - 7月27日:Kimi K3 重みが Hugging Face に公開。
- 7月31日:V4-Flash-0731 公式 API ベータ、Harness 初言及(未公開)、9/9 Agent ベンチで Pro プレビュー超え。
- 8月3日:Qwen3.8-Max GA(API $2/$6)。
- 規模:284B 総量、13B 活性、100万トークン、MIT。
- 価格:入力 $0.14 / 出力 $0.28(100万トークン)、キャッシュヒット入力 $0.0028。
- Artificial Analysis:指数 50・$0.03/タスク。Kimi K3 は 57・$0.86。GPT-5.6 Sol と Claude Fable 5 はいずれも約9ポイント上で $1.86・$3.15/タスク。
- Terminal Bench 2.0:Flash 82.7 vs Pro プレビュー 67.9。
料金、ベンチ、公開日程は更新される可能性があります。以下の一次情報を本記事より優先してください。
DeepSeek 公式:
API ドキュメント:
独立ベンチマーク:
Artificial Analysis — Intelligence Index と $/タスク
学習済み重み:
FAQ
V4 Flash はパラメータを増やしましたか?
いいえ。284B/13B のままです。性能向上はポストトレーニングのみに由来します。
Harness はもう使えますか?
7月31日に初言及されましたが未公開です。公表 Agent ベンチは最小モードで、ハーネス設定にスコアが敏感です。
アプリはいつ V4 Flash になりますか?
現時点では API のみの更新です。Web とモバイルは旧モデルのままなので、本番は API でモデル ID を明示してください。
Kimi K3 とどちらを選ぶべきですか?
コスト最優先なら Flash($0.03/タスク)。指数と open-weight 自ホストなら K3(57、7月27日公開)。多くのチームは両方を役割分担で併用します。
8月の V4-Pro GA 噂は信じられますか?
8月10〜20日 GA の噂は未確認です。Harness 公開とセットで再評価するのが安全です。
V4-Flash-0731 はベンダー表では Opus 4.8 級に迫り、Artificial Analysis ではタスクあたり数セント — しかし Harness は未公開、キャッシュ不具合が報告され、V4-Pro 正式版はまだです。Kimi K3 や Qwen3.8-Max との並走検証は、共有サンドボックスではなく wipe 可能な実機 Mac が前提です。KVMFLUX の Mac mini M4 なら root・数分で SSH・日単位レンタルで、モデル ID やルーティングが一夜で変わってもクリーンにやり直せます。
隔離 Mac で V4 Flash Agent を検証
Kimi K3・Qwen3.8-Max と API 並走 — Apple Silicon、root + SSH、SDK 競合なし。