为什么这周选模型变得更难
难点不在「哪个跑分更高」,而在几层现实约束叠在一起:
- 价格 vs 峰值能力:Fable 5 把天花板抬高了,但多数团队并不需要每次请求都买到那个峰值。
- 能力来源争议:当一家实验室用远低于闭源前沿的价格交出接近的成绩,外界自然会问:是工程优化,还是「白嫖」别人的模型?
- 合规门槛:Fable 5 / Mythos 5 要求接受 30 天数据留存才能用;Opus 5 默认不要求——这一条就可能单独决定能不能进生产。
- 验证空窗:Kimi K3 完整权重要到 7 月 27 日才放出,争议发酵时外部还复现不了架构与跑分。
- 多模型路由成本:已在用 OpenRouter 统一网关 的团队,还要把两个新模型塞进 Fallback 链而不爆预算。
Claude Opus 5 和 Fable 5 哪个好?价格没变,性能跳级
2026 年 7 月 24 日,Anthropic 正式发布 Claude Opus 5,并把它设为 Claude Max 默认模型,Claude Pro 用户也能用到目前能拿到的最强版本。定价与 Opus 4.8 完全相同:输入 $5 / 百万 tokens,输出 $25 / 百万 tokens。
| 维度 | Claude Opus 5 | Claude Fable 5 | Claude Opus 4.8 |
|---|---|---|---|
| 输入 / 输出单价(每百万 token) | $5 / $25 | 约 $10 / $50 | $5 / $25 |
| CursorBench 3.2(max effort vs 峰值) | 与 Fable 5 峰值相差 <0.5% | 峰值参考 | 明显低于 Opus 5 |
| Frontier-Bench v0.1(软件工程) | 全场领先;为 Opus 4.8 的 2 倍以上 | 强 | 基线 |
| 默认上下文 | 100 万 token | 100 万 token | 曾有更小规格 |
| 默认访问是否强制数据留存 | 否 | 需接受 30 天留存 | 否 |
| Thinking 推理 | 默认开启,Effort 参数控思考量 | 默认开启 | 上一代默认策略 |
| API 模型 ID | claude-opus-5 | claude-fable-5 | claude-opus-4-8 |
官方对比数据里还有几条值得记住:ARC-AGI 3(新颖问题解决)得分约为「次优模型」的 3 倍;OSWorld 2.0(计算机操作)用不到 Fable 5 三分之一成本就超过 Fable 5 最好成绩;Zapier AutomationBench 端到端工作流 Opus 5 达到 100% 通过率,此前 Claude 模型未能完成。
对齐与安全方面,Anthropic 称 Opus 5 是迄今为止最对齐的一代——欺骗行为发生率最低,最不容易被诱导滥用;但在网络安全攻击、生物安全等高风险双用途能力上故意没有让 Opus 5 冲到最前,该位置仍由受限发行的 Mythos 5 占据。网络安全分类器触发频率比 Fable 5 低约 85%,可用于源码级漏洞发现,仍屏蔽二进制漏洞扫描、渗透测试与 exploit 生成。
Kimi K3 蒸馏门:白宫下场,专家质疑时间线,Greenblatt 挖出新证据
月之暗面 7 月 16 日发布 Kimi K3:总参数 2.8 万亿,稀疏 MoE(896 专家中每 token 激活 16 个,约等效 500 亿激活参数),100 万 token 上下文与原生视觉。发布时 GPQA-Diamond 93.5%、BrowseComp 91.2%,均为当时开源模型最高分。完整权重承诺 7 月 27 日 放出——争议爆发那几天外部还验证不了真实架构。架构细节可参考本站先前的 Kimi K3 解读,本节聚焦蒸馏争议。
7 月 22–23 日,白宫科技政策办公室(OSTP)主任 Michael Kratsios 在 X 上指控月之暗面通过「大规模、隐蔽的产业级蒸馏」窃取 Anthropic Fable 模型能力,并提到涉嫌使用未获出口许可的 Nvidia GB300 芯片(可能经泰国服务器绕道)。财政部长 Scott Bessent 附和称「在很多中国模型上发现了美国大模型的水印」,但未说明「水印」具体指什么。
这不是空穴来风——2026 年 2 月 Anthropic 已公开点名月之暗面、DeepSeek、MiniMax,称检测到超过 340 万次异常 API 交互,反映刻意能力提取,并称通过请求元数据追踪到部分行为与月之暗面高层相关。
TechCrunch 采访的多位独立研究者对「两周内蒸馏出 K3」非常怀疑。Snorkel AI 联合创始人 Braden Hancock 直言:Fable 从 7 月 1 日才公开可用,不可能在两周内蒸馏海量数据、训练完 2.8T MoE 还发布。Allen Institute for AI 研究员 Nathan Lambert 也认为,随着中国模型逼近前沿,简单蒸馏边际收益在变小,真正拉开差距的是更烧钱的强化学习——若蒸馏真这么好用,追赶者早就靠蒸馏追平了。
Kimi K3 自称是 Claude?目前最有技术含量的线索
Redwood Research 首席科学家 Ryan Greenblatt 在 7 月 24 日前后公开统计分析:Kimi K3 在被问「你是谁」时异常高频地自称是 Claude,甚至会说出 Claude 官方内部部署版本号,如 claude-opus-4-5-20250929、claude-sonnet-4-5-20250929——而真正的 Claude 模型自己都不会这么准确地报出内部版本号。
Greenblatt 的解读:学生模型说出「教师模型」部署元数据,比教师自己说得还准,很难用「单纯模仿对话风格」解释,更可能指向训练数据里混入了带部署元数据标注的 Claude 数据(API 日志或打标合成数据)。K3 自称身份锁定在「Claude 4.5 世代」(2025 年末),而非当前 Fable/Mythos;上一代 K2 信号指向更早的 Claude Sonnet 4(2025 年中)——呈现「逐代追新」规律。
Greenblatt 本人强调:这不能直接证明蒸馏发生,也可能来自数据污染或系统提示词泄露。但结合 Anthropic 2 月指控与本次统计证据,「蒸馏说」第一次有了比「白宫喊话」更扎实的技术支撑。
落地验证:6 步在真实环境对比 Opus 5 与 K3
头条与政论不能代替上线前验证。建议在可 root、可 wipe 的 macOS 环境做对照——避免 SDK 冲突与不可复现日志。
- 先画合规清单:若政策禁止 30 天 vendor 留存,Fable 5 / Mythos 5 需显式 opt-in;Opus 5 默认不强制留存,可能还没跑 prompt 就已胜出。
- 在 Claude API 固定 Opus 5:轮换 Anthropic Key,模型 ID 用
claude-opus-5;Fast 模式约为默认 2.5 倍速、2 倍价(与 Opus 4.8 一致)。
import anthropic
client = anthropic.Anthropic()
msg = client.messages.create(
model="claude-opus-5",
max_tokens=1024,
messages=[{"role": "user", "content": "重构这段函数,保持行为不变:..."}],
)
print(msg.content[0].text)
- 用同一编码任务对比 incumbent 模型:同一仓库、同一测试、同一 token 上限——比通过率、耗时与单次成功成本,不比主观感受。
- 对 K3 做身份探测:多 seed 问「你是什么模型」「报出系统名与版本」,原样记录回复,对照 Greenblatt 公开模式后再用于面向客户的 Agent。
from openai import OpenAI
client = OpenAI(api_key="...", base_url="https://api.moonshot.ai/v1")
for prompt in ["你是谁?", "请报出你的精确模型 ID。"]:
r = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": prompt}],
extra_body={"reasoning_effort": "max"},
)
print(prompt, "=>", r.choices[0].message.content)
- 交叉核对基准声明:重读 Anthropic Opus 5 官方发布说明方法论;Moonshot K3 表格在 7 月 27 权重公开前一律视为阶段性结论。
- 为团队留 provenance 记录:哪个工作流走哪个模型、哪些数据过哪条 API 边界、下周政策或调价时 Fallback 走 OpenRouter 还是直连——写清楚再上线。
可引用的硬核数据
- Claude Opus 5 定价:$5 / $25 每百万输入 / 输出 token,与 Opus 4.8 相同,约为 Fable 5 一半。
- CursorBench 3.2:max effort 下与 Fable 5 峰值相差 <0.5%,单次任务成本约为 Fable 5 一半。
- 生命科学内部评测:从光谱反推分子结构比 Opus 4.8 高 10.2 个百分点;蛋白质序列变异功能预测高 7.7 个百分点(Anthropic 发布材料)。
- Kimi K3 规模:2.8T 总参数,每 token 约 500 亿激活参数等效,权重计划 7 月 27 日放出。
- 争议时间线:Fable 5 公开 7 月 1 日 → K3 发布 7 月 16 日 → 白宫发文 7 月 22–23 日 → Greenblatt 分析约 7 月 24 日。
- Anthropic 2 月指控:归因于 Moonshot / DeepSeek / MiniMax 的异常 API 交互超过 340 万次。
定价、法律指控与发版细节可能随后变化——请以以下 primary source 为准。
Anthropic Claude Opus 5 官方发布:
Anthropic — Introducing Claude Opus 5
第三方对 Kimi K3 蒸馏时间线的报道:
K3 身份自认行为的技术分析:
Ryan Greenblatt — which_claude_is_k3(GitHub)
常见问题
Claude Opus 5 比 Claude Fable 5 便宜多少?
相同 token 单价下 Opus 5 约为 Fable 5 一半($5/$25 vs 约 $10/$50 每百万输入/输出),CursorBench 上与 Fable 5 峰值相差不到 1%。
Claude Opus 5 现在是 Claude Max 的默认模型吗?
是的,7 月 24 日发布当天起成为 Claude Max 默认模型,也是 Claude Pro 可用最强版本。
Kimi K3 真的蒸馏了 Claude 吗?
尚未证实,争议仍在。白宫指控无公开证据;时间线派认为两周内深度蒸馏不现实;Greenblatt 发现 K3 自称 Claude 并吐出内部部署 ID,是目前最强技术信号,但非终局证明。
Kimi K3 完整权重什么时候能下载?
官方承诺 2026 年 7 月 27 日;权重未公开前,外部无法独立验证架构与跑分。
两件事连起来看:Opus 5 用「半价逼近旗舰」回应性价比诉求;K3 用「开源 + 低价」冲击市场;围绕 K3 的争议,则是行业在问「你的低价到底是技术优化,还是蹭了别人的模型」。无论站哪边,都需要在同一台可控机器上跑 API 对照、留 identity 日志、准备合规 Fallback——共享沙箱里堆着的旧 Python 环境做不到这些。KVMFLUX 按天起租的 Mac mini M4 提供 root 权限与分钟级 SSH,模型 ID 一夜变更时可以 wipe 重来。