Anthropic Opus 5 发布超越 Fable 5 和 GPT-5.6 Sol、Kimi K3 开源但安全落后、Fields 奖得主称 GPT-5.5 两小时完成博士级数学研究

# Anthropic Opus 5 发布超越 Fable 5 和 GPT-5.6 Sol、Kimi K3 开源但安全落后、Fields 奖得主称 GPT-5.5 两小时完成博士级数学研究

AI 深度 0728

【一句话摘要】Anthropic 发布 Opus 5,基准测试和人类评估超越 Fable 5 和 GPT-5.6 Sol,定价仅为 Fable 5 一半;月之暗面开源 Kimi K3 权重,但在网络安全和复杂数学上大幅落后;Fields 奖得主称 GPT-5.5 Pro 在两小时内独立完成博士级数学研究。

【实战价值分析】
– 🏆 Opus 5 重回巅峰——Anthropic 新旗舰定价减半,性价比大幅提升
– 🇨🇳 Kimi K3 开源——中国开源模型追赶到哪了
– 🧮 Fields 奖得主背书——AI 数学推理的实际水平
– ⚠️ Claude 共享聊天记录泄露——数据安全的管理漏洞

【核心对比】

模型 性能排名 定价 开源 发布时间
Claude Opus 5 🏆 第1 Fable 5 的一半 7/28
Fable 5 第2 6月
GPT-5.6 Sol 第3 中等 7月
Kimi K3 追赶中 极低 ✅ 开源 7月

## 一、Claude Opus 5:Anthropic 重回巅峰

Anthropic 发布了 Claude Opus 5——在综合基准测试和人类评估中超越 Fable 5 和 GPT-5.6 Sol。

【核心亮点】
– 性能:在”真实智能”基准测试上超越前代 Fable 5
– 定价:仅为 Fable 5 的一半
– 定位:Opus 系列重回旗舰,Fable 5 保持高端但不再是唯一
– 延续了短提示趋势:Anthropic 砍了 80% 系统提示,Opus 5 更依赖模型自身的推理能力

【定价矩阵变化】

2026 年 7 月模型定价格局
────────────────────────────
Opus 5      | ★★★★★ 旗舰 | $$     ← 新标杆
Fable 5     | ★★★★☆ 高端 | $$$$
GPT-5.6 Sol | ★★★★☆ 高端 | $$$ 
Sonnet 5    | ★★★☆☆ 中端 | $
Kimi K3     | ★★★☆☆ 开源 | 极低
────────────────────────────

【站长视角】
Opus 5 的发布传递了一个明确信号:性能领先 + 价格减半。这比单纯追求更高性能更有商业杀伤力。如果 Fable 5 用户能以一半成本获得更好性能,竞品将面临巨大压力。

## 二、Kimi K3 开源:追赶但仍有差距

月之暗面正式开源了 Kimi K3 的权重,但在两个关键维度暴露了差距:

【优势】
– 前端代码:超越 Fable 5
– 价格:极低,开源免费
– 48 小时 GPU 耗尽:需求证明热度

【差距】
– 网络安全:大幅落后美国前沿模型
– 复杂数学:同样差距明显
– 英国 Cyber Institute 的独立测试验证了这些差距

【蒸馏争议】
Google 和 OpenAI 抱怨中国模型通过蒸馏克隆西方模型。但 Nadella 批评这种双标——西方实验室也蒸馏别人的数据。美国倾向于选择性限制而非全面封禁中国开源模型。

## 三、Fields 奖得主验证 GPT-5.5:两小时博士级研究

一位 Fields 奖得主(数学界最高荣誉)验证了 GPT-5.5 Pro 在数学研究上的能力。

– 两小时内完成博士级数学研究
– 零人类帮助——AI 完全自主
– 这延续了此前 Sol Ultra 破解 50 年数学难题、AlphaProof 破解 Erdős 问题的系列
– AI 数学推理能力的提升速度远超预期

## 四、更多动态
– Claude 共享聊天记录被搜索引擎收录——Anthropic 的数据管理漏洞
– OpenAI 前对齐负责人抨击公司安全流程——商业利益优先于安全
– Delhi 高等法院驳回印度新闻机构对 OpenAI 的版权禁令请求
– METR 新指标:计算 AI Agent 何时比人类更贵——精确量化的劳动力替代指标
– Cursor 的 Agent Swarm:用小模型处理大部分编码,前沿模型策划工作
– Opus 5 定价仅为 Fable 5 的一半——Anthropic 的价格战策略

【SOP 操作】

1. 评估 Opus 5:如果你的团队在使用 Fable 5 或 GPT-5.6,测试 Opus 5——更好的性能 + 一半的成本
2. Kimi K3 选型:前端开发场景可以考虑使用(前端代码超越 Fable 5),但安全敏感场景需要谨慎
3. Claude 共享链接安全:如果使用 Claude 的共享聊天功能,确认不包含敏感信息
4. AI 数学能力:博士级研究级别的 AI 数学能力意味着科研工作流正在被重塑——开始思考 AI 在研究中的角色
5. Agent 成本评估:使用 METR 的新指标评估你的 AI Agent 是否比人类员工更具成本效益

来源:The Decoder;360 视界整理编译

发表评论