AI Daily Digest: 最强模型卖不动?Fable 5 自主科研闭合 82% 人类差距 - 2026/08/24
今天 AI 圈最重要的一组对照:Claude Fable 5 在 Prime Intellect 的自主科研实验中以 2,726 步登顶 nanoGPT 优化器速度赛,闭合人类纪录 82% 的差距、99% 工作流无需人工介入——但同一周,FT 报道这个"最能干"的模型在 Anthropic 客户支出中占比停滞于 11%,被单价减半的 Opus 5 反超。能力天花板与商业成功第一次如此清晰地脱钩。此外:DeepSeek 与 MiniMax 同日发布超大规模开源权重模型,GLM-5.3 权重本周开源,o3 两天后退 役。
Fable 5 自主科研闭合 82% 人类差距
Prime Intellect 做了迄今最大规模的前沿模型自主科研实验:18 个模型、153 次沙箱运行(8xH200,单次最长 8 天),任务是 nanoGPT 优化器速度赛——把 124M 参数模型在 FineWeb 上训到 3.28 验证损失,步数越少越好。这是一道没有标准答案可以查的开放研究题:需要假设训练为何慢、改掉某个环节、测量、迭代。
结果:Claude Fable 5 以 2,726 步登顶,闭合共享基线与人类纪录(数十名研究者数月积累)之间 82% 的差距,99% 的研究工作流无需人工介入。注意表述——82% 不是"打败人类",人类纪录仍然领先;变化在于模型在无人值守的八天算力里独立走完了大部分科研流程。
更有信息量的是横向对比:同一实验中 Opus 5 只闭合了 52-54% 的差距。两个在综合智能指数上只差三分的模型,在多天自主任务上差距悬殊——持续自主性是一个现有排行榜完全不测量的独立能力维度。选型跑长程 Agent 任务时,基准分数是弱代理信号。
来源:Prime Intellect(2026-08)
能力与商业成功脱钩:Fable 5 卖不过 Opus 5
据 Financial Times,发布两个月的 Fable 5 占 Anthropic 客户支出比例停滞在 11%,而单 token 成本约两倍于它的 Opus 5(25 每百万 token)在企业支出上完成反超,同时以 63 分登顶 Artificial Analysis 智能指数、55.3 分登顶 Agent 指数——双榜第一还更便宜。
这是目前关于"企业如何真正选模型"最清晰的数据点:旗舰模型赢得基准和头条,但大多数生产流量路由到下一档,因为多数工作负载上的能力差异撑不起价差。发布两个月支出占比就停滞,这是平台期不是爬坡期。同样的动力学正在推动 GPT-5.6 Sol 降到 20、DeepSeek 以 $1.32 提供 1.6T 参数服务——绝对前沿能力的市场很小(主要是科研),"够用且便宜一半"的市场巨大。
DeepSeek 视觉模型与 MiniMax M3:开源阵营双发
DeepSeek 发布 V4-Flash-Vision-Exp:284B 总参数、每 token 激活 13B 的 MoE 视觉模型,在 ALE(1000+ 多步应用任务)和 ZeroBench 上超越 Opus 4.8,7 项文本基准中 6 项超越自家基座——视觉训练没有以牺牲推理为代价。更值得注意的是 HCA/CSA 压缩技术把百万 token 上下文的处理成本削减 73%:全代码库分析、长 Agent 历史正在从"演示级"进入"预算级"。
MiniMax M3 则交出 428B 总参数、23B 激活的开源权重,是首个把前沿 Agent 编码(SWE-bench Verified 80.5%)与原生文本/图像/视频输入结合的开源模型,GPQA 超 92 分——距离闭源第一 GPT-5.4-Pro 的 94.4% 只差约两分。提醒:许可证是自定义的 minimax-community 而非 Apache 2.0,商用前需细读条款。加上 Qwen3.8-Max(2.4T)与 Kimi K3(2.8T),开源阵营一个月内凑齐了三个前沿级选项。
本周日程:GLM-5.3 开源与 o3 退役
两件日程值得所有工程团队记下。其一,Z.ai 预计 8 月 28 日前后发布 GLM-5.3 开源权重——该模型以 84.5% 领跑 CyberGym 网络安全基准,为攻防能力领先的模型开源权重尚无行业先例,这次发布将成为后续所有安全模型开源决策的参照点。其二,OpenAI 的 o3 将于 8 月 26 日从 ChatGPT 退役(Google 的 gemini-robotics-er-1.6-preview 也在 8 月 31 日关闭)——绑定特定模型 ID 的系统会在退役日静默劣化,今天就去代码库里搜一遍硬编码的模型标识符。
同日披露的安全事件也值得注意:一个影响 OpenAI、Anthropic、Google 的 API 缺陷曾允许弱模型解码强模型的推理轨迹(可被用于蒸馏或绕过输出过滤),三家均已修复。同一类缺陷同时出现在三家独立供应商,指向共享设计假设而非单点实现漏洞。
学术前沿:Agent 系统的三个新基准与方法
Outcome Monitors:静默工具失败的恢复设计
工具超时是可见的,Agent 能绕行;但缓存错误页、负数价格会以"正确格式"到达并被当事实消费。这篇论文从任务无关轨迹中挖掘"结果契约",违约时保留结果并下发非约束性回执,指明被违反的属性与公开恢复工具。ToolMaze 完成率从 10.9% 提升至 28.1%(4 个模型),tau-bench retail 提升约 14 分;对照实验证明有效成分就是恢复工具列表本身。
来源:arXiv:2608.19303(2026-08)
