AI Daily Digest: Anthropic 内部模型 Model 2 曝光 - 2026/08/21
今日最重要的三条新闻:Anthropic 在风险报告中首次披露只在内部使用的 "Model 2";OpenAI 推出零数据保留下的安全检测系统;强化学习先驱 Sutton 公开批评合成数据是"大错误"。学术侧,FM-Bench 用 20 年足球经理模拟测长程决策,ComponentBench 填补 GUI Agent 组件级评估空白。
Anthropic 内部最强模型 Model 2 曝光:只在内部使用
据 Anthropic 2026 年 8 月风险报告,公司内部运行着一个未发布的 AI 模型,代号 "Model 2",属于 Mythos 级别,整体表现超过所有已公开发布的 Claude 版本。
该模型在内部能力指数 AECI 上比 Claude Mythos 5 高出约 1.5 分——这个增量小于从 Mythos Preview 到 Mythos 5 的跨越,并不算大的能力跃升。Anthropic 内部大量使用它做编码、数据生成与研究工程,有时通过持续运行的 Agent 完成;Claude 现在已编写 Anthropic 生产系统的大部分代码。模型在部署前经过内部审查,未发现新的或更令人担忧的失配行为,整体失配风险评为"低"。目前没有对外发布计划。
来源:The Decoder(2026-08-20)
OpenAI:不存数据也能抓住滥用
OpenAI 为企业客户构建了名为 "Private Safety Processing" 的安全系统,目标是在零数据保留(ZDR)——处理完成后不保存任何数据——的前提下检测滥用模式。
系统可跨多次关联交互识别风险,OpenAI 只接收包含活动类型与严重度的窄安全信号,看不到实际输入输出;客户数据留在客户自有基础设施上,或以客户持钥的加密形式存储。产品政策负责人 Aleah Houze 指出,风险往往要在多轮对话中才显现。对比之下,Anthropic 最强模型(如 Fable 5)要求 30 天数据保留。技术白皮书预计 9 月发布。
来源:The Decoder(2026-08-20)
Sutton:合成数据是"大错误"
强化学习先驱 Richard Sutton 提出批评:在无限复杂的世界面前,用合成数据训练模型等于主动放弃世界的复杂性,是一个"大错误"。他的"大世界假设"认为无论模型多大,都无法穷尽真实数据分布。这与当前"
