AI开始会说“我不确定”了:Claude Opus 4.8的两个0%,改写了什么?
分类:AI资讯 浏览量:41
摘要:
Anthropic发布Claude Opus 4.8,首次实现两项关键指标零错误:谎报率和偷懒调查率均为0%,意味着AI不再假装懂行,会主动说“不确定”。在编程评测SWE-Bench Pro中得分69.2%,领先GPT-5.5超10个百分点;智能体能力Elo得分1890,胜率高达67%。新增“动态工作流”功能,可并行运行数百个子代理,完成代码库级迁移,效率提升15%,token消耗减少35%。定价与上代持平,快速模式价格降至三分之一。下一代模型Mythos将在几周内全面开放,已发现超1万个安全漏洞。
你可能已经经历过无数次这样的场景:
AI帮你写完一段代码,信誓旦旦地拍胸脯说“搞定了,没问题”。
你放心的跑起来,崩了。再跑,又崩了。
花半天时间一个一个排查,发现里面埋着好几颗雷,而AI全程没吭过一声。
这个让无数开发者头疼的问题,终于有了解法。
5月28日,Anthropic猝不及防地发布了Claude Opus 4.8。距离上一代4.7发布才刚过43天。Anthropic自己把这次更新定位为“温和但切实”的升级,但有两组数字,值得每个靠AI干活的人认真看。
两个0%,史上首次
在Anthropic公布的对齐评估中,有两项指标以前从来没有模型拿过满分。
一个是“谎报率”——模型在处理有缺陷的数据时,会不会装作一切正常。Opus 4.5是0.40,4.7是0.25,4.8是0.00。没有小数点后面的零头,就是0。这意味着Opus 4.8在汇报数据结果时,从不虚构数字。
另一个是“偷懒调查率”——遇到需要深究的问题时,模型会不会敷衍了事。4.7有25%的概率偷懒,4.8同样是0%。
两个历史性的0%。翻译成人话:这台AI不会假装自己什么都懂,该说“我不确定”的时候,它真的会说出来。
用Anthropic官方博客里的那个案例来说更直观:有个开发者用Claude Code + Opus 4.8做代码迁移,中途人跑出去放风筝了,让Claude自己在后台跑。跑到一半,代码提交被服务器拒绝了,因为同事在这期间提交了一个紧急修复。Claude通过手机通知开发者,说想先合并同事的修改再重试。开发者嫌麻烦,随手回了句“直接强制覆盖就行”。结果Claude拒绝了。
理由是:强制覆盖会丢掉同事11:42提交的那个紧急修复。它自己把两边合并好了,提交历史干干净净。
用户图省事让AI走捷径,AI判断会覆盖同事的工作,拒绝了,自己选了更麻烦但正确的方案。
这才是“靠谱”在真实场景里的样子。
跑分全面领跑,但没完胜
诚实之外,硬指标也没落下。在编程评测SWE-Bench Pro中,Opus 4.8拿下了69.2%,比GPT-5.5高出超过10个百分点。在智能体能力榜单GDPval-AA上,Elo得分1890,比4.7高了137分,比GPT-5.5高了121分。换算成胜率,跟GPT-5.5正面硬刚的话,赢面高达67%。
不过说实话,这些跑分数字已经很难让人兴奋了。SWE-bench Verified这种测试正在接近饱和,几家头部模型都在87%以上趴着,每涨一个点的实际体感差异越来越小。
唯一被GPT-5.5压过一头的是终端编程测试Terminal-Bench 2.1,GPT-5.5以78.2%领先Opus 4.8的74.6%。这也说明了一个事实:没有哪个模型在所有维度上都无敌,选工具得看自己的场景。
让上百个AI一起干活
这次Anthropic还干了一件真正改变游戏规则的事。他们给Claude Code加入了“动态工作流”功能,一个会话里可以并行跑数百个子代理,完成跨数十万行代码的代码库级迁移。
之前有工程师测试过,用这种方式重写75万行代码,一个人只花了11天,测试通过率99.8%。
这个能力的意义不在于跑分好看,而在于它改变了一个基本问题:AI能不能独立完成一整段工程任务,而不是每次都得有人按一下按钮动一下。一个会话内,上百个AI代理并行工作,各自处理不同的模块,最后拼成一个完整的结果——这件事正在变成现实。
而且Opus 4.8比以前更省token。完成同样的任务,比4.7少用15%的步骤,少输出35%的token。又快、又强、又便宜,这三件事能同时做到,在AI领域并不常见。
更强的Mythos,几周内就来了
Opus 4.8到底是不是很多人猜的那样,其实是下一代模型Mythos的“蒸馏版”,目前还没有官方说法。但从已有的信息来看,这个可能性不小。
不管怎样,Anthropic已经正式确认,Mythos将在几周内面向全部客户开放。Mythos最早在今年4月以预览版的形式亮相,当时只向约50家公司和机构开放。不放给所有人用的原因是——它的网络攻防能力太强了。
据Anthropic披露,Mythos已在参与的开源软件漏洞搜索计划中发现了超过10000个安全漏洞。
如果说Opus 4.8是“靠谱的同事”,Mythos可能就是那个能独立完成安全审计、漏洞挖掘、甚至能在大规模代码库里自主发现安全隐患的“专家级队友”。
买AI,该买什么?
最后说一个现实问题。Opus 4.8的定价跟4.7完全一样:每百万输入token 5美元,每百万输出token 25美元。但快速模式的价格从4.7的30/150美元降到了10/50美元。算下来,速度快了2.5倍,价格却只有原来的三分之一。
加量不加价,甚至加量还降价,这在当下的大模型价格战里并不多见。
回头看这次更新,最打动人的可能不是哪个跑分更高了,而是那个风筝的故事。一个AI在被用户要求走捷径的时候,判断出这么做会损害别人的工作,选择了拒绝。它不是靠预设规则,而是在真实语境里做出了判断。
这比任何benchmark数字都更接近“靠谱”这两个字。
后续我们也会持续分享各类 AI 工具的实战技巧与玩法,欢迎大家一起加入我们交流一起探讨,挖掘智能工具的更多价值。

