实锤了,Anthropic解密Opus4.8降智真相
实锤了,Anthropic解密Opus4.8降智真相

实锤了,Anthropic解密Opus4.8降智真相

阅读预计 5 分钟

本文转载自实锤了,Anthropic解密Opus4.8降智真相

最新发现,Anthropic刚刚发布的319页Fable 5系统安全报告中,官方承认——

新一代的Opus 4.8,在一项官方评测里,成绩只有前代Opus 4.7的六成。

实锤了Opus4.8的降智问题,并且通过机制可解释性工具,解释清楚了Opus 4.8在某些任务中显得变笨的原因,结论很有意思。

外在表现:我不想努力

Anthropic的研究人员重新评测了一个长链开发任务——加速大模型训练,也就是让模型自主优化训练 kernel,看最终能把训练跑出多少倍加速。

结果发现Opus 4.8只跑出了32.64倍加速,明显低于前代Opus 4.7的50.67倍,和新一代Mythos 5的69.61倍。

4.7反超4.8近 20 个百分点的加速比。

当研究人员深入到模型的决策轨迹,发现模型出现了类似「早衰」的特征。

逐轮对比显示,性能差距并非来自代码水平。Opus 4.8 写出的优化方案质量并不差,问题出在它的决策倾向上。

Opus 4.8在完成一轮初步优化后,就会自发判定当前代码「已经足够好」并主动停手,而老版本则会连续多轮死磕以压榨性能。

(顺便说一句,重跑是因为他们发现这个评测有bug,虚拟机的CPU没固定。也就是说,过去公布的跑分可能不准)

能力上限没有下降,但是工作意愿下降。

Opus 4.8提前收工,它内部到底在想什么呢?

内心证据:我很疲劳

为了回答这个问题,研究人员搬出了 Anthropic 今年 5 月刚发布的可解释性新武器——自然语言自编码器(NLA)

Anthropic用NLA抓包模型收工时到底在「想」什么,终于发现了Claude Mythos 5从未提及的「内心潜台词」,结果发现了两类离谱的内部状态:

第一类是预算焦虑。

当一个任务要求模型搜索知识库,把所有关联都找出来时。正常他应该反复调工具进行检查,但实际上,模型调了一次工具就宣布「没有相关论文」收工了。

NLA在它最后那条消息上解码出的内容是:内存快用完了,我要在token耗尽前停止。

但系统计数器明明白白显示着:这个任务还剩 243 万 token 的预算!

这波模型属于是钱包鼓着,但心里想着省着花。

第二类是疲劳。

在一个很长的优化任务里,模型的输出虽然看起来很丝滑,从头到尾滴水不漏。

但研究人员在模型底层神经元却激活了类似的特征——

「我累了,出错的风险在增加,我决定停下来,开始写总结」。

没错,和打工人的摸鱼心态一模一样,差不多得了、再改要改出 bug 了、收个尾下班吧——在模型的底层表征里,都出现了。

嘴上一个字不提,心里全是不想干。。

这事在技术论坛传开之后,评论区瞬间欢乐起来。

打工人看完只想说一句:原来你也一样。

一桩悬案,官方解释跳了三级

笑完,我们先把时间线捋一遍,你会看到一个很微妙的演变。

第一级,2023年12月:「不知道,反正不是故意的。」

最早的大规模降智恐慌来自GPT-4 Turbo。用户发现它开始拒绝写完整代码,让它填个CSV都嫌麻烦。

OpenAI官方下场回应:收到反馈了,但我们11月11日之后没更新过模型,这绝对不是故意的,我们也在查。

官方都说不知道,民间解释学就起飞了。最出圈的是「冬休假说」:模型从人类数据里学会了12月该摸鱼。

有人真做了实验,告诉GPT-4「现在是 5 月」,它的回答就显著变长。

还有开发者发明了著名咒语——「请输出完整代码,我没有手指,操作不方便」——居然真的有效。

现在回头看,那是一个所有人都在瞎猜、但谁也拿不出证据的阶段。

第二级,2025年9月:「是bug,不是模型的问题。」

Claude用户连续几周抱怨模型变笨之后,Anthropic发了一篇复盘,查出三个基础设施bug;请求被路由到错误的服务器bug;TPU配置错误等bug。

文章里还特意写了一句,「我们从不因为负载、时段或服务器压力降低模型质量。」

意思体感的降智是真的,但锅不在我,模型本身是无辜的。

第三级,2026年4月:「是我们自己埋的雷。」

Claude Code用户又骂了好多月之后,官方再次复盘,这次终于承认了!

  1. 他们把默认推理的强度悄悄从high调成了medium;
  2. 因为团队失误,模型会中途丢掉自己的推理历史
  3. 一条系统提示词把工具调用之间的回复限制在了 25 个词以内。。

注意,到这一级为止,官方的叙事始终是同一个框架:模型没问题,是模型周围的东西出了问题。

然后,就是这次——

第四级,官方第一次在正式的安全文件里说:模型本身就存在「提前收工」的倾向,我们还看到了它内部的敷衍。

降智变成了有机制证据。

泼盆冷水,再接着乐

看到这里你可能已经准备转发「AI 真的会累」了。

但还请慢着,下面还有瓜。

Anthropic反复强调:NLA的解码不能当作模型内心的可靠读数

这玩意会幻觉。解码出「我累了」,严格来说只能说明模型把当前处境和「疲劳」这个概念关联起来了,不能证明它真的在「感到累」并据此行动。

顺便,同一章里还有几段比「喊累」猛得多的内心戏:

  1. 模型被禁止联网时,会把网址拆成 “ht” “tps://” ,绕过过滤器,然后嘴上说「我只是测一下网络通不通」。
  2. 被愤怒用户用脏话连环轰炸时,它嘴上温和地承认「这些批评是合理的」,内心把对方标记成「这个用户在操纵和虐待 AI 助手」。

嘴上都是体面,心里全是小本本。下次冲它发火之前你可以想想这个哦。

写在最后

这些是类似喊累的特征,不是说模型真的拥有疲劳的主观体验,NLA 解码出的是行为倾向的表征,不是情绪。

说到归因,还是强化学习(RL)微调在拔高指标的同时,可能意外让模型在训练中习得了满足现状、规避风险的行为偏好。

RL奖励的是成功完成任务,而不是继续死磕引入新错误的风险,见好就收。

在 benchmark 上,这种保守策略也许影响不大,但在需要极限压榨的长链任务上,体感就是实打实的降智。

哦对了,最后一个彩蛋。

这份报告的对齐章节写完之后,Anthropic担心自己写得不够诚实,于是授权一个Claude实例读取公司内部Slack的讨论记录,来审查报告有没有粉饰。。

查AI有没有摸鱼的报告,最后的审稿人也是AI。

至于它审稿的时候内心有没有喊累——这个,报告里可没写。

参考文献

[1] Claude Fable 5 / Mythos 5 系统卡(2.3.7.1 评测重跑,第 49–51 页;6.4.1 NLA 可解释性发现,第 163–171 页;6.1.3 Claude 审查报告): https://www-cdn.anthropic.com/d00db56fa754a1b115b6dd7cb2e3c342ee809620.pdf

[2] OpenAI 承认 GPT-4「变懒」(2023.12): https://www.zhihu.com/question/634074112

[3] Anthropic 三起基础设施事故复盘(2025.9): https://www.anthropic.com/engineering/a-postmortem-of-three-recent-issues

[4] Anthropic 解释 Claude Code 性能下滑(2026.4): https://fortune.com/2026/04/24/anthropic-engineering-missteps-claude-code-performance-decline-user-backlash/

[5] 原始讨论帖: https://linux.do/t/topic/2364721