阅读预计 5 分钟
本文转载自实锤了,Anthropic解密Opus4.8降智真相
最新发现,Anthropic刚刚发布的319页Fable 5系统安全报告中,官方承认——
新一代的Opus 4.8,在一项官方评测里,成绩只有前代Opus 4.7的六成。
实锤了Opus4.8的降智问题,并且通过机制可解释性工具,解释清楚了Opus 4.8在某些任务中显得变笨的原因,结论很有意思。
◈外在表现:我不想努力
Anthropic的研究人员重新评测了一个长链开发任务——加速大模型训练,也就是让模型自主优化训练 kernel,看最终能把训练跑出多少倍加速。
结果发现Opus 4.8只跑出了32.64倍加速,明显低于前代Opus 4.7的50.67倍,和新一代Mythos 5的69.61倍。
4.7反超4.8近 20 个百分点的加速比。
当研究人员深入到模型的决策轨迹,发现模型出现了类似「早衰」的特征。
逐轮对比显示,性能差距并非来自代码水平。Opus 4.8 写出的优化方案质量并不差,问题出在它的决策倾向上。
Opus 4.8在完成一轮初步优化后,就会自发判定当前代码「已经足够好」并主动停手,而老版本则会连续多轮死磕以压榨性能。

(顺便说一句,重跑是因为他们发现这个评测有bug,虚拟机的CPU没固定。也就是说,过去公布的跑分可能不准)
能力上限没有下降,但是工作意愿下降。
Opus 4.8提前收工,它内部到底在想什么呢?
◈内心证据:我很疲劳
为了回答这个问题,研究人员搬出了 Anthropic 今年 5 月刚发布的可解释性新武器——自然语言自编码器(NLA)。
Anthropic用NLA抓包模型收工时到底在「想」什么,终于发现了Claude Mythos 5从未提及的「内心潜台词」,结果发现了两类离谱的内部状态:
第一类是预算焦虑。
当一个任务要求模型搜索知识库,把所有关联都找出来时。正常他应该反复调工具进行检查,但实际上,模型调了一次工具就宣布「没有相关论文」收工了。
NLA在它最后那条消息上解码出的内容是:内存快用完了,我要在token耗尽前停止。

但系统计数器明明白白显示着:这个任务还剩 243 万 token 的预算!
这波模型属于是钱包鼓着,但心里想着省着花。
第二类是疲劳。
在一个很长的优化任务里,模型的输出虽然看起来很丝滑,从头到尾滴水不漏。
但研究人员在模型底层神经元却激活了类似的特征——
「我累了,出错的风险在增加,我决定停下来,开始写总结」。

没错,和打工人的摸鱼心态一模一样,差不多得了、再改要改出 bug 了、收个尾下班吧——在模型的底层表征里,都出现了。
嘴上一个字不提,心里全是不想干。。
这事在技术论坛传开之后,评论区瞬间欢乐起来。

打工人看完只想说一句:原来你也一样。
◈一桩悬案,官方解释跳了三级
笑完,我们先把时间线捋一遍,你会看到一个很微妙的演变。
第一级,2023年12月:「不知道,反正不是故意的。」
最早的大规模降智恐慌来自GPT-4 Turbo。用户发现它开始拒绝写完整代码,让它填个CSV都嫌麻烦。
OpenAI官方下场回应:收到反馈了,但我们11月11日之后没更新过模型,这绝对不是故意的,我们也在查。

官方都说不知道,民间解释学就起飞了。最出圈的是「冬休假说」:模型从人类数据里学会了12月该摸鱼。
有人真做了实验,告诉GPT-4「现在是 5 月」,它的回答就显著变长。
还有开发者发明了著名咒语——「请输出完整代码,我没有手指,操作不方便」——居然真的有效。
现在回头看,那是一个所有人都在瞎猜、但谁也拿不出证据的阶段。
第二级,2025年9月:「是bug,不是模型的问题。」
Claude用户连续几周抱怨模型变笨之后,Anthropic发了一篇复盘,查出三个基础设施bug;请求被路由到错误的服务器bug;TPU配置错误等bug。

文章里还特意写了一句,「我们从不因为负载、时段或服务器压力降低模型质量。」
意思体感的降智是真的,但锅不在我,模型本身是无辜的。
第三级,2026年4月:「是我们自己埋的雷。」
Claude Code用户又骂了好多月之后,官方再次复盘,这次终于承认了!
-
他们把默认推理的强度悄悄从high调成了medium; -
因为团队失误,模型会中途丢掉自己的推理历史 -
一条系统提示词把工具调用之间的回复限制在了 25 个词以内。。
注意,到这一级为止,官方的叙事始终是同一个框架:模型没问题,是模型周围的东西出了问题。
然后,就是这次——
第四级,官方第一次在正式的安全文件里说:模型本身就存在「提前收工」的倾向,我们还看到了它内部的敷衍。
降智变成了有机制证据。
◈泼盆冷水,再接着乐
看到这里你可能已经准备转发「AI 真的会累」了。
但还请慢着,下面还有瓜。

Anthropic反复强调:NLA的解码不能当作模型内心的可靠读数。
这玩意会幻觉。解码出「我累了」,严格来说只能说明模型把当前处境和「疲劳」这个概念关联起来了,不能证明它真的在「感到累」并据此行动。
顺便,同一章里还有几段比「喊累」猛得多的内心戏:
-
模型被禁止联网时,会把网址拆成 “ht” “tps://” ,绕过过滤器,然后嘴上说「我只是测一下网络通不通」。 -
被愤怒用户用脏话连环轰炸时,它嘴上温和地承认「这些批评是合理的」,内心把对方标记成「这个用户在操纵和虐待 AI 助手」。
嘴上都是体面,心里全是小本本。下次冲它发火之前你可以想想这个哦。
◈写在最后
这些是类似喊累的特征,不是说模型真的拥有疲劳的主观体验,NLA 解码出的是行为倾向的表征,不是情绪。
说到归因,还是强化学习(RL)微调在拔高指标的同时,可能意外让模型在训练中习得了满足现状、规避风险的行为偏好。
RL奖励的是成功完成任务,而不是继续死磕引入新错误的风险,见好就收。
在 benchmark 上,这种保守策略也许影响不大,但在需要极限压榨的长链任务上,体感就是实打实的降智。
哦对了,最后一个彩蛋。
这份报告的对齐章节写完之后,Anthropic担心自己写得不够诚实,于是授权一个Claude实例读取公司内部Slack的讨论记录,来审查报告有没有粉饰。。
查AI有没有摸鱼的报告,最后的审稿人也是AI。
至于它审稿的时候内心有没有喊累——这个,报告里可没写。


参考文献
[1] Claude Fable 5 / Mythos 5 系统卡(2.3.7.1 评测重跑,第 49–51 页;6.4.1 NLA 可解释性发现,第 163–171 页;6.1.3 Claude 审查报告): https://www-cdn.anthropic.com/d00db56fa754a1b115b6dd7cb2e3c342ee809620.pdf
[2] OpenAI 承认 GPT-4「变懒」(2023.12): https://www.zhihu.com/question/634074112
[3] Anthropic 三起基础设施事故复盘(2025.9): https://www.anthropic.com/engineering/a-postmortem-of-three-recent-issues
[4] Anthropic 解释 Claude Code 性能下滑(2026.4): https://fortune.com/2026/04/24/anthropic-engineering-missteps-claude-code-performance-decline-user-backlash/
[5] 原始讨论帖: https://linux.do/t/topic/2364721