阅读预计 9 分钟
昨天,横冲直撞的匿名模型 Ox-Alpha,终于被认领了。
不是谷歌,也不是哪个突然冒出来的海外团队。它是智谱的 GLM-5.3-Flash。
过去一周,没有发布会,没有模型卡,厂商那一栏就写着stealth。上线不到一天,它同时登顶了 OpenRouter 和 OpenCode 两个调用量榜,创下了 OpenRouter 的模型发布纪录,终结了 DeepSeek 连续 56 天霸榜的纪录。烧掉 62T token。
Hermes Agent创始人直接称,「This model is slaughtering all our internal benchmarks. What the actual fuck is it??」
(这个模型正在屠杀我们所有的内部基准。这到底是怎么回事?!)
全网开猜。火到 Gemini 穿着马甲来蹭,还有截图起哄说它疑似大幅超过 Fable 5。
现在,谜底揭晓。
Ox-Alpha,就是智谱 GLM-5.3-Flash。
这是 GLM 首个原生多模态模型,支持1M上下文,主攻 Coding 和 Agent,上线即以 MIT 协议开源。
先别被Flash这个起名带偏,并没有能力降一档,而是直接进入顶级模型第一梯队,从榜单成绩看,明显强于 DeepSeek V4,能力对标 Claude Opus 4.8,价格只有后者的1/40。
◈一、真正的杀招:一条新的价格斩杀线
看这篇之前的老读者知道,两周前我刚写过一篇:DeepSeek 8月17日涨价,开始分高峰/闲时计费。
当时我的原话是,「地板价的说法,以后不太好意思讲了」。
结果这周,智谱直接把地板拆走了。。
牛来国内定价,每百万Token输入0.4 元,输出1.4元。比DeepSeek的闲时价格还要低!
GLM-5.3-Flash 全时段的优惠价格只有 DeepSeek V4 Flash 闲时价的30%!!
什么叫斩杀线?
DeepSeek 精心设计了分时定价,闲时价是留给你半夜薅的底价。
GLM-5.3-Flash 的五折价,全时段低于它的闲时价。即使五折结束回到正价(输入 0.8、输出 2.8),价格依然比 DeepSeek 的闲时价低。
这张新的模型斩杀线更加直观、震撼。
五折价格下,GLM-5.3-Flash 几乎斩杀了一切模型。楼上尚未被斩杀的,都是贵出成百上千倍的顶模了,这波牛模王当之无愧。
当然,价格是入场券,干活儿好不好才是留下来的理由。
官宣之后,我第一时间把GLM-5.3-Flash大模型,接入Zcode进行测试。
◈二、复杂3D空间建模能力
第一个任务,我直接把复杂度拉满。
我要求GLM-5.3-Flash 根据真实的城市建筑公开数据,把从北京北站到北五环的京张铁路遗址公园沿线约 11.4 平方公里临时推定范围,做成一座微缩 3D 城市。
这个任务数据特别杂。建筑、道路、铁路、水系、公共空间和 POI,各自数据泥沙俱下,来源还各不相同。
这非常考验模型的数据预处理能力。但牛来把这些来源不一的数据逐项清洗、筛选并转换到统一坐标系,最终成功接进了同一套可检查的 3D 城市沙盘。
最后,它实际处理并放进页面的,包括 4522 栋建筑、2489 条道路、106 条铁路、23 个水系要素,以及 1077 个现状 POI。
京张铁路遗址公园沿线 3D 城市总览
在真实数据里,每个建筑都标注了明确的高度和经纬度。
我在搜索框里输入「北京北」,页面给出真实候选;点下「北京北站」,镜头沿着铁路沙盘飞过去,对应建筑变成金色,定位标记和属性面板一起出现。
输入“北京北”后出现真实候选
它真能搜,真能跳转,真能点建筑,也真能查数据来源。
我仔细对比了各个地标,和真实遥感卫星拍摄的地图相差无几。真的无敌了。
这一项最能看出它的 Agent 能力。因为要完成的不是「写一个前端」,而是一整条链。筛数据,做坐标转换,构建 3D 场景。
中间任何一环偷懒,最后都会变成一座看起来很酷、一点击就露馅的空城。
3D 城市检验的是模型能不能把一条复杂数据链做完整,接着,我测试了牛来的原生多模态能力。
◈三、原生多模态能力
我给了它两张喀斯特地貌照片和一段接近一分钟的视频,要求它根据素材做一个博物馆风格的教学网站,演示喀斯特地貌是怎么形成的。
模型需要看懂图片和视频,提炼地质变化过程,再写成能交互的模拟。
GLM-5.3-Flash 先分别解释了三份素材,然后,它把整个过程拆成六个阶段:酸性雨水形成、雨水进入裂缝、裂缝逐渐扩宽、落水洞和地下河出现、洞穴继续扩大,最后形成钟乳石和石笋。
GLM-5.3-Flash生成的喀斯特地貌完整过程
同一个场景里的连续变化,模型都处理地没有失误。
页面还提供了降雨量、裂隙数量、岩石可溶性和地下水位几个参数,可以自由调节。
到这里,喀斯特 Case 验证的已经不只是“模型看懂了画面”。它还抓住了降雨、裂隙、地下水和洞穴之间的变化关系,并把这些关系写进了交互。
但把视频信息变成页面,只是第一关。我还想知道,它能不能直接进入时间轴,重新组织人物、声音、镜头和字幕。
于是,我把测试从「看懂视频」推到了「直接剪视频」。
我准备了两个难点完全不同的剪辑活。
第一个,给它一段多人对谈视频。
要求先识别不同说话人,再做「人物底色固定 + 当前词卡拉 OK 高亮」的双层字幕。每个人一个固定底色,读到哪个词,哪个词从低亮度平滑过渡到高亮。 配色限定青蓝、暖黄、珊瑚红和白色的高对比组合;主讲人、主持人和短暂插话的人要分开算,背景音乐、掌声和环境人声不许单列成说话人。 字幕必须基于剪辑后的最终时间轴重新对齐,不许沿用源视频的旧时间戳。
现在,很多自动字幕工具经常在里卡住。片子一剪,时间轴就全错位了,最后还需要人工一点点对齐。
但原生多模态的牛模王,稳稳接住了。
我回看执行记录时才发现,它不是凭声音猜人名。有位说话人的名签只在画面里闪过一瞬,它把那一帧单独截了下来,再用名签确认身份。
成片的字幕落在画面安全区,带描边和底板,复杂背景下也能看清,剪辑点听起来是自然的。
第二个,我把电影《神话》完整片源交给它,要求剪成一条中文解说视频。
请将这部完整电影剪辑成一条中文电影解说视频,梳理主线剧情和人物关系,突出关键冲突与情绪转折,确保解说内容与原片一致,并生成配音和中文字幕。
看完一整部电影,再把它重新讲一遍。
成片一开场就能把人带进剧情,主线清楚,人物关系和关键转折也交代得明白。
剪辑节奏稳,镜头衔接自然,没有明显的乱跳,已经很接近一条可以直接发布的电影解说视频。
一个 Flash 档的模型,把「长视频理解 → 时间轴重构 → 配音字幕合成」这条链一次跑通。
这我可真没想到,太强了。一整个核弹爆炸。下一项,我测了一个复刻网站的任务。
◈四、Coding 和 Agent 能力
这个任务只给模型一段网页录屏。让模型根据视频中的网页内容,复刻这个网页。
原片是一个黑底创意工作室页面,首屏字标、两侧悬浮画廊、底部胶囊导航,以及滚动中的文字和图片,前端逻辑相当复杂。
以下只按两段录屏里实际出现的画面做对照。
仔细看还有一些细节瑕疵,不能说100%复刻,80%的完成度做到了。前提是这是一个视觉和交互都很复杂的网站。
不过,复刻网站最容易制造一种「已经做完」的错觉:首屏颜色、卡片和按钮都很像,真正点起来,上传、算法和导出却可能一个都没做。
如果没有把验收要求写清楚,模型往往会先把最省事的表面功能做出来。
所以下一个任务,我让5.3做了一个有前端和后端的工具。
这个工具是一个图片风格处理工具,有产品前端UI、前后端交互逻辑。
参考资料只有两张界面、一段 9.8 秒的操作视频,以及四张样例图。上传、选算法、调参数、导出,这套流程得由它自己做出来。要求模型不能照搬原站品牌,不能调用生成式图片 API,更不能拿 CSS 滤镜糊弄。
牛来没有停在界面复刻上,它真的把六种像素算法真正写进了 Canvas,做了六套调色板,以及分辨率、阈值、对比度、反相等参数。拖动参数时页面不卡死,相同输入和参数也会稳定得到同一个结果。
载入样例图后切换算法与调色板、调整参数,并导出当前结果
最后,这套工具真的能从本地上传图片,实时切算法、换调色板、调参数,再把处理结果导出成 PNG。
虽然没有 3D 城市那么震撼,但反而是四个任务里产品完成度最高的一个。
这个 Case 我想说明的是这个模型不止会“复刻网页”,还能从还原产品逻辑,再把算法、交互和导出一起做成可用工具。
最后一个任务,我让它根据图片做游戏。
我交给GLM-5.3-Flash 四张图片,一头牛来、一只小鸭、一只猫,和一个浮岛搭桥的场景。
玩法是,把有限的桥块拖进浮岛之间的空位,路线连通后,牛来沿桥走过去找小鸭。
一共三关,后面加入 L 形桥、T 形桥和一个简单分岔。
第一关直桥连通、黄牛过桥
第二关转角桥补齐路线
这个任务看起来很萌,实际特别容易翻车。
3D 场景、拖拽命中、关卡状态、连通判断、手机触摸、角色移动和庆祝动画,任何一环有问题,游戏就玩不了。
任务跑完,再看「Opus 4.8 能力、1/40 价格」,我由衷感觉震惊。
这些任务旗舰模型当然也能干,但GLM-5.3-Flash,实在是太太太便宜了。
这种性价比给人的震撼程度,真的不亚于Fabel 5开源。
因为模型越贵,我就越不舍得改它们生成的产物。
用着GLM-5.3-Flash,代码错了,我敢让它继续修;界面不够好,我敢让它再跑很多很多轮。
我再也不会因为心疼 Token,我只会让GLM-5.3-Flash带着问题交付。
这可能才是「牛来」这个名字最贴脸的地方:
干的是重活。吃的草,是真的少。
当然,这个价格也不是靠补贴硬砸出来的。
GLM-5.3-Flash 用了一套线性注意力加稀疏注意力的混合架构。
就是近处的信息用成本更低的方式持续处理,真的需要回看长上下文时,再把相关部分找回来。
按官方口径,相比 GLM-5.3,它的注意力计算量降低了 3.01 倍,KV 缓存缩小了 4.44 倍。算得少,显存占得少,价格才有底气一路往下打。
这是结构性的便宜。
还有一件事,很重要。Ox-Alpha 在 OpenCode 和 OpenRouter 上收到的真实请求,全部由国产芯片承载!
过去聊国产卡,问题常停在能不能跑、兼不兼容。
这一次,它是在没人知道模型身份的情况下接住全球开发者的真实流量,并成为当周最受欢迎的模型。
最后附一下目前免费使用的方式:
OpenRouter:
https://openrouter.ai/stealth/ox-alpha
OpenCode:打开终端后依次输入 opencode、/models,搜索 Ox Alpha Free。
目前模型免费开放,支持 1M 上下文和多模态。
欢迎评论区讨论。