OpenAI放出GPT-Live,背后是GPT5.5,实时语音有点恐怖了
OpenAI放出GPT-Live,背后是GPT5.5,实时语音有点恐怖了

OpenAI放出GPT-Live,背后是GPT5.5,实时语音有点恐怖了

阅读预计 5 分钟

本文转载自OpenAI放出GPT-Live,背后是GPT5.5,实时语音有点恐怖了

想象一个场景。

你下班走在路上,随口跟手机说:“帮我查一下的航班会不会延误,顺便看看公司附近有没有能坐一小时的咖啡店。”

Siri、小爱大概率会沉默三秒,然后开始念一段网页摘要。再不然就是——抱歉,我暂时还做不到。

今天,OpenAI正式发布了GPT-Live,这个事情以后可能要被颠覆了。

大家普遍的风评是“像真人一样说话”、“同声传译要失业了”……。

但说实话,这些都是GPT-Live 最表层的东西。

这模型最牛的是——

它把自己变成了一个“前台”。真正干活的,是后面的 GPT-5.5。

要理解这件事为什么重要,得从语音AI的一个老矛盾说起。

要快,还是要聪明?

过去几年,不管是Siri、Alexa还是ChatGPT Voice,都卡在这一个点上。

快,意味着模型要小、推理要轻,这样延迟才低。但小模型能力有限,稍微复杂一点的问题就答不好。

聪明,意味着要用大模型,但大模型推理慢,对话体验直接崩掉。

所以之前的语音AI基本只能二选一:要么像Siri一样反应快但蠢,要么像旧版ChatGPT Voice一样虽然聪明,但经常沉默到让人尴尬。

而GPT-Live的解法是把这两件事拆开。

前台是GPT-Live。一个专门为实时对话优化的模型,反应快、延迟低。你说话的时候它在听,你停下来它知道该接,你打断它它不会硬着头皮念完。

后台是GPT-5.5。当对话中出现需要搜索、深度推理、数学计算、或者复杂任务的时候,GPT-Live就会把问题打包丢给后台的GPT-5.5。

GPT-5.5在后面跑完把结果传回来,GPT-Live再用自然语言说给你听。

更细的分级是,如果你用的是Instant或mini模式,后台跑的就是GPT-5.5 Instant;如果用Medium或High模式,后台跑的就是GPT-5.5 Thinking。

OpenAI把这个叫委派(delegate),在官方评测中,比起上一代语音模式,GPT-Live的对话流畅度从3.80分跳到了4.96分(满分 7 分)。

一个拿到内测的开发者表示,自己在散步时跟GPT-Live连续聊了一个小时,它会先接着聊,后台默默把答案跑出来。

官方演示里,主角把GPT-Live当搜索引擎使,一会儿问天气一会儿考实时信息流,问东问西的,查到的信息全部真实有效。

这个架构带来的体验优化很大。不过,产品层面还有不少坑要填。

好架构,粗手艺

首先,GPT-Live上线时不支持视频和屏幕共享。你不能举着手机让它看你面前的东西——至少目前不行。

其次,它暂时不面向B端用户,也不支持桌面端App、Codex和自定义GPT。而且,API的定价都还没有公布。

不过,参考上代gpt音频模型输入价格,是在每百万token 32美元、输出64美元,mini版便宜一些(10 和 20 美元)。

而且根据既往经验,语音API的价格还不止这些。模型说出口后,哪怕被打断的对话也会产生费用,连续打断几次就会成本会爆。

总体看,真的不便宜。

还有一个槽点就是GPT-Live学会了“嗯嗯”、“对”这种垫话,但有时候会过于主动地打断用户。

赛道里的其他人,在拼什么?

GPT-Live选的这条路,在当前语音AI赛道里是比较独特的。

把几家主要玩家拉出来看,大家押注的方向很不一样。

先看国内。

字节豆包4月上线了全双工语音模型Seeduplex,这是国内第一个规模化落地的全双工语音模型。它解决的核心问题也是——边听边说、不抢话、不误打断。

但豆包目前的重心还是在“对话体验”层面,可以和AI共享屏幕,打视频,但没有像GPT-Live那样明确打出后台委派强模型的牌。

MiniMax1月发布了 MiniMax Speech 2.8,主打TTS和声音克隆。这个模型专门补了真人说话里的小瑕疵,比如 “um”“ah”、呼吸、停顿、清嗓子等这些语气标签。

用户给一段10秒参考音频,它就能做声音克隆,还强调更干净的录音棚级输出。

价格上,speech-2.8-turbo是60 美元/百万字符,speech-2.8-hd是100美元/百万字符。更像是内容生产工具,适合有声书、短视频配音、AI 角色、客服播报。

面壁智能4月发布了MiniCPM-o 4.5,走的是全模态全双工路线,端侧开源小钢炮。它可以在同一条时间轴上同时处理视觉、环境音频和输出流。简单说,就是边看、边听、边说。

比GPT还要全能,而且——开源免费。

语音生成侧,面壁还有 VoxCPM2,支持30种语言和9种中文方言,可以做音色设计、可控声音克隆,原生输出48kHz音频。这个方向和小米有点像,都在做更便宜、更轻、更可部署的语音底座。

小米7月上线了 MiMo-V2.5-TTS Series + ASR。其中MiMo-V2.5-ASR主打语音识别,支持中英双语、粤语/吴语/闽南语/四川话等方言、强噪音、多说话人、歌词识别和原生标点。按音频转写时长计费,0.5 元/小时。

再看海外。

Google推的是Gemini 3.1 Flash Live Preview,主打低价多模态。每分钟大概只有0.036美元,比OpenAI上代的gpt-realtime-2.1(输入 32、输出 64 美元)便宜一个数量级。

此外,谷歌还单独出了Gemini 3.5 Live Translate,支持70+语言实时翻译,每分钟输入成本不到1美分,比的就是谁便宜、谁快、谁的语种多。

还有个比较知名的垂类玩家,ElevenLabs。它走的是企业语音Agent路线,核心卖点是极致音色还原、电话/SIP接入、RAG知识库,每分钟通话0.08美元。

拉开来看,语音模型方面大家押注的方向虽然不太一样,但所有人都在押注,语音会成为AI的下一个默认入口。

当说话比打字更自然

OpenAI说,每周有超过1.5亿人在用ChatGPT的语音和听写功能。

当GPT-Live把对话体验做到接近自然、后台又有最强模型兜底的时候,很多人可能会慢慢习惯跟手机说话。

通勤、做饭、开车、跑步、带孩子——这些场景里你腾不出手打字,但你可以说话。GPT-Live赌的就是这些场景。

让前台负责像人,让后台负责有用。这两件事最终能不能在一个产品里平衡好,可能要等几亿用户真正用起来之后才知道。

但回到开头那个场景——你走在路上,随口问了一句航班和咖啡店的事。

以前,这句话会掉进沉默里。现在,至少有一个产品试图让它不掉。