OpenAI 发布新模型 GPT-Live:听说一体


AI 终于不抢话了

今天凌晨,OpenAI 发布了 GPT-Live:新一代语音模型,并从今天起成为 ChatGPT 的默认语音模式

官方博客:openai.com/index/introducing-gpt-live

至于进步点,大概如下:

之前版本的问题

早在 2023 年,ChatGPT 就推出了语音模式,这其实是仨模型的接力:一个负责语音转文字,一个负责写回复,一个负责朗读,所以声音总是又慢又僵

2024 年的高级语音模式(Advanced Voice Mode)把三步并成一个模型,直接处理音频,快了不少。但它是轮流制,你说一轮,它说一轮,靠工程方法判定回复时间(比如检测你多久没说话)

这东西最大的体感,就是我在说话的时候,说着想一想,然后呢,他就开始回复了,就让我很头疼

真正的听说同步

GPT-Live 的第一个改动是全双工,能做到一直输入,随时输出,其背后的原理是每秒做很多次决策:开口,继续听,停下,插话,还是调工具(顺手还解决了实时翻译问题)

在闲聊模式下,这里也放个音频 demo,可与之前的进行对比

前台聊天,后台干活

这个模型(如果能被称之为模型的话)的第二个改动,是把「聊天」和「干活」解耦,如果遇到需要搜索、推理、多步执行的问题,GPT-Live 把任务委托给 GPT-5.5,自己继续跟你忽悠拖时间,等后台结果出来了在播放

这里的解耦,也是为了之后的升级,比如以后出了新模型,语音也不用重新训练,不用再等文本模型「降级适配」,以期适配更 Agent 的任务

跑分

盲测里,5 到 10 分钟的真实对话,GPT-Live-1 和 mini 在偏好度、接话、打断、流畅度、自然度上全面强于高级语音模式

GPQA(研究生级科学题)、BrowseComp(刁钻信息检索)、τ³-Voice Telecom(多轮电信客服任务)三项也都是明显领先

档位说明:Instant 档和 mini 背后是 GPT-5.5 Instant,Medium 和 High 档背后是 GPT-5.5 Thinking,推理力度对应中和高

在哪用

今天开始,这个东西已经能在 ChatGPT 里用了,iOS、Android、网页都有

付费用户默认给 GPT-Live-1,免费用户默认 mini,但暂时不支持视频通话和屏幕共享

API 目前还没有,但可以填表单登记,上线了会通知

→ API 登记表单:https://openai.com/form/gpt-live-1-in-the-api/

            预览时标签不可点