OpenAI 发布新模型 GPT-Live:听说一体
- 公众号:赛博禅心
- 发布时间:2026-07-09T01:51:56+08:00
- 微信链接:https://mp.weixin.qq.com/s/TUvqoxx5iZrYrtjqQj3U8Q
- RSS ID:3934419561-2247518549_1
- Feed ID:MP_WXS_3934419561
- Glance 当前首页可见:是
AI 终于不抢话了
今天凌晨,OpenAI 发布了 GPT-Live:新一代语音模型,并从今天起成为 ChatGPT 的默认语音模式
官方博客:openai.com/index/introducing-gpt-live
至于进步点,大概如下:
之前版本的问题
早在 2023 年,ChatGPT 就推出了语音模式,这其实是仨模型的接力:一个负责语音转文字,一个负责写回复,一个负责朗读,所以声音总是又慢又僵
2024 年的高级语音模式(Advanced Voice Mode)把三步并成一个模型,直接处理音频,快了不少。但它是轮流制,你说一轮,它说一轮,靠工程方法判定回复时间(比如检测你多久没说话)
这东西最大的体感,就是我在说话的时候,说着想一想,然后呢,他就开始回复了,就让我很头疼
真正的听说同步
GPT-Live 的第一个改动是全双工,能做到一直输入,随时输出,其背后的原理是每秒做很多次决策:开口,继续听,停下,插话,还是调工具(顺手还解决了实时翻译问题)
在闲聊模式下,这里也放个音频 demo,可与之前的进行对比
前台聊天,后台干活
这个模型(如果能被称之为模型的话)的第二个改动,是把「聊天」和「干活」解耦,如果遇到需要搜索、推理、多步执行的问题,GPT-Live 把任务委托给 GPT-5.5,自己继续跟你忽悠拖时间,等后台结果出来了在播放
这里的解耦,也是为了之后的升级,比如以后出了新模型,语音也不用重新训练,不用再等文本模型「降级适配」,以期适配更 Agent 的任务
跑分
盲测里,5 到 10 分钟的真实对话,GPT-Live-1 和 mini 在偏好度、接话、打断、流畅度、自然度上全面强于高级语音模式
GPQA(研究生级科学题)、BrowseComp(刁钻信息检索)、τ³-Voice Telecom(多轮电信客服任务)三项也都是明显领先
档位说明:Instant 档和 mini 背后是 GPT-5.5 Instant,Medium 和 High 档背后是 GPT-5.5 Thinking,推理力度对应中和高
在哪用
今天开始,这个东西已经能在 ChatGPT 里用了,iOS、Android、网页都有
付费用户默认给 GPT-Live-1,免费用户默认 mini,但暂时不支持视频通话和屏幕共享
API 目前还没有,但可以填表单登记,上线了会通知
→ API 登记表单:https://openai.com/form/gpt-live-1-in-the-api/
预览时标签不可点