科技界新动向:OpenAI升级语音模型
在科技新闻的前沿,OpenAI于7月9日宣布了一项重大的更新,推出了他们的新一代语音模型GPT-Live。这一更新标志着用户与AI之间的对话体验迈入了一个更为真实的交流阶段。
语音交互一直是OpenAI面临的技术挑战之一。早期的语音模型依赖于ASR语音识别、LLM文本推理和TTS语音合成的三段式处理流程,这不仅延迟严重,而且容易在语音与文本转换过程中丢失关键信息,如语调、情绪和背景噪声。此外,这些模型无法生成情感表达,如笑声或歌声,导致交互显得机械而割裂。
2024年5月,OpenAI发布了GPT-4o,试图通过端到端的统一模型来替代传统的三段式处理流程,以此减少延迟时间。然而,用户体验的稳定性和覆盖面与预期仍有差距。GPT-Live的发布正是在GPT-4o的基础上进行的一次系统性升级。
GPT-Live的主要优势在于其全双工架构,这意味着产品能够同时进行听和说的操作。在对话过程中,GPT-Live能够通过简单的回应,如“嗯嗯”或“是啊”,来显示其正在专注倾听,或者在用户需要时间思考时保持沉默,从而提升语音交互体验。
据OpenAI称,GPT-Live是公司迄今为止最先进的语音模型。对于需要进行网络搜索、深入推理或复杂任务的问题,GPT-Live能够在后台调用最新的GPT-5.5模型,同时保持对话的连贯性。
随着AI交互对话和硬件落地需求的增长,流畅、准确的AI语音对话成为了模型产品的必备能力。ChatGPT语音功能的产品负责人阿蒂·埃莱蒂(Atty Eleti)表示,他曾在散步时与该语音功能进行了长达30至40分钟的对话。
目前,已有超过1.5亿人通过语音和听写功能与ChatGPT互动。埃莱蒂预测,随着时间的推移,语音将成为计算的主要交互方式,并用于管理复杂、长期的智能体任务。开发者已经开始利用Codex和ChatGPT实现重要的应用案例,语音有望成为各类工作的交互界面。
在OpenAI更新之前,谷歌和字节跳动豆包代表了行业实时交互体验的标杆,两者都可以直接与AI产品进行实时语音对话。尽管两者提供了相似的体验,但他们的技术路线各有特点。谷歌Gemini Live基于统一的Gemini多模态基座Gemini 3.1 Flash Live,没有独立的专用语音模型,而是音频、视频、图像、文本共用一套模型权重,配合谷歌自研TPU集群进行流式推理加速;豆包语音底座则是字节跳动Seed团队自研的Seeduplex原生全双工端到端语音专用模型。
GPT-Live的加入使得三者的产品体验和技术水平各有特色,共同证明了语音已成为AI的核心流量入口,并承载着用户增长、硬件落地、商业化变现等平台需求。尽管产品体验逐渐趋同,技术路线的多样化表明语音交互技术尚未达到单一最优解。
有用户在GPT-Live发布留言区表示:“我终于可以把OpenAI推荐给我奶奶用了。”这表明OpenAI在C端语音交互体验上正逐渐向“海外版豆包”靠拢,与谷歌的实时对话能力相匹配。未来,B端智能体开发等场景的语音交互完善,将成为观察其营收新增长点的关键。