GPT-Live 底层拆解:OpenAI 如何让 95% 的音频帧不再延迟
GPT-Live 底层拆解:OpenAI 如何让 95% 的音频帧不再延迟通过重写 Python、魔改 WebRTC 握手,GPT-Live 让Agent从单向对话进入「实时交互」时代。
来自主题: AI技术研报
9787 点击 2026-08-05 11:04
搜索
通过重写 Python、魔改 WebRTC 握手,GPT-Live 让Agent从单向对话进入「实时交互」时代。
就在刚刚,OpenAI 正式推出了全新一代语音模型 GPT-Live。正如它的名字一样,这一次,ChatGPT 的语音功能彻底「活」了过来。据官方透露,目前每周有超过 1.5 亿人使用 ChatGPT 的语音和听写功能来练习外语、讲睡前故事或在通勤时打发时间。而从今天起,这 1.5 亿人将迎来一次豆包式的进步:
GPT-Live 基于全双工架构构建,也就是说,它可以同时听和说。在对话过程中,GPT-Live 可以用 mhmm 或 yeah 这样的回应表示自己正在听,也可以进行快速来回交流;当你需要一点时间思考时,它也会保持安静。最终带来的,是一种非常轻松自然的语音交互体验。