跳到主内容
@wquguru
精选85小互技巧与观点

OpenAI 复盘:6 个月构建 GPT-Live 实时语音系统

OpenAI 复盘:我们是如何在 6 个月内完成构建 GPT-Live 实时语音系统的

原文
发到 X
推荐理由

做实时语音或 Agent 的同学必看,OpenAI 这次把全双工语音的延迟砍到 1 秒内,异步委托和 WARP 协议都是能直接借鉴的工程实践,赶紧去读原文。

OpenAI 复盘:我们是如何在 6 个月内完成构建 GPT-Live 实时语音系统的

GPT-Live 是OpenAI 最新一代的语音模型,它摒弃了原有的“轮流检测器”,实现了全双工(Full-duplex)——即 AI 可以边听边说,完全模仿真人的对话习惯。

为了做到不到 1 秒的极致超低延迟,OpenAI 在底层技术上做了重磅升级。

“嘴巴”和“大脑”分工合作(异步委托机制):

快路径(前端语音):专门负责“聊天和接话”,把语音数据以极快速度在用户和语音模型间传递。

慢路径(后台大脑):遇到复杂逻辑、搜索或调用工具时,后台会异步请出 GPT-5.5 等超强大模型来思考,思考完再把结果送回语音模型。

重构底层代码与网络传输:

改用 Go 语言:把媒体前端和推理逻辑从 Python 替换为 Go 语言,大大降低了音频数据包的延迟波动。

自定义传输协议 WARP:基于 WebRTC 进行了优化,推出了开源规范 WARP,把原本建立语音连接所需的 6 次网络往返缩减到 1 次(甚至单个 UDP 包就能启动),实现“秒连”。

更详细↓

https://best.xiaohu.ai/article/openai-gpt-live-realtime/

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

关联讨论

同一事件的更多信源

相似阅读

另一事件,读法相近