跳到主内容
@wquguru
精选88小互模型发布/更新多源精选 ×7

Google发布Gemini 3.8 Live,支持实时语音与多步推理

边想边说的实时语音大模型:

原文
发到 X
推荐理由

Gemini 3.8 Live 实现了实时语音与后台推理的并发协作,这种“边想边说”的多模态交互范式对Agent开发极具参考价值,建议关注其工程落地潜力。

边想边说的实时语音大模型:

Google 发布 Gemini 3.8 Live 与 Extended Thinking 把实时语音推向多步骤推理

基础版本 Gemini 3.8 Live 专注于大规模部署的高性价比。面向高并发、低延迟的日常助理与检索服务。支持在97种语言对话中自动识别并平滑过渡...

兼顾流畅的多模态实时互动(视觉+语音)与极具竞争力的运行成本。

Gemini 3.8 Live Extended Thinking 则主打企业级复杂任务执行。它重点强化了多步骤逻辑推理与规划能力,主要面向客户服务、专业排障、多系统协调等需要深度思考的生产环境

Thinking 版本实现了“实时思考与发音同步”。面对复杂问题时,它会自然地说出“让我查一下…”作为过渡,并在后台执行多步骤任务时同步向用户汇报进度,交流体验就像在与真人通电话。

后台异步工具调用:在调用外部 API、检索数据或订座的同时,前端的语音闲聊完全不中断,实现了真正的并发协作。

近实时多模态视觉理解:模型能一边看着画面一边聊天,例如实时根据员工入职环境答疑、看棋盘下棋,甚至看着草图直接用语音沟通并生成 React 代码。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →