Gemini 3.8 Live · 实时语音 · WebSocket

Gemini 3.8 Live API:实时语音 Agent、Extended Thinking 与迁移指南

Google 于 2026 年 9 月 15 日将 Gemini 3.8 Live 稳定版用于低延迟语音 Agent,并提供独立的 Extended Thinking 型号处理需要后台推理的复杂实时任务。本文只使用 Google 官方资料;本站控制台是否开放这两个模型仍需单独核验。

发布日期:2026-09-19·官方资料核对:2026-09-19
标准型号gemini-3.8-live
推理型号Extended Thinking
协议Stateful WebSocket
本站状态尚未核验开放

1. Gemini 3.8 Live 是什么

Gemini 3.8 Live 面向连续音频、图片、视频和文本流,输出文本或语音。Google 将标准型号定位为大多数低延迟语音 Agent 和实时对话的默认选择:模型可以边接收音频边响应,支持用户插话、异步函数调用、搜索工具和输入/输出转录。

Gemini 3.8 Live Extended Thinking 则把后台推理放进实时会话。它适合边说边调用工具、需要多步决策或等待外部系统结果的场景,但客户端必须正确处理“语音一轮结束后,后台任务仍可能继续”的状态。

2. gemini-3.8-live 与 Extended Thinking 怎么选

维度gemini-3.8-livegemini-3.8-live-extended-thinking
主要意图低延迟实时语音对话实时语音中的复杂多步推理
思考配置不支持 thinking_level支持 low / medium / high
函数调用默认异步,也可兼容阻塞模式仅支持 NON_BLOCKING 异步模式
状态判断按音频与工具事件推进必须继续监听 interaction_status
适合场景客服、陪练、实时翻译、语音助手诊断助手、复杂业务流程、工具密集 Agent

不要仅因为 Extended Thinking 名称更“高级”就默认使用。实时语音的关键指标包括首音频响应时间、插话恢复、工具调用完成率和每分钟成本;高推理档位可能增加处理与输出消耗。

3. 官方规格与价格

项目Google 官方信息
输入文本、图片、音频、视频
输出文本、音频
输入窗口131,072 tokens
最大输出65,536 tokens
协议有状态 WebSocket(WSS)
音频输入参考价$3 / 百万 tokens,约 $0.005/分钟
音频输出参考价$12 / 百万 tokens,约 $0.018/分钟
文本输入/输出$0.75 / $4.50 每百万 tokens
图片/视频输入$1 / 百万 tokens,约 $0.002/分钟

这些是 Google Developer API 的官方参考价格,不是本站价格,也不代表一次通话只产生音频费用。文本上下文、图片/视频帧、搜索查询和工具结果可能分别计费;应按完整会话流水核算。

4. 实时语音 Agent 的连接架构

Live API 使用有状态 WebSocket。服务端方案由浏览器或 App 把音频发给你的后端,再由后端连接 Google;客户端直连方案延迟更低,但不能把长期 API Key 放进前端。Google 建议生产环境使用短期 ephemeral token。

  1. 采集 16-bit PCM、16 kHz 小端音频,并按实时节奏发送。
  2. 建立 WSS 会话,配置模型、输出音频和工具声明。
  3. 持续消费音频帧、工具调用、转录和状态消息。
  4. 支持 barge-in:用户开始说话时,中断当前模型输出。
  5. 会话结束后记录持续时间、工具调用、搜索次数和 token 用量。

视频帧会进入上下文和成本。Google 说明 3.8 Live 默认的 turn coverage 包含视频活动,因此没有视觉需求时不要持续上传摄像头帧。

5. 从 Gemini 3.1 Flash Live Preview 迁移

gemini-3.1-flash-live-preview 迁移不能只换模型名。标准 3.8 Live 不接受 thinking_levelthinking_config;异步函数调用变为默认;主动音频永久开启,显式设置 proactive_audio: false 会报错;旧的 affective dialogue 配置已移除。

  1. 把模型 ID 改为 gemini-3.8-live
  2. 删除标准型号上的 thinking 配置。
  3. 核对工具是否需要 NON_BLOCKING;只有标准型号还能显式使用 BLOCKING。
  4. 删除 enable_affective_dialog
  5. 正确处理 send_client_contentturn_complete,后者会中断正在生成的内容。
  6. 若切换 Extended Thinking,用 interaction_status=IDLE 判断真正完成,不能只看 turnComplete

6. 上线前的可复核测试

实时模型不能只用普通聊天接口的“回答是否正确”来验收。建议准备固定的 20 段脱敏音频,覆盖打断、噪声、口音、数字、专有名词和工具调用,并记录:

  • 首次收到音频响应的时间;
  • 用户插话后停止播放与恢复的时间;
  • 输入和输出转录是否一致;
  • 异步工具是否重复调用或漏调用;
  • 整段会话的 token、搜索和音频费用;
  • 网络断开后的重连、状态恢复和幂等行为。

截至 2026 年 9 月 19 日,本站现有公开模型页覆盖 Gemini 3.8 Flash,但本文没有证据证明本站控制台已经开放 Gemini 3.8 Live。实际接入前应先检查控制台模型列表与协议支持。

7. 常见问题

Gemini 3.8 Live 和 Gemini 3.8 Flash 是一个模型吗?

不是。Flash 主要走生成内容接口;Live 是面向实时音频/视频会话的独立模型与 WebSocket 协议。

Extended Thinking 一定更好吗?

不一定。它适合复杂多步任务,但状态管理更复杂,也可能增加消耗。普通低延迟对话优先从标准 Live 开始。

可以把 Google API Key 写在网页里吗?

不应这样做。客户端直连生产环境应使用短期 token,或通过自己的后端代理连接。

本站现在能调用 Gemini 3.8 Live 吗?

本文尚未完成本站控制台可用性核验。模型 ID、协议与费用均先按 Google 官方资料说明,本站是否开放以控制台为准。

官方来源:Gemini 3.8 Live 模型页Extended Thinking 模型页Live API 指南官方价格页。核对日期:2026-09-19。