1. Gemini 3.8 Live 是什么
Gemini 3.8 Live 面向连续音频、图片、视频和文本流,输出文本或语音。Google 将标准型号定位为大多数低延迟语音 Agent 和实时对话的默认选择:模型可以边接收音频边响应,支持用户插话、异步函数调用、搜索工具和输入/输出转录。
Gemini 3.8 Live Extended Thinking 则把后台推理放进实时会话。它适合边说边调用工具、需要多步决策或等待外部系统结果的场景,但客户端必须正确处理“语音一轮结束后,后台任务仍可能继续”的状态。
2. gemini-3.8-live 与 Extended Thinking 怎么选
| 维度 | gemini-3.8-live | gemini-3.8-live-extended-thinking |
|---|---|---|
| 主要意图 | 低延迟实时语音对话 | 实时语音中的复杂多步推理 |
| 思考配置 | 不支持 thinking_level | 支持 low / medium / high |
| 函数调用 | 默认异步,也可兼容阻塞模式 | 仅支持 NON_BLOCKING 异步模式 |
| 状态判断 | 按音频与工具事件推进 | 必须继续监听 interaction_status |
| 适合场景 | 客服、陪练、实时翻译、语音助手 | 诊断助手、复杂业务流程、工具密集 Agent |
不要仅因为 Extended Thinking 名称更“高级”就默认使用。实时语音的关键指标包括首音频响应时间、插话恢复、工具调用完成率和每分钟成本;高推理档位可能增加处理与输出消耗。
3. 官方规格与价格
| 项目 | Google 官方信息 |
|---|---|
| 输入 | 文本、图片、音频、视频 |
| 输出 | 文本、音频 |
| 输入窗口 | 131,072 tokens |
| 最大输出 | 65,536 tokens |
| 协议 | 有状态 WebSocket(WSS) |
| 音频输入参考价 | $3 / 百万 tokens,约 $0.005/分钟 |
| 音频输出参考价 | $12 / 百万 tokens,约 $0.018/分钟 |
| 文本输入/输出 | $0.75 / $4.50 每百万 tokens |
| 图片/视频输入 | $1 / 百万 tokens,约 $0.002/分钟 |
这些是 Google Developer API 的官方参考价格,不是本站价格,也不代表一次通话只产生音频费用。文本上下文、图片/视频帧、搜索查询和工具结果可能分别计费;应按完整会话流水核算。
4. 实时语音 Agent 的连接架构
Live API 使用有状态 WebSocket。服务端方案由浏览器或 App 把音频发给你的后端,再由后端连接 Google;客户端直连方案延迟更低,但不能把长期 API Key 放进前端。Google 建议生产环境使用短期 ephemeral token。
- 采集 16-bit PCM、16 kHz 小端音频,并按实时节奏发送。
- 建立 WSS 会话,配置模型、输出音频和工具声明。
- 持续消费音频帧、工具调用、转录和状态消息。
- 支持 barge-in:用户开始说话时,中断当前模型输出。
- 会话结束后记录持续时间、工具调用、搜索次数和 token 用量。
视频帧会进入上下文和成本。Google 说明 3.8 Live 默认的 turn coverage 包含视频活动,因此没有视觉需求时不要持续上传摄像头帧。
5. 从 Gemini 3.1 Flash Live Preview 迁移
从 gemini-3.1-flash-live-preview 迁移不能只换模型名。标准 3.8 Live 不接受 thinking_level 或 thinking_config;异步函数调用变为默认;主动音频永久开启,显式设置 proactive_audio: false 会报错;旧的 affective dialogue 配置已移除。
- 把模型 ID 改为
gemini-3.8-live。 - 删除标准型号上的 thinking 配置。
- 核对工具是否需要 NON_BLOCKING;只有标准型号还能显式使用 BLOCKING。
- 删除
enable_affective_dialog。 - 正确处理
send_client_content与turn_complete,后者会中断正在生成的内容。 - 若切换 Extended Thinking,用
interaction_status=IDLE判断真正完成,不能只看turnComplete。
6. 上线前的可复核测试
实时模型不能只用普通聊天接口的“回答是否正确”来验收。建议准备固定的 20 段脱敏音频,覆盖打断、噪声、口音、数字、专有名词和工具调用,并记录:
- 首次收到音频响应的时间;
- 用户插话后停止播放与恢复的时间;
- 输入和输出转录是否一致;
- 异步工具是否重复调用或漏调用;
- 整段会话的 token、搜索和音频费用;
- 网络断开后的重连、状态恢复和幂等行为。
截至 2026 年 9 月 19 日,本站现有公开模型页覆盖 Gemini 3.8 Flash,但本文没有证据证明本站控制台已经开放 Gemini 3.8 Live。实际接入前应先检查控制台模型列表与协议支持。
7. 常见问题
Gemini 3.8 Live 和 Gemini 3.8 Flash 是一个模型吗?
不是。Flash 主要走生成内容接口;Live 是面向实时音频/视频会话的独立模型与 WebSocket 协议。
Extended Thinking 一定更好吗?
不一定。它适合复杂多步任务,但状态管理更复杂,也可能增加消耗。普通低延迟对话优先从标准 Live 开始。
可以把 Google API Key 写在网页里吗?
不应这样做。客户端直连生产环境应使用短期 token,或通过自己的后端代理连接。
本站现在能调用 Gemini 3.8 Live 吗?
本文尚未完成本站控制台可用性核验。模型 ID、协议与费用均先按 Google 官方资料说明,本站是否开放以控制台为准。
官方来源:Gemini 3.8 Live 模型页、Extended Thinking 模型页、Live API 指南和官方价格页。核对日期:2026-09-19。