1. Grok Voice Transcribe 2.0 是什么
Grok Voice Transcribe 2.0 是 xAI 的第二代专用 Speech-to-Text 模型。官方发布说明称它在相同价格下提升了真实环境音频的识别准确率,重点覆盖电话线路、多人对话、本地口音、数字、邮箱地址和多语言短指令。
准确率数字与排行榜来自 xAI 和其引用的第三方评测,不应直接当作你的生产成功率。中文客服、粤语夹杂、行业术语和窄带电话都需要用自己的脱敏音频单独测试。
2. 主要功能与限制
| 能力 | 官方支持 | 实施注意 |
|---|---|---|
| 批量与流式 | 文件/URL、WebSocket | 两种模式价格不同 |
| 词级时间戳 | start / end / confidence | 用于字幕与检索切片 |
| 说话人分离 | diarize=true | 多人重叠语音仍需实测 |
| 多声道 | 最多 8 声道 | 客服与客户分轨优于事后猜测 |
| 关键词偏置 | 最多 100 个术语 | 适合产品名、药名和专有名词 |
| 文本格式化 | 数字、日期、货币、电话和邮箱 | 需要设置语言并开启 format |
| 填充词 | 默认移除,可选择保留 | 法律取证或质检需明确策略 |
批量文件上限为 500 MB,支持常见 WAV、MP3、OGG、Opus、FLAC、AAC、MP4、M4A 和 MKV,以及需要声明采样率的 PCM、µ-law、A-law 原始音频。
3. 批量语音转文字 API
xAI 官方批量端点是 POST https://api.x.ai/v1/stt,请求使用 multipart/form-data,必须提供 file 或 url。官方特别说明:上传文件字段应放在其他表单参数之后,否则流式 multipart 实现可能忽略后续字段。
curl -X POST https://api.x.ai/v1/stt \
-H "Authorization: Bearer $XAI_API_KEY" \
-F model=grok-voice-transcribe-2.0 \
-F format=true \
-F language=zh \
-F "keyterm=产品名称" \
-F file=@meeting.mp3响应包含完整文本、自动检测语言、音频时长和词级时间戳。开启说话人分离后,词项还会包含 speaker;开启多声道时,结果按 channels 数组返回。
4. WebSocket 实时流式转写
实时端点为 wss://api.x.ai/v1/stt。音频作为二进制 WebSocket 帧发送,不需要 base64;配置通过 URL 查询参数完成。客户端应等到 transcript.created 后再发送音频,并处理 partial、done 和 error 事件。
wss://api.x.ai/v1/stt?
model=grok-voice-transcribe-2.0&
sample_rate=16000&
encoding=pcm&
interim_results=true&
smart_turn=0.7&
smart_turn_timeout=3000interim_results=true 会约每 500 ms 返回可能变化的临时文本;is_final=true 表示文本片段已经锁定;speech_final=true 才表示本次话语结束。Smart Turn 用模型判断沉默是否真的是轮次结束,适合数字听写和用户思考停顿。
不要在浏览器或移动端暴露长期 xAI API Key。官方文档要求通过自己的后端代理 WebSocket。网络层还要处理心跳、断线、重复片段和最终 transcript.done 未到达的情况。
5. 官方价格和从 1.0 迁移
xAI 公布的价格为批量转写每小时音频 $0.10,流式转写每小时 $0.20;说话人分离、时间戳和关键词功能包含在价格内。价格与 1.0 相同,但最终账单仍应以 xAI Console 为准。
xAI 表示 2.0 将很快成为 Speech-to-Text API 默认模型,1.0 会在接下来数周弃用。已有接口无需代码变化就能获得默认模型升级,但生产系统不应该依赖这种静默切换:
- 把现有模型显式固定为
grok-voice-transcribe-1.0,保留回滚窗口。 - 用相同音频分别跑 1.0 和 2.0,比较词错误、时间戳、说话人和格式化结果。
- 通过后再将配置改为
grok-voice-transcribe-2.0。 - 保留每次请求的模型 ID、音频时长、参数和账单。
- 确认回滚完成后,再移除 1.0 依赖。
6. 上线前测试清单
建议至少准备四类脱敏音频:8 kHz 电话、多人会议、包含数字/邮箱的客服录音、多语言短指令。每类同时测试批量和流式模式,记录词错误、漏字、说话人切分、最终事件延迟与费用。
- 关键词偏置不能替代真实发音测试;
- 较低 VAD 阈值可能识别安静语音,也可能把噪声写成文字;
- Opus 流式必须保证一个 WebSocket 帧只含一个完整 Opus packet;
- 多声道客服录音优先按 channel 分轨,不要同时依赖 diarization 猜测;
- 字幕系统要区分临时文本、片段 final 和整句 speech_final。
截至 2026 年 9 月 19 日,本站公开模型目录没有可核验的 Grok Voice Transcribe 2.0 条目。本文介绍的是 xAI 官方 API,不代表本站现有 OpenAI 兼容 Base URL 已支持 /v1/stt。
7. 常见问题
Grok Voice Transcribe 2.0 是 Grok 4.6 的升级吗?
不是。2.0 是专用语音转文字模型;Grok 4.6 是通用文本/多模态旗舰。
不填写 model 会怎样?
xAI 当前文档称 2.0 是默认值,但生产环境仍应显式填写模型 ID,避免默认模型变化造成不可追溯的结果差异。
批量和流式该怎么选?
已有文件、会议归档和视频字幕选批量;客服、实时字幕和语音 Agent 选流式。
本站可以直接调用这个模型吗?
尚未核验。本文代码使用 xAI 官方端点;本站控制台是否开放 STT 需要另行确认。
官方来源:xAI 2026-09-18 发布说明与xAI Speech-to-Text 文档。核对日期:2026-09-19。