多模态模型
xAI Grok STT 1.0 STT 1.0
Grok STT系列 · xAI · 2026-07发布
模型介绍
xAI 语音转文字模型,2026-07-23 正式可用,支持约 25 种语言,批量与流式(WebSocket)两种模式,含说话人分离、词级时间戳、数字格式化。
模型基础信息
模型系列Grok STT系列
开发机构xAI
发布时间2026-07
参数规模闭源(未公开)
上下文窗口语音转写(25 语种)
模型类型多模态(语音转文字)
中文能力良好
使用方式网页体验 / API调用
免费额度与收费政策
API 按量
免费规则详情
通过 xAI API 调用,按音频时长计费。
收费标准简介
批量约 $0.10/小时、流式约 $0.20/小时(按音频时长)。
模型能力介绍
✅ 核心优势
- 25 语种支持
- 批量 + 流式双模式
- 说话人分离与词级时间戳
- Smart Turn 端点检测
⚠️ 短板与局限
- 闭源仅云端
- 国内直连受限
- 无独立网页 Demo
🎯 适用场景
- 电话录音转写
- 会议纪要
- 字幕生成
- 实时语音助手
模型使用教程
本章节整理 xAI Grok STT 1.0 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。
- 体验网址:通过 xAI API 调用(无独立网页 Demo),或在支持的平台试用。
- 能力简介:xAI 语音转文字模型,2026-07-23 正式可用,支持约 25 种语言,批量与流式(WebSocket)两种模式,含说话人分离、词级时间戳、数字格式化。
- 适用场景:电话录音转写、会议纪要、字幕生成、实时语音助手、多语种内容整理。
- 使用建议:16kHz PCM 为原生采样率;100ms 分块可获得最佳延迟。
- 开发接入:REST
POST /v1/stt与流式wss://api.x.ai/v1/stt。
- 注册 [xAI Console](https://console.x.ai) 创建 API Key。
- 配置环境变量:
export XAI_API_KEY=你的Key
批量转写
import requests
r = requests.post(
"https://api.x.ai/v1/stt",
headers={"Authorization": f"Bearer {os.environ['XAI_API_KEY']}"},
files={"file": ("call.mp3", open("call.mp3", "rb"), "audio/mpeg")},
data={"format": "true", "language": "en"},
)
print(r.json()["text"])
流式转写(WebSocket)
wscat -c "wss://api.x.ai/v1/stt?sample_rate=16000&encoding=pcm&interim_results=true" \
-H "Authorization: Bearer $XAI_API_KEY"
> 提示:价格约批量 $0.10/小时、流式 $0.20/小时(按音频时长计费)。
💡 使用小技巧
16kHz PCM 为原生采样率;100ms 分块获得最佳延迟;REST POST /v1/stt 与流式 wss://api.x.ai/v1/stt。
❓ 常见问题 FAQ
Q1:支持多少语种?
A1:约 25 种语言。
Q2:如何流式调用?
A2:WebSocket wss://api.x.ai/v1/stt。
访问备注与注意事项
- 2026-07-23 正式可用,支持 12 种音频格式与 2-8 声道
Aitishiku.com