多模态模型

xAI Grok STT 1.0 STT 1.0

Grok STT系列 · xAI · 2026-07发布

闭源多模态

模型介绍

xAI 语音转文字模型,2026-07-23 正式可用,支持约 25 种语言,批量与流式(WebSocket)两种模式,含说话人分离、词级时间戳、数字格式化。

模型基础信息

模型系列Grok STT系列
开发机构xAI
发布时间2026-07
参数规模闭源(未公开)
上下文窗口语音转写(25 语种)
模型类型多模态(语音转文字)
中文能力良好
使用方式网页体验 / API调用

免费额度与收费政策

API 按量

免费规则详情

通过 xAI API 调用,按音频时长计费。

收费标准简介

批量约 $0.10/小时、流式约 $0.20/小时(按音频时长)。

模型能力介绍

✅ 核心优势

  • 25 语种支持
  • 批量 + 流式双模式
  • 说话人分离与词级时间戳
  • Smart Turn 端点检测

⚠️ 短板与局限

  • 闭源仅云端
  • 国内直连受限
  • 无独立网页 Demo

🎯 适用场景

  • 电话录音转写
  • 会议纪要
  • 字幕生成
  • 实时语音助手

模型使用教程

本章节整理 xAI Grok STT 1.0 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

  • 体验网址:通过 xAI API 调用(无独立网页 Demo),或在支持的平台试用。
  • 能力简介:xAI 语音转文字模型,2026-07-23 正式可用,支持约 25 种语言,批量与流式(WebSocket)两种模式,含说话人分离、词级时间戳、数字格式化。
  • 适用场景:电话录音转写、会议纪要、字幕生成、实时语音助手、多语种内容整理。
  • 使用建议:16kHz PCM 为原生采样率;100ms 分块可获得最佳延迟。
  • 开发接入:REST POST /v1/stt 与流式 wss://api.x.ai/v1/stt
  1. 注册 [xAI Console](https://console.x.ai) 创建 API Key。
  2. 配置环境变量:
export XAI_API_KEY=你的Key

批量转写

import requests
r = requests.post(
    "https://api.x.ai/v1/stt",
    headers={"Authorization": f"Bearer {os.environ['XAI_API_KEY']}"},
    files={"file": ("call.mp3", open("call.mp3", "rb"), "audio/mpeg")},
    data={"format": "true", "language": "en"},
)
print(r.json()["text"])

流式转写(WebSocket)

wscat -c "wss://api.x.ai/v1/stt?sample_rate=16000&encoding=pcm&interim_results=true" \
  -H "Authorization: Bearer $XAI_API_KEY"

> 提示:价格约批量 $0.10/小时、流式 $0.20/小时(按音频时长计费)。

💡 使用小技巧

16kHz PCM 为原生采样率;100ms 分块获得最佳延迟;REST POST /v1/stt 与流式 wss://api.x.ai/v1/stt

❓ 常见问题 FAQ

Q1:支持多少语种?

A1:约 25 种语言。

Q2:如何流式调用?

A2:WebSocket wss://api.x.ai/v1/stt

访问备注与注意事项