Skip to main content

火山引擎流式语音识别

通过 WebSocket 接口 /v1/stream_asr 持续发送 PCM 音频,并实时接收识别结果。

可用模型

音频要求

发送的音频必须满足以下要求: 如果源文件不是该格式,可先使用 FFmpeg 转换:

Python 示例

安装 WebSocket 客户端:
以下示例读取 input.pcm,按 100 毫秒分片发送,并在音频末尾补充静音以触发完整识别结果:
MODEL 改为 volcengine_bigmodel 即可调用大模型流式识别。

请求格式

ASR 使用 WebSocket 协议,因此建连请求没有 HTTP JSON Body。连接成功后,客户端通过 WebSocket 文本消息发送 JSON Body。 建连地址:
建连 Header:
WebSocket 连接建立后,可以直接发送音频 Body:
如果需要设置识别语言,可以先发送会话配置 Body:
发送了 session.config 时,请等待平台返回 session.ready,然后再发送音频 Body。不需要设置会话参数时,无需发送 session.config,也无需等待 session.ready 音频 Body:

连接参数

客户端事件

session.config

配置当前识别会话。该事件不是必需步骤;只有需要设置会话参数时才发送。发送后应等待平台返回 session.ready,再开始发送音频。
volcengine_normal 只读取 languageenable_itnenable_puncenable_ddc 不会传递给该模型。 不发送 session.config 时,WebSocket 建连成功后可以直接发送第一条 input_audio_buffer.append,平台将使用模型默认配置。

input_audio_buffer.append

发送一段 Base64 编码的 PCM 音频。建议按固定时长连续发送,不要一次发送完整的长音频。

服务端事件

最终结果事件示例:
火山引擎模型能力说明可参考火山引擎语音识别产品文档