火山引擎流式语音识别
通过 WebSocket 接口/v1/stream_asr 持续发送 PCM 音频,并实时接收识别结果。
可用模型
音频要求
发送的音频必须满足以下要求:
如果源文件不是该格式,可先使用 FFmpeg 转换:
Python 示例
安装 WebSocket 客户端:input.pcm,按 100 毫秒分片发送,并在音频末尾补充静音以触发完整识别结果:
MODEL 改为 volcengine_bigmodel 即可调用大模型流式识别。
请求格式
ASR 使用 WebSocket 协议,因此建连请求没有 HTTP JSON Body。连接成功后,客户端通过 WebSocket 文本消息发送 JSON Body。 建连地址:session.config 时,请等待平台返回 session.ready,然后再发送音频 Body。不需要设置会话参数时,无需发送 session.config,也无需等待 session.ready。
音频 Body:
连接参数
客户端事件
session.config
配置当前识别会话。该事件不是必需步骤;只有需要设置会话参数时才发送。发送后应等待平台返回 session.ready,再开始发送音频。
volcengine_normal 只读取 language;enable_itn、enable_punc 和 enable_ddc 不会传递给该模型。
不发送 session.config 时,WebSocket 建连成功后可以直接发送第一条 input_audio_buffer.append,平台将使用模型默认配置。
input_audio_buffer.append
发送一段 Base64 编码的 PCM 音频。建议按固定时长连续发送,不要一次发送完整的长音频。
服务端事件
最终结果事件示例:

