Skip to main content

FunASR 流式语音识别

通过 WebSocket 接口 /v1/stream_asr 持续发送 PCM 音频,并实时接收中文识别结果。

可用模型

音频要求

该模型部署的是中文 16 kHz Paraformer 在线识别模型。发送的音频必须满足以下要求: 转换示例:

Python 示例

安装依赖:

请求格式

ASR 使用 WebSocket 协议,因此建连请求没有 HTTP JSON Body。连接成功后,客户端通过 WebSocket 文本消息发送音频 JSON Body。 建连地址:
建连 Header:
音频消息 Body:

连接参数

WebSocket 建连成功后可以直接发送音频消息,无需先发送 session.config,也无需等待 session.ready

输入事件

每个音频事件包含一段 Base64 编码的 PCM 字节:

输出事件

最终结果事件示例: