qwen-audio-3.0-realtime-plus 和 qwen-audio-3.0-realtime-flash。两款使用同一参数契约。以下描述平台当前统一接口的支持范围,不表示所有 OpenAI Realtime 参数都受支持。中文使用示例
会话参数
下表字段均相对session.update.session。所有更新必须等待 session.updated,之后才能发送下一次更新或音频。上游拒绝更新时,不应按请求值更新客户端本地配置。
输入未指定采样率时,网关按24kHz解码;上游输入为16kHz,网关负责24k到16k重采样。不要输入16k音频却声明24k。音频开始后不能改变输入采样率或VAD;开始前可更新。首轮后重复设置音色或声纹地址会明确返回错误,避免上游静默忽略。
搜索与非空工具互斥,检查的是整个会话状态。切换时在同一次更新中先关闭另一项,例如
{"tools": [], "enable_search": true};反向为 {"enable_search": false, "tools": [...]}。这条完整动态切换流程尚未做专项真实验收。
客户端事件
错误事件使用
error.type=invalid_request_error、error.code=unsupported_or_invalid_parameter,并关联客户端的event_id。错误后连接可继续用于合法请求。
服务端事件与字段映射
验收范围与已知限制
截至2026-09-18,开发环境两模型已验证文本/音频、16k/24k输入、两种VAD、有效语音打断、五种内置音色、工具往返、搜索来源、历史窗口1/50的实际效果、正常完成响应的用量和钱包费用、8并发隔离、超过两分钟的20轮连接复用。上述结果不代表正式环境已经完成部署。 smart_turn专项12条用例均通过:空闲和输出中分别输入合成“嗯”“啊”及噪声,无额外回答或取消;随后明确问题能自动应答。尚未覆盖真实麦克风混音、扬声器回声或所有环境噪声。
正常完成的音频响应附带文本不另收费;独立纯文本输出仍收费。混合会话按每个响应的模态处理,usage中的文本token仍保留。对外支持范围应与此矩阵一致,不能把未测或豁免项描述为已通过。
官方参考:百炼客户端事件、服务端事件。参数转换和明确拒绝行为以平台适配实现为准。

