Skip to main content

MiniMax 语音合成

通过 /v1/audio/speech 接口将文本转换为自然语音。接口支持两种输出方式:
  • 非流式:生成完成后返回音频文件 URL,适合配音、有声内容等场景。
  • 流式:通过 SSE 持续返回音频分片,适合语音助手、实时播报等低延迟场景。

可用模型

非流式语音合成

只需提供模型、文本和音色。生成完成后,从响应的 url 下载或播放音频。
响应示例:

流式语音合成

设置 stream: true 后,接口返回 text/event-stream。每条 SSE 消息中的 audio 是 Base64 编码的 MP3 分片。
SSE 数据示例:
流式模式建议使用 mp3。音频分片必须按接收顺序解码并写入同一个文件。

请求参数

通用参数

常用音色

也可以将已创建的 MiniMax 复刻音色 ID 传给 voice。更多系统音色请参考 MiniMax 官方语音合成文档

高级参数

高级参数统一放在 model_extra 中:

生成字幕

字幕文件请使用非流式模式:
成功后通过响应中的 subtitle_url 获取字幕文件。

指定发音

遇到多音字、专有名词或英文缩写时,可以使用 tone 指定发音:

混合音色

使用 timber_weights 混合多个系统音色:
设置 timber_weights 后,最终声音主要由混合音色配置决定。