跳转到内容
中文

Qwen-Audio 3.0 TTS Flash API

POST Base URL: https://api.hiapi.ai /v1/tasks

图片、视频和音频模型通过 统一异步接口 POST /v1/tasks 调用,区别只在 input 字段(见下方 input 参数)。

模型概览

状态 即将上线
HiAPI 模型 ID qwen-audio-3.0-tts-flash
Qwen 官方模型 ID qwen-audio-3.0-tts-flash
首发售价 $0.030 / 1,000 characters
类型 音频生成(文生语音)

Qwen-Audio 3.0 TTS Flash 面向低延迟语音工作流,适合 AI 助手、语音智能体和快速交互。HiAPI 支持完整的语音控制参数,并按有效字符数计费。

生产建议

参数说明
  • 公开 input 支持 text、voice、format、sample_rate、volume、rate、pitch、seed、bit_rate、language_hints 和 instruction。
  • format 支持 pcm、wav、mp3、opus,默认 mp3;sample_rate 默认 22050 Hz;bit_rate 仅用于 Opus。
  • Flash 官方系统音色:longanhuan_v3.6、longjielidou_v3.6、loongeva_v3.6、loongjohn。
  • 售价为 $0.030 / 1,000 characters;阿里计费规则为中日韩表意文字每个计 2 个字符,其他字符每个计 1 个。

适用场景

AI 助手播报

适合快速生成语音回复、状态反馈和提示信息。

textvoicerate
语音智能体

适合以异步任务方式生成短语音片段。

textvoicelanguage_hints
批量通知

适合把通知、提醒和客服文本批量转换为音频。

textformat

请求参数

model string 必填

固定填 qwen-audio-3.0-tts-flash。

示例 qwen-audio-3.0-tts-flash
input object 必填

Qwen-Audio 3.0 TTS Flash 的语音合成参数。

text string 必填

待合成文本,不能为空;hiAPI 单次最多 20,000 个 Unicode 码点,所有输出格式一致。售价为 $0.030 / 1,000 characters。

voice enum 必填

Flash 版本支持的官方系统音色 ID。 查看可用音色

默认 longanhuan_v3.6 可选值: longanhuan_v3.6longjielidou_v3.6loongeva_v3.6loongjohn
format enum 可选

输出格式:PCM、WAV、MP3 或 Opus。

默认 mp3 可选值: pcmwavmp3opus
sample_rate enum 可选

输出采样率,单位 Hz。

默认 22050 可选值: 80001600022050240004410048000
volume integer 可选

音量,范围 0-100。

默认 50
rate number 可选

语速倍率,范围 0.5-2.0。

默认 1
pitch number 可选

音高倍率,范围 0.5-2.0。

默认 1
seed integer 可选

合成随机种子,范围 0-65,535。

默认 0
bit_rate integer 可选

Opus 码率,范围 6-510 kbps,仅在 format=opus 时生效。

默认 32
language_hints string[] 可选

可选语言提示,仅可传一个官方语言码;Qwen 只处理数组第一项。

可选值: zhenfrdejakoruptthid +6
instruction string 可选

可选,用于控制方言、情绪或角色风格。

callback object 可选

可选回调配置;正式上线后,任务进入终态时 HiAPI 可主动通知你的服务。

url string 必填

传入 callback 时必填的 HTTPS 地址。

示例 https://your-domain.com/hiapi/callback
when enum 可选

回调触发时机,固定为 final。

默认 final 可选值: final

Flash 可用音色

下表列出该档官方系统音色。

voice ID状态
longanhuan_v3.6支持
longjielidou_v3.6支持
loongeva_v3.6支持
loongjohn支持

用例示例

MP3 语音请求

使用默认 MP3 和 22.05 kHz 采样率。

请求体
{
  "model": "qwen-audio-3.0-tts-flash",
  "input": {
    "text": "欢迎使用 HiAPI,这是一段语音合成示例。",
    "voice": "longanhuan_v3.6",
    "format": "mp3",
    "sample_rate": 22050
  }
}
带语音控制的 PCM 请求

显式设置语速、音高和音量。

请求体
{
  "model": "qwen-audio-3.0-tts-flash",
  "input": {
    "text": "这是一段语音参数测试。",
    "voice": "longanhuan_v3.6",
    "format": "pcm",
    "sample_rate": 24000,
    "volume": 50,
    "rate": 1.1,
    "pitch": 1,
    "seed": 0
  }
}

获取结果

  1. 当前为 Coming Soon 页面,模型未启用时不要发送真实生产请求。
  2. 正式上线后,提交成功会立即返回 taskId,不等待音频生成完成。
  3. 生产环境优先等待 callback.url 终态通知;本地调试可轮询 GET /v1/tasks/:id。
  4. status=success 后从 output[].url 下载音频,并按业务需要转存。

常见问题

现在可以调用吗?

当前页面处于即将上线状态;正式开放时间以本页面状态为准。

正式价格是多少?

Flash 的售价是 $0.030 / 1,000 characters,按有效字符数计费。

字符如何计算?

中文汉字、繁体字、日文汉字和韩文汉字每个计 2 个字符;字母、数字、标点、空格、假名等每个计 1 个。

支持哪些音色?

Flash 官方系统音色为 longanhuan_v3.6、longjielidou_v3.6、loongeva_v3.6、loongjohn。 查看可用音色

单次最多支持多少文本?

hiAPI 单次最多 20,000 个 Unicode 码点,PCM、WAV、MP3 和 Opus 使用同一限制。

支持实时流式或 SSML 吗?

不在公开首发合同内。HiAPI 只提供统一异步任务接口。

下一步