跳转到内容
中文

AI 音频生成 API 对比

HiAPI 通过与图片和视频相同的统一 POST /v1/tasks 接口提供音频生成模型,包括文本转语音(TTS)、音乐和音效。只需一个 API Key 和一套任务模型,即可为产品加入语音、音乐或音效能力。

准备测试音频 API?

接入生产环境前,可先在 Playground 中试用、对比实时价格或创建 API Key。

所有音频模型均通过同一个 POST /v1/tasks 接口调用,并返回可通过轮询或回调获取的音频产物,例如 mp3wav

模型最适合说明
ElevenLabs Text to Dialogue v3 API多角色对话:广播剧、播客、游戏 NPC67 种预设音色、70 多种语言、逐行控制音色;按字符计费,每次最多 5000 个字符
MiniMax Music 1.5 API带人声的完整歌曲:配乐、广告歌曲、品牌音乐最长约 4 分钟,支持带结构标签的中英文歌词;按首计费
MiniMax Music 2.6 API新一代完整歌曲:长歌词、纯音乐模式、自动作词歌词最长 3500 字符,支持 14 种结构标签、纯音乐模式和按提示词自动作词;按首计费
MiniMax Music 3 API高保真歌曲:时长可控、结果可复现歌词必填、支持结构标签,时长上限 1-300 秒,无损 WAV 输出;按请求的生成时长计费

以下页面提供上线前契约,供集成评审使用。dev 环境验收已通过;生产环境仍保持关闭,待发布门禁解除后开放。

模型规划用途状态
Qwen-Audio 3.0 TTS Plus高质量配音、视频旁白和有声内容2 个系统音色;PCM/WAV/MP3/Opus;完整语音控制;dev 验收已通过
Qwen-Audio 3.0 TTS FlashAI 助手、语音智能体、通知播报和快速语音工作流4 个系统音色;PCM/WAV/MP3/Opus;完整语音控制;dev 验收已通过

更多音频能力会通过同一个接口陆续上线:

能力典型用途说明
文本转语音(TTS)配音、旁白、助手根据输入文本返回语音文件
音乐生成背景音乐、广告歌曲、循环音乐根据文本提示词返回音乐片段
音效生成UI 音效、环境声、拟音根据提示词返回短音效

音频模型会持续增加。请在 HiAPI 价格页查看当前模型列表和实时价格。

所有音频模型都使用统一的异步任务流程:

  1. 使用音频模型 ID 和 input 对象调用 POST /v1/tasks
  2. 获取任务 ID。
  3. 轮询 GET /v1/tasks/:id,或使用回调等待任务完成。
  4. 从已完成任务中读取音频产物 URL,然后下载或播放。

音频任务是异步执行的,因此应优先使用回调或适中的轮询间隔,避免高频轮询。

HiAPI 的所有音频生成 API 都使用相同的 API Key 和任务接口。在 API Keys 页面创建一个 Key,并在每次请求中携带:

Terminal window
Authorization: Bearer YOUR_API_KEY

请将 API Key 保存在服务端。对于浏览器应用,应先将用户文本或提示词发送到你的后端,再由后端创建 HiAPI 任务。

当前价格以 HiAPI 价格页为准。音频价格通常取决于模型及其计费单位,包括输出时长(按秒)或输入长度(按字符),同时也与请求量有关。

控制成本时建议:

  • 生成长音频前,先用较短的提示词或文本测试。
  • 缓存预计会重复使用的生成音频。
  • 优先使用回调,避免高频轮询。
  • 单独跟踪失败任务,避免无效请求转化为隐藏的重试成本。

AI 音频 API 可以让应用根据文本或提示词生成语音、音乐或音效。HiAPI 通过 POST /v1/tasks 提供音频模型,并返回任务 ID,供应用轮询结果或通过回调等待任务完成。

注册 HiAPI 账户,然后在 API Keys 页面创建 Key。同一个 Key 可用于音频、图片和视频任务模型。

音频 API 成本取决于模型、计费单位(按输出秒数或输入字符数)和请求量。当前价格请查看 HiAPI 价格页

音频任务会返回可下载的产物 URL,常见格式为 mp3wav,具体取决于模型。