音频模型
音频模型与图像、视频模型共用统一的 POST /v1/tasks 端点和 API Key。
| 模型 | 适用场景 | 说明 |
|---|---|---|
| ElevenLabs Text to Dialogue v3 | 多说话人对话:有声剧、播客、游戏 NPC | 67 个预置音色、70+ 语言、逐句指定音色;按字符计费 |
以下页面是上线前契约。dev 环境验收已通过;生产环境仍保持关闭,待发布门禁解除后开放。
| 模型 | 计划定位 | 准备状态 |
|---|---|---|
| Qwen-Audio 3.0 TTS Plus | 高质量配音、视频旁白和有声内容 | 2 个系统音色、PCM/WAV/MP3/Opus 和完整语音控制;dev 验收已通过 |
| Qwen-Audio 3.0 TTS Flash | AI 助手、语音智能体、通知播报和快速语音工作流 | 4 个系统音色、PCM/WAV/MP3/Opus 和完整语音控制;dev 验收已通过 |
更多音频模型(音乐生成、音效)陆续上线,实时模型列表见价格页。