Appearance
豆包语音
字节豆包大模型语音 V3 接口集,三方服务模块下提供 2 个工具:
- 语音合成(TTS):将文本合成为音频,HTTP Chunked 单向流式,结果归档至 sandbox workspace,返回公网可播放 URL。
- 录音文件极速识别(auc_turbo / V3 flash):将音频文件识别为文字,单文件 ≤100 MB、≤2 小时。
两个工具共用一把火山引擎 API Key。
- 服务 slug:
doubao_speech - 调用协议、鉴权、错误处理详见:调用说明
- 工具列表实时获取:
GET /v1/openapi/third-party-service/doubao_speech/tools
TIP
本页字段说明同步自平台插件 schema 与 doubao_speech 执行器实现,调用方应以工具列表接口返回为准。
工具一览
| 工具 slug | 名称 | 用途 | 典型耗时 |
|---|---|---|---|
doubao_tts_synthesize | 语音合成 | 文本 → 音频 URL | 数百毫秒 ~ 数秒(取决于文本长度) |
doubao_asr_recognize_flash | 录音文件极速识别 | 音频 → 文本 | 通常 < 文件时长的 1/10 |
通用调用形式(所有工具相同):
POST /v1/openapi/third-party-service/doubao_speech/:tool/invoke
{
"inputs": { ... }
}doubao_tts_synthesize 语音合成
接口说明
豆包 TTS(V3 HTTP Chunked 单向流式),将文本合成为音频,支持音色选择、语速 / 音量 / 音调调节,可传入语音指令 (speech_instruction) 与上下文 (context_text) 触发高级特性。合成结果自动归档至 sandbox workspace,返回公网可播放 URL,无需调用方自行托管音频。
- 工具 slug:
doubao_tts_synthesize - 完整路径:
POST /v1/openapi/third-party-service/doubao_speech/doubao_tts_synthesize/invoke
入参(inputs)
| 字段 | 类型 | 必填 | 默认 | 说明 |
|---|---|---|---|---|
text | string | 是 | - | 待合成文本,UTF-8 编码 ≤ 1000 字节 |
voice_type | string | 是 | - | 音色 ID。请使用 2.0 音色(后缀 _uranus_bigtts),如 zh_female_xiaohe_uranus_bigtts、zh_female_vv_uranus_bigtts,与 tts_resource_id=seed-tts-2.0 匹配;不要使用 1.0 的 _moon_bigtts / _mars_bigtts 音色 |
speech_instruction | string | 否 | - | TTS 2.0 语音指令(如情绪调教,例:用兴奋的语气朗读) |
context_text | string | 否 | - | TTS 2.0 上下文引用文本,给模型提供前文以保持语气连贯 |
encoding | string | 否 | mp3 | 输出音频编码:mp3 / wav / pcm / ogg_opus |
speech_rate | integer | 否 | 0 | 语速档位,范围 -50 ~ 100。0=原速,100=2.0 倍速,-50=0.5 倍速 |
loudness_rate | integer | 否 | 0 | 音量档位,范围 -50 ~ 100。0=原音量,100=2.0 倍音量,-50=0.5 倍音量 |
pitch | integer | 否 | 0 | 音调,范围 -12 ~ 12,0 为原音调 |
TIP
完整音色清单参见火山引擎官方文档:https://www.volcengine.com/docs/6561/1257544
出参(output)字段
| 字段 | 类型 | 说明 |
|---|---|---|
audio_url | string | 合成音频的可播放 URL(已归档至 sandbox workspace) |
format | string | 音频编码格式(mp3 / wav / pcm / ogg_opus) |
sample_rate | integer | 音频采样率(Hz) |
size_bytes | integer | 音频文件大小(字节) |
调用示例
bash
curl -X POST 'https://runtime-api.invalid/v1/openapi/third-party-service/doubao_speech/doubao_tts_synthesize/invoke' \
-H 'Content-Type: application/json' \
-H 'Authorization: Bearer sk_your_api_key' \
-d '{
"inputs": {
"text": "欢迎使用 AI 应用开发平台。",
"voice_type": "zh_female_xiaohe_uranus_bigtts",
"encoding": "mp3",
"speech_rate": 0
}
}'成功响应示例
json
{
"code": 200,
"data": {
"service": "doubao_speech",
"tool": "doubao_tts_synthesize",
"output": {
"audio_url": "https://sandbox-cdn.hxsyai.com/audio/xxx.mp3",
"format": "mp3",
"sample_rate": 24000,
"size_bytes": 41263
}
},
"message": "success",
"trace_id": "ece1bfa480da3a5bb346cf83cfc29454"
}doubao_asr_recognize_flash 录音文件极速识别
接口说明
豆包录音文件极速版(auc_turbo / V3 flash),同步返回转写结果。支持 WAV / MP3 / OGG 等格式,单文件 ≤ 100 MB、≤ 2 小时。
输入采用数据中心 audio_id:前端先将音频上传到平台数据中心拿到 audio_id,再传入本接口;后端反查公网 URL 直拉,URL 拉取失败时自动降级为 base64 上送。
- 工具 slug:
doubao_asr_recognize_flash - 完整路径:
POST /v1/openapi/third-party-service/doubao_speech/doubao_asr_recognize_flash/invoke
入参(inputs)
| 字段 | 类型 | 必填 | 默认 | 说明 |
|---|---|---|---|---|
audio_id | string | 是 | - | 数据中心音频文件 ID(前端上传完成后由数据中心返回),后端凭此反查公网播放地址 |
enable_punc | boolean | 否 | true | 是否在识别结果中输出标点符号 |
enable_itn | boolean | 否 | true | 将口语数字、日期等规整为书面格式 |
enable_ddc | boolean | 否 | true | 过滤口语中的「嗯、啊、呃」等填充词 |
出参(output)字段
| 字段 | 类型 | 说明 |
|---|---|---|
text | string | 识别后的文本 |
audio_url | string | 实际拉取的音频 URL |
audio_id | string | 输入的数据中心文件 ID(直接传 audio_url 时为空) |
source | string | 识别走的链路:url(直拉) / base64(URL 拉取失败时降级) |
调用示例
bash
curl -X POST 'https://runtime-api.invalid/v1/openapi/third-party-service/doubao_speech/doubao_asr_recognize_flash/invoke' \
-H 'Content-Type: application/json' \
-H 'Authorization: Bearer sk_your_api_key' \
-d '{
"inputs": {
"audio_id": "audio_01J8...",
"enable_punc": true,
"enable_itn": true,
"enable_ddc": true
}
}'成功响应示例
json
{
"code": 200,
"data": {
"service": "doubao_speech",
"tool": "doubao_asr_recognize_flash",
"output": {
"text": "欢迎使用 AI 应用开发平台。",
"audio_url": "https://sandbox-cdn.hxsyai.com/audio/xxx.mp3",
"audio_id": "audio_01J8...",
"source": "url"
}
},
"message": "success",
"trace_id": "1c2b23f18c73fc0540423f0c2923a654"
}凭证配置
在控制台为 workspace 配置以下凭证后两个工具均可使用:
| 字段 | 必填 | 默认 | 说明 |
|---|---|---|---|
api_key | 是 | - | 火山引擎控制台 API Key(UUID 形式);获取地址:https://console.volcengine.com/speech/app |
tts_resource_id | 否 | seed-tts-2.0 | TTS 资源 ID,默认即可;详见 https://www.volcengine.com/docs/6561/1598757 |
未配置时调用返回 三方服务凭证未配置。
注意事项
- TTS 文本长度 ≤ 1000 字节(约 333 个汉字)。如需更长文本,请在调用方按句切片后串行 / 并行合成。
- 音色版本:必须使用 2.0 音色(
_uranus_bigtts),与默认seed-tts-2.0资源匹配;混用 1.0 / 2.0 会报「音色不存在」类错误。 - ASR 推荐链路:前端上传至数据中心 → 拿到
audio_id→ 调本接口。平台优先用公网 URL 直拉,失败时透明降级 base64,output.source字段可作排查依据。 - 音频归档:TTS 结果的
audio_url已自动落库至 sandbox workspace,无需调用方再次上传;如需长期持久化,请按需另行复制。
