Skip to content

豆包语音

字节豆包大模型语音 V3 接口集,三方服务模块下提供 2 个工具:

  • 语音合成(TTS):将文本合成为音频,HTTP Chunked 单向流式,结果归档至 sandbox workspace,返回公网可播放 URL。
  • 录音文件极速识别(auc_turbo / V3 flash):将音频文件识别为文字,单文件 ≤100 MB、≤2 小时。

两个工具共用一把火山引擎 API Key。

  • 服务 slug:doubao_speech
  • 调用协议、鉴权、错误处理详见:调用说明
  • 工具列表实时获取:GET /v1/openapi/third-party-service/doubao_speech/tools

TIP

本页字段说明同步自平台插件 schema 与 doubao_speech 执行器实现,调用方应以工具列表接口返回为准。

工具一览

工具 slug名称用途典型耗时
doubao_tts_synthesize语音合成文本 → 音频 URL数百毫秒 ~ 数秒(取决于文本长度)
doubao_asr_recognize_flash录音文件极速识别音频 → 文本通常 < 文件时长的 1/10

通用调用形式(所有工具相同):

POST /v1/openapi/third-party-service/doubao_speech/:tool/invoke
{
  "inputs": { ... }
}

doubao_tts_synthesize 语音合成

接口说明

豆包 TTS(V3 HTTP Chunked 单向流式),将文本合成为音频,支持音色选择、语速 / 音量 / 音调调节,可传入语音指令 (speech_instruction) 与上下文 (context_text) 触发高级特性。合成结果自动归档至 sandbox workspace,返回公网可播放 URL,无需调用方自行托管音频。

  • 工具 slug:doubao_tts_synthesize
  • 完整路径:POST /v1/openapi/third-party-service/doubao_speech/doubao_tts_synthesize/invoke

入参(inputs

字段类型必填默认说明
textstring-待合成文本,UTF-8 编码 ≤ 1000 字节
voice_typestring-音色 ID。请使用 2.0 音色(后缀 _uranus_bigtts,如 zh_female_xiaohe_uranus_bigttszh_female_vv_uranus_bigtts,与 tts_resource_id=seed-tts-2.0 匹配;不要使用 1.0 的 _moon_bigtts / _mars_bigtts 音色
speech_instructionstring-TTS 2.0 语音指令(如情绪调教,例:用兴奋的语气朗读
context_textstring-TTS 2.0 上下文引用文本,给模型提供前文以保持语气连贯
encodingstringmp3输出音频编码:mp3 / wav / pcm / ogg_opus
speech_rateinteger0语速档位,范围 -50 ~ 1000=原速,100=2.0 倍速,-50=0.5 倍速
loudness_rateinteger0音量档位,范围 -50 ~ 1000=原音量,100=2.0 倍音量,-50=0.5 倍音量
pitchinteger0音调,范围 -12 ~ 120 为原音调

TIP

完整音色清单参见火山引擎官方文档:https://www.volcengine.com/docs/6561/1257544

出参(output)字段

字段类型说明
audio_urlstring合成音频的可播放 URL(已归档至 sandbox workspace)
formatstring音频编码格式(mp3 / wav / pcm / ogg_opus
sample_rateinteger音频采样率(Hz)
size_bytesinteger音频文件大小(字节)

调用示例

bash
curl -X POST 'https://runtime-api.invalid/v1/openapi/third-party-service/doubao_speech/doubao_tts_synthesize/invoke' \
  -H 'Content-Type: application/json' \
  -H 'Authorization: Bearer sk_your_api_key' \
  -d '{
    "inputs": {
      "text": "欢迎使用 AI 应用开发平台。",
      "voice_type": "zh_female_xiaohe_uranus_bigtts",
      "encoding": "mp3",
      "speech_rate": 0
    }
  }'

成功响应示例

json
{
  "code": 200,
  "data": {
    "service": "doubao_speech",
    "tool": "doubao_tts_synthesize",
    "output": {
      "audio_url": "https://sandbox-cdn.hxsyai.com/audio/xxx.mp3",
      "format": "mp3",
      "sample_rate": 24000,
      "size_bytes": 41263
    }
  },
  "message": "success",
  "trace_id": "ece1bfa480da3a5bb346cf83cfc29454"
}

doubao_asr_recognize_flash 录音文件极速识别

接口说明

豆包录音文件极速版(auc_turbo / V3 flash),同步返回转写结果。支持 WAV / MP3 / OGG 等格式,单文件 ≤ 100 MB、≤ 2 小时

输入采用数据中心 audio_id:前端先将音频上传到平台数据中心拿到 audio_id,再传入本接口;后端反查公网 URL 直拉,URL 拉取失败时自动降级为 base64 上送。

  • 工具 slug:doubao_asr_recognize_flash
  • 完整路径:POST /v1/openapi/third-party-service/doubao_speech/doubao_asr_recognize_flash/invoke

入参(inputs

字段类型必填默认说明
audio_idstring-数据中心音频文件 ID(前端上传完成后由数据中心返回),后端凭此反查公网播放地址
enable_puncbooleantrue是否在识别结果中输出标点符号
enable_itnbooleantrue将口语数字、日期等规整为书面格式
enable_ddcbooleantrue过滤口语中的「嗯、啊、呃」等填充词

出参(output)字段

字段类型说明
textstring识别后的文本
audio_urlstring实际拉取的音频 URL
audio_idstring输入的数据中心文件 ID(直接传 audio_url 时为空)
sourcestring识别走的链路:url(直拉) / base64(URL 拉取失败时降级)

调用示例

bash
curl -X POST 'https://runtime-api.invalid/v1/openapi/third-party-service/doubao_speech/doubao_asr_recognize_flash/invoke' \
  -H 'Content-Type: application/json' \
  -H 'Authorization: Bearer sk_your_api_key' \
  -d '{
    "inputs": {
      "audio_id": "audio_01J8...",
      "enable_punc": true,
      "enable_itn": true,
      "enable_ddc": true
    }
  }'

成功响应示例

json
{
  "code": 200,
  "data": {
    "service": "doubao_speech",
    "tool": "doubao_asr_recognize_flash",
    "output": {
      "text": "欢迎使用 AI 应用开发平台。",
      "audio_url": "https://sandbox-cdn.hxsyai.com/audio/xxx.mp3",
      "audio_id": "audio_01J8...",
      "source": "url"
    }
  },
  "message": "success",
  "trace_id": "1c2b23f18c73fc0540423f0c2923a654"
}

凭证配置

在控制台为 workspace 配置以下凭证后两个工具均可使用:

字段必填默认说明
api_key-火山引擎控制台 API Key(UUID 形式);获取地址:https://console.volcengine.com/speech/app
tts_resource_idseed-tts-2.0TTS 资源 ID,默认即可;详见 https://www.volcengine.com/docs/6561/1598757

未配置时调用返回 三方服务凭证未配置

注意事项

  • TTS 文本长度 ≤ 1000 字节(约 333 个汉字)。如需更长文本,请在调用方按句切片后串行 / 并行合成。
  • 音色版本:必须使用 2.0 音色(_uranus_bigtts),与默认 seed-tts-2.0 资源匹配;混用 1.0 / 2.0 会报「音色不存在」类错误。
  • ASR 推荐链路:前端上传至数据中心 → 拿到 audio_id → 调本接口。平台优先用公网 URL 直拉,失败时透明降级 base64,output.source 字段可作排查依据。
  • 音频归档:TTS 结果的 audio_url 已自动落库至 sandbox workspace,无需调用方再次上传;如需长期持久化,请按需另行复制。

AI 应用开发平台 - 面向医疗场景的 AI 应用创新引擎