功能说明
对应工具标识text_to_speech。
text_to_speech 将文本合成为语音,并把音频保存到本地。
导入路径:from veadk.tools.builtin_tools.tts import text_to_speech
环境变量与前提
环境变量:MODEL_AGENT_API_KEY:智能体推理模型的 API KeyTOOL_VESPEECH_APP_ID:VeSpeech 服务的 App IDTOOL_VESPEECH_API_KEY:VeSpeech 服务的 API KeyTOOL_VESPEECH_SPEAKER:音色,默认为zh_female_vv_uranus_bigttsTOOL_VESPEECH_AUDIO_OUTPUT_PATH:音频输出目录,默认为系统临时目录
使用方法
examples/tools/tts/agent.py
参数与输出格式
成功结果为
{"saved_audio_path": "..."},失败时可能返回 error。音频按 24 kHz PCM 保存为本地 .pcm 文件,不是可直接按 WAV 或 MP3 解码的文件;转码时需要匹配 PCM 音频参数。输出目录不存在时会创建,进程需具有写入权限
工具使用 seed-tts-2.0 资源和火山引擎语音服务地址,需为 App ID 开通该资源与音色。设置 CLOUD_PROVIDER=byteplus 不会自动切换语音端点。工具还可能尝试在运行机器播放音频,无可用音频设备时仍应检查输出文件
验证时先检查 error,再确认 saved_audio_path 指向存在且非空的文件;服务器上的本地路径不能直接作为终端用户可下载的链接,应由应用按需发布文件