运行时依赖
安装命令
点击复制技能文档
类别:提供者 Model Studio Qwen TTS 验证 mkdir -p output/aliyun-qwen-tts python -m py_compile skills/ai/audio/aliyun-qwen-tts/scripts/generate_tts.py && echo "py_compile_ok" > output/aliyun-qwen-tts/validate.txt 通过标准:命令退出 0 且 output/aliyun-qwen-tts/validate.txt 被生成。 输出和证据 将生成的音频链接、样本音频文件和请求有效负载保存到 output/aliyun-qwen-tts/。每次执行保留一个验证日志。 关键模型名称 使用以下推荐模型之一:qwen3-tts-flash qwen3-tts-instruct-flash qwen3-tts-instruct-flash-2026-01-26 先决条件 安装 SDK(推荐在 venv 中安装以避免 PEP 668 限制): python3 -m venv .venv . .venv/bin/activate python -m pip install dashscope 在环境中设置 DASHSCOPE_API_KEY,或在 ~/.alibabacloud/credentials 中添加 dashscope_api_key(环境变量优先)。 标准化接口(tts.generate) 请求文本(字符串,必需) voice(字符串,必需) language_type(字符串,选项;默认 Auto) instruction(字符串,选项;推荐用于指令模型) stream(布尔,选项;默认 false) 响应 audio_url(字符串,当 stream=false 时) audio_base64_pcm(字符串,当 stream=true 时) sample_rate(整数,24000) format(字符串,wav 或 pcm,取决于模式) 快速开始(Python + DashScope SDK) import os import dashscope # 首选环境变量进行认证:export DASHSCOPE_API_KEY=... # 或使用 ~/.alibabacloud/credentials 中的 dashscope_api_key(位于 [default] 下)。 # 北京区域;用于新加坡:https://dashscope-intl.aliyuncs.com/api/v1 dashscope.base_http_api_url = "https://dashscope.aliyuncs.com/api/v1" text = "Hello, this is a short voice line." response = dashscope.MultiModalConversation.call( model="qwen3-tts-instruct-flash", api_key=os.getenv("DASHSCOPE_API_KEY"), text=text, voice="Cherry", language_type="English", instruction="温暖和平静的语调,稍微慢一点的节奏。", stream=False, ) audio_url = response.output.audio.url print(audio_url) 流媒体注意事项 stream=True 返回 24kHz 的 Base64 编码 PCM 块。解码块或将其连接到 pcm 缓冲区。响应包含 finish_reason == "stop" 时流媒体结束。 操作指南 保持请求简洁;如果遇到大小或超时错误,请将长文本分成多个调用。 使用与文本一致的 language_type 以提高发音。 仅在需要显式样式/语调控制时使用 instruction。 通过(文本,语音,language_type)缓存以避免重复成本。 输出位置 默认输出:output/aliyun-qwen-tts/audio/ 使用 OUTPUT_DIR 覆盖基本目录。 工作流程 确认用户意图、区域、标识符以及操作是否为只读或可变。 首先运行一个最小的只读查询以验证连接和权限。 使用显式参数和有界范围执行目标操作。 验证结果并保存输出/证据文件。 参考 references/api_reference.md 中的参数映射和流媒体示例。 实时模式由 skills/ai/audio/aliyun-qwen-tts-realtime/ 提供。 语音克隆/设计由 skills/ai/audio/aliyun-qwen-tts-voice-clone/ 和 skills/ai/audio/aliyun-qwen-tts-voice-design/ 提供。 源列表:references/sources.md