运行时依赖
安装命令
点击复制技能文档
分类:提供商 Model Studio Qwen ASR(非实时)验证 mkdir -p output/aliyun-qwen-asr python -m py_compile skills/ai/audio/aliyun-qwen-asr/scripts/transcribe_audio.py && echo "py_compile_ok" > output/aliyun-qwen-asr/validate.txt 通过标准:命令退出 0 且 output/aliyun-qwen-asr/validate.txt 被生成。 输出和证据 将转录文本和 API 响应存储在 output/aliyun-qwen-asr/ 下。每次运行保留一个命令日志或示例响应。 使用 Qwen ASR 进行录音音频转录(非实时),包括短音频同步调用和长音频异步作业。 关键模型名称 使用以下确切模型字符串之一: qwen3-asr-flash qwen3-asr-flash-2026-02-10 qwen-audio-asr qwen3-asr-flash-filetrans qwen3-asr-flash-filetrans-2025-11-17 选择指南: 对于短/正常录音(同步),使用 qwen3-asr-flash、qwen3-asr-flash-2026-02-10 或 qwen-audio-asr。 对于长文件转录(异步任务工作流),使用 qwen3-asr-flash-filetrans 或 qwen3-asr-flash-filetrans-2025-11-17。 先决条件 安装 SDK 依赖项(脚本仅使用 Python 标准库): python3 -m venv .venv . .venv/bin/activate 在环境中设置 DASHSCOPE_API_KEY,或在 ~/.alibabacloud/credentials 中添加 dashscope_api_key。 标准化接口(asr.transcribe) 请求音频(字符串,必需):公共 URL 或本地文件路径。 模型(字符串,选项):默认 qwen3-asr-flash。 语言提示(字符串数组,选项):例如 zh、en。 采样率(数字,选项) 词汇表 ID(字符串,选项) 停顿去除启用(布尔,选项) 时间戳粒度(字符串数组,选项):例如 sentence。 异步(布尔,选项):默认为 false(同步模型),true(qwen3-asr-flash-filetrans)。 响应文本(字符串):标准化转录文本。 任务 ID(字符串,选项):异步提交时存在。 状态(字符串):SUCCEEDED 或提交状态。 原始(对象):原始 API 响应。 快速入门(官方 HTTP API) 同步转录(OpenAI 兼容协议): curl -sS --location 'https://dashscope.aliyuncs.com/compatible-mode/v1/chat/completions' \ --header "Authorization: Bearer $DASHSCOPE_API_KEY" \ --header 'Content-Type: application/json' \ --data '{ "model": "qwen3-asr-flash", "messages": [ { "role": "user", "content": [ { "type": "input_audio", "input_audio": { "data": "https://dashscope.oss-cn-beijing.aliyuncs.com/audios/welcome.mp3" } } ] } ], "stream": false, "asr_options": { "enable_itn": false } }' 异步长文件转录(DashScope 协议): curl -sS --location 'https://dashscope.aliyuncs.com/api/v1/services/audio/asr/transcription' \ --header "Authorization: Bearer $DASHSCOPE_API_KEY" \ --header 'X-DashScope-Async: enable' \ --header 'Content-Type: application/json' \ --data '{ "model": "qwen3-asr-flash-filetrans", "input": { "file_url": "https://dashscope.oss-cn-beijing.aliyuncs.com/audios/welcome.mp3" } }' 轮询任务结果: curl -sS --location "https://dashscope.aliyuncs.com/api/v1/tasks/" \ --header "Authorization: Bearer $DASHSCOPE_API_KEY" 本地帮助脚本 使用捆绑脚本进行 URL/本地文件输入和可选异步轮询: python skills/ai/audio/aliyun-qwen-asr/scripts/transcribe_audio.py \ --audio "https://dashscope.oss-cn-beijing.aliyuncs.com/audios/welcome.mp3" \ --model qwen3-asr-flash \ --language-hints zh,en \ --print-response 长文件模式: python skills/ai/audio/aliyun-qwen-asr/scripts/transcribe_audio.py \ --audio "https://dashscope.oss-cn-beijing.aliyuncs.com/audios/welcome.mp3" \ --model qwen3-asr-flash-filetrans \ --async \ --wait 操作指南 对于本地文件,使用 input_audio.data(数据 URI)当直接 URL 不可用时。 保持语言提示最小化以减少识别歧义。 对于异步任务,使用 5-20 秒的轮询间隔和最大重试保护。 将标准化输出保存在 output/aliyun-qwen-asr/transcripts/ 下。 输出位置 默认输出:output/aliyun-qwen-asr/transcripts/ 使用 OUTPUT_DIR 覆盖基目录。 工作流程 确认用户意图、区域、标识符以及操作是否为只读或可变。 首先运行一个最小的只读查询以验证连接和权限。 使用显式参数和有界范围执行目标操作。 验证结果并保存输出/证据文件。 参考 references/api_reference.md references/sources.md 实时合成由 skills/ai/audio/aliyun-qwen-tts-realtime/ 提供。