创建异步语音转写任务
创建语音转写任务,支持多种音频格式,支持输出时间戳及说话人信息。
授权
- Security Scheme Type: http
- HTTP Authorization Scheme: Bearer API_key,用于验证账户信息,可在 按量计费&资源包>API Key 管理 中查看。
请求头
请求体的媒体类型,请设置为application/json以确保请求数据格式正确。
可用选项:application/json
请求体application/json
file_id long 选填
音频文件 ID(通过文件上传接口获取)。与 file_url 二选一。
file_url string 选填
公网可访问的 http(s) 音频直链,长度不超过 2048 字符。若 URL 含特殊字符须 UrlEncode;已带签名的 URL 请勿二次编码。与 file_id 二选一。
异步语音识别文件需遵从以下规范:
- 格式:mp3、opus、wav、amr、m4a、ogg
- 时长:最少不低于 1 秒,最长不超过 5 小时
- 大小:不超过 1GB
modelenum<string>必填
模型编码可用选项:u2-asr
format string 必填
语音文件类型:mp3、opus、wav、amr、m4a、ogg。
sample_rate integer
音频采样率,默认 16000。
enable_auto_lang boolean
是否开启语种自动识别,默认 false。
language string
- zh-CN (中文)
- en-US (英语)
- ar-SA (阿拉伯语)
- de-DE (德语)
- es-MX (西班牙语)
- fr-FR (法语)
- id-ID (印尼语)
- ja-JP (日语)
- ko-KR (韩语)
- pt-BR (葡萄牙语)
- ru-RU (俄语)
- tr-TR (土耳其语)
- vi-VN (越南语)
- th-TH (泰语)
- it-IT (意大利语)
enable_itn boolean
是否启用阿拉伯数字转换(如将"一九九七年"转为"1997年"),默认 true。
channel integer
音频声道数,1(mono) / 2(stereo),默认为 1。
enable_speaker boolean
是否启用说话人分离,channel 为单声道时有效,默认 false。
speaker_num integer
说话人数量(仅当启用说话人分离时有效),默认自动识别人数。
speaker_ids string[ ]
注册声纹ID(仅当启用说话人分离时有效),最多支持10个
word_info boolean
是否返回单词级别的时间戳,默认 false。
context string
上下文,用于指定模型的上下文信息,限制 500 字。
hotwords string[ ]
热词列表,热词个数<=200,每个热词<=5 字符。
响应体结构
task_idstring
base_respobject
base_resp.status_codeinteger
base_resp.status_msgstring
