文档信息抽取与分类
上传图片或PDF文件与提示词,同步返回结构化信息抽取结果。
POST/v1/ocr/image/extract
授权
Authorizationstringheader必填
HTTP: Bearer Auth
- Security Scheme Type: http
- HTTP Authorization Scheme: Bearer API_key,用于验证账户信息,可在 按量计费&资源包>API Key 管理 中查看。
请求头
Content-Typeenum<string>默认值:multipart/form-data必填
请求体为表单数据,请使用multipart/form-data上传文件与字段。
可用选项:multipart/form-data
请求体multipart/form-data
modelenum<string>必填
模型 ID。取值及作用场景如下:
- u1-ocr:通用场景(发票/收据/报销单/费用清单提取与对账);支持 PDF
- u1-ocr-med:医疗场景(病历/检验报告/处方/费用清单/收费清单与费用明细票据卡证核验);仅图片,不支持 PDF
type enum<string> 必填
文件类型。取值:
- image:图片类型(u1-ocr / u1-ocr-med 均可用)
- pdf:PDF文件类型(仅 model=u1-ocr)
file string 必填
需要抽取的图片或者pdf文档,支持url和base64。
支持图片格式:JPG、JPEG、PNG、BMP。图片≤10MB,PDF≤20MB
prompt string 必填
提示词,用于指导模型抽取指定信息。
示例:请提取图片中信息,schema如下:{"invoice_no":"发票号码","date":"开票日期","items":[{"name":"项目名称","total":"金额"}]}
page_begin integer 选填
传入pdf时,开始解析的页码,默认值为1。
page_end integer 选填
传入pdf时,结束解析的页码,默认到最后一页
dpi integer 选填
PDF 渲染 DPI;默认 150,范围 72 ~ 600。仅 PDF 生效。
响应体结构
contentstring
模型抽取结果(字符串)。按文件类型:
- 图片:文本或 JSON 字符串
- PDF:按页升序的 JSON 数组字符串,需先 JSON.parse,元素结构见下方子属性
content[].pageinteger
页码,从 1 开始
content[].contentobject
该页抽取结果
usageobject
Token 消耗统计对象。
usage.prompt_tokensinteger
输入 Token 数量
usage.completion_tokensinteger
输出 Token 数量
usage.total_tokensinteger
总 Token 消耗量
base_respobject
本次请求的状态码及其详情
base_resp.status_codeinteger
状态码(0=正常;100001=参数错误;261001=图片格式不支持;261003=图片损坏或无法解析;100601=文件或请求体超限;100502=触发 TPM 限流;100997=模型处理超时;100999=系统内部错误)
base_resp.status_msgstring
状态详情