文档信息抽取与分类

上传图片或PDF文件与提示词,同步返回结构化信息抽取结果。
POST/v1/ocr/image/extract

授权

Authorizationstringheader必填
HTTP: Bearer Auth

请求头

Content-Typeenum<string>默认值:multipart/form-data必填

请求体为表单数据,请使用multipart/form-data上传文件与字段。

可用选项:multipart/form-data

请求体multipart/form-data

modelenum<string>必填

模型 ID。取值及作用场景如下:
  • u1-ocr:通用场景(发票/收据/报销单/费用清单提取与对账);支持 PDF
  • u1-ocr-med:医疗场景(病历/检验报告/处方/费用清单/收费清单与费用明细票据卡证核验);仅图片,不支持 PDF

type enum<string> 必填

文件类型。取值:

  • image:图片类型(u1-ocr / u1-ocr-med 均可用)
  • pdf:PDF文件类型(仅 model=u1-ocr)

file string 必填

需要抽取的图片或者pdf文档,支持url和base64。

支持图片格式:JPG、JPEG、PNG、BMP。图片≤10MB,PDF≤20MB

prompt string 必填

提示词,用于指导模型抽取指定信息。

示例:请提取图片中信息,schema如下:{"invoice_no":"发票号码","date":"开票日期","items":[{"name":"项目名称","total":"金额"}]}

page_begin integer 选填

传入pdf时,开始解析的页码,默认值为1。

page_end integer 选填

传入pdf时,结束解析的页码,默认到最后一页

dpi integer 选填

PDF 渲染 DPI;默认 150,范围 72 ~ 600。仅 PDF 生效。

响应体结构

contentstring

模型抽取结果(字符串)。按文件类型:
  • 图片:文本或 JSON 字符串
  • PDF:按页升序的 JSON 数组字符串,需先 JSON.parse,元素结构见下方子属性

content[].pageinteger

页码,从 1 开始

content[].contentobject

该页抽取结果

usageobject

Token 消耗统计对象。

usage.prompt_tokensinteger

输入 Token 数量

usage.completion_tokensinteger

输出 Token 数量

usage.total_tokensinteger

总 Token 消耗量

base_respobject

本次请求的状态码及其详情

base_resp.status_codeinteger

状态码(0=正常;100001=参数错误;261001=图片格式不支持;261003=图片损坏或无法解析;100601=文件或请求体超限;100502=触发 TPM 限流;100997=模型处理超时;100999=系统内部错误)

base_resp.status_msgstring

状态详情