文档矫正增强V2
更新时间:2026-09-10
接口描述
对试卷、卡证、票据等内容进行智能主体检测,自动定位四角并精准提取主体内容,完成高精度透视矫正;V2 版本全面升级,支持图片增强、进一步锐化文字笔画、提升画面清晰度,让主体内容检测、矫正增强一步到位,全面提升图片质量。

请求说明
请求示例
HTTP 方法: POST
请求URL: https://aip.baidubce.com/rest/2.0/ocr/v1/doc_crop_enhance_v2
URL参数:
| 参数 | 值 |
|---|---|
| access_token | 通过API Key和Secret Key获取的access_token,参考“Access Token获取” |
Header如下:
| 参数 | 值 |
|---|---|
| Content-Type | application/x-www-form-urlencoded |
Body中放置请求参数,参数详情如下:
请求参数
| 参数 | 类型 | 是否必须 | 说明 |
|---|---|---|---|
| image | string | 和 url/pdf_file 三选一 | 图像数据,base64编码后进行urlencode,要求base64编码和urlencode后大小不超过4M,最短边至少15px,最长边最大4096px,支持jpg/jpeg/png/bmp格式 优先级:image > url > pdf_file,当image字段存在时,url、pdf_file字段失效 |
| url | string | 和 image/pdf_file 三选一 | 图片完整url,url长度不超过1024字节,url对应的图片base64编码后大小不超过4M,最短边至少15px,最长边最大4096px,支持jpg/jpeg/png/bmp格式 优先级:image > url > pdf_file,当image字段存在时,url字段失效 请注意关闭URL防盗链 |
| pdf_file | string | 和 image/url 三选一 | PDF文件,base64编码后进行urlencode,要求base64编码和urlencode后大小不超过4M,最短边至少15px,最长边最大4096px 优先级:image > url > pdf_file,当image、url字段存在时,pdf_file字段失效 |
| pdf_file_num | string | 否 | 需要识别的PDF文件的对应页码,当 pdf_file 参数有效时,识别传入页码的对应页面内容,若不传入,则默认识别第 1 页 |
| scan_type | int32 | 否 | 选择是否对图片内主体内容进行四角点增强或矫正,可选值如下: - scan_type = 1:只做检测,不对主体进行矫正,返回主体四角点坐标,可用作前端页面展示 - scan_type = 2:默认值,检测并矫正,返回主体在原图中的四角点坐标以及矫正后的图像 |
| points | array | 否 | 如 scan_type = 2,则需传入此参数,左上角起顺时针汇总四角点坐标为[{x1,y1},{x2,y2},{x3,y3},{x4,.y4}] |
| enhance_type | int32 | 否 | 选择是否开启图像增强功能,如开启可选择增强效果,可选值如下: - enhance_type =0:默认值,不开启增强功能 - enhance_type = 1:增强并锐化 |
返回说明
返回参数
| 参数 | 类型 | 是否必须 | 说明 |
|---|---|---|---|
| log_id | uint64 | 是 | 唯一的log id,用于问题定位 |
| image_processed | string | 是 | 返回处理后的图片 |
| points | array[] | 否 | 检测到的图片内主体在原图中的四角点坐标,顺序固定为左上、左下、右下、右上。坐标系为上传的原图,可直接用于在原图上绘制 |
| pdf_file_size | string | 否 | 传入PDF文件的总页数,当 pdf_file 参数有效时返回该字段 |
返回示例
{
"image_processed":"/9j/4AAQSkZJRgABAQAAAQABAAD/2wBDAAYEBQYFBACUoKSj/2w"
"points": [
{
"x": 462,
"y": 122
},
{
"x": 305,
"y": 1521
},
{
"x": 1745,
"y": 1406
},
{
"x": 1341,
"y": 196
}
],
"log_id": 2098017318853891227
}