快速入门
智能文档分析平台是一款基于百度文心大模型赋能的智能文档助手,集文档格式转换、合同审查、文档比对、文档抽取、文档解析等功能于一体,致力于打造高效便捷的文档处理方案。它助力企业轻松驾驭海量文档,不仅提升工作效率,更精准规避潜在风险,是企业文档管理的得力助手。本文档将为新用户提供轻松入门的流程以及相关注意事项的介绍,帮助您快速上手智能文档分析平台。
一、注册与认证
(一)账号注册
请参考文档并注册百度智能云账号;若您已经注册百度智能云账号,可忽略此步骤。

(二)实名认证
请参考文档进行实名认证。完成个人实名或企业实名认证后,方可获得免费额度赠送;若您已经在百度智能云完成实名认证,可忽略此步骤。

二、获取免费资源
注意:
- 每个智能文档分析功能均可领取200页免费测试资源
- 在线工具和API服务的额度为共享互通,在一个平台上领取免费额度后,无法在另外一个平台上重复领取;
- 免费测试资源使用完毕后,可开通付费或申请免费调额。
(一) 在线工具领取
- 登录智能文档分析平台,根据您的需求选择相应的功能。

- 新用户首次进入功能页面后,即自动领取200页免费配额。每个功能的额度是相互独立的。

(二)API服务领取
- 登录 文字识别控制台。如果您已经完成了实名认证,系统将自动发放免费测试资源到您的账户上。
- 领取成功的免费测试资源将会显示在资源列表的「已领取资源」中。您可以选择「查看领取记录」去往「资源列表」查看。刚领取的资源大约5分钟生效,若领取接口长时间未在「资源列表」上生效显示,可提交工单咨询。

三、功能操作指南
接下来将引导您快速熟悉在线工具的各项功能,带您快速入门。API版的操作指南请查看API文档
(一)文档格式转换
【适合场景】图片 / PDF / OFD 转 Word、Excel、双层 PDF、双层 OFD,便于二次编辑与档案电子化。
【操作步骤】
- 进入文档格式转换页面后,系统会展示一份内置的「图片转Word」示例,供您参考。

- 在「转换类型」下拉框中选择所需的转换类型。

- 将文件拖拽至上传区域,或点击上传文件,文件上传完成后,点击「开启文档格式转换」按钮,即可提交转换任务。

- 任务处理完后,页面左侧展示源文件,页面右侧展示识别结果。鼠标悬停在识别结果上时,左侧对应文本会有高亮显示,点击「复制文本」按钮即可复制转换后的结果,点击「导出结果」按钮即可下载转换后的格式文件。

(二)合同审查
【适合场景】买卖、采购、租赁等合同的风险预审,定位条款原文并给出风险说明与修改参考。
【操作步骤】
- 进入合同审查页面后,系统会展示内置的的审查示例,供您参考。

- 点击「审查清单」选项框,选择您所需的合同审查类型。

- 拖拽文件至上传区域或点击上传,单次支持上传最多10份文件。

- 合同审查页面点击「审查清单管理」,可对审查清单进行新增、编辑等管理操作。

- 进入审查清单管理页面后,左侧清单列表展示预置清单,并支持新建清单;右侧展示清单详情,包括条款列表、条款说明及风险点。您还可以通过右上角切换审查立场、编辑清单或发起审查。

- 上传文件并编辑完审查清单后,点击「开始合同审查」按钮提交任务。

- 任务处理完后,页面中间区域展示源文件,页面右侧展示各个条款的审查结果。您可以查看每个条款的审查结果以及原文中相应的位置。

- 您可以点击任意条款名称,可以在原文中快速定位到该条款。

- 点击「导出结果」按钮即可将审查结果导出成带批注的Word文件。

(三)文档比对
【适合场景】合同改稿、制度修订、版本核验等,快速定位两版文档的增删改差异。
【操作步骤】
- 进入文档比对页面后,系统会展示一份内置的文档比对示例,供您参考。

- 选择您希望保留的特殊差异识别,拖拽上传主版和副版文件至上传区域或点击上传。上传文件后,点击「开始文档比对」按钮提交任务。

- 任务处理完后,页面中间区域展示源文件,页面右侧展示主版和副版之间的差异项。总共有「新增」、「删除」、「修改」三项。
- 您可以点击页面右侧卡片或中心的图标来定位原文中差异的位置。
- 您可以点击「新增」「删除」「修改」按钮,对任务文件进行差异筛选管理。

- 点击「导出结果」按钮即可下载比对差异结果的报告。

(四)文档抽取
【适合场景】从卡证、表单、合同、报关单、标书等文档中,按自定义抽取清单抽取关键信息(无需单独训练模型)。
【操作步骤】
- 进入文档抽取页面后,系统会展示一份内置的文档抽取示例,供您参考。

- 可以选择抽取场景以及进行抽取预处理。
- 抽取场景:「通用文档」侧重复杂版面理解,适用于图文混排文档;「长文档」侧重语义召回与定位,适用于纯文本型文档。
- 抽取预处理:支持印章抽取、水印去除、图像矫正增强。

- 完成文件解析后,配置需要抽取的字段,配置完成后点击「发起抽取」按钮提交抽取任务。

- 完成文件解析后,配置需要抽取的字段,配置完成后点击「发起抽取」按钮提交抽取任务。

- 在字段清单模式中,单个字段是指一个独立的字段值,例如境内收货人;组合字段是指一组相互关联的字段值,例如货物信息可包含商品编码、数量、单价等。您还可以复制清单 ID,调用文档抽取 API 时,传入该清单 ID,系统即可按照对应清单执行文档抽取任务。

- 在prompt清单模式下,您可以使用自然语言描述所需字段,系统将据此直接抽取。

- 任务处理完后,页面中间区域展示源文件,页面右侧【查看抽取结果】选项下展示最终抽取结果。点击「导出结果」按钮可以下载json格式文件。

- 您可以点击页面右侧抽取结果中的字段来定位原文中差异的位置。

(五)文档解析
【适合场景】将 PDF、图片等非结构化文档解析为版面、表格、阅读顺序、标题层级等结构化信息,输出 Markdown / JSON,便于知识库、RAG、大模型语料与二次开发。
【操作步骤】
- 进入文档解析页面后,系统会展示一份内置的文档解析示例,供您参考。

- 在「模型选择」中选择适合业务需求的模型。
- 文档解析(标准版):支持 DOC、XLSX、PPT 等 18 种格式及 20 余种语言,可输出文档切片、标题层级树、页面角度等信息,适用于多格式通用场景。
- 文档解析(PaddleOCR-VL):可精准识别手写文本、公式、印章、图表及不规则布局,支持 100 余种语言和跨页结构解析,适用于复杂文档场景。

3.上传待解析文件,根据实际需求配置解析参数、解析范围及相关能力,确认无误后点击「开始文档解析」。

4.在结果页切换版本,可点击「修改参数」调整参数重新解析。

- 任务状态变为「成功」后,页面中间区域展示预览带版面框选的原文;右侧可切换 JSON、表格、图片、公式、手写签名、页眉页脚等视图,并支持复制/下载。

6.您可以点击页面右侧抽取结果中的字段来定位原文中差异的位置。

