资讯 文档
技术能力
语音技术
文字识别
人脸与人体
图像技术
语言与知识
视频技术

实体抽取数据的标注与转换

实体抽取数据的标注

  • EasyData为百度大脑推出的一站式数据处理和服务平台,主要围绕AI开发过程中所需要数据采集、数据清洗、数据标注等业务需求提供完整的数据服务。目前EasyData已经支持图片、文本、音频、视频四类基础数据的处理。同时EasyData已与EasyDL数据管理打通,可以将EasyData处理的数据应用于EasyDL模型训练。
  • 目前EasyData在实体抽取上为用户提供了非常方便的在线标注工具,同时标注完的结果也可以随时导出到用户账号下关联的bos服务上,然后通过bos进行下载;
  • 实体数据标注好后,需要转换成文心开发套件可读取的格式才能进行训练。因此文心提供了EasyData标注数据的格式转换工具。下文将详细介绍该工具。

实体抽取数据的转换

进入目录

首先进入文本分类的示例代码目录./wenxin/wenxin/data/data_format_convert/ 。

cd ./wenxin/wenxin/data/data_format_convert/ 

代码结构说明

.                                                      
├── demo_data											## 示例数据文件夹
│   ├── entity_bio_wenxin.txt			## 文心支持的BIO格式数据示例
│   └── entity_easydata.json			## easydata标注数据后导出的json格式数据示例
└── data_format_convert.py				## 实体抽取数据的转换脚本

使用说明

  • 为了方便使用文心的用户,需要把json格式的标注数据文件转成文心实体抽取任务支持的格式(bio标签下的文本格式);

    下载的json数据文件如下:

    实体抽取json文件

    运行data_format_convert.py转换数据

    python data_format_convert.py --origin_file ./demo_data/entity_easydata.json --convert_file entity_bio_wenxin.txt --labelmap_file label_map.txt --fun e_to_bio

    转换后的bio数据如下:

    文心BIO

  • 为了把文心支持的bio文本数据转成xlsx格式,并上传到EasyData进行云端处理;也准备了对应的功能:

    python data_format_convert.py --origin_file ./demo_data/entity_bio_wenxin.txt --convert_file entity_easydata.xlsx --fun e_to_easydata

    转换后的xlsx数据如下:

    easydata数据格式

脚本参数说明

  • origin_file:待转换文件路径;
  • convert_file:转换后的文件路径;
  • fun:使用的数据转换服务,共分为:

    • e_to_bio:实体抽取标注数据由easydata的json格式转换为文心支持的BIO格式
    • e_to_easydata:实体抽取标注数据由文心支持的BIO格式转换为easydata支持的excel格式
  • labelmap_file:待生成的label_map文件路径(若为e_to_bio必填);
  • split_char:分隔符。