Paddle Dataset是Paddle生态中的数据源抽象,至少需要提供两个方法
def __getitem__(self, idx):
)
def __len__(self):
)
将自己的数据封装为Dataset后可以配合高层API使用,也可以享受Paddle生态的各种加强,比如批量加载等。
Paddle内部包含一些常用的数据集,比如MNIST。常用数据集的封装还包含了自动下载,非常适合新手使用。
WildReceipt数据集作为文本关键信息提取的基准,无论从数据量还是结构上,都要优于其他公开的数据集。主要用于文档的关键信息提取训练。这里演示下怎么制作Dataset。
数据集结构
制作数据集的第一步是了解数据集,了解数据集的结构和需要的输出,这里的输出可能需要关联具体的模型。
这里使用WildReceipt + SDMGR进行演示。
WildReceipt数据集主要分两部分,一部分是图片本身,一部分是区域标注。这部分信息存储在txt文件中,图片放在images目录中。由于是在Paddle中,这里直接使用https://paddleocr.bj.bcebos.com/ppstructure/dataset/wildreceipt.tar。
下面是数据的一些片段
image_files/Image_12/10/845be0dd6f5b04866a2042abd28d558032ef2576.jpeg [{"label": "Store_name_value", "transcription": "CHOEUN", "points": [[114.0, 19.0], [230.0, 19.0], [230.0, 1.0], [114.0, 1.0]]}, {"label": "Store_name_value", "transcription": "KOREANRESTAURANT", "points": [[97.0, 35.0],
…