票据字段检测数据集 | 票据检测 字段识别 财务自动化 目标检测 YOLO格式 深度学习数据集 计算机视觉9045期
发布时间:2026/9/3 20:52:56 锦皓数字建站

票据字段检测数据集 | 票据检测 字段识别 财务自动化 目标检测 YOLO格式 深度学习数据集 计算机视觉9045期数据集概述本数据集专注于票据/收据关键字段的视觉检测服务于智能财务、文档自动化处理及OCR预标注。数据涵盖票据中的八个核心信息字段适配票据自动录入、财务审核及信息提取等应用。数据集核心信息数据要素详细说明类别共8类日期、标题、地址、项目明细、订单号、小计、税额、总价数量1700张图像格式图像为 JPG/PNG标签为 YOLO 格式的 txt 文件水平边界框应用价值1.财务自动化支撑票据信息的快速结构化提取减少人工录入工作量。2.报销审核辅助财务人员快速定位关键字段提升审核效率与准确性。3.数据分析为消费数据分析、预算管理提供标准化的票据数据输入。数据三要素解析类别与字段覆盖数据集定义8类票据核心字段日期Date交易发生的日期。标题Title票据标题或商户名称。地址Address商户地址信息。项目明细Item购买的商品或服务项目列表。订单号OrderId订单唯一标识号。小计Subtotal税前金额合计。税额Tax应缴税额。总价TotalPrice含税总金额。这些字段覆盖了票据信息录入所需的最核心内容具有明确的财务应用导向。数据规模与格式图像总量约1700张规模适中适合作为票据文本检测任务的基准数据集。采用通用YOLO 格式txt每张图像对应一个同名标签文件包含类别 ID 与归一化边界框坐标可直接接入 YOLOv5、YOLOv8 等主流检测框架。图像与标签一一对应数据结构规范便于进行训练/验证集划分与预处理集成。应用与扩展数据集可扩展用于票据类型分类如增值税发票、小票、电子票、字段内容识别结合OCR及异常票据检测。可结合OCR引擎如 Tesseract、PaddleOCR构成完整的票据信息提取流水线。数据可迁移至合同、表单等类似结构化文档的字段检测任务。知识普及票据字段检测的技术要点版面多样性不同商户票据的排版方式差异大字段位置、字体、大小不一模型需具有较好的版面适应性。紧密关联的字段标题与地址常相邻小计、税额与总价在位置和数值上关联检测后引入规则校验可提升识别一致性。干扰与噪声票据背景、水印、折叠痕迹等可能干扰字段检测建议采用图像增强与噪声抑制预处理。应用流程本数据集提供的是字段区域检测而非字符识别OCR。实际系统中可先用本模型定位字段区域再对每个区域调用OCR引擎读取文本内容实现完整的信息结构化。快速开始代码示例配置文件data.yaml示例train:./dataset/images/trainval:./dataset/images/valnc:8names:[date,title,address,item,orderid,subtotal,tax,totalprice]启动 YOLOv8 训练fromultralyticsimportYOLO modelYOLO(yolov8m.pt)model.train(datadata.yaml,epochs100,imgsz640,batch16)标签票据检测字段识别财务自动化目标检测YOLO格式深度学习数据集计算机视觉
锦
锦皓数字建站
深耕本土企业品牌数字化升级,专注原创端正雅致商务官网,从视觉设计到稳定运维全程保驾护航。