Umi-OCR 完整指南:截图、批量图片与扫描 PDF 的免费离线 OCR
发布时间:2026/9/5 17:54:45 锦皓数字建站

Umi-OCR 完整指南截图、批量图片与扫描 PDF 的免费离线 OCR【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费、开源、完全离线的 OCR 软件识别过程全部在本地引擎中完成。它覆盖屏幕截图文字识别、批量图片识别、扫描版 PDF 提取以及二维码的扫码与生成解压后就能用不需要联网、也不涉及任何安装。项目定位Umi-OCR 是什么一句话概括它是一个跑在你自己电脑里的文字识别工具箱图片不会流向任何外部服务器扫描件和内部文档可以放心处理断网状态下功能也照常可用。核心能力一览功能说明截图 OCR快捷键唤起截屏框选即识别结果可编辑、可划选复制批量 OCR一次导入几百张图片无数量上限支持导出 txt / jsonl / md / csv文档识别解析 PDF、xps、epub、mobi、fb2、cbz可输出双层可搜索 PDF二维码截图、粘贴或拖入图片读取条码也支持输入文本生成二维码图外部调用提供命令行与 HTTP 接口方便脚本和其他程序接入软件适配 Windows 7 x64 与 Linux x64首次启动时会跟随系统自动选择界面语言。安装与首次运行解压即用获取发布包使用仓库根目录下的Umi-OCR_Rapid_v2.1.5.7z没有解压缩软件的机器可以改用配套的.7z.exe自解压包也可以自行克隆代码git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR构建。把压缩包释放到任意目录整个软件没有安装环节也不挑路径。运行Umi-OCR.exeLinux 下为umi-ocr.sh打开主程序。切到「截图OCR」标签页点左侧工具栏的截屏图标在屏幕上拖出一个矩形框。松开鼠标识别出的文字就落在右侧「记录」面板随时可以划选复制。界面左侧是被截取的代码图片预览下方有「隐藏文本」开关和缩放比例右侧「记录」页签列出识别文字右上角是「滚动」开关与「清空」按钮。实战场景从一张截图到一整批文件截图识别网页文字适合网页正文、聊天截图、屏幕中的代码这类零散需求。进入「截图OCR」页后点截屏图标拖框选定区域即可也可以在别处复制一张图片直接粘贴进来识别。左侧预览栏支持鼠标划选右侧「记录」栏允许编辑文字、跨多条记录划选后一次性复制右键还有「复制CtrlC」「全选CtrlA」「复制图片」等快捷入口。图中左侧是带选区的文档截图右键菜单列出复制、全选、复制图片、显示/隐藏文字等选项右侧「记录」面板按时间排列每次识别的结果。批量导入图片文件夹几十张图不想一张张开「批量OCR」页点「选择图片」文件或整个文件夹都能加入队列支持jpg、png、webp、bmp、tif等常见格式且没有数量上限。右侧设置区确认语言、排版解析等参数后点「开始任务」顶部进度条会实时给出耗时、完成数与百分比「记录」面板逐张展示识别文本并附带置信度。长图或超大图若识别精度不理想可在设置里调高「限制图像边长」的数值任务结束后还能自动关机或待机。左侧列表已排入 13 张图片进度条显示「1.4s 3/13 23%」「开始任务」按钮就在旁边右栏「记录」按文件名分组列出文字每条标注时间与置信度。扫描版 PDF 数字化「文档识别」页面向扫描件工作按页解析文档先做 OCR再把文字整理成可保存的纯文本或者生成「双层 PDF」——原扫描画面保持不动上面叠加一层可搜索、可复制的文字版式观感完全不变。它同样支持设置忽略区域来剔除页眉页脚多个文档可一次加入识别参数与批量图片页共用一套配置不用重复调。提升准确率排版解析与三个调优点排版解析方案决定引擎找到文字块之后怎么排序换行选错方案会让输出顺序混乱方案适合什么内容多栏-按自然段换行报纸、网页等多栏文档默认选择单栏-保留缩进代码截图、缩进文本行首空格原样保留多栏-无换行表格与密集排版输出连续文本单栏-总是换行每行都是独立短句的场景不做处理直接采用引擎原始输出排除干扰在「忽略区域」编辑器里按住右键画矩形框把水印、LOGO、页眉页脚包住任务执行时位于框内的整个文本块会被直接舍弃框尽量画大一些盖住水印可能出现的全部位置。「记录」面板每条结果上方都标着耗时和置信度如 0.92数值明显偏低时换更清晰的源图或在设置里把「限制图像边长」从默认 960 调高精度通常会有改善对记录右键可以删除单条或清空全部。方向纠偏遇到倾斜、倒置的文字打开「文本方向纠偏」引擎会先判断方向再识别准确率提升速度会略降。进阶调用命令行与 HTTP 接口主程序本身就是命令行入口。前提是「全局设置」页里保持允许 HTTP 服务默认开启主机选「仅本地」即可因为指令是通过系统内部环回传给后台进程的不走物理网卡。umi-ocr --screenshot --clip umi-ocr --path D:/notes/img1.png --output text.txt umi-ocr --help第一条发起截屏识别并把结果送进剪贴板第二条识别指定文件也接受文件夹、多路径写结果到text.txt指令还支持简写如--screenshot可缩成--sc。完整参数见 命令行手册。程序化接入则走 HTTP 接口服务默认监听 1224 端口图片识别调用 POST/api/ocr请求体传图片的base64字符串与可选的options参数字典把data.format设为text就只拿识别文本GET/api/ocr/get_options能查询当前引擎支持的全部参数及默认值。二维码识别/生成、PDF 文档识别也各有对应接口详见 HTTP 接口文档。「全局设置」页的服务区控制 HTTP 开关与监听地址保持「仅本地」时只有本机能发起请求。常见问题识别时必须联网吗不需要。识别由内置离线引擎完成断网环境一样工作HTTP 服务也只在本机环回上通信默认主机就是「仅本地」。识别语言在哪里切换「截图OCR」「批量OCR」右侧设置里可以切换简体、繁体、英文、日文、韩文等模型库混合语言的文档按文字主体选一套即可。倾斜或倒着的文字认得出来吗可以。开启「文本方向纠偏」后引擎先判方向再识别代价是速度略有下降。结果存在哪、怎么带走默认展示在右侧「记录」面板直接复制或导出即可批量任务可导出txt、jsonl、md、csv四种格式命令行调用还能用--output把结果直接写进文本文件。从一张随手截图到一整批扫描件日常遇到的文字提取活计基本都被 Umi-OCR 收进了一个窗口里而且它自始至终不碰外网 相关资源CHANGE_LOG.md历次版本更新记录docs/README_CLI.md命令行完整手册含范围截屏与高级指令docs/http/README.md 与 docs/http/api_ocr.mdHTTP 接口总览及参数细节Umi-OCR_Rapid_v2.1.5.7z仓库根目录的发布包解压即可运行【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
锦
锦皓数字建站
深耕本土企业品牌数字化升级,专注原创端正雅致商务官网,从视觉设计到稳定运维全程保驾护航。