Umi-OCR 离线 OCR 上手指南:5 步把截图和 PDF 批量转成文字
Umi-OCR 离线 OCR 上手指南5 步把截图和 PDF 批量转成文字【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费、开源的离线 OCR 工具Windows 和 Linux 均可运行解压后无需联网即可把屏幕、图片和 PDF 里的文字转成可编辑文本。本文带你从零跑通第一次文字识别再覆盖批量导入、排版解析和常见坑点适合第一次接触离线 OCR 的用户。 首次运行5 步跑通 Umi-OCR下载并解压。获取.7z发布包或.7z.exe自解压包适合没装压缩软件的电脑解压即可软件无需安装。仓库里也附了一份 RapidOCR 引擎的 Umi-OCR_Rapid_v2.1.5.7z 可以直接参考。启动程序。双击解压目录中的Umi-OCR.exe。首次打开时界面语言会按你的系统语言自动切换。完成第一次截图识别。切到「截图OCR」标签页按快捷键框选一块屏幕松开鼠标后识别结果立即出现在右侧。复制文字。左侧图片预览里可以直接用鼠标划选复制右侧识别记录支持编辑文字也能框选多条记录一起复制。可选设为开机自启。进入「全局设置」→「快捷方式」勾选桌面、开始菜单和开机自启。日常最高频的用法就到这里想识别哪块屏幕就框哪块Esc可随时取消截图。如果你在别处复制了图片也可以直接粘贴到「截图OCR」页面识别。✂️ 截图 OCR日常取字的最快路径「截图OCR」页面的分工很明确左栏放图片预览右栏放识别记录。右侧记录支持右键操作例如复制、全选、复制图片、删除选中记录、清空全部记录处理大段文字时比手动逐条复制省事。每个标签页都有独立的「设置」面板可以分别调整识别语言、是否自动纠正文字方向、识别后的操作如复制到剪贴板、是否弹出主窗口等。截图页的参数同样作用于命令行调用这一点做自动化时要注意。 批量 OCR一次导入几百张图片要处理一堆图片时切到「批量OCR」标签页点「选择图片」导入本地图片左侧列表会显示每张图的耗时、置信度和状态右侧实时滚动识别记录。输入格式jpg, jpe, jpeg, jfif, png, webp, bmp, tif, tiff。输出格式txt, jsonl, md, csv(Excel)可存到原目录或指定目录。数量没有上限官方说明支持一次导入几百张图片任务完成后还可以自动关机或待机。支持任务预览批量页带有图片预览窗口点击列表即可查看原图。批量任务建议按「同类型图片、同一套参数」组织比如一批论文截图用一套语言设置一批代码截图换用「保留缩进」方案避免混在一起反复改参数。 文档识别与二维码两个容易被忽略的页签文档识别面向 PDF 类文件支持格式pdf, xps, epub, mobi, fb2, cbz。既能对扫描件做 OCR也能提取原本就有的文本并可输出双层可搜索 PDF——扫描版 PDF 转成能全文搜索的版本这是它最实用的场景之一。支持设定忽略区域专门用来排除页眉、页脚。长任务可设置完成后自动关机/休眠适合下班前丢几百页扫描件跑着。二维码页分两半上半部分扫码支持截图、粘贴或拖入本地图片支持一图多码覆盖 QRCode、DataMatrix、EAN13、PDF417 等 19 种协议下半部分生成码输入文本即可生成二维码图片可选协议和纠错等级。 排版解析与忽略区域让文字更好读OCR 引擎输出的文字常常是按字块顺序的读起来像打散的句子。Umi-OCR 的文本后处理负责把顺序和换行整理好各预设方案的适用场景如下排版解析方案适用场景多栏 - 按自然段换行大部分情景自动识别多栏布局多栏 - 总是换行每段语句都强制换行多栏 - 无换行把所有语句合并到同一行单栏 - 按自然段换行 / 总是换行 / 无换行单栏文档不区分多栏单栏 - 保留缩进代码截图保留行首缩进和行中空格不做处理引擎原始输出这些方案都能自动处理横排和竖排从右到左的排版竖排文字需要 OCR 引擎本身支持。忽略区域则用来排除干扰文字入口在批量识别页右栏设置中按住右键绘制多个矩形框把水印、LOGO、页眉页脚盖住即可框建议画大一些完全包裹住干扰文字可能出现的位置。注意规则只有完全落在框内的整个文本块才会被忽略而不是单个字符框边缘压住的文字仍会保留。⚙️ 全局设置语言、主题与 OCR 引擎「全局设置」页管理整软件的行为常用项快捷方式一键创建桌面/开始菜单快捷方式设置开机自启。语言支持简体中文、繁体中文、英语、日语等也可以手动切换。外观多个亮/暗主题、字体、界面大小比例均可调整。OCR 插件可在 PaddleOCR 与 RapidOCR 两套离线引擎之间切换前者速度稍快后者兼容性更好。渲染器界面默认走显卡加速渲染如果你的机器出现截图闪烁、UI 错位就切换渲染方案或关闭硬件加速详见下节避坑。仓库的 dev-tools/i18n/ 目录提供了翻译工程工具和步骤文档有兴趣参与界面本地化可以从这里入手。 避坑3 个高频问题与解决办法超大图、长图识别不了或很慢。批量页的「设置 → 文字识别 → 限制图像边长」默认会限制图片尺寸遇到像素超大的长图或大图时把这个数值调高再跑。批量任务耗时较长一批命令跑完前不要急着发下一条。水印、页眉页脚混进结果。用「忽略区域」画矩形排除处理 PDF 时同样可以设忽略区域去掉页眉页脚。画框时记住整块文本被忽略的规则框要完整包住干扰区域。截图时界面闪烁、UI 错位或命令行没有反应。前者去「全局设置 → 界面和外观 → 渲染器」换渲染方案或关硬件加速后者先确认全局设置里 HTTP 服务处于允许状态默认开启选「仅本地」即可命令行依赖这个本地环回服务与后台进程通信不会经过外部网络。另外用 HTTP 接口时尽量避免并发调用长时间大批量连续请求偶发连接报错时重试一次通常就能恢复原因见 HTTP 接口手册 的注意事项。 进阶命令行与 HTTP 接口需要自动化时入口仍是Umi-OCR.exe简写umi-ocr常用指令umi-ocr --screenshot唤起截图识别screen0 rectx,y,w,h可做无需鼠标的范围截屏。umi-ocr --path D:/img1.png D:/image/test识别指定图片或整个文件夹含子文件夹多个路径用空格分隔。umi-ocr --clipboard识别剪贴板里的图片。输出控制--clip复制到剪贴板--output file.txt覆盖写入--output_append或--追加写入。二维码--qrcode_read扫码、--qrcode_create生成码。两个实际提醒系统管道重定向符和|在 Umi-OCR 上可能失效程序间调用可改用 HTTP 转发命令行截屏、粘贴、路径类指令的 OCR 参数继承「截图OCR」页的设定不想弹主窗口就在那里关掉对应选项。完整的指令含高级模块调用见 官方 CLI 文档HTTP 接口覆盖图片 OCR、文档识别和二维码三类能力见 docs/http/README.md。功能更新可查 CHANGE_LOG.md。第一次使用建议按本文顺序走一遍先截图跑通再批量导入最后按文档类型挑排版方案——离线 OCR 的大部分价值就藏在这三步里。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考