hiroi-sora / Umi-OCR · v2.1.5
下载 releases →

Umi-OCR 文字识别工具

免费,开源,可批量的离线 OCR 软件。适用于 Windows7 x64 及 Linux x64。

v2.1.5 · 三周年版本 MIT 开源协议 Windows / Linux 100+ 语言 100% 离线运行 Paddle / Rapid 双引擎

免费:本项目所有代码开源,完全免费,无广告、无捆绑、无付费功能。

方便:解压即用,离线运行,无需网络,不上传任何图片到服务器。

高效:自带高效率离线 OCR 引擎,内置多种语言识别库,多线程并发处理。

灵活:支持命令行、HTTP 接口等外部调用方式,方便集成到工作流中。

功能:截图 OCR / 批量 OCR / PDF 文档识别 / 二维码 / 数学公式。

免费下载 v2.1.5 查看功能说明 版本对比
目录

功能说明

Umi-OCR 提供五种主要文字识别功能,覆盖日常提取文字的绝大多数场景。所有识别过程都在本地完成,图片不会上传到任何服务器。

截图 OCR快捷键 Win+Alt+C

按下快捷键唤起截图工具,截取屏幕任意区域后自动识别图中的文字。左侧预览栏可划选局部区域,右侧识别记录栏可编辑、复制、导出。

截图 OCR · 界面示意
预览 · Preview
截图区域(可划选局部)
识别结果 · Result
Umi-OCR 是一款免费开源的
离线 OCR 文字识别软件,
支持截图、批量、文档识别。
# 128 characters

批量 OCR

一次性导入数百张图片,Umi-OCR 自动多线程并发识别,结果可批量导出。适合整理扫描件、发票、学习资料等大批量场景。

批量 OCR · 界面示意
01screenshot_2026_01.png已完成
02screenshot_2026_02.png已完成
03screenshot_2026_03.png已完成
04screenshot_2026_04.png识别中
05screenshot_2026_05.png等待中

PDF / 文档识别

导入 PDF 或扫描件图片,逐页识别文字内容,保留原文档段落结构,输出可编辑的 TXT 或 Markdown 文件。

二维码识别

扫描图片或截图中的二维码,识别内容可复制,支持一图多码批量提取。

数学公式识别实验性功能

识别图片中的数学公式,输出 LaTeX 格式代码,可直接粘贴到 LaTeX 编辑器或 Markdown 中使用。

使用方式

Umi-OCR 提供 图形界面 与 命令行 / HTTP 接口 两种使用方式,可以根据使用场景自由选择。

图形界面

解压后双击主程序即可启动。所有功能都在图形界面内完成,无需命令行操作,适合普通用户日常使用。

Umi-OCR_Rapid_v2.1.5/
├── Umi-OCR.exe        # 主程序
├── config/            # 配置文件
├── models/            # 识别模型
└── README.md

命令行调用

提供完整的命令行接口,可脚本化批量处理图片,适合服务器端或自动化任务集成。

# 对单张图片进行 OCR
Umi-OCR.exe --path "image.png" --output "result.txt"

# 批量处理目录
Umi-OCR.exe --path "./images/" --output "./results/"

HTTP 接口

启动时可开启 HTTP 服务,通过 REST 接口调用 OCR 功能,方便与其他软件集成。

# 启动 HTTP 服务(默认端口 1224)
Umi-OCR.exe --server

# 调用接口
POST http://127.0.0.1:1224/api/ocr
Content-Type: application/json
{ "base64": "..." }

下载与版本

Umi-OCR 提供两个引擎版本:Paddle 版 精度更高,Rapid 版 更快更轻。可根据电脑配置与使用场景选择。

版本 体积 特点 适用场景
Paddle 版 约 128 MB 精度更高,模型更大 复杂文档、专业场景
Rapid 版 约 97 MB 速度更快,体积更小 快速任务、低配电脑
Linux 版 AppImage Ubuntu / Debian / Fedora Linux 桌面环境
兼容性说明:Paddle 版不兼容奔腾 / 赛扬 / 凌动 CPU,如果启动报错 0xc0000142,请换用 Rapid 版。

Windows 下载

# SHA256 校验
Rapid  : 4B3D... (请以 releases 页面为准)
Paddle : 8F2A... (请以 releases 页面为准)

Linux 下载

项目数据

Umi-OCR 由 hiroi-sora 发起并维护,是 GitHub 上活跃的开源 OCR 项目之一。

GitHub Stars 0K+
支持语言 0+ 种
离线运行 0%(不上传图片)
广告与捆绑 0(完全免费纯净)
最新版本 v2.1.5

常见问题

Umi-OCR 是免费的吗?
完全免费且开源,采用 MIT 协议。软件本身无任何付费内容,无广告、无捆绑,所有功能均可免费使用。
OCR 识别会上传图片到服务器吗?
不会。Umi-OCR 100% 本地离线运行,所有识别过程都在你的电脑上完成,图片不会上传到任何服务器,完全保护隐私。首次启动时已内置识别模型,无需联网下载。
Paddle 版和 Rapid 版有什么区别?
Paddle 版精度更高,模型更大(约 128MB),适合复杂文档识别,但不兼容奔腾 / 赛扬 / 凌动 CPU;Rapid 版处理速度更快,体积更小(约 97MB),兼容性更好,适合快速任务与低配电脑。如果 Paddle 版报错 0xc0000142,请换用 Rapid 版。
支持哪些操作系统?
支持 Windows 10 / 11 与 Linux 系统(包括 Ubuntu、Debian、Fedora 等主流发行版)。Windows 提供 7z 压缩包,Linux 提供 AppImage 与 tar.gz 两种形式。
识别结果可以导出成什么格式?
截图 OCR 可导出 TXT、Markdown;批量 OCR 可导出 TXT、jsonl、Markdown、CSV 四种格式;文档识别可导出 TXT、Markdown。所有导出均保留原始识别排版。
如何排除水印或页眉页脚的干扰?
使用「忽略区域」功能:在识别前,右键绘制矩形框覆盖水印、页眉、页脚等区域,Umi-OCR 会自动跳过这些区域,只识别正文内容,大幅提升识别准确率。
支持哪些语言?
内置 100+ 种语言的识别模型,涵盖简体中文、繁体中文、英语、日语、韩语、法语、德语、西班牙语等主流语言,以及部分小语种。

开源协议

Umi-OCR 采用 MIT License 协议开源。您可以自由使用、修改、分发本项目,包括商业用途,只需保留原作者的版权声明。

项目源代码托管于 GitHub:github.com/hiroi-sora/Umi-OCR