本帖最后由 莫小乐 于 2026-7-7 19:15 编辑
OCR 本地识别服务 —— 使用说明
═════════════════════════════
一、软件特点
- ✅ 纯本地运算:无需联网,图片绝不上传,保护数据隐私
- ✅ 纯净体验:授权后无弹窗、无广告、无后门、无限制
- ✅ 多模型支持:V4 / V5 / V6 模型可选,按需平衡速度与精度
- ✅ GPU 加速:支持 CPU / GPU 双模式推理,可自定义线程数
- ✅ HTTP 服务:内置 HTTP API,支持任意语言调用
- ✅ 图找图:支持精准找图、容错找图、句柄找图、屏幕找图
- ✅ 多线程并发:高并发处理,适合批量识别场景
- ✅ 可视化调试:画板绘制识别框和中心点,直观验证结果
二、功能介绍
| 功能模块 |
说明 |
| 文字识别(整段) |
上传图片,返回图中所有文字,合并为一段文本输出 |
| 多行 JSON 识别 |
返回每行文字的内容、置信度、包围盒坐标及中心点 |
| 单字 JSON 识别 |
返回每个单字的内容、置信度、精确坐标、行号、行内序号 |
| 找字功能 |
输入单字或连续多字,返回匹配位置及合并后的坐标信息 |
| 图找图(精准) |
在大图中精确定位小图,返回坐标 |
| 图找图(容错) |
支持设置误差值、吻合度、采样间隔,适合模糊变色场景 |
| 句柄找图(精准) |
在指定窗口句柄范围内精确定位小图,支持后台截图 |
| 句柄找图(容错) |
支持误差值等参数,适合后台窗口变色或模糊场景 |
| 屏幕找图(精准) |
全屏截图精确定位小图,返回屏幕绝对坐标 |
| 屏幕找图(容错) |
支持误差值等参数,适合变色、遮挡或模糊场景 |
三、使用方式
1. 图形界面(GUI)
- 选择本地图片,点击按钮即可查看识别或查找结果
- 支持画板可视化绘制,方便坐标校准与效果验证
- 可一键切换模型和推理设备
2. HTTP API 服务
- 启动内置 HTTP 服务后,通过网络请求调用所有功能
- 支持 JSON 参数传递,返回结构化 JSON 结果
- 适用于 Python / 按键精灵 / 易语言 / 浏览器等任意可发 HTTP 请求的环境
| 接口名称 |
请求路径 |
| 文字识别 |
/ocr/shibie |
| 找字 |
/ocr/zhaozi |
| 多行 JSON |
/ocr/duohangjson |
| 单字 JSON |
/ocr/danzijson |
| 图找图(精准) |
/ocr/tuzhaotu1 |
| 图找图(容错) |
/ocr/tuzhaotu2 |
| 句柄找图(精准) |
/ocr/jubingzhaotu1 |
| 句柄找图(容错) |
/ocr/jubingzhaotu2 |
| 屏幕找图(精准) |
/ocr/pingmuzhaotu1 |
| 屏幕找图(容错) |
/ocr/pingmuzhaotu2 |
| 健康检查 |
/ocr/health |
四、模型选择
| 版本 |
说明 |
| V4 模型 |
通用版,性能均衡 |
| V5 模型 |
经典版本,稳定可靠 |
| V6 模型 |
速度与精度兼顾,推荐使用 |
五、适用场景
- ✅ 自动化办公:发票、表格、证件文字提取
- ✅ RPA / 脚本辅助:屏幕文字识别、图片定位点击
- ✅ 数据采集:批量图片转文字
- ✅ 二次开发:作为 OCR 后端服务集成到项目中
六、资费规则
| 授权类型 |
价格 |
说明 |
| 个人授权 |
终身免费 |
限三台电脑 |
| 商用授权 |
35元/年 |
测试特惠,多台电脑可用 |
|