• 欢迎访问小杰博客网站
  • 欢迎访问小杰博客网站哦

Mac上tesseract-OCR的安装配置

linux 小杰 5年前 (2018-03-31) 2076次浏览 已收录 0个评论

Mac上tesseract-OCR的安装配置

tesseract简介

OCR(Optical Character Recognition)即光学字符识别技术,专门用于对图片文字进行识别,并获取文本。

tesseract-ocr引擎先由HP实验室研发,后来成为一个开源项目,主要由google进行改进优化。

安装步骤

安装homebrew

Homebrew是MacOS上的包管理器,类似于ubuntu中的apt-get,centos中的yum,Homebrew安装很简单

安装完毕后可以用brew -v测试

安装tesseract

安装完毕后用tesseract -v测试

基本用法

test.png

output.txt自动生成

更多可选参数的用法可以通过tesseract -h查询

python接口

python有着更加优雅的方式调用系统的tesseract工具,首先安装pytesseract模块

pytesseract是对tesseract的封装,要和PIL联合使用,基本用法如下:

结束语

默认的tesseract-ocr工具识别能力有限,很多地方需要个性化定制(如中文),博主也还在学习过程中,以后再会有进一步说明,欢迎大家学习交流。


小杰博客 , 版权所有丨如未注明 , 均为原创丨本网站采用BY-NC-SA协议进行授权
转载请注明原文链接:Mac上tesseract-OCR的安装配置
喜欢 (0)
发表我的评论
取消评论
表情 贴图 加粗 删除线 居中 斜体 签到

Hi,您需要填写昵称和邮箱!

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址