Github Star 4.5K+,3.5M超超轻量中英文OCR模型开源,火了!

限时加码!20+主流AI编程工具免费用 购周边加赠Coding Plan Lite,Claude Code、Cursor等即刻畅享,学习进阶更高效! 阅读详情

先看下PaddleOCR自今年年中开源以来,短短几个月在GitHub上的表现:

  • 7月,8.6M超轻量模型发布,GitHub Trending 全球日榜榜单第一

  • 8月,开源CVPR2020顶会SOTA算法,再上GitHub趋势榜单!

  • 9月,GitHub Star数量已超过4K, 近期又带来哪些重磅更新?

果然,看9月最新更新,PaddleOCR再次诚意满满为大家带来真干货,直接看官方介绍:

01.官方介绍

数量上,这次PaddleOCR一口气发布了三个系列模型,满足移动端、服务器端各种场景需求。而且,多语言也妥妥安排上了,全部训练代码和模型毫无保留开源。其中3.5M超轻量文字识别模型,堪称目前业界开源的最轻量OCR模型了。

质量上,如此轻量的模型,效果有保障吗?不看广告,直接看疗效。

先看几个常见的通用场景识别效果:

3.5M的模型能达到这个识别精度,绝对是良心之作了!

传送门 Github:

https://github.com/PaddlePaddle/PaddleOCR

论文下载链接:

https://arxiv.org/abs/2009.09941

02.快速体验

PaddleOCR的3.5M超轻量OCR模型


1).PC端快速尝试:(打开网页,选一张图片,即可实时看到结果)

https://www.paddlepaddle.org.cn/hub/scene/ocr

2).手机端App安装体验

PaddleOCR在百度大脑EasyEdge上开放了文字识别APP demo。

示例效果如下(可以在github首页找到下载二维码)

多个开源repo测试对比

简单对比一下目前主流OCR方向开源repo的核心能力:

3).从性能指标来看:

  • 针对OCR实际应用场景,包括合同,车牌,铭牌,火车票,化验单,表格,证书,街景文字,名片,数码显示屏等,收集的300张图像,每张图平均有17个文本框,PaddleOCR的F1-Score超过0.5,这个性能已经很不错了。

4).从功能完备来看:

  • 预训练模型大小:easyOCR目前暂无超轻量模型,chineseocr_lite最新的模型是4.7M左右,而PaddleOCR提供的3.5M无疑是目前业界已知最轻量的

  • PIP安装:目前仅PaddleOCR和easyOCR支持。

  • 自定义训练:实际业务场景中,预训练模型往往不能满足需求,对于自定义训练和模型Finetuning,目前只有PaddleOCR支持

  • 部署方面:easyOCR模型较大不适合端侧部署,Chineseocr_lite和PaddleOCR都具备端侧部署能力。

开发者可以根据自己的实际需求,选择适合自己的开源方案。

对于PaddleOCR 3.5MB的超轻量模型,是如何做到的,repo中也给出了解释。

3.5M超轻量模型应用了一套超轻量OCR系统PP-OCR,主要由DB文本检测、检测框矫正和CRNN文本识别三部分组成。该系统从骨干网络选择和调整、预测头部的设计、数据增强、学习率变换策略、正则化参数选择、预训练模型使用以及模型自动裁剪量化8个方面,采用19个有效策略,对各个模块的模型进行效果调优和瘦身。

其中,飞桨模型压缩库PaddleSlim为PaddleOCR超轻量化模型的实现提供了核心的技术支撑。从超轻量模型8.1M的压缩到3.5M,模型大小降低了56.79%,其中检测模型速度提升21%,而且整体模型精度还有提升。

除了3.5M超轻量OCR模型,PaddleOCR提供了多语言预训练模型(英、德、法、韩、日),支持自定义训练和丰富的部署方式。

想了解更多,欢迎加入PaddleOCR技术交流群,跟百度高工交流,第一时间获得技术支持。

PaddleOCR技术交流群


招募活动预告

10月24日,百度AI快车道将在上海举办线下活动,欢迎上海OCR方向的开发者们,我们相聚上海徐汇区【LOFAS集聚空间】,“共度1024程序员节”!

更多飞桨的相关内容,请参阅以下内容:

官网地址:https://www.paddlepaddle.org.cn

飞桨PaddleOCR项目地址:

GitHub: https://github.com/PaddlePaddle/PaddleOCR

Gitee: https://gitee.com/paddlepaddle/PaddleOCR

飞桨PaddleSlim项目地址:

GitHub: https://github.com/PaddlePaddle/PaddleSlim

Gitee: https://gitee.com/paddlepaddle/PaddleSlim

PP-OCR技术文章:

论文下载:https://arxiv.org/abs/2009.09941

也可以点击“查看原文加入交流群!

PaddleOCR快速使用教程 本文介绍了PaddleOCR图片文字检测识别的快速使用教程。主要内容包括:环境搭建(创建Python 3.8虚拟环境并安装相关库)、权重文件下载(检测和识别模型)、快速应用步骤(通过命令行或自定义脚本执行识别)。文章还提供了报错解决方案(CUDA相关dll文件缺失问题),并附有示例代码和运行结果说明。整个过程从程序下载到实际应用共分四个步骤,适合想快速体验PaddleOCR功能的用户。 阅读详情

相关推荐

「PaddleOCR模型应用优化流程

PaddleOCR 算是OCR算法里面较好用的,支持的内容多,而且社区维护的好(手把手教你,生怕你学不会),因此在国内常采用。目前已经更新到 2.8版本了,功能更加丰富、强大;目前支持通用OCR、表格识别、图片信息提取以及文档场景信息提取,基本覆盖了常用的场景首先下载模型代码需要视频课程的可以看。

绿色羽毛 2897

PaddleOCR字符识别,训练自己的数据集全流程(环境、标注、训练、推理)

PaddleOCR是基于百度飞桨框架的开源OCR工具,支持80多种语言,适用于复杂文本场景。本文介绍了PaddleOCR的环境配置、数据集制作和模型训练流程。首先通过conda创建虚拟环境并安装PaddlePaddle和PaddleOCR,然后使用PPOCRLabel工具标注数据集,划分训练集、验证集和测试集。接着下载预训练权重,分别训练文本检测和识别模型,最后评估模型性能并导出静态图模型。整个过程涵盖了从数据准备到模型部署的完整OCR开发流程,适用于票据识别、文档数字化等应用场景。

wwwwww7733的博客 7925

安装paddleocr

克隆代码我使用Anaconda3的虚拟环境进行安装直接在当前目录下标注工具安装有两种方法:1.直接pip,你可以在其他环境下,或者 根本无需下载PaddleOCR的情况下安装。2.在PaddleOCR里面找到PPOCRLabel,编译安装。进入标注工具的目录编译生成进入生成的文件夹cd dist安装编译文件使用标注工具命令启动PPOCRLabel。

雪剑封心 2422

基于百度飞桨PaddleOCR的图片文字识别

基于百度飞桨PaddleOCR的图片文字识别

jianxuezixuan的博客 7541

Github Star 4.6K,3.5M超轻量中英文OCR模型开源了!

导读如果你是OCR方向的工程师,你一定需要知道这个OCR开源项目:PaddleOCR先看下PaddleOCR自今年开源以来,短短几个月在GitHub上的表现:7月,8.6M超轻量模型发布...

datayx的文章 800

Github 又现神器!累计star过11.5K,这个OCR神器开源啦!

一、导读OCR方向的工程师,一定需要知道这个OCR开源项目:PaddleOCR短短半年时间,累计Star数量已过11.5K,频频登上Github Trending和Paperswithc...

cainiao_python的博客 2712

Github Star 11.5K项目再发版:AAAI 2021 顶会论文开源,80+多语言模型全新升级

一、导读 OCR 方向的工程师,一定需要知道这个 OCR 开源项目:PaddleOCR 短短半年时间,累计 Star 数量已过 11.5K,频频登上 Github Trending 和 Paperswithcode 日榜月榜第一,在《Github 2020数字洞察报告》中被评为中国 Github Top20 活跃项目。 称它为OCR 方向目前最的 repo绝对不为过。 最近,它又带来两项全新发布: AAAI 2021 顶会论文开源:PGNet: Real-time Arbitrari...

百度大脑 629

PaddleOCR震撼登场!一招解锁全球文字,让图像秒变文本的黑科技神器来了

PaddleOCR:无需繁琐训练,一拍即识!用镜头捕捉瞬间,多场景文本秒变可读信息! - 精选真开源,释放新价值。

2401_83063795的博客 1286

GitHub项目推荐--PaddleOCR:工业级OCR与文档AI引擎】

​PaddleOCR​ 是一个行业领先、生产就绪的OCR和文档AI引擎,提供从文本提取到智能文档理解的端到端解决方案。它能够将任何PDF或图像文档转换为结构化数据,为AI应用提供强大支持。

j8267643的博客 1413

github设置中文_PaddleOCR超轻量级中文OCR模型(总模型仅8.6M)进阶使用

PaddleOCR是一个与OCR相关的开源项目,不仅支持超轻量级中文OCR预测模型,总模型仅8.6M(单模型支持中英文数字组合识别、竖排文本识别、长文本识别,其中检测模型DB(4.1M)+识别模型CRNN(4.5M)),而且提供多种文本检测训练算法(EAST、DB)和多种文本识别训练算法(Rosetta、CRNN、STAR-Net、RARE)。本文主要介绍如何使用PaddleOCR提供的超轻量级中...

weixin_39872222的博客 866

5款视觉OCR开源模型

来自清华和旷视的研究团队提出了一个通用的OCR-2.0模型模型能够处理各种OCR任务中的上述所有类型的“字符”,是一个统一且优雅的端到端模型,包含高压缩编码器和长上下文解码器。Umi-OCR 可以将纸质文档、书籍、合同等转换为可编辑的电子文本,提高文档存储和检索的效率。Surya:多语言文档OCR工具包,可进行准确的文本行检测,即将推出文本识别功能,以及表格和图表检测功能,可以处理各种类型的文档和多种语言。该模型可以更深入地理解丰富的文档,尤其是包含图表、图形、公式和数字的科学论文。

年轻即出发, 9643

文本OCR,这个Python库识别效果不输于商用!

本小节是对 PaddleOCR 项目的简单介绍,如果只对使用步骤感兴趣的同学可以跳过本小节看第二节部分~~~经测试 PaddleOCR 识别效果非常优秀,下面两张图片是从官网介绍中截取的几张图片图一图二为了测试该项目的识别性能、随后我在网上找了一张关于优惠卷的图片,图片中文字情况比较复杂,垂直、斜体等;还有中英文相结合,甚至还有小数点最终测试效果如下,无论左边图片文本复杂度有多高,图中文字基本都能识别到,非常Nice 👍关于 PaddleOCR 模型 ,有以下几个特点。

WANGWUSAN66的博客 1455

PaddleOCR 的使用,极简介绍

简单的说,就是两句话:pip install "paddleocr>=2.0.1" # 推荐使用2.0.1+版本Python下的使用。

lianbus的专栏 1009
上一篇: Python也能成为毕加索?我用Python给小姐姐画了幅油画
下一篇: 如何获取大名鼎鼎的Hacker News信息,40行Python轻松搞定!
菜鸟学Python
博客等级 码龄9年 7562粉丝 571原创
评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值