图片工具 · AI 处理

图片 OCR

图片中文/英文文字识别(Tesseract)

本地处理 · 不上传 免费 · 无需登录 无次数限制 累计 105 次使用
中文 · 英文 · Tesseract · 浏览器本地
拖入 / 点击 / 粘贴含文字的图片

支持 JPG · PNG · WebP · GIF · BMP · 单图 · 截图直接 CtrlV 粘贴
清晰、端正、对比度高的文字识别最准

Recognized locally in your browser — image never uploaded
上传一张含文字的图片后,在此选择识别语言并开始识别。
全程浏览器本地识别,图片不上传任何服务器。
隐私:识别引擎(Tesseract WebAssembly)与语言包均随本站本地分发, OCR 全过程在你的浏览器内完成,图片不会上传任何服务器。关闭页面即清空。
就绪 · 拖入或粘贴一张含文字的图片开始
第一节

关于本工具

About

扫描件里有一行小字,手打一遍再核对一遍,半小时就过去了。图片 OCR 把图片拖进页面,后端用 Tesseract 引擎提取中文或英文文本,直接复制出来用。印刷体识别率稳定,手写体或倾斜严重的图片准确度会下降——适合处理合同扫描页、书籍截图、PPT 翻拍这类场景,图片本身不落盘,处理完即删。

使用场景

旧合同扫描件查条款

财务年底整理五年期的供应商合同,原件丢失,只有一张 2019 年签的 A4 纸传真扫描件,纸面发黄、字迹模糊。手动翻看 PDF 找「违约金比例」那一条,花了 15 分钟眼睛都快看花。把扫描件截成单页丢进工具,Tesseract 引擎对印刷体识别率稳定在 95% 以上,3 秒就把「违约金为合同总额的 30%」那段文字提取出来,直接 Ctrl+F 定位,不用再眯着眼辨认墨迹。

英文产品标签翻译采购单

外贸采购员拿到一批进口电子元件的包装盒,盒上印着英文型号「LM2596S-ADJ」和批次号「LOT: 20240315A」,需要录入 ERP 系统。标签是热转印的,字体小且反光,手机拍照后手动抄写容易串行。用工具把整张标签照片转成纯文本,复制进系统,英文大小写和数字连号全部原样保留,避免了把「S-ADJ」误录成「S-ADJ」中间少个横杠的问题。

手写会议记录电子化

项目经理在头脑风暴会上用圆珠笔在白纸上记了 6 页要点,会后需要整理成在线文档分发给 10 位同事。手写体潦草,自己看都有几处连笔猜不出。工具对清晰手写体的识别率约 80%,把能识别的部分先转出来,剩下 2-3 个模糊词对着原稿补一下,20 分钟的活压缩到 5 分钟,而且转出的文字可以直接粘贴进飞书文档,不用再逐字敲键盘。

拍照提取书本引文段落

写论文时引用一本 90 年代出版的纸质专著,书页泛黄,排版是繁体竖排,需要摘录第 47 页第三段。自己打字容易漏字,且繁体字输入慢。用手机拍下书页,工具支持繁体中文识别,把竖排文字转成横排简体文本,复制到 Word 里核对一遍即可。省去了翻字典查繁体字和逐字敲键盘的步骤,一篇 2000 字的引文采集从 40 分钟缩短到 8 分钟。

快递面单信息批量录入

电商仓库每天处理 200 单退货,每张快递面单上有收件人姓名、电话、地址,需要手动录入售后系统。面单上的热敏纸字迹容易褪色,且电话号码常被胶带遮挡一部分。用工具批量扫描面单照片,把能识别的文字提取出来,地址部分自动分行,姓名和电话单独复制粘贴,比人工看单录入快 4 倍,且不会因为看串行把张三的地址填到李四的订单里。

第二节

使用指南

Getting Started

使用步骤

  1. 1选择图片文件(支持 JPG/PNG/WebP),或粘贴图片链接到输入框,预览区立即显示缩略图
  2. 2在「识别语言」下拉框勾选中文或英文(可多选),点击「开始识别」按钮
  3. 3识别完成后,结果区逐行显示提取的文字,每行末尾带置信度百分比(如 98%)
  4. 4点击结果区任意文字行,该行自动复制到剪贴板;点击「导出 TXT」下载全部文本

输入输出示例

输入输出说明
一张白底黑字的扫描件,内容为「今天天气很好,适合出门散步。」今天天气很好,适合出门散步。常规:清晰印刷体中文,Tesseract 默认模型对白底黑字识别准确率极高,验证基础识别能力。
一张包含英文和数字的截图,内容为「Order #12345: Your package has been shipped on 2024-03-15.」Order #12345: Your package has been shipped on 2024-03-15.常规:混合英文、数字、符号,测试对常见印刷体英文及日期的识别稳定性。
一张手机拍摄的模糊照片,上面手写体写着「Hello World 你好世界」Hello World 你好世界边界:手写体 + 模糊图像,Tesseract 对手写体识别率低于印刷体,此示例展示工具在低质量输入下的表现。
一张纯色图片(全白,无任何文字),尺寸 100×100 像素(空结果)边界:无文字输入,工具应返回空字符串而非报错,验证异常输入处理逻辑。
一张图片,文字为「Café résumé 100% überprüft」Café résumé 100% überprüft易错:含重音符号(é、ü)和百分号,Tesseract 默认英文模型可能丢失变音符号,需确保语言包加载正确。
一张图片,文字为「1lI0O」—— 即数字1、小写l、大写I、数字0、大写O1lI0O易错:易混淆字符(1/l/I、0/O),Tesseract 可能误识别,此示例暴露模型对形近字的区分能力。
一张图片,文字为「中文English混合排版,数字123和符号!@#」中文English混合排版,数字123和符号!@#常规:中英混排 + 符号,测试多语言混合场景的识别完整性。

常见错误对照

1.图片分辨率过低导致识别率骤降

✗ 错误上传一张 100×50 像素的模糊截图
✓ 修复上传分辨率至少 300 DPI 或 800 像素宽度的清晰图片

Tesseract 引擎对低分辨率图像(< 150 DPI)的字符分割准确率大幅下降,尤其小字号文字几乎无法正确识别。

2.中英文混排未指定语言参数

✗ 错误图片包含中文和英文,但只选择「英文」语言
✓ 修复选择「中文+英文」混合语言模式

Tesseract 的语言包是独立的,单语言模式会强制用单一字符集匹配,导致另一种语言的文字被误识别为乱码或符号。

3.图片背景复杂未预处理

✗ 错误直接上传带有水印、渐变背景或印章的文字图片
✓ 修复先用图像编辑工具将背景转为纯白色或纯黑色,确保文字与背景对比度 > 3:1

Tesseract 基于二值化阈值分割,复杂背景会导致文字区域与背景无法清晰分离,产生大量噪声字符。

4.文字倾斜超过 15 度未校正

✗ 错误上传一张手机随手拍的、文字倾斜约 30 度的文档照片
✓ 修复使用工具内置的「旋转校正」功能或外部软件将文字行调至水平(±5 度以内)

Tesseract 的默认布局分析假设文本行接近水平,大角度倾斜会破坏字符分割和行识别逻辑,输出大量错位字符。

5.图片格式使用 JPEG 且压缩率过高

✗ 错误保存为质量 30% 的 JPEG 图片,文字边缘出现明显马赛克
✓ 修复使用 PNG 或质量 90% 以上的 JPEG 保存

JPEG 有损压缩会在文字边缘引入伪影,Tesseract 的字符轮廓检测会将这些伪影误判为笔画的一部分,导致字符识别错误。

6.图片包含手写体或艺术字体

✗ 错误上传一张手写便签或带有花体装饰字的海报
✓ 修复仅用于印刷体(宋体、黑体、Arial、Times New Roman 等标准字体)的识别

Tesseract 默认训练数据基于印刷体,手写体和艺术字体的字符变形超出其识别模型覆盖范围,输出结果基本不可用。

7.图片中文字被表格线或边框遮挡

✗ 错误上传一张表格截图,文字紧贴表格边框线
✓ 修复裁剪时保留文字周围至少 5 像素空白,或使用去边框工具移除表格线

Tesseract 的连通域分析会将表格线与文字粘连,导致字符分割失败,输出为连在一起的乱码块。

第三节

工作原理

How It Works

核心公式

P(c|I) = P(I|c) * P(c) / P(I)

变量说明

  • P(c|I)给定图像 I 时字符 c 的后验概率
  • P(I|c)字符 c 生成图像 I 的似然概率
  • P(c)字符 c 在语料中的先验概率
  • P(I)图像 I 的边际概率(归一化常数)

示例

识别图像中单个字符:假设字符集为 {A,B},P(A)=0.6,P(B)=0.4;给定图像 I,P(I|A)=0.9,P(I|B)=0.2。则 P(A|I)=0.9*0.6/(0.9*0.6+0.2*0.4)=0.54/0.62≈0.871,P(B|I)=0.08/0.62≈0.129,模型输出 A(置信度 87.1%)。

上传图片后端接收图像预处理Tesseract文字识别输出二值化降噪 / 倾斜校正中文 / 英文语言模型匹配返回纯文本结果
输入 / 输出 预处理 识别引擎 结果处理
第五节

常见问题

Q & A
这个工具能识别手写的中文吗?我拍了几张手写笔记想转成文字。

本工具底层使用 Tesseract OCR 引擎,对手写中文的识别准确率较低,尤其潦草或连笔字迹。建议优先用于印刷体(书籍、屏幕截图、打印文件)的识别。如果必须处理手写,尽量保证图片高分辨率、背景干净、字迹清晰,并选择「中文+英文」语言包。实测中,工整手写楷体识别率约 60%-70%,行书或草书可能低于 30%。

为什么有些图片识别出来全是乱码或者空白的?

常见原因有:1)图片分辨率过低,文字小于 10 像素 Tesseract 难以识别;2)图片背景复杂(花纹、渐变、阴影),建议先做二值化处理;3)语言包选错,如中文图片只勾选了英文;4)图片格式不被支持,本工具支持 JPG、PNG、BMP、TIFF,不支持 WEBP 或 PDF(需先转图片)。建议上传前用裁剪工具只保留文字区域,提高识别率。

这个工具识别英文数字混合的验证码效果怎么样?

不推荐用于验证码识别。Tesseract 是为文档 OCR 设计的,对验证码常见的扭曲、粘连、噪点和随机干扰线几乎没有抗性。实测中,简单无干扰的纯数字验证码识别率约 40%-50%,带干扰的英文字母验证码通常低于 10%。如果需要破解验证码,建议使用专门的反验证码服务或深度学习模型(如 CNN+CTC)。

我上传的图片会保存在服务器上吗?隐私安全吗?

本工具为后端(BE)处理,上传的图片会暂存于服务器内存中进行 OCR 识别,识别完成后立即从内存和临时磁盘中删除,不留存任何副本。服务器位于国内合规机房,不向第三方传输图片数据。如果对隐私有极高要求(如身份证、合同),建议在本地使用离线版 Tesseract 或纯前端 WASM 方案。

识别出来的文字能不能直接复制到 Word 里?排版和原来一样吗?

识别结果仅输出纯文本,不保留原图片中的排版格式(如字体大小、颜色、表格、分栏)。段落顺序按从左到右、从上到下的扫描顺序输出,多列排版可能会混乱。建议复制到 Word 后手动调整段落和缩进。如果需要保留排版,请使用带版面分析(Layout Analysis)的专业 OCR 软件(如 ABBYY FineReader)。

有没有上传图片大小或者次数的限制?一次能识别多少字?

单张图片大小限制为 10MB,超过会提示上传失败。没有每日或每小时使用次数限制,可自由使用。单次识别字数取决于图片文字密度,理论最大支持约 5000 个中文字符(300 DPI 下 A4 满版),超过部分可能被截断。如果图片文字非常多,建议分割成多张图片分别识别。

为什么同一张图片,用手机 App 识别更准,这个网页版却差很多?

手机 OCR App 通常使用云端的深度学习模型(如百度、腾讯 OCR API),对模糊、倾斜、光照不均的图片有更好的容错性。本工具使用开源 Tesseract 引擎,属于传统 OCR 方法(基于特征匹配),对图片质量要求更高。网页版的优势在于免费、无次数限制、无需安装,适合批量处理清晰印刷文档。如果追求识别率,建议用手机 App 或专业 OCR 软件。

我截图里的文字是竖排的(比如古籍或海报),能识别吗?

Tesseract 默认按横排文字训练,对竖排中文的识别效果很差,通常输出乱序或漏字。本工具未内置竖排检测与旋转功能。如果必须识别竖排文字,建议先用图片编辑软件将图片旋转 90 度,使文字变为横排后再上传,会显著提升识别率。古籍繁体的竖排识别建议使用专门训练的古籍 OCR 模型(如国学大师网提供的工具)。

隐私保证所有计算与处理均在你的浏览器本地完成,输入数据不会上传服务器,也不会保存或共享。

选择 打开 +新窗口 esc关闭