本地处理 · 不上传

本地 PDF OCR 文字识别

在浏览器本地识别扫描 PDF、PNG、JPG 和 WebP 中的中文、英文及混排文字,导出保留原页面的可搜索 PDF,或下载纯文本。文件和识别结果都不会上传。

本地处理,不上传。 文件只会交给当前浏览器中的 OCR 流程。

三步生成可搜索 PDF

  1. 1选择扫描文件添加一个 PDF、PNG、JPG 或 WebP,文件只在当前设备中打开。
  2. 2本地逐页识别启动中英混合 OCR,模型按页返回文字、位置和置信度。
  3. 3下载并复核导出可搜索 PDF 或 TXT,并抽查重要文字是否正确。

模型会下载,文档不会上传

OCR 需要先加载本站托管的模型和运行文件,这些只是通用识别资源。PDF、图片、页面像素、识别文字与导出结果始终留在浏览器内存中。模型加载完成后,识别过程不需要把页面发给远程 OCR API。

搜索方便不代表识别无误

OCR 文字层主要用于搜索、复制和建立索引,不应被当作未经复核的权威转录。模糊、倾斜、低对比度、手写体、印章和表格都可能产生错字或错误顺序。导出后请用关键词搜索并对照原页面检查关键内容。

常见问题

PDF、图片和识别出的文字会上传到服务器吗?

不会。文件解析、页面渲染、文字识别和结果生成都在当前浏览器中完成。首次使用时浏览器只会从本站下载 OCR 模型与运行文件,并在可用时缓存它们;你的文档内容不会随模型请求发送出去。

可搜索 PDF 和普通扫描 PDF 有什么区别?

普通扫描 PDF 的每页通常只有图片。可搜索 PDF 会保留页面画面,并按识别位置加入不可见文字层,因此可以搜索、选择和复制文字。

支持哪些语言和文件?

首版面向中文、英文和中英混排内容,支持扫描 PDF、PNG、JPG / JPEG 与 WebP。手写体、艺术字体、竖排文字和复杂表格的识别效果可能较弱。

识别结果一定准确吗?

不一定。分辨率、倾斜、阴影、压缩噪点、印章和复杂排版都会影响结果。下载后请搜索几个关键字并抽查复制出的文字;重要合同、证件和法律材料仍需人工核对。

为什么第一次识别需要多等一会儿?

OCR 模型和浏览器运行时比普通网页资源更大,首次使用需要先从本站下载。后续使用通常可以复用浏览器缓存,但清理网站数据后会重新下载。

处理页数很多的 PDF 会怎样?

OCR 会逐页处理以控制内存,并设置页数与像素上限保护手机和内存较小的设备。较长文件建议先拆分;识别过程中请保持当前标签页打开。