PDF、图片和识别出的文字会上传到服务器吗?
不会。文件解析、页面渲染、文字识别和结果生成都在当前浏览器中完成。首次使用时浏览器只会从本站下载 OCR 模型与运行文件,并在可用时缓存它们;你的文档内容不会随模型请求发送出去。
在浏览器本地识别扫描 PDF、PNG、JPG 和 WebP 中的中文、英文及混排文字,导出保留原页面的可搜索 PDF,或下载纯文本。文件和识别结果都不会上传。
OCR 需要先加载本站托管的模型和运行文件,这些只是通用识别资源。PDF、图片、页面像素、识别文字与导出结果始终留在浏览器内存中。模型加载完成后,识别过程不需要把页面发给远程 OCR API。
OCR 文字层主要用于搜索、复制和建立索引,不应被当作未经复核的权威转录。模糊、倾斜、低对比度、手写体、印章和表格都可能产生错字或错误顺序。导出后请用关键词搜索并对照原页面检查关键内容。
不会。文件解析、页面渲染、文字识别和结果生成都在当前浏览器中完成。首次使用时浏览器只会从本站下载 OCR 模型与运行文件,并在可用时缓存它们;你的文档内容不会随模型请求发送出去。
普通扫描 PDF 的每页通常只有图片。可搜索 PDF 会保留页面画面,并按识别位置加入不可见文字层,因此可以搜索、选择和复制文字。
首版面向中文、英文和中英混排内容,支持扫描 PDF、PNG、JPG / JPEG 与 WebP。手写体、艺术字体、竖排文字和复杂表格的识别效果可能较弱。
不一定。分辨率、倾斜、阴影、压缩噪点、印章和复杂排版都会影响结果。下载后请搜索几个关键字并抽查复制出的文字;重要合同、证件和法律材料仍需人工核对。
OCR 模型和浏览器运行时比普通网页资源更大,首次使用需要先从本站下载。后续使用通常可以复用浏览器缓存,但清理网站数据后会重新下载。
OCR 会逐页处理以控制内存,并设置页数与像素上限保护手机和内存较小的设备。较长文件建议先拆分;识别过程中请保持当前标签页打开。