扫描件里的文字,一键识别成可复制的文本。
扫描、拍照得到的 PDF 本质上是图片,文字无法复制、搜索。本工具基于 Tesseract OCR 在你的浏览器本地完成文字识别,支持简体中文与英文混合识别。识别结果逐页展示,可随时复制,也可一键导出为 TXT。语言模型已内置,处理过程完全离线、不上传任何内容。
Tesseract 引擎在浏览器内运行。
简体中文与英文模型自动切换。
识别结果一键导出为文本文件。
选择扫描件或图片型 PDF。
逐页 OCR,页面显示识别文字。
复制结果或导出为 TXT 文件。
提升扫描 PDF 的对比度与亮度,让发灰的文字更清晰。
提取 PDF 中的文字并复制/下载为 TXT,可指定页码范围。
把 PDF 每页转为高清图片并嵌入 Word 文档,便于二次编辑排版。
把 PDF 提取为 Markdown,保留标题、段落与列表结构。