PDF 提取文字与图片
把 PDF 里的文字复制出来或存成 txt,把内嵌图片单独导出成 PNG 打包下载
把 PDF 拖到这里,或点击选择
一次处理一个文件;纯文字版 PDF 提取最快,扫描件没有文字层(提取不到文字是正常现象)
PDF 提取文字与图片的常见用法
复制文字做笔记。论文、合同、说明书、报告里的段落要引用到自己的文档里,重新打一遍既慢又容易错。选中页码范围提取成纯文本,再复制到笔记软件即可。需要注意提取的是"文字层",原始排版(多栏、表格、公式)会被拉平,因此它适合取内容,不适合还原版式——要保留版式请用「PDF 转图片」。
把合同、论文里的图单独取出来。PDF 里的插图在内部就是一张嵌入的图片对象,本工具能把它原样取出(不会重新压缩、不会掉清晰度),导出为 PNG 后可以放进 PPT、文档、推文配图。带页码的文件名让你能对照原文找到出处;同一张图在多页重复出现时会自动去重,不会给你一堆重复文件。
为什么有的 PDF 提取不到文字。扫描件(用扫描仪或手机拍的纸质文件)整页只有一张图片,PDF 里没有任何文字层,所以提取结果为空白——这不是工具坏了,而是那份文件里本来就没有可提取的文字。想从扫描件拿到文字必须做 OCR(光学字符识别):中文 OCR 需要加载十几 MB 的模型,与「轻量、打开就能用的本地工具」定位冲突,也会明显拖慢页面,因此本工具明确不做 OCR。需要识别扫描件请使用专业的 OCR 软件或服务。
提取不到图片的情况。若某页的图形是矢量绘制(例如用线条和色块画出的流程图、用曲线画的 Logo),它们在 PDF 里不是"图片对象",无法按图片取出;个别 CMYK 色彩空间、带蒙版的图片对象也无法直接解码,本工具会跳过它们并如实告知跳过数量,而不是让整页失败。这类情况都可以改用「PDF 转图片」把整页渲染成 PNG。
关于隐私:整个解析过程在你的浏览器里完成(用 pdf.js 读取文件),PDF 不会被上传到任何服务器。合同、身份证、财务单据这类材料可以放心处理,可在浏览器开发者工具的 Network 面板核验没有文件上传请求。
常见问题
这个 PDF 很可能是扫描件——页面里只有图片、没有文字层,因此提取不到文字。请用专业的 OCR 工具识别。判别方法:在阅读器里试着选中文字,如果怎么拖都选不中,说明就是扫描件。
PDF 内部并不保存"段落",只保存一段段文字的坐标。多栏排版、跨行表格的阅读顺序经常无法自动还原。建议缩小页码范围(一次几页)提取,再用编辑器的查找替换整理。
提取文字是逐页进行的,几十页通常几秒内完成,状态栏会显示"正在提取 i/N"。页数特别多(几百页)或每页图片很多时建议先用页码范围分批处理,避免占用过多本机内存。
没有。PDF 里嵌入的原始图片数据是直接取出来的,不做重采样,清晰度与原文件一致。导出的 PNG 只是无损封装,体积会比原 JPEG 大一些,这是正常现象。
带打开密码的 PDF 无法解析。请先用阅读器输入密码后另存为不加密的副本,再上传处理。