PDF 转 Excel
PDF 里的表格 → 可编辑 .xlsx · 一张表一个工作表 · 附全文文本工作表
为什么这个工具要上传文件?
本站其它工具都在你的浏览器里本地处理、文件不出本机;但 PDF 转 Excel 需要服务端解析 PDF 内部的文字与线条坐标、再把格子还原成表格结构,纯浏览器在整份文档上做这件事又慢又不稳,因此它是本站少数需要上传的工具之一。 上传的文件只用于这一次转换:不写入数据库、不留存在服务器(转换完成立即删除)、不上传到任何第三方、不会被任何人看到。 如果你的文件敏感到「连我们自己都不能经手」,请用 Excel / WPS 的「数据 → 获取数据 → 自 PDF」在本地完成。
把 .pdf 文件拖到这里,或点击选择
只支持 PDF;单文件不超过 20MB、不超过 200 页;扫描件(没有文字层)不支持
提示:常见的几页 PDF 几秒完成,几百页的大文件最长约一分钟;提取失败页面会给出原因,原文件不会有任何改动。
PDF 转 Excel 的常见用法与效果边界
最常用的是把「系统导出的 PDF 表格」变成能用的数据。发票明细、对账单、银行流水、报价单、报表导成 PDF 之后没法筛选、没法求和、没法复制进别的表;转成 Excel 就能接着算。这是本页的目标场景。
本工具只提取表格,不还原版式。PDF 文件里并没有「表格」这个东西——只有一串带坐标的文字和一堆线条。所以要如实说明:单元格里的文字能拿到,字体、字号、颜色、列宽、合并单元格、图片、批注、页眉页脚一律不还原。同一份 PDF 用不同工具转出来长得不一样是正常的,各家切格算法不同。要原样保留版式,请用本站「PDF 转 Word」。
扫描件 / 图片型 PDF 不支持。如果整份 PDF 里没有任何文字层(拍照的、扫描仪扫的、图片拼的),本工具会直接告诉你「没有可提取的文字」,而不是给你一张空表。这类文件需要 OCR(文字识别),本页不做 OCR——请先用带 OCR 的工具或扫描软件识别出文字,再拿识别后的 PDF 来提取。
数字按「明确安全才当数字」的规则写入。可以直接求和的数字(1000.00、1,280,000.00、负数)会写成 Excel 数字;带前导零的编号(工号 0012)、超过 15 位的长号码、含百分号、货币符号或字母的内容一律按文本写入——这样发票代码、发票号码、纳税人识别号打开后既不会变成科学计数法,也不会丢掉前面的 0。
一张表一个工作表,另附「全文文本」。识别到多张表就写多个工作表(表格1、表格2…),最后一个工作表固定是「全文文本」,把 PDF 里的文字按行原样列出,方便你核对有没有漏掉内容。跨页时如果下一页重复了表头会自动接上;没有重复表头的跨页表格会按页分开成两张表,需要你在 Excel 里自行拼接。
没有框线的表格是兜底能力,准确率更低。有的 PDF 表格只靠文字对齐、没有画线。这种会按文字的位置尝试还原,但相邻两列挨得很近时可能被并成一格,也可能把页面顶部的标题误当成一行。有框线的表格优先、结果最可靠;无框线表格请务必对着「全文文本」工作表核一遍。
上限与隐私:单文件 20MB、不超过 200 页;每个 IP 有每小时与每日的提取次数上限,超了会提示稍后再试。文件仅用于这一次转换——不写入数据库、不留存服务器(转换完成立即删除)、不上传到任何第三方。
常见问题
会上传,但只用于这一次转换。本站绝大多数工具都在你的浏览器里本地完成、文件不出本机;而 PDF 转 Excel 需要服务端解析 PDF 内部的文字与线条坐标、把格子还原成表格结构,纯浏览器在整份文档上做这件事又慢又不稳,所以本页是需要上传的例外之一。上传的文件只用于转换:不写入数据库、不留存服务器(转换完成立即删除)、不上传到任何第三方、不会被任何人看到。如果文件敏感到「连提取服务都不能经手」,请用 Excel / WPS 的「数据 → 获取数据 → 自 PDF」在本地完成。
不能,本页会明确拒绝并告诉你原因,而不是给你一张空表。扫描件、拍照件、图片拼成的 PDF 里没有文字层,只有图像——要提取内容必须先做 OCR(光学字符识别)把图像认成文字,本工具不做 OCR。判断方法:在 PDF 阅读器里能选中并复制文字,就是有文字层;怎么拖都选不中,就是扫描件。需要 OCR 请用手机扫描类 App 或带 OCR 的办公软件先识别一遍。
不保留版式,只提取内容。PDF 里没有「表格」这个概念,只有带坐标的文字和线条,本工具做的是按线条与文字位置把格子还原出来,因此字体、字号、颜色、列宽、合并单元格、图片、批注、页眉页脚都不会还原。有框线的表格提取最准;没有画线、只靠空格对齐的表格会尝试还原,但相邻列挨得近时可能并成一格,请对着「全文文本」工作表核对。需要原样保留版式的,请用本站「PDF 转 Word」。
不会。PDF 里一切都是文字,如果原样丢给 Excel,它会自己「猜」:长数字编号会变成 1.23E+19 这样的科学计数法,工号 0012 会变成 12、前面的 0 直接没了。所以本工具只把明确安全的数字写成 Excel 数字(例如金额 1000.00,写进去可以直接求和),带前导零的编号、超过 15 位的长号码、含百分号或货币符号的内容一律按文本写入,保证原样可读。代价是这类列不能直接求和——这是刻意的取舍,因为编号被改掉比不能求和严重得多。
识别到几张表就写几个工作表,按出现顺序命名为「表格1」「表格2」……最后一个工作表固定是「全文文本」,把 PDF 里的文字按行原样列出,方便你核对有没有漏。跨页的情况:如果下一页重复了表头,两张表会自动接成一张(去掉重复的表头行);如果没有重复表头,跨页的表格会按页分成两张,需要你在 Excel 里自行拼接——这一点不做猜测,猜错比分开更麻烦。
单文件上限 20MB,超出时页面会在上传前直接拦下(不会发起请求,也就不会浪费你的流量和提取次数)。页数上限 200 页——页数只有服务端解析后才知道,所以超过 200 页的文件会照常上传、由服务端拒绝,那一次会计入你的提取次数。每个 IP 另有每小时与每日的提取次数上限,超了会提示稍后再试。失败时页面会给出原因:不是 PDF、文件超过上限、页数过多、加密(需要密码)、扫描件没有文字层、提取超时、服务暂时不可用;提取失败不会改动你的原文件,换文件或拆分后重试即可。