Word 转 TXT
.docx / .doc / .rtf / .html 提取正文,输出 UTF-8 带 BOM 的 .txt,记事本直接打开
为什么这个工具要上传文件?
本站其余工具都在你的浏览器里本地处理、文件不出本机;但把 Office 文档解析成纯文本需要**文档解析引擎**:.doc 是 Word 97-2003 的老式二进制格式,浏览器基本读不了;.docx 虽然本质是个 zip 包,但要正确处理样式、表格、页眉页脚与各种编码,兼容性风险很大。所以这一类工具统一走服务端的 LibreOffice 引擎(与本站 Word/Excel/PPT 转 PDF 同一个通道)。
上传的文件只用于这一次转换:不写入数据库、不留存在服务器(转换完成立即删除)、不上传到任何第三方、不会被任何人看到、不用于其它用途。
提取的是纯文本:没有图片、没有字体颜色与排版、表格会退化成文字行。要保留版式请用「Word 转 PDF」;要提取 PDF 里的文字请用「PDF 提取文字」。
把文档拖到这里,或点击选择
支持 .docx / .doc / .rtf / .html;单文件不超过 20MB;PDF 请用「PDF 提取文字」
提示:常见文档几秒到十几秒。转换失败会给出原因(扩展名与内容不符、文件损坏、超时、次数已达上限等),可直接重试。
提取出来的是什么(效果边界)
只有文字。输出是一份纯文本 .txt:字体、字号、颜色、加粗斜体、段落缩进、分栏、页边距等版式信息全部不会保留,图片与图表会直接丢失。
表格会退化成文字行。表格不再有行列结构,单元格文字会变成普通文本行(列与列之间可能是制表符或空格,具体形态取决于原文档),复杂表格通常需要手工整理。
页眉页脚与批注不一定在。页眉、页脚、批注、脚注、文本框里的文字可能不会出现在结果里——不同格式、不同文档结构的表现并不一致,拿到结果建议通读一遍。
编码是 UTF-8 带 BOM。Windows 记事本、Notepad++、VS Code、Word / WPS 直接打开都不会乱码;用 Excel 打开建议走「数据 → 从文本/CSV」并选 UTF-8。
隐私说明:文件仅用于这一次转换——不写入数据库、不留存服务器(转换完成立即删除)、不上传到任何第三方。
常见问题
会上传,但只用于这一次转换。把 .docx / .doc / .rtf / .html 解析成纯文本需要文档解析引擎:.doc 是 Word 97-2003 的老式二进制格式,浏览器基本读不了;.docx 虽然本质是个 zip 包,但要正确处理样式、表格、页眉页脚与各种编码,兼容性风险很大。所以这一类工具统一走服务端的 LibreOffice 引擎(与本站 Word/Excel/PPT 转 PDF 是同一个通道)。上传的文件只用于转换:转换完成立即删除、不写入数据库、不留存、不用于其它用途。本站其余工具(图片、PDF、文本、二维码等)仍然全部在浏览器本地处理、文件不出本机。
提取出来的是纯文本,只有文字。图片、图表、形状会全部丢失;字体、字号、颜色、加粗斜体等样式不会保留;表格会退化成纯文本行,列与列之间可能是制表符或空格(具体形态取决于原文档),复杂表格通常需要手工整理;页眉、页脚、批注、脚注、文本框里的文字可能不会出现在结果里,不同格式与文档结构的表现并不一致;超链接一般只留下链接文字,网址本身不保证保留。需要保留版式请改用「Word 转 PDF」。
输出是 UTF-8 编码、带 BOM 的 .txt:Windows 记事本、Notepad++、VS Code、Word / WPS 直接打开都不会乱码。用 Excel 打开时,建议走「数据 → 从文本/CSV」并选 UTF-8;直接双击用老版本 Excel 打开可能按本地编码解析,那就先用记事本打开另存一份再加。文件名默认是「原文件名.txt」。
支持 .docx、.doc(Word 97-2003)、.rtf、.html 四种输入,输出统一是 .txt。PDF 不在支持范围:PDF 的版面是坐标式的、不是流式文本,把 PDF 交给文档引擎直接导成纯文本实测会得到空产物,所以本页明确不收 PDF——要提取 PDF 文字请用「PDF 提取文字」。单文件上限 20MB;每个 IP 有每小时与每日的转换次数上限(超了会提示稍后再试);失败会给出人话原因(扩展名与内容不符、文件损坏、转换超时、服务繁忙等),可以重试或压缩文件后再试。