直接在 Word、PDF 或 Excel 中逐段复制文字,容易漏掉内容,也不方便统一转换。文件文本转换工具可以在当前浏览器读取多个文件,把可提取文字合并到转换区,再选择简体、繁体、台湾或香港模式。
这套流程的重点是“提取文字”,不是编辑原文件。转换结果可以复制或下载为 TXT;字体、图片、页眉页脚、批注、公式和复杂表格布局不会原样保留。
不同文件格式会提取什么
DOCX 会读取文档中的段落文字;PDF 会读取页面内可选择的文本层;Excel 会按工作表提取单元格内容;TXT 和 CSV 则直接读取纯文本。一次选择多个文件时,工具会用文件名分隔各段内容。
扫描版 PDF 本质上是一组图片,没有可选择的文字层,普通 PDF 文本提取无法识别。此时应先使用 OCR,或把需要处理的页面截图后使用拍照识字工具。
| 格式 | 适合处理 | 需要注意 |
|---|---|---|
| DOCX | 文章、合同草稿、说明文档 | 只提取文字,不保留原排版 |
| 带文本层的电子 PDF | 扫描件需要先做 OCR | |
| XLSX / XLS | 工作表中的文字单元格 | 公式结果和布局需另行核对 |
| TXT / CSV | 纯文本、字幕、数据导出 | 注意原文件编码和字段分隔 |
文件内容怎样在浏览器中处理
选择文件后,页面按格式加载对应的公开解析组件,并在本机浏览器中读取内容。提取出的文本会进入与普通粘贴文本相同的转换流程,不需要把原文件上传到 JianFan.app 服务器。
浏览器内处理有利于保护普通文档内容,但设备内存仍有限。大文件应拆分后处理,特别是页数很多的 PDF 和包含大量工作表的 Excel 文件。
- 打开文件文本简繁转换页面,选择转换方向和地区模式。
- 拖入一个或多个受支持的文件,等待文字提取完成。
- 在原文区检查文件名分隔和段落是否完整,再查看转换结果。
- 复制结果,或下载 TXT 后粘贴回原文档并重新排版。
哪些内容不会被完整保留
文字提取不会复制 Word 样式、PDF 坐标或 Excel 合并单元格。表格内容可能转成按行排列的文本,页眉和页脚也可能混入正文。下载 TXT 后,应根据实际用途恢复标题层级和版式。
如果文件包含保密合同、身份信息或未公开商业资料,即使工具主要在本地处理,也应遵守单位的数据安全规定,并确认浏览器扩展、同步软件和本机环境是否可信。
转换后重点检查这些位置
先核对文件总数、页数和工作表名称,再抽查每个文件的开头与结尾。对于台湾或香港版本,还要检查地区词汇、日期格式、货币单位和联系方式。
最终交付仍需要原文件格式时,可以把校对后的文本粘贴回 Word 或 Excel。不要用纯文本结果直接替换依赖公式、脚注、目录或版式定位的正式文件。
常见问题
转换后能下载为原来的 Word 或 PDF 吗?
当前流程导出 TXT,不重建原文件。需要保留格式时,请把校对后的文字复制回原文档。
为什么扫描版 PDF 没有提取出文字?
扫描版 PDF 没有文本层,需要先做 OCR。可以截取单字或短文本后使用拍照识字,也可以使用专门的整页 OCR 工具。
可以一次转换多个文件吗?
可以。页面支持多选文件并合并提取,但大批量或大文件应分组处理,避免占用过多浏览器内存。
相关资料
本文结合本站工具的实际处理流程撰写,涉及的主要开源资料如下。
- Mammoth.jsDOCX 文字提取组件
- PDF.jsPDF 文本读取组件