展示贴近实际使用的源文档,以及“PDF 转文本”处理后的实际文档状态或输出文件。
之后
之前
PDF 转文本(OCR)

PDF 到文本转换器 — 免费在线从 PDF 中提取文本

PDF 是扫描件,因此不会选择任何内容,不会复制任何内容,搜索也不会发现任何内容。无论如何都可以从中提取文本 - 包括纯图像 PDF,30 多种语言。

  • 从扫描的 PDF 中获取文本,其中选择和复制不起作用
  • 读取 30 多种语言的纯图像和文档照片 PDF
  • 下载为 TXT、Markdown、Word、Excel 或 CSV

PDF

上传 PDF

拖入任意 PDF——复制其中文字,或下载为 .txt 文件

PDF · free up to 11MB, Premium up to 50MB

使用 PDF 转文本 可以做什么

在开始之前查看主要功能。

  • 从 PDF 中获取文本,复制和粘贴不起作用
  • 从扫描件或纯图片 PDF 中提取文字
  • 从禁止选取文字的 PDF 中复制内容
  • 用文档原本的语言阅读文字
  • 重新运行提取,获得更干净的结果
  • 获得可编辑的文字,方便做笔记或搜索

设置参考

PDF 转文本 的可用控件。

处理模式预设
可逐个处理输入内容,也可切换到 Premium 批量模式,将同一设置应用于多个输入。可用的输入类型取决于所用工具。选项: 单个文件批量

引擎

引擎下拉框
选择由哪个文字识别引擎读取你的文件;当“默认”引擎误读花式字体或手写内容时,可切换到“引擎 1”或“引擎 2”——结果会自动刷新。选项: 默认引擎 1引擎 2
语言下拉框
选择原文的主要语言。可用选项取决于所选识别引擎,不支持的语言会隐藏。默认英语,请检查提取文字是否存在识别错误。选项: 英语法语德语西班牙语意大利语葡萄牙语荷兰语俄语日语韩语中文(简体)中文(繁体)阿拉伯语印地语孟加拉语旁遮普语乌尔都语越南语泰语波兰语瑞典语丹麦语挪威语芬兰语土耳其语乌克兰语印尼语泰米尔语泰卢固语马拉地语尼泊尔语波斯语希腊语希伯来语
重新运行提取一键
使用当前的「引擎」和「语言」选择,对同一文件重新执行提取——识别效果不佳或失败后重试时很方便。

下载

下载为下拉框
选择文字提取后的输出类型。Word 与电子表格根据源文件生成;PDF 表格 CSV 导出为 ZIP,其中每张表格一个文件。选项: 文本 (.txt)Markdown 文档(.md)Word 文档(.docx)Excel 表格(.xlsx)CSV(表格 · .zip)
免费使用 · 无需注册 · 无水印上传过程全程加密传输已根据我们的数据保留政策移除

常见问题

上传您的 PDF,工具会检测它包含的是真正的文本层还是仅有扫描图像。带文本层的 PDF 可即时导出。纯图像的 PDF(扫描书籍、拍摄的收据、旧报告)会自动经过 OCR 处理。无论哪种情况,您都能得到一份整洁的 .txt 文件,保留段落、换行和章节间距。

usage

可以。如果 PDF 是纯图片格式(扫描件、拍摄页面或传真导出常见此种情况),OCR 引擎会自动启动——你无需另用工具。内置多语言支持,因此即便是双语或非拉丁文字(中文、阿拉伯文、印地文)也能在同一次处理中提取出来。

features

段落分隔、章节之间的空行、项目符号和编号列表前缀都会以纯文本形式保留。标题会根据源字体以大写或原始大小写呈现。视觉强调(粗体、斜体)无法在纯文本中编码——如需保留这些,请改用 PDF 转 Word 转换器。

technical

可以。上传后在提示框中输入密码,工具会在内存中将文件解锁,时间仅够提取文本之用。密码绝不会存储到磁盘或传输给第三方服务。没有密码的加密 PDF 无法处理——出于安全考虑,本工具不进行密码破解。

features

为保证转换可靠性,页数和文件大小均有限制。免费方案最多支持 30 页和 11 MB,Premium 支持 200 页和 50 MB,Pro 支持 500 页和 120 MB,Enterprise 支持 1000 页。请使用拆分 PDF 工具拆分更大的文档,再分别处理每个部分。

technical

处理发生在安全服务器上,并且根据我们的安全政策,文件将被删除——除非您明确共享结果,这会将其保留在公共链接上,任何拥有该结果的人都可以在长达 30 天内打开。 .txt 输出是您的 — 无水印、无归属、无跟踪。研究人员、记者、律师和学生使用该工具从机密报告中提取文本,因为他们知道源 PDF 不会在该窗口之外保留。

privacy

可以。打开「引擎」面板,选择你文档的语言和 OCR 引擎,页面就会按该文字系统进行识别 — 支持 100 多种语言,包括非拉丁文和从右往左书写的文字。如果第一遍把带重音符号或非英文字符识别错了,请切换语言并点击「重新运行识别」。

usage

格式化视图保留页面的原始排版——分栏、间距和行的位置——非常适合表格和收据。纯文本视图则提供干净、重新排版的文字,更方便粘贴到文档或聊天机器人中。在两种视图间切换,然后复制文字或将其下载为 .txt 文件。

features

此工具直接为你提供可复制或保存为 .txt 的纯文本。如果你想保留原始 PDF 但让它支持 Ctrl+F 搜索,请用「图片转可搜索 PDF」工具处理 — 它会在扫描件上方添加一层隐形的 OCR 文字层,页面看起来一模一样,但文字变得可选取。

tips

对于常见的拉丁字母语言,先用“默认”引擎并选择文档所用语言——它处理日常文本又快又准。如果输出看起来乱码,或文字是非拉丁文字(阿拉伯文、印地文、中文、西里尔文),就切换到 Engine 1 或 Engine 2,在选择器中选好对应语言,然后点按“重新提取”——不同引擎针对不同文字做了调优,两个都试一下只需几秒。

tips

输出框完全可编辑,因此你可以在屏幕上直接快速修正某个 OCR 错误或删减某一段。“复制到剪贴板”始终复制框内当前的确切内容,包括你的编辑——但“下载 .txt”保存的是上一次引擎/语言运行产出的原始文件,而不是你在屏幕上的编辑。要保留某处修正,请用“复制”并粘贴到你自己的 .txt 文件中;或者如果错误是系统性的,就切换“语言”或“引擎”并点按“重新提取”,而不要手动编辑。

features

上传 PDF,让提取工具提取文字——对扫描件或纯图片页面会自动运行 OCR——然后将结果下载为纯文本 .txt 文件。该文件可在记事本、TextEdit 或任何代码编辑器中打开,无需专用软件。这样使用时,它就相当于一个简单的 PDF 转记事本工具,适合只想获取可直接复制、不含格式或图片的纯文字内容的场景。

usage

是的 — 无需创建帐户即可转换、预览和下载 PDF 文本。免费津贴涵盖扫描 PDF、格式化和普通视图以及 .txt 下载的 OCR。保费消除了每日承保限额。

pricing

是的 - Pixoate 支持批处理和批量处理。切换到批处理模式,在 Premium 上添加最多 60 个 PDF,在 Pro 上添加最多 200 个 PDF,设置一次选项,然后在下载单个 ZIP 之前,每个 PDF 都会使用相同的设置进行处理。批量处理是一项高级功能;输出使用与单一模式相同的质量和设置。

features

是的 - 通过批量处理,您只需配置一次设置,它们就会应用到批次中的每个项目 - Premium 上最多 60 个 PDF,Pro 上最多 200 个 PDF。无需对每个项目重复设置,临时上传和生成的文件将被安全处理并自动删除。

usage

几乎总是以下三种原因之一:文件超过 11 MB 的免费上传上限——Premium 支持 50 MB,Pro 支持 120 MB;文件格式不受此工具支持,请查看上传面板显示的格式列表;或者文件的真实格式与文件名不符。重命名不会改变文件内部格式,这正是看似有效的 PDF 仍会被拒绝的原因。

troubleshooting

PDF 存储每个字符在页面上的位置,而不是文字处理器工作的段落和样式,因此转换意味着通过推理重建该结构。复杂的列、表格和围绕图像的文本是它漂移的地方。如果外观比可编辑性更重要,请选择视觉模式;如果您需要输入内容,请选择可编辑模式并期望修复奇怪的标题。

troubleshooting

不需要。您无需帐户即可运行 PDF 转文本并下载免费结果,并且它没有水印。高级版是当限制开始出现时您购买的:一批最多 60 个文件、更大的上传量、无每日上限以及原始分辨率结果。下载步骤中不会显示任何在开始之前不可见的内容。

pricing

否 — PDF 转文本在桌面和手机上的浏览器中运行。在您看到它是否满足您的需要之前,无需安装任何东西,无需试用,也无需购买许可证。在您实际遇到的文件而不是样本上尝试一下。

troubleshooting

PDF 转文本 如何助您完成任务

它每天为企业、创作者和日常任务解决实际问题。找到适合您的用例并开始。

教育经历

讲座与课程笔记提取

学生从教授提供的 PDF 讲义和实验手册中提取纯文本,方便把摘录粘贴到 Notion、Obsidian 和学习卡片中。

个人使用

用于批量投递的简历文本

求职者从 PDF 简历中提取纯文本,粘贴到 ATS 申请表、LinkedIn Easy Apply 以及不支持文件上传的招聘门户文本框中。

面向企业

从 PDF 报告生成邮件草稿

分析师从冗长的 PDF 报告中提取执行摘要部分,粘贴到邮件、Slack 消息和 Teams 聊天中,让相关方快速获取关键洞见。

面向企业

对现有 PDF 资源进行 SEO 审查

营销人员从旧的 PDF 白皮书和电子书中提取文本,以审查关键词覆盖、识别内容空白,并重新发布为新的博客文章以获取自然搜索流量。

面向企业

翻译工作流准备

译者先从 PDF 源文件中提取文字,再将其粘贴到 Trados、MemoQ 或 DeepL Pro 等翻译记忆工具中,以实现更快、更精准的本地化。

效率办公

从长篇 PDF 报告生成 AI 提示词

高级用户从 PDF 研究论文中提取文本,将其作为上下文输入 ChatGPT、Claude 或 Gemini,用于摘要、问答和要点提取。

面向企业

纯文本备份存档

IT 和档案团队从 PDF 文档库中提取纯文本,创建轻量、面向未来的备份,20 年后无需依赖 PDF 查看器也能读取。

教育经历

引文与参考文献列表

研究人员将 PDF 中的参考文献部分提取为纯文本,即可直接粘贴到 Zotero、Mendeley 或 EndNote 中,无需逐条手动重新录入。

个人使用

屏幕阅读器与文字转语音访问

从 PDF 中提取干净的文本,以便屏幕阅读器朗读或粘贴到文字转语音应用中——对视障读者或想解放双手收听长篇报告的人很有用。

合法的

法律电子取证关键词检索

律师助理从扫描的证词笔录和证据材料包中提取文字,让上千页的内容变得可全文检索,无需在纯图像 PDF 中逐页翻找某个人名或条款。

面向开发者

扫描发票数据流水线

开发者和运维团队从扫描的发票和收据中提取文本,输入基于正则或 LLM 的解析器,用自动化批量录入取代手工重录。

研究

信息公开申请与泄露文件调查

调查记者从扫描的政府公告和信息公开(FOIA)文件中提取文本,以便在海量文档中检索、引用并交叉核对各项说法。

观看每一个转变土地

每张照片都原封不动地穿过斜线,并在另一边完成。