Extract text from PDFs — free
Pull editable text out of any PDF with accurate OCR — even scanned, image-only or photo-of-document PDFs. Copy it or download as TXT, Markdown, Word, Excel or CSV.
- Reads scanned & image-only PDFs in 30+ languages
- Formatted or plain text — copy or download instantly
- Private processing · Files deleted automatically
PDF · Secure processing
上传 PDF
Drop any PDF — copy its text or download it as .txt
PDF · free up to 20MB, Premium up to 50MB
What you can do with PDF 转文本
Everything this tool helps you accomplish — no learning curve, no setup.
- Extract plain text from any PDF
- Pull text out of scanned or image-only PDFs
- Copy content from PDFs that block selection
- Read text in your document's own language
- Re-run extraction for a cleaner result
- Get editable text for notes or search
Settings information
3 settings
Every control in PDF 转文本, explained — what it does and when to use it.
引擎
- 引擎Dropdown
- 选择由哪个文字识别引擎读取你的文件;当“默认”引擎误读花式字体或手写内容时,可切换到“引擎 1”或“引擎 2”——结果会自动刷新。选项: 默认引擎 1引擎 2
- 语言Dropdown
- 设置源文本所使用的语言,让字符识别更准确;可搜索的选择器只会列出所选引擎支持的语言,默认英语。选项: EnglishFrenchGermanSpanishItalianPortugueseDutchRussianJapaneseKoreanChinese (Simplified)Chinese (Traditional)ArabicHindiBengaliPunjabiUrduVietnameseThaiPolishSwedishDanishNorwegianFinnishTurkishUkrainianIndonesianTamilTeluguMarathiNepaliPersianGreekHebrew
- 重新运行提取One-click
- 使用当前的「引擎」和「语言」选择,对同一文件重新执行提取——识别效果不佳或失败后重试时很方便。
用完 PDF 转文本 了?接下来试试这些
为您精选与 PDF 转文本 搭配得当的工具。无需丢失文件,继续操作。
PDF 转 Word
Stop retyping locked PDFs. Get a clean .docx with fonts, tables and layout preserved that opens in Word, Pages or Google Docs — ready in seconds. Free to start, no credit card.
立即试用PDF 转 HTML
Get semantic HTML with real table markup you can paste straight into your site or CMS — works on scanned PDFs too, done in seconds. Free to start, no credit card.
立即试用图片转文字(OCR)
Stop retyping screenshots and scans. Upload any image and get clean, editable text in 30+ languages — ready to copy in seconds. Free to start.
立即试用合并 PDF
Stop emailing five attachments. Drop your PDFs, drag them into order, and download a single merged file in seconds. Free to start, no watermark, files auto-deleted.
立即试用压缩 PDF
Rejected by an upload limit or bounced by email? Pick a quality preset and get a much smaller PDF in seconds — same document, lighter file. Free to start, no watermark.
立即试用字数统计
Essay limits and character caps sneak up on you. Paste or type to see words, characters, sentences, paragraphs and reading time update live. Free to use and copy — no account needed.
立即试用常见问题
上传您的 PDF,工具会检测它包含的是真正的文本层还是仅有扫描图像。带文本层的 PDF 可即时导出。纯图像的 PDF(扫描书籍、拍摄的收据、旧报告)会自动经过 OCR 处理。无论哪种情况,您都能得到一份整洁的 .txt 文件,保留段落、换行和章节间距。
usage可以。如果 PDF 是纯图片格式(扫描件、拍摄页面或传真导出常见此种情况),OCR 引擎会自动启动——你无需另用工具。内置多语言支持,因此即便是双语或非拉丁文字(中文、阿拉伯文、印地文)也能在同一次处理中提取出来。
features段落分隔、章节之间的空行、项目符号和编号列表前缀都会以纯文本形式保留。标题会根据源字体以大写或原始大小写呈现。视觉强调(粗体、斜体)无法在纯文本中编码——如需保留这些,请改用 PDF 转 Word 转换器。
technical可以。上传后在提示框中输入密码,工具会在内存中将文件解锁,时间仅够提取文本之用。密码绝不会存储到磁盘或传输给第三方服务。没有密码的加密 PDF 无法处理——出于安全考虑,本工具不进行密码破解。
features免费版的文件最大可达 20 MB,高级版的文件最大可达 50 MB,专业版的文件最大可达 120 MB,并且可以毫无问题地处理 500 页。较大的文档也可以工作,但需要更长的时间 - 2000 页的法律档案可能需要几分钟的 OCR 时间。对于大量作业,请先使用 PDF 拆分工具拆分 PDF,然后单独处理每个块。
technicalProcessing happens on secure servers and files are deleted within 24 hours — unless you explicitly share a result, which keeps it at a public link anyone who has it can open for up to 30 days. The .txt output is yours — no watermark, no attribution, no tracking. Researchers, journalists, lawyers and students use the tool to extract text from confidential reports knowing the source PDF is not retained beyond that window.
privacy可以。打开「引擎」面板,选择你文档的语言和 OCR 引擎,页面就会按该文字系统进行识别 — 支持 100 多种语言,包括非拉丁文和从右往左书写的文字。如果第一遍把带重音符号或非英文字符识别错了,请切换语言并点击「重新运行识别」。
usage格式化视图保留页面的原始排版——分栏、间距和行的位置——非常适合表格和收据。纯文本视图则提供干净、重新排版的文字,更方便粘贴到文档或聊天机器人中。在两种视图间切换,然后复制文字或将其下载为 .txt 文件。
features此工具直接为你提供可复制或保存为 .txt 的纯文本。如果你想保留原始 PDF 但让它支持 Ctrl+F 搜索,请用「图片转可搜索 PDF」工具处理 — 它会在扫描件上方添加一层隐形的 OCR 文字层,页面看起来一模一样,但文字变得可选取。
tips对于常见的拉丁字母语言,先用“默认”引擎并选择文档所用语言——它处理日常文本又快又准。如果输出看起来乱码,或文字是非拉丁文字(阿拉伯文、印地文、中文、西里尔文),就切换到 Engine 1 或 Engine 2,在选择器中选好对应语言,然后点按“重新提取”——不同引擎针对不同文字做了调优,两个都试一下只需几秒。
tips输出框完全可编辑,因此你可以在屏幕上直接快速修正某个 OCR 错误或删减某一段。“复制到剪贴板”始终复制框内当前的确切内容,包括你的编辑——但“下载 .txt”保存的是上一次引擎/语言运行产出的原始文件,而不是你在屏幕上的编辑。要保留某处修正,请用“复制”并粘贴到你自己的 .txt 文件中;或者如果错误是系统性的,就切换“语言”或“引擎”并点按“重新提取”,而不要手动编辑。
features上传 PDF,让提取工具提取文字——对扫描件或纯图片页面会自动运行 OCR——然后将结果下载为纯文本 .txt 文件。该文件可在记事本、TextEdit 或任何代码编辑器中打开,无需专用软件。这样使用时,它就相当于一个简单的 PDF 转记事本工具,适合只想获取可直接复制、不含格式或图片的纯文字内容的场景。
usageYes — you can convert PDF to text free to preview; create a free account to download required. The free tier includes a generous daily allowance and covers OCR on scanned PDFs, the Formatted and Plain views, and the .txt download. If you extract text from large batches of documents every day, upgrading removes the daily limits.
pricing是的 - Pixoate 支持批处理和批量处理。切换到批处理模式,在 Premium 上添加最多 60 个 PDF,在 Pro 上添加最多 200 个 PDF,设置一次选项,然后在下载单个 ZIP 之前,每个 PDF 都会使用相同的设置进行处理。批量处理是一项高级功能;输出使用与单一模式相同的质量和设置。
features是的 - 通过批量处理,您只需配置一次设置,它们就会应用到批次中的每个项目 - Premium 上最多 60 个 PDF,Pro 上最多 200 个 PDF。无需对每个项目重复设置,临时上传和生成的文件将被安全处理并自动删除。
usagePDF 转文本 如何助您完成任务
它每天都在解决真实的问题——服务企业、创作者和日常任务。找到适合您的用例,几秒即可开始。
讲座与课程笔记提取
学生从教授提供的 PDF 讲义和实验手册中提取纯文本,方便把摘录粘贴到 Notion、Obsidian 和学习卡片中。
用于批量投递的简历文本
求职者从 PDF 简历中提取纯文本,粘贴到 ATS 申请表、LinkedIn Easy Apply 以及不支持文件上传的招聘门户文本框中。
从 PDF 报告生成邮件草稿
分析师从冗长的 PDF 报告中提取执行摘要部分,粘贴到邮件、Slack 消息和 Teams 聊天中,让相关方快速获取关键洞见。
对现有 PDF 资源进行 SEO 审查
营销人员从旧的 PDF 白皮书和电子书中提取文本,以审查关键词覆盖、识别内容空白,并重新发布为新的博客文章以获取自然搜索流量。
翻译工作流准备
译者先从 PDF 源文件中提取文字,再将其粘贴到 Trados、MemoQ 或 DeepL Pro 等翻译记忆工具中,以实现更快、更精准的本地化。
从长篇 PDF 报告生成 AI 提示词
高级用户从 PDF 研究论文中提取文本,将其作为上下文输入 ChatGPT、Claude 或 Gemini,用于摘要、问答和要点提取。
纯文本备份存档
IT 和档案团队从 PDF 文档库中提取纯文本,创建轻量、面向未来的备份,20 年后无需依赖 PDF 查看器也能读取。
引文与参考文献列表
研究人员将 PDF 中的参考文献部分提取为纯文本,即可直接粘贴到 Zotero、Mendeley 或 EndNote 中,无需逐条手动重新录入。
屏幕阅读器与文字转语音访问
从 PDF 中提取干净的文本,以便屏幕阅读器朗读或粘贴到文字转语音应用中——对视障读者或想解放双手收听长篇报告的人很有用。
法律电子取证关键词检索
律师助理从扫描的证词笔录和证据材料包中提取文字,让上千页的内容变得可全文检索,无需在纯图像 PDF 中逐页翻找某个人名或条款。
扫描发票数据流水线
开发者和运维团队从扫描的发票和收据中提取文本,输入基于正则或 LLM 的解析器,用自动化批量录入取代手工重录。
信息公开申请与泄露文件调查
调查记者从扫描的政府公告和信息公开(FOIA)文件中提取文本,以便在海量文档中检索、引用并交叉核对各项说法。
