PDF to Text (OCR)

Extract text from PDFs — free

Pull editable text out of any PDF with accurate OCR — even scanned, image-only or photo-of-document PDFs. Copy it or download as TXT, Markdown, Word, Excel or CSV.

  • Reads scanned & image-only PDFs in 30+ languages
  • Formatted or plain text — copy or download instantly
  • Private processing · Files deleted automatically

PDF · Secure processing

TXT
PDFTXT

PDFをアップロード

Drop any PDF — copy its text or download it as .txt

PDF · free up to 20MB, Premium up to 50MB

What you can do with PDF からテキストへ

Everything this tool helps you accomplish — no learning curve, no setup.

  • Extract plain text from any PDF
  • Pull text out of scanned or image-only PDFs
  • Copy content from PDFs that block selection
  • Read text in your document's own language
  • Re-run extraction for a cleaner result
  • Get editable text for notes or search

Settings information

Every control in PDF からテキストへ, explained — what it does and when to use it.

エンジン

エンジンドロップダウン
ファイルを読み取る文字認識エンジンを選びます。「デフォルト」が装飾的なフォントや手書き文字を誤認識する場合は、「エンジン1」または「エンジン2」に切り替えてください — 結果は自動的に更新されます。オプション: デフォルトエンジン1エンジン2
言語ドロップダウン
元のテキストが書かれている言語を設定し、文字を正確に認識させます。検索できるピッカーには選択中のエンジンが対応する言語だけが表示され、初期値は英語です。オプション: 日本語 Englishフランス語ドイツ人スペイン語イタリアポルトガル語オランダ語ロシア人日本語 English韓国人中国語(簡体)中国語(繁体)ログインヒンディー語ベンガル語プンジャビウルドゥーベトナムタイポーランドSwedishDanishNorwegianFinnishTurkishUkrainianIndonesianTamilTeluguMarathiNepaliPersianGreekHebrew
抽出をやり直すOne-click
現在の「エンジン」と「言語」の設定で、同じファイルの抽出をもう一度実行します — うまく読み取れなかったときの再試行に便利です。
Uploads are encrypted in transitRemoved under our retention policy

よくある質問

PDFをアップロードすると、ツールが本物のテキストレイヤーを含むのか、それともスキャンされた画像だけなのかを検出します。テキストレイヤーを持つPDFはその場で書き出されます。画像のみのPDF(スキャンした書籍、撮影したレシート、古いレポート)は自動的にOCRを通ります。どちらの場合も、段落、改行、セクションの間隔が保たれたきれいな.txtファイルが得られます。

usage

はい。PDFが画像のみの場合(スキャン、撮影したページ、ファックスの書き出しによく見られます)、OCRエンジンが自動的に作動するので、別のツールは必要ありません。多言語対応が組み込まれているため、二言語混在の文書やラテン文字以外の文字(中国語、アラビア語、ヒンディー語)でも、同じ処理の中で一度に抽出されます。

features

段落の区切り、セクション間の空行、箇条書きの記号、番号付きリストの接頭番号は、プレーンテキストとして保持されます。見出しは、元のフォントに応じて大文字、または元の大文字・小文字のまま出力されます。視覚的な強調(太字、斜体)はプレーンテキストには記録されません。それが必要な場合は、代わりに PDF から Word への変換ツールをご利用ください。

technical

はい。アップロード後に表示される入力欄でパスワードを入力すると、ツールはテキストを抽出するのに必要な間だけメモリ上でファイルのロックを解除します。パスワードがディスクに保存されたり、第三者のサービスに送信されたりすることは一切ありません。パスワードのないロック済みPDFは処理できません。セキュリティ上の理由から、パスワードの解読は一切行いません。

features

ファイルは、Free で最大 20 MB、Premium で 50 MB、Pro で 120 MB まで可能で、500 ページは問題なく処理できます。より大きな文書も機能しますが、時間がかかります。2000 ページの法的アーカイブの場合、OCR には数分かかる場合があります。大量のジョブの場合は、まず PDF 分割ツールを使用して PDF を分割し、各チャンクを個別に処理します。

technical

Processing happens on secure servers and files are deleted within 24 hours — unless you explicitly share a result, which keeps it at a public link anyone who has it can open for up to 30 days. The .txt output is yours — no watermark, no attribution, no tracking. Researchers, journalists, lawyers and students use the tool to extract text from confidential reports knowing the source PDF is not retained beyond that window.

privacy

はい。エンジンパネルを開いて文書の言語とOCRエンジンを選ぶと、その文字体系でページが読み取られます — 非ラテン文字や右から左に書く言語を含め、100以上の言語に対応しています。最初の読み取りでアクセント付き文字や英語以外の文字が誤読された場合は、言語を切り替えて「抽出を再実行」をタップしてください。

usage

整形ビューはページ本来のレイアウト(段組み・間隔・行位置)をそのまま保つので、表やレシートに最適です。プレーンビューは整理して流し込んだクリーンなテキストになり、ドキュメントやチャットボットへの貼り付けが簡単です。両者を切り替えて、テキストをコピーするか .txt ファイルとしてダウンロードできます。

features

このツールは、コピーや.txt保存ができる生テキストを返します。元のPDFはそのまま残しつつCtrl+Fで検索できるようにしたい場合は、Image to Searchable PDFツールに通してください。スキャンの上に見えないOCRテキスト層を追加するので、ページの見た目はそのままで、文字が選択可能になります。

tips

一般的なラテン文字系の言語なら、まずはデフォルトと文書の言語で始めてください。日常的なテキストなら高速で正確です。出力が文字化けしたり、非ラテン文字(アラビア語・ヒンディー語・中国語・キリル文字)だったりする場合は、Engine 1またはEngine 2に切り替え、選択画面で該当言語を選んで「抽出を再実行」をタップします。エンジンによって得意な文字体系が異なるため、両方試しても数秒で済みます。

tips

出力ボックスは完全に編集可能なので、OCRの誤りを画面上ですばやく修正したり、一部を削ったりできます。「クリップボードにコピー」は、編集した内容も含めて、現在ボックスに入っているものをそのままコピーします。ただし「.txtをダウンロード」は、画面上の編集ではなく、最後のエンジン/言語での実行によって生成された元のファイルを保存します。修正を残すには、「コピー」を使ってご自分の.txtファイルに貼り付けるか、誤りが体系的なものであれば、手作業で編集する代わりに言語やエンジンを切り替えて「抽出を再実行」をタップしてください。

features

PDFをアップロードすると、抽出ツールがテキストを取り出します — スキャンされたページや画像のみのページには自動的にOCRが実行されます — 結果はプレーンな.txtファイルとしてダウンロードできます。このファイルはメモ帳やテキストエディット、任意のコードエディタで特別なソフトなしに開けます。書式や画像なしで、コピーしてすぐ使える生のテキストだけが欲しいときは、シンプルなpdfからメモ帳への変換ツールとして使えます。

usage

Yes — you can convert PDF to text free to preview; create a free account to download required. The free tier includes a generous daily allowance and covers OCR on scanned PDFs, the Formatted and Plain views, and the .txt download. If you extract text from large batches of documents every day, upgrading removes the daily limits.

pricing

はい — Pixoate はバッチ処理と一括処理をサポートしています。バッチ モードに切り替え、プレミアムでは最大 60 個、プロでは最大 200 個の PDF を追加し、オプションを一度設定すると、単一の ZIP をダウンロードする前にすべての PDF が同じ設定で処理されます。一括処理はプレミアム機能です。出力にはシングル モードと同じ品質と設定が使用されます。

features

はい。一括処理では設定を 1 回行うだけで、バッチ内のすべてのアイテムに適用されます (Premium では最大 60 PDF、Pro では 200 PDF)。項目ごとに設定を繰り返す必要はなく、アップロードおよび生成された一時ファイルは安全に処理され、自動的に削除されます。

usage

PDF からテキストへでできること

ビジネス、クリエイター、日々の作業で毎日役立つ、実際の課題を解決します。あなたに合う使い方を見つけて、数秒で始めましょう。

学歴

講義・授業ノートの抽出

学生は、教授から提供された PDF の講義ノートや実習マニュアルからプレーンテキストを抽出し、抜粋を Notion や Obsidian、学習用の暗記カードに貼り付けることができます。

個人利用

一括提出用の履歴書テキスト

求職者はPDF履歴書からプレーンテキストを抽出し、ファイルのアップロードに対応していないATS応募フォーム、LinkedInのEasy Apply、採用ポータルのテキスト欄に貼り付けられます。

ビジネス向け

PDFレポートからメール下書きを作成

アナリストは、長いPDFレポートからエグゼクティブサマリーの部分を抽出し、メールやSlackメッセージ、Teamsのチャットに貼り付けます。これにより関係者が要点をすばやく把握できます。

ビジネス向け

既存のPDFリソースのSEO監査

マーケターは、古いPDFのホワイトペーパーや電子書籍からテキストを抽出し、キーワードの網羅状況を監査したり、コンテンツの不足を特定したり、オーガニック検索向けに新しいブログ記事として再公開したりできます。

ビジネス向け

翻訳ワークフローの準備

翻訳者は、より速く正確なローカライズのために、PDFの原稿からテキストを抽出してから、Trados、MemoQ、DeepL Proといった翻訳メモリツールに貼り付けます。

生産性

長いPDFレポートからのAIプロンプト

パワーユーザーは PDF の研究論文からテキストを抽出し、要約・Q&A・要点抽出のためのコンテキストとして ChatGPT、Claude、Gemini に渡しています。

ビジネス向け

プレーンテキストのバックアップアーカイブ

IT部門や記録管理チームは、PDFのドキュメントアーカイブからプレーンテキストを抽出し、20年後にPDFビューアーに依存しない軽量で将来も使えるバックアップを作成します。

学歴

引用と参考文献リスト

研究者はPDFから参考文献欄をプレーンテキストとして抽出し、各項目を手作業で入力し直すことなくZotero、Mendeley、EndNoteに貼り付けられます。

個人利用

スクリーンリーダー・音声読み上げのアクセス

PDF からきれいなテキストを抽出すれば、スクリーンリーダーで読み上げたり、テキスト読み上げアプリに貼り付けたりできます。視覚に障害のある読者や、長いレポートをハンズフリーで聴きたい場合に便利です。

法的事項

法的電子証拠開示のキーワード検索

パラリーガルはスキャンした証言録取書や証拠開示資料からテキストを抽出し、名前や条項を探して画像のみのPDFをスクロールする代わりに、数千ページにわたって内容を検索できるようにします。

開発者向け

スキャン請求書のデータパイプライン

開発者や運用チームは、スキャンした請求書やレシートからテキストを抽出し、正規表現やLLMベースのパーサーに渡すことで、手作業の再入力の代わりに大量のデータ入力を自動化します。

リサーチ

情報公開請求・リーク文書の調査

調査報道記者は、スキャンした政府発表資料や情報公開請求(FOIA)文書からテキストを抽出し、大量の文書の山を横断して主張を検索・引用・相互参照できます。