PDF to Text (OCR)

Extract text from PDFs — free

Pull editable text out of any PDF with accurate OCR — even scanned, image-only or photo-of-document PDFs. Copy it or download as TXT, Markdown, Word, Excel or CSV.

  • Reads scanned & image-only PDFs in 30+ languages
  • Formatted or plain text — copy or download instantly
  • Private processing · Files deleted automatically

PDF · Secure processing

TXT
PDFTXT

Tải lên PDF

Drop any PDF — copy its text or download it as .txt

PDF · free up to 20MB, Premium up to 50MB

What you can do with PDF sang văn bản

Everything this tool helps you accomplish — no learning curve, no setup.

  • Extract plain text from any PDF
  • Pull text out of scanned or image-only PDFs
  • Copy content from PDFs that block selection
  • Read text in your document's own language
  • Re-run extraction for a cleaner result
  • Get editable text for notes or search

Settings information

Every control in PDF sang văn bản, explained — what it does and when to use it.

Bộ máy

Bộ máyDropdown
Chọn công cụ nhận dạng văn bản sẽ đọc tệp của bạn; hãy chuyển sang Công cụ 1 hoặc Công cụ 2 khi tùy chọn Mặc định đọc sai phông chữ cách điệu hay chữ viết tay — kết quả sẽ tự động cập nhật.Tùy chọn: Mặc địnhBộ máy 1Bộ máy 2
Ngôn ngữDropdown
Chọn ngôn ngữ mà văn bản gốc được viết để nhận dạng ký tự thật chính xác; trình chọn có thể tìm kiếm chỉ liệt kê những ngôn ngữ mà công cụ đang chọn hỗ trợ, mặc định là tiếng Anh.Tùy chọn: EnglishFrenchGermanSpanishItalianPortugueseDutchRussianJapaneseKoreanChinese (Simplified)Chinese (Traditional)ArabicHindiBengaliPunjabiUrduVietnameseThaiPolishSwedishDanishNorwegianFinnishTurkishUkrainianIndonesianTamilTeluguMarathiNepaliPersianGreekHebrew
Chạy lại trích xuấtOne-click
Chạy lại quá trình trích xuất trên cùng tệp đó với lựa chọn Công cụ và Ngôn ngữ hiện tại — tiện lợi để thử lại sau một lần chạy kém hoặc thất bại.
Uploads are encrypted in transitRemoved under our retention policy

Câu hỏi thường gặp

Tải lên PDF của bạn và công cụ phát hiện xem nó chứa lớp văn bản thực hay chỉ là hình ảnh quét. PDF có lớp văn bản xuất ra tức thì. PDF chỉ có hình ảnh (sách quét, hóa đơn chụp ảnh, báo cáo cũ) được chạy qua OCR tự động. Dù theo cách nào, bạn đều nhận được tệp .txt gọn gàng với đoạn văn, ngắt dòng và khoảng cách giữa các phần được giữ nguyên.

usage

Có. Nếu file PDF chỉ gồm ảnh (thường gặp với bản quét, trang chụp ảnh hoặc bản xuất từ fax), bộ máy OCR sẽ tự động kích hoạt — bạn không cần một công cụ riêng. Hỗ trợ đa ngôn ngữ được tích hợp sẵn, nên ngay cả văn bản song ngữ hay chữ viết không phải Latinh (tiếng Trung, Ả Rập, Hindi) cũng được trích xuất trong cùng một lượt.

features

Dấu ngắt đoạn, dòng trống giữa các phần, ký hiệu đầu dòng và tiền tố danh sách đánh số được giữ lại dưới dạng văn bản thuần. Tiêu đề được hiển thị bằng chữ hoa hoặc giữ nguyên kiểu chữ gốc tùy thuộc vào font nguồn. Nhấn mạnh trực quan (in đậm, in nghiêng) không được mã hóa trong văn bản thuần — để có những thứ đó, hãy dùng công cụ chuyển PDF sang Word.

technical

Có. Nhập mật khẩu vào ô nhắc sau khi tải lên, và công cụ sẽ mở khóa file trong bộ nhớ vừa đủ lâu để trích xuất văn bản. Mật khẩu không bao giờ được lưu trên ổ đĩa hay truyền tới các dịch vụ bên thứ ba. Các file PDF bị khóa mà không có mật khẩu thì không thể xử lý — vì lý do bảo mật, không có thao tác phá mật khẩu nào được thực hiện.

features

Tệp có thể có dung lượng lên tới 20 MB ở chế độ Miễn phí, 50 MB ở chế độ Premium hoặc 120 MB ở chế độ Pro và xử lý 500 trang mà không gặp sự cố. Các tài liệu lớn hơn cũng có tác dụng nhưng mất nhiều thời gian hơn — một kho lưu trữ pháp lý 2000 trang có thể mất vài phút để thực hiện OCR. Đối với các công việc lớn, trước tiên hãy tách tệp PDF bằng công cụ Tách PDF và xử lý từng đoạn riêng biệt.

technical

Processing happens on secure servers and files are deleted within 24 hours — unless you explicitly share a result, which keeps it at a public link anyone who has it can open for up to 30 days. The .txt output is yours — no watermark, no attribution, no tracking. Researchers, journalists, lawyers and students use the tool to extract text from confidential reports knowing the source PDF is not retained beyond that window.

privacy

Có. Mở bảng Công cụ, chọn ngôn ngữ tài liệu và công cụ OCR của bạn, và trang sẽ được đọc theo hệ chữ đó — hơn 100 ngôn ngữ được hỗ trợ, bao gồm cả các hệ chữ phi Latinh và viết từ phải sang trái. Nếu lượt đầu đọc sai các ký tự có dấu hoặc không phải tiếng Anh, hãy đổi ngôn ngữ và chạm Chạy lại trích xuất.

usage

Chế độ xem định dạng giữ nguyên bố cục gốc của trang — cột, khoảng cách và vị trí dòng — rất hữu ích cho bảng biểu và hóa đơn. Chế độ xem văn bản thuần cho ra văn bản gọn gàng, được căn chỉnh lại, dễ dán vào tài liệu hoặc chatbot hơn. Chuyển đổi giữa hai chế độ, rồi sao chép văn bản hoặc tải về dưới dạng tệp .txt.

features

Công cụ này trả cho bạn văn bản thô để sao chép hoặc lưu dưới dạng .txt. Nếu bạn muốn giữ PDF gốc nhưng làm cho nó tìm được bằng Ctrl+F, hãy đưa nó qua công cụ Ảnh sang PDF có thể tìm kiếm — công cụ này thêm một lớp văn bản OCR vô hình lên bản quét, nên trang trông y hệt trong khi các từ trở nên chọn được.

tips

Bắt đầu với Default và ngôn ngữ của tài liệu cho các ngôn ngữ dùng hệ chữ Latinh phổ biến — nó nhanh và chính xác cho văn bản thường ngày. Nếu kết quả bị lỗi hoặc hệ chữ không phải Latinh (tiếng Ả Rập, Hindi, Trung, Kirin), chuyển sang Engine 1 hoặc Engine 2, chọn ngôn ngữ tương ứng ở bộ chọn, và chạm Re-run extraction — mỗi engine được tinh chỉnh cho từng hệ chữ khác nhau, nên thử cả hai chỉ mất vài giây.

tips

Ô kết quả hoàn toàn có thể chỉnh sửa, nên bạn có thể nhanh chóng dọn một lỗi OCR hoặc cắt bớt một phần ngay trên màn hình. Copy to clipboard luôn sao chép chính xác những gì hiện có trong ô, bao gồm cả các chỉnh sửa — nhưng Download .txt lưu tệp gốc do lần chạy Engine/Language cuối cùng tạo ra, chứ không phải các chỉnh sửa trên màn hình của bạn. Để giữ một sửa đổi, dùng Copy và dán nó vào tệp .txt của riêng bạn, hoặc nếu lỗi mang tính hệ thống, hãy đổi Language hoặc Engine và chạm Re-run extraction thay vì sửa bằng tay.

features

Tải lên PDF và để công cụ trích xuất lấy văn bản ra — OCR sẽ tự động chạy trên các trang được quét hoặc chỉ chứa ảnh — rồi tải xuống kết quả dưới dạng file .txt thuần túy. File này mở được bằng Notepad, TextEdit hoặc bất kỳ trình soạn thảo code nào mà không cần phần mềm đặc biệt. Dùng theo cách này, nó hoạt động như một công cụ chuyển PDF sang Notepad đơn giản khi bạn chỉ cần văn bản thô, sẵn sàng sao chép mà không có định dạng hay hình ảnh.

usage

Yes — you can convert PDF to text free to preview; create a free account to download required. The free tier includes a generous daily allowance and covers OCR on scanned PDFs, the Formatted and Plain views, and the .txt download. If you extract text from large batches of documents every day, upgrading removes the daily limits.

pricing

Có — Pixoate hỗ trợ xử lý hàng loạt và hàng loạt. Chuyển sang chế độ Hàng loạt, thêm tối đa 60 tệp PDF trên Premium hoặc 200 trên Pro, đặt các tùy chọn của bạn một lần và mọi tệp PDF đều được xử lý với cùng cài đặt trước khi bạn tải xuống một tệp ZIP. Xử lý hàng loạt là một tính năng Cao cấp; đầu ra sử dụng cùng chất lượng và cài đặt như chế độ đơn.

features

Có — với tính năng xử lý hàng loạt, bạn định cấu hình cài đặt một lần và chúng áp dụng cho mọi mục trong lô — tối đa 60 tệp PDF trên Premium hoặc 200 trên Pro. Không cần phải lặp lại thiết lập cho mỗi mục và các tệp được tạo và tải lên tạm thời sẽ được xử lý an toàn và tự động xóa.

usage

PDF sang văn bản giúp bạn hoàn thành công việc như thế nào

Những vấn đề thực tế mà công cụ này giải quyết mỗi ngày — cho doanh nghiệp, người sáng tạo và các tác vụ thường ngày. Tìm trường hợp sử dụng phù hợp với bạn và bắt đầu trong vài giây.

Học vấn

Trích ghi chú bài giảng & khóa học

Học sinh trích xuất văn bản thuần từ bài giảng PDF và sổ tay thí nghiệm do giáo sư cung cấp để dán đoạn trích vào Notion, Obsidian và thẻ ghi nhớ học tập.

Sử dụng cá nhân

Trích xuất nội dung CV để nộp hàng loạt

Người tìm việc trích văn bản thuần từ CV PDF để dán vào biểu mẫu ATS, LinkedIn Easy Apply và các ô nhập liệu trên cổng tuyển dụng vốn không cho tải tệp lên.

Cho doanh nghiệp

Bản nháp email từ báo cáo PDF

Các nhà phân tích trích xuất phần tóm tắt điều hành từ những báo cáo PDF dài để dán vào email, tin nhắn Slack và cuộc trò chuyện Teams, giúp các bên liên quan nắm bắt thông tin then chốt nhanh chóng.

Cho doanh nghiệp

Kiểm tra SEO cho các tài nguyên PDF hiện có

Người làm tiếp thị trích văn bản từ các tài liệu chuyên đề PDF và eBook cũ để rà soát độ phủ từ khóa, tìm ra khoảng trống nội dung và đăng lại thành bài blog mới phục vụ tìm kiếm tự nhiên.

Cho doanh nghiệp

Chuẩn bị quy trình dịch thuật

Người dịch trích xuất văn bản từ nguồn PDF trước khi dán vào các công cụ bộ nhớ dịch như Trados, MemoQ hay DeepL Pro để bản địa hóa nhanh hơn, chính xác hơn.

Năng suất

Tạo prompt AI từ các báo cáo PDF dài

Người dùng chuyên sâu trích xuất văn bản từ các bài nghiên cứu PDF và đưa vào ChatGPT, Claude hoặc Gemini làm ngữ cảnh để tóm tắt, hỏi đáp và rút trích các điểm chính.

Cho doanh nghiệp

Lưu trữ sao lưu văn bản thuần

Các nhóm CNTT và lưu trữ hồ sơ trích xuất văn bản thuần từ kho tài liệu PDF để tạo các bản sao lưu nhẹ, bền vững với thời gian, không phụ thuộc vào trình xem PDF sau 20 năm nữa.

Học vấn

Danh sách trích dẫn & tài liệu tham khảo

Các nhà nghiên cứu trích xuất phần tài liệu tham khảo từ tệp PDF thành văn bản thuần để có thể dán vào Zotero, Mendeley hoặc EndNote mà không phải gõ lại thủ công từng mục.

Sử dụng cá nhân

Truy cập trình đọc màn hình & chuyển văn bản thành giọng nói

Trích xuất văn bản sạch từ PDF để trình đọc màn hình có thể đọc to hoặc dán vào ứng dụng chuyển văn bản thành giọng nói — hữu ích cho người đọc khiếm thị hoặc để nghe một báo cáo dài mà không cần dùng tay.

Pháp lý

Tìm kiếm từ khóa trong khám phá điện tử pháp lý

Trợ lý pháp lý trích xuất văn bản từ các bản khai và tập hồ sơ đã quét để nội dung có thể tìm kiếm được trên hàng nghìn trang, thay vì cuộn qua các file PDF chỉ có hình ảnh để tìm một cái tên hay một điều khoản.

Cho nhà phát triển

Quy trình dữ liệu hóa đơn được quét

Các lập trình viên và nhóm vận hành trích xuất văn bản từ hóa đơn và biên lai đã quét để đưa vào bộ phân tích cú pháp dựa trên regex hoặc LLM, tự động hóa việc nhập liệu hàng loạt thay vì gõ lại thủ công.

Nghiên cứu

Điều tra tài liệu FOIA & rò rỉ

Nhà báo điều tra trích xuất văn bản từ các thông cáo chính phủ và tài liệu FOIA đã quét để có thể tìm kiếm, trích dẫn và đối chiếu chéo các nhận định trên những kho tài liệu lớn.