Extract text from PDFs — free
Pull editable text out of any PDF with accurate OCR — even scanned, image-only or photo-of-document PDFs. Copy it or download as TXT, Markdown, Word, Excel or CSV.
- Reads scanned & image-only PDFs in 30+ languages
- Formatted or plain text — copy or download instantly
- Private processing · Files deleted automatically
PDF · Secure processing
Tải lên PDF
Drop any PDF — copy its text or download it as .txt
PDF · free up to 20MB, Premium up to 50MB
What you can do with PDF sang văn bản
Everything this tool helps you accomplish — no learning curve, no setup.
- Extract plain text from any PDF
- Pull text out of scanned or image-only PDFs
- Copy content from PDFs that block selection
- Read text in your document's own language
- Re-run extraction for a cleaner result
- Get editable text for notes or search
Settings information
3 settings
Every control in PDF sang văn bản, explained — what it does and when to use it.
Bộ máy
- Bộ máyDropdown
- Chọn công cụ nhận dạng văn bản sẽ đọc tệp của bạn; hãy chuyển sang Công cụ 1 hoặc Công cụ 2 khi tùy chọn Mặc định đọc sai phông chữ cách điệu hay chữ viết tay — kết quả sẽ tự động cập nhật.Tùy chọn: Mặc địnhBộ máy 1Bộ máy 2
- Ngôn ngữDropdown
- Chọn ngôn ngữ mà văn bản gốc được viết để nhận dạng ký tự thật chính xác; trình chọn có thể tìm kiếm chỉ liệt kê những ngôn ngữ mà công cụ đang chọn hỗ trợ, mặc định là tiếng Anh.Tùy chọn: EnglishFrenchGermanSpanishItalianPortugueseDutchRussianJapaneseKoreanChinese (Simplified)Chinese (Traditional)ArabicHindiBengaliPunjabiUrduVietnameseThaiPolishSwedishDanishNorwegianFinnishTurkishUkrainianIndonesianTamilTeluguMarathiNepaliPersianGreekHebrew
- Chạy lại trích xuấtOne-click
- Chạy lại quá trình trích xuất trên cùng tệp đó với lựa chọn Công cụ và Ngôn ngữ hiện tại — tiện lợi để thử lại sau một lần chạy kém hoặc thất bại.
Xong với PDF sang văn bản rồi? Hãy thử những công cụ này tiếp theo
Những công cụ được chọn lọc kết hợp tốt với PDF sang văn bản. Tiếp tục làm việc mà không mất tệp của bạn.
PDF sang Word
Stop retyping locked PDFs. Get a clean .docx with fonts, tables and layout preserved that opens in Word, Pages or Google Docs — ready in seconds. Free to start, no credit card.
Dùng thử ngayPDF sang HTML
Get semantic HTML with real table markup you can paste straight into your site or CMS — works on scanned PDFs too, done in seconds. Free to start, no credit card.
Dùng thử ngayẢnh sang văn bản (OCR)
Stop retyping screenshots and scans. Upload any image and get clean, editable text in 30+ languages — ready to copy in seconds. Free to start.
Dùng thử ngayGộp PDF
Stop emailing five attachments. Drop your PDFs, drag them into order, and download a single merged file in seconds. Free to start, no watermark, files auto-deleted.
Dùng thử ngayNén PDF
Rejected by an upload limit or bounced by email? Pick a quality preset and get a much smaller PDF in seconds — same document, lighter file. Free to start, no watermark.
Dùng thử ngayĐếm từ
Essay limits and character caps sneak up on you. Paste or type to see words, characters, sentences, paragraphs and reading time update live. Free to use and copy — no account needed.
Dùng thử ngayCâu hỏi thường gặp
Tải lên PDF của bạn và công cụ phát hiện xem nó chứa lớp văn bản thực hay chỉ là hình ảnh quét. PDF có lớp văn bản xuất ra tức thì. PDF chỉ có hình ảnh (sách quét, hóa đơn chụp ảnh, báo cáo cũ) được chạy qua OCR tự động. Dù theo cách nào, bạn đều nhận được tệp .txt gọn gàng với đoạn văn, ngắt dòng và khoảng cách giữa các phần được giữ nguyên.
usageCó. Nếu file PDF chỉ gồm ảnh (thường gặp với bản quét, trang chụp ảnh hoặc bản xuất từ fax), bộ máy OCR sẽ tự động kích hoạt — bạn không cần một công cụ riêng. Hỗ trợ đa ngôn ngữ được tích hợp sẵn, nên ngay cả văn bản song ngữ hay chữ viết không phải Latinh (tiếng Trung, Ả Rập, Hindi) cũng được trích xuất trong cùng một lượt.
featuresDấu ngắt đoạn, dòng trống giữa các phần, ký hiệu đầu dòng và tiền tố danh sách đánh số được giữ lại dưới dạng văn bản thuần. Tiêu đề được hiển thị bằng chữ hoa hoặc giữ nguyên kiểu chữ gốc tùy thuộc vào font nguồn. Nhấn mạnh trực quan (in đậm, in nghiêng) không được mã hóa trong văn bản thuần — để có những thứ đó, hãy dùng công cụ chuyển PDF sang Word.
technicalCó. Nhập mật khẩu vào ô nhắc sau khi tải lên, và công cụ sẽ mở khóa file trong bộ nhớ vừa đủ lâu để trích xuất văn bản. Mật khẩu không bao giờ được lưu trên ổ đĩa hay truyền tới các dịch vụ bên thứ ba. Các file PDF bị khóa mà không có mật khẩu thì không thể xử lý — vì lý do bảo mật, không có thao tác phá mật khẩu nào được thực hiện.
featuresTệp có thể có dung lượng lên tới 20 MB ở chế độ Miễn phí, 50 MB ở chế độ Premium hoặc 120 MB ở chế độ Pro và xử lý 500 trang mà không gặp sự cố. Các tài liệu lớn hơn cũng có tác dụng nhưng mất nhiều thời gian hơn — một kho lưu trữ pháp lý 2000 trang có thể mất vài phút để thực hiện OCR. Đối với các công việc lớn, trước tiên hãy tách tệp PDF bằng công cụ Tách PDF và xử lý từng đoạn riêng biệt.
technicalProcessing happens on secure servers and files are deleted within 24 hours — unless you explicitly share a result, which keeps it at a public link anyone who has it can open for up to 30 days. The .txt output is yours — no watermark, no attribution, no tracking. Researchers, journalists, lawyers and students use the tool to extract text from confidential reports knowing the source PDF is not retained beyond that window.
privacyCó. Mở bảng Công cụ, chọn ngôn ngữ tài liệu và công cụ OCR của bạn, và trang sẽ được đọc theo hệ chữ đó — hơn 100 ngôn ngữ được hỗ trợ, bao gồm cả các hệ chữ phi Latinh và viết từ phải sang trái. Nếu lượt đầu đọc sai các ký tự có dấu hoặc không phải tiếng Anh, hãy đổi ngôn ngữ và chạm Chạy lại trích xuất.
usageChế độ xem định dạng giữ nguyên bố cục gốc của trang — cột, khoảng cách và vị trí dòng — rất hữu ích cho bảng biểu và hóa đơn. Chế độ xem văn bản thuần cho ra văn bản gọn gàng, được căn chỉnh lại, dễ dán vào tài liệu hoặc chatbot hơn. Chuyển đổi giữa hai chế độ, rồi sao chép văn bản hoặc tải về dưới dạng tệp .txt.
featuresCông cụ này trả cho bạn văn bản thô để sao chép hoặc lưu dưới dạng .txt. Nếu bạn muốn giữ PDF gốc nhưng làm cho nó tìm được bằng Ctrl+F, hãy đưa nó qua công cụ Ảnh sang PDF có thể tìm kiếm — công cụ này thêm một lớp văn bản OCR vô hình lên bản quét, nên trang trông y hệt trong khi các từ trở nên chọn được.
tipsBắt đầu với Default và ngôn ngữ của tài liệu cho các ngôn ngữ dùng hệ chữ Latinh phổ biến — nó nhanh và chính xác cho văn bản thường ngày. Nếu kết quả bị lỗi hoặc hệ chữ không phải Latinh (tiếng Ả Rập, Hindi, Trung, Kirin), chuyển sang Engine 1 hoặc Engine 2, chọn ngôn ngữ tương ứng ở bộ chọn, và chạm Re-run extraction — mỗi engine được tinh chỉnh cho từng hệ chữ khác nhau, nên thử cả hai chỉ mất vài giây.
tipsÔ kết quả hoàn toàn có thể chỉnh sửa, nên bạn có thể nhanh chóng dọn một lỗi OCR hoặc cắt bớt một phần ngay trên màn hình. Copy to clipboard luôn sao chép chính xác những gì hiện có trong ô, bao gồm cả các chỉnh sửa — nhưng Download .txt lưu tệp gốc do lần chạy Engine/Language cuối cùng tạo ra, chứ không phải các chỉnh sửa trên màn hình của bạn. Để giữ một sửa đổi, dùng Copy và dán nó vào tệp .txt của riêng bạn, hoặc nếu lỗi mang tính hệ thống, hãy đổi Language hoặc Engine và chạm Re-run extraction thay vì sửa bằng tay.
featuresTải lên PDF và để công cụ trích xuất lấy văn bản ra — OCR sẽ tự động chạy trên các trang được quét hoặc chỉ chứa ảnh — rồi tải xuống kết quả dưới dạng file .txt thuần túy. File này mở được bằng Notepad, TextEdit hoặc bất kỳ trình soạn thảo code nào mà không cần phần mềm đặc biệt. Dùng theo cách này, nó hoạt động như một công cụ chuyển PDF sang Notepad đơn giản khi bạn chỉ cần văn bản thô, sẵn sàng sao chép mà không có định dạng hay hình ảnh.
usageYes — you can convert PDF to text free to preview; create a free account to download required. The free tier includes a generous daily allowance and covers OCR on scanned PDFs, the Formatted and Plain views, and the .txt download. If you extract text from large batches of documents every day, upgrading removes the daily limits.
pricingCó — Pixoate hỗ trợ xử lý hàng loạt và hàng loạt. Chuyển sang chế độ Hàng loạt, thêm tối đa 60 tệp PDF trên Premium hoặc 200 trên Pro, đặt các tùy chọn của bạn một lần và mọi tệp PDF đều được xử lý với cùng cài đặt trước khi bạn tải xuống một tệp ZIP. Xử lý hàng loạt là một tính năng Cao cấp; đầu ra sử dụng cùng chất lượng và cài đặt như chế độ đơn.
featuresCó — với tính năng xử lý hàng loạt, bạn định cấu hình cài đặt một lần và chúng áp dụng cho mọi mục trong lô — tối đa 60 tệp PDF trên Premium hoặc 200 trên Pro. Không cần phải lặp lại thiết lập cho mỗi mục và các tệp được tạo và tải lên tạm thời sẽ được xử lý an toàn và tự động xóa.
usagePDF sang văn bản giúp bạn hoàn thành công việc như thế nào
Những vấn đề thực tế mà công cụ này giải quyết mỗi ngày — cho doanh nghiệp, người sáng tạo và các tác vụ thường ngày. Tìm trường hợp sử dụng phù hợp với bạn và bắt đầu trong vài giây.
Trích ghi chú bài giảng & khóa học
Học sinh trích xuất văn bản thuần từ bài giảng PDF và sổ tay thí nghiệm do giáo sư cung cấp để dán đoạn trích vào Notion, Obsidian và thẻ ghi nhớ học tập.
Trích xuất nội dung CV để nộp hàng loạt
Người tìm việc trích văn bản thuần từ CV PDF để dán vào biểu mẫu ATS, LinkedIn Easy Apply và các ô nhập liệu trên cổng tuyển dụng vốn không cho tải tệp lên.
Bản nháp email từ báo cáo PDF
Các nhà phân tích trích xuất phần tóm tắt điều hành từ những báo cáo PDF dài để dán vào email, tin nhắn Slack và cuộc trò chuyện Teams, giúp các bên liên quan nắm bắt thông tin then chốt nhanh chóng.
Kiểm tra SEO cho các tài nguyên PDF hiện có
Người làm tiếp thị trích văn bản từ các tài liệu chuyên đề PDF và eBook cũ để rà soát độ phủ từ khóa, tìm ra khoảng trống nội dung và đăng lại thành bài blog mới phục vụ tìm kiếm tự nhiên.
Chuẩn bị quy trình dịch thuật
Người dịch trích xuất văn bản từ nguồn PDF trước khi dán vào các công cụ bộ nhớ dịch như Trados, MemoQ hay DeepL Pro để bản địa hóa nhanh hơn, chính xác hơn.
Tạo prompt AI từ các báo cáo PDF dài
Người dùng chuyên sâu trích xuất văn bản từ các bài nghiên cứu PDF và đưa vào ChatGPT, Claude hoặc Gemini làm ngữ cảnh để tóm tắt, hỏi đáp và rút trích các điểm chính.
Lưu trữ sao lưu văn bản thuần
Các nhóm CNTT và lưu trữ hồ sơ trích xuất văn bản thuần từ kho tài liệu PDF để tạo các bản sao lưu nhẹ, bền vững với thời gian, không phụ thuộc vào trình xem PDF sau 20 năm nữa.
Danh sách trích dẫn & tài liệu tham khảo
Các nhà nghiên cứu trích xuất phần tài liệu tham khảo từ tệp PDF thành văn bản thuần để có thể dán vào Zotero, Mendeley hoặc EndNote mà không phải gõ lại thủ công từng mục.
Truy cập trình đọc màn hình & chuyển văn bản thành giọng nói
Trích xuất văn bản sạch từ PDF để trình đọc màn hình có thể đọc to hoặc dán vào ứng dụng chuyển văn bản thành giọng nói — hữu ích cho người đọc khiếm thị hoặc để nghe một báo cáo dài mà không cần dùng tay.
Tìm kiếm từ khóa trong khám phá điện tử pháp lý
Trợ lý pháp lý trích xuất văn bản từ các bản khai và tập hồ sơ đã quét để nội dung có thể tìm kiếm được trên hàng nghìn trang, thay vì cuộn qua các file PDF chỉ có hình ảnh để tìm một cái tên hay một điều khoản.
Quy trình dữ liệu hóa đơn được quét
Các lập trình viên và nhóm vận hành trích xuất văn bản từ hóa đơn và biên lai đã quét để đưa vào bộ phân tích cú pháp dựa trên regex hoặc LLM, tự động hóa việc nhập liệu hàng loạt thay vì gõ lại thủ công.
Điều tra tài liệu FOIA & rò rỉ
Nhà báo điều tra trích xuất văn bản từ các thông cáo chính phủ và tài liệu FOIA đã quét để có thể tìm kiếm, trích dẫn và đối chiếu chéo các nhận định trên những kho tài liệu lớn.
