展示贴近实际使用的源文档,以及“PDF 转 HTML”处理后的实际文档状态或输出文件。
之后
之前
PDF 转 HTML

PDF 到 HTML 转换器 — 免费在线将 PDF 转换为 HTML

将 PDF 重新发布为网页意味着手动重建它。将 PDF 转换为 HTML,然后选择外观或结构哪个更重要。

  • 将 PDF 放在网络上,无需自行重建页面
  • 保持准确的外观,或获得可编辑的语义结构
  • OCR 选项仅在 PDF 实际需要时出现

PDF

在 HTML 中你最看重什么?

上传 PDF

拖入 PDF —— 获得视觉还原、自适应的 HTML。

PDF · free up to 11MB, Premium up to 50MB

使用 PDF 转 HTML 可以做什么

在开始之前查看主要功能。

  • 选择视觉保真度或可编辑的语义内容
  • 将每个渲染后的页面嵌入到一个便携 HTML 文件中
  • 使用 OCR 重建支持的标题、列表和表格
  • 在语义模式下选择 OCR 引擎和文档语言
  • 发布前检查生成的标记

设置参考

PDF 转 HTML 的可用控件。

处理模式预设
可逐个处理输入内容,也可切换到 Premium 批量模式,将同一设置应用于多个输入。可用的输入类型取决于所用工具。选项: 单个文件批量

模式

在 HTML 中你最看重什么?预设
为保证视觉还原,嵌入完整页面的自适应图片;或使用 OCR 重建支持的语义内容以便编辑。选项: 保留 PDF 外观让内容可编辑

引擎

引擎下拉框
选择在语义模式下由哪个文字识别引擎读取 PDF;视觉模式不运行 OCR。选项: 默认引擎 1引擎 2
语言下拉框
选择原文的主要语言。可用选项取决于所选识别引擎,不支持的语言会隐藏。默认英语,请检查提取文字是否存在识别错误。选项: 英语法语德语西班牙语意大利语葡萄牙语荷兰语俄语日语韩语中文(简体)中文(繁体)阿拉伯语印地语孟加拉语旁遮普语乌尔都语越南语泰语波兰语瑞典语丹麦语挪威语芬兰语土耳其语乌克兰语印尼语泰米尔语泰卢固语马拉地语尼泊尔语波斯语希腊语希伯来语
重新运行提取一键
使用当前的「引擎」和「语言」选择,对同一文件重新执行提取——识别效果不佳或失败后重试时很方便。
免费使用 · 无需注册 · 无水印上传过程全程加密传输已根据我们的数据保留政策移除

常见问题

「保留 PDF 外观」会将完整页面的自适应图片内嵌到一个自包含的 HTML 文件中。「让内容可编辑」则使用 OCR 将支持的标题、段落、列表和表格重建为语义化标记。前者优先还原度;后者需要对内容和无障碍性进行检查。

features

当 OCR 识别到支持的表格时,语义模式会输出表格元素。表头角色、合并单元格和阅读顺序可能出错,请检查并修正可编辑的标记。视觉模式不会重建表格,它只显示完整的页面图片。

technical

你可以将语义输出复制到自定义的 HTML 工作流中,或托管下载的视觉 HTML 文件。发布前请校验标记、应用你自己的 CSS 并核对 OCR。本工具不保证在每个 CMS 或浏览器中呈现效果完全一致。

usage

可以。视觉模式在不使用 OCR 的情况下呈现扫描页面。语义模式会运行 OCR 并尝试重建支持的结构;准确度取决于扫描质量和版式,因此未经核对不应直接发布。

features

视觉模式会将图表和插图保留在每个完整渲染的页面中。语义模式侧重于识别出的文档结构,不保证提供单独优化的资源。当你需要将支持的位图资源作为文件获取时,请使用 PDF 转图片中的“提取内嵌图片”。

quality

根据我们的安全政策,上传内容将被删除 - 除非您明确共享结果,这会将其保存在公共链接上,任何拥有该结果的人都可以打开长达 30 天 - 从未用于训练模型,也从未共享过。 HTML 输出没有水印、没有归属注释、没有跟踪像素。机构和内部团队使用该工具将旧版 PDF 迁移到现代 CMS 站点,无需任何许可或隐私问题。

privacy

「保留 PDF 外观」会将每一整页作为内嵌图片渲染到一个自适应 HTML 文件中,不含 OCR 设置。「让内容可编辑」则使用 OCR 将支持的标题、段落、列表和表格重建为可编辑标记。追求还原度选视觉模式,内容迁移选语义模式,语义输出发布前请先检查。

usage

先选择「使内容可编辑」;视觉模式不运行 OCR。然后打开「引擎」控件,选择一个引擎和匹配的文档语言,并用同一个上传文件再次运行语义提取。

features

对于常见的拉丁字母语言,先用“默认”引擎——它处理日常文档最快也最准。对于较少见的文字(阿拉伯文、印地文、中文),或当“默认”引擎把标题和表格弄乱时,就切换到 Engine 1 或 Engine 2,设定对应“语言”,然后“重新提取”——不同引擎各有擅长的文字,两个都试一下只需几秒,往往就能修正被误读的带重音字符。

tips

可以——输出面板在实时渲染预览旁显示一个可编辑的代码框,因此输入修正(移除多余标签、调整标题级别、微调行内文本)会立即更新预览窗格。请在那里完成所有更正,然后再点击下载或复制,因为这两个操作使用的都是代码框中当前的内容,而非原始 OCR 输出。

features

点击输出面板上方的“复制 HTML”——它会将可编辑代码框中的内容(包括你所做的任何手动修改)原样复制到剪贴板,并短暂显示“已复制!”以示确认。当你要直接粘贴到 CMS 的 HTML 或嵌入代码块中而非上传文件时,这是最快捷的方式。

usage

开始转换,查看 HTML 并在适用的免费额度内下载。视觉模式属于转换任务;语义模式按 OCR 计量。Premium会提高或取消工具中显示的相应限制。

pricing

视觉模式始终会将完整渲染的页面嵌入 HTML,使下载文件保持自包含;不会提供单独资源的 ZIP。如果你需要独立的页面图片或 PDF 内存储的位图,请使用 PDF 转图片中相应的模式。

features

是的 - Pixoate 支持批处理和批量处理。切换到批处理模式,在 Premium 上添加最多 60 个 PDF,在 Pro 上添加最多 200 个 PDF,设置一次选项,然后在下载单个 ZIP 之前,每个 PDF 都会使用相同的设置进行处理。批量处理是一项高级功能;输出使用与单一模式相同的质量和设置。

features

是的 - 通过批量处理,您只需配置一次设置,它们就会应用到批次中的每个项目 - Premium 上最多 60 个 PDF,Pro 上最多 200 个 PDF。无需对每个项目重复设置,临时上传和生成的文件将被安全处理并自动删除。

usage

几乎总是以下三种原因之一:文件超过 11 MB 的免费上传上限——Premium 支持 50 MB,Pro 支持 120 MB;文件格式不受此工具支持,请查看上传面板显示的格式列表;或者文件的真实格式与文件名不符。重命名不会改变文件内部格式,这正是看似有效的 PDF 仍会被拒绝的原因。

troubleshooting

PDF 存储每个字符在页面上的位置,而不是文字处理器工作的段落和样式,因此转换意味着通过推理重建该结构。复杂的列、表格和围绕图像的文本是它漂移的地方。如果外观比可编辑性更重要,请选择视觉模式;如果您需要输入内容,请选择可编辑模式并期望修复奇怪的标题。

troubleshooting

不需要。您可以运行 PDF 到 HTML 并下载免费结果,无需帐户,并且它没有水印。高级版是当限制开始出现时您购买的:一批最多 60 个文件、更大的上传量、无每日上限以及原始分辨率结果。下载步骤中不会显示任何在开始之前不可见的内容。

pricing

否 — PDF 转 HTML 在桌面和手机上的浏览器中运行。在您看到它是否满足您的需要之前,无需安装任何东西,无需试用,也无需购买许可证。在您实际遇到的文件而不是样本上尝试一下。

troubleshooting

PDF 转 HTML 如何助您完成任务

它每天为企业、创作者和日常任务解决实际问题。找到适合您的用例并开始。

面向企业

将旧版 PDF 迁移到现代网站

营销团队将旧的 PDF 白皮书、案例研究和宣传册转换为响应式 HTML 页面,让用户能在手机上阅读,也方便 Google 为 SEO 编入索引。

面向企业

白皮书转博客文章

将可下载的 PDF 白皮书转换为博客文章 HTML,用于自然搜索排名、内部链接以及推动邮件订阅的内嵌行动号召。

教育经历

研究论文网络重新发布

学者将已发表的 PDF 论文转换为 HTML,用于个人网站和大学主页,让研究成果在网上更易被发现和引用。

面向企业

知识库文章导入

支持团队将 PDF 用户手册转换为 HTML 知识库文章,用于 Zendesk、Intercom 或 Help Scout——可搜索、可链接,且对屏幕阅读器友好。

面向企业

用 PDF 模板制作邮件简报

将设计师提供的 PDF 邮件简报样稿转换为适用于 Mailchimp、Klaviyo 或 HubSpot Email 的邮件安全 HTML——基于表格的布局在包括 Outlook 在内的所有客户端中都能正常显示。

面向企业

在线联盟营销对比表格

联盟营销人员将可打印的对比 PDF 转换为评测博客上的 HTML 表格,使产品规格易于浏览、可排序,并针对搜索排名进行 SEO 优化。

面向创作者

由 PDF 菜谱书生成的食谱博客

美食博主将 PDF 食谱书摘录转换为 HTML 食谱文章,配有结构化的配料表和分步说明,可直接用于 WordPress 或 Ghost。

面向企业

SaaS 文档导入

SaaS 开发者关系团队将遗留的产品 PDF 转换为 HTML 文档,用于 GitBook、Mintlify 或 Docusaurus——可搜索、可版本管理,并与营销网站在视觉上保持一致。

市场营销

以网页形式发布新闻稿

公关团队将 PDF 新闻稿转换为干净的 HTML,使每篇稿件都拥有自己可被收录、可分享的网页,而不是埋在搜索引擎很少呈现的下载文件里。

活动

把活动节目单变成移动端议程

将 PDF 会议议程或婚礼行程转换为响应式 HTML,让参加者可以在手机上滚动查看日程,而不必对着打印版面双指缩放。

官方文件

为政府门户重建公开报告

各机构将 PDF 公开报告和会议纪要转换为无障碍 HTML,让使用屏幕阅读器或移动设备的居民无需先下载文件即可阅读。

面向电商

将规格表迁移到在线目录

将 PDF 产品规格表和数据表转换为 HTML 表格,可直接嵌入产品页面模板,让规格保持可搜索,并与网站其余部分样式统一。

观看每一个转变土地

每张照片都原封不动地穿过斜线,并在另一边完成。