ImgIng 图映ImgIng 图映 · DataDance 旗下产品中文EN日本語한국어DEESPTFR立即处理图片
ImgIng 图映 / PDF 内容提取
TEXT + IMAGE OCR

PDF 内容提取:原生文字与图片内文字一起还原

有文字层就直接读取;页面中的图片仍会逐张 OCR。隐藏 OCR 层与图片识别结果重叠时自动去重,避免同一句出现两次。

原生文字 + OCR图文混排阅读顺序重建HTML / TXT / Markdown

能力速查

以当前产品实现为准,不把路线图当成已上线功能。

文字来源
PDF 原生文字 + 图片 OCR
模型
自动 / 极速 / 专业 / 极致
混排
按页面坐标合并文字与图片
输出
长页 HTML / TXT / Markdown

DataDance 产品与工程团队核对 · 首次发布 · 最近更新

三步完成

所有关键参数在导出前确认,处理位置也会明确标注。

01

选择 PDF

读取每页文字坐标、图片位置和共享资源。

02

选择 OCR 档位

默认自动:桌面使用专业 OCR,移动端使用低内存极速档;桌面也可手动选择极速、专业或极致。

03

校对并导出

合并原生文字、图片与 OCR 结果,按页输出一份可独立打开的长页内容。

文字 PDF 和扫描 PDF 都能提取吗?

可以。原生文字来自 PDF 文字操作符;扫描页或图文混排中的图片则交给图映 PP-OCRv6。两条结果按页面坐标合并,而不是只选其中一种。

OCR 模型怎样选择和下载?

自动档在桌面选择专业模型,在移动端选择低内存极速模型;桌面还可手动选择极速、专业或极致档。模型首次使用时按需从多源模型 CDN 下载并校验,失败自动切换备用源,成功后从浏览器缓存读取。

怎样避免隐藏 OCR 层造成重复?

许多扫描 PDF 已带一层不可见识别文字。图映会规范化空格、标点和大小写,对图片 OCR 与当前页原生文字做重叠判断;已有内容不再重复插入,图片本身仍按原位置保留。

为什么输出是长页 HTML?

HTML 同时保留页码、段落、图片与图片内文字,适合阅读、归档和继续整理;TXT 与 Markdown 提供更轻量的纯内容版本。

内容更新:2026-08-30 · 能力边界以工具内实时探测为准

常见问题

下列答案与当前产品逻辑和页面结构化数据保持一致。

图片里的文字也会识别吗?

会。页面中的每张有效图片都会进入 OCR,识别结果与原生文字合并。

已有 OCR 文字会重复吗?

重叠文本会自动去重,低置信度或不重叠内容仍会保留供核对。

处理是否上传?

不会。PDF 解析、图片 OCR、排版和导出全部在浏览器本地完成。

继续了解 ImgIng 图映

相关任务页使用独立的标题、说明和可核验边界,不做只换关键词的重复页。