选择 PDF
读取每页文字坐标、图片位置和共享资源。
以当前产品实现为准,不把路线图当成已上线功能。
DataDance 产品与工程团队核对 · 首次发布 · 最近更新
所有关键参数在导出前确认,处理位置也会明确标注。
读取每页文字坐标、图片位置和共享资源。
默认自动:桌面使用专业 OCR,移动端使用低内存极速档;桌面也可手动选择极速、专业或极致。
合并原生文字、图片与 OCR 结果,按页输出一份可独立打开的长页内容。
可以。原生文字来自 PDF 文字操作符;扫描页或图文混排中的图片则交给图映 PP-OCRv6。两条结果按页面坐标合并,而不是只选其中一种。
自动档在桌面选择专业模型,在移动端选择低内存极速模型;桌面还可手动选择极速、专业或极致档。模型首次使用时按需从多源模型 CDN 下载并校验,失败自动切换备用源,成功后从浏览器缓存读取。
许多扫描 PDF 已带一层不可见识别文字。图映会规范化空格、标点和大小写,对图片 OCR 与当前页原生文字做重叠判断;已有内容不再重复插入,图片本身仍按原位置保留。
HTML 同时保留页码、段落、图片与图片内文字,适合阅读、归档和继续整理;TXT 与 Markdown 提供更轻量的纯内容版本。
内容更新:2026-08-30 · 能力边界以工具内实时探测为准
下列答案与当前产品逻辑和页面结构化数据保持一致。
会。页面中的每张有效图片都会进入 OCR,识别结果与原生文字合并。
重叠文本会自动去重,低置信度或不重叠内容仍会保留供核对。
不会。PDF 解析、图片 OCR、排版和导出全部在浏览器本地完成。
相关任务页使用独立的标题、说明和可核验边界,不做只换关键词的重复页。