PDF 生成模板编辑器
开源可视化 PDF 生成引擎,支持自定义模板,并提供面向开发者的 API,灵活构建文档生成流程。
ComPDFKit 支持判断 PDF 文档是否为扫描档(图像文档)。扫描档通常由扫描仪生成,页面内容以图像形式存储,而非可选择的文本。ComPDFKit 提供两种级别的扫描档判断:文档级别和页面级别。
使用 CPDFDocument.isImageDoc() 方法可以判断整个 PDF 文档是否为扫描档。以下是示例代码:
CPDFDocument document = new CPDFDocument();
document.open("test.pdf");
bool isScannedDocument = document.isImageDoc(); // 返回 true 表示是扫描档
if (isScannedDocument)
{
// 该文档为扫描档,可能需要进行 OCR 处理以提取文本
}使用 CPDFPage.isImagePage() 方法可以判断单个页面是否为扫描页(图像页)。该方法适用于混合文档的场景,即文档中部分页面是扫描图像,部分页面是普通文本。以下是示例代码:
CPDFDocument document = new CPDFDocument();
document.open("test.pdf");
for (int i = 0; i < document.PageCount; i++)
{
CPDFPage page = document.PageAtIndex(i);
bool isImagePage = page.isImagePage(); // 返回 true 表示该页是扫描页/图像页
if (isImagePage)
{
// 该页为扫描页,可能需要进行 OCR 处理以提取文本
System.out.println("第 " + i + "页是扫描页");
}
}| 方法 | 级别 | 用途 |
|---|---|---|
CPDFDocument.isImageDoc() | 文档级别 | 判断整个文档是否为扫描档,适用于快速筛选文档类型 |
CPDFPage.isImagePage() | 页面级别 | 判断单个页面是否为扫描页,适用于处理混合文档或逐页分析 |
扫描档是指通过扫描仪或拍照方式将纸质文档转换为电子文档的 PDF 文件。这类文档的特点是页面内容以图像形式存储,无法直接选择或搜索其中的文本。识别扫描档有助于决定是否需要进行 OCR(光学字符识别)处理。