Skip to content
DemoAPI 参考文档FAQ

PDF 生成模板编辑器

开源可视化 PDF 生成引擎,支持自定义模板,并提供面向开发者的 API,灵活构建文档生成流程。

查看 GitHub

扫描档判断

ComPDFKit 支持判断 PDF 文档是否为扫描档(图像文档)。扫描档通常由扫描仪生成,页面内容以图像形式存储,而非可选择的文本。ComPDFKit 提供两种级别的扫描档判断:文档级别和页面级别。

判断扫描档(文档级别)

使用 CPDFDocument.IsImageDoc() 方法可以判断整个 PDF 文档是否为扫描档。以下是示例代码:

C#
CPDFDocument document = CPDFDocument.InitWithFilePath("filePath");
bool isScannedDocument = document.IsImageDoc(); // 返回 true 表示是扫描档
if (isScannedDocument)
{
    // 该文档为扫描档,可能需要进行 OCR 处理以提取文本
}

判断扫描页(页面级别)

使用 CPDFPage.IsImagePage() 方法可以判断单个页面是否为扫描页(图像页)。该方法适用于混合文档的场景,即文档中部分页面是扫描图像,部分页面是普通文本。以下是示例代码:

C#
CPDFDocument document = CPDFDocument.InitWithFilePath("filePath");
for (int i = 0; i < document.PageCount; i++)
{
    CPDFPage page = document.PageAtIndex(i);
    bool isImagePage = page.IsImagePage(); // 返回 true 表示该页是扫描页/图像页
    if (isImagePage)
    {
        // 该页为扫描页,可能需要进行 OCR 处理以提取文本
        Console.WriteLine($"{i + 1} 页是扫描页");
    }
}

两种判断方式的区别

方法级别用途
CPDFDocument.IsImageDoc()文档级别判断整个文档是否为扫描档,适用于快速筛选文档类型
CPDFPage.IsImagePage()页面级别判断单个页面是否为扫描页,适用于处理混合文档或逐页分析

什么是扫描档?

扫描档是指通过扫描仪或拍照方式将纸质文档转换为电子文档的 PDF 文件。这类文档的特点是页面内容以图像形式存储,无法直接选择或搜索其中的文本。识别扫描档有助于决定是否需要进行 OCR(光学字符识别)处理。