Skip to main content
产品文档
覆盖范围

提取数据 · 字段与精度

ChromaParse 从一份色谱 PDF 中能提取哪些字段、识别精度如何、如何处理多页与续表。

更新于 2026 年 6 月 16 日

标准提取字段

ChromaParse 在每份色谱 PDF 上抽取以下字段(具体可用字段取决于报告版式):

样品信息(sample info)

  • 样品名 / 样品编号 / 批号 / 操作员 / 注射时间 / 注射体积 / 检测波长

方法元数据(method header)

  • 方法名 / 色谱柱 / 流动相 / 流速 / 柱温 / 检测器 / 运行时间

峰表(peak table)

  • 序号 / 保留时间(RT) / 峰名 / 面积 / 高度 / 面积% / 高度% / 理论塔板数 / 拖尾因子 / 分离度 / 浓度 / 单位

系统适用性(system suitability)

  • RSD / 拖尾 / 塔板 / 分离度 / 接受标准比对结果

计算结果(quantitation summary)

  • 含量(assay)/ 杂质(known + unknown)/ 总杂 / 总和 / 接受标准结果

识别精度

我们对每种已认证模板维护一份测试集,精度指标:

  • 数值字段(RT、面积、高度等):100% 精确(直接从 PDF 文本层提取,不经过 OCR)
  • 文本字段(样品名、方法名等):>99.5%(罕见的字符切分歧义,会标记 review)
  • 扫描件 PDF(走 OCR pipeline):数值字段 >99.8%,文本字段 >98%

精度未达标的字段会显式标记 review_needed,不会静默通过 —— 这是 GMP 合规的硬要求。

多页与续表

色谱报告常常一份样品跨多页(峰表续表、SST 单独一页等)。ChromaParse 自动:

  1. 识别”续表”标记(各厂商有不同写法,均已收录)
  2. 把跨页峰合并为一张逻辑表
  3. 保留原始页码作为审计追踪元数据

不可提取项

  • 色谱图(chromatogram)图像本身:目前只提取数据;未来可能加入色谱图二值化提取,但不是 ROI 高的功能
  • 手写批注:扫描件中如有手写,标记为 handwritten_annotation 但不解析内容
  • 印章、签名、二维码:识别位置但不解析

字段映射定制

每个企业客户可配置:

  • 字段重命名:Area %相对峰面积(对接 LIMS 中文 schema)
  • 单位换算:面积 mAU·s → AU·min
  • 精度截断:RT 保留 4 位小数 → 3 位
  • 缺省值:某字段在 PDF 中不存在时,填 N/A 还是 null

详见 企业版交付与运维

需要更深入的支持?

企业客户可获得 IQ/OQ/PQ 验证包、私有指纹库、API 与本地部署支持。