标准提取字段
ChromaParse 在每份色谱 PDF 上抽取以下字段(具体可用字段取决于报告版式):
样品信息(sample info)
- 样品名 / 样品编号 / 批号 / 操作员 / 注射时间 / 注射体积 / 检测波长
方法元数据(method header)
- 方法名 / 色谱柱 / 流动相 / 流速 / 柱温 / 检测器 / 运行时间
峰表(peak table)
- 序号 / 保留时间(RT) / 峰名 / 面积 / 高度 / 面积% / 高度% / 理论塔板数 / 拖尾因子 / 分离度 / 浓度 / 单位
系统适用性(system suitability)
- RSD / 拖尾 / 塔板 / 分离度 / 接受标准比对结果
计算结果(quantitation summary)
- 含量(assay)/ 杂质(known + unknown)/ 总杂 / 总和 / 接受标准结果
识别精度
我们对每种已认证模板维护一份测试集,精度指标:
- 数值字段(RT、面积、高度等):100% 精确(直接从 PDF 文本层提取,不经过 OCR)
- 文本字段(样品名、方法名等):>99.5%(罕见的字符切分歧义,会标记 review)
- 扫描件 PDF(走 OCR pipeline):数值字段 >99.8%,文本字段 >98%
精度未达标的字段会显式标记 review_needed,不会静默通过 —— 这是 GMP 合规的硬要求。
多页与续表
色谱报告常常一份样品跨多页(峰表续表、SST 单独一页等)。ChromaParse 自动:
- 识别”续表”标记(各厂商有不同写法,均已收录)
- 把跨页峰合并为一张逻辑表
- 保留原始页码作为审计追踪元数据
不可提取项
- 色谱图(chromatogram)图像本身:目前只提取数据;未来可能加入色谱图二值化提取,但不是 ROI 高的功能
- 手写批注:扫描件中如有手写,标记为
handwritten_annotation但不解析内容 - 印章、签名、二维码:识别位置但不解析
字段映射定制
每个企业客户可配置:
- 字段重命名:
Area %→相对峰面积(对接 LIMS 中文 schema) - 单位换算:面积 mAU·s → AU·min
- 精度截断:RT 保留 4 位小数 → 3 位
- 缺省值:某字段在 PDF 中不存在时,填
N/A还是null
详见 企业版交付与运维。