一句话
ChromaParse 把色谱仪导出的 PDF 报告还原回结构化数据,让 QC、CDMO、研发实验室不再花几小时手工抄录峰表。
它解决的问题
色谱数据系统(Empower、OpenLab、Chromeleon、LabSolutions 等)的”标准导出格式”基本就是 PDF。这意味着:
- 数据下游消费方(LIMS、ELN、Excel 工作流、监管报送)拿不到原生结构化数据,要么靠厂商付费 API,要么靠人工抄录
- 人工抄录单批 20 页的报告通常需要 60–90 分钟,出错率不低,审计追踪存在缺口
- 跨厂商、跨方法、跨工厂的数据汇总,因为格式不统一,极难自动化
ChromaParse 用模板指纹库识别每种 PDF 的版式,把峰表、样品信息、方法元数据全部抽出来,导出成 Excel / JSON / 直连 LIMS。每个数值都带可点击的回链,指向 PDF 原文位置 —— 满足 GMP 审计追踪要求。
它适合谁
- 药企 QC 实验室:每天处理大量 Empower / OpenLab 报告,需要 GMP 合规可审计的数据流
- CDMO / CRO:跨客户、跨方法、跨设备的数据要统一规范化输出
- 食品检测 / 第三方实验室:高通量 QC,需要把 PDF 报告快速导入 LIMS
- 研发与方法学验证:做 ICH Q2 / USP 〈1225〉 的统计需要结构化数据,人工录入不现实
它不做什么
- 不解析原始仪器数据(
.dat/.raw) —— 这是色谱数据系统本身的工作,通常涉及厂商授权与法规验证 - 不替代色谱数据系统 —— 我们只处理”已经导出为 PDF 的报告”
- 不修改报告内容 —— 只读取,不写回。原始 PDF 永远是 source of truth