为什么通用 OCR 在色谱场景不够用
色谱 PDF 看起来 OCR 友好 —— 对文字确实是。问题从表格开始。
数值精度问题
OCR 在全球文本上训练 —— 报纸、书籍、表单。色谱报告里却是:
- 8-10 位有效数字(如
2,345,678峰面积) - 科学计数法(如
1.234e+05) - 本地化的小数点符号(
5.234vs5,234) - 紧凑的列间距,让表格重建很困难
即便最好的通用 OCR(ABBYY FineReader、Adobe Acrobat Pro)在密集数值表上的字符准确率通常也是 95-98%。97% 准确率下,一份 83 页的 Empower 报告会有 50+ 个错误单元格。 在 QC 场景下这比手工录入更糟糕 —— 因为错误率被隐藏了。
结构问题
色谱 PDF 不是单一表格,是:
- 色谱图(图像)
- 峰表(结构化数据,有时跨页)
- 系统适用性指标(独立小表)
- 样品 / 方法头部(键值文本)
通用 OCR 返回文本。把这四块按正确关系重建,需要专为色谱报告模板调优的版面分析 —— 这正是 ChromaParse 做的。
| 维度 | 通用 OCR | ChromaParse |
|---|---|---|
| 数值精度 | 95-98% | >99.9% |
| 跨页表格 | 经常碎片化 | 正确重建 |
| 厂商识别 | 无 | 自动识别 Waters/Agilent/Thermo/Shimadzu |
| 溯源 | 无 | 逐字段页码 + bbox |
| 输出格式 | 通用 CSV/Excel | LIMS 就绪,经过 schema 校验 |
通用 OCR 仍合适的场景
- 非色谱 PDF —— 发票、表单、合同。用合适的工具。
- 快速肉眼提取 —— 你只需要读数值,不需要导入。
- ChromaParse 暂未支持的语言或文字 —— 通用 OCR 文字覆盖更广。
ChromaParse 胜出的时候
如果 PDF 是受支持厂商的色谱报告,且您需要数据结构化、经过校验、可审计追溯,通用 OCR 增加的核验负担通常超过它起步简单的好处。