在线近红外光谱实现乳酸发酵多指标实时监测的关键技术

发布时间:2026/9/1 11:19:59
在线近红外光谱实现乳酸发酵多指标实时监测的关键技术 乳酸的批次发酵和连续发酵过程越来越多地用在线近红外光谱仪来监测底物消耗和产物累积。与离线取样检测相比在线近红外的价值不只是减少取样量而是在分钟级时间尺度上同时输出乳酸、残糖、总糖、菌体浓度和总酸等多个工艺指标的预测值。近红外光谱本身存在吸收峰重叠、环境温度敏感、仪器长期漂移等问题所以“五个指标全部跑通”并不是把光谱仪接上管路就能实现而是需要从取样系统、光谱预处理、化学计量学建模、模型验证、现场校验到数据追溯把一整条链路都理顺。内容按一条完整的技术链路展开先说明乳酸发酵为什么需要在线近红外然后介绍一套在线系统的组成和安装要点再给出五个指标从光谱到预测值的建模流程接着讨论模型在现场连续运行五年所需的维护机制最后整理高频故障的排查路径和一套可复用的落地清单。适合发酵工艺、过程分析、仪表自控和近红外建模岗位的工程师阅读也适合正打算引入在线近红外的项目负责人作为立项前的参考。1. 乳酸发酵过程监测为什么从离线走向在线近红外1.1 离线取样检测真正的问题是时间差乳酸发酵控制中最常见的场景是“取样后得到结果时罐内状态已经变了”。以传统离线 HPLC 测定乳酸为例从发酵罐取样口取 100 mL 样品送到分析室经过离心、稀释、过滤、上机再到结果出来通常需要 30 分钟到数小时。在批次生产中这种时间差会直接影响补糖、中和和放罐判断。比如残糖已经降到目标值以下但离线结果还没出来等到确认时可能已经过度消耗底物乳酸积累量也不符合工艺要求。离线检测还存在第二个问题取样本身会影响罐内状态。每班多次取样既增加了染菌风险也会因为取样口冲洗不彻底引入偏差。再就是劳动强度问题发酵车间 24 小时运行夜晚值班人员仍然需要定时取样、记录、送样一旦分析室反馈不及时批次之间的质量波动就会放大。在线近红外改变了这个节奏。发酵液通过取样回路持续流过流通池光谱仪每隔几十秒或几分钟完成一次扫描软件调用已经训练好的模型把光谱转换成浓度或物性数据。操作人员看到的是一张趋势曲线而不是一个个孤立的数据点。对于乳酸这类发酵周期相对短、负荷变化快的工艺这种连续信息能让补料、中和和放罐决策往前移从“事后知道”变成“事中判断”。1.2 近红外光谱为什么适合乳酸这类体系近红外光谱记录的是分子中含氢基团O-H、C-H、N-H振动的倍频和合频吸收。乳酸分子中含有羟基和羧基发酵液中的水、葡萄糖、乳酸、菌体蛋白和氨基酸也都有丰富的含氢基团因此近红外光谱可以同时携带底物、产物和菌体的信息。这是它能在同一条光谱上建立多个指标模型的基础。但近红外光谱的吸收峰重叠非常严重。没有预先建立的数学模型很难直接从某个波长的吸光度读出乳酸浓度。近红外定量分析采用的是“二级方法”思路先用一级参考方法如 HPLC、滴定、分光光度法测出样本的真实值再把这些真实值与对应光谱关联起来建立校准模型。之后对于新光谱模型根据已学到的关联关系输出预测值。在乳酸发酵液中水含量通常在 70% 以上近红外光受水分吸收影响很大。同时菌体和蛋白会造成散射气泡会导致吸光度剧烈波动温度变化会改变氢键状态。所以近红外在线监测的应用本质上是一个“光谱测量 模型校正 现场防护”的组合问题。只强调光谱仪分辨率或模型精度忽略了取样和现场环境系统很难长期稳定。1.3 五个指标“跑通”的工程含义“五个指标全跑通了五年”这句话经常被简化成“在线仪表能测五个项目”但在实际项目中它至少包含五层含义第一每个指标都建立了独立的校准模型并且参考方法可靠。没有 HPLC 或滴定数据作为基准光谱模型就是无源之水。第二每个模型的验证集误差都达到了工艺可接受范围。训练集精度再高验证集偏差大也不能投用。第三在线系统在真实生产环境中连续可用而不是只在实验室验证通过。第四预测值异常时有报警、有判定规则不会被操作人员当成普通故障灯忽略。第五模型使用期间做过版本管理、定期校验和数据追溯出现偏差时能找到原因。所以“跑通”不是一次验收而是一套完整的数据管理和模型维护体系。这也是后面所有章节要展开的内容。2. 一套在线近红外系统要跑起来先要知道由哪几部分组成2.1 核心部件和选型关注点一套典型的在线近红外系统通常包括光谱仪主机、光纤探头或流通池、取样预处理系统、温度控制单元、自动清洗单元以及用于数据采集、模型调用和与 DCS/PLC 通信的工控机与软件。部件主要作用选型关注点在线近红外光谱仪连续采集近红外光谱防护等级、防爆等级、长期波长稳定性、环境温度范围流通池或插入式探头让发酵液与近红外光发生稳定作用耐压、耐温、耐腐蚀光程可调窗口材料与物料兼容取样预处理系统提供有代表性、稳定的样品流除气泡能力、防堵塞、防止固体沉积、可自动冲洗温控单元稳定样品温度减少氢键变化影响控温精度、响应速度、与罐体温控匹配程度清洗单元定时清洗探头和流通池窗口清洗介质、清洗时序、与光谱采集逻辑互锁软件与通信模块调用模型输出预测值传给控制系统数据存储、模型版本管理、报警输出、与 PLC 通信协议这里最容易低估的是取样预处理系统。很多在线近红外项目失败不是光谱仪不好而是取样回路里气泡太多、流量不稳、窗口结垢导致光谱质量下降。光谱仪本身只是一部分整个回路能否提供“干净、稳定、有代表性”的样品往往决定项目成败。2.2 安装位置与取样回路设计乳酸发酵罐通常采用循环管路安装流通池的方式。在罐底或侧壁开取样口通过泵把发酵液送入流通池再回到罐内。这样做的优点是拆卸维护方便可以通过阀门调节流量还可以在流通池前后安装清洗液入口。插入式探头省去了取样回路但直接接触高温、高压、高粘度和含固体颗粒的物料窗口污染和磨损问题会更突出。安装位置要考虑三点。第一是代表性取样口不能选在搅拌死角、泡沫层或固体沉积区。第二是流速稳定性发酵液流速波动会导致光谱信噪比变化建议通过循环泵和转子流量计把流速控制在一定范围内。第三是气泡干扰乳酸发酵会产生二氧化碳气泡进入流通池后会在近红外光谱中造成明显散射设计方案时要在取样回路上增加除泡罐或除泡阀。光程选择也很关键。水在近红外区吸光很强光程太长会导致光谱饱和光程太短又会降低有效信号。常见的水性发酵体系从 1 mm 到 2 mm 光程开始尝试是比较稳妥的做法。如果发酵液颜色很深或固形物含量高还需要进一步缩短光程。光程一旦确定在建模和现场运行中要尽量保持不变。2.3 离线实验室和在线现场的环境差异很多团队在实验室里用同一台近红外仪器建模效果很好装到现场后预测值就开始波动根本原因是离线与在线环境差异太大。实验室里样品静置、温度恒定、比色皿光程固定现场是流动液体温度随罐温波动窗口可能被污染测量位置也可能发生变化。对比项实验室近红外在线近红外样品状态静止、均匀、预处理后流动、含气泡、含固体颗粒温度控制恒温或接近恒温随工艺温度变化需要记录窗口状态每次测量前可擦拭易污染、结垢、需自动清洗光谱漂移短期内可忽略存在光源衰减和温度漂移维护频率每次测量前维护每天或每周定期维护模型使用环境离线建模数据为主必须加入现场温度与干扰样本因此在线模型不能只使用实验室理想样本。正式建模时要把现场温度变化、气泡扰动、不同批次原料差异都纳入建模样本。试运行阶段也不能只看模型输出是否稳定还要持续记录光谱质量、窗口污染情况和预测值与离线值的偏差这些数据是后续模型维护的基础。3. 五个指标全部建模光谱数据到工艺结果的完整处理链路3.1 五个关键指标的定义和参考方法乳酸发酵过程中常见的在线监测指标包括乳酸含量、总糖、残糖、菌体浓度和总酸。不同工厂的工艺卡片不同但基本都围绕“底物消耗、产物生成、菌体生长、酸碱度变化”四个方面。指标工艺意义常用参考方法近红外建模侧重点乳酸含量产物浓度决定发酵终点和收率HPLC 或酶法直接定量模型可靠性较高总糖初始底物总量影响发酵效率DNS 比色法或 HPLC需要覆盖不同原料批次残糖剩余糖浓度指导补糖和放罐HPLC对补料控制非常重要菌体浓度菌体生长状态反映发酵进程OD600 或干重法属于间接相关模型需谨慎总酸或 pH酸碱状态影响菌活和乳酸产率电位滴定或 pH 计pH 与近红外是间接关联建议作辅助指标这里要特别注意菌体浓度和 pH 的近红外模型属于“间接关联”模型。菌体浓度通过细胞散射与近红外光谱产生联系pH 则主要靠有机酸和盐形态变化间接体现。间接模型容易受到其他因素干扰比如原料批次变化、菌种活力和代谢副产物累积都会造成预测偏差。工程上建议把它们定位成趋势监测辅助指标而不是唯一控制依据。3.2 建模样本怎么采光谱与参考值必须一一对应近红外模型的训练本质上是通过大量“光谱-真值”对应关系学习特征。因此采集光谱和取参考值样品必须在同一条件下进行。实际操作中需要保证光谱采集完成后的几十秒内从流通池出口或取样口取到对应样品立刻处理后送实验室测定。如果取样时间滞后太久罐内浓度已经发生明显变化样本就成了错配样本。样本要覆盖的变异来源包括浓度范围从发酵初期到末期不同发酵批次不同原料批次和供应商不同季节的进料温度不同 pH 状态不同过滤或预处理方式。浓度范围越宽、变异来源越完整模型在未来的适用范围越大。但样本数并不是越多越好关键是分布要均匀。如果大量样本集中在高浓度区间低浓度区间样本稀疏模型在发酵后期残糖较低时预测精度就会变差。开始建模前还要对样本做异常样本检查。常见的方法包括计算光谱杠杆值找出对回归结果影响过大的点计算学生化残差找出参考值或光谱存在明显错误的点。异常样本不能简单删除要先回顾采样记录和参考方法确认是过程异常还是测定异常再决定是否剔除或重新测定。3.3 光谱预处理消除与目标指标无关的物理变化原始近红外光谱里包含大量与目标浓度无关的信息比如基线漂移、样品散射、温度引起的谱峰位移、仪器噪声。光谱预处理的目的就是把这些无关变化尽量消除让模型聚焦在目标成分的吸收特征上。常用预处理方法包括方法作用适用场景平滑移动平均、SG降低随机噪声光谱信噪比低时使用导数一阶、二阶消除基线漂移、分离重叠峰基线不稳定或峰重叠严重时使用标准正态变换SNV消除样品颗粒散射影响固体粉末或浑浊液体多元散射校正MSC校正散射导致的基线和斜率变化含悬浮颗粒的液体均值中心化与标准化统一变量量纲PLS 建模前的常规步骤需要提醒的是预处理方法不是越多越好。每增加一步都会改变原始光谱的信息结构过度预处理也可能把有效吸收信号一并滤掉。常见做法是先用少量样本试验不同预处理组合再根据验证集误差决定最终方案。以下示例代码用模拟光谱演示从 SG 平滑到 PLS 建模的整个流程真实项目中需要替换成实际光谱数据和参考值。import numpy as np from scipy.signal import savgol_filter from sklearn.cross_decomposition import PLSRegression from sklearn.model_selection import train_test_split from sklearn.metrics import r2_score, mean_squared_error np.random.seed(42) n_samples 200 n_wavelengths 100 wavelengths np.linspace(900, 1700, n_wavelengths) # 模拟乳酸浓度范围 0~100 g/L lactose_true np.random.uniform(0, 100, n_samples) X np.zeros((n_samples, n_wavelengths)) for i in range(n_samples): baseline np.polyval([0.02, -20], wavelengths) 50 peak 0.8 * lactose_true[i] * np.exp(-((wavelengths - 1400) / 60) ** 2) noise np.random.normal(0, 0.002, n_wavelengths) X[i] baseline peak noise # SG 平滑window_length 和 polyorder 需要根据实际谱图调整 X_smooth np.array([savgol_filter(x, window_length9, polyorder2) for x in X]) X_train, X_test, y_train, y_test train_test_split( X_smooth, lactose_true, test_size0.2, random_state42 ) pls PLSRegression(n_components5) pls.fit(X_train, y_train) y_pred_train pls.predict(X_train).ravel() y_pred_test pls.predict(X_test).ravel() print(train R2:, round(r2_score(y_train, y_pred_train), 3)) print(test R2:, round(r2_score(y_test, y_pred_test), 3)) print(train RMSE:, round(np.sqrt(mean_squared_error(y_train, y_pred_train)), 3)) print(test RMSE:, round(np.sqrt(mean_squared_error(y_test, y_pred_test)), 3))这段代码解决的是“从原始光谱矩阵到一个预测模型的套路”问题。实际项目中需要把模拟光谱换成仪器导出的光谱矩阵把模拟真值换成 HPLC、滴定或 OD 测定结果还要在建模前增加异常样本剔除和变量选择。window_length9、polyorder2、n_components5只是示例默认值不能直接套用到所有体系。3.4 用 PLS 建立多指标模型潜变量数不要凭感觉偏最小二乘回归PLS是近红外建模最常用的算法之一。近红外光谱的数据特点是变量数远多于样本数而且波长点之间存在严重共线性。PLS 的思路是在分解光谱矩阵的同时让得分向量与目标指标达到最大协方差从而用少量潜变量表达光谱和指标之间的有效关系。模型建立后潜变量数的选择是决定模型是否过拟合的关键。潜变量太少信息提取不足模型偏差大潜变量太多会把噪声也学进去训练集精度很高但验证集误差大。工程上推荐用交叉验证如留一法或 K 折交叉验证绘制“潜变量数-RMSECV”曲线选取 RMSECV 最低或接近最低的潜变量数。不要直接使用默认值也不要追求训练集 R² 最高。3.5 模型评价R²、RMSEC、RMSECV、RMSEP、RPD近红外模型不是看一个指标就能定论。需要同时看训练集和验证集的多个统计量。指标全称含义经验参考R²决定系数模型解释了多少方差越高越好但要看验证集RMSEC训练集均方根误差模型对训练样本的拟合误差用于观察是否需要增加潜变量RMSECV交叉验证均方根误差内部交叉验证的平均误差判断潜变量数和稳健性RMSEP验证集均方根误差模型对新样本的预测误差最接近真实在线应用的指标RPD标准差与 RMSEP 的比值衡量模型区分能力一般大于 3 可用大于 5 较好注意不要只看训练集 R²。训练集 R² 达到 0.98验证集 RMSEP 却很大通常意味着过拟合或训练样本代表性不足。只有验证集误差满足工艺允许偏差模型才能进入现场试运行。五个指标全部建模完成后还要做一次“试运行”验证模型计算值只显示在屏幕上不参与控制持续运行数周并与离线参考值逐点对比。试运行期间发现偏差大的指标要回溯到样本覆盖范围、参考方法准确性和现场光谱质量找到原因后再决定是否正式投用。4. 在线模型持续稳定五年靠的是更新机制而不是建成时精度4.1 仪器漂移和工艺漂移长期稳定的真正敌人在线近红外系统运行一两年后很多团队会遇到同一个现象模型预测值与离线测定结果越来越偏但每次现场校验又找不到明显故障。这不是单一问题造成的而是仪器和工艺都在缓慢变化。仪器侧光源老化、检测器响应衰退、光纤接头松动、温度变化都会导致光谱基线漂移。工艺侧原料批次变化、菌种活力差异、补料策略调整、中和剂种类改变都会让当前罐内的物料状态逐渐偏离建模时的样本空间。两种漂移叠加后即使模型在新样本上仍然能输出一个数字这个数字的可靠性也已经下降。因此长期运行的首要任务不是追求更高的初始精度而是建立能及时发现漂移的监控机制。最简单有效的工具是记录建模时的平均光谱和标准差光谱日常运行中持续计算新光谱与模型光谱库的马氏距离。距离超过阈值时软