——拆解那 12 分钟提前量到底从哪来
凌晨两点四十,延迟焦化的主操盯着屏幕,什么也没响。
分馏塔底温度在正常带里晃,塔顶压力也在正常带里晃,进料流量看着挺稳。三十分钟后,高压报警响成一片,火炬开始冒黑烟,装置降量。事后翻历史曲线,所有人都会说同一句话:其实早就不对了。
"早就不对了"是一句非常昂贵的话。它的意思是:信息一直在数据里,只是我们的判据看不见它。
2026 年 9 月 2 日,一家叫 ControlRooms 的公司发布了面向能源与化工的智能体(Agentic AI)故障排查系统,由 Detect、Advise、Log、Handover 四个 AI 代理协同工作。它的卖点正是这句话的反面:在传统报警响之前,把"早就不对了"提出来。
这不是孤例。2025 年 11 月,霍尼韦尔与道达尔能源在其得州阿瑟港炼厂的延迟焦化装置上试点 Experion Operations Assistant,公布的初步结果是成功预判 5 起潜在事件,平均比报警提前 12 分钟。
12 分钟值得认真对待——不是因为它长,而是因为它可以被算出来。这篇文章只做一件事:把这 12 分钟拆开,看看它的数学来源是什么,以及它在什么条件下会变成 0。
全文 4100 字 · 阅读约 12 分钟 · 图表 4 幅 · 含可复算推导
01
"AI 进控制室"这件事,已经越过试点线
先把事实层说清楚。
ControlRooms 这套系统的四个代理分工是明确的:Detect 负责在数千个连续测点上发现隐藏异常,宣称在常规报警触发前动作;Advise 是操作侧的助手,把第一性原理、工艺与设备知识、图纸文档、操作规程(SOP)和模型输出揉在一起给排查建议;Log 用免手持的语音或文字记录操作员观察;Handover 自动生成交接班摘要与音频简报。
支撑 Detect 的是他们命名的"大协调模型"(Large Harmony Model, LHM)——学习数千个工艺变量之间的多维"协调关系",实时识别对这种协调的偏离。公司称已在全球 30 多个工厂上线,某上市客户预计到 2030 年带来 2500 万美元增量 EBITDA,部署见效周期 28 天。
※ "首个"(First)是发布稿的措辞。该公司创始人兼 CEO Monte Zweben 早年任 NASA 艾姆斯研究中心人工智能分部副主管,其 AI 故障排查产品早在 2024 年 CERAWeek 就已公开演示。因此这次发布更接近"多代理形态的产品化定型",而非某项能力的首次出现。读者引用时建议自行核实。
两条线的方向是一致的:异常检测正从"事后分析工具"往"控制室实时界面"迁移,区别只在于霍尼韦尔从 DCS 本体长出来,ControlRooms 从数据侧长进来。对一线仪表和控制工程师来说,真正要回答的不是"要不要上",而是——它凭什么能提前?以及,什么时候提不前?
· · ·
02
提前量不是预测未来,是门限被更早跨越
这里有一个几乎所有宣传材料都不会讲清楚的关键点:多变量异常检测并没有"预知"任何事情。它只是换了一把尺子,而这把尺子跨过门限的时刻,比原来那把早。
▍报警框是矩形,正常域是椭圆
传统报警是逐点判据:每个变量各有自己的高低限,互不通气。在二维平面上画出来,它是一个矩形框——只要点还在框里,无论落在哪个角落,系统都认为正常。
但真实装置里的变量不是独立的。物料平衡、能量平衡、控制回路的耦合,会让它们高度相关。取两个相关系数 ρ=0.95 的变量,正常工况下的散点不会填满矩形,而是挤在一条细长的斜带里——统计上就是一个置信椭圆。

图1 报警框内的异常:相关结构破裂发生在越限之前
现在看图 1 里那个叉号:变量 A 偏高 1σ,变量 B 偏低 1σ。
从报警的角度,这两个值都安全得很——按 ±3σ 报警限算,各自只走完了三分之一,离响还差得远。但从相关结构看,这是严重异常:本该同涨同落的两个量走反了。用马氏距离(Mahalanobis distance)把协方差矩阵的逆算进去,结果是 6.32σ,已是 3σ 门限的 2.11 倍。
单变量还剩三分之二余量,多变量判据已经超限一倍多。这就是"异常检测先于报警"的全部秘密——它是几何的,不是预言的。
报警看的是点走了多远,
异常检测看的是点走偏了多少。
▍那 12 分钟是怎么算出来的
把上面的静态图变成动态。假设一个缓慢发展的扰动,让两个变量沿反相关方向线性漂移,直到其中一个撞上 3σ 报警限。
单变量走完全程需要时间 T。马氏距离由于放大了 √(2/(1−ρ)) 倍,会更早撞线:在 ρ=0.95 时,它只需要走完全程的 15.8% 就到门限了。

图2 12 分钟提前量的来源:门限被更早跨越,而非预测未来
反过来用阿瑟港那个数字校验:如果提前量是 12 分钟,占全程 84.2%,那么这次漂移从起始到报警响的完整过程约 14.3 分钟,AI 在第 2.3 分钟就报出了。
对延迟焦化这种大惯性、长时间常数的装置,十几分钟量级的漂移过程完全合理。数字对得上。
※ 此处的时间反推基于线性漂移与 ρ=0.95 的简化假设,用于说明量级来源,并非对该试点实际算法的还原。霍尼韦尔未公开其模型结构。
· · ·
03
方向决定一切:同样的相关度,差 67 倍
上一节的推导可以写成一个干净的解析式。设单变量报警限与多变量判据门限都取 3σ,漂移沿反相关方向线性发展,则:
提前量占全程比例 = 1 − √( (1−ρ) / 2 )
这个式子说:变量之间越协调(ρ 越大),多变量判据的提前量越大。ρ=0.9 时提前 77.6%,ρ=0.95 时 84.2%,ρ=0.99 时 92.9%。这解释了为什么厂家愿意强调"学到了变量间的协调关系"——协调越强,杠杆越大。
但如果漂移方向反过来,沿着相关方向同涨同落呢?换个符号重算,得到:
提前量占全程比例 = 1 − √( (1+ρ) / 2 )
同样是 ρ=0.95,答案是 1.26%。

图3 提前量只来自方向:同一相关度下相差 67 倍
84.2% 对 1.26%,相差 67 倍。同一套模型,同一组变量,同样的相关系数——提前量完全取决于故障把工况推向哪个方向。
多变量异常检测的提前量,
全部来自"偏离方向与正常相关结构不一致"。
方向一致时,它退化成普通报警。
▍这条判据可以直接拿来分类现场故障
哪些故障会产生逆结构偏离,因而能被提前捕捉:调节阀内漏(阀位与流量的关系破裂)、换热器结垢(换热量与温差的关系漂移)、孔板磨损或引压管堵塞(差压与其他流量指示不匹配)、单台变送器零点漂移(该表与同一物料平衡上的其他表打架)、机泵汽蚀初期(电流与流量脱钩)。
这恰好是仪表专业最常处理的一类失效,共同特征是局部性:只影响系统的一部分,因而破坏了局部与整体的一致性。
哪些不会:装置整体负荷变动、环境温度大幅变化引起的全场漂移、供电或气源品质波动导致的多表同向偏移,以及最值得警惕的一类——共模失效。
同一批次、同一型号、同一安装方式的变送器,在同一诱因下同向漂移;同一根电缆槽里的信号线同时受扰;同一路 24V 电源品质劣化拖累一组仪表。这些故障的偏离方向天然是"顺结构"的,因为它们同时作用于所有相关变量,恰恰保住了变量之间的比例关系。
※ 这正是 SIS 里 β 因子要处理的那类失效。一个不太舒服的推论:多变量异常检测在结构上恰好对共模失效最不敏感,而共模失效又是冗余架构中最难压低的那一项。二者不能互相替代,这是作者观点,建议结合本厂 FMEDA 与共因分析数据自行判断。
· · ·
同一个阀内漏,在装置级模型里报得出来,
扔进全厂模型就消失了。
所以"学习数千个工艺变量"如果指的是把数千个点塞进同一个协方差结构里,它在数学上是自伤的。任何一套真正能用的系统,必然要做分区建模——按装置、按物料平衡边界、按控制回路族群切分,每个分区几十到两三百个变量,再在分区之上做汇总。
※ 厂商未公开 LHM 的分区策略,上述是从检测统计量的标度关系反推的架构约束,属于作者推断。这也提供了一个有用的技术尽调问题:单个模型实际纳入多少个 tag,分区依据是什么。若答案是"全厂一个模型",值得追问其误报控制机制。
· · ·
05
三层边界:异常检测不是报警,报警不是联锁
技术能算清楚,治理问题才是真正卡住落地的地方。
控制室里现在要放三样东西,它们的性质完全不同:
AI 异常检测(LHM) 判据:多变量统计距离 输出:概率性提示,非确定性 无 SIL 等级,无可证明的 PFD 与 BPCS 共用同一批传感器 模型随数据演化,行为不可完全复现 定位:咨询层,无强制响应义务 | 报警 / SIS 联锁 判据:确定性阈值逻辑 输出:明确的响应要求或动作 受 IEC 62682 / IEC 61511 约束 报警可作独立保护层(IPL) 逻辑固化,可审计、可验证 定位:保护层,响应义务强制 |
▍第一个冲突:报警率预算
EEMUA 191 第三版给出的稳态基准是:平均低于每 10 分钟 1 条报警"很可能可接受",每 5 分钟 1 条属于"可管理",每 2 分钟 1 条已经"过度要求",超过每分钟 1 条"很可能不可接受"。IEC 62682 的对应目标值约为每天 144 条。重大扰动后的前 10 分钟,报警数应控制在 10 条以内。
这是一个严格受限的注意力预算,而且它是按人来算的。
于是问题来了:Detect 推给操作员的异常提示,算不算报警?
如果算,它必须纳入报警管理生命周期,走合理化流程,定优先级与响应规程、进 KPI 统计,并挤占那个每 10 分钟 1 条的预算。如果不算,它就没有强制响应义务,操作员忙起来完全可以不看——而系统的价值恰恰依赖于有人看。
这个两难目前没有标准答案。务实的做法是放在报警系统之外的独立视图上,用班组级而非操作员级的流程去接,并明确规定:AI 提示不得作为任何安全动作的唯一依据。
▍第二个冲突:需求率被污染
这一条更隐蔽,但对做 SIS 的人更要紧。
IEC 61511 要求在运行阶段跟踪保护层的实际需求率(demand rate),用现场数据验证设计阶段的 SIL 假设。
现在设想一个运行良好的 AI 预警系统:它持续在报警响起之前促成人工干预,把本会发展成需求的工况一次次掐灭在萌芽阶段。统计上会看到什么?实际需求率下降。
数字变好看了,但保护层的有效性从未被检验过。更麻烦的是,如果按下降后的需求率去重新评估 SIL 或延长检验测试周期,等于用"人工干预及时"这个非安全功能,去为安全仪表功能背书。
一个成功的 AI 预警系统,
会让 SIS 看起来比实际更安全。
※ 作者观点,未见现行标准对此作出规定。建议的做法是:在需求率统计中单独标记"AI 提示后人工干预"的事件,作为潜在需求(potential demand)单独计数,不并入自然需求率。这一点值得在功能安全评估(FSA)阶段就与评估方明确。
· · ·
06
带去开工作会的六个问题
如果你的厂正在被推销这类系统,或者已经在做 POC,下面六个问题足以把技术底摸清楚:
一、单个模型实际纳入多少个 tag?分区依据是什么?(对应第 04 节的标度关系)
二、对同向偏离类故障的提前量实测是多少?请提供该类工况的实际案例,而不只是逆结构案例。
三、模型在装置开停车、切换负荷、切换原料期间如何处理?这些时段相关结构本身会变。
四、提示的输出通道是什么?进不进 DCS 报警栏?如果进,报警合理化谁来做?
五、误报率是怎么统计的?分母是什么?"高信噪比"要有可核查的定义。
六、需求率统计怎么处理 AI 促成的人工干预?谁来向功能安全评估方解释?
· · ·
回到开头那个凌晨两点四十。
多变量异常检测确实能把"其实早就不对了"提前几分钟变成可见的东西,这个价值是真实的,数学上也站得住。但它的能力边界同样是数学的:对局部的、破坏结构一致性的故障敏感,对全局的、保持结构一致性的故障近乎失明;在规模适中的分区模型里灵敏,在贪多求全的大模型里迟钝。
它不会取代报警,更不会取代联锁。它填补的是一个此前一直空着的位置——在"完全正常"和"必须响应"之间,那段谁也说不清的灰色地带。这个位置值得占,但占之前得先知道它有多大。
▽ 参考资料(6 项)
[1] ControlRooms Unveils First Agentic Troubleshooting System for Chemical & Energy Operations. PR Newswire / The AI Journal, 2026-09-02.
[2] Honeywell and TotalEnergies Pilot AI-Assisted Control Room to Accelerate Shift to Industrial Autonomy. Honeywell 新闻稿, 2025-11-11(阿瑟港炼厂 DCU 试点,5 起预判,平均提前 12 分钟)。
[3] EEMUA Publication 191, Alarm Systems: A Guide to Design, Management and Procurement, 第三版, 2013, p.96(稳态报警率基准)。
[4] IEC 62682, Management of Alarm Systems for the Process Industries, 2014(约 144 条/天目标值);ANSI/ISA-18.2。
[5] IEC 61511-1, Functional Safety: Safety Instrumented Systems for the Process Industry Sector(运行阶段需求率跟踪要求)。
你厂里上过异常检测类系统吗?
最想知道的是:它报出来的那些提示,有多少最后被证明是真的?欢迎在留言区说说你的实际命中率。