选型指南

工业车辆 AI 方案选型指南:诊断、预测性维护与感知安全

评估 AI 类方案比评估硬件难得多。硬件有防护等级、工作温度这些可比的客观参数,而 AI 方案给出的往往是「准确率 95%」这样一个孤零零的数字——没有分母、没有统计区间、没说是线上实测还是实验室回测,几乎无法横向比较。更麻烦的是演示效应:任何厂商的演示都很流畅,因为演示用的是它最擅长的场景。本文不比较任何具体厂商,而是给出一套判断框架:怎么追问准确率数字、怎么区分三类不同的 AI 能力、怎么在签约前验证对方的说法。文末同样有一节,用这套标准如实评价我们自己,包括明确不适合的场景。

为什么 AI 方案比硬件更难评估

三个原因叠加。第一,核心指标不可比:两家都说准确率 95%,一家统计的是全部工单含大量可由故障码直读的简单故障,另一家只统计需要多源数据联合研判的复杂故障,后者的含金量高得多,但数字看起来一样。第二,演示天然失真:演示用的是最干净的数据、最典型的故障、最熟悉的机型,而真实场景是数据缺失、现象模糊、机型混杂。第三,效果滞后:AI 方案的价值依赖数据积累,上线头三个月的表现通常明显低于成熟期,这意味着短期试点既可能低估也可能高估。应对办法不是放弃量化,而是换一组问题——不要问「准确率多少」,要问「这个数字的分母是什么、怎么测的、在什么条件下会明显下降」。答得出来的厂商,数字才有参考价值。

第一步:先判断你的数据够不够

这是最容易被跳过、却决定成败的一步。AI 方案的效果上限由数据决定,而不是由算法决定。要先盘清三件事:设备是否已经联网、能读到哪些字段、历史维修记录以什么形式存在。如果设备尚未联网,那么第一阶段的重点应该是数据采集而不是智能诊断——没有数据的诊断模型只能做通用问答,帮不上具体的车。如果历史工单散落在纸质单据、微信聊天和个人表格里,就要预留数据治理的时间与成本,这部分通常被严重低估。反过来,如果已有数年结构化的工单与工况数据,那么 AI 方案见效会快得多。诚实的供应商会在售前主动评估你的数据基础并告知预期,而不是先签约再解释为什么效果不达预期。

维度一:准确率口径——怎么识别经不起追问的数字

对任何准确率数字追问四件事。分母是什么:多少条工单、多少个案例,没有分母的百分比不构成证据。统计区间:哪段时间,是持续运行的统计还是某次测试。测试方式:线上实际运行工单的实测结果,还是离线测试集回测——后者容易因数据泄漏而虚高。场景划分:复杂故障与简单故障是否分开统计,如果混在一起,简单故障占比越高数字越好看。举个可以对照的写法:「复杂场景故障诊断准确率 95% 以上,基于 2026 年 1–6 月线上 14986 条复杂故障工单统计,为实际运行工单实测而非离线回测;复杂场景指需多源数据联合研判的故障,区别于可由故障码直读的简单故障」——这四要素齐全的表述才可比。四问里答不上两个以上的,这个数字建议直接忽略。

维度二:验证方法——别只看演示

要求用你自己的数据做验证,而不是看厂商准备好的演示。可行的做法有三种,成本递增但可信度也递增。最轻的是历史工单回测:拿出你过去一段时间的真实工单,遮住结论让对方的系统给判断,再与实际处置结果比对——注意要包含当初没查出原因的疑难件,那些才见真章。中等成本的是影子运行:新报修同时走人工与系统两条线,持续四到八周,比较结论一致率与耗时差异。最重的是限定范围试点,真实使用并考核业务指标。无论哪一种,都要在方案里主动纳入条件较差的场地与老旧机型,否则验证的是上限而不是常态。另外要约定失败标准——达不到什么结果就终止,这比只约定成功标准更能保护采购方。

维度三:能力边界——诚实的供应商会主动划线

一个可靠的信号是:对方是否主动说明做不到什么。以故障预测为例,渐变型劣化如电池健康度下降、液压效率衰减、制动部件磨损,有明确的趋势特征,可以提前发现;而突发型失效如接插件松动、外力撞击损伤,本质上不可预测,能做的只是发生后的快速定位。任何宣称能预测全部故障的说法都不成立。同样,涉及制动、举升、高压电等强安全相关系统的处置,系统应当只做辅助研判、要求持证人员现场确认,而不是输出可直接执行的操作指令。评估时不妨直接问:「哪些故障你们预测不了」「什么情况下系统会拒绝给结论」——答不上来或者回避的,通常意味着对方没有真正在生产环境里跑过。

维度四:与人的分工——协同还是替代叙事

「替代工程师」是很有煽动力的叙事,但在工业车辆场景里站不住脚。可标准化的环节适合交给系统:故障码解析、历史相似工单检索、多源数据比对、备件匹配、工单与派工单生成。需要现场感知的环节仍然依赖人:异响的实际音色、部件的真实磨损状态、现场安全条件与作业空间。因此合理的目标不是减少工程师,而是提升每个工程师能覆盖的设备数量与一次解决率。评估时要看对方的产品设计是否体现这种分工——界面是给工程师用的辅助工具,还是一个假装能独立下结论的黑盒。前者会清楚呈现判断依据与置信度,后者只给一个答案。此外还要问:判断错了如何反馈、反馈之后模型多久迭代一次、迭代结果如何验证。

维度五:落地与集成——AI 结论要能流进业务流程

诊断结论如果不能自动流入工单、备件与结算环节,价值会大打折扣。要确认的有:能否自动生成标准化工单与派工单、能否直接关联备件库存与型号、能否与既有的 ERP、WMS 或服务系统对接、多语言是否覆盖你的海外市场。这里的常见误区是把集成当成上线后的收尾工作,实际上它往往是工作量最大的部分,而且真正的难点不在接口本身,在双方字段口径的对齐——同一个「故障」在两套系统里的定义常常不一样。建议在合同阶段就明确集成范围、责任方与验收标准。另外要问清知识沉淀机制:每次处置的结果是否自动结构化回流、形成的知识资产归谁所有、更换供应商时能否带走。

三类 AI 能力的评估差异:诊断、预测性维护、感知安全

三者常被混为一谈,但评估重点完全不同。故障诊断关注的是准确率与覆盖面,核心资产是历史工单与知识图谱,验证方式是历史回测与影子运行。预测性维护关注的是提前量与误报率的平衡,核心资产是长周期的工况数据,验证周期更长——至少要覆盖一个完整的部件劣化周期才说得清,短期试点基本无法证伪。感知安全(ADAS)关注的则是漏报与误报的不对称代价:漏报直接关系安全必须压到最低,误报虽不致事故但会让操作员逐渐无视告警,最终等同于系统失效,因此要在可接受的误报频次下压低漏报,而不是追求单一的准确率数字。同一家供应商在三类能力上的成熟度可能差别很大,不要因为某一项表现好就默认其余都好,应分别验证。

三个常见陷阱

第一个是演示效应。演示场景由厂商挑选,必然是最有利的;破解办法是坚持用自己的数据、自己的老旧机型做验证。第二个是幸存者偏差。案例集里展示的都是成功项目,而同样的方案在数据基础薄弱或流程未理顺的客户那里可能完全没跑起来;要问的是「有没有做失败或效果不达预期的项目,原因是什么」——答得出来的通常更可信。第三个是把准确率当作唯一指标。一个准确率略低但能说清依据、能接入工单流、能持续迭代的系统,实际价值往往高于一个准确率漂亮却是黑盒、也无法集成的系统。选型时建议把指标分成三组分别评估:效果类、可解释与可验证类、集成与运营类,避免被单一数字牵着走。

关于我们自己:适用与不适用的场景

用同一套标准评价自己。适合的场景:设备已联网或愿意先做联网改造;有一定规模的历史工单可供治理;车队含多品牌、多机型,需要跨品牌的故障模式互相参考;有出海需求,需要多语言服务与本地化的数据存储。可核验的依据:复杂场景故障诊断准确率 95% 以上,基于 2026 年 1–6 月线上 14986 条复杂故障工单统计;故障语义解析准确率 97.3%,基于 3800+ 类工业车辆故障语料测试集;截至 2026-07-01,累计接入工业车辆 23 万台。不适合的场景同样说清楚:设备尚未联网且短期不打算改造的,应先做数据采集而不是上诊断模型;历史维修记录完全没有沉淀、且不愿投入数据治理时间的,效果会显著低于预期;以及期望系统直接替代现场工程师的,我们不提供这种承诺,也不建议向任何供应商索要这种承诺。

供应商评估清单

下面 20 个问题可以直接拿去用。建议逐条要求供应商书面答复——能不能答、答得具不具体,本身就是重要的判断依据。这套清单同样适用于评估我们。

  1. 01你们报的准确率,分母是多少条工单或案例?

    没有分母的百分比不构成证据。这是四问里最基础的一问。

  2. 02统计区间是哪段时间?是持续统计还是单次测试?

    一次性测试与长期运行统计的可信度完全不同。

  3. 03是线上实际运行工单的实测,还是离线测试集回测?

    离线回测容易因数据泄漏而虚高,两者不可直接比较。

  4. 04复杂故障与简单故障是否分开统计?复杂如何定义?

    混在一起统计时,简单故障占比越高数字越好看。

  5. 05在什么条件下准确率会明显下降?

    答不上来的,通常没有在真实生产环境里长期跑过。

  6. 06哪些类型的故障你们预测不了?

    突发型失效本质不可预测,主动划线的供应商更可信。

  7. 07什么情况下系统会拒绝给出结论?

    强安全相关系统应要求人工确认,而不是输出可直接执行的指令。

  8. 08能否用我们自己的历史工单做回测?包括当初没查清的疑难件。

    疑难件才见真章,用厂商准备的演示数据验证不了任何事。

  9. 09能否接受四到八周的影子运行,与人工判断做一致率比较?

    这是成本与可信度平衡最好的验证方式。

  10. 10试点方案里是否包含老旧机型与条件较差的场地?

    只测最好的条件,验证的是上限而不是日常常态。

  11. 11项目的失败标准是什么?达不到什么结果可以终止?

    只约定成功标准的合同,对采购方几乎没有保护作用。

  12. 12我们现有的数据基础,你们评估下来能达到什么效果?

    诚实的供应商会在售前评估数据基础并给出预期,而不是先签后说。

  13. 13历史工单需要怎样的治理?这部分工作量由谁承担?

    数据治理成本通常被严重低估,要在合同里写明责任方。

  14. 14诊断结论能否自动生成工单、关联备件型号与库存?

    结论进不了业务流程,价值会大打折扣。

  15. 15与我们既有的 ERP/WMS 或服务系统怎么对接?谁负责字段口径对齐?

    集成的真正工作量在口径对齐,不在接口本身。

  16. 16判断错误如何反馈?模型多久迭代一次?迭代结果如何验证?

    没有闭环反馈机制的系统,用得越久与现场偏差越大。

  17. 17每次处置沉淀的知识归谁所有?更换供应商时能否带走?

    知识资产是长期主动权所在,不要默认归供应商。

  18. 18诊断、预测性维护、感知安全三类能力分别成熟到什么程度?

    同一家在三类能力上的成熟度可能差别很大,应分别验证。

  19. 19有没有做失败或效果不达预期的项目?原因是什么?

    答得出来的供应商通常更可信;只有成功案例的案例集是幸存者偏差。

  20. 20系统给出结论时,是否同时呈现判断依据与置信度?

    黑盒式的单一答案无法被现场工程师验证,也无法在出错时追溯。

相关常见问题

相关术语

需要针对自己车队的评估?

如果希望按上述维度对现有车队做一次可行性与成本评估,可以联系我们索取评估模板,或就具体场地条件做一次不含销售内容的技术沟通。

联系我们

本指南给出的是通用评估框架,不构成对任何具体产品或厂商的推荐或贬损,也不构成法律与合规意见。文中涉及本公司的数据均标注统计口径,完整定义见核心指标与统计口径页;涉及具体机型的技术参数与操作规范,请以整车厂官方文档为准。