1. 先聊聊装配质量这个老难题
干过产线的人都有感触,装配环节的质量管控,多少年都是靠“人盯人”。SOP写了一大本,培训也做了,但实际执行起来,漏装、错装、扭矩不到位的现象总在重复出现。这几年我陆续参与过几条装配线的数字化改造,真正把SOP、AI和视频分析放到一起用,才体会到什么叫“火眼金睛”——不是某个单点技术多神奇,而是这三样东西组合起来,正好补上了传统质量管控最薄弱的环节:过程监控。
这篇文章我想完整梳理一下这套思路和落地细节。如果你正在负责装配线的质量提升、想上AI视觉但不知道从哪切入,或者已经在试点视频分析却苦于误报率高,那这篇内容应该能给你不少实际参考。
先说结论:视频分析不是用来替代老师的眼睛,而是把老师傅的“经验判断”沉淀成可量化的规则,再借助SOP的标准化框架,让每一台装配工位都拥有稳定、不知疲倦的“AI质检员”。它能同时解决两个层面的问题——结果检验和过程合规。结果检验检查“装没装对”,过程合规检查“有没有按SOP做”。而这两个层面,恰恰是传统人工管理和普通视觉检测设备覆盖不了的盲区。
2. 方案整体设计:SOP、AI、视频分析怎么组合才不打架
2.1 为什么要用视频分析这条技术路线
很多同行问我,装配质量管控已经有扭矩扳手、盲检设备、激光传感器,为什么还要上视频分析?我的回答是:这些设备各有局限。扭矩扳手只能验证紧固力矩一个参数,盲检设备只能判断零部件到没到位,它们都是“结果导向”的验证,无法覆盖整个装配动作的过程。举个例子,扭矩合格只能说明螺丝拧紧了,但没法证明工人是用正确手法、正确顺序、以及正确的工具完成的——而大量装配缺陷恰恰是过程不规范造成的。
视频分析补齐的正是过程维度。它相当于在每个工位装了一双“不眨眼、不疲劳”的眼睛,持续观察操作者的动作路径、工具使用顺序、装配节拍和关键步骤执行情况。通过AI模型识别动作语义,再与SOP定义的标准流程比对,系统就能实时发现问题:漏了一个步骤、动作顺序颠倒、节拍严重异常、或者用了错误的工具。
我把这称作“SOP视频化”——把纸面上的文字标准,变成算法能理解的行为规则。这也解答了很多人的疑问:视频分析不是简单装个摄像头加个模型,而是需要先把SOP做结构化拆解,再映射到视觉可识别的动作序列上。这两件事的耦合程度,直接决定了系统的可用性。
2.2 三层架构:采集、分析、闭环
整套系统我习惯分成三层来设计,逻辑清晰,落地也好推进。
第一层是感知层,也就是视频采集。工位相机负责持续拍摄操作过程,通过智能盒子或边缘服务器做初步的视频流接入。这一层的关键选型不是相机数量,而是安装位置和拍摄视角。单目相机加合理机位就能解决大部分动作识别需求;复杂工位才需要考虑双目或多角度融合。
第二层是分析层,核心是AI算法。常见的组合方案是“目标检测 + 姿态估计 + 行为识别”:目标检测负责发现“工具在不在手里、螺丝有没有拿错”,姿态估计负责理解“手臂动作和躯干姿态”,行为识别负责把连续帧串成“动作序列”。这一层跑出来的结果直接喂给SOP比对引擎,而不是直接输出“合格/不合格”结论,这很重要。
第三层是业务闭环层,跟生产管理系统对接。判定结果会写入MES(制造执行系统)或QMS(质量管理系统),当班数据自动汇总成质量报告,异常工单推送到班组长终端。闭环节不是“看”,而是“管”——发现问题之后必须有预警、有拦截、有追溯。
2.3 从SOP到检测项:拆解比算法更重要
我见过一个最常见的失败案例:项目组花了大价钱训练模型,但准确率始终上不去,最后复盘发现不是算法不行,而是SOP拆解得一塌糊涂。原SOP写的是“安装左侧盖板,力矩20Nm”,这句话工人都能看懂,但算法完全不知道“安装盖板”对应哪些可见动作。
正确做法是把每一条SOP工序向下拆成三层:
- 动作层:拿起盖板、对准卡口、按压到位、拿取螺丝、固定
- 对象层:左侧盖板、卡口位置、螺丝型号、对应电动工具
- 检验层:关键检验节点、动作顺序校验点、允许的节拍窗口
拆完之后,每个节点就是一个检测触发器。比如“拿起盖板”这个动作,AI只需要判断“人手是否从物料盒方向移动到盖板区域”;“按压到位”就需要结合特定区域的交互动作来判定。这样设计检测项,模型的识别目标明确,误报率也能控制在可接受的范围内。
注意:SOP拆解必须让工艺工程师和产线班组长一起参与。算法工程师单独做出来的拆解往往脱离实际操作习惯,工人实际动作可能跟SOP有出入(这些出入恰恰是AI要发现的核心价值),但拆解人要能分辨哪些是合理偏差、哪些是违规行为。
3. 核心技术细节与实操要点
3.1 视觉硬件选型:不是越贵越好
视频采集的硬件投入,我建议按“够用+稳定”来定策略。常规装配工位选择分辨率1080P以上的工业相机或高性能网络摄像头,帧率控制在15到30帧就足够覆盖人工装配动作。再高的帧率和分辨率只会增加存储和计算压力,对动作识别的精度提升非常有限。
安装位置是最容易踩坑的地方。相机要能覆盖整个操作台面,同时避免逆光和遮挡。我做过的一个汽车零部件装配项目,第一批相机装在工位正上方,结果被吊挂的平衡器挡住了一半视野,模型在识别“拿起工具”这个动作时频繁漏检。后来把机位往前移了30厘米,加了一个低角度补光,同样的模型准确率从78%提到了92%。
灯光比相机更关键。装配现场环境复杂,常有环境光和工位灯叠加,容易造成反光和阴影。经验做法是在工位上增加专门的漫射补光灯,并在算法前处理加入亮度归一化。对检测模型而言,光照不一致会严重影响训练效果和上线后的稳定性。
存储规划别忽略。单工位每天8小时视频,1080P+H.265编码大约产生20到30GB数据。建议做到“原始视频保留7天、异常片段永久留存、特征信息实时入库”。这样既能覆盖质量追溯需求,又能控制存储成本。
3.2 算法选型与模型训练:建议从现成模型起步
装配动作识别的算法方案,不建议从头训练大模型,成本高且效果不一定可控。我目前用过最稳的路线是:目标检测用YOLO系列或RT-DETR等成熟的预训练模型做迁移学习,关键点检测选轻量化的姿态估计模型,动作序列分类再用一个时序模型(如基于Transformer或LSTM的轻量分类器)来整合。
用YOLO检测工具和零部件时,类别不要设太细。比如电动扳手就是“电动扳手”,不要去细分型号,否则样本量不够,模型很容易混淆。需要区分型号时,用颜色特征明显的区域加一个辅助分类器,比硬塞进检测模型的类别里靠谱得多。我踩过这个坑:第一版把扭矩扳手按三档扭矩分成三个类别,样本量本来就不足,结果模型把三档工具混在一起,最后干脆合并成一类,再通过操作位上摆放不同档位工具的区域判断,反而稳定多了。
样本采集和标注是真正耗时的地方。一个工位至少需要采集3到5天的正常操作视频,并尽量覆盖不同班次、不同员工、不同工况。标注时,重点标“关键动作的起始帧和结束帧”,而不是每帧都标——这会节省大量人力。行为识别的模型训练,动作边界标注的准确性比分类标注数量更重要。
实操心得:如果项目是从零起步,先找一个最容易识别的动作作为试验目标。比如“取件动作”或“工具拿起动作”,验证完整链路通了之后,再逐步扩展到更复杂的工序。一上来就想识别全部SOP节点,往往会把项目拖入数据地狱。
3.3 SOP一致性判定:不要追求“分毫不差”
SOP一致性的判定逻辑是整个系统的“大脑”。实际装配中,工人不会像机器人一样每个动作都标准,总会有些合理波动。如果判定逻辑写得太死,系统会天天误报,最后班组直接关掉报警。
我的设计原则是“抓关键节点,容一般偏差”。具体做法是:
- 关键节点设为硬校验:该有的步骤必须有,顺序不能颠倒。比如“先装密封圈再装端盖”,这一步错了就是硬缺陷,直接报警拦截。
- 非关键节拍设为软校验:动作耗时允许在标准时间的上下20%到30%内波动,超出区间才产生提示,不直接判定为不合格。
- 遗漏检测设为重点:SOP要求“每台安装4颗螺丝”,系统发现只检测到3次紧固动作,这时必须触发复查。
另外要设计“置信度阈值”的控制逻辑。每条报警都附带AI的置信度分数,便于现场人员快速判断。上线初期阈值可以调高一些,减少干扰;运行稳定后再逐步下调,提高检出率。我见过一个项目把阈值调得太低,一天报警几百条,产线停线排查次数过多,反而拖低了生产效率。
3.4 数据回流:AI反过来优化SOP
这部分很少有人提,但价值极大。AI持续识别出的偏差数据,其实是一面镜子,照出SOP本身是否合理。实际操作中,可能出现一种情况:大量员工在同一个非关键节点都偏离了SOP,同时装配不良率却没有升高。这说明什么?说明SOP这部分可能写得太保守,或者作业顺序可以优化。
我做过的一个电子装配项目就遇上了这种情况。SOP要求“先预装两颗定位螺丝,再装配其余螺丝”,但实际有经验的老师傅都是“先装完定位螺丝,直接按对角线顺序全部锁紧”,效率高而且质量稳定。AI通过几个月的数据积累发现了这个一致性偏差,后来工艺部门验证后,干脆把SOP改成了老师傅的做法,装配节拍还因此提升了8%。
所以说,这套系统的价值不只是“抓违规”,更是“做进化”。把AI积累的行为数据和SOP的合理性验证打通,质量管控才能形成真正的闭环。
4. 从0到1实施路径:一步步落地,不冒进
4.1 试点工位怎么选
很多项目一上来就想覆盖整条产线,我强烈建议先做一个“光杆工位”试点。选试点工位的标准有三个:工序标准化程度高、操作动作相对固定、不良率或客诉率较高。标准化程度高意味着AI学习的基准清晰;动作固定意味着视觉识别难度较低;不良率高则意味着项目价值明显,容易拿到管理层支持。
我最近做的一个电机装配项目,试点选的是“定子入壳+端盖锁紧”这个工位,原因很简单:这个工位一个班次要装几百台电机,曾经出现过端盖密封圈漏装导致的客诉,是最能体现项目价值的地方。
试点周期控制在4到6周。第一周梳理SOP和安装相机;第二周采集数据;第三周标注和训练;第四周联调;第五和第六周试运行和优化。时间表排得太满,出了问题没有缓冲余地,试点很容易翻车。
4.2 SOP重新梳理:先砍掉不合理的“书面标准”
不要直接拿现有SOP文档去指导AI。现有SOP往往存在几个问题:部分工序描述停留在“要求”层面,缺少可观察的动作本体;不同版本的SOP之间存在冲突;还有一部分工序是“书面一套、实操一套”。
所以在试点之前,我建议先做一场“SOP现场验证会”:邀请工艺、质量、生产三方聚在工位前,让老师傅按当前SOP操作一遍,全程录像。然后逐条比对,凡是视频里做不出来、或者所有人都不按书面要求做的步骤,当场标记出来。
这一步会触到一些“流程部门的敏感神经”,沟通时要注意方式:重点是“为了让AI能学会正确动作”,而不是“质疑SOP的合理性”。等项目出效果了,工艺部门自然会愿意配合改SOP。
4.3 数据采集与模型训练:按工位建小模型
每个工位的场景差异都很大,我倾向于按工位训练独立的小模型,而不是做一个“万能大模型”。原因很实际:每个工位的工具、零件、动作模式不同,一个大模型需要海量数据才能覆盖,项目中很难搞到这么多高质量标注样本。
训练过程大致是这样的:先用预训练模型在自采数据上做迁移学习,迭代50到100个epoch,观察loss和指标;然后处理类别不平衡的问题——比如“拿取螺丝”这个动作每天出现几百次,“使用扭矩扳手”只出现十几次,如果不做重采样或数据增强,模型很容易偏向高频动作,低频动作的召回率会非常低。
模型上线后不代表结束,我建议至少做两周的“影子模式”,就是AI只记录不报警,拿AI的输出跟人工专检的结果对比。跑完两周,基本上能摸清模型的误报和漏报分布,再决定正式启用和报警阈值。
4.4 与MES/QMS系统对接
试点跑通后要快速落地到业务闭环里,否则价值没有显现。对接的方式不复杂,本质上是做接口打通。AI判定结果通过API或者消息队列推送到MES系统,在MES里生成质量事件并绑定到对应的产品序列号,这样就能实现单台追溯。
如果现场没有MES,也别灰心。可以做轻量方案:用低代码平台搭一个简单的异常事件看板,AI报警推送到Webhook,班组长手机上就能收到消息。等信息化基础完善了,再逐步向MES/QMS迁移。
注意:数据接口在设计时就要考虑好“谁负责确认AI的报警”——是班组长、质检员还是操作工人自己?这个角色没定好,报警推给了所有人,结果没人处理,闭环就会流于形式。
5. 常见问题与排查技巧实录
5.1 误报率高,怎么压下来
误报是这类项目里最常见的“劝退器”。我遇到过最夸张的一次,上线第一周误报率达到35%,产线班组长直接要求拆设备。排查之后发现,问题不在算法,在于SOP判定条件太严苛——凡是有动作顺序偏离就报警,但很多偏离其实是工人习惯性的动作重合,比如左手拿螺丝的同时右手已经在够工具,两件事并不是严格串行。
解决路径有三步:第一步,检查判定逻辑是否留足了动作重叠窗口;第二步,检查标注数据中是否覆盖了不同员工的作业习惯,建议在训练样本里刻意加入老师傅的“花式操作”;第三步,调整置信度阈值和报警去抖策略——连续5帧以上稳定识别到的偏差才触发报警,单帧闪烁全部忽略。
5.2 员工抵触,被当成“监控工具”怎么办
说句实在话,视频分析一上产线,第一反应基本都是“公司在监视我”。我在项目启动会上一开始就明确讲清楚了:这套系统盯的是过程,不是人。它记录的对象是与SOP偏差相关的动作数据,破例处理也会明确边界。隐私方面,我们做了背景虚化处理,只保留姿态轮廓和工具交互信息,不保留真实人脸。动手解决比张嘴承诺更有说服力。
推行策略上,我建议先做“正向激励闭环”。试点期间不处罚任何违规,反而每周用数据评选“SOP执行之星”,奖励执行最规范的员工。等大家习惯了这个系统之后,再逐步约束关键违规场景。我负责的项目里,一个原本最有抵触情绪的班组长,后来成了系统最积极的推广者——因为他第一次可以有理有据地跟后道工序争论:“不是我们装配有问题,是上一工序的来料问题,数据在这里。”
5.3 算力成本:一定得上GPU服务器吗
很多团队一听到“洗视频分析”就以为要上服务器集群,其实装配线场景的算力需求远没有那么夸张。单工位的视频分析,一张入门级AI推理卡就够用了,甚至部分轻量模型在CPU上也能跑起来(当然延迟会高一些,建议搭配GPU使用)。我做过的一个两条装配线共8个工位的项目,一台配备单块GPU的工控机就稳定扛住了所有视频流。
真正花钱的大头是数据存储和标注人力。存储可以用分级策略来控成本;标注人力可以通过“预标注+人工修正”来压缩工时。先用现成的检测模型自动预标注拿到初始框,再让人工复核修正,标注效率可以提升一倍以上。
如果连单块GPU预算都紧张,也可以考虑用第三方算法平台或云推理接口——把视频抽帧后传云端识别,成本按调用量算。不过要考虑现场网络条件和数据合规要求,实际需要在“本地实时性”和“成本可控”之间做权衡。
这套东西做到现在,我个人最大的体会是:技术问题其实都有解,难的是把三个完全不同领域的人——工艺、IT、车间——拉到同一张桌子上,让他们相信彼此的目标是一致的。SOP提供了“标准答案”,AI提供了“解读能力”,视频分析提供了“观察渠道”,缺了任何一环,另外两环都会变成空中楼阁。如果你正准备上这类系统,我建议从最小的试点工位开始,先让数据说话,再用成果推动扩展,这条路虽然慢,但走得稳,每一步都经得起产线检验。