❓什么是自动化视觉检测?
自动化视觉检测(Automated Visual Inspection)是用摄影机和软件判断一件东西符不符合标准,不需要人亲自去看。它分成三种:对照固定条件检查零件的规则式系统、用范例训练出来的学习式系统,以及看人怎么作业的动作式系统。
你桌上摊着两份报价。两份都写「AI 自动化视觉检测」。两支 demo 影片演的也是同一件事:一个红框收拢在发丝纹金属机壳的一道刮痕上,接着红框的位置换成一个绿色勾勾,画面角落的通过率往上跳。
其中一套会在第三周出状况,那时候新机种进来了,零件在治具里的角度和原本差了一点。型录不会告诉你是哪一套。
它其实也说不出来。同一个词底下有三种不同的技术,而这三种各自在不同的地方失灵。有用的做法,是在试点开始之前就弄清楚眼前这套是哪一种,而不是之后。
Kearney 量的是这些系统几乎都没有对准的那一块工厂。工厂里 72% 的工作由人执行,创造了整个营运 71% 的价值,而「用来量测人的活动的工具,自 1908 年以来实际上没有改变过」。(Kearney, The State of Human Factory Analytics)
📖 本文将带你看:
- 自动化视觉检测的三种类型,各自抓得到什么、抓不到什么
- 为什么同一个词可以同时指一套固定规则和一个训练出来的模型
- 你的产线真正在问的是三个问题里的哪一个
- 带进供应商 demo 的六个评估项目,以及每一项的警讯
- 一个半导体光罩盒组装工站 改了什么,又动了哪些数字
自动化视觉检测:规则式、学习式与动作式
挂着这个名称在卖的系统,都是这三种之一。比价之前,先弄清楚眼前的是哪一种。它们彼此不能互相替代。

“规则式”、“学习式”与“动作式”检测能力对比。
1. 规则式检测(传统机器视觉):用来判断一个已知的零件
工业摄影机、受控的打光和预先写好的演算法,把物件对照固定条件比对,高速回传 OK 或 NG。
系统不会学习。也不会适应。它做的就是被设定要做的事,在被设定好的条件下。这既是它的强项,也是它的天花板。
它擅长的地方:
- 表面瑕疵检测(自动光学检测,Automated Optical Inspection, AOI):成品上的刮伤、裂痕、污染、缺件
- 尺寸量测:到微米等级的几何公差
- 定位引导:把机械手臂和取放系统带到精确的座标
它停下来的地方,是任何没有事先告诉它的事。供应商把机壳从银色换成灰色,同一道刮痕就不再被判成不良,而产线上没有任何东西会通知你这个变化。在只跑一种产品的稳定大量产线上,这个天花板也许永远碰不到。在多样少量的产线上,你通常会在第一次爬坡(ramp,新机种从试产拉到满载产量的那段时间)就碰到它。
2. 学习式检测(针对零件的深度学习):用来容纳变异
模型用标注过的良品与不良品影像训练,所以系统认得出从来没有被明确写进程式里的模式。光线、位置、表面处理的变异会让一套规则失效,它撑得住;出现新的不良类型时,也可以重新训练。
代价在数据上。得有人搜集并标注足够多的不良品范例,而稀有的不良,恰好在你最需要它的时候最稀有。问供应商,模型要多少张标注影像才能上线,标注由谁做。如果答案是「我们会处理」,再问:11 月你的产品改版时会发生什么事。
这两类检查的都是同一个东西:零件,在它做出来之后。
3. 动作式检测(看作业员的 AI 视觉):用来看顺序
在这里,摄影机底下的对象不是零件。是一个正在做一连串动作的人。
系统不判断成品,而是辨识动作,拿来和标准作业程序(Standard Operating Procedure, SOP)比对:拿起来的是扭力起子,还是旁边那把手动螺丝刀;零件有没有先转到正确方向再放进去;第 4 步有没有做在第 5 步之前;作业员是不是停了 11 秒在等治具。触发条件是人的一个动作,不是画面里出现一个零件。
PowerArena HOP 人因作业平台(Human Operation Platform)就在这一层运作。HOP 在使用的当下辨识零件与工具,对照要求的顺序追踪作业员的动作,持续量测每个工站的组装周期,并把影像和序号、时间戳记、工站编号连在一起,任何一台之后都调得出来重看。
一家投入精密制造超过 25 年的全球半导体制造商,把它用在光罩盒组装工站上,那里单一作业员往往要负责 10 到 30 个组装步骤。组装周期从 3.5 分钟缩短到 2.8 分钟,UPH(Units Per Hour,每小时产出)提升 19%,直通率(First Pass Yield, FPY)达到 97.6%。他们的产线工业工程师讲得比任何规格表都直接:「以前异常靠经验判断,现在能用影像和数据快速指出瓶颈,让改进更有说服力。」

在复杂的手工装配工站部署“动作式” AI 检测的成果。
有一部分成果,来自任何模型训练之前就先做完的功课。零件摆放位置、工具位置、左右手分工都被明确定义下来,AI 才辨识得了。这件事本身也让流程变好了。支撑这一切的 PowerArena 基础模型(fundamental model),也就是底层的动作辨识模型,带来过 32.3% 的生产力提升。
你的产线真正在问的是哪一个问题
每一类都只把一个问题答得好,另外两个答得差。
「这个零件做对了吗?」 规则式检测,用在稳定的产品上,就很好用了。这通常是每单位最便宜的答案,技术也成熟。
「这个零件做对了吗?可是零件变异很大。」 学习式检测。你付的是数据和重新训练的成本,换回来的是对变异的容忍度。
「这一台有没有做对,而且我能证明吗?」 动作式检测。任何看成品的方法都答不了这一题,因为你想验证的多数东西,早在到达摄影机前三个工站的时候,就已经被封进产品里了。
很多已经在跑 AOI 的工厂,问的是第三个问题,逛的却是第一类。下面六个评估项目要抓的就是这个错配,而且趁早、趁便宜的时候抓。

为产线目前面临的问题,匹配最合适的检测技术。
带进 demo 的六个评估项目:该要求什么,警讯是什么
把这张表带进 demo。对任何导入过检测系统的人来说,这些都是很平常的问题,做过的供应商六题都会有现成的答案。
| 评估项目 | 该要求什么 | 警讯 |
| 1. 摄影机对准的是什么 | 明确说出检测的对象:零件,还是动作。请他们用一句话讲清楚。 |
回答「都可以」,却没有另外解释动作是怎么被辨识的。零件检测和动作辨识是不同的模型。
|
| 2. 遇到变异时的表现 | 用你的零件做 demo,包含一个你自己带去、转了角度、换了光线或颜色不一样的样品。问他们:一个刚刚判定通过的零件,转 15 度再跑一次,画面会怎么样。 |
只用供应商自己的黄金样品(golden sample,他们已知的良品,打光和摆放都配合系统调过)做 demo,或是先要求「有代表性的条件」才肯展示任何东西。
|
| 3. 训练数据,以及它归谁 | 达到量产精度需要多少张标注范例、谁来标注、要花多久,以及训练好的模型和影像事后归谁所有。 |
给不出数字。「它会自动学习」不是答案;没有附上不良类型的数字也不是。
|
| 4. 延迟,以及警示落在谁手上 | 以秒计的警示时间,加上一个指名的接收者:工站上的作业员、线长,或者一份班次报表。接着问,那个人在接下来 30 秒该做什么。 |
警示落在一个没有人打开的仪表板上,或者一封每日摘要 email 被说成「即时」。
|
| 5. 它留下的证据 | 以序号、工站和时间戳记为索引的逐台纪录,客诉进来时几分钟内调得出来。请他们现场调出一台给你看,不是给你一张截图。 |
只有 OK 和 NG 的计数。汇总图表,却没有办法回到单独一台。
|
| 6. 改变的成本 | 一份书面答复,说明下一次机种切换时会发生什么事:什么要重新设定、由谁做、需要几天的产线时间、费用多少。 |
「只需极少的重新设定。」请他们给出天数。导入过的供应商知道这个数字。
|
下一次和供应商谈的时候带什么
把你自己的不良品带进 demo。不是不良品的描述。是零件本身。
先讲工站,再讲技术,并且说明为什么是那一站。如果供应商从头到尾没问过是哪一站,这多少说明了他们怎么定义专案范围。
把今天在那一站验不了的三件事,一件一行写下来。如果供应商说不出他们的系统涵盖三件里的哪几件,就当作只涵盖一件。
问谁已经在人工组装上跑过这套,并且要求在供应商不在线上的情况下和对方聊。这个要求被怎么处理,比 demo 本身告诉你的更多。
再问:大夜班没有主管在现场的时候会怎么样。问这个问题会觉得有点直接。还是要问。
如果你评估的正是动作式系统,前面提到的组装周期、步骤验证和影像回溯功能,都放在 HOP Digital Station 里。
常见问题
什么是自动化视觉检测?
自动化视觉检测用摄影机和软件检查一件东西是否符合定义好的标准,不需要人来检验。它涵盖三种不同的做法:对照固定条件检查零件的规则式系统、用标注影像训练的学习式系统,以及辨识作业员在工站上正在做什么的动作式系统。
机器视觉和 AI 视觉检测差在哪里?
机器视觉把写好的规则套用在一个位置受控的物件上,回传 OK 或 NG。AI 视觉检测从范例学,不靠规则,所以容得下变异;在动作式的情况下,还能辨识人的动作顺序,这是任何规则集都列举不完的。
自动化视觉检测抓得到组装错误吗,还是只抓得到不良?
只有动作式的抓得到。零件检测看的是事后的结果,任何在到达摄影机之前就被封进产品里的东西,它都看不到。动作辨识在步骤发生的当下验证,那时候产品还在作业员面前。
AI 视觉检测有多准?
准确率的数字只有在附上不良类型、光线条件和数据集的时候才有意义。任何报百分比的供应商,都问一句这是在什么上面量出来的,并要求把误判率(false positive rate)一起拿出来看。一套什么都报警的系统,通常一个月内就会被线长关掉。
我需要换掉现有的 AOI 吗?
通常不需要。产线末端的 AOI 和制程中的动作式检测回答的是不同的问题,常见的架构是两个都跑:一个检查做出来的东西,另一个记录它是怎么被做出来的。
接下来可以往哪里看
三个问题、三种技术、一张带进会议室的表。如果想在其中任何一项再往下一层,可以从这几页开始。
延伸阅读
- 制造业的 SOP 遵循:怎么量测,而不只是写下来。如果你在逛的正是动作式检测这一类,这篇讲的是「已验证」在一个工站上实际指的是什么。
- AI 视觉能不能强化 FMEA? 评估项目 5 的证据一旦存在,值多少:来自观察而不是记忆的失效模式。
- AI 视觉如何升级质量管理。三种类型所处的那个更大的品保与品管全貌。
- 用 AI 让半导体制造的良率维持在 95%。上面光罩盒故事的良率那一面。
客户案例
- 某半导体制造商以 HOP AI Poka-Yoke 提升产品质量。光罩盒导入的完整版:10 到 30 步的工站、SOP 的改写,以及 3.5 到 2.8 分钟是从哪里来的。
- 某前五大 EMS 的产线平衡案例。一条 15 个工站产线上的动作式检测,验证步骤的那些摄影机同时也在量组装周期。
在自己的产线上看一次
要确定三种里你的产线需要哪一种,最快的方法是挑一个工站,把六个问题套上去。零件记得带。
欢迎预约一次线上讨论:看自动化视觉检测用在人工组装上的样子。
Table of Contents


