一块黑色塑料外壳放在摄像头底下,和另一块材质完全不同的黑色塑料外壳,看上去几乎没有任何区别——这正是只靠视觉AI做材料识别,迟早会撞上的天花板。开云在实际的分选和入库质检环节,从来不指望一个摄像头就能把材料认全,视觉、光谱、化学分析各自负责不同层次的问题,最后再把结果拼起来,这也是kaiyun.com一直强调的"多模态"在材料识别这件事上真正的含义,而不是一个听起来很先进的名词。
视觉AI看得清形状和颜色,看不清化学成分
视觉AI擅长的是目标检测、分割、颜色聚类和表面缺陷识别——判断这是一块板材还是一段管材、表面有没有明显划痕和污渍、颜色是否均匀,这些任务视觉模型做得又快又稳定,非常适合在分选线上做第一轮高速筛查,处理速度基本不受物料形状复杂程度影响,单位时间能处理的物料数量远高于光谱或化学分析。但视觉能提供的终究是外观信息,不是化学身份:两种颜色几乎相同的黑色塑料,可能一种是聚丙烯、一种是ABS,单靠摄像头根本分不出来。更麻烦的是,黑色塑料里常用的炭黑类着色剂会大量吸收可见光乃至近红外波段的光线,这不仅让视觉判断失效,连常规近红外光谱设备在黑色物料上的识别效果也会打折扣,这也是行业里"黑色塑料分选难"长期存在的一个现实原因,不是一句"上AI"就能绕开的,需要换用对炭黑不那么敏感的检测波段或者辅助手段才能解决,单纯升级摄像头分辨率解决不了这个问题。
光谱AI辨的是化学结构,但要先解决噪声和基线问题
近红外、中红外、拉曼这些光谱手段测的是分子振动对应的化学结构信息,理论上能分辨视觉识别不了的材料类别差异。但光谱数据从采集到能用,中间要处理不少工程问题:物料表面的水分、油污会带来额外吸收峰,干扰真正代表材料本身的特征峰;物体形状不规则、检测距离和角度变化会造成基线漂移,同一块料换个角度测,曲线整体上下平移;传送带速度越快,单个物料能采集光谱的时间窗口越短,信噪比就越难保证,这几乎是所有在线光谱分选系统都要面对的物理限制。这意味着光谱AI的识别能力不是纯粹由算法决定的,采集端的稳定性同样重要,速度和识别准确度之间存在实实在在的工程取舍,不是简单堆算力就能突破的瓶颈,这一点在评估任何"AI分选准确率"的说法时都值得多问一句:这个数字是在什么速度、什么物料状态、多大样本量下测出来的,离线实验室条件下的表现和产线实际运行的表现往往有明显差距。
化学分析补上光谱看不到的元素和杂质信息
光谱主要反映的是分子层面的化学结构,但对元素组成和微量杂质并不敏感,这部分需要靠X射线荧光光谱(XRF)这类元素分析手段来补充。比如判断废塑料里是否混有含溴阻燃剂残留,或者废金属里是否夹杂了不该出现的重金属元素,这类信息光谱曲线不容易直接反映,但对下一步能不能安全进入某个应用场景非常关键,尤其是涉及电子产品拆解件这类成分复杂的来源。XRF也有自己的局限——对原子序数很小的轻元素灵敏度低,碳、氢这类构成塑料主体的元素基本测不出来;而且检测结果很大程度上取决于取样点是否有代表性,一块物料表面测一个点,不代表整批料的真实杂质水平,如果杂质分布不均匀,单点检测很容易得出过于乐观或过于悲观的结论,需要多点采样或者结合物料的均匀程度做判断,采样方案本身也是整套识别流程里容易被忽视但影响很大的一环。
融合逻辑:不是三个模型各投一票,而是分工接力
真正在产线上跑起来的多模态识别,不是让视觉、光谱、化学分析三个模型各自打分再简单加权平均,而更像是一条有先后顺序的接力:
- 视觉AI在分选线全速运行,负责形状分类和明显异常品的初筛,把可疑或需要进一步确认的物料分流出来,这一步几乎不产生额外的时间成本;
- 被分流出来的物料进入光谱检测环节,由光谱AI给出材料化学类别的判断,这一步通常比视觉筛查慢,但只针对被标记出来的子集,不需要覆盖全部流量;
- 对涉及安全或合规风险的品类(比如疑似含阻燃剂的电子废料塑料),再抽样送入化学分析环节做元素级确认,这一步速度最慢,成本也最高,但只在必要时触发,不会拖累整条产线的节奏。
这种分级接力的好处是,把最耗时的检测手段留给真正需要的那一小部分物料,而不是让所有物料都跑一遍最慢的流程,兼顾了产线速度和识别可靠性,也让整体检测成本控制在可接受的范围内。反过来说,如果一开始就想着"每一块料都做全套检测",不但产线速度会被拖垮,检测设备的损耗和运营成本也会高到不现实。
模拟场景:一批混合外壳料的分级识别
示例场景中,一批来自小家电拆解的塑料外壳混料进入产线,外观上大多是黑色和深灰色,颜色区分度很低,单纯依靠人眼或普通摄像头几乎无法区分材质。视觉AI先按形状和尺寸做初步分类,并把颜色接近炭黑特征、可能对近红外不敏感的部分单独标记;这部分物料被送入中红外和拉曼联合检测站,确认材质大类为聚丙烯或ABS;其中被判断可能来自电路板附近结构件的一小部分,再额外过一次XRF检测,筛查是否存在溴系阻燃剂残留。三段检测的结果最后汇总成这批料的分级建议,标明哪些可以进入常规再生流程,哪些需要单独隔离处理,而不是任何单一环节说了算,整个过程中每一段检测的判断依据也会被记录下来,方便后续追溯这批料到底是怎么被归类的。
诚实地说,多模态也不是所有产线都用得起
把视觉、光谱、化学分析都部署到一条产线上,意味着设备采购、维护、校准和人员培训的成本都要同步上一个台阶,这不是所有回收企业都能一次性承担的。现实中更常见的做法是分阶段部署:先用视觉AI解决最基础的分类和筛查问题,把明显不合格、明显异常的物料先挡在外面;等业务规模和资金条件允许,再逐步加入光谱检测覆盖更细的材料类别判断;化学分析这类成本最高、速度最慢的手段,往往只在涉及安全合规风险或者高价值应用场景时才值得投入,而不是每一条产线都要配齐三套系统。换句话说,多模态识别的部署顺序本身也是一种权衡——先解决影响面最大的问题,再逐步补齐识别精度上的短板,而不是一步到位追求"全传感器覆盖"这种不现实的目标。也正因为如此,评估一套多模态识别方案时,除了看它的识别能力,还要看它能不能支持这种循序渐进的部署方式,而不是要求企业一次性投入所有传感手段才能起步。
识别材料从来不是一锤定音的事
把视觉、光谱、化学分析拼在一起,本质上是承认一个事实:没有哪一种传感手段能单独覆盖材料识别需要回答的所有问题。这种多信号交叉验证的思路,同样也是判断一批材料里再生成分到底有多少时绕不开的方法论——单一传感器给出的"看起来是"和多种手段交叉确认后的"应该是",完全是两种可信度。循环材料大模型需要读懂的数据类型也远不止光谱这一种,未来能不能做出更高质量的再生材料,很大程度上取决于识别环节愿不愿意多花这一步功夫,把不同传感手段的结果诚实地拼在一起,而不是继续依赖一个摄像头给出的第一印象做决定。