"智“启未来,”能“韵新章
当前,全球新一轮科技革命和产业变革加速演进,人工智能、机器视觉、具身智能等技术成为大国博弈的战略制高点。习近平总书记深刻指出:“人工智能是引领这一轮科技革命和产业变革的战略性技术,具有溢出带动性很强的‘头雁’效应。”在2024年全国科技大会上,总书记进一步强调:“必须充分认识科技的战略先导地位和根本支撑作用,锚定2035年建成科技强国的战略目标,加快实现高水平科技自立自强。”2025年中央经济工作会议与“十五五”规划前期研究均将“加快发展新质生产力”作为核心任务,明确提出“推动科技创新和产业创新深度融合,积极培育新兴产业和未来产业”。
在此背景下,工业机器人作为智能制造的重要执行终端,其视觉感知能力直接决定产线柔性化与无人化水平。视觉软件不再只是辅助工具,而是工业机器人“眼睛”与“大脑”的连接器,是实现智能检测、精准装配、柔性生产的关键使能技术。本次实习正是在国家推进“人工智能+制造”行动、加快制造业数字化转型的政策窗口期展开,具有鲜明的时代意义。
今年暑假于7月27至8月28日,非常有幸能前往工业机器人研发高新技术企业武汉法博特机器人有限公司参与实践实习。由于是跨专业领域实践,所以这次实习的形式是以项目自导为主,公司负责人给我布置了一项预研发项目,项目大致主题是机器视觉的智能化检测。生产线上存在一类典型工序:将一个用于烘烤的料架中金属盖板与底板进行高精度对位装配。传统方式依赖人工目检并接触式定位,存在效率低、一致性差、易损伤工件等痛点。随着客户对节拍(≤2秒/件检测时长)和装配精度(±0.1mm)的要求提升,亟需引入基于工业相机的视觉引导与复合机器人识别装配方案。
由于是项目预研究,所以对我这个“外行人”的最终识别精度要求稍低了一些,最终我基于自研算法框架,实现盖板、销钉、底板的多目标识别与定位;开发了图像预处理、模型训练、边缘提取、几何拟合等核心算法模块;并最终进行项目打包,集成了可视化GUI软件,也实现了初步的检测方案要求。
由于工件底板参考定位点较少,边缘老化严重,噪声较大,且板面较暗,所以在视觉算法中放弃了全局canny检测的想法,由于要进行底板上4个销钉的定位,所以我采用了YOLOv8的视觉模型识别缩小目标ROI框后再进行局部的canny检测,最终达到了目标要求,在部分图片里实现了≤0.1mm精度的工业精度要求,识别准确率也达95%、召回率100%。在进行底板轮廓提取时进一步优化了ROI的选择,并加入了相机投影偏差的考虑,经过数万行合计9轮的代码的优化历程,最终实现了训练集标准图片(复杂环境和劣质数据集除外)
的93%提取。但是代码原理方面仍存在对特殊环境(销钉框和背景噪声线重合时)鲁棒性不足,目前也尚未有很好的解决办法。
针对盖板的识别,我在观察了多种规格的工件盖板之后,也放弃了canny或者霍夫直线直接拟合的办法。因为盖板针阵噪声影响很大,最后依旧选择对多图片的明显特征“螺母”进行YOLO识别,最后依旧进行ROI扩展和梯度特征提取,通过几何推理拟合之后,得出短边的部分轮廓和长边中线,实现对机械爪传入参数的要求,非常幸运的是,由于盖板螺母不存在较大的高度偏差,可以暂时忽略投影偏差,简化了代码块,但同时我提高了对聚类的控制,优化了视野中多目标的分别提取。
最后进行了代码的封装,对一些关键的PY库依赖如opencv、numpy、pytorch、sklearn、ultralytics(即yolo)等进行封装保存,并且自主搭建了用户友好型GUI界面,可以让用户简洁调参,实现端到端的全线落地。并且代码中写入了HTTP接口,方便上位机直接传输,满足现实中机器人的控制。但是当前软件对剧烈特定背景噪声干扰和轮廓老化侵蚀鲁棒性仍不足,后续需继续优化参数或背景布置与主动光源控制;标定流程依赖人工放置标定板,自动化程度有待提升。
本项目的落地直接回应了总书记关于“推动制造业高端化、智能化、绿色化发展”的指示。视觉软件替代人工目检,不仅完成了将单件检测节拍压缩至2秒的预期,还大大解放了人力限制捆绑,降本增效,提高了人力资源的高效利用。这正是“新质生产力”在微观产线上的具体体现——以数据驱动和智能算法重构传统生产要素,实现质量、效率、动力的三重变革。
从产业链安全角度看,工业视觉核心算法长期被国外厂商(如康耐视、基恩士)垄断。本次实习中使用的部分算法框架虽基于开源库二次开发,但针对特定工件优化的识别逻辑和标定方法具有自主知识产权,一定程度上响应了总书记“打好关键核心技术攻坚战”的要求。在“十五五”即将开启之际,这类面向实际产线的应用型研发,正是产学研用协同、科技与经济结合的生动实践。
此外,视觉引导装配减少了人工重复劳动,改善了工人劳动条件,符合“以人民为中心”的发展思想。机器人替代的并非简单人力,而是高风险、高强度的重复性操作,从而推动劳动者向设备运维、工艺优化等高技能岗位转型。
真正把这件事做成之后,我才真正体悟到干成一件事有多不容易。视觉识别看似只是让机器人“看见”盖板、销钉和底板,但研究得越深,越想把算法与现实产线还原得越真,要考虑的因素就越多:盖板表面的反光度、销钉边缘因干涉产生的灰度差异、底板油渍造成的灰度漂移、盖板边缘因长久磨损产生的凹槽、2D视觉相机产生的投影偏差和畸变……每一个被忽略的细节,都可能让识别率骤然下跌。为了让代码扛得住真实场景的考验,同事们下班后,我常常一个人留在工位,反复优化预处理流程、调整匹配阈值、重写ROI设定算法。三十三天,几万行代码,几十轮近乎推倒重来的优化,删了写、写了测、测了再改,有好几个深夜走出公司,脑子里还在回放白天失败的图像。说不疲惫是假的,但正是这种近乎偏执的打磨,让我真正理解了工匠精神的含义——它不是灵光一现的聪明,而是把一件看似普通的事做到极致,容忍不了一像素的偏差、一毫秒的延迟、一次无来由的误判;它也不是一句口号,而是深夜里屏幕上那一行行反复修改的代码,是失败几十次之后依然不死心的那口气。当最后测调成功,软件测试恶劣数据集时,屏幕上返回每一个红线贴合边缘的测试的日志时,那一刻,所有的疲惫都被一种巨大的舒心和成就感冲散了。那种舒心不是短暂的兴奋,而是一种从心底升起的踏实:我真的把它做成了,靠一行行代码、一次次调试、一个个深夜硬磕出来的。回望这段经历,我更确信,所谓科技自立自强,正是由这样一个个不起眼的深夜、一次次不甘心的较真,慢慢垒成的。
习近平总书记强调:“我们要顺应第四次工业革命发展趋势,共同把握数字化、网络化、智能化发展机遇。”本次实习虽仅33天,但让我亲历了工业机器人视觉技术从算法设计到产线模拟的全过程,更深刻理解了科技工作者在民族复兴进程中的使命。未来我将继续深耕智能化AI大模型与机器人控制交叉领域,努力成为“既懂算法又懂工艺”的复合型工程师,为实现高水平科技自立自强贡献青春力量。
当然,我也由衷感谢各位公司同事的支持和领导的悉心关怀,他们在我每次受挫的的时候都能给予我暖心的宽慰,在我每一版调试出色时都会给我一个“大拇指”表情包;也由衷感谢AIagent的全力支持,如果没有当今大模型的飞速发展,API接入agent的高效工作辅助,也没有结项的那一张GUI用户友好的软件答卷。所以生于今日之泱泱华夏,海晏河清,岁月承平,我倍感自豪,自当踔厉分发,韬光逐薮,不负盛世之葳蕤!
社会实践推荐