AI在工厂里“拧螺丝”,但还没学会写请假条
上周五,我在苏州一家做汽车零部件的厂子里蹲了大半天。
不是去参观,是陪朋友做交付验收——他们给这家企业上线了一套基于Qwen2.5-72B微调的质检系统。产线上,三台红外+可见光双模相机正对着传送带,每秒抓拍12帧,模型实时判断刹车卡钳表面有没有0.3mm以上的划痕。现场工程师指着屏幕说:“去年人工复检率37%,现在压到8.2%。上个月漏检导致的客户投诉,零。”
我顺手翻了眼他们内部系统后台:自2024年9月上线以来,模型日均处理图像217万张,误报率从初期的14.6%降到现在的2.9%(数据来自该企业2025年Q1数字化年报,第17页)。
这事儿听着挺硬核,但更让我记住的,是下午茶歇时车间主任随口说的一句:“AI能盯住划痕,可我们生产计划表改三次,它还卡在第一次的版本里。”
——你看,最狠的AI落地,往往不在PPT里,而在流水线的震动、排班表的涂改、老师傅皱着的眉头里。
---
2026年快过半了,AI大模型在企业端确实不讲虚的了。
但和2023年那会儿“全员接入ChatGPT”的热闹不同,现在的企业,尤其是制造业、能源、金融这些“重资产+强流程”行业,早过了“要不要用”的阶段,直接干到“怎么嵌进KPI里”的程度。
工信部《2025年人工智能产业应用白皮书》里有个冷数据:截至2025年底,全国规上工业企业中,已将大模型深度集成进核心业务系统的比例为19.3%,其中超七成集中在质检、设备预测性维护、供应链异常识别三个场景(P32,表4-1)。注意,是“深度集成”——不是员工自己偷偷调个API,而是和MES、ERP、SCADA系统打通,动作能触发工单、自动停机、生成维修建议。
比如国家电网江苏公司,2025年3月上线的“巡检语义理解引擎”,把无人机拍回来的28类绝缘子缺陷图像+巡检员语音口述(“这里有点发白,不像上次”)一起喂给模型。它不再只回答“是否异常”,而是输出结构化结论:“A相绝缘子串第4片伞裙存在电晕腐蚀迹象,建议72小时内安排红外复测,并同步比对2024年11月同角度影像”。这个系统上线半年后,一线班组平均故障定位时间缩短了41%(来源:《中国电力企业管理》2026年4月刊,第55页)。
再比如中信证券2025年Q4财报里明确披露:其投行尽调辅助系统已覆盖全部IPO项目,模型自动提取招股书中的关联交易、资金拆借、股权代持线索,初筛准确率达82.7%(对比人工初筛平均耗时4.3人日/项目,现压缩至0.9人日),但——关键在这里——所有风险点必须由保荐代表人二次确认并手写批注,系统不允许直接生成签字页。
看见没?真实落地,从来不是“替代”,而是“锚定”:锚定人的经验边界,锚定制度红线,锚定责任归属。
---
可问题也扎堆冒出来。
最典型的是“幻觉合规化”。
去年底,某头部乳企在用通义千问微调做配方合规审查时发现:模型能把《GB 10765-2021》里“DHA添加量不得高于总脂肪酸的0.5%”准确转译成计算逻辑,却把“婴幼儿配方乳粉”错误泛化为“所有含乳基产品”,导致给儿童奶酪做的配料表提示“涉嫌违规”,实际该标准根本不适用。
这不是模型错了,是训练数据里混进了大量未打标场景的监管问答,模型学会了“看起来像法规就严肃对待”,但没学会“谁管谁”。
这个案例被收录在信通院《2025年大模型行业落地风险清单》第2.4条,原文写:“当领域知识与法律适用边界交叉时,微调未必能消除语义漂移,反而可能因过度拟合局部特征,放大误判权重。”
另一个更难缠的,叫“组织级沉默”。
深圳一家做精密模具的厂子,2024年花了270万上线大模型驱动的工艺参数推荐系统。结果半年后调研发现:83%的技术员用它查热处理温度曲线,但没人敢按它推荐的‘最优解’直接设参数。为什么?因为过去二十年,老师傅凭声音听淬火油温、看氧化色判回火程度的经验,已经沉淀为车间默认SOP。模型给出的方案哪怕数据漂亮,只要和老经验差0.5秒节拍,一线就集体“装死”。
后来他们怎么破的?不是换模型,是让模型学着写“解释链”:不仅给参数,还要附三句话——“此推荐基于近3年同材质模具在XX设备上的127组成功案例”“与王工2023年处理089号订单时的设定偏差±1.2℃”“若首件检测硬度超差,建议优先回调回火时间而非温度”。
你看,技术落地的终点,常常不是精度,而是可信度翻译。
---
还有些事,连报告都不好写。
比如某省属港口集团2025年试点的“智能调度大模型”,目标是优化集装箱堆场翻箱率。模型跑出来的方案理论上能降本11%,但实际推演时发现:它把龙门吊司机轮休、饭点交接、雨天限速这些“非结构化约束”全当噪声过滤了。最后项目组不得不倒回去,用规则引擎把27条人工排班潜规则一条条写死,再让模型在“规则牢笼”里找最优解。
再比如银行风控场景。多家城商行反馈,模型对“小微企业主征信空白但纳税稳定”的客群识别率高达91%,可一旦涉及“个体户用配偶账户走流水”这类灰色操作,准确率断崖式跌到53%——因为训练数据里,这类样本被统一打标为“高风险”,模型学的是“规避”,而不是“理解动机”。
说白了,今天的大模型,在有明确定义、有历史数据、有闭环反馈的环节,已经能扛活;但在靠默契、靠权衡、靠灰色地带生存的地方,它还是个交学费的实习生。
---
所以别再问“AI什么时候取代人类”了。
真正的问题可能是:
你的企业,有没有把一个老师傅三十年没写下来的经验,变成能喂给模型的“结构化语义”?
你的ERP里,那些被标注为“其他费用”的17类杂项支出,能不能被模型识别出其实是同一类隐性成本?
你开会时大家心照不宣的“先走流程再补材料”,是不是已经悄悄成了模型推理的最大盲区?
这些问题,没有API能直接答。得有人坐在产线旁记三天笔记,得法务和算法工程师一起啃三个月监管文件,得让风控主管把“我觉得有问题”的100个案例逐条录音转文字——然后,才轮到模型上场。
2026年的AI落地现场,最稀缺的不是算力,是那种愿意蹲下来、把模型当学徒使的耐心。
就像苏州那家厂子的老师傅,现在每天早上第一件事,是打开系统看模型昨天标出的“疑似划痕”,然后拿放大镜挨个复核。他不喊“AI真神”,也不说“都是瞎猜”,就指着其中一处说:“这儿不是划痕,是喷漆时气压不稳留的流挂——你让它下次学学气压表读数波动和表面纹理的关系。”
——这话,比任何benchmark都准。
以上信息综合自公开报道和网络讨论,仅代表个人看法。
本文基于公开行业信息和个人观察整理,仅供参考