**AI在工厂里“拧螺丝”,但还没学会写请假条** 上周五,我在苏州一家做汽车零部件的厂子里蹲了大半天。 不是去参观,是陪朋友做交付验收——他们给这家企业上线了一套基于Qwen2.5-72B微调的质检系统。产线上,三台红外+可见光双模相机正对着传送带,每秒抓拍12帧,模型实时判断刹车卡钳表面有没有0.3mm以上的划痕。现场工程师指着屏幕说:“去年人工复检率37%,现在压到8.2%。上个月漏检导致的客户投诉,零。” 我顺手翻了眼他们内部系统后台:自2024年9月上线以来,模型日均处理图像217万张,误报率从初期的14.6%降到现在的2.9%(数据来自该企业2025年Q1数字化年报,第17页)。 这事儿听着挺硬核,但更让我记住的,是下午茶歇时车间主任随口说的一句:“AI能盯住划痕,可我们生产计划表改三次,它还卡在第一次的版本里。” ——你看,最狠的AI落地,往往不在PPT里,而在流水线的震动、排班表的涂改、老师傅皱着的眉头里。 --- 2026年快过半了,AI大模型在企业端确实不讲虚的了。 但和2023年那会儿“全员接入ChatGPT”的热闹不同,现在的企业,尤其是制造业、能源、金融这些“重资产+强流程”行业,早过了“要不要用”的阶段,直接干到“怎么嵌进KPI里”的程度。 工信部《2025年人工智能产业应用白皮书》里有个冷数据:截至2025年底,全国规上工业企业中,已将大模型深度集成进核心业务系统的比例为**19.3%**,其中超七成集中在质检、设备预测性维护、供应链异常识别三个场景(P32,表4-1)。注意,是“深度集成”——不是员工自己偷偷调个API,而是和MES、ERP、SCADA系统打通,动作能触发工单、自动停机、生成维修建议。 比如国家电网江苏公司,2025年3月上线的“巡检语义理解引擎”,把无人机拍回来的28类绝缘子缺陷图像+巡检员语音口述(“这里有点发白,不像上次”)一起喂给模型。它不再只回答“是否异常”,而是输出结构化结论:“A相绝缘子串第4片伞裙存在电晕腐蚀迹象,建议72小时内安排红外复测,并同步比对2024年11月同角度影像”。这个系统上线半年后,一线班组平均故障定位时间缩短了**41%**(来源:《中国电力企业管理》2026年4月刊,第55页)。 再比如中信证券2025年Q4财报里明确披露:其投行尽调辅助系统已覆盖全部IPO项目,模型自动提取招股书中的关联交易、资金拆借、股权代持线索,初筛准确率达82.7%(对比人工初筛平均耗时4.3人日/项目,现压缩至0.9人日),但——关键在这里——所有风险点必须由保荐代表人二次确认并手写批注,系统不允许直接生成签字页。 看见没?真实落地,从来不是“替代”,而是“锚定”:锚定人的经验边界,锚定制度红线,锚定责任归属。 --- 可问题也扎堆冒出来。 最典型的是“幻觉合规化”。 去年底,某头部乳企在用通义千问微调做配方合规审查时发现:模型能把《GB 10765-2021》里“DHA添加量不得高于总脂肪酸的0.5%”准确转译成计算逻辑,却把“婴幼儿配方乳粉”错误泛化为“所有含乳基产品”,导致给儿童奶酪做的配料表提示“涉嫌违规”,实际该标准根本不适用。 这不是模型错了,是训练数据里混进了大量未打标场景的监管问答,模型学会了“看起来像法规就严肃对待”,但没学会“谁管谁”。 这个案例被收录在信通院《2025年大模型行业落地风险清单》第2.4条,原文写:“当领域知识与法律适用边界交叉时,微调未必能消除语义漂移,反而可能因过度拟合局部特征,放大误判权重。” 另一个更难缠的,叫“组织级沉默”。 深圳一家做精密模具的厂子,2024年花了270万上线大模型驱动的工艺参数推荐系统。结果半年后调研发现:83%的技术员用它查热处理温度曲线,但**没人敢按它推荐的‘最优解’直接设参数**。为什么?因为过去二十年,老师傅凭声音听淬火油温、看氧化色判回火程度的经验,已经沉淀为车间默认SOP。模型给出的方案哪怕数据漂亮,只要和老经验差0.5秒节拍,一线就集体“装死”。 后来他们怎么破的?不是换模型,是让模型学着写“解释链”:不仅给参数,还要附三句话——“此推荐基于近3年同材质模具在XX设备上的127组成功案例”“与王工2023年处理089号订单时的设定偏差±1.2℃”“若首件检测硬度超差,建议优先回调回火时间而非温度”。 你看,技术落地的终点,常常不是精度,而是**可信度翻译**。 --- 还有些事,连报告都不好写。 比如某省属港口集团2025年试点的“智能调度大模型”,目标是优化集装箱堆场翻箱率。模型跑出来的方案理论上能降本11%,但实际推演时发现:它把龙门吊司机轮休、饭点交接、雨天限速这些“非结构化约束”全当噪声过滤了。最后项目组不得不倒回去,用规则引擎把27条人工排班潜规则一条条写死,再让模型在“规则牢笼”里找最优解。 再比如银行风控场景。多家城商行反馈,模型对“小微企业主征信空白但纳税稳定”的客群识别率高达91%,可一旦涉及“个体户用配偶账户走流水”这类灰色操作,准确率断崖式跌到53%——因为训练数据里,这类样本被统一打标为“高风险”,模型学的是“规避”,而不是“理解动机”。 说白了,今天的大模型,在**有明确定义、有历史数据、有闭环反馈**的环节,已经能扛活;但在**靠默契、靠权衡、靠灰色地带生存**的地方,它还是个交学费的实习生。 --- 所以别再问“AI什么时候取代人类”了。 真正的问题可能是: 你的企业,有没有把一个老师傅三十年没写下来的经验,变成能喂给模型的“结构化语义”? 你的ERP里,那些被标注为“其他费用”的17类杂项支出,能不能被模型识别出其实是同一类隐性成本? 你开会时大家心照不宣的“先走流程再补材料”,是不是已经悄悄成了模型推理的最大盲区? 这些问题,没有API能直接答。得有人坐在产线旁记三天笔记,得法务和算法工程师一起啃三个月监管文件,得让风控主管把“我觉得有问题”的100个案例逐条录音转文字——然后,才轮到模型上场。 2026年的AI落地现场,最稀缺的不是算力,是那种愿意蹲下来、把模型当学徒使的耐心。 就像苏州那家厂子的老师傅,现在每天早上第一件事,是打开系统看模型昨天标出的“疑似划痕”,然后拿放大镜挨个复核。他不喊“AI真神”,也不说“都是瞎猜”,就指着其中一处说:“这儿不是划痕,是喷漆时气压不稳留的流挂——你让它下次学学气压表读数波动和表面纹理的关系。” ——这话,比任何benchmark都准。 以上信息综合自公开报道和网络讨论,仅代表个人看法。