AI落地最大瓶颈是数据工程?数智融合与开放架构给出解法

发布时间:2026/9/7 8:39:11
AI落地最大瓶颈是数据工程?数智融合与开放架构给出解法 几个月前我和一个做工业质检的朋友吃饭他整场饭局都在吐槽一件事模型训练其实只花了两周但前面的数据整理用了整整三个月上线前一天才发现标注数据的类别分布和线上实际分布差太远整个项目延期重来。这个场景我在很多企业里都见过AI规模化落地这件事真正的卡点早就不是算法了而是复杂、分散、质量不可控的数据。这两年我接触了大量做AI平台建设、数据中台改造的团队大家有个共同的焦虑模型可以换、框架可以换但数据底座一旦建错后面所有智能化应用都要跟着返工。市面上关于“AI怎么落地”的文章大多是讲模型怎么调、Prompt怎么写但很少人系统讲清楚一个更本质的问题——数据平台到底应该长成什么样才能扛住AI规模化落地的压力。这就要说到“数智融合”和“开放架构”这两个词了。华为AI数据平台这两年一直在推这套理念核心目标就是解决数据工程和模型工程割裂的问题。我结合自己在企业数据平台建设中的实际经历把这条技术路线拆开聊聊里面有不少是实际操作中才会踩到的坑。1. AI规模化落地卡在哪数据工程成本远超模型训练1.1 算法不是瓶颈“数据准备度”才是大多数企业对AI的理解还停留在“找个厉害的算法工程师跑通一个模型”的阶段。可真到了项目里你会发现算法工程师能发挥的空间其实很有限。训练一个模型可能需要几天但准备让它有效训练的数据通常要按周甚至按月来算。我参与过好几个预测类项目复盘时拉出时间流水数据的收集、清洗、标注、特征构建普遍占掉整个项目70%以上的时间。这不是某个团队的个案而是整个行业的实际情况。我曾经在一份行业报告里看到类似的结论虽然具体百分比记不清了但“数据准备是AI项目中最耗时、最不可控的环节”这个判断我是完全认同的。为什么不可控因为数据工作不像写代码那样有确定性。你永远不知道下一批数据里有多少空值、多少脏数据、多少字段含义和业务方理解不一致。模型训练是收敛的但数据清洗的边界是模糊的。1.2 传统数据系统与AI数据需求的错位很多企业不是没有数据平台而是现有的数据平台根本服务不了AI场景。传统数据仓库是为报表和分析设计的数据模型高度结构化处理的是订单、交易、客户这类规整的表格数据。可AI模型需要的是什么是文本、图片、音视频这些非结构化数据是埋点日志、物联网时序数据是训练集和验证集需要留出样本是模型上线后还要回流新的标注数据。为了补这个缺口不少企业上了数据湖把各种格式的数据一股脑扔进去。但数据湖解决的是“能存”的问题没有解决“能用”的问题。没有元数据管理、没有数据血缘、没有质量规则的数据湖最后往往变成数据沼泽——数据全堆在里面但谁也说不清楚哪份数据是可信的、哪个表是最新的、哪条数据是从哪来的。我见过不少企业湖里几千张表真正敢用来训练模型的不超过几十张。1.3 一条数据管线的真实拆解拿一个工业预测性维护场景举个例子。设备传感器每秒钟会产生一组时序数据另外还有工单记录、维修日志、零件更换记录这些业务数据。做模型之前你至少要做这几件事建立统一的数据接入通道把不同频率、不同格式的数据对齐到同一个时间轴上清洗异常值比如传感器失灵产生的满值和零值不能直接喂给模型关联业务上下文字段比如设备型号、工况这些信息单独看没什么用但组合起来对预测准确率影响很大构造时序特征比如滑动窗口的均值、变化率、周期波动划分训练集和验证集而且要按时间划分不能随机抽否则会数据泄漏这一套走下来建模本身反而成了最简单的部分。这个场景里我见过的最常见错误是业务系统里的设备编码在不同年份发生过变更导致早期数据和近期数据无法关联结果模型训练时以为有两台设备实际上是一台。这种数据问题模型再先进也解决不了。2. 数智融合的核心逻辑数据管线和模型管线的一体化2.1 数据团队和算法团队各干各的代价是什么传统做法里数据团队和算法团队是脱节的。数据团队负责把数仓建设好按业务需求跑出报表算法团队需要数据时自己写SQL从数仓或数据湖里导出来再在本地做一套数据处理。问题马上来了数据团队维护的指标口径和算法团队理解的不一定一致同一个“用户活跃度”两边算出来可能差几个百分点数据导出来之后脱离了原平台的治理体系出现脏数据没人知道模型要上线时发现线上特征计算逻辑和训练时不一致。这种“两张皮”的状态让AI项目跑起来非常累。我见过一个金融风控团队每次模型迭代都要重新向数据团队提需求、等数据、再自己清洗一遍一个版本的周期从两周拖到两个月最后干脆放弃迭代模型一用就是半年风险敞口越来越大。2.2 数智融合到底融合了什么“数智融合”这个词听起来有点玄但落到实际平台设计上核心就是打通三条线第一条是元数据的打通。从原始数据到清洗后的表再到特征、模型训练集、推理结果全程都有统一的元数据和血缘关系。这样当上游数据质量出问题时很快能定位到会影响哪些模型某个输入字段变更时也能知道要同步调整哪些特征工程代码。第二条是特征平台的统一。很多AI应用是共享底层数据的比如同一个用户的消费行为特征既可以用于推荐、也可以用于风控、也可以用于流失预警。以前每个团队各自建特征同一份数据算了三遍。统一特征平台之后特征构建一次、发布出来、多方复用。这个收益在业务线多的企业里非常明显。第三条是数据和模型的协同调度。训练数据有问题时训练流程能自动感知并阻断而不是模型默默学习了一个有偏的数据集数据版本和模型版本绑定实验可以复现。这些都是传统数据平台给不了的。2.3 数智融合带来的实际变化最直观的变化是模型迭代速度。我们有一个内部实践把核心用户画像特征统一建设之后新业务模型的特征工程时间从三周压缩到三天。之前每个模型都要重新做一遍数据探索和特征拼接现在直接从特征市场里取现成的。另一个变化是可追溯性。以前模型效果异常第一个反应是“模型是不是该调了”排查半天发现是上游数据出问题。而数据与模型血缘打通后数据质量一旦波动平台直接告警到模型运维侧问题定位时间从小时级降到分钟级。对生产环境要求高的业务这个能力几乎是刚需。3. 开放架构为什么重要别让AI平台走回封闭老路3.1 平台应该是“服务模型的底座”而不是“绑定模型的选择”很多企业选型AI平台时有个误区看平台官方演示了什么模型效果就觉得这个平台本身很厉害。但模型迭代这么快今天的热门模型明天可能就被替代。如果一个数据平台把存储、数据接口、调度能力都和某一种模型深度绑定那等你想换模型时代价会非常大。过去十年我们见过太多封闭生态的案例。某些平台为了形成壁垒只支持自家的算法框架和部署方式企业一旦深度使用后续任何技术选型都要被它牵着走。AI领域现在变化这么快这种风险比传统软件时代更致命。开放架构的第一原则就是平台不关心你的模型是谁家的。无论是开源大模型、商用模型还是企业自研的行业小模型数据平台都只负责提供干净的数据、编排训练任务、统一部署服务。模型从哪来是模型层的事平台不过问。3.2 开放架构的四个关键边界根据我自己的平台建设和使用经验一个真正开放的AI数据平台至少要在这四个层面保持开放数据接入层要开放。平台应该能对接各种数据源不管是传统关系型数据库、消息队列、文件服务器还是新型的数据湖对象存储。企业现有的数据资产不应该因为上一个平台而废弃。训练框架层要开放。PyTorch、TensorFlow这些主流框架以及各种深度学习工具链都应该能直接在平台上跑而不是被限定在某一种自研框架里。我们团队内部用的框架就很杂不同背景的工程师各有所爱平台如果只支持一种光内部迁移就要折腾很久。算力层要开放。不同企业手里的硬件资源差异很大有的有专门的AI加速卡有的是通用服务器有的则把算力放在云上。平台通过统一算力抽象层来调度不同硬件让上层应用不感知底层资源变化。这样即便硬件升级换代数据平台也不受影响。模型服务层要开放。模型的推理部署应该支持标准的服务化接口同时允许用户自定义镜像和环境依赖。企业里有不少老模型可能是几个研究员用特殊环境训练的如果平台要求必须重新适配一套规范才能部署这类模型基本就废弃了。3.3 开放架构对企业实际意味着什么从企业视角看开放架构最直接的价值是“不被锁死”。AI技术还在快速演进今天的架构选择要能兼容明天的技术变化。选了一个封闭平台短时间内可能交付快但三年后想拓展能力时会发现所有重新选型的成本都要自己承担。另一个价值是生态兼容性。数据平台不是一个独立工具它要接入数据管道、BI工具、调度系统、运维平台。只有开放接口和数据访问协议才能把平台嵌进企业已有的技术体系里而不是逼着企业围绕平台重做一遍所有系统。说到底数智融合这件事本身就很依赖开放架构。如果平台只支持一种模型、一种数据格式那“融合”的范围就太窄了。真正的融合应该是企业自有的所有数据资产和所有智能服务之间的无缝连接而不是在某个特定厂商设定的小圈子里的伪融合。4. 华为AI数据平台落地路径从连接数据到交付智能4.1 平台的定位不是一个数据库也不是一个模型训练工具华为AI数据平台这套架构如果只用一句话定义我会说它是一个“从数据连接到智能交付的全栈底座”。它既管数据也管模型但它管的不是“单点能力”而是数据工程师和算法工程师协作的完整链路。具体拆开看平台包含几个比较核心的能力模块模块职责解决什么问题数据集成多源异构数据接入、实时与批量同步数据散落在不同系统、格式不统一湖仓存储结构化与非结构化数据统一存储数据湖和数据仓库分离、重复搬运数据治理质量规则、血缘、元数据、权限数据不可信、找不到、不敢用特征工程特征构建、上线、复用、监控每个团队重复建特征、口径不一致模型开发训练交互式开发、分布式训练、实验管理训练环境不统一、算力利用率低推理部署在线服务、批量推理、模型版本管理模型上线周期长、运维复杂这几层串起来本质上是在替企业把数据和AI之间的“路”修好。数据进来之后经过治理变成资产资产向下支持特征建设特征向上支撑模型开发模型上线后产生的反馈数据又可以回流到数据资产中形成一个闭环。4.2 从0到1搭建一条规模化AI流水线我在给一个制造企业做咨询时按这个平台思路设计过一条完整流水线。他们当时的问题是产线上有几百台设备想上预测性维护但数据散落在SCADA系统、MES系统、手工Excel表里没有一版完整的数据可以训练。我们按四个阶段推进每个阶段的动作和产出物很清晰第一阶段是数据接入和盘点。花了两周时间把所有设备数据、维修记录、点检记录摸了一遍梳理出哪些数据可用、哪些数据质量太差、哪些字段需要业务方确认含义。产出是一份数据资产目录。第二阶段是数据治理和资产化。定义数据质量规则比如传感器数值范围、时间戳完整性、设备编码合法性。对不合格数据先拦截、再补数。这个阶段看似最枯燥但它决定了后面所有工作的上限。第三阶段是特征构建和模型开发。基于治理后的数据建设特征平台把设备运行状态特征、维保历史特征统一构建好模型团队直接取用。因为特征已经就绪模型训练反而很快不到两周就出了一版可用的故障预测模型。第四阶段是部署和回流。模型部署到产线监测环境每天接收新数据实时评分。预测结果回传给维修调度系统同时维修结果作为新的标注数据回流持续优化模型。整条流水线跑通大概用了两个月其中模型训练只占两周。如果按传统模式每个阶段各自独立交付中间光扯皮就得额外消耗一倍时间。4.3 自建“数据中台AI中台”和用成熟平台的差距在哪很多大企业有自建情结觉得“业务太特殊商用平台满足不了”于是选择自己搭一套。我理解这种想法也承认自研在极端定制化场景下的优势但从成本和风险来看自研中台的隐性成本往往被严重低估。自研一套数据平台表面上你只需要几个数据工程师和算法工程师可实际上还需要运维、数仓建模、后端开发、安全合规一整套班子。而且数据平台这类基础设施功能是慢慢长出来的不像业务系统那样有明确的完工日期。我们见过不少自研项目半年后停留在“数据能导入了”的初级阶段业务方早就失去耐心了。成熟平台的优势是“开箱即用”的能力覆盖面和长期可维护性。像华为AI数据平台这类产品背后是整个生态在持续迭代各种主数据连接器、数据治理模板、模型评估工具都是现成的。企业把精力聚焦在业务场景上而不是重复研发基础能力。当然商业平台不是买完就高枕无忧。我见过有团队采购了平台之后没有结合业务重构数据模型直接把旧数仓的逻辑平移过来效果自然不好。平台只是引擎怎么用好是你的事。5. 团队落地AI数据平台的踩坑与实操经验5.1 踩坑实录一次数据回溯引发的模型效果雪崩这是一个真实教训。我们有一个推荐场景的模型上线后效果一直不错某天核心指标突然掉了15%。大家第一反应是算法出了问题业务策略调整了或者是网上流量异常。查了一圈最后定位到是特征平台里有一张基础用户特征表触发了数据回溯——上游修复了一批历史数据平台按计划重刷了全量特征。结果就是线上推理用的特征分布瞬间变了而在线模型没有感知到这种变更效果自然崩了。这个事故之后我们立了几条规矩特征表必须有版本概念重刷时不能覆盖线上使用中的版本数据回刷要纳入变更管理流程不能由数据任务自己触发了事特征上线后要有分布的监控告警分布变化超过阈值就要通知模型方这些能力其实都需要数据平台从底层支持数据版本和血缘追踪。没有数智融合的架构数据被人改了你都未必知道。5.2 被低估的组织协同问题技术平台只是一个必要条件组织协同往往是落地成败的关键。数据团队考核的是数据准确性算法团队考核的是模型效果指标业务团队考核的是收入增长。目标不一致平台用得就拧巴。推荐一个比较有效的做法围绕业务目标组建混编团队。比如做智能营销业务运营、数据工程师、算法工程师固定在一个组里共用一套KPI。数据工程师能第一时间听到业务诉求算法工程师也能在数据建模阶段就参与避免交付出来的数据集根本训练不出有效模型。平台上线后我特别建议设一个“数据质量运营”的岗位。很多平台失败不是技术不好而是没人持续为数据负责。指标报警、字段口径变更、数据字典维护这些工作琐碎但极其重要。没有专门的人盯半年之后平台上的数据又会变回一锅粥。5.3 给正在选型或建设AI数据平台的团队几条建议第一先做数据资产盘点再选平台。很多团队选型时直接看性能指标却连自己手上有哪些数据、数据质量如何都没理清。最稳妥的做法是花两周做一次数据梳理盘点出高频使用的核心表、孤岛数据、无主数据这样选型才能有的放矢。第二从一个小场景跑通闭环不要上来就搞企业级大规划。选一个业务价值清晰、数据相对齐备的场景把数据接入、治理、特征、模型、部署这整条链路原原本本跑一遍。这个过程会暴露平台和组织的各种短板这时候解决问题比铺开搞平台时再解决要高效得多。第三开放架构要刻进技术团队的DNA里。平台选型时坚持开放接口和数据服务化后续任何一次技术演进都要回顾一遍这会不会引入新的锁定我见过一个团队为了图方便把一些核心数据直接放进某个厂商的专有格式里等想迁移时发现导出工具都没有非常痛苦。第四产品上线只是开始数据运营是无限游戏。AI平台的价值是随着数据资产的持续积累才不断放大的。一个跑了一年的平台和上线当天的平台价值完全不同。关键是数据能不能持续沉淀、质量能不能持续提升、特征能不能持续复用。我自己在给团队做平台建设时最深的体会是不要神话任何一套平台也不要轻视平台底座的作用。AI规模化落地说到底拼的是把数据变成资产、把资产变成模型的能力。数智融合和开放架构的意义在于让这条路更短、更稳、更可控。至于模型本身永远只是这场长跑中的一段冲刺。