制造业数据与AI:连接产品价值链
DataHot 速览
文章指出制造缺陷往往跨越机器设置、供应商批次、物流事件和质量系统,相关数据被分割在工厂、职能和系统边界中。它回顾了50多年前Joseph Harrington提出的计算机集成制造(CIM)愿景,并认为现代数据与AI平台正让连接产品价值链变得可行。核心跨阶段问题包括:受影响产品涉及哪些供应商批次、缺陷是否曾出现及纠正措施是否有效、哪些客户或服务案例可能受影响。文章强调制造商需要的是带治理和业务上下文的跨系统信息流,而不是更多孤立报表。
为什么值得关注:制造数据跨系统集成与AI平台落地是典型行业场景,涉及数据接入、治理和业务上下文,能帮助数据从业者理解制造价值链的数据架构与决策问题。
本文目录 22 节
- 什么是制造业产品价值链?
- 为什么系统边界才是真正的问题
- Databricks如何连接制造数据
- 无需颠覆性迁移
- 这些示例所依赖的四项能力
- 提升数据素养——让数据对更多非专家也有用
- “与数据对话”在制造业中如何运作(以及为什么它需要受治理的语义)
- 示例:采购
- 示例:KPI 报告
- 一条切实的前进道路
- 常见问题解答(FAQ)
- 跨价值链连接制造数据的最大好处是什么?
- 制造商需要将所有源数据迁移到 Databricks 吗?
- 什么是可追溯性?
- 什么是 LTAP,为什么制造商需要它?
- 是什么让数据素养超越平台功能而成长?
- “与数据对话”如何变得可信?
- 什么是 Lakehouse Federation?
- 在制造数据的背景下,Unity Catalog 是什么?
- 该平台能否处理高吞吐量的机器和车辆遥测数据?
- 数据如何进入 Databricks?
- 该平台是否开放且支持多云?
译文
AI 逐段翻译制造缺陷很少只属于某一个系统。一次报废激增可能与机器设置、供应商批次、物流事件或质量系统中记录的重复性问题有关。然而,调查所需的数据通常分散在工厂、职能和系统的边界之间。
50多年前,Joseph Harrington博士提出的计算机集成制造(CIM)愿景认识到,制造依赖于跨职能的互联信息流。如今,随着数据和AI将产品价值链的各个阶段连接起来,这一愿景正在变得切实可行。
最棘手的制造问题都是跨阶段的问题:
- 哪个供应商批次到达了受影响的产品?
- 这个缺陷以前出现过吗?纠正措施是否有效?
- 哪些客户或服务案例可能受到影响?
回答其中任何一个问题,都需要连接那些从未被设计为相互通信的系统中的数据。制造商需要的不是更多孤立的报告。他们需要一条贯穿产品价值链的互联信息流,并具备使这些信息可用的治理和业务上下文。这正是现代数据与AI平台可以发挥的作用。
什么是制造业产品价值链?
产品价值链是将原材料和创意转化为交付给客户并在现场得到支持的产品的一系列端到端职能。它连接了研究与开发(R&D)和工程、采购、生产与质量、销售与营销,以及售后与现场服务。每个阶段都有自己的目标、团队和运营系统:
- 研究与开发(R&D)和工程部门使用产品生命周期管理(PLM)、计算机辅助设计(CAD)、计算机辅助工程(CAE)与仿真、测试数据、需求以及工程物料清单(BOM)。
- 采购部门使用企业资源规划(ERP)采购、从源到付款、合同、供应商风险和供应商门户。
- 生产与质量部门使用制造执行系统(MES)、监控与数据采集(SCADA)/可编程逻辑控制器(PLC)数据、过程历史数据库、质量管理系统(QMS)/实验室信息管理系统(LIMS)以及维护系统。
- 物流与供应链使用企业资源规划(ERP)、仓库管理系统(WMS)、运输管理系统(TMS)、计划系统、电子数据交换(EDI)和远程信息处理。
- 销售与营销使用客户关系管理(CRM)、配置-定价-报价(CPQ)、定价、经销商管理、营销自动化和电子商务。
- 售后与现场服务使用服务管理、保修、服务备件计划、互联产品数据、诊断和工单。

每个阶段都产生有价值的运营数据。更大的机会来自将链条中某一环节的发现与另一环节的行动连接起来:在生产中发现的质量问题通过物流和供应商记录进行调查,或者将供应商警报正向追踪到每一个接收了受影响物料的产品。
为什么系统边界才是真正的问题
当价值链的每个阶段都是孤立的时,一个跨阶段的问题就变成了一项由工单、导出和核对组成的人工项目。当数据作为一个受治理的系统可访问时,同一个问题就变成了一次查询。
示例1:一位工厂质量工程师需要回答三个问题:
- 报废激增是由批次、机器还是设置引起的,现在还在发生吗?
- 我们以前见过这个缺陷吗,修复措施是否有效?
- 为什么一家工厂的同一零件报废量远高于另一家?
每个问题都跨越多个系统:制造执行系统(MES)记录、过程历史数据库数据、供应商和供应商质量管理(SQM)数据、质量管理系统(QMS)历史、八项纪律(8D)记录,而且往往还涉及多个工厂实例。如今,回答每一个问题都意味着提交工单、手动导出数据并依赖少数专家。
示例2:一位采购分析师需要回答三个问题:
- 哪些关键零件依赖于某个现已被标记为交付风险的单一供应商?
- 某个供应商的准时交付和质量表现在近期订单中是否一直在下滑?
- 如果某个供应商失败,哪些产品、工厂和未结订单会受到影响?
每个问题都跨越多个系统:企业资源规划(ERP)采购和从源到付款记录、合同、供应商风险数据源和供应商门户。如今,回答每一个问题都可能变成一个小型项目,涉及工单、专家知识和手动导出。
将这些运营数据源汇聚在一起,就能消除这种摩擦。将价值链整合一次,治理一次,并使用共享标识符——序列号、批次号或零件号——作为连接键,可追溯性就变成了一次查询。六个问题,一个根本需求:连接那些从未被设计为相互连接的系统中的数据,并信任结果。四项平台能力使之成为可能。
Databricks如何连接制造数据
无需颠覆性迁移
互联的价值链不需要对每个源系统进行一次颠覆性迁移。在合适的情况下可以复制数据,也可以让数据留在原处并仍然可被查询。
通过零拷贝开放共享和Lakehouse Federation,组织可以访问源系统中的数据,而无需为每个用例创建另一个提取、转换和加载(ETL)管道或副本。当适合进行镜像时,连接器和云对象存储提供了将数据引入湖仓的可扩展路径。
The Databricks Data and AI Platform将这种灵活性同制造团队所需的能力结合在一起:跨生产、质量和供应数据的历史分析;面向机器和车辆遥测的低延迟处理;以及能够快速读取和写入单条记录的应用。
这些示例所依赖的四项能力
汇集或联合源数据,无需破坏性迁移:质量工程师的问题横跨 MES、过程历史数据库、供应商与 SQM、QMS 以及各工厂实例中的 8D 记录;采购分析师的问题则横跨 ERP 采购、合同和供应商风险数据源。借助零拷贝 Open Sharing 和 Lakehouse Federation,这些数据可以就地查询,并在复制是更优选择时通过连接器进行镜像。无论哪种方式,每个问题都不需要新的 ETL 复制。
编排与精炼:两个示例都针对受治理的黄金表进行连接,而不是原始提取数据。Lakeflow帮助团队构建、调度和监控管道,将原始输入转化为可信、可分析的数据,通常经过青铜层、白银层和黄金层。
面向数据与 AI 的治理:Unity Catalog是跨镜像数据和联合数据的单一控制平面:一个权限模型、完整的血缘,以及横跨数据、模型和 AI 代理的发现能力,因此同一个受治理界面可以回答两个示例。Unity Gateway使你能够跨代理、工具、模型和 MCP 控制 AI 访问、支出和可观测性。
代理式能力:构建在这个受治理的基础之上,Genie One是一个连接到你的数据的 AI 同事,Agent Bricks帮助构建以企业数据为基础的 AI 代理,而 Genie App Builder 让任何人都能用自然语言创建代理和应用。工程师和分析师可以用通俗语言提出问题,并获得基于业务所认可的定义的答案,这是接下来两节的主题。
实用的设计原则很简单:在能增加价值的地方汇集数据,在复制没有意义的地方联合数据,并通过同一个控制平面治理两者。其结果是一种跨制造数据类型和阶段工作的方式,而无需为每个分析或 AI 用例创建新的孤岛。
提升数据素养——让数据对更多非专家也有用
一个平台的价值取决于能够使用它的人。在许多制造组织中,一小群专家了解工厂特有的系统,而业务用户则等待报告或导出。
当人们能够沿着一条实用的进阶路径前进时,数据素养就会增长:找到相关数据、理解可信定义、分析数据、用自然语言提问、构建受治理的代理或应用,并与他人共享这些资产。不是每个人都需要成为数据工程师才能参与。这种成长遵循六个步骤,如下所示。

技术只是变革的一部分。培训、实践社区和倡导者网络帮助每个职能建立信心并分享可复用的模式。一个共同的、受治理的数据界面为这些社区提供了具体的工作基础:共享定义、共同词汇,以及可跨团队复用的答案。
“与数据对话”在制造业中如何运作(以及为什么它需要受治理的语义)
提升数据素养最快的方式是让人们与自己的数据对话:无需学习查询语言,无需提交工单,也无需等待报告。自然语言分析可以降低数据门槛,但对话界面还不够。答案必须基于业务所认可的定义。
示例:采购
诸如“哪些关键零件依赖某个现已被标记为交付风险的单一供应商?”这样的问题,可能需要了解 SAP 特定的表头、连接和业务规则。采购分析师不应该为了调查它而必须成为数据专家。
这个采购 Genie 演示让这一模式变得具体。这个可运行项目遵循三个步骤:准备受治理的数据、构建专家代理,然后在监督者下组合它们并作为一个受治理的应用共享。

这种模式将需要技术专长的工作——准备和治理数据——与业务用户应当能够自己完成的工作分开:提问、审阅答案并采取行动。
示例:KPI 报告
同样的模式也适用于日常报告。当 KPI 定义位于受治理的语义层中时,BI 工具和 AI 都基于相同的业务逻辑工作。Genie Agents 使用这些可信定义在职能范围内回答问题,Agent Bricks 将它们组合成跨职能工作的基于角色的代理。结果是:同一个问题每次都得到相同的答案,基于业务所认可的定义,而不是从复杂模式或不连贯的报告中推断出来。
梅赛德斯-奔驰韩国在实践中应用了这一模式,你可以在此了解更多。
一条切实的前进道路
50 多年前,Joseph Harrington 博士对计算机集成制造的愿景将制造描述为一个由信息流动统一起来的凝聚系统。这一愿景如今可以大规模实现。
实施配方有三个步骤:
- 一次性汇集数据并一次性治理它,以 Unity Catalog 作为单一控制平面,覆盖镜像和联合数据源。
- 让共享标识符成为连接键,如序列号、批次或零件号,这样价值链某一部分的发现就能驱动另一部分的行动,使端到端可追溯性成为一次查询。哪个标识符合适取决于领域:有些领域用序列化单元和 VIN,流程制造中则用批次号或批量号。
- 让人们与自己的数据对话通过将自然语言访问建立在受治理的业务语义之上。
当业务用户可以用通俗语言提问并获得可信答案时,数据素养就不再是少数专家的特权,而成为一项组织能力。其成果不是又一个仪表板,而是价值链上成千上万的人能够找到、理解可信数据并据此采取行动。
常见问题解答(FAQ)
跨价值链连接制造数据的最大好处是什么?
跨价值链连接制造数据的最大好处,是能够回答那些起始于一个环节、却需要在另一个环节采取行动的问题。一个生产缺陷可以经由物流追溯到造成它的供应商批次,或者一个可疑的供应商批次可以向前追溯到它所到达的每一件产品。没有互联的数据,这类调查每一项都需要数天的手工工作。有了互联的湖仓,同一个问题就变成了一次查询。
制造商需要将所有源数据迁移到 Databricks 吗?
制造商不需要将所有源数据迁移到 Databricks。在有需要时可以对数据进行复制,但零拷贝 Open Sharing 和 Lakehouse Federation 允许数据保留在源系统中并在原处进行查询。Unity Catalog 可以同时治理联邦数据和镜像数据。
什么是可追溯性?
可追溯性将制造工艺步骤、产品、材料和运营记录关联起来,使团队可以从受影响的产品向后追溯,或从可疑材料向前追溯。它支持更快地解决问题和更精确的召回分析。一个例子是追溯所生产产品的序列号或批次号。
什么是 LTAP,为什么制造商需要它?
LTAP 指湖仓事务/分析处理(Lake Transactional/Analytical Processing)。它描述的是在一个受治理的平台上运行分析型和事务型工作负载。制造业既需要对历史数据进行大规模分析,也需要能读写运营记录的响应式应用。过去,这两者存在于两套独立的技术栈中,数据在它们之间复制;LTAP 则在同一份受治理的数据上运行两者。
是什么让数据素养超越平台功能而成长?
仅靠功能还不够。培训、实践社区以及各职能中的倡导者,帮助人们建立信心、分享模式,并使用统一的受治理数据界面。平台提供基础;活跃的社区将其转化为广泛的能力。
“与数据对话”如何变得可信?
自然语言访问应当建立在受治理的业务语义之上:有文档记录的度量、维度、连接和定义。Genie 随后可以使用相同的可信上下文来回答问题,而不是从复杂的模式或不连贯的报表中推断含义。
什么是 Lakehouse Federation?
Lakehouse Federation 是 Databricks 的一项能力,它允许数据保留在其源系统中,同时仍可通过 Databricks 进行查询。它避免了创建额外的 ETL 管道或数据副本。源数据与任何镜像数据一起通过 Unity Catalog 进行治理,无论数据实际存放在哪里,都提供统一的治理层。
在制造数据的背景下,Unity Catalog 是什么?
Unity Catalog 是 Databricks 面向数据、模型和 AI 代理的统一治理层。它提供一套权限模型、完整的数据血缘以及覆盖整个数据版图的发现能力。对制造业而言,它意味着一个统一的控制平面,治理生产数据、质量记录、供应商数据和 AI 代理,无论这些数据存放在湖仓中,还是从源系统联邦而来。
该平台能否处理高吞吐量的机器和车辆遥测数据?
可以。该平台将批处理和流处理相结合。高吞吐量的机器和车辆遥测数据可以作为持续、极低延迟的流被摄取并可靠地处理,因此不会有事件在中途丢失。
数据如何进入 Databricks?
摄取被设计得很简单。Zerobus Ingest 支持基于推送的流式传输直接写入受治理的表,Lakeflow Connect 为业务系统提供托管连接器和变更数据捕获,而 Auto Loader 和 Structured Streaming 则处理文件和事件。
该平台是否开放且支持多云?
是的。Delta 表存储在云对象存储上,存储和计算独立扩展。Databricks 可在 AWS、Azure 和 Google Cloud 上运行,数据以 Delta Lake 和 Iceberg 等开放格式落地。
这篇内容对你有用吗?
反馈只用于改善内容筛选,不等同于收藏