过去十年,企业解决数据分散问题的主要手段是“把数据搬到一个地方”:先建数据仓库,再建数据湖,然后不断做ETL。但随着系统数量持续增长,这条路径的成本和延迟越来越难以承受。多家机构的调研显示,大型企业平均运行数百个应用系统,一个数据集成项目的周期常常以季度计算。在此背景下,数据编织(Data Fabric)被反复提及,成为数据架构领域的新热词。
不是搬运数据,而是连接数据
数据编织的核心思路,是不再把数据集中到单一平台,而是通过统一的逻辑层,把分散在不同系统中的数据“编织”成一张可按需调用的网络。用户提出需求时,系统自动定位数据位置、完成连接与转换,并返回结果。
支撑这一过程的关键是主动元数据。与传统静态元数据不同,主动元数据会持续采集数据的结构、血缘、使用频率、质量评分乃至访问权限,形成动态更新的数据地图。在此基础上,知识图谱把表、字段、报表、业务指标和责任人关联起来,让系统能够推断哪些数据可以一起使用、哪些指标口径已经冲突。
与人工智能互为支撑
数据编织与大模型的结合正在加速。一方面,大模型可以帮助生成和补全元数据描述,把非结构化的文档、注释、代码转成可检索的标签;另一方面,自然语言问答让业务人员不必写SQL,就能在编织层上取数。反过来,数据编织提供的可信数据视图,也为企业级人工智能应用提供了稳定的数据供给。
- 元数据自动化:减少人工登记,降低维护负担;
- 按需集成:缩短从需求提出到数据可用的时间;
- 统一治理:权限、质量、血缘在同一层管理。
落地仍有难点
数据编织并非没有门槛。首先是元数据质量,若采集不全、口径不一,自动推理就会失真,甚至给出错误结论。其次是组织协作,数据域负责人需要承担本域数据的定义与质量责任,这与传统集中式数据团队模式有明显差异。第三是成本与复杂度,编织层本身的建设与运维需要持续投入,短期内难以看到直接收益。此外,数据跨域调用涉及的合规与安全要求,也需要在架构设计阶段一并考虑。
从实践看,较为务实的做法是先从一两个高价值场景切入,例如客户全景视图或供应链风险监测,围绕这些场景逐步补齐元数据与治理规则,再向更多数据域扩展。数据编织不是一个可以一次性采购的产品,而更像一套需要持续演进的能力。
可以预见,随着数据要素价值被进一步重视,企业比拼的不再是谁的数据更多,而是谁能更快找到、理解并可信地使用数据。数据编织提供的正是这样一种思路:不追求把所有数据装进一个盒子,而是让数据在原有位置上被看见、被信任、被调用。