过去十多年,企业的数据治理体系大多围绕结构化数据展开:数据库表、指标口径、主数据、数据质量规则。但企业真正庞大的数据量,来自合同、报告、邮件、工单、会议录音、监控视频和系统日志。业内常引用的经验比例是,非结构化数据约占企业数据总量的八成,其中被真正盘点、检索和复用的只是很小一部分。
非结构化数据为何长期沉睡
原因并不神秘。传统方式下,处理非结构化内容依赖人工阅读、关键词规则和目录管理:一份合同要有人逐条看,一段录音要有人听写,一段日志要工程师凭经验翻找。人力成本高、覆盖范围窄、结果难复用,于是多数企业只能做到先存下来,数据躺在对象存储里,既不知道有什么,也不知道放在哪,更谈不上分析。
大模型的成熟改变了成本结构。多模态解析可以完成版面理解、表格还原和语音转写;语言模型可以对文本做摘要、分类、打标和实体抽取;向量化技术则把内容映射为可计算的语义表示。原本需要数小时人工处理的文档,现在可以在秒级完成初步加工,治理的边际成本明显下降。
技术路径逐渐清晰
目前主流的落地链路大致分为几层:
- 解析层:OCR、语音转写、版面和表格还原,把多模态内容转为文本与结构信息;
- 加工层:分块、清洗、去重,由模型生成摘要、标签、主题与关键实体;
- 存储层:向量数据库保存语义索引,与传统数仓、对象存储形成互补;
- 应用层:检索增强生成、智能问答、相似内容聚类、异常归因等。
这套链路让非结构化数据第一次具备了可检索、可统计、可关联的属性。客服可以把海量工单自动归因到产品问题,法务可以从历史合同中批量抽取关键条款,研发可以在内部文档中直接提问并拿到带出处的答案。
成本、准确率与合规三道坎
落地并不轻松。首先是成本:全量解析与向量化的算力开销不小,向量索引的存储也会随数据量增长,企业需要按价值分层处理,而不是把所有数据一次性灌入。其次是准确率:模型输出存在幻觉和偏差,关键结论仍需人工复核,实践中通常保留抽样校验和反馈回路。第三是元数据:非结构化数据同样需要血缘、责任人和生命周期管理,否则只是换了一种方式堆积。
合规问题更需前置。非结构化内容往往密集包含个人信息、商业秘密和敏感业务数据,向量化不能成为权限打通的借口。检索结果必须继承原有权限体系,做到按人按需过滤,并保留完整审计日志。
先选场景,再谈规模
从实践看,较稳妥的做法是先选一两个高价值场景试点,例如合同审查、客服工单分析或研发知识检索,验证效果与成本后再逐步扩展。非结构化数据治理不是一次性的技术升级,而是数据治理覆盖面的延伸。当企业能把这部分数据纳入统一的盘点、权限和质量体系,数据的可用边界才算真正被打开。