Tags数据治理 AI 大模型 数据质量 主数据 元数据 数据中台 NL2SQL 数据资产 数据驱动
我的判断是,AI越强,数据治理越值钱。
目录
1 开头 2 先看AI现在能干什么 3 AI解决不了的三类数据问题 4 AI和治理,其实是互相成就 5 我的判断,治理更重要了 6 写在最后
1 开头
今年开始,我被问得最多的问题变了。
以前是「数据治理怎么落地」,现在是「都有AI了,还搞什么数据治理」。问的人里有业务方,有数据同行,也有甲方高管。有位甲方老板更直接,说乙方给他演示过,大模型一接上,字段含义自动识别、数据质量自动检查、重复数据自动合并,一套AI全搞定,那我们花几百万建的数据治理体系是不是白建了。
我当时回了他一句话,治理不是被AI替代了,是被AI放大了。
先说结论,AI来了,数据治理不是不重要了,是更重要了。
2 先看AI现在能干什么
不吹不黑,现在的AI在数据领域确实能干不少活。
第一,自然语言查数。你问「上个月华东区SUV销量环比」,AI直接生成SQL跑出结果。这在两三年前不可想象,现在各家BI产品都在做。数据使用的门槛,正在从「会SQL会BI」降到「会打字」。
第二,文档和代码。写个清洗脚本、生成个正则、总结一份数据字典,AI比我带过的实习生上手快。我现在写复杂逻辑,先让AI出一版,再人工改,效率至少提一半。
第三,体力活。给几百个字段补语义注释、把积压的报表文档读一遍提炼要点,这类活AI干得又快又便宜。
这些能力都是真的。但如果你就此得出结论,数据治理可以被AI替代了,那是把治理这件事想简单了。
3 AI解决不了的三类数据问题
我在G企做数据治理的时候,碰到的三类问题,AI一个都解决不了。
第一类,口径问题。
同一个「销量」,销售口径是开票数,生产口径是下线数,财务口径是确认收入数。同一个「活跃客户」,市场部按触达算,服务部按进厂算。你去问大模型,它只会从喂给它的数据里挑一套口径算给你,算完还信誓旦旦。数据没错,AI没错,错的是没人告诉它口径是什么。口径是什么、谁说了算,这就是数据标准,就是治理的活。这一块不治理,AI只会把口径混乱的速度提上来。
第二类,主数据问题。
G企当时同一个客户在不同系统里,手机号、地址、购车时间全都不一样,市场部、销售部、售后部各一套。AI能不能自动合并?能试,但错杀率你得认。一家人共用一个手机号、证件号录入错一位、先用车后补录信息,这些场景靠算法匹配总有灰色地带,最后还是要人定规则、人兜底。规则怎么定、合并后算谁的、错了怎么回滚,这些是主数据管理的地盘,也是治理的地盘。工具可以换,这些问题一个都少不了。
第三类,人的问题。
G企治理最难的不是写标准,是让业务部门按标准填数据。标准文档签了字,业务人员该不填的字段还是不填。最后靠什么落地的,靠在业务系统里加校验规则,不按规范格式填就提交不了,再加一个数据质量看板定期通报各部门合格率,用数据管数据,才真正从一次性项目变成常态化管理。AI能替销售顾问把客户信息填对吗,不能。工具永远管不住人,能管住人的只有机制。
说白了,这三类问题没有一个是技术问题,全是管理问题。AI再强,它是个工具,工具解决不了组织的问题。
我总结了一句糙理,以前是垃圾进垃圾出,现在是垃圾进、AI放大了垃圾出。数据脏的企业上了AI,等于给全公司配了一个语速很快、自信满满、但时不时胡说八道的分析师。
4 AI和治理,其实是互相成就
讲完AI不行的,讲讲两边怎么结合。我看到的结合点有两个方向。
方向一,AI帮治理提效。三个已经能落地的点。
一是元数据自动化。以前给几百张表补字段注释、做数据分类分级,工作量按人年算。现在大模型扫一遍字段名和样例数据,能给出八成的语义标注,人工只做复核。华为云DataArts这类平台已经在做数据资产智能编目,这个方向是对的,治理里最枯燥的部分会被AI吃掉。
二是质量规则推荐。大模型理解字段的业务含义后,能推荐该配哪些质量规则,手机号格式、日期范围、枚举值合法性,生成的规则比人从模板里挑得全。治理规则的生产效率,确实被AI提上来了。
三是数据资产问答。把元数据、指标字典、口径定义喂给大模型,业务方问「这个指标谁负责、口径是什么」,AI直接答。注意,这是治理成果的变现出口。治理做得好的企业,这个场景马上能用。治理没做的,问了也白问,因为没有干净的知识可答。
方向二,治理给AI供弹药。
现在企业落地AI,最先卡住的环节你知道是什么吗,是数据。做知识库,文档乱七八糟、版本混乱、术语不统一,AI检索出来的就是错的。做经营分析助手,底层数据口径不一致,AI给出的数今天一个样明天一个样,业务方用一次就不信了。
都说AI幻觉,我看AI幻觉的锅,一半在模型,另一半在数据。喂进去的数据越干净、口径越统一、元数据越全,AI的输出就越靠谱。治理就是给AI打地基的那个人。
5 我的判断,治理更重要了
三个理由。
第一,用数据的人要暴增了。AI把门槛打下来之后,看数据的人会多一个数量级。使用的人多了十倍,脏数据的杀伤半径就大了十倍。以前一张错报表影响一个部门,现在一个错答案能顺着AI对话传遍全公司,还带着「AI说的」这层信任背书。
第二,AI拉开了数据质量的价值差距。同一个大模型,数据干净的企业和数据脏的企业,用出来的效果差距会比以前更大。以前数据质量差,报表数字不对,业务方骂两句数据团队。现在数据质量差,AI一本正经地胡说,决策跟着错。治理从成本项,变成了竞争力项。
第三,往长了看,数据资产入表、AI训练语料、企业知识库,哪个都绕不开治理。数据这个资产,不治理就是负资产,治理了才是资产。AI时代只是把这个账算得更清楚了。
给同行一句话。别焦虑工具,工具会一直换,我18年换过的工具两只手数不完。把标准、质量、主数据、元数据这套基本功练扎实,在AI时代不但不过时,还更值钱。
6 写在最后
这是12篇的最后一篇。
回头看这一季,其实就讲了一条线。前四篇讲数据怎么治,主数据、OneID、CDGP认证、数仓分层。中间四篇讲数据怎么用,数据质量、标签体系、上云迁移、数据驱动。后四篇讲人怎么立,中年焦虑、面试、工具变迁、AI。从乱到治,从治到用,从用到人,这就是我理解的数字化这条路。
AI来了,这条线没有断。反而是这条路,修到了AI的门口。
作者 凌波,18年汽车行业数字化老兵,CDGP数据治理专家。从DMS运维到数据中台架构,干过甲方也干过乙方。
下一季预告 敏捷Scrum实战、数据资产入表、数仓中台数据湖