FDE Hub
学习路径/17
校准
18 分钟

FDE 数据治理:从数据盘点到可审计上线

掌握数据资产清单、分级授权、质量指标、数据合同、血缘追踪和 AI/RAG 专项治理,把数据风险转化为可执行、可验收的交付控制。

FDE 做数据治理,不是先建一个“完美数据中台”,也不是只处理脏数据。真正目标是让项目使用的数据可找到、可理解、可用、可控、可追溯、可退出,并让每项规则都有负责人、证据和处置动作。

数据治理不是项目上线前的一次检查,而是从数据进入系统到停止使用的持续控制。没有责任人、口径和证据的规则,不能算治理制度。

FDE 为什么必须懂数据治理

业务结果依赖数据

模型表现、流程效率和用户信任,最终都受到数据完整性、准确性和及时性的限制。

权限问题发生在数据层

如果检索、缓存和导出没有继承原系统权限,界面上的登录控制并不能阻止越权。

问题必须能追根溯源

错误答案需要追到来源、版本、转换、索引、提示词和模型,才能修复而不是反复打补丁。

交付必须能够验收

客户需要看到数据清单、质量报告、授权记录、审计日志和删除证明,而不是只听口头保证。

先回答六个治理问题

01

有什么

数据在哪里、以什么形式存在,是否还有影子表格和人工导出。

02

谁负责

谁定义业务口径、谁批准使用、谁修复问题、谁接受风险。

03

为什么用

每类数据对应哪个明确场景,是否发生超出原目的的二次使用。

04

质量怎样

基线是多少,目标是什么,如何抽样、监控和阻断不合格数据。

05

谁能访问

用户、服务账号、供应商和模型分别可以看到什么,权限如何回收。

06

何时退出

数据保存多久,项目停止、用户撤回或合同结束后怎样删除并证明。

数据全生命周期治理

01

发现与盘点

找到系统、表、文件、接口、知识文档和日志,确认业务用途与责任人。

02

分类与授权

按公开、内部、敏感、严格受限分类,并记录授权依据和允许用途。

03

接入与建模

建立字段语义、主键、数据合同、更新频率以及上下游依赖。

04

加工与质检

执行清洗、去重、脱敏和质量规则,保留转换记录与失败样本。

05

服务与使用

通过最小权限、用途限制和审计,把数据提供给应用、分析或 AI。

06

监控与处置

持续监控质量、权限、成本和异常,完成纠正、通知、删除与复盘。

第一张表:建立数据资产清单

不要一开始就扫描全公司的所有数据。先围绕本期业务流程,盘点会被读取、加工、生成、缓存、导出和删除的数据。 每项资产必须有业务定义、来源、责任人、敏感级别、更新频率、保留期限和允许用途。

数据资产来源系统所有者 / 管理员分级更新频率保留期限允许用途
客户工单工单系统 API客服负责人 / 数据管理员L3 敏感每 15 分钟24 个月检索、分类、回复草稿
产品知识库文档平台产品负责人 / 内容运营L2 内部每日有效期内带引用回答
账号与角色统一身份系统IT / 安全负责人L4 严格受限实时账号有效期权限过滤,不进入模型上下文

范围界定原则

数据资产清单中没有登记、没有责任人或没有合法授权依据的数据,默认不得进入本期项目。新增数据源、扩大用途、延长保留期或改变敏感级别,都要走范围变更和风险复核。

责任不能只写“项目组负责”

角色主要职责最终负责事项
业务负责人确定业务定义、允许用途、质量目标和价值优先级业务口径与最终验收
数据所有者批准访问、共享、保留与删除策略授权与风险接受
数据管理员维护目录、口径、质量规则、问题队列和元数据日常治理质量
安全 / 合规确定分级、脱敏、审计、跨境和事件响应要求安全合规门槛
平台 / 运维保障数据管道、备份、监控、恢复和成本可控技术服务等级
FDE把业务规则落实为数据合同、权限、质量门禁和可验收证据端到端闭环与移交

一项任务可以多人参与,但只能有一个最终负责角色。FDE 可以推动和实现治理控制,却不能替客户业务负责人决定数据含义,也不能替数据所有者批准用途。

数据分级与最小权限

L1 公开

已批准公开的数据

允许公开访问,但仍需保证来源和版本

L2 内部

内部制度、一般业务资料

仅组织内授权用户,禁止任意外发

L3 敏感

客户、员工、交易和经营数据

按角色与用途授权,脱敏、审计、限制导出

L4 严格受限

密钥、身份凭证、核心机密等

默认拒绝,特殊审批,隔离存储,禁止进入模型上下文

  • 先验证身份,再根据角色、部门、数据属性、用途和环境共同判断访问权限。
  • 人、应用、定时任务和第三方供应商都必须使用可识别账号,禁止共享长期密钥。
  • 授权要有到期时间;转岗、离职、项目结束和合同终止时自动或人工复核回收。
  • 查看、检索、修改、导出、授权和删除都应留下可查询的审计记录。

第二张表:把数据质量变成可验收指标

“数据质量好”无法验收。每项指标要定义对象、公式、样本、频率、目标值、负责人以及不达标时是否阻断上线。 下面数值只是示例,应根据项目基线、业务风险和成本共同确认。

质量维度计算口径示例目标测量与处置
完整性必填字段有值的记录占比≥ 98%每日扫描;低于目标暂停增量入库
准确性抽样记录与权威来源一致的占比≥ 95%每周分层抽样并由业务复核
及时性源数据产生到可用的时间差P95 ≤ 30 分钟链路时间戳监控与告警
一致性相同业务对象在不同系统中关键字段一致率≥ 97%按主键对账,差异进入修复队列
唯一性不应重复的业务对象无重复占比≥ 99.5%主键与相似度双重去重
有效性值符合类型、枚举、范围和业务规则的占比≥ 99%Schema 校验与规则引擎

质量评分不能掩盖关键失败

可以使用加权总分衡量整体质量,但必须设置门槛项。例如权限映射错误、关键主键大量缺失、生产数据未经授权、删除请求无法传播等情况,不能用其他指标高分抵消。

用数据合同控制上下游变化

数据合同是数据提供方与使用方对接口的明确约定。它至少要包含数据负责人、Schema、字段业务含义、主键、更新频率、质量目标、权限级别、版本、兼容策略和变更通知期限。

合同发布前

  • • 明确权威来源和字段业务定义
  • • 定义必填、枚举、范围和关联规则
  • • 建立测试样本与自动校验
  • • 记录消费者和影响范围

合同发生变化

  • • 兼容修改按版本发布并自动回归
  • • 破坏性修改必须通知、评估和批准
  • • 上下游共同确认迁移窗口与回退方案
  • • 完成后更新目录、血缘、文档和监控

数据血缘:错误发生后能追到哪一步

业务源系统
采集 / 同步
清洗与脱敏
知识库 / 数仓
检索与模型
业务输出
反馈与审计

每一段血缘至少记录输入、输出、处理规则、运行时间、代码或配置版本、执行账号和失败状态。出现错误答案时,团队应能够定位是源数据错误、同步延迟、清洗规则、权限过滤、索引版本还是模型生成问题。

AI 与 RAG 项目的专项数据治理

环节主要风险最低控制要求
知识入库重复、失效或未经授权的文档进入索引去重、有效期、来源、版本、ACL 和审批状态作为强制元数据
切分与向量化切分破坏语义,向量库残留旧内容按文档结构切分;记录模型版本;删除时同步清理索引与缓存
检索用户检索到越权内容检索前做身份与属性过滤,禁止只在答案生成后做文本遮盖
模型上下文敏感字段进入第三方模型或日志最小化上下文、字段脱敏、供应商边界确认、日志默认不记录原文
回答输出答案无来源、过期或把推测当事实强制引用、低置信度拒答、关键动作人工确认、建立回归评测集
反馈与训练用户反馈和生产对话被直接用于训练单独取得授权,隔离评测集,去标识化并保留用途和版本记录

特别注意评测数据泄漏

验收题、标准答案和生产反馈不能无控制地混入知识库、提示词优化或训练数据,否则评测结果会虚高。评测集应独立存放、限制访问、记录版本,并保留一部分从未参与调优的盲测样本。

一套可落地的 30 / 60 / 90 天计划

0—30 天

建立基线

确定范围和角色,完成关键数据盘点、分级、用途确认、质量基线和高风险问题清单。

31—60 天

建立控制

上线数据合同、质量门禁、权限过滤、血缘、审计和问题处理流程,先覆盖核心链路。

61—90 天

验收与移交

运行监控和抽样,关闭高风险问题,形成治理报告、操作手册、责任人和持续改进节奏。

治理交付物与验收证据

数据资产与范围

数据清单、业务术语、分级、用途、责任人、保留期限和范围外说明。

安全与权限

权限矩阵、审批记录、脱敏规则、服务账号清单、审计日志和回收记录。

质量与血缘

质量规则、基线与趋势报告、问题台账、数据合同、血缘图和变更记录。

运行与移交

治理 RACI、操作手册、告警和事件流程、培训记录、验收签字及后续复盘计划。

上线前治理检查表

本期所有数据资产都有来源、用途、分级、负责人和保留期限。
业务定义与技术字段已经对齐,关键指标不会因部门不同出现多个口径。
核心质量指标有基线、目标、测量方法、告警和未达标处置。
访问权限在数据读取和检索阶段生效,并已使用越权样本测试。
敏感数据不会无控制进入第三方模型、日志、缓存、导出文件和测试环境。
数据合同、血缘和版本足以定位一次错误输出使用了哪批数据。
删除、撤回授权、账号回收和项目退出流程已经演练并能提供证据。
治理责任已经移交给具体人员,而不是长期依赖 FDE 人工救火。

常见失败方式

  • 把数据治理理解为一次性清洗,项目上线后无人持续维护。
  • 先把所有数据汇总到一起,再考虑权限、用途和删除。
  • 只有技术负责人,没有业务口径和数据所有者。
  • 只看平均质量分,不设置越权、关键字段缺失等门槛项。
  • 文档写得很完整,但规则没有进入管道、测试、监控和审批流程。
  • 为了提高模型效果,把生产对话、评测答案和敏感数据直接用于训练。
最小可行数据治理不是少写文档,而是先覆盖最高价值、最高风险的数据链路,把责任、规则、技术控制和证据真正连起来,再逐步扩大范围。

本章常见问题

FDE 做数据治理应该从哪里开始?

先从当前交付范围内的数据资产清单开始,逐项记录来源、业务用途、责任人、敏感级别、更新频率、保留期限和允许使用方式,再优先治理高价值、高风险的数据链路。

怎样把数据质量写成可验收标准?

把完整性、准确性、及时性、一致性、唯一性和有效性分别写成可计算公式,约定基线、目标值、测量样本、测量频率、责任人和未达标处置,不只写“数据质量良好”这类主观描述。

RAG 项目需要重点治理哪些数据风险?

重点治理知识来源和授权、文档版本与有效期、切片和元数据质量、检索权限继承、引用可追溯、敏感信息泄露、评测集污染,以及删除或撤回授权后索引是否同步失效。