模 模界数智

非结构化数据分类分级:从文件堆到可信数据基础

非结构化数据分类分级怎么做?准确率怎么验证?

非结构化数据分类分级的难点不是打标签,而是判断「这份数据服务于什么业务、对应哪条法规、在什么组合下会升级为高敏感」。做法是先理解内容(抽取用途、主体、对象、环节等要素),再结合业务目录、行业规则和真实填写状态逐级判断,最后把标签转化为 DLP、知识库、外发与 Agent 的可执行策略。准确率必须结合测试方法看——测试集来源、是否含历史遗留命名、未识别项是否计入分母,都会显著改变结果。

关键结论

  • ● 打标签是结果,不是方法——难在业务语义判断,不在标签本身。
  • ● 判定稳定性应该排在准确率之前:两轮一致率不到 95% 时,准确率数字落在噪声里。
  • ● 类目粒度可以量化诊断:每个叶子承载多少字段、跨多少来源系统。
  • ● 低置信度是资产——它精确圈出需要人工复核的少数样本,其余可直接采信。
  • ● 结构化和非结构化可以共用一棵树、一套判据,但要走不同的入口与粒度。
✅ 客户收益
完成海量 PDF、Word、邮件等非结构化资产的合规梳理,输出可执行的安全策略,为大模型应用筑牢数据底座。
🔎 服务内容
核心能力来自模界·知源 AiDClass 软件,支持独立采购软件;也可配套咨询服务完成行业标准适配与落地实施。
杂乱的文档、邮件、图片和表格经过内容理解与标签处理,形成有序且带有证据轨迹的可信数据
从发现和解析开始,让杂乱文件逐步形成可治理、可授权、可审计的数据身份。

为什么字段名匹配的工具会大面积失效

这些情况在真实企业里不是例外,是常态。只按字段名匹配的工具,在这些情况面前准确率会断崖式下跌。

  • ● 拼音缩写:`khxm`、`zjhm`、`co_qty`——字段名本身不携带语义
  • ● 同名异义:不同系统里的 `status` 含义完全不同
  • ● 历史遗留命名:十几年前建的表,命名规范早已失传
  • ● 填写状态与设计不符:字段设计为身份证号,实际填的是内部编号

六项核心能力

环节做什么输出
发现与解析发现文件,解析正文、表格、图片与 OCR 内容,识别音视频中的语言,保留来源与版本可处理的数据对象与证据
内容识别识别业务用途、敏感字段、实体与上下文识别结果、置信度与证据片段
分类分级结合目录、行业规则、字段参考级别与真实填写状态进行判断业务类别、安全级别与解释
策略生成把标签转化为 DLP、知识库、共享、外发与 Agent 使用策略可执行或可审批的策略建议
资产地图按文件类别、级别及在存储资源中的分布展示,并警示错位存储错位存储提示与整改建议
审计与评估记录模型、规则、版本、证据、决策与执行结果可解释、可审计、可回放的证据链

怎么验证一套分类分级方案

这是采购环节最容易被话术绕过的地方。几条可以自己动手的验证方法:

  • ● 先测一致率:同一批数据连跑两轮,看判定是否一致。不到 95% 时准确率数字没有统计意义
  • ● 测试集必须由客户从生产环境抽取,且包含拼音缩写与历史遗留字段
  • ● 未识别项必须计入分母——把「不确定」排除出统计是最常见的操纵手法
  • ● 看置信度分布:一个永远输出高置信的引擎,比准确率低两个点的诚实引擎更危险
  • ● 结构化要整表提交:孤立单字段会丢掉表上下文,实测会严重低估真实能力

标准本身的质量,就是这项工作的质量

在能源、医疗等行业,监管指南给了原则和识别规则,但把三、四级分类的建设权和责任交给了企业。这意味着一份十几条的行业文件,落到一家企业身上会变成几百个类目,每个都要有可判定的边界和定级理由。标准建得好不好,直接决定了后面所有自动化工作的上限。

能力边界

我们区分「已验证」与「规划中」,不把规划中的能力写成现有能力。

  • 已验证 有限样本中的文件级业务分类、字段识别、定级、策略生成与安全系统联动路径,已获得 PoC 认可。
  • 规划中 十万至百万级吞吐、多 GPU 长期稳定、生产接口回写、实时阻断审批闭环,以及全行业准确率,仍需专项试点验证。
相关产品

模界·知源 AiDClass

识别每一份数据,并形成可执行的治理与安全策略。

已验证 了解 知源 →

常见问题

分类分级不就是给文件打标签吗?

+

打标签是结果,不是方法。难点在于判断「这份数据服务于什么业务、对应哪条法规、在什么组合下会升级为高敏感」。只按字段名匹配的工具,在拼音缩写、同名异义、历史遗留命名面前会大幅失效。

准确率能到多少?

+

在覆盖完整业务类别的前提下,文档级四级精确命中可以达到九成以上,字段级在八成上下。但这个数字必须结合测试方法看——测试集是否由客户从生产环境抽取、是否包含拼音缩写与历史遗留字段、未识别项是否计入分母,都会显著改变结果。比准确率更该先看的是判定稳定性。

结构化和非结构化能用同一套标准吗?

+

可以用同一棵树、同一套判据,但要走不同的入口和粒度。非结构化侧输入文档原文,先做内容结构化再整篇输出一条路径加等级;结构化侧输入字段清单,按表聚合、整表提交、字段级输出,同一张表的字段可以分流到不同类目。

支持私有化部署吗?

+

支持,并可使用客户本地模型。重要数据尽量不离开客户环境是产品的默认设计前提。

延伸阅读

正在规划企业 AI 相关项目?

建议从真实业务场景切入,优先完成项目诊断:评估业务价值、核查数据基础、识别安全与权限风险,审慎评估之后,再决定是否启动 PoC 原型建设,避免无效投入。

预约 30 分钟交流