模 模界数智
AiDClass 观察 · 第 1 篇

如何分辨真假 AI 数据分类分级:三类伪 AI 工具与七项 PoC 测试

模界数智 官网首发
三类外观相似的数据分类工具中,只有一个能够展开语义证据与完整判断路径

AiDClass 观察 · 第 01 期|企业采购时最该警惕的三类工具

序篇里,我们讲了数据分类分级的三次范式:从规则匹配,到训练式模型,再到业务推理。文章发出后,一个更现实的问题很快浮上来:市场上那么多产品都叫“AI 分类分级”,企业到底怎么分辨?

这不是一个纯技术问题,而是一个采购问题。因为很多机构最后买到的,并不是一个真正理解业务语义、能对齐监管要求的 AI 引擎,而是旧规则系统换了一套 AI 说法:页面上有置信度,方案里有大模型,演示时也能跑出漂亮结果,但一进真实系统,问题就露出来了。

更微妙的是,这些工具并非完全没有价值。它们能解决一部分基础扫描、清单生成、合规留痕的问题。真正的风险在于:企业把它们当成“AI 能力”来采购、按 AI 产品来付费,却在执法和运营环节发现结果解释不清、覆盖不全、更新太慢。

这一期,我们先把市场上最常见的三类“伪 AI”分类分级工具拆开看:它们长什么样,底层大概怎么跑,什么时候会失灵,以及采购方在 PoC 阶段可以怎么识别。

图 1:三类常见“伪 AI”分类分级工具的底层差异
图 1:三类常见“伪 AI”分类分级工具的底层差异

一、字典翻译派

这类产品最常见的演示,是识别英文字段名。比如 CUST_PHONE_NO 一扫出来,系统马上给出“客户手机号”,旁边再标一个 99.x% 的准确率。

这个结果看起来很智能。但只要把字段换成 CST_MOB_NUM,或者更贴近中国企业真实系统的拼音缩写 khsjh,准确率往往会明显下滑。原因也不复杂:很多时候,它的核心不是“理解”,而是一本做得很大的字段字典。

字典里存着常见缩写的映射:CUST 对应客户,ACCT 对应账户,AMT 对应金额,PHONE/MOB 对应手机号。系统先把英文字段名翻译成中文,再用正则或关键词去匹配分类树。

它的问题不在于完全没用。金融行业常见字段确实能覆盖不少,演示数据如果选得好,结果也会很好看。问题在于,这种能力一旦离开“规范英文缩写”的舒适区,就会很快失去稳定性。

最容易暴露的三个场景:

  • 行内命名规范不在字典里。某家银行用 KH 表示客户,某家保险用 BD 表示保单,某家券商用 WTBH 表示委托编号,这些内部习惯通常不在公开字典里。

  • 相同字段名在不同业务里含义不同。AMT 在交易系统里可能是交易金额,在风控系统里可能是风险评分,在精算模型里又可能是负债评估金额。只看字段名,无法判断业务语义。

  • 老核心系统命名混乱。1995-2005 年间建设的系统里,英文缩写、拼音缩写、业务编号、COL_001 这类递增编号都可能存在,而这恰恰是企业最需要工具帮忙识别的区域。

采购方可以做一个很简单的测试:准备一批拼音首字母字段,例如 khxm、shfzh、yhkh,再准备一批老核心系统的真实字段。只要准确率从演示环境的高分明显掉下来,就要高度怀疑它只是“字典翻译派”。

二、规则伪装派

第二类产品看起来会更“AI”。产品页面上有大模型 logo,有训练曲线,有“AI 置信度”按钮,甚至还有一个让人很安心的“开始训练”。但客户真正落地后,常会遇到一个尴尬现象:无论怎么调整所谓模型参数,识别结果都差不多。

这类产品的底层,很多仍是传统规则引擎:正则表达式、关键词匹配、字段命名规则。所谓 AI 包装,更多发生在产品形态上:后台加一个训练进度条,结果页加一个置信度字段,宣传材料里写上“集成大模型”。

这并不难理解。传统数据安全厂商本来就有 DLP、数据库审计、数据脱敏等产品,规则引擎是现成能力。要在短期内“AI 化”,最快路径不是重做底层,而是在已有产品上加一层 AI 风格的交互和话术。

识别规则伪装派,可以追问三个问题:

  • 请解释这个字段为什么被判定为敏感数据。如果最后只能解释为“触发了某条规则”,那它仍然是规则引擎,只是换了展示方式。

  • 如果我们有 5000 个特殊命名字段,应该怎么让系统识别?如果答案是“一条条加入规则库”,那所谓 AI 并没有真正减少配置工作。

  • 新监管文件发布后,产品多久能适配?如果周期仍然是三到六个月,说明底层仍要人工改规则、发版本,而不是知识层快速更新。

坦率说,规则伪装派能卖出去,也有现实原因。很多采购原本就是合规驱动,只要能生成一份分类分级清单就先过关;很多招标流程也更重视方案演示,而不是用真实脏数据压测。再加上 AI 预算本身存在,厂商和客户都容易被“AI 标签”推着往前走。

但到了 2026 年,这个空间会越来越小。93 号文强调的是能运营的能力,后续的发现、整改、通报、处罚都需要持续可信的结果。一份解释不清、更新不动、覆盖不全的清单,在执法年里反而可能变成风险本身。

三、小模型贴牌派

第三类最难识别,因为它确实用了机器学习。它可能基于开源模型做微调,用行业常见字段样本训练分类器,也能输出真正的语义识别结果。

它相比前两类有进步。在“客户姓名”“身份证号”“手机号”“账号”“金额”等高频字段上,效果往往不错,甚至能在演示和标准测试集中跑出很高的准确率。

但它的问题也很明确:能力高度依赖训练数据覆盖。训练集中见过、标注过、分布接近的字段,识别就好;训练集中没见过,或者命名风格差异很大,表现就会掉下来。

这也是为什么很多 PoC 会出现“演示时 95%,落地后 70%”的落差。演示数据和训练数据同源,真实数据和训练数据异源,中间差的不是参数,而是业务现实。

小模型贴牌派的几个边界,采购方尤其要注意:

  • 新类别上线慢。全新的业务字段如果训练集没覆盖,往往需要收集样本、重新标注、重新训练、重新部署,周期可能是 1-3 个月。

  • 分布外容易失效。训练数据大量是英文缩写,但客户真实系统主要是拼音缩写,准确率就很难维持宣传值。

  • 非结构化场景覆盖不足。字段分类器天然面向结构化字段,对 PDF、合同、扫描件、API 报文、客服录音转写等场景,往往需要另起一套机制。

  • 跨行业扩展成本高。从金融扩到医疗、电信、政务,不是简单换一份配置,而是重新收集标注数据、重新训练模型。

识别它,可以问一个直接的问题:如果我们要识别一类你们训练数据里从未见过的业务字段,多久能上线?如果答案是“几小时内通过知识库扩展可用”,那至少说明它在往业务推理方向走;如果答案是“需要收集样本、训练新版本模型,预计 1-3 个月”,那它仍然是典型训练式路线。

四、为什么这些工具长期存在

这里需要说得公允一点:以上三类工具不是简单的“骗局”。在合适场景下,它们都能创造价值。字典和规则可以做基础扫描,小模型也能提升常见字段识别效果。真正的问题,是它们被包装成了更强的 AI 能力,导致客户对适用边界产生误判。

伪 AI 长期存在,大致有三层原因。

  • 客户侧存在认知门槛。分类分级横跨 AI、数据库、安全、业务和监管,采购团队能验证产品是否能输出报告,却很难判断底层到底是模型、规则,还是业务推理。

  • 厂商侧有技术债。传统数据安全厂商多起家于审计、DLP、脱敏等规则型产品。真正转向 AI 推理,不是做一次界面升级,而是重做底层工作机制。

  • 监管侧也有现实节奏。早期监管更关心企业是否动起来,先有清单、先有制度、先有流程。这个阶段,规则型工具确实有过渡价值。

不过,2026 年的情况不一样了。93 号文强调动态运营,“四个一批”意味着执法链条会更实,监管也会越来越关心分类依据、整改闭环和持续更新能力。换句话说,能不能生成一张清单已经不够了,工具必须能解释、能更新、能覆盖真实业务。

五、那什么才更接近真 AI 分类分级

反过来看,真正值得企业关注的 AI 分类分级能力,不应该只停留在“识别字段名”。它至少要回答几个问题:

  • 遇到训练数据里没见过的字段,能不能结合业务上下文推理,而不是直接失败或回退规则?

  • 给出分类结果时,能不能说明依据,包括业务语义、相关字段、适用监管条款,而不是只有标签和置信度?

  • 新增监管、新行业、新业务类别时,能不能通过知识库扩展快速适配,而不是重新训练一个模型?

  • 结构化字段、非结构化文档、API 报文、音频转写等不同输入,能不能用同一套业务推理机制处理?

  • 能不能支持客户自己的分类标准,而不是为每个客户再训练一个子模型?

  • 跨国家、跨语言场景下,能不能直接理解业务语义,而不是依赖翻译字典作为中间层?

这几条能力,才是序篇里说的第三代范式:不是把分类分级做成一个字段分类器,而是让 AI 像一个懂业务、懂监管、能解释判断过程的合规专家那样工作。

图 2:采购方可直接用于 PoC 的四个基础测试
图 2:采购方可直接用于 PoC 的四个基础测试

六、采购方七项 PoC 测试清单

如果你正在评估同类产品,不必一上来就讨论架构、模型和参数。先把测试集准备好,尤其要用自己的真实系统样本,而不是只看厂商演示数据。下面这七项,挑三到四项与你业务最相关的做,基本就能看出差异。

#测试场景真 AI 的应有表现
1拼音缩写字段识别对 khxm / shfzh / yhkh 这类拼音首字母字段,识别率保持稳定,不依赖英文字典覆盖。
2同名异义字段区分同一字段名如 AMT,在交易、风控、精算等不同业务上下文中,能输出不同分类。
3历史核心字段挑战从 1995-2005 年代建设的老核心系统抽取真实字段,识别率不应明显低于结构化字段平均水平。
4全新业务类别接入针对训练数据从未涉及的新业务类别,上线周期应以“小时”或“天”计,而不是“月”。
5可解释性测试每个分类结果能输出适用监管条款、业务推理依据和置信度构成,而不是只展示触发规则。
6新监管适配速度新发布的金规、人行、证监等文件,从发布到引擎可引用,周期不应依赖传统发版节奏。
7非结构化场景覆盖PDF 合同、扫描件、API 报文、客服录音转写等场景,能进入同一套判断机制。

写在最后

回到开头那个问题:为什么企业很难分辨真 AI 与伪 AI?不是企业不专业,而是这个市场对“AI”两个字的使用太宽了。当大多数产品都自称 AI,“是不是 AI”就很容易从技术判断变成营销话术。

所以,采购时不要只看宣传材料,也不要只看厂商准备好的演示数据。更有效的办法,是把产品放进真实场景里测:拼音缩写、行内自定义字段、同名异义字段、训练数据里没见过的新业务。

这四类场景测完,产品的底层机制基本就会自己浮出来。

下一期,我们会接着谈另一个被普遍误用的指标:准确率。当一家厂商告诉你“我们的准确率 95%”时,真正值得追问的,往往不是这个数字,而是它背后的测试方法、样本选择和口径定义。

—— 模界数智

正在规划企业 AI 相关项目?

建议从真实业务场景切入,优先完成项目诊断:评估业务价值、核查数据基础、识别安全与权限风险,审慎评估之后,再决定是否启动 PoC 原型建设,避免无效投入。

预约 30 分钟交流