# 如何分辨真假 AI 数据分类分级：三类伪 AI 工具与七项 PoC 测试

> 发布日期：2026-08-25　作者：模界数智
> 原文链接：https://mojiedata.com/insights/identify-fake-ai-classification

---

AiDClass 观察 · 第 01 期｜企业采购时最该警惕的三类工具

序篇里，我们讲了数据分类分级的三次范式：从规则匹配，到训练式模型，再到业务推理。文章发出后，一个更现实的问题很快浮上来：市场上那么多产品都叫“AI 分类分级”，企业到底怎么分辨？

这不是一个纯技术问题，而是一个采购问题。因为很多机构最后买到的，并不是一个真正理解业务语义、能对齐监管要求的 AI 引擎，而是旧规则系统换了一套 AI 说法：页面上有置信度，方案里有大模型，演示时也能跑出漂亮结果，但一进真实系统，问题就露出来了。

更微妙的是，这些工具并非完全没有价值。它们能解决一部分基础扫描、清单生成、合规留痕的问题。真正的风险在于：企业把它们当成“AI 能力”来采购、按 AI 产品来付费，却在执法和运营环节发现结果解释不清、覆盖不全、更新太慢。

这一期，我们先把市场上最常见的三类“伪 AI”分类分级工具拆开看：它们长什么样，底层大概怎么跑，什么时候会失灵，以及采购方在 PoC 阶段可以怎么识别。

![图 1：三类常见“伪 AI”分类分级工具的底层差异](./images/fig-01.png)

# 一、字典翻译派

这类产品最常见的演示，是识别英文字段名。比如 CUST_PHONE_NO 一扫出来，系统马上给出“客户手机号”，旁边再标一个 99.x% 的准确率。

这个结果看起来很智能。但只要把字段换成 CST_MOB_NUM，或者更贴近中国企业真实系统的拼音缩写 khsjh，准确率往往会明显下滑。原因也不复杂：很多时候，它的核心不是“理解”，而是一本做得很大的字段字典。

字典里存着常见缩写的映射：CUST 对应客户，ACCT 对应账户，AMT 对应金额，PHONE/MOB 对应手机号。系统先把英文字段名翻译成中文，再用正则或关键词去匹配分类树。

它的问题不在于完全没用。金融行业常见字段确实能覆盖不少，演示数据如果选得好，结果也会很好看。问题在于，这种能力一旦离开“规范英文缩写”的舒适区，就会很快失去稳定性。

## 最容易暴露的三个场景：

- 行内命名规范不在字典里。某家银行用 KH 表示客户，某家保险用 BD 表示保单，某家券商用 WTBH 表示委托编号，这些内部习惯通常不在公开字典里。

- 相同字段名在不同业务里含义不同。AMT 在交易系统里可能是交易金额，在风控系统里可能是风险评分，在精算模型里又可能是负债评估金额。只看字段名，无法判断业务语义。

- 老核心系统命名混乱。1995-2005 年间建设的系统里，英文缩写、拼音缩写、业务编号、COL_001 这类递增编号都可能存在，而这恰恰是企业最需要工具帮忙识别的区域。

采购方可以做一个很简单的测试：准备一批拼音首字母字段，例如 khxm、shfzh、yhkh，再准备一批老核心系统的真实字段。只要准确率从演示环境的高分明显掉下来，就要高度怀疑它只是“字典翻译派”。

# 二、规则伪装派

第二类产品看起来会更“AI”。产品页面上有大模型 logo，有训练曲线，有“AI 置信度”按钮，甚至还有一个让人很安心的“开始训练”。但客户真正落地后，常会遇到一个尴尬现象：无论怎么调整所谓模型参数，识别结果都差不多。

这类产品的底层，很多仍是传统规则引擎：正则表达式、关键词匹配、字段命名规则。所谓 AI 包装，更多发生在产品形态上：后台加一个训练进度条，结果页加一个置信度字段，宣传材料里写上“集成大模型”。

这并不难理解。传统数据安全厂商本来就有 DLP、数据库审计、数据脱敏等产品，规则引擎是现成能力。要在短期内“AI 化”，最快路径不是重做底层，而是在已有产品上加一层 AI 风格的交互和话术。

## 识别规则伪装派，可以追问三个问题：

- 请解释这个字段为什么被判定为敏感数据。如果最后只能解释为“触发了某条规则”，那它仍然是规则引擎，只是换了展示方式。

- 如果我们有 5000 个特殊命名字段，应该怎么让系统识别？如果答案是“一条条加入规则库”，那所谓 AI 并没有真正减少配置工作。

- 新监管文件发布后，产品多久能适配？如果周期仍然是三到六个月，说明底层仍要人工改规则、发版本，而不是知识层快速更新。

坦率说，规则伪装派能卖出去，也有现实原因。很多采购原本就是合规驱动，只要能生成一份分类分级清单就先过关；很多招标流程也更重视方案演示，而不是用真实脏数据压测。再加上 AI 预算本身存在，厂商和客户都容易被“AI 标签”推着往前走。

但到了 2026 年，这个空间会越来越小。93 号文强调的是能运营的能力，后续的发现、整改、通报、处罚都需要持续可信的结果。一份解释不清、更新不动、覆盖不全的清单，在执法年里反而可能变成风险本身。

# 三、小模型贴牌派

第三类最难识别，因为它确实用了机器学习。它可能基于开源模型做微调，用行业常见字段样本训练分类器，也能输出真正的语义识别结果。

它相比前两类有进步。在“客户姓名”“身份证号”“手机号”“账号”“金额”等高频字段上，效果往往不错，甚至能在演示和标准测试集中跑出很高的准确率。

但它的问题也很明确：能力高度依赖训练数据覆盖。训练集中见过、标注过、分布接近的字段，识别就好；训练集中没见过，或者命名风格差异很大，表现就会掉下来。

这也是为什么很多 PoC 会出现“演示时 95%，落地后 70%”的落差。演示数据和训练数据同源，真实数据和训练数据异源，中间差的不是参数，而是业务现实。

## 小模型贴牌派的几个边界，采购方尤其要注意：

- 新类别上线慢。全新的业务字段如果训练集没覆盖，往往需要收集样本、重新标注、重新训练、重新部署，周期可能是 1-3 个月。

- 分布外容易失效。训练数据大量是英文缩写，但客户真实系统主要是拼音缩写，准确率就很难维持宣传值。

- 非结构化场景覆盖不足。字段分类器天然面向结构化字段，对 PDF、合同、扫描件、API 报文、客服录音转写等场景，往往需要另起一套机制。

- 跨行业扩展成本高。从金融扩到医疗、电信、政务，不是简单换一份配置，而是重新收集标注数据、重新训练模型。

识别它，可以问一个直接的问题：如果我们要识别一类你们训练数据里从未见过的业务字段，多久能上线？如果答案是“几小时内通过知识库扩展可用”，那至少说明它在往业务推理方向走；如果答案是“需要收集样本、训练新版本模型，预计 1-3 个月”，那它仍然是典型训练式路线。

# 四、为什么这些工具长期存在

这里需要说得公允一点：以上三类工具不是简单的“骗局”。在合适场景下，它们都能创造价值。字典和规则可以做基础扫描，小模型也能提升常见字段识别效果。真正的问题，是它们被包装成了更强的 AI 能力，导致客户对适用边界产生误判。

伪 AI 长期存在，大致有三层原因。

- 客户侧存在认知门槛。分类分级横跨 AI、数据库、安全、业务和监管，采购团队能验证产品是否能输出报告，却很难判断底层到底是模型、规则，还是业务推理。

- 厂商侧有技术债。传统数据安全厂商多起家于审计、DLP、脱敏等规则型产品。真正转向 AI 推理，不是做一次界面升级，而是重做底层工作机制。

- 监管侧也有现实节奏。早期监管更关心企业是否动起来，先有清单、先有制度、先有流程。这个阶段，规则型工具确实有过渡价值。

不过，2026 年的情况不一样了。93 号文强调动态运营，“四个一批”意味着执法链条会更实，监管也会越来越关心分类依据、整改闭环和持续更新能力。换句话说，能不能生成一张清单已经不够了，工具必须能解释、能更新、能覆盖真实业务。

# 五、那什么才更接近真 AI 分类分级

反过来看，真正值得企业关注的 AI 分类分级能力，不应该只停留在“识别字段名”。它至少要回答几个问题：

- 遇到训练数据里没见过的字段，能不能结合业务上下文推理，而不是直接失败或回退规则？

- 给出分类结果时，能不能说明依据，包括业务语义、相关字段、适用监管条款，而不是只有标签和置信度？

- 新增监管、新行业、新业务类别时，能不能通过知识库扩展快速适配，而不是重新训练一个模型？

- 结构化字段、非结构化文档、API 报文、音频转写等不同输入，能不能用同一套业务推理机制处理？

- 能不能支持客户自己的分类标准，而不是为每个客户再训练一个子模型？

- 跨国家、跨语言场景下，能不能直接理解业务语义，而不是依赖翻译字典作为中间层？

这几条能力，才是序篇里说的第三代范式：不是把分类分级做成一个字段分类器，而是让 AI 像一个懂业务、懂监管、能解释判断过程的合规专家那样工作。

![图 2：采购方可直接用于 PoC 的四个基础测试](./images/fig-02.png)

# 六、采购方七项 PoC 测试清单

如果你正在评估同类产品，不必一上来就讨论架构、模型和参数。先把测试集准备好，尤其要用自己的真实系统样本，而不是只看厂商演示数据。下面这七项，挑三到四项与你业务最相关的做，基本就能看出差异。

| **#** | **测试场景** | **真 AI 的应有表现** |
|---|---|---|
| 1 | 拼音缩写字段识别 | 对 khxm / shfzh / yhkh 这类拼音首字母字段，识别率保持稳定，不依赖英文字典覆盖。 |
| 2 | 同名异义字段区分 | 同一字段名如 AMT，在交易、风控、精算等不同业务上下文中，能输出不同分类。 |
| 3 | 历史核心字段挑战 | 从 1995-2005 年代建设的老核心系统抽取真实字段，识别率不应明显低于结构化字段平均水平。 |
| 4 | 全新业务类别接入 | 针对训练数据从未涉及的新业务类别，上线周期应以“小时”或“天”计，而不是“月”。 |
| 5 | 可解释性测试 | 每个分类结果能输出适用监管条款、业务推理依据和置信度构成，而不是只展示触发规则。 |
| 6 | 新监管适配速度 | 新发布的金规、人行、证监等文件，从发布到引擎可引用，周期不应依赖传统发版节奏。 |
| 7 | 非结构化场景覆盖 | PDF 合同、扫描件、API 报文、客服录音转写等场景，能进入同一套判断机制。 |

# 写在最后

回到开头那个问题：为什么企业很难分辨真 AI 与伪 AI？不是企业不专业，而是这个市场对“AI”两个字的使用太宽了。当大多数产品都自称 AI，“是不是 AI”就很容易从技术判断变成营销话术。

所以，采购时不要只看宣传材料，也不要只看厂商准备好的演示数据。更有效的办法，是把产品放进真实场景里测：拼音缩写、行内自定义字段、同名异义字段、训练数据里没见过的新业务。

这四类场景测完，产品的底层机制基本就会自己浮出来。

下一期，我们会接着谈另一个被普遍误用的指标：准确率。当一家厂商告诉你“我们的准确率 95%”时，真正值得追问的，往往不是这个数字，而是它背后的测试方法、样本选择和口径定义。

—— 模界数智