模 模界数智
数据分类分级

模界·知源

AiDClass
这是什么数据?

识别每一份数据,并形成可执行的治理与安全策略。

知其源——知道一份数据从哪来、是什么、归谁管、对应哪条法规。这是后面所有控制的依据。

想看看实际效果?

用你自己的一批真实数据做小范围验证,比看演示更有说服力。

产品定位

模界·知源 从数据分类分级出发,演进为企业数据安全控制平面,以非结构化数据为重点,同时覆盖结构化数据。它以内容理解和分类分级为根,为企业建立统一的数据身份、风险判断和策略依据,并逐步连接不同厂商的数据安全产品。

不建议的理解:不是一个文档分类工具,也不替代所有数据安全产品。

AiDClass 将非结构化文件解析、理解并分类分级,形成类别、级别、证据和策略,再输出给 DLP、RAG、Agent 与治理系统
AiDClass 提供可信判断依据,下游系统继续负责确定性执行。

核心能力

发现解析、内容识别、分类分级、策略生成、资产地图和审计评估六类能力围绕统一数据身份协同工作
能力域 主要能力 输出
发现与解析 发现文件,解析正文、表格、图片与 OCR 内容,识别音视频中的语言,保留来源与版本 可处理的数据对象与证据
内容识别 识别业务用途、敏感字段、实体与上下文 识别结果、置信度与证据片段
分类分级 结合目录、行业规则、字段参考级别与真实填写状态进行判断 业务类别、安全级别与解释
策略生成 把标签转化为 DLP、知识库、共享、外发与 Agent 使用策略建议 可审批的策略建议,可半自动下发至 DLP 执行
资产地图 按文件类别、级别及在存储资源中的分布展示,并警示错位存储 错位存储提示与整改建议
审计与评估 记录模型、规则、版本、证据、决策与执行结果 可解释、可审计、可回放的证据链

产品原则

AI 给方向,代码守底线
AI 负责理解和判断,权限与执行控制由确定性代码和策略引擎完成。
业务用途优先
分类首先回答数据服务于什么业务,再判断字段和安全级别。
结合上下文、就高定级
基础级别、敏感字段和真实填写状态共同决定最终级别。
诚实降级
无法可靠识别时明确标记不确定性,进入人工复核或保守策略。
私有化与可替换
支持客户本地模型、多模型切换和知识图谱热更新。

能力矩阵

以当前发布版本(v4.0)为准,逐项标注状态。

项目 说明 状态
文档格式 原生解析 Word(.doc / .docx)、Excel(.xlsx)、PowerPoint(.pptx)、PDF、SQL 导出;兜底解析旧版 Office(.xls / .ppt)、OpenDocument、RTF、HTML / MHTML、EPUB,以及纯文本、代码、配置与日志。按内容而非扩展名识别格式,不符即拒收。 已验证
压缩包 zip、tar、tar.gz、rar 递归解压,限制嵌套深度与解压总量以防压缩炸弹。7z 暂不支持。 已验证
扫描件 / 图片 本地 CPU OCR(RapidOCR),无文本层的 PDF 自动转 OCR,默认处理前 20 页。低置信时可回退视觉大模型;私有化环境应配置本地模型,否则回退调用会出网。 已验证
音视频 由内网采集器做语音转写后再分类,默认关闭、按需启用。 开发中
数据源 11 类连接器:PostgreSQL、MySQL、Elasticsearch、MongoDB、Hive、FTP、SFTP、NFS、SMB、S3 兼容对象存储、HTTP,并支持 Oracle 与达梦、人大金仓、GBase 等国产数据库。 支持
输出 四级分类路径、安全级别、置信度、判定理由与复核状态。安全级别由命中的标准节点继承,不由模型自行决定。结果可导出 Excel / CSV。 已验证
分类标准 内置多套行业标准(含对标 GB/T 42775 的证券行业标准),可导入客户自有标准或既有分类分级结果。 已验证
部署 私有化 Docker Compose 部署,Ubuntu 22.04 / 24.04,提供离线安装包;平台本身不需要 GPU。大模型由客户提供,可接本地模型或 OpenAI 兼容接口。 已验证
接口 REST API(文本、文件、数据库、批量分类),API Key 鉴权;提供 MCP 服务,可被 Agent 直接调用。 已验证
处理耗时 普通 PDF 单文件约 7–12 秒(中位约 8 秒),主要耗时在大模型分类;扫描件显著更慢。测试条件:2026 年 4 月,云端大模型,18 份银行表单 PDF,无缓存。 已验证
文件打标 把分类分级结果写入 Office 文档属性与 PDF 元数据,供下游系统读取。 开发中
DLP 联动 分类分级结果与策略建议经人工确认后下发 DLP 执行(半自动化)。 已验证
自动化防护联动 无人工环节的实时联动,以及分级防护策略(脱敏、加密、水印、访问控制)与风险告警。 规划中

准确率与测试条件

测试范围 测试集 结果 时间
证券行业文档分类,精确到第四级类目 196 篇依据标准生成的测试文档 82% → 86%(调优前后);一级类目 92% 2026-07
字段级识别与定级 不同行业标准、不同口径 差异较大,尚无统一口径的正式报告,暂不公布单一数字 —

以上测试集为依据行业标准生成的文档,调优与评测使用同一批数据,不是独立留出集,只能说明方法在该标准下的表现。客户真实数据的准确率必须在 PoC 中用客户自己的样本重新测,这也是我们建议的验收方式。

当前边界

我们区分「已经验证」和「还没做到」,不把规划中的能力写成现有能力。

  • 已验证 文件级业务分类、字段识别与定级,已在生成测试集和有限的客户 PoC 样本中验证。
  • 规划中 十万至百万级吞吐、与安全系统的全自动实时联动、分级防护与风险告警,以及跨行业的统一准确率报告,仍需专项开发与试点验证。

常见问题

知源和传统 DLP 是什么关系?

+

DLP 解决「拦不拦」,知源解决「该拦什么」。传统 DLP 靠正则和关键词识别敏感内容,规则脆弱、误报高;知源提供带业务语义的分类分级结果,作为 DLP 的判断依据。两者是互补关系,不是替代关系。

分类分级不就是给文件打标签吗?

+

打标签是结果,不是方法。难点在于判断「这份数据服务于什么业务、对应哪条法规、在什么组合下会升级为高敏感」。只按字段名匹配的工具,在拼音缩写、同名异义、历史遗留命名面前会大幅失效。

准确率能到多少?

+

目前能公开的是:证券行业 196 篇生成测试文档上,精确到第四级类目的文档分类准确率 86%(2026 年 7 月)。字段级结果随标准和口径差异较大,还没有统一口径的正式报告,所以不给单一数字。任何准确率都必须结合测试方法看——测试集是否由客户从生产环境抽取、是否包含拼音缩写与历史遗留字段、未识别项是否计入分母,都会显著改变结果。我们建议用客户自己的样本在 PoC 中实测。

支持私有化部署吗?

+

支持,并可使用客户本地模型。重要数据尽量不离开客户环境是产品的默认设计前提。

已有的分类分级结果能复用吗?

+

可以。知源可以导入客户既有的分类分级结果或手工标签,也可以独立服务于 DLP、数据治理、迁移与审计系统。

配套的服务平台

知源回答「这是什么数据」。落地 RAG 与 Agent 时,我们在开源基座或客户现有平台上,把知源输出的标签与权限依据接进去。这两层不是独立产品,是我们做服务用的平台。