模界·知源
识别每一份数据,并形成可执行的治理与安全策略。
知其源——知道一份数据从哪来、是什么、归谁管、对应哪条法规。这是后面所有控制的依据。
产品定位
模界·知源 从数据分类分级出发,演进为企业数据安全控制平面,以非结构化数据为重点,同时覆盖结构化数据。它以内容理解和分类分级为根,为企业建立统一的数据身份、风险判断和策略依据,并逐步连接不同厂商的数据安全产品。
不建议的理解:不是一个文档分类工具,也不替代所有数据安全产品。
核心能力
| 能力域 | 主要能力 | 输出 |
|---|---|---|
| 发现与解析 | 发现文件,解析正文、表格、图片与 OCR 内容,识别音视频中的语言,保留来源与版本 | 可处理的数据对象与证据 |
| 内容识别 | 识别业务用途、敏感字段、实体与上下文 | 识别结果、置信度与证据片段 |
| 分类分级 | 结合目录、行业规则、字段参考级别与真实填写状态进行判断 | 业务类别、安全级别与解释 |
| 策略生成 | 把标签转化为 DLP、知识库、共享、外发与 Agent 使用策略建议 | 可审批的策略建议,可半自动下发至 DLP 执行 |
| 资产地图 | 按文件类别、级别及在存储资源中的分布展示,并警示错位存储 | 错位存储提示与整改建议 |
| 审计与评估 | 记录模型、规则、版本、证据、决策与执行结果 | 可解释、可审计、可回放的证据链 |
产品原则
- AI 给方向,代码守底线
- AI 负责理解和判断,权限与执行控制由确定性代码和策略引擎完成。
- 业务用途优先
- 分类首先回答数据服务于什么业务,再判断字段和安全级别。
- 结合上下文、就高定级
- 基础级别、敏感字段和真实填写状态共同决定最终级别。
- 诚实降级
- 无法可靠识别时明确标记不确定性,进入人工复核或保守策略。
- 私有化与可替换
- 支持客户本地模型、多模型切换和知识图谱热更新。
能力矩阵
以当前发布版本(v4.0)为准,逐项标注状态。
| 项目 | 说明 | 状态 |
|---|---|---|
| 文档格式 | 原生解析 Word(.doc / .docx)、Excel(.xlsx)、PowerPoint(.pptx)、PDF、SQL 导出;兜底解析旧版 Office(.xls / .ppt)、OpenDocument、RTF、HTML / MHTML、EPUB,以及纯文本、代码、配置与日志。按内容而非扩展名识别格式,不符即拒收。 | 已验证 |
| 压缩包 | zip、tar、tar.gz、rar 递归解压,限制嵌套深度与解压总量以防压缩炸弹。7z 暂不支持。 | 已验证 |
| 扫描件 / 图片 | 本地 CPU OCR(RapidOCR),无文本层的 PDF 自动转 OCR,默认处理前 20 页。低置信时可回退视觉大模型;私有化环境应配置本地模型,否则回退调用会出网。 | 已验证 |
| 音视频 | 由内网采集器做语音转写后再分类,默认关闭、按需启用。 | 开发中 |
| 数据源 | 11 类连接器:PostgreSQL、MySQL、Elasticsearch、MongoDB、Hive、FTP、SFTP、NFS、SMB、S3 兼容对象存储、HTTP,并支持 Oracle 与达梦、人大金仓、GBase 等国产数据库。 | 支持 |
| 输出 | 四级分类路径、安全级别、置信度、判定理由与复核状态。安全级别由命中的标准节点继承,不由模型自行决定。结果可导出 Excel / CSV。 | 已验证 |
| 分类标准 | 内置多套行业标准(含对标 GB/T 42775 的证券行业标准),可导入客户自有标准或既有分类分级结果。 | 已验证 |
| 部署 | 私有化 Docker Compose 部署,Ubuntu 22.04 / 24.04,提供离线安装包;平台本身不需要 GPU。大模型由客户提供,可接本地模型或 OpenAI 兼容接口。 | 已验证 |
| 接口 | REST API(文本、文件、数据库、批量分类),API Key 鉴权;提供 MCP 服务,可被 Agent 直接调用。 | 已验证 |
| 处理耗时 | 普通 PDF 单文件约 7–12 秒(中位约 8 秒),主要耗时在大模型分类;扫描件显著更慢。测试条件:2026 年 4 月,云端大模型,18 份银行表单 PDF,无缓存。 | 已验证 |
| 文件打标 | 把分类分级结果写入 Office 文档属性与 PDF 元数据,供下游系统读取。 | 开发中 |
| DLP 联动 | 分类分级结果与策略建议经人工确认后下发 DLP 执行(半自动化)。 | 已验证 |
| 自动化防护联动 | 无人工环节的实时联动,以及分级防护策略(脱敏、加密、水印、访问控制)与风险告警。 | 规划中 |
准确率与测试条件
| 测试范围 | 测试集 | 结果 | 时间 |
|---|---|---|---|
| 证券行业文档分类,精确到第四级类目 | 196 篇依据标准生成的测试文档 | 82% → 86%(调优前后);一级类目 92% | 2026-07 |
| 字段级识别与定级 | 不同行业标准、不同口径 | 差异较大,尚无统一口径的正式报告,暂不公布单一数字 | — |
以上测试集为依据行业标准生成的文档,调优与评测使用同一批数据,不是独立留出集,只能说明方法在该标准下的表现。客户真实数据的准确率必须在 PoC 中用客户自己的样本重新测,这也是我们建议的验收方式。
当前边界
我们区分「已经验证」和「还没做到」,不把规划中的能力写成现有能力。
- 已验证 文件级业务分类、字段识别与定级,已在生成测试集和有限的客户 PoC 样本中验证。
- 规划中 十万至百万级吞吐、与安全系统的全自动实时联动、分级防护与风险告警,以及跨行业的统一准确率报告,仍需专项开发与试点验证。
常见问题
知源和传统 DLP 是什么关系?
+
DLP 解决「拦不拦」,知源解决「该拦什么」。传统 DLP 靠正则和关键词识别敏感内容,规则脆弱、误报高;知源提供带业务语义的分类分级结果,作为 DLP 的判断依据。两者是互补关系,不是替代关系。
分类分级不就是给文件打标签吗?
+
打标签是结果,不是方法。难点在于判断「这份数据服务于什么业务、对应哪条法规、在什么组合下会升级为高敏感」。只按字段名匹配的工具,在拼音缩写、同名异义、历史遗留命名面前会大幅失效。
准确率能到多少?
+
目前能公开的是:证券行业 196 篇生成测试文档上,精确到第四级类目的文档分类准确率 86%(2026 年 7 月)。字段级结果随标准和口径差异较大,还没有统一口径的正式报告,所以不给单一数字。任何准确率都必须结合测试方法看——测试集是否由客户从生产环境抽取、是否包含拼音缩写与历史遗留字段、未识别项是否计入分母,都会显著改变结果。我们建议用客户自己的样本在 PoC 中实测。
支持私有化部署吗?
+
支持,并可使用客户本地模型。重要数据尽量不离开客户环境是产品的默认设计前提。
已有的分类分级结果能复用吗?
+
可以。知源可以导入客户既有的分类分级结果或手工标签,也可以独立服务于 DLP、数据治理、迁移与审计系统。
配套的服务平台
知源回答「这是什么数据」。落地 RAG 与 Agent 时,我们在开源基座或客户现有平台上,把知源输出的标签与权限依据接进去。这两层不是独立产品,是我们做服务用的平台。