MojieData · 企业 AI 落地与数据安全
让企业 AI 真正落地,
并让数据始终可控
模界数智打通 AI 场景选择、Agent PoC 共创到数据安全治理, 把 AI 从试验推进到生产环境,防范数据泄露与 AI 越权,服务金融、能源、医疗等高监管行业。
普通 AI 咨询公司的重点是「把 AI 做出来」,传统安全厂商的重点是「不要出风险」。 我们在两者中间:既懂怎么把 AI 做出来,又懂怎么让企业数据、权限和安全跟着 AI 一起落地。 帮助客户减少 AI 项目沉没成本,满足行业合规监管要求。
从真实业务场景开始,先判断价值、可行性和数据准备度
让知识库、RAG 与 Agent 在权限和评估体系里一起落地
把一个成功场景沉淀为可以复制的企业 AI 能力
企业不缺 AI 想法,缺的是把 AI 真正上线的路径
几十个 AI 想法,哪个值得先做?
排序依据不是谁提得急,而是价值、可行性和数据准备度三者的交集。
企业文件是否具备进入 RAG / Agent 的条件?
文档说明里的数据总是干净的。真实数据里有重复版本、扫描件、失传的命名规范。
PoC 怎么从 Demo 变成稳定生产系统?
差距不在模型,在评估方式、数据管道、权限完整性和运维。
AI 能访问哪些数据,代表谁行动,怎么防越权?
这些问题必须和 AI 应用同步设计,上线前才补的代价是重做数据管道。
从场景到生产的四步闭环
这四步不是瀑布式阶段,而是一个闭环——第四步产出的治理规则,会回过头来改变第一步的场景排序。
Diagnose 找对场景
- AI 场景清单
- 价值 / 可行性评估
- 数据准备度
- 风险分析
- PoC 范围与验收指标
客户收益过滤低价值 AI 想法,避免盲目投入项目
Build 做出 PoC
- RAG / 知识库
- Agent / 工作流
- 模型与系统集成
- 评估与测试
- 生产化设计
客户收益自带可投产路径,减少二次返工
Secure 让数据可控
- 数据发现
- 分类分级
- 敏感数据识别
- RAG 权限继承
- Agent 工具权限
- 审计与风险控制
客户收益内部敏感文档不泄露、Agent 不越权,满足监管审计要求
Scale 从一个场景扩展
- 标准化架构
- 评估体系
- 治理规则
- 平台化能力
- 复制到更多场景
客户收益AI 能力从「一个试点」复制到「全业务线」,多场景复用,摊薄单项目成本
AI 要理解企业数据,企业首先要理解自己的数据
模界·知源 AiDClass 面向 PDF、Word、PPT、邮件、 文本等非结构化数据,也覆盖数据库表与字段等结构化数据,通过内容理解与规则能力识别数据类别、敏感属性和安全级别, 并把标签输出给数据治理、RAG、Agent、DLP 等系统, 为企业 AI 提供可治理、可授权、可审计的数据基础。
企业知识库的权限不能靠在检索结果上加一道过滤解决。正确做法是让分类分级标签和原始访问权限,从原始文件一路继承到页面、切片、向量索引、模型上下文和最终回答,目标是让越权内容在候选阶段就被排除,不进入模型上下文。分类分级回答「这是什么数据、多敏感」,权限回答「这个人能不能看这个对象」,两者必须同时成立。
- 分类分级不能单独替代权限——L2 级别的文档也可能只属于某个项目组。
- 优先在检索阶段就按权限约束候选范围;召回后的过滤可以作为复核,但无论过滤发生在哪一步,都要保证未授权内容不进入模型上下文、外部服务和用户可见结果。
- 标签继承链断在任何一环(页面、切片、向量、回答),后面的权限判断都失去依据。
Agent 的安全问题和知识库不是一回事。知识库管的是「AI 能读什么」,Agent 管的是「AI 能做什么」——调用哪些工具、访问哪些 API、执行哪些业务动作、记住哪些内容。核心风险来自三处:Agent 使用超越用户权限的服务账号、工具调用缺少参数级授权、以及记忆在不同用户与会话之间串流。三者都必须在执行之前判定,事后审计无法替代。
- 读取权限与执行权限必须分别判断——用户能看到数据,不代表 Agent 可以把它发到任意地方。
- Agent 用服务账号跑,是最常见也最危险的默认设计:权限过大、长期有效、审计追不到真实委托人。
- 工具授权要到参数级和目标资源级,仅授权「能不能调这个工具」远远不够。
非结构化数据分类分级的难点不是打标签,而是判断「这份数据服务于什么业务、对应哪条法规、在什么组合下会升级为高敏感」。做法是先理解内容(抽取用途、主体、对象、环节等要素),再结合业务目录、行业规则和真实填写状态逐级判断,最后把标签转化为 DLP、知识库、外发与 Agent 的可执行策略。准确率必须结合测试方法看——测试集来源、是否含历史遗留命名、未识别项是否计入分母,都会显著改变结果。
- 打标签是结果,不是方法——难在业务语义判断,不在标签本身。
- 判定稳定性应该排在准确率之前:两轮一致率不到 95% 时,准确率数字落在噪声里。
- 类目粒度可以量化诊断:每个叶子承载多少字段、跨多少来源系统。
行业
不同行业的 AI 落地难点,难在监管口径、数据形态和权限结构上,不难在模型上。
案例与实践
以下均为真实项目,客户信息已做匿名处理。每个案例都标注了项目进展阶段,只写已经发生的做法与结果。
最新洞察
-
AI 读规则,代码算价格:不能出错的业务系统里,模型和代码的分工线画在哪
印刷报价算错一个数字要真金白银赔。这个系统让模型读懂自然语言报价表、理解自由文本备注、对缺项提候选,但最终价格必须由规则引擎产出并附带计算路径。本文记录那条分工线,以及 12 条兜底校验、一张术语表和一个「匹配不上就不猜」的设计。
-
企业 RAG 的准确率是在入库前挣出来的:12 个杠杆、六条铁律与一次 4000 个垃圾切片的事故
同一批源文件,第一次处理出 6961 个切片、词表 47 万,答案似是而非;修正解析方式后变成 2884 个真实切片、词表 10 万,内容零丢失。本文复盘一个已上线企业知识库的完整过程,以及按性价比排序的 12 个准确率杠杆。
-
电力数据分类分级落地实录:356 个类目、3.1 万字段与一次全量实测
《能源行业数据分类分级指南(2026年版)》只规定了一、二级分类维度,三、四级要企业自己建。本文记录一个省级电网企业标准从条文到可执行类目的完整过程、三条原创判据,以及一次 520 篇全量跑批的真实结果与局限。
-
AI 数据安全:哪些能买到,哪些必须自建
上一篇提出了“先给数据建立语义标签,再逐层建设授权、控制与审计”的架构,收到不少关于落地的追问。这一篇基于公开资料梳理国际产品的现状,并借这些事实反过来检验上一篇的判断:哪些成立,哪些只部分成立,哪些还缺证据……
正在规划企业 AI 相关项目?
建议从真实业务场景切入,优先完成项目诊断:评估业务价值、核查数据基础、识别安全与权限风险, 审慎评估之后,再决定是否启动 PoC 原型建设,避免无效投入。
预约 30 分钟交流