# Agent 时代正在失效的十二个安全假设

> 原载于微信公众号，原题《你在做的安全，是面向过去的安全，还是面向未来的安全？》
> 发布日期：2026-07-27　作者：模界数智
> 原文链接：https://mojiedata.com/insights/past-vs-future-security

---

你在做的安全，是面向过去的安全，还是面向未来的安全？

边界防护、入侵防御、DLP、加密——这些防线防的都是"偷"，它们今天依然管用，但它们面向的是已经被理解的过去。AI 正在制造一类被"问"出来的新风险。两代安全的分水岭，不在工具清单上，而在最底层的隐含假设里。

![图 1](./images/fig-01.png)

## 一、五类工具，一套世界观

打开任何一家企业的数据安全建设清单，大概率是这五件套：DLP、加解密、脱敏、访问控制、UEBA。它们看起来技术路线迥异——有的盯内容，有的管密钥，有的改数据，有的守大门，有的看行为。

但如果往下多问一层，你会发现它们背后共享着同一套"数据安全世界观"。这套世界观从来没有被明说，却写在每一份产品白皮书的字缝里：

一个具有明确身份的人，在一个清晰的边界内，对一份可以识别的数据，执行一种可以枚举的操作；安全系统只要在操作前授权、操作中检查、操作后审计，风险就是可控的。

把它写成一条公式：

已知主体+ 已知数据+ 已知操作+ 已知通道+ 稳定规则= 可控风险

DLP、加密、脱敏、访问控制、UEBA，基本都建立在这条公式上。

这套世界观没有错——它正是"面向过去的安全"的根基。边界防护、入侵防御、DLP、终端管控、堡垒机，防的都是"非法"：非法进入、非法访问、非法外传。一句话：防"偷"。三十年下来，防"偷"的体系已经相当成熟，而且今天依然必要。

而AI——尤其是RAG、Copilot、MCP 和自主Agent——正在制造防"偷"体系没有见过的东西：它把公式里的每一项，从常量慢慢变成变量。这不是个别厂商的判断：NIST 已在2026 年专门立项研究AI Agent 的身份、授权、审计与不可抵赖问题，因为Agent 会自主访问多种数据、工具和应用；OWASP 也把Agent 能够自主计划、行动和决策，视为一条全新的安全边界。

先把三句话说在前面，免得引起误会。第一，这个变化是渐进的，不是一夜之间的：公式松动的速度，取决于企业把多少业务交给了AI——还没有引入AI 的场景里，面向过去的安全今天怎么工作，明天还怎么工作。第二，边界防控依然有效：对外部攻击、终端外设、传统外发通道，这些年建起来的防线仍然是防线，这部分投资一分都没有白花。第三，真正的新问题出在内部：数据在企业内部被AI 检索、理解、组合、再生成的那些环节，是面向过去的工具没有被设计去覆盖的空白地带——这块空白，就是"面向未来的安全"要接管的地方。

所以这不是"推倒重来"，而是一场从根基开始的迁移：面向过去的安全继续值守已知的风险，面向未来的安全在新的假设上重新立起来。两代安全的分水岭，不在工具清单上，而在根基里——真正危险的不是根基在变，而是把"还能再看看"当成一种策略。

下面逐条来看：面向过去的安全所站立的十二个隐含假设，正在怎样一条一条地松动。

![图 2](./images/fig-02.png)

图1 一条公式里的每一项，都在从常量变成变量

## 二、十二个正在松动的隐含假设

假设一：数据是被动对象，不会改变系统行为

传统安全系统眼里，文档是文档，邮件是邮件，网页内容是网页内容——数据只是被读取、复制或传输的东西。

但在AI 系统里，数据同时也是指令。一个网页、一封邮件、一张图片或一个PDF 中，可以藏着一段提示词，让模型改变行为、调用工具、读取其他数据、甚至向外发送信息。OWASP 明确指出，间接提示注入可以来自网页、文件和多模态内容，并可能导致敏感信息泄露、越权工具调用和任意命令执行。

传统安全把数据看成"货物"，AI 系统却可能把货物当成"命令"。

这意味着过去的"内容检测"已经不够。系统还必须回答：这段内容是在陈述事实，还是在下达指令？指令来自用户、系统、网页还是第三方工具？这个数据源有多可信？它有没有资格改变Agent 的行为？

![图 3](./images/fig-03.png)

图2 数据不再只是货物，也可能是命令

假设二：敏感数据是预先存在、可以被识别的

DLP和分类分级的前提是：敏感信息已经写在某个对象里——身份证号、客户名单、财务报表、源代码、合同、商业秘密文档。只要扫描并识别它，就能施加控制。

但AI 可以从多份平平无奇的数据中，推导出原本并不存在的敏感结论。员工考勤记录、项目会议安排、招聘信息、采购记录、邮件语气的微妙变化——单独看每一份都不敏感，经过模型关联之后，却可能推导出：某个部门即将裁员、某家公司准备并购、某位高管即将离职、某个客户资金紧张、某款产品尚未公开的发布日期。

传统DLP 保护的是已经写出来的秘密；AI 环境里，还要保护可以被推理出来的秘密。

这是一种"推理敏感性"或"组合敏感性"——关键词、正则、指纹、单文档分类，都对它无能为力。注意：这不是说DLP 识别不了身份证号了——它识别得依然很好；是"秘密"这个集合本身，多出了一块它看不见的部分。

假设三：数据的敏感等级是稳定不变的

传统分类分级把标签贴在文件、字段或数据表上：公开、内部、秘密、核心。隐含的前提是，数据本身具有相对稳定的敏感等级。

但在AI 环境下，同一份数据的敏感性取决于：谁在问、为什么问、与哪些数据组合、模型已经知道什么、输出给谁、输出精度多高、是否允许批量查询、查询结果能否被持续积累。

举个例子："某地区客户数量"不敏感；但按营业部、年龄、资产规模连续切片之后，就可能重构出客户分布，甚至识别到具体的人。

敏感等级不再是数据的固有属性，而是数据×身份×目的×上下文×聚合程度×输出精度的运行时函数。

![图 4](./images/fig-04.png)

图3 单独看都不敏感，组合后高度敏感

假设四：身份可以代表行为意图

传统访问控制的逻辑链是：用户身份经过认证→用户具有相应角色→角色获得相应权限→因此访问基本可信。

但Agent 的身份和人的身份完全不是一回事。Agent 可能使用用户的OAuth Token、服务账号、API Key，可能继承应用系统的身份，可能调用其他Agent、临时生成子Agent，还可能在多个系统之间传递凭据。

于是，审计日志里"谁访问了数据"显示为James，但实际过程是：James 提出目标→Agent 制定计划→子Agent 搜索数据→MCP 工具查询数据库→另一个模型做汇总→邮件工具发送结果。James 并没有逐条决定其中任何一个查询和动作。

认证能够证明凭据是谁的，却不能证明这一次具体动作符合这个人的真实意图。

这正是NIST 从2026 年开始专门研究Agent 身份、授权、审计和不可抵赖问题的原因。

假设五：权限是静态的，访问路径是直接的

传统IAM 的路径是：用户→应用→数据。

Agent的路径可能是：用户→主Agent →规划Agent →检索Agent →MCP Server →数据库→外部模型→消息工具。每一层单看权限都有限，组合起来却形成了更大的有效权限。

比如：Agent A 可以读客户数据，Agent B 可以访问互联网，Agent C 可以发送邮件，主Agent 可以调用A、B、C。单看每一个都合理，组合起来就是一条"读取客户数据并发送到互联网"的完整能力链。

这叫权限组合风险，或者能力合成风险。

传统访问控制检查"这个主体能不能执行这个动作"；Agent 安全必须检查"这一整条行动链，最终能做成什么"。

![图 5](./images/fig-05.png)

图4 单看都合理，串起来就是风险

假设六：获得访问权，就意味着可以自由使用数据

传统控制解决的是"能不能看"。AI 环境里真正的问题是：看了以后，能拿来做什么？

同一个员工可以为了客户服务读取客户数据，但不能拿去训练模型、不能输入外部大模型、不能建客户评分模型、不能推断客户健康状况、不能生成营销名单、不能与第三方数据关联、不能长期存入Agent 记忆。

传统授权是资源授权："可以访问customer_table"。AI 需要的是目的授权和用途约束："可以为了处理这张工单，在本次会话中读取该客户的必要字段——但不能用于训练、长期记忆、跨客户分析或外部调用。"

假设七：数据访问是一次离散事件

传统安全眼里，访问行为有清晰的开始和结束：打开文件、查询数据库、发送邮件、拷贝U 盘。

但AI 读取一次数据之后，信息可能进入：Prompt 上下文、对话历史、KV Cache、向量数据库、Embedding、Agent 长期记忆、调试日志、可观测性平台、模型供应商日志、训练或微调数据集、其他Agent 的上下文。

一次"读取"，实际上是多次复制和长期传播的开始。

传统系统保护的是原始数据对象；AI 系统里，还必须保护数据进入认知链条之后产生的所有中间状态。

假设八：泄露表现为原文、文件或字段被传出去

DLP擅长发现文件上传、文档外发、身份证号、客户名单、数据库导出、源代码复制——这些能力今天依然在正常工作，边界上的泄露通道，它看得住。

但AI 不一定原样泄露数据。它可以输出摘要、改写、翻译、统计结果、推理结论、代码、图表，可以分批回答，可以给出看似匿名却可重识别的信息。比如，Agent 从不发送完整客户名单——它只是回答了连续几百个"小问题"，最终让提问者重构出了整份名单。

传统DLP 检测的是"输出里有没有敏感数据"；AI 环境还必须判断"输出有没有泄露敏感知识、敏感关系，或足以重构原数据的信息"。

![图 6](./images/fig-06.png)

图5 一次读取，是长期传播的开始；泄露也不再只是原文外传

假设九：加密能够有效解决机密性问题

加密非常重要，而且它承诺的部分并没有失守：静态存储泄露、传输窃听、介质丢失、未授权的直接读取，它照样防得住。它的隐含前提是：数据解密之后，使用数据的程序是可信且行为确定的。

AI恰好落在这个前提之外。模型要理解数据，就必须在某个执行环境里看到明文。真正的风险发生在解密之后：模型推理时、工具调用时、上下文拼接时、结果生成时、写入记忆时。

加密保护的是数据到达AI 之前和离开AI 之后；而新增的风险，恰恰集中在数据正在被AI 使用的那一段。

假设十：脱敏后的数据已经安全

姓名替换、证件号掩码、手机号隐藏、数据泛化、Tokenization——传统脱敏认为这样就能阻止识别到个人。

但模型拥有远超预期的关联与推理能力。即使删掉姓名，只要保留年龄、职位、地区、交易时间、特殊经历、就诊记录、会议时间，模型仍可能借助互联网、内部知识库或其他数据集，把这个人重新"认出来"。

脱敏的隐含假设是"攻击者只看得到眼前这一份数据"；而AI 环境里，模型手里握着当前数据、内部知识库、互联网信息、历史会话，外加推理能力。

脱敏必须从"字段遮挡"升级为一个动态评估问题：在给定攻击者知识、模型能力和可查询次数的情况下，是否仍然可以重识别或推断？

假设十一：异常行为可以通过历史基线发现

UEBA的前提是：人的行为相对稳定、异常操作有限、风险能对应到账号、登录/下载/访问量/时间/地点足以刻画行为。对人的行为，这套前提今天依然大体成立。

但Agent 的正常行为，本身就长得像攻击：一秒访问数百份文件、自动跨系统查询、24 小时持续运行、根据任务动态改变路径、自动生成脚本、调用大量API、创建子任务、失败后自动重试和自我纠错。

这让传统UEBA 面临双重困境：第一，Agent 的合法行为看起来就像攻击；第二，恶意行为可以伪装成正常任务链中一个合理的步骤。

传统UEBA 分析的是"这个账号的行为是否异常"；AI 环境更需要分析的是"这一连串行为，是否仍然服务于最初被授权的那个目标"。

这是一种从"行为异常检测"到"目标偏离检测"的转变。

假设十二：日志可以还原事实，人工审批可以兜底

传统治理相信，即使事前控制失效，还可以查日志、追账号、找到责任人；高风险操作还有人工审批把关。

但AI Agent 会动态规划、多次尝试、调用外部模型、读取未被记录的上下文、受历史记忆影响，而且无法稳定复现相同结果。MITRE 对Agent 系统的调查已经展示了完整的攻击链：不可信的网页、消息和第三方技能进入Agent 记忆，随后影响工具调用、凭据使用、数据外传，甚至触发破坏性操作。

人工审批同样撑不住：操作数量太多、审批人看不到完整上下文、单个动作看似无害、真正的风险来自多个动作的组合——高频审批的终点，是机械点击"同意"。

![图 7](./images/fig-07.png)

图6 正在松动的十二个隐含假设

## 三、往下再挖一层：这些工具真正共享的五个底层假设

把十二条归拢，传统数据安全其实站在五块更深的地基上：

底层假设

传统世界

AI 现实

稳定性假设

主体、数据、权限、用途、敏感等级相对稳定

在AI 链路中运行时动态变化

可分离假设

数据、指令、代码、行为可以分开处理

文本既是数据，也是代码和命令

可观察假设

重要行为必经网关、终端、数据库或网络通道

敏感信息藏在推理、记忆、Embedding、上下文和语义输出里

确定性假设

相同输入和规则产生大致相同结果

生成式模型非确定，Agent 随环境动态规划

人类主体假设

行为由一个有判断力、能负责的人发起

Agent 自主决定步骤，却没有人类的意图、伦理和责任能力

五块地基都没有塌，但都出现了不同程度的沉降——沉得最深的，恰恰是企业里AI 用得最深的那几块。还没被AI 触及的业务，站的仍是原来的硬地。

![图 8](./images/fig-08.png)

图7 五块地基的传统世界与AI 现实

## 四、安全的控制对象变了：从数据对象到"认知—行动闭环"

有人会问：这不就是零信任吗？

方向一致，但层次不同。零信任取消的是网络和身份层的隐式信任——它回答"你是谁、能不能进来"；而这里要取消的，是语义和用途层的隐式信任——"你理解了什么、推理出了什么、打算拿它去做什么"。前者零信任已经给出了答案，后者才刚刚开始有人回答。

传统数据安全保护的是：数据对象及其传输过程。这条防线在边界上依然成立，也依然必要。

AI时代需要在它旁边再立一条：保护数据被获取、理解、组合、推理、生成、记忆，并转化为行动的整个过程。

安全控制对象在原有的Data Object 之外，多出了Data →Context →Reasoning →Decision →Action →Memory 的完整"认知—行动闭环"。

![图 9](./images/fig-09.png)

图8 控制对象：从数据对象到认知—行动闭环

## 五、下一代数据安全需要建立的五个新前提

再强调一次：面向过去的安全没有失效——在边界侧，它们仍然是主力，继续值守外部攻击和传统外泄通道。需要新建的，是面向未来的那半边：内部数据使用侧的防线。新的体系至少要立起五根柱子。

第一，从身份授权转向任务授权。不能只问"Agent 是谁"，还要绑定：谁委托的、要完成什么任务、有效期多久、允许用哪些数据、允许调哪些工具、允许产生什么类型的结果。任务结束，权限自动失效。

第二，从一次性授权转向持续授权。每一次检索、推理、工具调用、外部发送和记忆写入，都需要重新判断风险，而不是登录一次、全程信任。这与零信任"取消隐式信任、持续验证"的方向一致——只是把验证从网络会话，下沉到了每一次认知动作。

第三，从数据标签转向数据血缘和推理血缘。不仅记录输出包含什么，还要知道：输出来自哪些数据、经过哪些模型、用了哪些Prompt、调了哪些工具、哪个Agent 做的决定、哪些是原始事实、哪些是模型推断。

第四，从内容检测转向意图和用途检测。不仅识别"有没有敏感数据"，还要判断：是否符合业务目的、是否超出最小必要、是否发生跨域组合、是否可能重识别、是否正在积累式查询、是否产生了高敏感推论。

第五，从单点工具转向运行时控制平面。需要一个覆盖AI 全链路的运行时安全控制层：Prompt 输入、RAG 检索、上下文组装、模型调用、MCP 与工具调用、Agent 间通信、输出生成、长短期记忆、外部发送、审计与追责——十个环节，一个平面。

![图 10](./images/fig-10.png)

图9 从传统前提到下一代数据安全的五个新前提

## 六、结语

面向过去的安全，隐含前提是：数据风险产生于"非法访问或非法传输"。这个前提在边界上依然成立，所以边界防线不用动、也不能撤。

AI时代新增的现实是：即使每一次访问都是合法的，数据仍然可能在合法的检索、推理、组合和自动行动中，悄悄产生风险。数据不是被偷走的——每一道防"偷"的墙都还立着；它是被一句一句合法的提问，"问"走的。防"偷"，是面向过去的安全；防"问"，是面向未来的安全。

所以，AI 时代数据安全的核心问题，在"谁能访问什么数据"之外，又多了一个：谁或哪个Agent，基于什么目的，在什么上下文中，可以让哪些数据参与何种推理，并产生什么结果、采取什么行动，以及这些结果能够流向哪里。

这将是传统DLP 向AI Data Security、AI Usage Control、Agent Runtime Security 演进的理论起点。

所以回到标题的问题——答案不是二选一。面向过去的安全必须留着，它守住的是已经被理解的风险；但一套只面向过去的安全体系，等于把未来交给运气。企业每多接入一个AI 场景，"未来"就多占一分。迁移不必一步到位，但必须从现在开始，而且要从正确的地方开始：不是多买一件工具，而是换一块根基。

而新根基的第一块基石，十二个假设里已经反复出现：无论任务授权、持续授权还是运行时控制平面，每一次放行与拦截的前提，都是系统能在毫秒之间回答——这条数据是什么、什么等级、在当前上下文里意味着什么。这也是我们做AiDClass 时始终坚持的起点：让数据先学会自己说话，面向未来的一切判断才有依据。

参考资料

[1] NIST，Accelerating the Adoption of Software and AI Agent Identity and Authorization（Concept Paper，2026.2）

[2] OWASP Gen AI Security Project，OWASP Top 10 for Agentic Applications for 2026

[3] OWASP Gen AI Security Project，LLM01: Prompt Injection（间接注入来源与后果）

[4] MITRE ATLAS，OpenClaw Investigation（2026.2）

[5] NIST CSRC Glossary，Zero Trust Architecture

说明：文中关于Agent 行为模式与风险场景的部分描述，属于基于公开研究的合理推演，具体企业环境请以实际评估为准。

—— 模界数智