Agent 时代正在失效的十二个安全假设
本文原载于微信公众号,原题《你在做的安全,是面向过去的安全,还是面向未来的安全?》。
你在做的安全,是面向过去的安全,还是面向未来的安全?
边界防护、入侵防御、DLP、加密——这些防线防的都是”偷”,它们今天依然管用,但它们面向的是已经被理解的过去。AI 正在制造一类被”问”出来的新风险。两代安全的分水岭,不在工具清单上,而在最底层的隐含假设里。

一、五类工具,一套世界观
打开任何一家企业的数据安全建设清单,大概率是这五件套:DLP、加解密、脱敏、访问控制、UEBA。它们看起来技术路线迥异——有的盯内容,有的管密钥,有的改数据,有的守大门,有的看行为。
但如果往下多问一层,你会发现它们背后共享着同一套”数据安全世界观”。这套世界观从来没有被明说,却写在每一份产品白皮书的字缝里:
一个具有明确身份的人,在一个清晰的边界内,对一份可以识别的数据,执行一种可以枚举的操作;安全系统只要在操作前授权、操作中检查、操作后审计,风险就是可控的。
把它写成一条公式:
已知主体+ 已知数据+ 已知操作+ 已知通道+ 稳定规则= 可控风险
DLP、加密、脱敏、访问控制、UEBA,基本都建立在这条公式上。
这套世界观没有错——它正是”面向过去的安全”的根基。边界防护、入侵防御、DLP、终端管控、堡垒机,防的都是”非法”:非法进入、非法访问、非法外传。一句话:防”偷”。三十年下来,防”偷”的体系已经相当成熟,而且今天依然必要。
而AI——尤其是RAG、Copilot、MCP 和自主Agent——正在制造防”偷”体系没有见过的东西:它把公式里的每一项,从常量慢慢变成变量。这不是个别厂商的判断:NIST 已在2026 年专门立项研究AI Agent 的身份、授权、审计与不可抵赖问题,因为Agent 会自主访问多种数据、工具和应用;OWASP 也把Agent 能够自主计划、行动和决策,视为一条全新的安全边界。
先把三句话说在前面,免得引起误会。第一,这个变化是渐进的,不是一夜之间的:公式松动的速度,取决于企业把多少业务交给了AI——还没有引入AI 的场景里,面向过去的安全今天怎么工作,明天还怎么工作。第二,边界防控依然有效:对外部攻击、终端外设、传统外发通道,这些年建起来的防线仍然是防线,这部分投资一分都没有白花。第三,真正的新问题出在内部:数据在企业内部被AI 检索、理解、组合、再生成的那些环节,是面向过去的工具没有被设计去覆盖的空白地带——这块空白,就是”面向未来的安全”要接管的地方。
所以这不是”推倒重来”,而是一场从根基开始的迁移:面向过去的安全继续值守已知的风险,面向未来的安全在新的假设上重新立起来。两代安全的分水岭,不在工具清单上,而在根基里——真正危险的不是根基在变,而是把”还能再看看”当成一种策略。
下面逐条来看:面向过去的安全所站立的十二个隐含假设,正在怎样一条一条地松动。

图1 一条公式里的每一项,都在从常量变成变量
二、十二个正在松动的隐含假设
假设一:数据是被动对象,不会改变系统行为
传统安全系统眼里,文档是文档,邮件是邮件,网页内容是网页内容——数据只是被读取、复制或传输的东西。
但在AI 系统里,数据同时也是指令。一个网页、一封邮件、一张图片或一个PDF 中,可以藏着一段提示词,让模型改变行为、调用工具、读取其他数据、甚至向外发送信息。OWASP 明确指出,间接提示注入可以来自网页、文件和多模态内容,并可能导致敏感信息泄露、越权工具调用和任意命令执行。
传统安全把数据看成”货物”,AI 系统却可能把货物当成”命令”。
这意味着过去的”内容检测”已经不够。系统还必须回答:这段内容是在陈述事实,还是在下达指令?指令来自用户、系统、网页还是第三方工具?这个数据源有多可信?它有没有资格改变Agent 的行为?

图2 数据不再只是货物,也可能是命令
假设二:敏感数据是预先存在、可以被识别的
DLP和分类分级的前提是:敏感信息已经写在某个对象里——身份证号、客户名单、财务报表、源代码、合同、商业秘密文档。只要扫描并识别它,就能施加控制。
但AI 可以从多份平平无奇的数据中,推导出原本并不存在的敏感结论。员工考勤记录、项目会议安排、招聘信息、采购记录、邮件语气的微妙变化——单独看每一份都不敏感,经过模型关联之后,却可能推导出:某个部门即将裁员、某家公司准备并购、某位高管即将离职、某个客户资金紧张、某款产品尚未公开的发布日期。
传统DLP 保护的是已经写出来的秘密;AI 环境里,还要保护可以被推理出来的秘密。
这是一种”推理敏感性”或”组合敏感性”——关键词、正则、指纹、单文档分类,都对它无能为力。注意:这不是说DLP 识别不了身份证号了——它识别得依然很好;是”秘密”这个集合本身,多出了一块它看不见的部分。
假设三:数据的敏感等级是稳定不变的
传统分类分级把标签贴在文件、字段或数据表上:公开、内部、秘密、核心。隐含的前提是,数据本身具有相对稳定的敏感等级。
但在AI 环境下,同一份数据的敏感性取决于:谁在问、为什么问、与哪些数据组合、模型已经知道什么、输出给谁、输出精度多高、是否允许批量查询、查询结果能否被持续积累。
举个例子:“某地区客户数量”不敏感;但按营业部、年龄、资产规模连续切片之后,就可能重构出客户分布,甚至识别到具体的人。
敏感等级不再是数据的固有属性,而是数据×身份×目的×上下文×聚合程度×输出精度的运行时函数。

图3 单独看都不敏感,组合后高度敏感
假设四:身份可以代表行为意图
传统访问控制的逻辑链是:用户身份经过认证→用户具有相应角色→角色获得相应权限→因此访问基本可信。
但Agent 的身份和人的身份完全不是一回事。Agent 可能使用用户的OAuth Token、服务账号、API Key,可能继承应用系统的身份,可能调用其他Agent、临时生成子Agent,还可能在多个系统之间传递凭据。
于是,审计日志里”谁访问了数据”显示为James,但实际过程是:James 提出目标→Agent 制定计划→子Agent 搜索数据→MCP 工具查询数据库→另一个模型做汇总→邮件工具发送结果。James 并没有逐条决定其中任何一个查询和动作。
认证能够证明凭据是谁的,却不能证明这一次具体动作符合这个人的真实意图。
这正是NIST 从2026 年开始专门研究Agent 身份、授权、审计和不可抵赖问题的原因。
假设五:权限是静态的,访问路径是直接的
传统IAM 的路径是:用户→应用→数据。
Agent的路径可能是:用户→主Agent →规划Agent →检索Agent →MCP Server →数据库→外部模型→消息工具。每一层单看权限都有限,组合起来却形成了更大的有效权限。
比如:Agent A 可以读客户数据,Agent B 可以访问互联网,Agent C 可以发送邮件,主Agent 可以调用A、B、C。单看每一个都合理,组合起来就是一条”读取客户数据并发送到互联网”的完整能力链。
这叫权限组合风险,或者能力合成风险。
传统访问控制检查”这个主体能不能执行这个动作”;Agent 安全必须检查”这一整条行动链,最终能做成什么”。

图4 单看都合理,串起来就是风险
假设六:获得访问权,就意味着可以自由使用数据
传统控制解决的是”能不能看”。AI 环境里真正的问题是:看了以后,能拿来做什么?
同一个员工可以为了客户服务读取客户数据,但不能拿去训练模型、不能输入外部大模型、不能建客户评分模型、不能推断客户健康状况、不能生成营销名单、不能与第三方数据关联、不能长期存入Agent 记忆。
传统授权是资源授权:“可以访问customer_table”。AI 需要的是目的授权和用途约束:“可以为了处理这张工单,在本次会话中读取该客户的必要字段——但不能用于训练、长期记忆、跨客户分析或外部调用。”
假设七:数据访问是一次离散事件
传统安全眼里,访问行为有清晰的开始和结束:打开文件、查询数据库、发送邮件、拷贝U 盘。
但AI 读取一次数据之后,信息可能进入:Prompt 上下文、对话历史、KV Cache、向量数据库、Embedding、Agent 长期记忆、调试日志、可观测性平台、模型供应商日志、训练或微调数据集、其他Agent 的上下文。
一次”读取”,实际上是多次复制和长期传播的开始。
传统系统保护的是原始数据对象;AI 系统里,还必须保护数据进入认知链条之后产生的所有中间状态。
假设八:泄露表现为原文、文件或字段被传出去
DLP擅长发现文件上传、文档外发、身份证号、客户名单、数据库导出、源代码复制——这些能力今天依然在正常工作,边界上的泄露通道,它看得住。
但AI 不一定原样泄露数据。它可以输出摘要、改写、翻译、统计结果、推理结论、代码、图表,可以分批回答,可以给出看似匿名却可重识别的信息。比如,Agent 从不发送完整客户名单——它只是回答了连续几百个”小问题”,最终让提问者重构出了整份名单。
传统DLP 检测的是”输出里有没有敏感数据”;AI 环境还必须判断”输出有没有泄露敏感知识、敏感关系,或足以重构原数据的信息”。

图5 一次读取,是长期传播的开始;泄露也不再只是原文外传
假设九:加密能够有效解决机密性问题
加密非常重要,而且它承诺的部分并没有失守:静态存储泄露、传输窃听、介质丢失、未授权的直接读取,它照样防得住。它的隐含前提是:数据解密之后,使用数据的程序是可信且行为确定的。
AI恰好落在这个前提之外。模型要理解数据,就必须在某个执行环境里看到明文。真正的风险发生在解密之后:模型推理时、工具调用时、上下文拼接时、结果生成时、写入记忆时。
加密保护的是数据到达AI 之前和离开AI 之后;而新增的风险,恰恰集中在数据正在被AI 使用的那一段。
假设十:脱敏后的数据已经安全
姓名替换、证件号掩码、手机号隐藏、数据泛化、Tokenization——传统脱敏认为这样就能阻止识别到个人。
但模型拥有远超预期的关联与推理能力。即使删掉姓名,只要保留年龄、职位、地区、交易时间、特殊经历、就诊记录、会议时间,模型仍可能借助互联网、内部知识库或其他数据集,把这个人重新”认出来”。
脱敏的隐含假设是”攻击者只看得到眼前这一份数据”;而AI 环境里,模型手里握着当前数据、内部知识库、互联网信息、历史会话,外加推理能力。
脱敏必须从”字段遮挡”升级为一个动态评估问题:在给定攻击者知识、模型能力和可查询次数的情况下,是否仍然可以重识别或推断?
假设十一:异常行为可以通过历史基线发现
UEBA的前提是:人的行为相对稳定、异常操作有限、风险能对应到账号、登录/下载/访问量/时间/地点足以刻画行为。对人的行为,这套前提今天依然大体成立。
但Agent 的正常行为,本身就长得像攻击:一秒访问数百份文件、自动跨系统查询、24 小时持续运行、根据任务动态改变路径、自动生成脚本、调用大量API、创建子任务、失败后自动重试和自我纠错。
这让传统UEBA 面临双重困境:第一,Agent 的合法行为看起来就像攻击;第二,恶意行为可以伪装成正常任务链中一个合理的步骤。
传统UEBA 分析的是”这个账号的行为是否异常”;AI 环境更需要分析的是”这一连串行为,是否仍然服务于最初被授权的那个目标”。
这是一种从”行为异常检测”到”目标偏离检测”的转变。
假设十二:日志可以还原事实,人工审批可以兜底
传统治理相信,即使事前控制失效,还可以查日志、追账号、找到责任人;高风险操作还有人工审批把关。
但AI Agent 会动态规划、多次尝试、调用外部模型、读取未被记录的上下文、受历史记忆影响,而且无法稳定复现相同结果。MITRE 对Agent 系统的调查已经展示了完整的攻击链:不可信的网页、消息和第三方技能进入Agent 记忆,随后影响工具调用、凭据使用、数据外传,甚至触发破坏性操作。
人工审批同样撑不住:操作数量太多、审批人看不到完整上下文、单个动作看似无害、真正的风险来自多个动作的组合——高频审批的终点,是机械点击”同意”。

图6 正在松动的十二个隐含假设
三、往下再挖一层:这些工具真正共享的五个底层假设
把十二条归拢,传统数据安全其实站在五块更深的地基上:
底层假设
传统世界
AI 现实
稳定性假设
主体、数据、权限、用途、敏感等级相对稳定
在AI 链路中运行时动态变化
可分离假设
数据、指令、代码、行为可以分开处理
文本既是数据,也是代码和命令
可观察假设
重要行为必经网关、终端、数据库或网络通道
敏感信息藏在推理、记忆、Embedding、上下文和语义输出里
确定性假设
相同输入和规则产生大致相同结果
生成式模型非确定,Agent 随环境动态规划
人类主体假设
行为由一个有判断力、能负责的人发起
Agent 自主决定步骤,却没有人类的意图、伦理和责任能力
五块地基都没有塌,但都出现了不同程度的沉降——沉得最深的,恰恰是企业里AI 用得最深的那几块。还没被AI 触及的业务,站的仍是原来的硬地。

图7 五块地基的传统世界与AI 现实
四、安全的控制对象变了:从数据对象到”认知—行动闭环”
有人会问:这不就是零信任吗?
方向一致,但层次不同。零信任取消的是网络和身份层的隐式信任——它回答”你是谁、能不能进来”;而这里要取消的,是语义和用途层的隐式信任——“你理解了什么、推理出了什么、打算拿它去做什么”。前者零信任已经给出了答案,后者才刚刚开始有人回答。
传统数据安全保护的是:数据对象及其传输过程。这条防线在边界上依然成立,也依然必要。
AI时代需要在它旁边再立一条:保护数据被获取、理解、组合、推理、生成、记忆,并转化为行动的整个过程。
安全控制对象在原有的Data Object 之外,多出了Data →Context →Reasoning →Decision →Action →Memory 的完整”认知—行动闭环”。

图8 控制对象:从数据对象到认知—行动闭环
五、下一代数据安全需要建立的五个新前提
再强调一次:面向过去的安全没有失效——在边界侧,它们仍然是主力,继续值守外部攻击和传统外泄通道。需要新建的,是面向未来的那半边:内部数据使用侧的防线。新的体系至少要立起五根柱子。
第一,从身份授权转向任务授权。不能只问”Agent 是谁”,还要绑定:谁委托的、要完成什么任务、有效期多久、允许用哪些数据、允许调哪些工具、允许产生什么类型的结果。任务结束,权限自动失效。
第二,从一次性授权转向持续授权。每一次检索、推理、工具调用、外部发送和记忆写入,都需要重新判断风险,而不是登录一次、全程信任。这与零信任”取消隐式信任、持续验证”的方向一致——只是把验证从网络会话,下沉到了每一次认知动作。
第三,从数据标签转向数据血缘和推理血缘。不仅记录输出包含什么,还要知道:输出来自哪些数据、经过哪些模型、用了哪些Prompt、调了哪些工具、哪个Agent 做的决定、哪些是原始事实、哪些是模型推断。
第四,从内容检测转向意图和用途检测。不仅识别”有没有敏感数据”,还要判断:是否符合业务目的、是否超出最小必要、是否发生跨域组合、是否可能重识别、是否正在积累式查询、是否产生了高敏感推论。
第五,从单点工具转向运行时控制平面。需要一个覆盖AI 全链路的运行时安全控制层:Prompt 输入、RAG 检索、上下文组装、模型调用、MCP 与工具调用、Agent 间通信、输出生成、长短期记忆、外部发送、审计与追责——十个环节,一个平面。

图9 从传统前提到下一代数据安全的五个新前提
六、结语
面向过去的安全,隐含前提是:数据风险产生于”非法访问或非法传输”。这个前提在边界上依然成立,所以边界防线不用动、也不能撤。
AI时代新增的现实是:即使每一次访问都是合法的,数据仍然可能在合法的检索、推理、组合和自动行动中,悄悄产生风险。数据不是被偷走的——每一道防”偷”的墙都还立着;它是被一句一句合法的提问,“问”走的。防”偷”,是面向过去的安全;防”问”,是面向未来的安全。
所以,AI 时代数据安全的核心问题,在”谁能访问什么数据”之外,又多了一个:谁或哪个Agent,基于什么目的,在什么上下文中,可以让哪些数据参与何种推理,并产生什么结果、采取什么行动,以及这些结果能够流向哪里。
这将是传统DLP 向AI Data Security、AI Usage Control、Agent Runtime Security 演进的理论起点。
所以回到标题的问题——答案不是二选一。面向过去的安全必须留着,它守住的是已经被理解的风险;但一套只面向过去的安全体系,等于把未来交给运气。企业每多接入一个AI 场景,“未来”就多占一分。迁移不必一步到位,但必须从现在开始,而且要从正确的地方开始:不是多买一件工具,而是换一块根基。
而新根基的第一块基石,十二个假设里已经反复出现:无论任务授权、持续授权还是运行时控制平面,每一次放行与拦截的前提,都是系统能在毫秒之间回答——这条数据是什么、什么等级、在当前上下文里意味着什么。这也是我们做AiDClass 时始终坚持的起点:让数据先学会自己说话,面向未来的一切判断才有依据。
参考资料
[1] NIST,Accelerating the Adoption of Software and AI Agent Identity and Authorization(Concept Paper,2026.2)
[2] OWASP Gen AI Security Project,OWASP Top 10 for Agentic Applications for 2026
[3] OWASP Gen AI Security Project,LLM01: Prompt Injection(间接注入来源与后果)
[4] MITRE ATLAS,OpenClaw Investigation(2026.2)
[5] NIST CSRC Glossary,Zero Trust Architecture
说明:文中关于Agent 行为模式与风险场景的部分描述,属于基于公开研究的合理推演,具体企业环境请以实际评估为准。
—— 模界数智
相关案例
相关解决方案
正在规划企业 AI 相关项目?
建议从真实业务场景切入,优先完成项目诊断:评估业务价值、核查数据基础、识别安全与权限风险,审慎评估之后,再决定是否启动 PoC 原型建设,避免无效投入。
预约 30 分钟交流