模 模界数智
行业观察

AI 写了近一半代码之后:企业还认得清自己的数据吗

模界数智
代码结构快速生长,背后的数据地图却逐渐失焦

本文原载于微信公众号,原题《人人都是开发者的时代,谁还认识你的数据?》。

图 1

一、近一半的新代码,已经不是人写的

先看几个数字。

GitHub Octoverse报告显示,全球约46% 的新增代码已由AI 生成;IDC 对中国市场的评估是,头部企业的AI 代码采纳率普遍超过40%;用过AI 编程工具的开发者里,七成以上已经是每天高频使用。换句话说,“要不要让AI 写代码”这个问题,市场已经替大多数企业回答完了。

工具的名单越拉越长。国外有OpenAI 的Codex、Anthropic 的Claude Code、Cursor、GitHub Copilot;国内有通义灵码和Qwen 系列、Kimi、MiniMax、GLM、DeepSeek——这些模型的编程能力一代代逼近云端旗舰,订阅价格却一路下探。开发者几乎没有理由不用。

更重要的变化发生在程序员之外。Office Copilot让业务人员用一句话生成分析报表,Cowork、Openclaw类桌面智能体让AI 直接读写本地文件夹、跨应用搬运数据。市场、财务、HR,谁都能用自然语言驱动一条碰真实业务数据的自动化流程。

“人人都是开发者”,这一次不是比喻。

图 2

图1AI 编程的渗透速度

而企业安全团队面对的局面是:过去”谁能动数据”是一条清晰的线——开发写代码,安全审架构,其余人只是应用的使用者。现在,这条线被几十款编程工具、Copilot和桌面智能体,冲得七零八落。

二、便利的另一面:你的代码和数据,去哪了?

把”用AI 开发”这件事拆开,数据在四个地方悄悄出了门。

第一个口子:上下文外送。要让AI 的建议足够有用,就得喂足上下文——代码库、数据表结构、配置参数、接口文档,有时还有日志和真实数据样本。这些内容默认流向云端推理服务。更隐蔽的是账号问题:企业协议通常带”零数据保留、不用于训练”的承诺,但员工拿个人账号用同一款工具时,这些承诺一条都不存在。很多企业的真实现状是:公司没买,员工自己在用——这就是”影子AI”。

第二个口子:境外工具的数据出境问题。Codex、Claude Code、Cursor 的推理大多发生在境外服务器。代码和上下文里一旦夹带个人信息、重要数据,就可能触发《网络安全法》第37 条、《数据安全法》第31 条、《个人信息保护法》第38 条项下的数据出境义务——未经评估或备案的出境,本身就是违规。这不是理论风险:员工把一份带客户字段的表结构粘进境外工具,一次”提效”,就完成了一次无人知晓的出境。

第三个口子:工具本身的漏洞面。安全研究者在Cursor、Windsurf、GitHub Copilot 等主流AI IDE 中披露了30 多个漏洞(“IDEsaster”,其中24 个已获CVE 编号),可导致数据被盗甚至远程命令执行;提示注入则能让编程Agent 在你看不见的地方执行恶意指令。工具越自动,攻击面越大。

第四个口子:Copilot模式的”过度共享”。Microsoft 365 Copilot 的风险不在模型,而在它运行的环境:它严格遵守现有权限——而大多数企业的权限是十几年积累下来的欠账。员工”技术上有权限看到、实际上不该看到”的敏感文件,过去藏在没人翻的目录深处,现在被Copilot 一句话精准端到面前。AI 没有越权,它只是把你的权限债,连本带息变现了。

图 3

图2 数据从四个口子出门

注意这四个口子的共同点:没有一个是”工具作恶”,全部是”数据在正常使用中失去了控制”。

三、用还是不用?桌上其实只有三条路

面对这个局面,企业能做的选择,归纳起来只有三条。

路线A:一禁了之。

直接封禁所有AI 编程工具和Copilot。表面上最安全,实际效果几乎总是相反:生产力的差距摆在那里,员工会用个人账号、手机热点、私人电脑继续用——你只是把看得见的使用,变成了看不见的使用。禁令挡不住46% 这个数字背后的生产力诱惑,只会制造影子AI。短期作为应急手段可以,作为长期策略,它解决的是”领导的焦虑”,不是数据的风险。现在很多数据敏感行业等容易采用这种方式,但实际上的结果就是生产效率无法进一步提高,竞争力低下。

路线B:用云端工具,配企业级管控。

这是当下大多数企业的现实选择,可用的抓手其实不少:

•合同层:签企业协议,拿到”零数据保留(ZDR)、不用于训练”的承诺;境外模型可以走云厂商托管通道(如Bedrock 类方案),数据限定在自己的VPC 内、用IAM 管权限;

•账号层:统一纳管账号,杜绝个人账号办公,工具走白名单;

•通道层:在网关和终端设卡口,对流向AI 工具的内容做敏感检测与拦截——粘贴、上传、插件调用,都过一道检查。

路线B 的优点是成本低、始终用得上最强的模型。但它有一个常被忽略的软肋:合同承诺只能管”对方怎么处理数据”,管不了”你送出去的是什么”。卡口要拦截,前提是它能在毫秒之间判断”这段内容是不是敏感、是几级、能不能去这个工具”——判断不了,拦截就只剩两个极端:全放(形同虚设)或全拦(等于路线A)。

路线C:自建私有coding 模型。

开源权重给了这条路现实基础:Qwen、GLM、Kimi K2、DeepSeek、MiniMax都开放了可商用的强编程模型。数据不出企业、代码不出内网,监管账好算。但成本账要算清楚三层:

1.算力:30B 级别的模型单机可跑,但与云端旗舰存在体验差距;想逼近旗舰水平的大参数MoE 模型,需要H100 级别的集群——千万级投入起步;

2.运维与追新:模型几个月一代,自建意味着持续的评测、升级、适配投入,落后两代,开发者就会用脚投票回到影子AI;

3.最容易被忽略的一层:自建不等于安全。模型在内网,数据照样会被它检索、记忆、拼装——一个接了全公司代码库和文档库的内部模型,本身就是一个超级权限账号。内部的越权访问、跨部门的数据泄露,一样会发生,只是不出公司大门而已。

路线C 适合强监管行业和核心代码资产极度敏感的企业,但它解决的是”数据出不出门”的问题,不解决”数据在门内被谁碰”的问题。

图 4

图3 三条路线的收益与软肋

四、三条路殊途同归:你都得先认识自己的数据

把三条路线的软肋放在一起看,会发现它们指向同一个缺口:

•选禁用,你得知道”哪些场景、哪些数据碰不得”,否则禁令要么一刀切失去生产力,要么处处例外形同虚设——这需要分类分级;

•选云端+管控,卡口要在毫秒之间判断一段代码、一份文档、一张表结构敏不敏感、能不能出去——这需要数据携带可机读的等级与归属;

•选自建,你得决定哪些数据可以进训练语料、哪些库可以进RAG 检索范围、哪个部门的人能让模型查到什么——这还是分类分级。

无论选哪条路,第一步都是同一步:搞清楚自己的数据是什么、几级、属于谁、能用在什么场景。

跳过这一步的治理,不管买了多贵的网关、签了多严的协议、堆了多少算力,拦截和放行都只是猜测。

另一个边界:员工在私人设备上的影子AI,任何企业侧卡口都拦不到。对它的答案不在工具侧,而在数据源侧——最小权限、不发长效凭证、数据访问API 化,让”像样的数据”只能从受控通道获得。管不住每一双手,但可以管住数据的出处。

五、把”认识数据”做成一条能落地的链

“先认识数据”不是一句口号,它有成熟的工程做法,拆开是四步——

4.自动发现并分类分级。用扫描连接器接入代码仓库、数据库、文件服务器和SaaS 应用,由语义引擎做列级、文件级的识别和分级,映射到行业标准。注意:代码也是数据——代码库里的密钥、内嵌配置、表结构定义,恰恰是AI 编程场景下最常外流的资产。增长靠增量扫描跟上,而不是人工逐条打标。

5.让数据的身份”随时可查”。文件类数据,标签写进文件元数据,随文件流转;结构化数据按表、按列登记进中央元数据目录,派生数据靠血缘继承标签。数据走到哪,身份都查得到。

6.在AI 流程经过的关键卡口,实时供给判断。卡口是明确的:代码提交与粘贴通道、企业AI 网关、终端DLP、内部模型的检索层。能”实时”的前提是分类提前做完——运行时只是一次毫秒级的标签查询,不是现场跑一遍模型。

7.高准确、可解释、可审计。每个分类结果带证据和标准依据,每次放行或拦截有日志:谁、动了什么等级的数据、为什么这么判。出了事,说得清。

图 5

图4 三条路线共同的前提:四步能力链

做到这四步,三条路线才各自成立:禁用有了精准的边界,管控有了可执行的依据,自建有了内部的秩序。

六、AiDClass:给每一条数据一个身份

AiDClass做的,正是这条链最前面、也最关键的那一环。

它给企业的结构化与非结构化数据——包括代码、文档、表结构这些AI 开发场景里最活跃的资产——装上自动化的分类分级与语义身份,让每一条数据都清楚地知道:自己是什么、属于谁、是几级、能去哪里。

于是,无论你的企业选择哪条路线——管控云端工具、自建私有模型,还是在两者之间组合——在数据被送进任何一个模型上下文的那一瞬间,系统都能给出一个可信的判断,而不是等泄露发生后,再回头翻日志、猜责任、补报告。

人人都是开发者的时代,企业拦不住任何人写代码,也不该拦。数据安全的起点,不再是管住每一双手,而是:

让数据先学会自己说话。

AI可以替你写一半的代码。但只有当数据先学会自己说话,这一半的效率,才不会变成下一份事故报告。

你管不住每个人用什么工具。但你可以让每一条数据都知道:自己是谁,属于谁,能去哪。

—— 模界数智

正在规划企业 AI 相关项目?

建议从真实业务场景切入,优先完成项目诊断:评估业务价值、核查数据基础、识别安全与权限风险,审慎评估之后,再决定是否启动 PoC 原型建设,避免无效投入。

预约 30 分钟交流