# AI 写了近一半代码之后：企业还认得清自己的数据吗

> 原载于微信公众号，原题《人人都是开发者的时代，谁还认识你的数据？》
> 发布日期：2026-06-12　作者：模界数智
> 原文链接：https://mojiedata.com/insights/ai-writes-code-who-knows-data

---

![图 1](./images/fig-01.png)

## 一、近一半的新代码，已经不是人写的

先看几个数字。

GitHub Octoverse报告显示，全球约46% 的新增代码已由AI 生成；IDC 对中国市场的评估是，头部企业的AI 代码采纳率普遍超过40%；用过AI 编程工具的开发者里，七成以上已经是每天高频使用。换句话说，"要不要让AI 写代码"这个问题，市场已经替大多数企业回答完了。

工具的名单越拉越长。国外有OpenAI 的Codex、Anthropic 的Claude Code、Cursor、GitHub Copilot；国内有通义灵码和Qwen 系列、Kimi、MiniMax、GLM、DeepSeek——这些模型的编程能力一代代逼近云端旗舰，订阅价格却一路下探。开发者几乎没有理由不用。

更重要的变化发生在程序员之外。Office Copilot让业务人员用一句话生成分析报表，Cowork、Openclaw类桌面智能体让AI 直接读写本地文件夹、跨应用搬运数据。市场、财务、HR，谁都能用自然语言驱动一条碰真实业务数据的自动化流程。

"人人都是开发者"，这一次不是比喻。

![图 2](./images/fig-02.png)

图1AI 编程的渗透速度

而企业安全团队面对的局面是：过去"谁能动数据"是一条清晰的线——开发写代码，安全审架构，其余人只是应用的使用者。现在，这条线被几十款编程工具、Copilot和桌面智能体，冲得七零八落。

## 二、便利的另一面：你的代码和数据，去哪了？

把"用AI 开发"这件事拆开，数据在四个地方悄悄出了门。

第一个口子：上下文外送。要让AI 的建议足够有用，就得喂足上下文——代码库、数据表结构、配置参数、接口文档，有时还有日志和真实数据样本。这些内容默认流向云端推理服务。更隐蔽的是账号问题：企业协议通常带"零数据保留、不用于训练"的承诺，但员工拿个人账号用同一款工具时，这些承诺一条都不存在。很多企业的真实现状是：公司没买，员工自己在用——这就是"影子AI"。

第二个口子：境外工具的数据出境问题。Codex、Claude Code、Cursor 的推理大多发生在境外服务器。代码和上下文里一旦夹带个人信息、重要数据，就可能触发《网络安全法》第37 条、《数据安全法》第31 条、《个人信息保护法》第38 条项下的数据出境义务——未经评估或备案的出境，本身就是违规。这不是理论风险：员工把一份带客户字段的表结构粘进境外工具，一次"提效"，就完成了一次无人知晓的出境。

第三个口子：工具本身的漏洞面。安全研究者在Cursor、Windsurf、GitHub Copilot 等主流AI IDE 中披露了30 多个漏洞（"IDEsaster"，其中24 个已获CVE 编号），可导致数据被盗甚至远程命令执行；提示注入则能让编程Agent 在你看不见的地方执行恶意指令。工具越自动，攻击面越大。

第四个口子：Copilot模式的"过度共享"。Microsoft 365 Copilot 的风险不在模型，而在它运行的环境：它严格遵守现有权限——而大多数企业的权限是十几年积累下来的欠账。员工"技术上有权限看到、实际上不该看到"的敏感文件，过去藏在没人翻的目录深处，现在被Copilot 一句话精准端到面前。AI 没有越权，它只是把你的权限债，连本带息变现了。

![图 3](./images/fig-03.png)

图2 数据从四个口子出门

注意这四个口子的共同点：没有一个是"工具作恶"，全部是"数据在正常使用中失去了控制"。

## 三、用还是不用？桌上其实只有三条路

面对这个局面，企业能做的选择，归纳起来只有三条。

路线A：一禁了之。

直接封禁所有AI 编程工具和Copilot。表面上最安全，实际效果几乎总是相反：生产力的差距摆在那里，员工会用个人账号、手机热点、私人电脑继续用——你只是把看得见的使用，变成了看不见的使用。禁令挡不住46% 这个数字背后的生产力诱惑，只会制造影子AI。短期作为应急手段可以，作为长期策略，它解决的是"领导的焦虑"，不是数据的风险。现在很多数据敏感行业等容易采用这种方式，但实际上的结果就是生产效率无法进一步提高，竞争力低下。

路线B：用云端工具，配企业级管控。

这是当下大多数企业的现实选择，可用的抓手其实不少：

•合同层：签企业协议，拿到"零数据保留（ZDR）、不用于训练"的承诺；境外模型可以走云厂商托管通道（如Bedrock 类方案），数据限定在自己的VPC 内、用IAM 管权限；

•账号层：统一纳管账号，杜绝个人账号办公，工具走白名单；

•通道层：在网关和终端设卡口，对流向AI 工具的内容做敏感检测与拦截——粘贴、上传、插件调用，都过一道检查。

路线B 的优点是成本低、始终用得上最强的模型。但它有一个常被忽略的软肋：合同承诺只能管"对方怎么处理数据"，管不了"你送出去的是什么"。卡口要拦截，前提是它能在毫秒之间判断"这段内容是不是敏感、是几级、能不能去这个工具"——判断不了，拦截就只剩两个极端：全放（形同虚设）或全拦（等于路线A）。

路线C：自建私有coding 模型。

开源权重给了这条路现实基础：Qwen、GLM、Kimi K2、DeepSeek、MiniMax都开放了可商用的强编程模型。数据不出企业、代码不出内网，监管账好算。但成本账要算清楚三层：

1.算力：30B 级别的模型单机可跑，但与云端旗舰存在体验差距；想逼近旗舰水平的大参数MoE 模型，需要H100 级别的集群——千万级投入起步；

2.运维与追新：模型几个月一代，自建意味着持续的评测、升级、适配投入，落后两代，开发者就会用脚投票回到影子AI；

3.最容易被忽略的一层：自建不等于安全。模型在内网，数据照样会被它检索、记忆、拼装——一个接了全公司代码库和文档库的内部模型，本身就是一个超级权限账号。内部的越权访问、跨部门的数据泄露，一样会发生，只是不出公司大门而已。

路线C 适合强监管行业和核心代码资产极度敏感的企业，但它解决的是"数据出不出门"的问题，不解决"数据在门内被谁碰"的问题。

![图 4](./images/fig-04.png)

图3 三条路线的收益与软肋

## 四、三条路殊途同归：你都得先认识自己的数据

把三条路线的软肋放在一起看，会发现它们指向同一个缺口：

•选禁用，你得知道"哪些场景、哪些数据碰不得"，否则禁令要么一刀切失去生产力，要么处处例外形同虚设——这需要分类分级；

•选云端＋管控，卡口要在毫秒之间判断一段代码、一份文档、一张表结构敏不敏感、能不能出去——这需要数据携带可机读的等级与归属；

•选自建，你得决定哪些数据可以进训练语料、哪些库可以进RAG 检索范围、哪个部门的人能让模型查到什么——这还是分类分级。

无论选哪条路，第一步都是同一步：搞清楚自己的数据是什么、几级、属于谁、能用在什么场景。

跳过这一步的治理，不管买了多贵的网关、签了多严的协议、堆了多少算力，拦截和放行都只是猜测。

另一个边界：员工在私人设备上的影子AI，任何企业侧卡口都拦不到。对它的答案不在工具侧，而在数据源侧——最小权限、不发长效凭证、数据访问API 化，让"像样的数据"只能从受控通道获得。管不住每一双手，但可以管住数据的出处。

## 五、把"认识数据"做成一条能落地的链

"先认识数据"不是一句口号，它有成熟的工程做法，拆开是四步——

4.自动发现并分类分级。用扫描连接器接入代码仓库、数据库、文件服务器和SaaS 应用，由语义引擎做列级、文件级的识别和分级，映射到行业标准。注意：代码也是数据——代码库里的密钥、内嵌配置、表结构定义，恰恰是AI 编程场景下最常外流的资产。增长靠增量扫描跟上，而不是人工逐条打标。

5.让数据的身份"随时可查"。文件类数据，标签写进文件元数据，随文件流转；结构化数据按表、按列登记进中央元数据目录，派生数据靠血缘继承标签。数据走到哪，身份都查得到。

6.在AI 流程经过的关键卡口，实时供给判断。卡口是明确的：代码提交与粘贴通道、企业AI 网关、终端DLP、内部模型的检索层。能"实时"的前提是分类提前做完——运行时只是一次毫秒级的标签查询，不是现场跑一遍模型。

7.高准确、可解释、可审计。每个分类结果带证据和标准依据，每次放行或拦截有日志：谁、动了什么等级的数据、为什么这么判。出了事，说得清。

![图 5](./images/fig-05.png)

图4 三条路线共同的前提：四步能力链

做到这四步，三条路线才各自成立：禁用有了精准的边界，管控有了可执行的依据，自建有了内部的秩序。

## 六、AiDClass：给每一条数据一个身份

AiDClass做的，正是这条链最前面、也最关键的那一环。

它给企业的结构化与非结构化数据——包括代码、文档、表结构这些AI 开发场景里最活跃的资产——装上自动化的分类分级与语义身份，让每一条数据都清楚地知道：自己是什么、属于谁、是几级、能去哪里。

于是，无论你的企业选择哪条路线——管控云端工具、自建私有模型，还是在两者之间组合——在数据被送进任何一个模型上下文的那一瞬间，系统都能给出一个可信的判断，而不是等泄露发生后，再回头翻日志、猜责任、补报告。

人人都是开发者的时代，企业拦不住任何人写代码，也不该拦。数据安全的起点，不再是管住每一双手，而是：

让数据先学会自己说话。

AI可以替你写一半的代码。但只有当数据先学会自己说话，这一半的效率，才不会变成下一份事故报告。

你管不住每个人用什么工具。但你可以让每一条数据都知道：自己是谁，属于谁，能去哪。

—— 模界数智