# 金发〔2026〕8 号解读：个人信息不得入模训练，语料入库门禁怎么建

> 原载于微信公众号，原题《金融机构高质量数据集建设：个人信息不得入模训练，进入数据集先过一道「门禁」》
> 发布日期：2026-07-07　作者：模界数智
> 原文链接：https://mojiedata.com/insights/jinfa-2026-8-corpus-gate

---

副标题：模型效果可以慢慢调，一条身份证号进了训练集，就再也撤不回来。

6 月 18 日，金融监管总局印发《关于银行业保险业人工智能安全开发应用的指导意见》（金发〔2026〕8 号）。32 条意见里，分量最重的一条在第二十四条：姓名、身份证号、手机号、银行卡号等个人信息和隐私数据，不得用于生成式人工智能模型的训练和优化。

条文用的是“不得”两个字，前面没有“审慎”“原则上”这类缓冲词，没留余地。

这条禁令落在了金融机构最不设防的地方。眼下各家机构都在建高质量数据集，语料多半来自存量文档和业务数据：客服工单里有手机号，投顾记录里有客户姓名，理赔材料里有证件号。哪些文件里藏着这些东西，多数机构自己也说不全。一旦混进训练集，模型记住了，就没有撤回的办法。

这篇文章讲一个具体做法：在语料进加工流程之前设一道门禁，让这条红线由系统来执行。

**一、监管这次把要求写到了“数据”这一层**

先把政策的层次理清楚。人民银行、国家发改委、金融监管总局、证监会四部门今年联合印发了《关于“人工智能+金融”的实施意见》（银发〔2026〕101 号），这是全金融行业的总纲；银行保险条线，金发 8 号文给出 32 条细则；证券基金期货条线，证监会的《资本市场金融科技发展规划（2026—2030 年）》和“人工智能+”专项行动在推同样的事。三条线出自三个部门，对数据安全的要求指向同一处。

具体到金发 8 号文，与数据直接相关的有三条。

第九条讲高质量数据集：确立数据质量标准，确保数据的准确性、相关性、一致性、完整性和无偏见。

第二十四条讲数据安全：将人工智能数据安全纳入企业数据安全管理体系，严格落实数据分类分级保护要求，完善数据脱敏规范，随后就是开头那条个人信息禁令。

第二十一条讲留痕：加强模型开发和训练过程记录，日志保存期限不低于业务存续期。

**三条放在一起读，意思很清楚：合规要求已经落到每一条训练数据上，数据先判定、再加工，顺序不能反。**

![图 1　“人工智能+金融”政策三层结构与数据安全要求](./images/fig-01.png)

**二、真做起来，会卡在四个地方**

这些要求没有机构会反对，难的是执行。

头一个障碍是数据形态。语料的大头是非结构化数据——办公过程中产生的 Word、PDF、Excel、邮件、会议纪要、工单记录。这部分数据量最大、敏感信息最密，却长期游离在数据治理之外：没有表结构，散落在共享目录和个人盘里，谁都知道里面有东西，谁都不愿意去碰，一拖就是很多年。金发 8 号文第八条这次专门点了名，要求加强对非结构化数据的管理，制定采集、清洗、标注、应用、退出的管理规范。

落到数据集建设的现场，问题通常卡在四个地方。

没标准。哪些数据可以进语料库，缺少可执行的判定依据，只能靠人工逐份评估，效率低，口径还不一致。

找不着。敏感信息藏在文档正文和备注类字段里，看元数据、看文件名都发现不了。银行的客户档案、保险的理赔记录、券商的投顾工单、互金平台的客服日志，都是这个形态。

一刀切。定位不了文件里的敏感实体，含敏感信息的文件就只能整份弃用。语料越洗越少，数据集的质量反而受损。

说不清。审计问询或数据集对外流通时，拿不出每条语料的入库依据和处理记录。第二十一条要求日志保存不低于业务存续期，前提是——得先有日志。

**四个问题指向同一个缺口：语料加工流程的前面，缺一个数据准入的判定环节。**

![图 2　数据集建设现场的四个“做不到”](./images/fig-02.png)

**三、做法：在语料加工前面加一道门禁**

补上这个环节的做法并不复杂：拟入库的数据先扫描、先判定，再决定放行还是拦截。

扫描发现服务以只读方式接入文档存储和业务数据库，AiDClass 分类分级引擎对每份数据做两件事：按 JR/T 0158、0197 等行业标准给出类别和级别，同时检测内容中的敏感实体。判定结果对应三个出口——

| **出口** | **判定条件（对应分类分级结果）** | **处理动作** | **典型数据** |
|---|---|---|---|
| 直接准入 | 级别为低敏（1–2 级），未检出敏感实体 | 写入标签后生成 JSON 语料 | 已公开研报、公告、产品说明 |
| 脱敏后准入 | 级别为中敏（3 级），检出可脱敏实体（证件号、账号、联系方式等） | 输出实体清单，脱敏复检达标后入库 | 客服工单、投顾与理赔服务记录 |
| 拒绝入库 | 级别为高敏（4 级），或属于约定的禁入类别 | 拦截、写入审计日志、通知数据管理员 | 客户身份档案、未公开重要信息 |

表 1　门禁三出口判定标准（判定矩阵经合规部门评审后固化执行）

三个出口的判定条件直接对接分类分级结果。第二十四条要求“严格落实数据分类分级保护要求”，落的就是这个点：

**分类分级的结果直接决定一份数据能不能入库——台账上的级别，第一次有了执行力。**

判定矩阵由合规部门评审确认后固化成规则版本，系统统一执行。人从逐份评估里解放出来，管标准、审例外。

这道门禁的功夫，重点下在非结构化数据上。数据库表有结构、有字段注释，处理路径是现成的：按字段级打标，导出时整列放行、脱敏或剔除。办公文档没有任何结构可依，AiDClass 引擎直接解析 doc、docx、pdf、xls、ppt、txt 等常见办公格式，支持压缩包展开，正文、表格、批注一并识别。结构化数据照常处理，真正难啃的那批存量文档，恰恰是这套引擎的主场。

![图 3　语料入库门禁总体流程](./images/fig-03.png)

**四、两层检查：文件定级，实体定位**

门禁能不能守住“个人信息不得入模”这条线，取决于检查做到多细。方案设计了两层。

文件级检查，对整份文档给出类别和敏感级别，作为门禁判定的基础依据。级别允许、又未检出敏感实体的文件，直接准入。

实体级检查，把内容里的身份证号、银行卡号、手机号、姓名、账号一个个找出来，输出类型与数量分布。这份清单有两个用途：交给脱敏环节作处理依据；脱敏之后复检，核对每个实体是否已处理干净，达标才放行入库。

**入库前把敏感实体找出来，脱敏之后再复检一遍，“个人信息不得用于训练”才算真正落了地。**

“一刀切”的问题也在这一层得到解决：能定位实体，就能精确脱敏，一大批原本只能整份弃用的文档，处理后重新变成可用语料。

![图 4　文件级判定与实体级检测的两层检查](./images/fig-04.png)

**五、标签跟着语料走，审计问得清**

通过门禁的语料，在生成 JSON 时同步写入一组标签：依据的标准、类别路径、敏感级别、判定路径、脱敏过的实体、规则与引擎版本，以及来源路径和文件哈希。

| {<br>"corpus_id": "doc_20260702_000183",<br>"content": "...（脱敏后文本）...",<br>"label": {<br>"standard": "JR/T 0158-2018",<br>"category_path": "客户/身份信息/联系方式",<br>"sensitivity_level": 3,<br>"gate_decision": "masked_admit",<br>"masked_entities": ["mobile", "id_card"],<br>"rule_version": "v2.3",<br>"engine_version": "aidclass-2.4"<br>},<br>"provenance": {<br>"source_path": "//nas01/.../xxx.docx",<br>"file_hash": "sha256:..."<br>}<br>} |
|---|

入库语料的标签结构（示例）

这组标签有四个用处。

审计回溯。每条语料都带着判定依据和规则版本，监管问询时逐条可查——第二十一条“日志保存不低于业务存续期”、第二十二条“责任可追溯”，落点都在这里。

训练圈定。训练集划分可以按标签圈范围，比如三级语料只用于内部微调，不进对外服务的检索库。

应用管控。银行的实际业务里，AI 应用远不止训练这一件事：知识库问答、RAG 检索、智能体调用，个人信息在这些场景同样是红线，进不得知识库；内部经营管理数据、业务指标这类敏感内容，也要分人分角色控制访问。难点在出口——内容被模型揉进回答之后，输出端几乎判断不了它来自几级数据。标签在入库时打好，检索就能按级别过滤，Agent 就能按角色鉴权，监控审计也有了落点。

**AI 输出端难以判断的事，在数据入口一次解决：入库时打好类别与级别，RAG 和智能体的权限管理、监控管控才有依据。**

升版重标。行标或内部制度更新后，按规则版本圈出受影响的存量语料，重新扫描、更新标签，不必推倒重来。

![图 5　标签随语料入库后的四个用处](./images/fig-05.png)

**六、这道门禁换来什么**

最后算一笔账，这道门禁给金融机构换来三样东西。

合规上，“个人信息不得入模”由制度要求变成系统里的一条规则，每条语料有判定、有记录、有出处，监管问到哪条都答得上。

效率上，扫描判定替代人工逐份评估，增量数据按文件指纹识别、按时间窗口例行处理；“脱敏后准入”留出了中间地带，可用语料不再因一刀切流失。

资产上，带标签的语料库本身就是指导意见第九条鼓励的高质量数据集——质量有标准、来源可追溯、用途可管理，也为第十条提出的行业数据集共建共享预留了接口。那批多年没人敢碰的办公文档，也第一次盘点清楚，变成了可以放心使用的资产。

落地前提只有一句话：只读扫描、不改动原始数据，引擎、规则与日志全部私有化部署，数据不出域。

**结语**

监管把红线画在了数据上，防线就应该建在数据的入口。

**分类分级是 AI 数据安全的地基——先让每条数据说清楚自己是谁、几级、能不能进，高质量数据集才立得住，金融 AI 应用才走得远。**

**参考资料**

[1] 国家金融监督管理总局：《关于银行业保险业人工智能安全开发应用的指导意见》（金发〔2026〕8 号），2026 年 6 月 18 日

[2] 中国人民银行、国家发展改革委、金融监管总局、中国证监会：《关于“人工智能+金融”的实施意见》（银发〔2026〕101 号）

[3] 国务院：《关于深入实施“人工智能+”行动的意见》（国发〔2025〕11 号）

[4] 中国证监会：《资本市场金融科技发展规划（2026—2030 年）》，2026 年 3 月

[5] JR/T 0158—2018《证券期货业数据分类分级指引》

[6] 《中华人民共和国数据安全法》《中华人民共和国个人信息保护法》

说明：银发〔2026〕101 号文全文未见公开，本文仅引用文件名与文号（据粤金管〔2026〕13 号文转引）；具体条款解读均以金发〔2026〕8 号公开全文为依据。

**—— 模界数智 · AiDClass 团队**