# 医疗数据分类分级：临床、科研、运营三重维度与已在发生的数据交易

> 发布日期：2026-08-25　作者：模界数智
> 原文链接：https://mojiedata.com/insights/healthcare-classification

---

**医疗数据分类分级**

临床、科研、运营三重维度,与已经发生的医疗数据交易

上一期我们用「合规地图」展开了中国十大行业的分类分级框架,医疗业是其中复杂度仅次于金融的行业。但医疗业在分类分级这件事上有一个独特之处——

**当其他行业还在讨论「数据交易该不该做」时,医疗数据交易已经在真实运行了。**

从国家医保大数据平台、各省健康医疗大数据中心,到上海、北京、广州陆续上线的医疗数据交易所,再到药企与医院之间频繁发生的真实世界数据(RWS)合作——医疗数据已经形成了一个有交易主体、交易规则、价格机制的真实市场。

这件事的意义远超分类分级本身。它意味着:对医疗行业而言,分类分级不是一份「应对监管检查」的合规文档,而是支撑数据资产化、决定数据能不能流通、能流通到什么程度的「业务前置条件」。

这一期我们做三件事:第一,讲清楚医疗数据本身的三重维度——临床、科研、运营;第二,讲清楚医疗数据交易已经在如何发生,以及背后对分类分级和隐私计算的真实需求;第三,讲清楚一套真正能服务医疗行业的分类分级体系应该长什么样。

# **一、医疗数据为什么独特**

在讨论分类分级之前,先讲清楚医疗数据本身的几个独特特征——这些特征决定了为什么金融业的分类分级方法论无法直接套用。

## **特征一:同一份数据有三重身份**

一个患者的一次就诊记录,在医院的不同业务环节里有完全不同的身份:

1. **临床环境中,**它是诊疗依据——医生根据病史、检查、化验作出诊断决策;

1. **科研环境中,**它是研究素材——临床医生用它做病例分析,医学院用它做流行病学研究,药企用它做药物效果评估;

1. **运营环境中,**它是经营数据——医院用它做收入核算、医保用它做支付审核、卫健委用它做医疗质量监测。

同一份数据,在三个不同身份下,合规要求、敏感性、流通边界都完全不同。一套通用的分类分级模型无法精准服务这三重需求。

## **特征二:数据形态最丰富**

没有任何一个行业的数据形态像医疗这么丰富。一个三甲医院的数据资产典型构成:

1. **结构化数据:**HIS(挂号、收费)、LIS(检验)、PACS 元数据、EMR 结构化字段、HRP 运营数据;

1. **半结构化数据:**病历首页、检验报告、出院小结、医嘱信息;

1. **自由文本:**主诉、现病史、查体记录、手术记录、护理日志、影像诊断报告;

1. **医学影像:**CT、MRI、X 线、超声、内镜、病理切片(含 DICOM 元数据);

1. **波形数据:**心电、脑电、监护参数;

1. **组学数据:**基因测序、蛋白质组、代谢组;

1. **音视频数据:**手术录像、远程会诊视频、移动 APP 录音。

这意味着医疗的分类分级工具必须能同时处理结构化字段、文档段落、影像元数据、自由文本病历——一个只能处理结构化数据库字段的工具,在医疗场景里只覆盖了 20%-30% 的资产。

## **特征三:敏感性等级最高**

医疗数据是国际公认的最敏感个人数据类别。它的敏感性体现在几个层面:

1. **诊疗信息的直接敏感:**罹患疾病、用药、手术等信息一旦泄露,直接影响患者就业、保险、社会关系;

1. **基因数据的不可变敏感:**基因信息泄露后,影响的不只是本人,还涉及直系亲属;

1. **心理 / 精神病史的极敏感:**心理咨询记录、精神科诊断对患者社会生活的影响巨大;

1. **未成年人医疗数据的特殊敏感:**受未成年人保护规章额外覆盖。

这种高敏感性意味着医疗数据的分级不能简单照搬金融分级——一个金融业「3 级」(轻度敏感)的字段,在医疗业可能要被定到「4 级」(高度敏感)甚至「5 级」(极高敏感)。

## **特征四:跨机构流转最复杂**

一个患者的就诊轨迹很少局限在一家医院。一份完整的健康档案可能涉及:基层社区医院的常规体检、三甲医院的急诊与住院、专科医院的复诊、康复机构的后续治疗、医保部门的报销结算、商业保险公司的健康核保、远程医疗平台的咨询记录、健康管理 APP 的日常监测。

这种跨机构流转决定了医疗分类分级不能是「机构内部话题」,而必须考虑跨机构共享时的合规处理——这正是医疗数据交易和隐私计算介入的核心场景。

# **二、临床、科研、运营:医疗分类分级的三重维度**

基于上面提到的「同一份数据有三重身份」,医疗分类分级必须建立三个独立但相互关联的维度。

| **维度** | **临床医疗** | **科研研究** | **运营管理** |
|---|---|---|---|
| **数据形态** | 电子病历、影像、检验、用药、手术记录(结构化 + 文档 + 影像) | 病例数据集、组学数据、临床试验数据、随访数据(结构化 + 半结构化) | HRP/HIS 运营数据、医保结算、医院财务、人事数据(结构化为主) |
| **主要敏感性** | 直接的患者隐私 + 诊疗信息(PHI 全部要素) | 去标识化后的研究价值(基因、组学数据可重识别) | 经营商业秘密 + 医保资金合规 + 内部管理数据 |
| **适用监管** | 卫健委系列规章 + PIPL + 知情同意要求 | 卫健委科研管理规章 + 伦理审查 + 数据治理规范 | 数据安全法 + 商业秘密保护 + 内审外审要求 |
| **处理目标** | 保护诊疗过程,确保 EMR 隐私 | 支持研究需求,平衡科研价值与隐私 | 保障运营透明,合规审计 |
| **分级要点** | 字段级 PHI 识别,影像元数据,自由文本敏感识别 | 去标识化强度分级,重识别风险评估,跨机构共享分级 | 财务数据 + 医保数据 + 商业秘密分级 |

## **维度一:临床医疗**

这是医疗分类分级最基础的维度——保护就诊过程中产生的诊疗数据。

典型场景包括:门诊就诊数据(挂号、诊断、处方)、住院数据(入院记录、医嘱、手术、护理)、检查数据(影像、检验、病理)、出院数据(出院小结、随访)。

临床维度的分级要点:

1. **字段级 PHI 识别:**PHI(Protected Health Information,受保护健康信息)涉及十八类标识——姓名、地址、电话、邮箱、社保号、医疗记录号、账号、证件号、生物识别、面部识别、车牌、设备序列号、URL、IP、影像、其他唯一标识、生日、入院 / 出院 / 死亡时间。这些都需要字段级的精确识别。

1. **影像元数据敏感识别:**DICOM 元数据(患者姓名、ID、出生日期、检查日期、设备信息)是影像数据中容易被忽略的敏感信息源。

1. **自由文本敏感识别:**主诉、现病史等自由文本中混杂着大量敏感信息,需要从文本中精确抽取并分级。

1. **时间序列敏感:**就诊时间序列即使其他信息脱敏,通过时间模式也可能反推到特定患者。

## **维度二:科研研究**

第二个维度是医疗数据用于研究的场景——这个维度对绝大多数医疗机构而言,既是核心业务诉求,也是合规盲区。

典型场景包括:临床医生的病例总结、医学院的教学使用、流行病学研究、药物临床试验、医疗器械上市后研究、AI 模型训练、真实世界研究。

科研维度的分级要点:

1. **去标识化强度分级:**不同研究目的需要不同强度的去标识化——内部教学可以保留较多识别信息,跨机构科研需要标准去标识化,公开发表需要完全去标识化。这是一个「分级化的处理」而不是「一刀切的脱敏」。

1. **重识别风险评估:**即使做了去标识化,通过组学数据、地理位置、罕见病诊断等仍可能重识别。需要对每个数据集做重识别风险评估。

1. **知情同意类型映射:**患者签署的知情同意书有不同类型——治疗用、科研用、可商业化、不可商业化。每个字段都要绑定其知情同意类型。

1. **跨机构共享分级:**院内研究、医联体共享、跨地区研究、国际合作,合规要求逐级提升。

## **维度三:运营管理**

第三个维度是医院作为机构的经营管理数据——这个维度经常被忽略,但商业敏感性极高。

典型场景包括:HIS / HRP 的收费数据、人力资源数据、药品采购数据、医保结算数据、绩效考核数据、设备运行数据、供应链数据。

运营维度的分级要点:

1. **商业秘密保护:**药品采购价、设备采购价、绩效考核数据等属于商业秘密;

1. **医保资金合规:**医保结算数据涉及医保基金安全,有专门的合规要求;

1. **财务审计要求:**医院财务数据需要满足内审、外审、医保部门检查等多种审计需求;

1. **员工隐私保护:**医护人员的薪酬、考核数据按《个人信息保护法》单独保护。

# **三、已经在发生的医疗数据交易**

讲完三重维度,这一章是这篇文章最有现实价值的部分——讲一件许多人不知道但已经在大规模发生的事:

**中国的医疗数据交易已经从「政策探讨」进入「实际运行」阶段。其他行业还在讨论「数据交易能不能做」的时候,医疗已经做了好几年。**

这件事对分类分级有什么意义?——它把分类分级从「合规文档」推到了「业务前置条件」的位置上。一份不能精确分级的医疗数据,不能进入数据交易;一份分级粗糙的数据集,卖不出好价钱;一份合规标签缺失的数据,会被交易所驳回。

## **交易主体已经成型**

中国的医疗数据交易已经形成了多层的主体生态:

1. **国家级平台:**国家健康医疗大数据平台、医保信息平台;

1. **省级中心:**济南、福州、厦门、贵阳等地的国家健康医疗大数据中心和区域中心;

1. **数据交易所:**北京国际大数据交易所、上海数据交易所、广州数据交易所、贵阳大数据交易所等均设有医疗健康数据板块;

1. **医联体内部流通:**区域医联体内部的数据共享和使用;

1. **医企合作:**医院与药企、医疗器械厂商、AI 公司之间的研究合作。

## **五种主要交易模式**

围绕医疗数据的真实流转,目前已经形成五种主要的交易模式。每一种对分类分级与安全处理都有不同的具体要求。

| **交易模式** | **数据形态与目的** | **对分类分级与安全处理的要求** |
|---|---|---|
| **脱敏数据集授权** | 经标准化去标识化处理的临床数据集,用于药物研发、AI 模型训练、流行病学研究 | 字段级 PHI 完整识别 + 去标识化强度分级 + 重识别风险评估 + 授权范围与级别绑定 |
| **数据沙箱使用** | 原始数据驻留医院侧,研究者通过沙箱环境查询、分析、产出研究结果 | 权限按分级标签控制 + 查询结果按级别脱敏 + 审计跟踪每一次访问 |
| **隐私计算协作** | 多家医院数据不出本域,通过联邦学习、多方安全计算、TEE 等协作建模 | 对参与字段做分级判定 + 中间结果按级别脱敏 + 模型本身的隐私风险评估 |
| **RWS 真实世界数据服务** | 面向药企、医疗器械厂商提供真实世界证据数据集,支持上市后研究 | 字段级合规标签 + 患者签署知情同意类型映射 + 数据使用边界管控 |
| **医保数据共享** | 医保部门向第三方研究机构提供脱敏医保结算数据,用于卫生经济学研究 | 敏感字段彻底脱敏 + 结算金额聚合处理 + 跨地域汇总的重识别风险评估 |

### **交易场景的真实案例**

不展开任何具体公司案例,但行业内已经有几类成熟的「数据交易闭环」长期运行:

1. 某省国家健康医疗大数据中心向多家药企持续提供脱敏的真实世界数据,支持药品上市后研究;

1. 多家三甲医院通过联邦学习联盟,联合训练罕见病、肿瘤等专科 AI 模型,数据不出医院但模型共享;

1. 医保系统向第三方研究机构开放结算数据用于卫生经济学研究,数据在沙箱中查询使用;

1. 商业健康险公司与医疗机构合作,基于患者授权的健康数据进行风险评估和产品设计;

1. 跨机构的肿瘤多中心研究,通过多方安全计算技术实现跨医院的患者匹配和疗效对比。

这些交易闭环每天都在运行——它们不是「未来的可能」,是「现在的现实」。

# **四、数据交易对分类分级的真实需求**

当医疗数据从「医院内部资产」变成「可交易的数据产品」,分类分级的角色发生了根本性的变化。

## **从合规要求,到交易前置条件**

在内部场景下,分类分级是「监管要求你做」;在交易场景下,分类分级是「数据本身能不能进入市场」的硬门槛。

一家数据交易所审核一份医疗数据集时,会问:

1. 数据集中每个字段的敏感级别是什么?

1. PHI 字段是否完整识别并去标识化?

1. 去标识化的强度是否与交易场景匹配?

1. 重识别风险评估的结果是什么?

1. 数据采集时的知情同意书是否覆盖本次交易用途?

以上每一个问题都直接对应分类分级的输出。一份连字段级敏感级别都说不清楚的数据集,在交易所审核环节直接被驳回。

## **从静态标签,到动态保护**

内部场景下分类分级标签是「静态贴在字段上的标签」;交易场景下它必须能驱动一连串「动态保护策略」:

1. **分级触发脱敏:**L4 字段必须脱敏到 k-匿名(k>=10)以上才能用于外部研究,L5 字段必须用差分隐私技术处理;

1. **分级触发隐私计算:**某些级别的数据不允许出域,必须用联邦学习、多方安全计算等技术参与协作;

1. **分级触发查询限制:**在沙箱环境中,查询条件涉及高敏字段时,自动应用查询结果的级别限制(比如「不能输出小于 5 例的子集」);

1. **分级触发审计跟踪:**高级别数据的每一次访问、每一次查询、每一次输出,都生成不可篡改的审计记录。

## **从单维分级,到多维标签**

传统的分类分级是「一个字段对应一个级别」的单维结构。医疗数据交易场景下,每个字段需要承载多维标签:

1. **敏感级别:**L1-L5,决定基础保护强度;

1. **可识别度:**直接标识符、间接标识符、敏感属性、准标识符;

1. **知情同意类型:**治疗用、教学用、科研用、商业化、特定研究项目用;

1. **授权使用范围:**本院、医联体、特定合作方、公开;

1. **重识别风险等级:**低、中、高;

1. **适用合规框架:**PIPL、卫健委系列规章、医保管理规定、伦理审查要求。

这种多维标签结构是「数据资产化」的内在要求——每一个标签都直接对应交易场景下的合规约束。一个只能输出「这个字段是 L3」的工具,在数据交易场景下是不够用的。

# **五、隐私计算与分类分级的协同**

讲到这里,自然就接到一个话题——医疗数据交易场景下大量使用的隐私计算技术,与分类分级之间是什么关系?

## **隐私计算解决「能不能用」,分类分级解决「怎么用」**

隐私计算(联邦学习、多方安全计算、可信执行环境、差分隐私、同态加密等)解决的是「数据不出域也能用」的技术问题。但这些技术本身不告诉你:

1. 哪些字段属于敏感数据,需要进入隐私计算保护?

1. 哪些计算结果可以输出,哪些不能?

1. 输出的中间结果属于什么敏感级别?

1. 不同参与方对不同字段的访问权限是什么?

这些问题的答案,全部来自分类分级。

**没有精确的分类分级作为基础,隐私计算就成了「在不知道哪些数据需要保护」的情况下「保护一切」——这要么导致性能崩塌,要么导致漏掉关键敏感字段。**

## **典型协同场景**

### **场景一:联邦学习中的字段筛选**

多家医院做联邦学习联合训练肿瘤诊断模型时,需要决定哪些字段参与联邦计算、哪些字段必须先脱敏、哪些字段根本不能进入联邦。这个决策的依据是字段的分类分级标签——分级越高,要么进入加密计算,要么完全排除。

### **场景二:差分隐私的预算分配**

差分隐私技术需要给查询分配「隐私预算」。预算的合理分配依赖于字段的敏感级别——高敏字段消耗更多预算,低敏字段消耗较少预算。这个映射的基础是分类分级。

### **场景三:沙箱环境的查询控制**

数据沙箱场景下,研究者的查询请求需要被实时审核——查询结果是否会暴露过多敏感信息?这个审核的判定依据是查询涉及的字段的敏感级别加查询输出的聚合度。没有字段级的分级标签,沙箱无法做精确的访问控制。

### **场景四:可信执行环境的访问审计**

TEE 中处理医疗数据时,每一次数据访问都需要审计跟踪。审计记录中需要记录访问的「数据敏感级别」——这同样依赖分类分级的输出。

总结一句话:隐私计算是「数据安全的执行手段」,分类分级是「执行手段的指挥系统」。两者协同,医疗数据交易才能真正合规、可控、可持续。

# **六、医疗分类分级工具的五个硬要求**

基于以上所有讨论,我们能清楚定义出:一个真正可用的医疗分类分级工具,必须具备哪些硬条件。

## **要求一:多形态数据统一处理**

能用一套机制同时处理结构化数据(HIS/LIS 字段)、半结构化数据(病历首页、检验报告)、自由文本(主诉、现病史)、影像元数据(DICOM)、组学数据(基因测序)。不能要求医院为每类数据用不同工具。

## **要求二:PHI 全要素识别**

能完整识别 PHI 十八要素,并且能在自由文本中精确抽取——主诉文本中的患者姓名、电话、地址、亲属关系等敏感信息,必须做到字段级精确识别。

## **要求三:三重维度的差异化分级**

能为同一份数据在临床、科研、运营三个维度下生成不同的分级结果——一份病历在临床使用时是 L4,在科研使用时(去标识化后)是 L2,在运营审计时是 L3。这种「维度切换」是医疗分类分级与其他行业最大的不同。

## **要求四:多维标签输出**

不止输出「敏感级别」,还要输出可识别度、知情同意类型、授权使用范围、重识别风险、适用合规框架等多维标签。每个标签直接对应数据交易、隐私计算、跨机构共享的具体决策。

## **要求五:与隐私计算栈的深度对接**

能与隐私计算栈(联邦学习平台、安全多方计算平台、TEE、差分隐私引擎)深度对接,把分类分级标签作为隐私计算的输入参数——指挥隐私计算选择正确的保护方式与强度。

这五个硬要求合起来,定义了一个「医疗级」分类分级工具的入门线。市场上大部分工具——包括把金融工具直接套用到医疗的工具——很难全部满足。

# **七、医疗数据资产化的真正含义**

最后我们用一段话回应文章标题里那个词:数据资产。

医疗数据交易的真实运行,意味着医疗数据已经从「业务副产品」变成了「机构核心资产」。但「资产」这个词不能只挂在嘴上,它需要具体的能力支撑——

1. **可估值:**知道这份数据值多少钱,基础是知道它包含什么、敏感性如何、合规可用范围多大;

1. **可流转:**知道这份数据能给谁用、用什么方式、在什么级别上脱敏处理后用;

1. **可保护:**知道这份数据在不同环节需要什么保护强度,被谁访问、什么时候被访问、被怎么使用;

1. **可追溯:**知道这份数据从哪来、经过哪些环节、被谁用过、产生了什么衍生数据。

以上四个能力的共同基础——是精确、动态、多维的分类分级。

**分类分级是数据资产化的底层基础设施。没有精确的分类分级,医疗机构空守着大量数据,无法估值、无法流转、无法保护、无法追溯——这些数据就不是资产,只是负担。**

这就是为什么医疗行业的分类分级是「不可回避的核心能力」,而不是「应付检查的合规文档」。

# **写在最后**

这一期我们走过了医疗行业分类分级的完整图景——从医疗数据的四大独特特征,到临床、科研、运营三重维度,到已经在真实运行的五种交易模式,到分类分级与隐私计算的协同需求,再到医疗分类分级工具的五个硬要求。

贯穿全篇的一条线索是:

**医疗行业的分类分级,不能套用金融业的方法论——它必须建立在对医疗业务的深度理解之上,服务于已经发生的医疗数据交易这一真实业务需求。**

这一篇也回应了上一期里那个核心论断——「跨行业能力,是数据安全工具的下一个分水岭」。能从金融走到医疗的工具,需要的不是「换一套规则库」,而是「换一套行业知识库 + 换一套分级元模型 + 换一套合规对齐机制」。

下一期我们会基于这两期的讨论(金融 + 医疗),延伸到一个更深的问题——为什么「行业知识库」会成为 AI 分类分级真正的护城河?在大模型参数规模动辄千亿万亿的时代,为什么决定分类分级产品天花板的不是模型大小,而是知识库的深度?

*—— AiDClass 团队 · 模界数智*