在当今数据驱动的环境中,组织正在管理跨本地、云和混合环境的大量信息。然而,如果没有结构化的方法来保护这些数据,敏感信息仍然容易受到泄露、合规失败和运营中断的影响。这就是强大数据分类过程变得至关重要的地方。
这份白皮书深入探讨了数据分类级别的基本知识——从公开和内部到机密和限制——并解释了企业如何利用这些数据分类级别将其安全投资与风险暴露对齐。您将探索常见的数据分类类型,包括基于内容、基于上下文和用户驱动的方法,并学习如何量身定制反映您组织的监管、业务和运营需求的数据分类方案。
此外,本文介绍了广泛采用的数据分类模型,例如分层、基于风险和监管驱动的框架,并解释了它们如何映射到各行业的不同数据分类类别。它还详细介绍了完整的数据分类过程,从初始数据发现到分类标签、治理和生命周期管理。
无论您是在构建分类策略还是完善政策,这份白皮书还强调了数据安全分类在遵守GDPR、HIPAA和PCI DSS等标准方面的作用,以及为什么数据敏感性分类是保护您最关键资产的关键。
立即下载,了解如何简化合规、降低风险,并实施满足今天安全需求和明天挑战的智能、可扩展的分类系统。
根据 IBM Cost of a Data Breach Report 2025,40% 的泄露事件涉及跨多个环境存储的数据,超过三分之一的事件涉及位于未受管理来源中的影子数据。
这些泄露事件的平均成本超过 500 万美元,并花了 283 天才能识别和遏制。共同点很简单:组织无法保护看不见的东西,也无法看见那些尚未分类的内容。
健全的数据分类分级正是用来缩小这一差距的机制。他们会将组织中的全部数据归整,并根据未授权访问造成的危害程度对其进行分层分类,同时为每个层级规定不同的控制措施。
在商用领域,占主导地位的框架采用四层级模型。该模型是大多数企业的运行标准,并且由如 GDPR、HIPAA 以及 PCI DSS 等法规所要求或在法规中被隐含指明。
本指南将解释每个等级的含义、为何分类等级是现代 data security的基础、各等级如何对应特定的合规要求,以及如何在不陷入 manual tagging的情况下落实这些要求。
数据分类等级是什么?
数据分类等级是 data classification 方案中的具体层级,用于定义一份数据的敏感程度以及适用于它的控制措施。分类等级并不等同于分类 scheme 或分类 model。模型是底层框架(层级式、基于风险、基于法规),scheme 是组织选择的完整政策和标签集合,而等级则是该 scheme 内部的各个具体层级。
组织会根据五项标准为每种数据类型分配一个等级:
- Confidentiality 指的是哪些人应该以及不应该查看数据
- 完整性 指的是确保数据保持准确且未被篡改的重要性
- 可用性 指的是及时访问数据对业务运转的关键程度
- 合规 指的是是否由法规或合同决定数据必须如何被处理
- 业务价值 指的是该数据是否与知识产权、战略或财务结果息息相关
这些标准并不会彼此独立运作。对机密性要求较高的数据集,几乎总会伴随较高的合规风险暴露;而将每一种数据类型都依次通过全部五项标准,其目的在于最终得到一个单一的分级结果,从而确保处理方式始终一致。
数据分类是数据安全的前端,而不是一项孤立的工作。只有当标签能够推动加密、访问限制、保留规则以及与数据敏感度相匹配的删除流程等下游控制时,标签才真正发挥价值。
为什么数据分类级别很重要
强化文件共享或推出 DLP ,但不进行数据分类,就像买了一个保险箱,然后把自己所有的东西都放进去一样。四个具体现实使数据分类级别成为当前可用的、回报率最高的安全投资之一。
1. 合规要求必须具备
GDPR, HIPAA, PCI DSS, NIST 800-53, ISO 27001, SOX 和 CCPA 均要求组织识别敏感数据并为其应用适当的控制措施。没有某种形式的数据分类,这些框架中的任何一项都无法真正落实。审计人员通常会反复问两个问题:受监管的数据在哪里?谁可以访问这些数据?数据分类级别正是让组织能够同时回答这两点的机制。
2. 将安全投资聚焦到关键之处
组织并没有无限的安全资源。数据分级会将保护重点放在一旦泄露将造成最大损害的数据上,而不是像对待公开营销资产和商业秘密那样在两者之间同等分散控制。这样的优先级策略既降低成本,也减少运营摩擦。
3. 加速事件响应与审计准备
在发生事件时,第一问题永远是“被访问/触达的数据是什么”。当数据被分级后,响应人员会立即知道受影响的资产是公开的营销文件,还是带有监管报告义务的受限客户记录。相同的机制还能支持审计响应、法律取证(legal discovery)以及在 GDPR 下的信息主体访问请求。
4. 降低存储成本并减少攻击面
数据分级会暴露出冗余、过时和琐碎的数据,团队可以对其进行归档或删除,从而降低存储和备份成本。它还能通过最大限度减少存在于不受控制位置的敏感数据的数量来缩小攻击面。
Netwrix Access Analyzer 可解析嵌套的 AD 组和 SharePoint 继承关系,从而发现暴露过多的敏感数据。申请免费试用
4 个数据分类级别详解
四级模型(Public、Internal、Confidential、Restricted)之所以成为商业标准,是有充分理由的。它为组织提供了足够的粒度,能够在每个级别上应用切实不同的控制措施,同时又不会因为标签过多而让用户忘记应当应用哪一个。
大多数合规框架、绝大多数 DLP 产品以及大多数安全团队都默认采用某种版本的这一分类法。
1. 公共数据
公共数据是已获批准可公开分发的信息。由于这些数据本来就打算共享,因此披露不会对组织造成任何损害。示例包括营销材料、公司网站、已发布的新闻稿、招聘启事以及公开研究资料。
处理规则相对宽松。公共数据不需要对静态数据进行加密,也不需要在基本的完整性保护之外额外进行访问控制,因为关注点并非未授权查看,而是未授权修改。除非内容本身变得过时或不准确,否则保留通常是无限期的。
2. 内部数据
内部数据是指旨在组织内部使用的、但并不敏感或受监管的信息。披露可能会带来尴尬或在运营上不便,但不会引发合规风险暴露或造成重大经济损失。示例包括组织架构图、内部电子邮件、公司政策、培训资料以及不敏感的项目文档。
允许经过身份验证的用户访问内部数据,并阻止匿名访问和外部访问。要求在通过外部网络传输时进行加密;在可行的情况下对数据存储时(at rest)进行加密。保留期限遵循内部策略,删除时应使用安全删除(secure-delete)方法,而不是标准的文件删除。
3. 机密数据
机密数据(Confidential data)是指未经授权披露会对组织或个人造成重大损害的信息。对不属于高度敏感行业的组织而言,大多数受监管数据都位于这一级别。示例包括员工档案、客户联系信息、合同细节、非公开的财务数据,以及受 GDPR 约束的一般个人数据。
基于角色(role-based)并按“知情需要”(need-to-know)原则授予访问权限。要求对数据存储时(at rest)和传输中(in transit)进行加密(TLS 1.2 或更高版本)。记录访问事件并定期审查。按数据类型定义保留期限,并使其与适用法规保持一致;在删除时,云存储使用加密擦除(cryptographic erasure),本地存储则使用经过认证的 secure-delete 工具。
4. 受限数据
受限数据是最敏感的分级。未经授权的披露将造成灾难性的损害、监管处罚,或两者兼有。示例包括 HIPAA 下的 Protected Health Information (PHI)、PCI DSS 下的持卡人数据、商业秘密、并购信息、源代码、管理凭据,以及 GDPR Article 9 下的特殊类别个人数据。GDPR Article 9。
访问需要明确批准、多因素认证(MFA)以及全面的日志记录。静态加密应使用 AES-256,而传输中的加密在环境支持的情况下应使用 TLS 1.3。法规通常规定保留要求,而不是将其交由组织自行决定;删除则需要经过认证的销毁,并提供足以满足审计的文档。
数据分级与合规
所有主要的数据保护法规都假设组织能够识别其受监管的数据,并根据数据的敏感程度施加相称的控制措施。分级(classification tiers/levels)是实现这一点的机制。数据类型、分级与所需控制之间的具体对应关系,才是合规工作真正发生的地方。
GDPR
在 GDPR 下,个人数据分为两大类。诸如姓名、联系方式、IP地址以及客户标识符等一般个人数据通常映射到 Confidential(机密)级别,并要求具备合法的处理依据、履行数据主体权利,以及在72小时内进行数据泄露通知。第9条中定义的特殊类别个人数据(健康数据、生物识别数据、揭示政治或宗教观点的数据)映射到 Restricted(受限)级别;在大多数情况下,还需要获得明示同意或其他第9条豁免、提高访问控制强度,并由数据保护官(Data Protection Officer)进行监督。
HIPAA
HIPAA 将受保护的健康信息(Protected Health Information)定义为任何健康数据,其中包含 §164.514 中列出的 18 个标识符中的一个或多个。所有 PHI 都映射到 Restricted(受限)级别。所需控制措施包括:静态和传输过程加密、带审计日志的访问控制、员工培训、与任何处理 PHI 的第三方签订 Business Associate Agreements,以及能够随受影响个人数量扩展的正式泄露通知流程。
PCI DSS
PCI DSS 适用于任何存储、处理或传输持卡人数据的组织。主账号标识(Primary Account Number,PAN)、敏感认证数据以及完整磁道数据都映射到 Restricted(受限)级别。所需控制包括:代币化或 AES 加密、将持卡人数据环境隔离的网络分段、强有力的访问控制、每季度的漏洞扫描,以及每年的渗透测试。无论数据分类如何,授权之后都禁止存储敏感认证数据。
SOX、CCPA 和行业法规
受 SOX 监管 财务报告数据通常会根据其在已披露财务信息中的作用映射到机密(Confidential)或受限(Restricted)。所需的控制措施包括职责分离、变更管理以及七年留存。
CCPA 以及相关的州级隐私法律涵盖消费者个人信息,通常会映射到机密(Confidential)。所需的控制措施重点关注消费者权利,例如知情权、删除权以及选择退出销售(opt-out of sale)。
行业法规(例如教育领域的《家庭教育权利与隐私法》(FERPA)以及金融服务领域的《格雷姆-里奇-布莱利法案》(GLBA))会在基础分类分级的之上叠加其自身的额外要求。
将各项法规的要求映射回分类分级,才能把分类从“贴标签”的工作转变为安全与审计控制。对于那些在纸面上制定了分类政策,但由于政策无法映射到具体的监管控制而导致审计不通过的组织来说,这也是最常见的单一差距。
Netwrix Access Analyzer 通过解析嵌套 AD 组和 SharePoint 继承关系,揭示过度暴露的敏感数据。申请免费试用
数据分类方法
大多数分类方案会结合三种方法,因为单一方法无法覆盖所有数据类型和应用场景。
基于内容的分类
该分类方法会分析文件的实际内容,以查找关键词、模式和指纹。模式匹配可以高精度地发现结构化数据,例如信用卡号、 社会保障号码 和护照号码。关键词和词典匹配能够检测诸如“salary”或“patient”之类的敏感词。文件指纹识别则使用哈希签名,将文档与已知的敏感模板进行匹配。
基于上下文的分类
它会根据数据来自哪里或数据存放在哪里来分配分级。例如,HR 系统生成的文件、存放在由法务团队拥有的文件夹中的文档,或从受监管数据库流出的数据,都可以从其来源自动继承分类。
用户驱动的分类
这种方法依赖数据所有者根据组织政策手动为文档打标签。当用户对自己正在创建的内容具备深入的上下文时,标签的质量最高;但该方法无法在小规模数据量之外扩展,并会产生摩擦,进而随着时间推移降低合规性。
内容与上下文方法可以自动化大部分分类工作;而用户驱动的分类会补充自动化规则所忽略的上下文判断。最有效的方案会在整个数据资产范围内应用自动化,并将含糊不清的文件转交给人工审核人员,而不是仅依赖某一种方法。
如何实施数据分类分级
实施遵循一个五步流程,该流程对应分类项目在实践中真正成功的方式。
界定范围与目标
汇集来自 IT、安全、合规、法务以及业务部门的相关干系人。确定哪些数据源在范围之内(文件服务器、SharePoint、数据库、云存储、SaaS 应用)以及成功应当是什么样子。清晰的范围可避免常见的失败模式:只对一部分数据进行分类并宣称达成目标。
制定正式的数据分类政策
策略应定义每个分类级别、每个级别的准入/资质标准、每个级别对应的处理规则(加密、访问、保留、处置),以及负责对数据进行分类和审查的角色。它还应指定审查频率。
盘点并发现数据
自动发现工具会在本地(on-premises)、云端和 SaaS 等位置扫描结构化与非结构化数据。输出结果是数据存储库、文件类型、数据量以及初始敏感度指标的完整目录。手动盘点无法扩展到小型环境之外的规模。
应用分类标签
对于大部分数据,结合自动化的内容与上下文规则;对于边缘场景和新内容,采用由用户驱动的分类;对于随着时间推移敏感度会发生变化的数据,安排定期的重新分类。标签应在数据在不同系统之间流转时与数据一同保持。
评估风险并持续治理
没有治理的分类会逐渐失效。将分类标签与访问控制绑定,监控策略违规和标记错误,并在业务情境因并购、新法规、产品发布或数据迁移到新环境等事件发生变化时进行重新分类。对已分类数据运行数据风险评估,可识别出下一步最值得投资的具体控制措施。
Netwrix 1Secure 管理 AI 代理可以访问的内容,并跟踪每一次由 AI 驱动的数据交互。请求演示
数据分类级别的最佳实践
少数几个做法就能区分能够带来安全效果的分类计划,以及仅作为文档存在的计划。
- 自动化发现与分类: 手动打标在超出小规模数据量后难以扩展,并且会引入不一致性。以自动模式匹配结合上下文规则作为基础是关键。由用户驱动的分类可以加入判断,但应作为对自动化的补充,而不是替代。
- 先从试点开始: 先从一个部门或一种数据类型入手,根据你学到的内容完善流程与策略,然后再扩展到全公司范围。试图在第一天就对所有数据存储进行分类,会导致覆盖不完整,并引发用户倦怠。
- 让方案保持简单: 更多层级听起来更安全,但会带来摩擦。无法快速判断应适用哪个标签的用户,往往会默认选择最低层级(削弱安全性)或最高层级(削弱可用性)。对大多数商业组织而言,四个层级就足够了。
- 将分类与身份和访问关联起来: 没有强制执行机制的分类标签只是文档。分类应当直接驱动访问控制、DLP 策略以及监控,这样无论数据存放在哪里,缺乏明确批准的人都无法打开 Restricted 数据。
- 按节奏重新分类: 数据的敏感级别会发生变化。产品发布期间被归类为 Confidential 的信息,发布公告后可能会变为 Public。受限的 M&A 数据在交易完成后可能会降级。通过年度评审并结合事件驱动触发器,可以保持标签的准确性。
- 培训员工遵循处理规则:政策的有效性取决于执行它的人。创建、访问或处理机密数据的每一位人员,都应当了解与其职责级别相对应的规则;并且培训至少应每年重复一次。
借助 Netwrix 发现、分类并保护敏感数据
分类是第一步。了解谁能够访问机密数据,以及这种访问是否恰当,正是分类转化为安全成效的关键。
Netwrix Access Analyzer 可在文件服务器、SharePoint、数据库和云存储库中实现企业级数据发现与自动分类。
它使用模式匹配、上下文分析以及 40 多个数据收集模块来识别个人身份信息(PII)、PHI、持卡人数据和自定义数据类型。
自动化的合规映射覆盖 GDPR、HIPAA 和 PCI DSS,并为组织特定的数据类型提供自定义分类规则。
Access Analyzer 还通过与 Active Directory 和 Entra ID 的集成,揭示谁可以访问已分类的数据,使“身份到数据”的关联成为分类输出的原生组成部分,而不是单独的工作流程。
该 Netwrix 1Secure platform 将分类与 Data Security Posture Management (DSPM)、数据访问治理以及身份上下文统一起来。
平台的风险评估仪表板包含 200 多项安全检查,覆盖数据风险、身份风险和基础设施风险,并提供基于 AI 的整改建议。
混合覆盖范围涵盖文件服务器、Microsoft 365、AWS S3、Azure Blob Storage 以及经认证的 NAS 平台(包括 Dell、NetApp 和 Qumulo)。部署选项包括 SaaS、本地部署(on-premises)和混合部署。
超过 13,500 家组织(其中包括近 25% 的《财富》500 强企业)依靠 Netwrix 来保护他们的数据和身份。
请求演示 以查看 Netwrix Access Analyzer 的实际效果。
常见问题
分享到