根据 Active Directory(AD)安全评估,只有36%的组织在过去12个月内进行了评估,The Netwrix 2026 Data and Identity Security Report。同一调查发现,73%的受访者不完全确信其AD没有允许权限提升的错误配置。
Microsoft Threat Intelligence 报告称,威胁行为者在超过78%的人为操作的网络攻击中入侵域控制器,利用未评估环境留下的漏洞。
这使得 AD 灾难恢复成为身份弹性问题,最坏的情况是整个林中所有域控制器(DC)都宕机、复制损坏或备份本身被加密的事件。
备份计划和恢复计划证明的是不同的内容。计划证明数据存在于某处。恢复计划证明企业能够在压力下从这些数据重建一个可用的目录,因此一个可用的计划定义了必须承受的最坏情况故障、恢复顺序以及证明其有效的测试频率。
什么是Active Directory灾难恢复?
Active Directory 灾难恢复是指在单个对象恢复无法修复的故障(如整个林的中断、损坏或被攻破)后,恢复整个 AD 林的有文档记录的顺序流程。
林恢复遵循严格的依赖顺序。该计划定义了哪个域控制器先恢复,团队重新分配Flexible Single Master Operations (FSMO roles)的顺序,以及如何在不传播损坏数据的情况下重新建立复制。
该术语宽泛地应用于从 恢复单个已删除用户账户 到重建整个林区,这两者需要完全不同的计划。从AD回收站恢复单个对象假设周围的林区是健康的;完整的林区恢复则基于林区本身已损坏的前提。
最坏的AD故障场景是什么样的?
这些AD故障场景促使组织追求完整的林恢复,而非常规故障排除。
勒索软件一次性加密或清除所有域控制器
勒索软件操作者现在直接针对域控制器,获取highly privileged accounts使攻击者能够在同一操作中删除备份。如果备份DC与生产环境位于同一网络段,导致AD瘫痪的攻击同样会使用于恢复的备份瘫痪。微软的标准是所有DC逻辑上被破坏或物理损坏到业务连续性不可能的程度,才能进行林恢复。
Maersk 2017年的NotPetya事件是此情景的典型案例。恶意软件在一小时内清除了Maersk全球网络中几乎所有的域控制器,公司之所以避免了全面损失,仅仅是因为其位于加纳阿克拉办公室的一个DC在攻击发生时因当地停电而关闭。正是这唯一幸存的副本使Maersk得以重建其余的Active Directory林,尽管Maersk的CISO后来表示 恢复所花的九天“还不够好”。更广泛的重建最终涵盖了大约4000台服务器和45000台PC,而且Maersk估计 总成本高达3亿美元。
被入侵的管理员账户删除OU、GPO或整个子树
拥有 Domain Admin 或 Schema Admin 权限的恶意管理员可以在复制流中进行与合法操作无法区分的更改。没有来自备份的已知良好基线,单个对象的恢复无法确定哪些更改是恶意的。
组织单位(OUs)、Group Policy Objects (GPOs)或子树的删除常常被忽视,因为这看起来像是正常的管理操作。除非团队从可信备份中恢复并验证结果,否则修改Kerberos票据、SIDHistory、AdminSDHolder或GPOs的持久化技术可能会保留在目录数据库中。
损坏的复制或在所有 DC 之间传播的错误架构更改
攻击者或管理员可以运行一个脚本,传播数据损坏遍及整个林,或通过冲突更改扩展架构,这些更改会在各处复制。当错误变得可见时,它可能已经存在于林中的每个域控制器上,包括恢复计划假设为干净的那些。架构分区是整个林范围内的,并由每个域共享,因此损坏的架构会同时破坏所有域的操作。
没有地理冗余DC的全站硬件故障或自然灾害
Microsoft的林恢复标准侧重于逻辑损坏和物理损害,单一地点的物理事件会产生相同的结果。将所有域控制器都运行在单一地点或数据中心的组织,面临因火灾、洪水或停电而失去整个林的风险,导致生产和任何共置的备份DC停机。地理冗余是防范此类故障的主要结构性防御措施。
在过程中损坏架构的失败的AD升级或迁移
除了攻击引起的故障外,架构修改还可能导致林处于不一致状态。架构修改会复制到所有DC,并且在正常操作下基本不可逆,因此回滚并不总是简单,损坏或冲突的架构可能会同时破坏每个域的整个林操作。
Netwrix Identity Recovery 在勒索软件或损坏后将 AD 对象、属性和整个林恢复到已知良好状态。请求演示
为什么AD灾难恢复计划很重要
没有计划,上述每种情况的结局都是一样的,即兴应对,在压力下,所有依赖系统已全部宕机。
勒索软件组织现在直接针对域控制器和备份
已记录的策略 显示了这已经远远超越了端点加密。攻击者现在关闭域控制器虚拟机以直接提取凭据数据库,并将FSMO角色转移到他们控制的恶意域控制器。
这一暴露也出现在调查数据中。在The Netwrix 2026 Data and Identity Security Report背后的调查中,25%的组织报告称在过去12个月内发生过未经授权身份访问敏感数据的事件。
假设备份自动安全的恢复策略已不再符合这些攻击的发展方式。
每当AD宕机时,所有依赖系统也会宕机
电子邮件、文件访问、VPN 和大多数业务应用程序都通过 AD 进行身份验证,因此停机成本会在每个依赖系统上按小时累积。如果 identity、DNS、网络、机密或数据库不可用,应用程序可能会恢复但仍无法使用,导致停机时间超出既定的恢复时间目标。
First National Bank Minnesota 直接感受到了这一需求,并在 Netwrix Auditor 的支持下,在三周内完成了Active Directory的重建,原计划估计为六个月。
Microsoft的林恢复过程漫长,依赖顺序且不容宽恕
官方Microsoft AD forest recovery guide 详细介绍了机械重建步骤,明确排除了受损后的安全恢复、规划与治理,以及向领导层或保险公司报告。若步骤执行顺序错误,例如跳过 metadata cleanup 或按依赖顺序之外恢复域控制器,可能会使重建无效并强制重新开始。
董事会和网络保险公司要求经过测试的恢复时间目标
经过测试的AD恢复时间目标为领导层、董事会和保险公司提供了具体的评估指标。它反映了在现实条件下执行的实际恢复。仅声明存在灾难恢复计划,所提供的操作证据不及带有测量阶段时间和完成标准的有日期恢复测试。
未经测试的计划在实际事件中失败
恢复计划中的漏洞在真正的压力下最先显现,而这也是发现它们最昂贵的时刻。信心和能力衡量的是不同的东西,只有测试才能将它们调和。
AD灾难恢复计划应包含的内容
下面的每个组件说明了它涵盖的内容以及为何在关键时刻遗漏它会破坏计划。
- 每个域控制器的系统状态不可变离线备份: 如果备份存放在与生产环境相同的网络中,导致 AD 停止运行的勒索软件可能会访问用于恢复的备份副本。隔离或不可变存储将恢复介质置于不同的故障路径之外,且支持 AD 的备份应用程序可避免恢复时更新序列号(USN)回滚。
- 有文档的、有序的重建顺序:林恢复有严格的顺序依赖,乱序恢复DC或重新分配FSMO角色可能会进一步破坏林而非修复它。微软指出该过程没有端到端自动化,这使得环境特定的计划负担加重。
- 针对AD测试过的恢复时间目标(RTO): 备份计划告诉您数据存在;RTO告诉您业务中断了多久,这是领导层和保险公司可以审核的数字。 恢复点目标(RPO)与之并列,定义了您可以容忍丢失多少目录更改。
- 针对 AD 故障的明确定义的沟通和升级计划: 在实际的 AD 故障期间,团队通常用来协调的工具,包括电子邮件、Teams 和工单系统,通常也会宕机。该计划需要明确团队如何在没有这些工具的情况下沟通,使用离线存储并提前分发的联系树。
- 计划的恢复演练或桌面演习: 团队从未排练过的计划会在实际事件中暴露其漏洞,而不是在受控测试中。定期演练在恢复团队承受事件压力之前,建立组织的肌肉记忆。
目录恢复软件应支持两种操作模式:细粒度对象修复和完整林重建,以免某类故障迫使团队在事件处理中途切换到第二个工具。
目录恢复还依赖于相邻的身份控制:zero standing privilege 在事件发生前减少持续的管理员暴露,ephemeral admin accounts 限制特权凭据的生命周期,access certification 保持特权访问的证据最新。
如何制定能应对最坏情况的AD灾难恢复计划
按正确顺序制定计划与计划内容同样重要。下面的每一步都依赖于前一步,跳过步骤会导致计划看似完整,但未经过依赖关系的压力测试。
1. 首先清点您的forest结构及所有依赖项
在编写任何恢复步骤之前,映射每个域控制器、FSMO角色持有者、信任关系和DNS依赖项。没有此清单的计划将在真正需要时遗漏依赖项。Microsoft的指导 将林根域DC列表视为最重要的项目,因为该域将首先恢复。
包括全局编录服务器、站点链接和复制拓扑,因为这些决定了DC重新上线的顺序。请在清单旁捕获基础的repadmin /showrepl和dcdiag输出,以便恢复团队了解健康状态的样子。
请立即记录每个域的Domain Admin密码和Directory Services Restore Mode(DSRM)密码,因为系统状态恢复需要它们,且无法从已失效的林中检索。
2. 在一般DR计划之外,设置专门的AD恢复时间目标
AD 的 RTO 需要比所有依赖它的系统的 RTO 更短,因为在 AD 完全恢复之前,其他系统无法完全恢复。微软的规则是必须先恢复父域再恢复子域,这意味着林根 RTO 控制着所有下游系统。将 AD 恢复视为更广泛灾难恢复计划中的一项通常会低估其紧迫性。
从故障声明到功能性林根DC恢复并确认复制,测量AD RTO。每个依赖应用程序的RTO应超过该数值。
3. 按顺序写下重建步骤,并存放在 AD 无法锁定您的地方
The sequence needs to specify which DC restores first, in what order FSMO roles get reassigned, and how replication gets re-verified. For the first writable DC in a domain, the runbook needs to cover each recovery action in this order:
- 执行 Active Directory Domain Services (AD DS) 的非权威性还原。
- Complete an authoritative restore of SYSVOL, the shared system volume that stores domain scripts and Group Policy files.
- Run metadata cleanup for DCs you aren't restoring.
- Seize FSMO roles.
- Invalidate the Relative Identifier (RID) pool and raise the available RID pool value by 100,000 to prevent reissuing RIDs consumed after the backup.
- Reset the DC computer account password twice.
- Reset the krbtgt password twice to protect the Kerberos Ticket Granting Ticket account, with a 10-hour wait between resets.
Write these steps clearly enough for the recovery team to follow them without normal AD-dependent tools. The plan itself has to live outside AD-dependent systems. A runbook stored on a SharePoint site that requires AD to authenticate is useless when AD is down.
4. Build immutable, air-gapped backups of system state
Backups need isolation from the production network so that whatever took down AD, whether ransomware or a compromised admin account, can't also reach the copies meant to restore it. Critical backups belong in separate storage protected from unauthorized modification.
备份时间也必须保持在林的墓碑寿命内(默认180天),因为AD会拒绝从较旧介质恢复。
在遭受攻击后制作的备份可能会连同AD一起恢复恶意软件和攻击者的持续存在,因为SIDHistory操作、AdminSDHolder更改和恶意GPO都存在于目录数据库中。隔离和干净恢复验证可防止攻击者重新进入目录。
5. 指定明确的所有权和命名的升级路径
明确执行恢复各阶段的人员及其在步骤失败时升级的对象,以免计划在实际事件中等待有人主动而停滞。
没有预先构建的依赖清单和指定所有者,恢复团队在压力下被动发现相互依赖关系,且无法获得所有原始系统架构师的支持。
为每个阶段指定一名主要负责人和一名备份,并确认两者都知道如何通过计划中定义的离线通信渠道相互联系。
在需要之前如何测试AD恢复计划
仅存在于纸上的恢复计划在测试证明其有效之前,仍然只是一个假设。
1. 在尝试实时故障转移测试之前,先进行桌面演练
逐步引导团队通过书面计划,且不涉及生产环境。使用基于讨论的演练,让人员讲述他们在特定紧急情况中的角色和响应,无需部署设备。这有助于在系统面临风险前发现责任和顺序上的漏洞,其结果将明确后续实战演练的范围。
2. 按设定周期在隔离的测试环境中恢复林
桌面演练检查计划的逻辑。只有在隔离环境中进行真实恢复,才能验证备份和重建顺序是否真正有效。
Microsoft建议将虚拟化的DC迁移到与生产环境隔离的虚拟网络中,并在实验室中使用生产备份,以便测试证明真实的恢复数据能够恢复。Microsoft 建议至少每年进行此演练,并且每当Enterprise Admins或Domain Admins组成员发生变化时再次进行。
3. 测量实际恢复时间线
计划中的RTO仅在经过实际测试恢复测量后才有效。未经验证的数字只是猜测。记录每个阶段的实际时间,包括隔离、恢复、FSMO接管和复制验证,以确保计划反映团队实际能够执行的内容。
Help Net Security在2024年报告 只有6%的企业能在一小时内恢复AD,这意味着大多数声明的RTO远高于团队的预期。dcdiag检查完成,运行正常;SYSVOL和NETLOGON共享存在,DNS运行健康。
4. 每当林拓扑结构发生变化时更新计划
新的域控制器、架构更改或新的信任关系可能使重建序列的部分无效,因此该计划除了年度审查外,还需要基于触发器的审查节奏。FSMO角色持有者、站点拓扑或复制链接的更改是计划漂移的最常见原因。
将迁移、升级和新的应用部署添加到触发列表中,因为每个都可能引入现有序列未考虑的依赖项。每次触发的审查应以更新的清单结束,并且当更改涉及拓扑、trusts或架构时,应进行新的恢复测试。
Netwrix如何支持Active Directory恢复
Netwrix Identity Recovery 涵盖了本计划区分的两种恢复模式。对于对象级别的事件,它保留目录更改的时间线,并将已删除或修改的用户、组、GPO 和 DNS 记录回滚到已知的良好状态,而不影响林的其余部分。
针对上述最坏情况,它自动执行完整的AD林恢复序列。覆盖范围扩展到Entra ID和Okta,因此混合身份可在同一运行手册下恢复。
恢复决策也依赖于证据,因为在安全漏洞中,第一个问题是哪个备份早于攻击者。
Netwrix Auditor 通过持续的 AD change auditing 提供该上下文,显示谁在何时更改了什么,并通过前后值区分恶意更改和合法更改。其时间状态报告比较目录在两个时间点之间的配置,帮助团队确定妥协何时开始以及哪个备份早于妥协。
柴郡县政府 使用 Netwrix Auditor 在15分钟内调查了27,000个文件更改事件,这是目录宕机时恢复团队所需的证据速度。
在相同工具上进行演练和真实事件,使每个阶段都可比较,因此在隔离实验室测量的RTO与团队向领导层报告的数字相同。
将您的AD恢复计划转变为经过测试的有效流程
真正的准备状态取决于领导层可以审查的证据。这意味着有日期的恢复测试、经过测量的AD RTO、在tombstone生命周期内的已知良好备份集,以及为每个恢复阶段指定负责人运行手册。
该方案回答了董事会、审计员和网络保险公司现在提出的问题,并且经得起考验,因为每一项内容都来自演练而非断言。
第一次孤立恢复揭示了缺失的DSRM密码、无人清点的依赖项,以及打破假定RTO的阶段。第二次演练更顺利,产生了业务可以据此规划的数字。此后,基于触发的审查保持计划与林环境同步,随着域控制器、信任关系和架构的演进,文档化计划与实际环境之间的差距不会再次扩大成风险。
请求演示,了解 Netwrix Identity Recovery 如何在您自己的拓扑中处理林重建、细粒度回滚和恢复演练。
关于Active Directory恢复的常见问题
分享到
了解更多
关于作者