Skip to content

Lesson 03 — Disaster Recovery Architectures

Learning Path

☁️ Phase 02 – AWS Cloud Security

📘 Module 10 – Backup, Disaster Recovery & Business Continuity


By the end of this lesson, you will be able to:

  • Understand Disaster Recovery (DR).
  • Compare AWS Disaster Recovery strategies.
  • Calculate RPO and RTO for different workloads.
  • Design Multi-Region architectures.
  • Select the appropriate DR strategy based on business requirements.
  • Build enterprise disaster recovery plans.
  • Test and validate recovery procedures.

📚 Lesson Information

Estimated Time: 4 Hours

Difficulty: Advanced

Prerequisites: Lesson 02 – AWS Backup & Recovery Services

Hands-on Lab: Yes


CloudNova Technologies now serves customers across North America, Europe and Asia-Pacific.

Its AWS environment includes:

  • 70 AWS Accounts
  • 3 AWS Regions
  • 2,000 Amazon EC2 Instances
  • 600 Amazon RDS Databases
  • Amazon EKS Clusters
  • Payment Platforms
  • Customer Portals
  • AI Services
  • Financial Systems

One afternoon, an unexpected event occurs.

A complete AWS Region becomes unavailable due to a large-scale infrastructure failure.

Immediately:

  • Customer logins fail.
  • Payment processing stops.
  • APIs become unreachable.
  • Databases cannot be accessed.
  • Internal operations halt.

The CEO asks:

“How quickly can we recover our services without losing customer data?”

As the Cloud Security Engineer, your responsibility is to implement a Disaster Recovery strategy that balances availability, recovery time and cost.


Disaster Recovery (DR) is the process of restoring IT systems, applications and data after a major disruption.

Disasters may include:

  • Regional outages
  • Ransomware attacks
  • Hardware failures
  • Accidental deletion
  • Insider threats
  • Data corruption
  • Network failures
  • Natural disasters

The objective is to restore business operations as quickly and safely as possible.


Many people confuse backups with disaster recovery.

Backup Disaster Recovery
Protects data Restores entire business services
Focuses on recovery points Focuses on complete service restoration
Usually one component Complete recovery strategy

Backups are part of Disaster Recovery—not the entire solution.


CloudNova follows this process.

Risk Assessment
Business Impact Analysis
Select DR Strategy
Build Recovery Environment
Replication
Disaster Occurs
Failover
Business Recovery
Failback
Continuous Improvement

Every DR strategy is driven by two business requirements.

Metric Meaning
RPO Maximum acceptable data loss
RTO Maximum acceptable downtime

Example:

Failure
Recovery Starts
Application Available
30 Minutes
RTO
Latest Backup
Failure
15 Minutes Data Lost
RPO

AWS recommends four primary Disaster Recovery strategies.

From lowest cost to highest availability.

Backup & Restore
Pilot Light
Warm Standby
Multi-Site Active/Active

This is the simplest Disaster Recovery strategy.

Production resources exist only in the primary Region.

Backups are stored securely.

Infrastructure is recreated after a disaster.

Production Region
AWS Backup
Backup Vault
Disaster
Restore
Business Online

Advantages

  • Lowest cost
  • Easy to implement
  • Excellent for non-critical workloads

Disadvantages

  • Longest recovery time
  • Infrastructure must be rebuilt

  • Development
  • Test environments
  • Internal systems
  • Small business applications

Pilot Light keeps only essential infrastructure running in the DR Region.

Example:

Primary Region
Production Database
Continuous Replication
Secondary Region
Database Running
Application Servers Created During Disaster

Only critical components remain active.

Everything else starts during recovery.


Advantages

  • Faster recovery
  • Lower infrastructure cost
  • Good balance between cost and resilience

Disadvantages

  • Recovery automation required
  • Scaling takes time

  • Customer Portals
  • SaaS Platforms
  • Medium-sized enterprises

Warm Standby maintains a smaller fully functioning production environment.

Primary Region
Full Production
Replication
Secondary Region
Small Running Environment
Scale Up During Disaster

Applications are already operational.

Capacity increases after failover.


Advantages

  • Fast recovery
  • Reduced downtime
  • Less operational complexity

Disadvantages

  • Higher infrastructure costs

  • E-commerce
  • Banking
  • Enterprise Applications
  • Healthcare

Both Regions actively serve customer traffic.

Users
Route 53
Region A
Region B
Synchronized Data

If one Region fails, traffic automatically shifts to the remaining Region.


Advantages

  • Lowest downtime
  • Highest availability
  • Best customer experience

Disadvantages

  • Highest implementation cost
  • Most complex architecture

  • Global Banking
  • Payment Platforms
  • Government Systems
  • Healthcare
  • Critical Enterprise Applications

Strategy Cost Complexity RTO RPO
Backup & Restore Low Low Hours Hours
Pilot Light Medium Medium Minutes to Hours Minutes
Warm Standby High Medium Minutes Minutes
Multi-Site Active/Active Very High High Seconds Near Zero

CloudNova selects strategies based on business criticality.

Application DR Strategy
Online Banking Active/Active
Customer Portal Warm Standby
HR Application Pilot Light
Development Environment Backup & Restore

The business—not technology alone—determines the appropriate recovery strategy.


Amazon Route 53
┌────────────────┼────────────────┐
│ │
Primary Region Secondary Region
│ │
Application Load Balancer Application Load Balancer
│ │
Amazon EC2 Amazon EC2
│ │
Amazon RDS ←──Replication──→ Amazon RDS
│ │
AWS Backup Backup Vault

Regional Failure
CloudWatch Alarm
Amazon EventBridge
Recovery Automation
Route 53 Failover
Recovery Validation
Business Restored

Moving production workloads to the recovery environment.

Primary Region
Failure
Secondary Region
Production

Returning production workloads to the primary Region after recovery.

Primary Region Restored
Synchronise Data
Traffic Returned
Normal Operations

CloudNova performs regular recovery exercises.

Testing includes:

  • EC2 Recovery
  • Database Recovery
  • DNS Failover
  • Application Validation
  • User Authentication
  • Backup Restoration
  • Security Validation

Recovery plans that are never tested should not be considered reliable.


Every disaster recovery event follows a documented runbook.

Typical sections include:

  1. Incident Detection
  2. Executive Notification
  3. Technical Assessment
  4. Disaster Declaration
  5. Recovery Team Activation
  6. Infrastructure Recovery
  7. Application Validation
  8. Security Validation
  9. Business Sign-Off
  10. Lessons Learned

CloudNova standards include:

  • Define RPO and RTO for every application.
  • Select DR strategies based on business impact.
  • Use Infrastructure as Code (IaC) to automate recovery.
  • Replicate critical workloads across Regions.
  • Test Disaster Recovery quarterly.
  • Automate DNS failover.
  • Encrypt replicated data.
  • Document recovery runbooks.
  • Continuously review recovery objectives.

🛠 Lab 01 — Compare Disaster Recovery Strategies

Section titled “🛠 Lab 01 — Compare Disaster Recovery Strategies”

Complete the following table.

Workload Recommended Strategy
Banking Application
Customer Portal
Internal HR System
Development Environment

Explain your decisions.


Given the following business requirements:

Application Maximum Data Loss Maximum Downtime
Payment Gateway 5 Minutes 15 Minutes
HR System 2 Hours 8 Hours
Development 24 Hours 24 Hours

Determine:

  • RPO
  • RTO
  • Appropriate DR Strategy

🛠 Lab 03 — Design a Multi-Region Architecture

Section titled “🛠 Lab 03 — Design a Multi-Region Architecture”

Create a Disaster Recovery design including:

  • Primary Region
  • Secondary Region
  • Route 53
  • Load Balancers
  • EC2
  • RDS
  • AWS Backup

Draw the architecture and explain the failover process.


Scenario:

The primary AWS Region becomes unavailable.

Document:

  • Recovery Steps
  • Failover Process
  • Estimated RTO
  • Estimated RPO
  • Validation Checks

🛠 Lab 05 — Create a Disaster Recovery Runbook

Section titled “🛠 Lab 05 — Create a Disaster Recovery Runbook”

Include:

  • Incident Detection
  • Communication Plan
  • Technical Recovery Steps
  • Validation
  • Business Sign-Off

Terminal window
aws ec2 describe-instances

Terminal window
aws rds describe-db-instances

Terminal window
aws route53 list-hosted-zones

Terminal window
aws route53 list-health-checks

Terminal window
aws backup list-recovery-points-by-backup-vault \
--backup-vault-name ProductionVault

Terminal window
aws ec2 describe-regions

Verify that you can:

✔ Explain Disaster Recovery.

✔ Differentiate DR from backups.

✔ Compare AWS Disaster Recovery strategies.

✔ Calculate RPO and RTO.

✔ Design Multi-Region architectures.

✔ Explain failover and failback.

✔ Build Disaster Recovery runbooks.


Recovery takes longer than expected.

Review:

  • RTO requirements.
  • Infrastructure automation.
  • Backup locations.
  • DNS propagation.
  • Recovery procedures.

Data loss exceeds business expectations.

Verify:

  • Replication frequency.
  • Backup schedules.
  • Database replication.
  • Cross-Region replication.

Failover unsuccessful.

Check:

  • Route 53 health checks.
  • Load Balancer configuration.
  • Security Groups.
  • IAM permissions.
  • Application dependencies.

❌ Assuming backups alone provide Disaster Recovery.

❌ Selecting DR strategies based solely on cost.

❌ Never testing failover.

❌ Ignoring application dependencies.

❌ Forgetting DNS failover planning.

❌ Not documenting recovery procedures.

❌ Failing to automate infrastructure deployment.


CloudNova plans to launch a global payment platform with a target availability of 99.99%.

Design a Disaster Recovery solution that includes:

  1. Appropriate DR strategy.
  2. Multi-Region architecture.
  3. Route 53 failover.
  4. Database replication.
  5. Backup strategy.
  6. Estimated RPO.
  7. Estimated RTO.
  8. Disaster Recovery Runbook.
  9. Executive communication plan.

Prepare:

  • Disaster Recovery Architecture
  • Recovery Workflow
  • RPO/RTO Matrix
  • Risk Assessment
  • Recovery Runbook
  • Executive Recovery Report

  1. What is Disaster Recovery?
  2. How is Disaster Recovery different from Backup?
  3. What is RPO?
  4. What is RTO?
  5. Which AWS Disaster Recovery strategy has the lowest recovery time?
  6. What is the difference between Pilot Light and Warm Standby?
  7. When should Multi-Site Active/Active be used?
  8. What is failover?
  9. What is failback?
  10. Why should Disaster Recovery plans be tested regularly?

After completing this lesson, you should understand:

  • Disaster Recovery extends beyond backups by restoring complete business services after a disruption.
  • AWS supports four primary Disaster Recovery strategies: Backup & Restore, Pilot Light, Warm Standby and Multi-Site Active/Active, each balancing cost, complexity and recovery objectives differently.
  • Recovery Point Objective (RPO) and Recovery Time Objective (RTO) are business-driven metrics that determine the most appropriate recovery architecture.
  • Multi-Region designs, automated failover and documented recovery runbooks significantly improve organisational resilience.
  • Regular Disaster Recovery testing is essential to verify that recovery objectives can be achieved when a real incident occurs.

➡️ Lesson 04 — Business Continuity Planning