Özet: Felaket Kurtarma Planı (Disaster Recovery Plan, DRP), kurumunuzun kritik BT sistemlerinin yangın, donanım arızası, fidye yazılımı veya doğal afet gibi olaylar sonrası ne kadar sürede ve hangi veri kaybıyla ayağa kaldırılacağını tanımlar. Bu yazıda bir DRP'yi sıfırdan oluştururken izlenecek 7 adımı ve ölçmeniz gereken iki temel metriği (RTO, RPO) anlatıyoruz.
RTO ve RPO: iki kritik metrik
RTO (Recovery Time Objective): Bir sistemin olay sonrasında yeniden çalışır hale gelene kadar geçen kabul edilebilir azami süre. Örneğin "ERP'miz en fazla 4 saat offline olabilir".
RPO (Recovery Point Objective): Ne kadarlık veri kaybını kabul edersiniz? Son yedekleme ile olay anı arasındaki süre. "15 dakikalık veri kaybına kadar toleransımız var" gibi.
DRP çalışmanızın temeli, her kritik sistem için bu iki değeri belirlemektir. Bunlar maliyet tartışmalarının da çıpasıdır; daha kısa RTO/RPO daha pahalı altyapı demektir.
Pratik tavsiye
Tier 1 (kritik) sistemlerde RTO 1-4 saat, RPO 15 dk; Tier 2'de RTO 8-24 saat, RPO 4 saat; Tier 3'te RTO 48+ saat, RPO 24 saat gibi kademe yapın.
1. İş Etki Analizi (BIA)
Her uygulamanın saatlik offline maliyetini çıkarın. Sadece gelir kaybı değil; itibar, yasal yükümlülük, tedarikçi ceza maddeleri de dahil. Bu analiz, hangi sisteme ne kadar yatırım yapmanız gerektiğini netleştirir.
2. Varlık envanteri
Sunucular, veritabanları, SaaS uygulamaları, ağ cihazları, dış bağımlılıklar. Hangi uygulama hangi altyapıya bağımlı? Çoğu kurum kendi BT envanterinin %20'sini bilmiyor; çizilen topoloji ile gerçek arasındaki fark, felaket anında sürprizlere yol açıyor.
3. Kurtarma stratejilerini seçin
Seçenekler (maliyet-hız ters orantısı):
- Cold site: Yedek lokasyonda sadece boş altyapı. Ucuz, RTO günler.
- Warm site: Yedek altyapı önceden kurulu, veri periyodik senkron. RTO saatler.
- Hot site: Aktif-aktif veya aktif-pasif ayna. RTO dakikalar, maliyet yüksek.
- Cloud DR: Yedek altyapı buluta hazır bekliyor, sadece olay anında ayağa kalkıyor (pilot light veya warm standby). Maliyet dengeli.
4. Yedekleme stratejisi: 3-2-1 kuralı
En az 3 kopya, 2 farklı medya (disk + tape veya disk + bulut), 1 tanesi offsite. Modern öneri 3-2-1-1-0: ek olarak 1 kopya immutable (silinemez), 0 hata (her yedek başarılı doğrulanmış).
5. Runbook ve playbook yazın
Olay anında kimin ne yapacağını adım adım yazın. Dakika 0, 15, 60, 240 aksiyonları. Kritik telefon numaraları, tedarikçi kontakları, şifre kasası erişim prosedürü. Bu belge yazılı ve erişilebilir olmazsa stres anında hiç kimse hatırlamaz.
6. İletişim zinciri
Kim, kime, hangi sırayla haber verecek? Yönetim, müşteriler, regülatör (bazı sektörlerde 72 saat içinde bildirim zorunluluğu var), medya. Bildirim şablonları önceden hazır olsun. Kriz iletişimi kötü yönetildiğinde teknik kurtarma başarılı olsa bile marka zarar görür.
7. Test edin, test edin, test edin
Yazılı bir DRP, test edilmemişse bir temenni belgesidir. Önerilen test döngüsü:
- Tabletop (masa başı): Çeyrekte bir. Senaryo üzerinde ekipler adımları tartışır.
- Partial failover: Yılda en az 2 kez. Tek bir sistem gerçekten yedek altyapıda çalıştırılır.
- Full failover: Yılda 1 kez. Tüm kritik yük yedek lokasyona alınır, gerçek çalışma simüle edilir.
Kurumunuz için DRP çıkarabiliriz
Mevcut altyapınızı ve hedeflerinizi değerlendirip size özel felaket kurtarma planı hazırlayalım.



