Etki Analizi ve RTO/RPO
Hangi sistemin kaç saat durabileceğini ve ne kadar veri kaybını kaldırabileceğini iş birimleriyle birlikte belirleriz. Tüm tasarım bu iki rakamın üzerine kurulur.
Felaket Kurtarma
Yedeğiniz sağlam olabilir; ancak sunucular, ağ ve uygulamalar yoksa veri tek başına iş üretmez. Felaket kurtarma, veriyi değil çalışma ortamının tamamını ikinci bir lokasyonda ayağa kaldırmakla ilgilidir. Ölçüsü de tek bir rakamdır: ne kadar sürede yeniden iş yapabiliyorsunuz?
Neden Önemli?
Bir veri merkezini kaybettiğinizde sıra yedekten dönmeye geldiğinde iş çoktan durmuştur. Sunucuları yeniden kurmak, ağı ayağa kaldırmak, terabaytlarca veriyi geri yazmak ve uygulamaları doğru sırayla başlatmak günler alabilir. Çoğu kurum için asıl maliyet kaybolan veri değil, o günlerdir.
Felaket kurtarma bu süreyi baştan kısaltmakla ilgilidir: kritik sistemler ikinci bir lokasyona sürekli kopyalanır, geçiş adımları önceden yazılır ve düzenli tatbikatla denenir. Veluva bu yapıyı kurumun gerçek RTO hedefine göre kurgular; ikinci veri merkezi yatırımı yapamayan kurumlar için bulut tabanlı, kullanıldıkça ödenen bir model tasarlarız.
Kurtarma süresi tahmin değil, tatbikatla kayda geçmiş bir rakamdır.
Bulut tabanlı DR ile ikinci veri merkezi kurmadan koruma sağlanır.
Kriz anında kimin ne yapacağı, hangi sırayla, önceden bellidir.
Yetenekler
Replikasyondan tatbikata kadar felaket kurtarmanın tüm bileşenlerini kurar ve düzenli olarak doğrularız.
Hangi sistemin kaç saat durabileceğini ve ne kadar veri kaybını kaldırabileceğini iş birimleriyle birlikte belirleriz. Tüm tasarım bu iki rakamın üzerine kurulur.
Kritik sanal makineleri ve verileri ikinci lokasyona sürekli kopyalarız. Dakikalar mertebesinde RPO gerektiren sistemlerde blok düzeyinde replikasyon kullanılır.
İkinci veri merkezi yatırımı yerine Azure Site Recovery gibi çözümlerle bulutta bekleyen bir kurtarma ortamı kurarız. Kaynak yalnızca felaket ya da tatbikat anında ücretlendirilir.
Sistemleri doğru sırayla ayağa kaldırırız: önce dizin ve veritabanı, sonra uygulama katmanı. Bağımlılıklar haritalanmazsa geçiş yarıda takılır.
Kullanıcıların ikinci lokasyona nasıl bağlanacağını, DNS ve yönlendirme değişikliklerini önceden tasarlarız. Sunucular çalışsa da erişim yoksa iş başlamaz.
Failover senaryosunu üretimi etkilemeden izole biçimde çalıştırır, süreyi ölçer ve aksayan adımları düzeltiriz. Sonuç, yönetime sunulabilir bir raporla belgelenir.
Ne Zaman İhtiyaç Duyarsınız?
Aşağıdakilerden biri bile tanıdık geliyorsa, bir veri merkezi kaybında ne olacağı bugün belirsiz demektir. Kısa bir değerlendirmeyle gerçek kurtarma sürenizi ortaya çıkarabiliriz.
Nasıl Kuruyoruz
Felaket kurtarmayı dört adımda kurar; teslimden önce en az bir kez gerçekten çalıştırırız.
Kritik sistemler, bağımlılıklar ve RTO/RPO hedefleri belirlenir.
İkinci lokasyon, replikasyon yöntemi ve geçiş adımları planlanır.
Replikasyon devreye alınır, geçiş planı yazılır ve otomatikleştirilir.
Failover izole ortamda denenir, süre ölçülür, plan güncellenir.
Öne Çıkan Platformlar
Felaket kurtarma platformlarında sertifikalı deneyime sahibiz. Doğru çözümü RTO hedefiniz, veri hacminiz ve bütçeniz belirler.
Sık Sorulanlar
Yedek veriyi geri getirir; ancak sunucuları kurmak, ağı ayağa kaldırmak ve terabaytları geri yazmak günler sürebilir. Bu süre işiniz için kabul edilebilirse yedekleme yeterlidir. Değilse, sistemlerin ikinci lokasyonda hazır beklediği bir yapı gerekir. Kararı biz değil, kabul ettiğiniz kesinti süresi verir.
Hayır. Bulut tabanlı felaket kurtarma tam da bu yatırımı gereksiz kılar. Sanal makineleriniz buluta sürekli kopyalanır ama çalışır durumda beklemez; ciddi bir maliyet oluşturmadan hazır durur. Kaynak yalnızca gerçek felaket ya da tatbikat anında ücretlendirilir.
Hayır. Tatbikatı izole bir ağda çalıştırırız: sistemler kurtarma ortamında ayağa kalkar, açılış ve veri doğrulanır, süre ölçülür; üretim tarafında hiçbir şey değişmez. Bu, gerçek kesinti anına hazırlanmanın tek dürüst yoludur.
Hayır ve genellikle gerekmez. Kritik sistemleri kapsama alır, kalanını daha uzun kurtarma süresiyle yedekten dönecek şekilde bırakırız. Her sistemi en yüksek koruma seviyesine almak, çoğu kurum için gereksiz maliyet demektir.
Bu teknik değil, iş kararıdır ve kriz anında tartışılmamalıdır. Planda karar verme yetkisinin kimde olduğunu, hangi eşikte devreye gireceğini ve iletişimin nasıl yürüyeceğini önceden tanımlarız.
Failback de planın parçasıdır ve çoğu kurumun atladığı yer burasıdır. İkinci lokasyonda üretilen veriyi kaybetmeden birincil sisteme geri dönmeyi tasarlar, bu adımı da tatbikat kapsamında denemeyi öneririz.
İlgili Çözümler
Sonraki Adım
Kısa bir değerlendirmeyle kritik sistemlerinizi, hedef kurtarma sürenizi ve bugünkü gerçek durumunuzu karşılaştıralım. Bağlayıcı taahhüt yok.