20 yılı aşkın kurumsal BT deneyiminde ve 1.370'ten fazla fiziksel ve sanal sunucunun bulunduğu yapılarda en önemli ders şudur: yüksek erişilebilirlik tek bir ürün değil, birlikte çalışan bir yönetim disiplinidir.
Önce RPO ve RTO belirlenmeli
Her sistem aynı kritik seviyede değildir. E-posta, PMS/POS, ERP, kimlik doğrulama veya dosya hizmetleri için kabul edilebilir kesinti ve veri kaybı süreleri farklı olabilir. RTO, servisin ne kadar sürede geri dönmesi gerektiğini; RPO ise kabul edilebilir veri kaybı aralığını tanımlar.
Bu iki hedef yazılı değilse altyapı yatırımı kolayca gereğinden pahalı veya iş ihtiyacına göre yetersiz hale gelir. Teknik mimari, satın alınacak ürünlerden önce iş birimleriyle birlikte bu hedeflere göre tasarlanmalıdır.
Tek hata noktaları katman katman kaldırılmalı
Güç ve fiziksel altyapı
UPS, jeneratör, çift güç kaynağı, soğutma, kabin ve çevresel izleme birlikte değerlendirilmelidir.
Ağ bağlantıları
Çift switch, yedek uplink, bağımsız internet hatları ve doğru döngü önleme tasarımı gereklidir.
Sunucu ve sanallaştırma
Kümeleme, canlı taşıma, kaynak rezervi ve arıza alanlarının ayrılması planlanmalıdır.
Depolama
RAID tek başına yeterli değildir; denetleyici, bağlantı, replikasyon ve kapasite riskleri de izlenmelidir.
Kimlik ve temel servisler
DNS, DHCP, Active Directory ve sertifika hizmetleri tek sunucuya bağımlı bırakılmamalıdır.
Uygulama bağımlılıkları
Veritabanı, lisans, API ve üçüncü taraf servis bağımlılıkları mimariye dahil edilmelidir.
Kurtarılamayan yedek, yedek değildir
Yedeklerin tamamlandı olarak görünmesi tek başına güvence sağlamaz. Kritik sistemler için geri yükleme testleri, uygulama tutarlılığı, saklama süresi ve kurum dışı veya değiştirilemez kopyalar düzenli olarak doğrulanmalıdır.
- 3-2-1 yaklaşımı ve çevrim dışı veya immutable kopya
- Kritik sanal makineler için periyodik geri dönüş testi
- Yetki ayrılığı ve yedekleme hesabının korunması
- Felaket kurtarma sırasının iş önceliğine göre dokümante edilmesi
İzleme yalnızca cihazın açık olduğunu söylememeli
CPU, bellek ve disk kullanımına ek olarak servis yanıt süresi, sertifika süresi, yedekleme sonucu, replikasyon gecikmesi, donanım sağlığı ve kullanıcı deneyimi takip edilmelidir. Alarm eşikleri anlamlı olmalı; çok sayıda önemsiz alarm kritik uyarıların gözden kaçmasına neden olmamalıdır.
Değişiklik yönetimi, yama planı, kapasite eğilimi ve olay sonrası kök neden analizi de yüksek erişilebilirliğin operasyonel tarafıdır.
Mimari kontrollü arıza senaryolarıyla test edilmeli
Bir bağlantı, host veya depolama yolu devre dışı kaldığında beklenen geçişin gerçekten gerçekleştiği görülmelidir. Testler üretim riskine göre planlanmalı, geri dönüş adımları önceden yazılmalı ve sonuçlar kayıt altına alınmalıdır.
En iyi mimari bile dokümantasyon, sorumluluk ve düzenli tatbikat olmadan sürdürülebilir değildir. Amaç yalnızca sistemi ayağa kaldırmak değil, kesinti anında kimin hangi sırayla ne yapacağını netleştirmektir.
Yüksek erişilebilirlik değerlendirmesinde sorulacak sorular
- Kritik servislerin RPO ve RTO hedefleri yazılı mı?
- Güç, ağ, sunucu, depolama ve temel servislerde tek hata noktası var mı?
- Yedeklerden düzenli ve kayıtlı geri dönüş testi yapılıyor mu?
- Alarm, kapasite ve sertifika süreleri merkezi olarak izleniyor mu?
- Felaket kurtarma sırası ve sorumlular güncel mi?