Not
Bu sayfaya erişim yetkilendirme gerektiriyor. Oturum açmayı veya dizinleri değiştirmeyi deneyebilirsiniz.
Bu sayfaya erişim yetkilendirme gerektiriyor. Dizinleri değiştirmeyi deneyebilirsiniz.
Olay, sistemin normal çalışmasını kesintiye uğratan, düşüren veya kesintiye uğratma tehdidinde bulunan planlanmamış bir olaydır. Olaylar genellikle müşterileri veya bir işletmeyi olumsuz etkiler. Geçici veya yerelleştirilmiş kesintilerden yaygın olaylara veya olağanüstü durumlara kadar bir spektrumda bulunurlar. Güvenlik olaylarına örnek olarak veri ihlalleri, mevzuat ihlalleri, kötü amaçlı yazılım veya kimlik güvenliği ihlalleri verilebilir. Nedenler arasında donanım veya altyapı hataları, kaynak sınırları, başarısız dağıtımlar veya yanlış yapılandırmalar gibi insan hataları ya da güvenlik saldırıları gibi dış faktörler yer alır.
Olay yönetimi (IcM), kesintiler sırasında hizmeti geri yüklemek için sistematik bir yaklaşım sağlar. Sürekli iyileştirme için net iletişimi sürdürür ve içgörüleri belgelendirirken algılama, araştırma, azaltma ve çözüm süreçlerini koordine eder. Olay yanıtı, olay türünden bağımsız olarak aynı playbook'u izler.
IcM planınızı oluştururken yalnızca panolara ve çalıştırma kitapçıklarına odaklanmayın. Mimar olarak, insanların, süreçlerin ve araçların sistemleri verimli ve kaossuz bir şekilde geri yüklemek için baskı altında birlikte çalıştığı tasarım operasyonları. IcM stratejiniz, küçük olaylar için hızlı azaltmadan büyük olaylar için eşgüdümlü ekipler arası çalışmalara kadar önem derecesine göre ölçeklendirilmelidir. Yanıt, nedene bağlı olarak da değişebilir.
Bu makalede hazırlık, etkin olay yanıtı, olay sonrası gözden geçirme ve sürekli iyileştirme gibi IcM aşamaları ele alınmaktadır. Bu kılavuz, tasarım uygulamalarını göstermek için bir örnek de içerir. Başlamadan önce, önemli stratejileri gözden geçirin ve işletmeniz için anlamlı olanları seçin. Daha fazla bilgi için bkz. IcM işlemi tasarlamaya yönelik OE:08 Mimari stratejileri.
Bu makale, özel kurtarma çalışmaları gerektiren olağanüstü durumları kapsamaz. Bu tür senaryoları işleme hakkında daha fazla bilgi için bkz. Çok bölgeli dağıtımlar için olağanüstü durum kurtarma planı geliştirme.
Terminoloji
Olay yönetimi planınızı geliştirmeye başlamadan önce bu önemli terimleri tanıyın.
| Süre | Definition |
|---|---|
| Patlama yarıçapı | Bir olay gerçekleştiğinde, kapsama stratejilerinin sınırlandırmayı amaçladığı etkinin veya etkilenen alanın kapsamı. |
| Cam kıran hesaplar | Kritik olaylar sırasında kullanılan ve açık kullanım yönergeleriyle kesinlikle denetlenen yükseltilmiş ayrıcalıklara sahip acil durum kimlik bilgileri. |
| Köprü ekibi | Mühendislik köprüsü olarak da adlandırılan bir olayı araştırmak için bir araya gelen triyaj ekibi. İlgili teknik uzmanlardan ve karar alıcılardan oluşur. |
| Kapsama | Sorunun iş yükünün diğer bölümlerine yayılmasını önlemek için etkilenen bileşenleri yalıtan olay düzeltmesinin ilk adımı. |
| Olay yönetimi (IcM) | İletişimi koordine ederken ve öğrenilen dersleri yakalarken olayları algılama, önceliklendirme, azaltma ve çözmenin yapılandırılmış süreci. |
| Bilinen son iyi yapılandırma | Olay başlamadan önce iş yükünün son sağlıklı durumu, geri alma işlemleri için başvuru noktası olarak kullanılır. |
| Hafifletme | Geri alma, geri dönüş, devre dışı bırakma veya acil durum düzeltmeleri gibi bir olayın etkisini azaltmaya veya kaldırmaya yönelik eylemler. |
| Retrospektif | Suçsuz olay sonrası gözden geçirme süreci, suç atamak yerine öğrenilen dersleri ve eyleme dönüştürülebilir iyileştirmeleri belirlemeye odaklanmıştır. |
| Kök neden analizi (RCA) | Sorundan sorumlu temel faktörleri belirlemek ve yinelenmeyi önlemek için bir olayı araştırmak için sistematik bir süreç. |
| Önem derecesi | İş etkisine ve etkilenen kullanıcılara göre uygun yanıt düzeyini belirleyen kritik, yüksek, orta ve düşük gibi bir sınıflandırma sistemi. |
| Önceliklendirme | Önem derecesini, etkisini ve uygun yanıt eylemlerini belirlemek için olayları analiz etme ve önceliklendirme işlemi. |
Hazırlık
Bir olay gerçekleşmeden önce gözlemlenebilirlik tasarlayarak, net roller ve süreçler tanımlayarak ve ekiplerinizin ihtiyaç duyduğu araçları ve kaynakları hazırlayarak etkili yanıt için temeli oluşturun. Olay yanıtı planını belgeleyin ve düzenli olarak güncelleştirin ve gözden geçirin.
Ekiplerin darboğazları veya tek hata noktalarını hızla tanımlamalarına yardımcı olmak için tüm bileşenleri ve etkileşimlerini gösteren doğru ve güncel mimari diyagramları muhafaza edin. Bu yaklaşım, yüksek basınç durumlarında daha hızlı sorun giderme sağlar.
İzleme yığınınızın iş yükünün tamamı için sağlaması gereken olay verilerini tanımlayın:
Altyapı ve uygulamalar da dahil olmak üzere uçtan uca telemetri toplayın.
Önceliklendirmeyi ve araştırmayı desteklemek için tüm bileşenler için yapılandırılmış günlüğe kaydetmeyi etkinleştirin ve analiz için günlükleri veri havuzlarına gönderin. Gerekirse logları merkezi olarak yönetilen alanlara da iletin. Ekip üyelerinin olaylar sırasında zaman sınırlı, en az ayrıcalıklı erişime sahip olduğundan emin olun.
İş yükü sağlığı modeline dayalı panolar oluşturun. Panolar, ekibinizin izlediği ölçümleri ve sinyalleri gösterir.
Yalnızca eşikler aşıldığında ve olası bir olay algılandığında bildirimleri tetikleyen eyleme dönüştürülebilir uyarılar yapılandırın. Çok fazla uyarı (gürültü) veya çok az sayıda uyarıdan kaçınmak için uyarıları ayarlayın. Örneğin, canlı site olayları için uyarılar, performans hedefleriyle uyumlu eyleme dönüştürülebilir sorunları algılamak için merkezi işlem birimi (CPU), bellek, yanıt süreleri ve veritabanı performansı gibi kritik ölçümleri izlemelidir.
Uyarıları otomatik olarak doğru ekiplere yönlendirin. Örneğin katman 1 desteği tüm uyarıları alırken, güvenlik mühendisleri yalnızca güvenlikle ilgili uyarılar alır.
Daha fazla bilgi için bkz . Gözlemlenebilirlik çerçevesi tasarlama ve oluşturma önerileri.
Güvenlik olayları sırasında ve sonrasında sorumluluk, karar alma ve etkili izleme sağlamak için temel rolleri tanımlayın. Uygun onay işlemleri oluşturun ve bunları net bir karar ağacında birleştirin. Farklı önem derecesi türleri, risk azaltma kararları, yükseltme yolları ve diğer alanlar için yetkilendirme düzeyleri tanımlayın.
Başlangıç noktası olarak aşağıdaki örnekleri kullanın ve bunları ekip yapınıza uyacak şekilde uyarlar.
Rol Sorumluluklar Olay Yanıt Yöneticisi Tespitten çözüm ve kaynağın kök neden analizi aşamasına kadar olayın tüm süreçlerinden sorumludur. Süreçlerin takip edilmesini, kararlar verilmesini ve doğru kişilerin bilgilendirilmesini sağlar. Geçmişe Dönük Bakış Lideri Olay sonrası incelemelere liderlik eder, öğrenilen dersleri yakalar, eyleme dönüştürülebilir raporlar üretir ve bulguların uygulanmasını sağlar. Arama Mühendisi Olayları etkin bir şekilde azaltır ve çözer. Farklı olay türleri için sorumlulukları izler ve olayın zamanında çözümlenmesi için gerektiğinde özel ekiplerle işbirliği yapılır. Araştırma için yordamları tanımlayın:
İş yükünüz için geçerli olan olay türleri (operasyonel, güvenlik, performans ve dağıtım olayları gibi) ve kritik, yüksek, orta ve düşük gibi önem düzeyleri için kategoriler tanımlayın.
Olayın önem derecesini, etkisini ve aciliyetini değerlendirmeyi belgeleme. Kullanıcı etkisini, etkilenen sistemleri ve iş açısından kritik işlevleri göz önünde bulundurun. Önem düzeyine bağlı olarak ekip, olağanüstü durum düzeyi eşiklerine uyan durumlar için olağanüstü durum kurtarma planını etkinleştirir. Veya daha az ciddi olaylar için standart yanıt planını izlerler.
Bir kaynağı kapatma veya trafiği yeniden yönlendirme gibi etkilenen bileşeni iş yükü akış yollarından yalıtan veya kaldıran stratejiler tanımlayın. Hangi rollerin kapsama eylemi gerçekleştirme yetkisine sahip olduğunu belirleyin.
Belirlenen olaylar için kontrol altına almayı otomatik olarak başlatmak üzere izleme sistemlerini ayarlayın. Bu yaklaşım, insanların kritik kararlar için döngüde kalmasını sağlar. Sistem yöneticileri, mühendisler ve üst düzey geliştiriciler, yüksek işlevselliği korurken patlama yarıçapını sınırlamak için işbirliği yapmalıdır. Bir bileşenin önceliklendirme için kullanılabilir durumda kalması gerekiyorsa, bileşenin erişimini iş yükünün geri kalanından kesinlikle yalıtın.
Yalıtım, geri alma, yapılandırma değişiklikleri ve geçici çözümler gibi olay önem derecesine göre risk azaltma stratejilerini seçmek için yönergeler oluşturun.
Türüne ve önem derecesine göre olayı hangi ekiplerin veya kişilerin işlediğini belirtin. İlk yanıtlayanların sorunu çözemediği durumlara yönelik yükseltme yollarını ekleyin.
Araştırmayı ve karar almayı desteklemek için günlükler, ölçümler, kullanıcı raporları ve uyarılar gibi önceliklendirme sırasında hangi verilerin toplayacağını özetleyin. Ayrıca bu verilere kimlerin erişmesi gerektiğini de ekleyin.
Önemli
Net kurallar oluşturarak acil durum kimlik bilgilerinizi veya kırılan hesaplarınızı koruma. Bunları kimlerin, ne zaman ve tam olarak nasıl kullanabileceğini belirleyin. Bu kuralları acil durum tatbikatlarıyla eşleştirin ve her tatbikatı takip edin. Ekibin tatbikatları ne sıklıkta uygulaması gerektiğini tanımlayın. Bir olay sırasında, o anda bunu anlamaya zaman yoktur. Tatbikatlar yeterli uygulama ve geliştirme fırsatları sağlar.
Çözümü desteklemek için altyapınızı ayarlayın:
İşlem hatlarını parametreleştirin. Hızlı geri alma için belirli sürümleri kabul etmek veya dağıtımı düzeltmek için dağıtım ve kurtarma işlem hatlarını etkinleştirin.
Veri düzlemi tutarlılığı sağlayın. Kurtarma işlemleri sırasında anahtarları, gizli dizileri, yapılandırmaları ve durum verilerini hizalı tutun.
Altyapı ölçeklendirmeyi otomatikleştirme. Trafik vardiyalarını veya artan yükü işlemek için kaynakları otomatik olarak ayarlayın.
Kendi kendini onarma uygulamasını gerçekleştir. Yaygın olay desenlerine yönelik yanıtları güvenli bir şekilde otomatikleştirin, ancak el ile geçersiz kılma için uygun izleme ve seçenekleri ekleyin.
İletişim süreçlerini tanımlama. Katman 1 desteğinin doğru ekiplere hızla ulaşabilmesi için net iletişim ve yükseltme planlarını belgeleyin. İç ve dış paydaşlar için uygun iletişim kanallarını belirtin ve arama zamanlamalarını ve iletişim ayrıntılarını ekleyin.
IcM aracının kullanımını ve basit bir iş akışında yakalaması gereken standart çalışma yordamlarını tanımlayın. İş akışı dört adım içerir: oluşturma, onaylama, azaltma ve çözme. Araç, ekiplere görünürlük sağlar, ilerleme durumunu izler, sorumluluk sahibi olur ve her zaman tutarlı olay işleme sağlar. Canlı site yönetimini ve nöbet rotasyonlarını desteklemek için tüm etkinlikleri merkezileştirir.
Bir olayı resmi olarak kapalı olarak işaretleyen ölçütleri tanımlayın:
Açık çözünürlük faktörleri ekleyin. Çözüm genellikle sistemin ve hizmetlerin hizmet düzeyi sözleşmeleri (SLA' lar) içinde çalıştığı, performansın ve güvenilirliğin kabul edilebilir düzeylere geri döndüğü ve anında risk azaltma eylemlerinin başarıyla tamamlandığı anlamına gelir.
Tam çözünürlüğü onaylamak için doğrulama denetimleri ekleyin. Olayın artık sistemi etkilemediğini ve etkilenen kullanıcıların kesinti yaşamadığını denetlemek için izleme araçlarını kullanın.
Bir olayı kapatırken iletişim gereksinimlerini dahil edin. İç ekipler, destek personeli ve etkilenen kullanıcılar da dahil olmak üzere ilgili paydaşları bilgilendirin ve gerçekleştirilen eylemlerin özetini, devam eden çalışmalarla birlikte sağlayın.
Bir olayı kapatırken ayrıntılı belgeler ekleyin. IcM sistemindeki tüm ayrıntıları kaydedin. Tetikleyiciyi, sınırlama adımlarını, üçleme kararlarını ve nihai çözümü ekleyin. Bu belgeleri, öğrenilen dersleri yakalamak için RCA'nın iletimi ve geçmişe dönük değerlendirme olarak değerlendirin.
Önemli
İşlemlerinizi, yalnızca Olay Yanıt Yöneticisi gibi belirlenen yetkilinin bir olayı kapatabilmesi için tasarlayın. Erken kapatmayı engellemek için katı denetim listelerini zorunlu kılma. Adımların atlanması gizli sorunları çözmeden bırakabilir ve bu da çözülmüş bir olayı tekrarlayan bir felakete dönüştürebilir.
Algılama, araştırma ve yanıtlama
2. aşama, olayları hızlı ve etkili bir şekilde algılamaya ve yanıtlamaya odaklanır. Bu aşama sorunları erken tanımlar, etkilerini değerlendirir ve kesintiyi içerirken doğru risk azaltma stratejilerini uygular. Bu aşama ayrıca önceliklendirme, çözüm ve iletişimin tüm ekipler arasında eşgüdümlü, tutarlı ve sorumlu olmasını sağlar.
Önemli
Net ve tutarlı iletişim, yüksek stres durumlarında denetimi ve netliği korur. Tam olarak kimlerin konuştuğunu, nelerin paylaşılacağını ve ne sıklıkta paylaşılacağını tanımlayın. Güncelleme temposunu, kanalları ve mesaj biçimlerini standartlaştırarak kriz sırasında kimsenin bilgi aramak zorunda kalmaması için. Mühendislerden yöneticilere kadar tüm paydaşların güncelleştirmeleri ne zaman beklemesi gerektiğini ve ne zaman yükseltme gerektiğini bildiğinden emin olun.
Uyarılar veya kullanıcı raporları bir sorun gösterdiğinde hemen harekete geçin. Anomalileri sistem değişiklikleriyle ilişkilendirmek için gözlemlenebilirlik ve performans araçlarını kullanın. Olay sorumlusu, ilgili üyelerle bir olay yönetimi (köprü) ekibi oluşturur ve iletişim modu, ilerlemenin takibi ve olay varlıklarına erişim konusunda anlaşır.
Etkiyi ve önem derecesini değerlendirmek için mühendislik ekibini harekete geçirin. Önceden tanımlanmış önem derecesi sınıflandırmalarınızı kullanarak olayın etkisini değerlendirin. Etkilenen kullanıcı sayısı, iş işlevlerinin kesintiye uğraması, güvenlik ve uyumluluk etkileri ve müşteri güveni ve itibarı üzerindeki olası etki gibi olay yanıtı planında belirtilen ölçütleri gerekçelendirmek için verileri kullanın. Bu değerlendirme uygun yanıt düzeyini belirler ve sonraki risk azaltma adımlarına yol gösterir.
Araştırma aşaması, doğru mühendislik ekipleri devreye girip bir RCA başlattığında başlar. Bu süreç, nedeni saptamak ve etkiyi içermek için derin teknik analizler içerir. Mühendisler gözlemlenebilirlik verilerini, telemetri panolarını, sistem günlüklerini kullanır ve anomalileri izlemek ve hata noktalarını belirlemek için geçmişleri değiştirir. Sorunu hızla yalıtma, gerçek zamanlı verileri kullanarak hipotezleri doğrulama ve yeni risk oluşturmadan hizmet kararlılığını geri yükleyen hassas bir risk azaltma planı geliştirmeye odaklanır.
Takas: RCA önemli zaman alabilir. Performans sorunlarını ilişkilendirmek için verileri toplamanız ve depolamanız gerekir. Gerekli süre ve altyapı, operasyon ekiplerine ek iş ve iş yüküne maliyet ekleyebilir.
Risk: Uygun güvenlik korumaları olmadan bir RCA gerçekleştirirseniz, günlüklere ve verilere erişim sağladığınızda hassas bilgileri kullanıma sunabilirsiniz.
Etkilenen bileşenleri yalıtmak ve patlama yarıçapını sınırlamak için kapsama stratejilerini izleyin. Aşağıdaki eylemleri gerçekleştirebilirsiniz:
Önceliklendirme için ayrı yollar kullanarak etkilenen bileşenlere erişimi engelleyin. Örneğin, bir kaynağı kapatabilir, trafiği kısıtlayabilir veya başarısız olan bir mikro hizmeti devre dışı bırakabilirsiniz.
Olayın etkisini belirli kullanıcılar, bölgeler veya bileşenlerle sınırlayın.
Mümkünse iş yükü işlevselliğini bozulmuş durumda koruyun.
Uygun bir risk azaltma stratejisi seçin. İş yükünün geçerli durumuna, kullanılabilir kaynaklara ve anında kısıtlamalara göre azaltma yaklaşımlarını seçin.
Seçiminiz altyapı türü, kullanılabilir atlama mekanizmaları, düzeltmenin karmaşıklığı, veri duyarlılığı ve uyumluluk gereksinimleri, sistem bağımlılıkları ve kurtarma süresi hedefleri (GPO'lar) gibi faktörlere bağlıdır.
Geri alma: Güncelleştirilmiş sistemleri bilinen son iyi yapılandırma durumuna geri döndür. İş yükü ekibi "bilinen son iyi durum" ifadesinin ne anlama geldiğini tanımlamalıdır. Genellikle, dağıtım başlamadan önce iş yükünün son sağlıklı durumunu ifade eder ve bu durum hemen önceki uygulama sürümü olmayabilir. Özellikle şema veya veri değişiklikleri söz konusu olduğunda geri alma karmaşık olabilir. Riski azaltmak için kayıtları değiştirmek yerine şema güncelleştirmelerini ekleyin. Eski ve yeni veriler, kullanım dışı bırakılan kayıtları güvenle kaldırana kadar bir arada bulunabilir. Geri alma işlemleri, birden çok ekipte dikkatli planlama ve koordinasyon gerektirebilir.
Geri dönüş: Güncelleştirilmiş sistemleri üretim trafiği yönlendirmesinden kaldırın ve tüm trafiği kararlı yığına yönlendirin. Bu düşük riskli strateji, daha fazla kesintiye neden olmadan dağıtım sorunlarını giderir. Kanarya dağıtımlarında geri dönüş, altyapı ve uygulama tasarımına bağlı olarak karmaşık olabilir. Trafiği geri döndürmeden önce kararlı yığında yeterli kapasite olduğundan emin olun. Yedekleme, devam eden işlemin sürdürülmesine olanak tanır ve sorunlu dağıtımı yalıtır.
Sorunlu işlevi atla: Sorunlu işlevselliği atlamak için özellik bayraklarını veya çalışma zamanı yapılandırma özelliklerini kullanın. Bu yaklaşım, dağıtımın devam etmesine olanak tanır ve sorunu yalıtır. Dengeleri değerlendirin ve paydaşlara iletin. Düzeyi düşürülmüş duruma ne kadar dayanabileceğinizi ve sorunu tam olarak çözmek için tahmini süreyi ekleyin. Plan için paydaş onayı alın.
Acil durum dağıtımı (sık erişimli düzeltme): Sorunu hızla çözmek için dağıtım sırasında sık erişimli düzeltme dağıtın. Ortamlar aracılığıyla kod terfi ve kalite kontrol aşamaları gibi güvenli dağıtım uygulamalarını izleyin, ancak süreçleri hızlandırın. Dağıtımı hızlandırmak için pişirme sürelerini ve testlerini kısaltın veya değiştirin. Güvenilirliği sağlamak için otomatik testi kullanın. Hızlı düzeltmeler için, riski en aza indirmek ve sorunu hızla çözmek amacıyla koordinasyon ve dikkatli planlama gereklidir.
Önemli
Risk azaltma kararlarının önceden tanımlanmış yetkilendirme kurallarına uygun olduğundan emin olun. Olay Yöneticisi tüm risk azaltma eylemlerini işlemelidir. Yetkili personelin, büyük etkili adımları onaylaması ve her eylemi belgelemesi gerekir. Sistemi geri yüklerken eylemleri kontrol altında, güvenli ve sorumlu tutun.
Kullanıcıları etkileyen bir sorun, ekibinizin bir değişikliği yayına aldığı zamanla hemen hemen aynı anda başlarsa, sorunun muhtemel nedeninin bu değişiklik olduğunu varsayın ve önce uzun süre araştırma yapmak yerine değişikliği derhal geri alın. Risk azaltma stratejisini seçmeniz için geçen süre, ortalama kurtarma sürenizde (MTTR) hesaba eklenir. Risk azaltma eylemini hemen yaparak bu süreyi iyileştirin.
Çözünürlüğü uygulayın. Bu adım, yinelenmeyi engellerken sistemin tam işletim durumuna geri yüklenmesine odaklanır. Mühendislik ekipleri, takıma özgü betiklenmiş prosedürleri izleyen doğrulanmış düzeltmeleri uygular. Araştırmayı yönlendirmek için günlük analizi ve izleme araçlarını kullanırlar. Geri alma adımları, etkisiz değişiklikleri geri alarak her eylemin sistemi kesintisiz bir şekilde tam kurtarma sürecine doğru ileriye taşımasını sağlar.
Bir RCA raporu oluşturun. Bir olayı çözümledikten sonra, SLA zaman çerçevesi içinde RCA raporunu oluşturun. Olay sahibi veya sahip müsait değilse yakından ilgili bir ekip üyesi, doğruluğu sağlamak için raporu oluşturmalıdır. Belirli bilgilerin dahil edilmesi ve paylaşılması konusunda net yönergeler içeren tanımlı bir RCA şablonunu izleyin ya da paydaşların gözden geçirmesiyle yeni bir şablon oluşturup onaylayın.
Olay sonrası etkinlikler
Her olaydan sonra geçmişe dönük değerlendirmeler yapın. Kritik öğrenme fırsatları sağlar, yanıt, dağıtım veya altyapıdaki zayıflıkları vurgular ve iyileştirmeleri bilgilendirir. Eylem öğelerini belgeleyin ve yinelemeli bir şekilde uygulanmak üzere bir iş listesinde izleyin.
Amaç, suçu atamak değil, eyleme dönüştürülebilir iyileştirmeleri belirlemektir. Bu süreci tarafsız bir kolaylaştırıcı yönetmelidir. Yanıt üzerinde çalışan kişilerin olaya dahil olan her ekibi temsil etmesi gerekir. Başarılar ve iyileştirme alanları hakkında gözlemlerle hazırlıklı olmaları gerekir:
Yanıt planı geliştirmeleri: Daha net ve daha etkili eylemler sağlamak için işlemleri veya yordamları güncelleştirin.
Gözlemlenebilirlik geliştirmeleri: Eşikleri ayarlayın, izleme ekleyin veya benzer olayları daha önce algılamak için uyarılar uygulayın.
İş yükü düzeltme: Kalıcı düzeltmeler için ortaya çıkan güvenlik açıklarını giderin.
Örnek: Dağıtım hatası yanıtı
Aşağıdaki örnekte dağıtımla ilgili bir olay açıklanmaktadır. Dikkatli planlama ve testlerde bile dağıtımlar bazen sistem performansını veya kullanıcı deneyimini etkileyen sorunlara neden olabilir.
Bu örnekte, iş yükü yönetim ekibi, birden çok bileşenden oluşan bir arama geliştirme özelliği sunmaktadır.
- İyileştirilmiş filtreleme işlevselliğine sahip yeni bir arama API'si uç noktası
- Güncelleştirilmiş veritabanı şeması
- Yeniden tasarlanmış kullanıcı arabirimi (UI) arama pencere öğesi
- Yeni önbelleğe alma mantığı
Ekip, olayı algılamak, azaltmak ve çözmek için aşağıdaki adımları uygular:
Algılama: Ekip, kanarya dağıtım gruplarından birinde hata oranlarında ani artış olduğunda bir sorun fark eder. Ekip, etkilenen grubu saptamak için kullanıcıları dağıtım aşamalarına bağlayan uygulama performansı izleme (APM), günlüğe kaydetme ve telemetri gibi gözlemlenebilirlik araçlarını hemen kullanır.
Ekip, dağıtım sürecinde güçlü gözlemlenebilirlik oluşturarak bu senaryoya hazırlandı. Her dağıtım aşamasında duman testleri ve kalite denetimleri çalıştırdılar ve uygulamalarını günlüğe kaydetme, izleme ve performans ölçümleriyle izlediler. Telemetri, kullanıcıları belirli dağıtım gruplarına bağlar, böylece hangi sürümün hangi kullanıcılardan etkilendiğini hızla belirleyebilirler. Ayrıca, tam desteğin sağlandığı çalışma saatlerinde dağıtımlar zamanlandı ve destek personelinin acil durum yanıt planına göre sorunları nasıl yükselteceğini bildiğinden emin oldular. Bu hazırlık, hata oranlarındaki ani artışı hızla algılamalarına ve gecikme olmadan yanıt vermelerine olanak tanır.
Azaltma: Ekip, bir azaltma stratejisine hızlı bir şekilde karar verir. Bilinen son iyi sürüme geri dönüp dönmeyeceğini, kararlı ortama geri dönüp dönmeyeceğini, özellik bayrağı kullanarak sorunlu işlevi atlayıp atlamayacağını veya sık erişimli bir düzeltme dağıtıp dağıtmayacağını düşünürler. Karar ağacı ve onay işlemi zaten tanımlanmıştır.
Takım mevcut tüm stratejileri gözden geçirmesinin ardından, geri alma veya geri dönüş seçeneklerini daraltır ve sonunda geri dönüşe karar verir. Trafiği kararlı yığına yönlendirmenin, karmaşık veri ve şema işlemleri gerektirebilecek tam geri alma işlemine göre daha hızlı ve daha düşük riskli olduğunu belirler. Ekip, kararlı yığının tam üretim yükünü işlemek için yeterli kapasiteye sahip olduğunu onaylar ve güncelleştirilmiş sistemleri üretim trafiği yönlendirmesinden yalıtabilir.
Ekip API, veritabanı şeması, UI bileşenleri ve önbelleğe alma mantığı dahil olmak üzere birden çok bağımlı değişikliği birlikte paketlemişti. Bu nedenle, hatalara neden olan belirli bileşeni tanımlamak, her değişikliği ayrı olarak dağıtıp dağıtmadığından daha zor ve zaman alıcıdır.
Çözüm: Takım yedekleme prosedürünü uygular. Sorunlu dağıtımı yalıtmak için trafiği güncelleştirilmiş ortamdan uzaklaştırır. Ekip, kullanıcıların çoğunu etkilemeden temel sorunu giderebilir.
Yedek uygulama operasyonel boşlukları gün yüzüne çıkarır. İki önemli ekip üyesinin güncel olmayan iletişim bilgilerini bulurlar ve yükseltme zincirindeki bir mühendis aylar önce şirketten ayrılmıştır. Ekip sorumlu bireyi bulmak için zaman kaybeder. Güncellenmiş dağıtımı yük dengeleyiciden kaldırmaya çalıştıklarında, belgeler son Azure güncellemesinde değiştirilen eskimiş bir yük dengeleyici yapılandırmasına atıfta bulunur. Zaman baskısı altında doğru prosedürü bulmak zorundalar.
İletişim, risk azaltma planının önemli bir parçasıdır. Ekip, sorunu yalıtılmış ortamda çözmek için beklenen zaman çizelgesi de dahil olmak üzere kararı ve etkilerini paydaşlara bildirir. Ekip, dağıtım olayları sırasında durum güncelleştirmeleri sağlamak için tempoyu zaten standartlaştırdığından, proje katılımcıları ilerleme durumu raporlarını ve güncelleştirmelerini ne zaman beklemeleri gerekeceğinden haberdar olur. Ekip ayrıca kullanıcılarla paylaşılmak üzere ayrıntı türünü ve düzeyini tanımladı ve dağıtım olayı iletişimleri için diğer gereksinimlerle uyumluluğu sağladı. Bu yapılandırılmış yaklaşım karışıklığı en aza indirir ve yanıt sürecinde güvenin korunmasına yardımcı olur.
Retrospektif: Ekip dağıtım olayını azalttıktan sonra, öğrenilen dersleri yakalamak ve gelecekteki süreçleri geliştirmek için geçmişe dönük bir değerlendirme yapar. Oturum, geliştiriciler ve operatörlerden destek ve paydaş temsilcilerine kadar dağıtıma katılan herkesi içerir. Ekip, algılamadan azaltmaya kadar olayların sırasını inceler ve neyin iyi gittiğini ve boşlukların nerede olduğunu anlar.
Önemli bir nokta, arama API'si değişikliklerini, veritabanı şeması güncelleştirmelerini, kullanıcı arabirimini yeniden tasarlamayı ve önbelleğe alma katmanını değiştirmenin hem sorun giderme hem de kurtarma çabalarını karmaşık hale getirmesidir.
Olay sonrası iyileştirmeler: Geçmişe dönük olarak, ekip gelecekteki dağıtımları daha güvenli hale getirmek ve azaltmaları daha güvenilir hale getirmek için çeşitli operasyonel iyileştirmeler uygular:
Daha küçük ve sık yapılan değişiklikler: Ekip, ardışık sürümler arasındaki deltayı azaltmak ve azaltmayı daha basit ve daha düşük risk haline getirmek için daha küçük, artımlı dağıtımlara doğru kayıyor.
Özellikle arama geliştirmesi için ekip, her bileşeni bağımsız olarak dağıtmaya karar verir. Şimdi önce geriye dönük uyumlu değişikliklerle veritabanı şeması değişikliklerini, ardından API uç noktası güncelleştirmelerini ve ardından diğer değişiklikleri dağıtıyorlar. Bu yaklaşım, ekibin bir sonraki katmanı eklemeden önce her katmanı bağımsız olarak doğrulamasını ve sorunları belirli bir bileşene daha kolay yalıtmalarını sağlar.
Düzenli test ve tatbikatlar: Ekip, tam dağıtım hatası azaltma stratejisi için sık sık test yapma uygulaması oluşturur. Hata senaryolarını simüle etmek ve azaltma işlemlerini doğrulamak için kaos mühendisliği ve hata ekleme testleri getirir. Bu düzenli tatbikatlar, olay sırasında karşılaşılan sorunları, eski kişi bilgileri ve eskimiş iş akış prosedürleri gibi durumlar dahil, yakalardı.
Azure hizmetlerinin kolaylaştırılması
Microsoft, Azure ile ilgili olay hazırlığı eğitimi sağlar. Daha fazla bilgi için bkz . Azure olay hazırlığına giriş ve Olay hazırlığı.
Azure İzleyici , bulut ve şirket içi ortamlardan izleme verilerini toplamaya, analiz etmeye ve yanıtlamaya yönelik bir çözümdür. Otomatik bildirimler ve otomatik ölçeklendirme ve diğer kendi kendini düzeltme mekanizmaları gibi diğer eylemler için yapılandırabileceğiniz bir uyarı platformu içerir.
Makine öğrenmesini tümleştirmek için Azure İzleyici'yi kullanın. Olay önceliklendirme ve proaktif önlemleri otomatikleştirin ve iyileştirin. Daha fazla bilgi için bkz. Azure İzleyici'de yapay zeka işlemleri ve makine öğrenmesi.
Log Analytics , Azure İzleyici'deki bir analiz aracıdır. Toplanan günlüklerde sorgu çalıştırmak ve iş yükünüz hakkında içgörüler elde etmek için Log Analytics'i kullanabilirsiniz.
Application Insights, APM özellikleri sağlayan bir Azure İzleyici uzantısıdır.
Microsoft Sentinel bir güvenlik bilgileri ve olay yönetimi (SIEM) ile güvenlik düzenleme, otomasyon ve yanıt (SOAR) çözümüdür. Uyarı algılama, tehdit görünürlüğü, proaktif tehdit avcılığı ve tehdit yanıtı için tek bir çözüm.
Azure Pipelines , uygulamalarınızın sürekli tümleştirmesini ve sürekli teslimini (CI/CD) desteklemek için derleme ve yayın hizmetleri sağlar.
Azure Test Planları , tarayıcı tabanlı bir test yönetimi çözümüdür. Bu çözüm, planlı el ile test, kullanıcı kabul testi ve keşif testi için gereken özellikleri sağlar. Azure Test Planları, paydaşlardan geri bildirim toplamanız için de bir yol sağlar.
Azure Logic Apps , uygulamaları, verileri, hizmetleri ve sistemleri tümleştiren otomatik iş akışlarını çalıştırmaya yönelik bulut tabanlı bir platformdur. Bir güncelleştirme aldığında uygulamanızın yeni bir sürümünü oluşturmak için Logic Apps'i kullanabilirsiniz. Azure, sürümlerin geçmişini tutar ve önceki sürümleri geri döndürebilir veya yükseltebilir.
Birçok Azure veritabanı hizmeti, geri almanız gerektiğinde size yardımcı olabilecek belirli bir noktaya geri yükleme (PITR) işlevi sağlar:
Azure Chaos Studio , bulut uygulamanızın ve hizmet dayanıklılığınızı ölçmenize, anlamanıza ve geliştirmenize yardımcı olmak için kaos mühendisliğini kullanan yönetilen bir hizmettir.