Pastaba.
Prieigai prie šio puslapio reikalingas įgaliojimas. Galite bandyti prisijungti arba pakeisti katalogus.
Prieigai prie šio puslapio reikalingas įgaliojimas. Galite bandyti pakeisti katalogus.
Taikoma šiai **gerai suprojektuoto patikimumo kontrolinio sąrašo** rekomendacijai: Power Platform
| RE:06 | Testavimo ir gamybinėje aplinkoje taikykite chaoso inžinerijos principus, kad patikrintumėte atsparumą ir prieinamumą. Atlikite testavimą, kad įsitikintumėte, jog jūsų sklandaus degradavimo įgyvendinimo strategijos yra veiksmingos, atlikdami aktyvius gedimų ir imituotos apkrovos testus. |
|---|
Šiame vadove aprašomos rekomendacijos, kaip sukurti patikimumo testavimo strategiją, skirtą jūsų darbo krūvio patikimumui patvirtinti ir optimizuoti. Patikimumo testavimas sutelktas į jūsų darbo krūvio atsparumą ir prieinamumą, ypač į kritinius srautus, kuriuos nustatote kurdami savo sprendimą. Šiame vadove pateikiamos bendros testavimo gairės ir gairės, skirtos gedimų injekcijai ir chaoso inžinerijai.
Apibrėžimai
| Terminas | Apibrėžtis |
|---|---|
| Pasiekiamumas | Laikas, kurį programos darbo krūvis veikia sveikoje būsenoje be reikšmingų prastovų. |
| Chaoso inžinerija | Praktika, kai programos ir paslaugos patiria realaus pasaulio stresą ir gedimus. Chaoso inžinerijos tikslas yra sukurti ir patvirtinti atsparumą nepatikimoms sąlygoms ir trūkstamoms priklausomybėms. |
| Gedimų injekcija | Klaidos įvedimas į sistemą siekiant patikrinti sistemos atsparumą. |
| Atkuriamumas | Atsparumo sinonimas. |
| Atsparumas | Programos darbo krūvio gebėjimas atlaikyti gedimų režimus ir atsigauti po jų. |
Pagrindinės projektavimo strategijos
Testavimas yra būtinas siekiant užtikrinti, kad jūsų darbo krūvis atitiktų patikimumo tikslus ir galėtų sklandžiai susidoroti su gedimais. Gedimų injekcija – tai testavimo tipas, kurio metu sąmoningai į sistemą įvedami gedimai arba apkrova, siekiant imituoti realaus pasaulio scenarijus. Naudodami gedimų injekcijos ir chaoso inžinerijos metodus, galite proaktyviai aptikti ir išspręsti problemas, kol jos nepaveikė jūsų gamybos aplinkos. Šiame skyriuje pateikiamos bendros gairės dėl testavimo, klaidų injekcijos ir chaoso inžinerijos jūsų darbo krūviui.
Bendrosios testavimo gairės
Reguliariai atlikite bandymus, kad patvirtintumėte esamas ribas, tikslus ir prielaidas. Kai jūsų darbo krūvis smarkiai pasikeičia, reguliariai atlikite testavimą. Atlikti daugumą bandymų bandymų ir testavimo aplinkoje. Taip pat naudinga atlikti tam tikrą testų dalį gamybinėje sistemoje.
Automatizuokite testavimą, kad užtikrintumėte nuoseklų testų aprėptį ir pakartojamumą. Automatizuokite įprastas testavimo užduotis ir integruokite jas į savo kūrimo procesus. Rankinis programinės įrangos testavimas yra varginantis ir jautrus klaidoms, tačiau galite atlikti rankinį tiriamąjį testavimą. Tais atvejais, kai reikia kurti automatizuotus testus, naudokite rankinį testavimą, kad nustatytumėte kuriamų testų apimtį.
Atlikite atsparumo ir prieinamumo testavimą ankstyvoje kūrimo ciklo stadijoje, naudodami testavimo metodą „poslinkis į kairę“.
Pritaikykite paprastą dokumentacijos formatą, kad visi galėtų lengvai suprasti kiekvieno įprasto testo procesą ir rezultatus.
Dokumentuotais rezultatais pasidalykite su atitinkamomis komandomis, tokiomis kaip operacijų komandos, technologijų lyderiai, verslo suinteresuotosios šalys ir nelaimių atkūrimo suinteresuotosios šalys. Rezultatai turėtų padėti patikslinti patikimumo tikslus, tokius kaip paslaugų lygio tikslai (SLO), paslaugų lygio susitarimai (SLA), atkūrimo laiko tikslai (RTO) ir atkūrimo taško tikslai (RPO).
Sukurkite reguliarų atsarginių kopijų testavimo intervalą. Atkurkite duomenis izoliuotose sistemose, kad užtikrintumėte atsarginių kopijų galiojimą ir atkūrimo funkcijų veikimą.
Dokumentuokite ir bendrinkite atkūrimo laiko metriką su savo atkūrimo suinteresuotosiomis šalimis, kad užtikrintumėte tinkamus atkūrimo lūkesčius.
Naudokite pramonės standartų diegimo testavimo procedūras, kad užtikrintumėte automatizuotą, nuspėjamą ir efektyvų diegimo procesą.
Patikrinkite savo darbo krūvio gebėjimą atlaikyti trumpalaikius gedimus. Daugiau informacijos žr. Rekomendacijos, kaip elgtis trumpalaikiais gedimais.
Patikrinkite, kaip jūsų darbo krūvis tvarko gedimus priklausomose paslaugose ar kitose priklausomybėse, naudodami gedimų injekciją.
Išbandykite savo nelaimių atkūrimo planą , kad galėtumėte reaguoti į katastrofinius gedimus ir kitus didelius incidentus.
Patikrinkite savo darbo krūvio gebėjimą sklandžiai mažėti ir sumažinti komponentų gedimo sprogimo spindulį naudodami gedimų injekciją.
Pasinaudokite planuotais ir neplanuotais elektros energijos tiekimo sutrikimais
Kai jūsų darbo krūvis neprijungtas dėl planinės priežiūros ar neplanuoto sutrikimo, turite unikalią galimybę atlikti testavimą ir geriau suprasti savo darbo krūvį. Tolesniuose skyriuose pateikiamos rekomendacijos kiekvienam scenarijui.
Suplanuota techninė priežiūra
Kai suplanavote atnaujinimų ar pataisų priežiūros laikotarpius, galite išbandyti komponentus ir srautus, kurie nėra susiję su priežiūros darbais. Atlikite testus be galimos rizikos netikėtai sumažinti darbo krūvį arba visiškai jį atjungti nuo tinklo. Jei techninės priežiūros laikotarpiu turite pakankamai laiko, galite patikrinti komponentus ir srautus, susijusius su technine priežiūra, kai techninės priežiūros darbai bus baigti.
Neplanuotas elektros tiekimo nutraukimas
Kiekvieną sutrikimo incidentą naudokite kaip galimybę daugiau sužinoti apie savo darbo krūvį ir pagerinti jo atsparumą, atlikdami šiuos veiksmus, išdėstytus pagal prioritetą:
Atkurkite darbo krūvį savo vartotojams. Gali tekti atlikti problemos sprendimo būdą, išspręsti problemą arba pradėti atkūrimo procesus.
Nustatykite pagrindinę sutrikimo priežastį ir ją pašalinkite. Jei tyrimo metu galite pašalinti pagrindinę priežastį, dokumentuokite ją ir priemones, kurių ėmėtės jai pašalinti. Jei problemai išspręsti reikės skirti kitą priežiūros laikotarpį vėliau, kruopščiai jas išbandydami įsitikinkite, kad jūsų priemonės gali atlaikyti numatomą apkrovą. Įsitikinkite, kad įdiegėte pakankamą stebėseną, apimančią jūsų rizikos mažinimo priemones.
Jei taikoma, visuose jūsų darbo krūvio komponentuose ieškokite tos pačios problemos arba konfigūracijos trūkumų, kuriuos gali paveikti panašios problemos. Pasinaudokite šia proga ir proaktyviai spręskite šių komponentų problemas. Peržiūrėkite savo incidentų istoriją, kad nustatytumėte panašių problemų modelius visame savo darbo krūvyje.
Pasinaudokite savo išvadomis, kad patobulintumėte savo testavimo strategiją. Įsitikinkite, kad sėkmingai išsprendėte pagrindinę priežastį ir panašias problemas, tiesiogiai išbandydami tą patį gedimą.
Gedimų injekcijos ir chaoso inžinerijos gairės
Gedimų injekcijos testavimas vadovaujasi chaoso inžinerijos principais, pabrėžiant darbo krūvio gebėjimą reaguoti į komponentų gedimus. Atlikti klaidų injekcijos testavimą ikigamybinėje ir gamybinėje aplinkoje. Pritaikykite informaciją, kurios išmokote atliekant gedimo režimo analizę siekiant užtikrinti, kad testuojate tik tuos gedimus, kuriems teikiate pirmenybę, ir kad turite problemų sprendimo strategijas.
Pagrindinės chaoso inžinerijos gairės yra šios:
Būkite iniciatyvūs. Nelaukite, kol nesėkmės įvyks. Stenkitės numatyti nesėkmes atlikdami chaoso eksperimentus, kad atrastumėte ir išspręstumėte problemas, kol jos nepaveikė jūsų gamybos aplinkos.
Priimk nesėkmę. Priimkite ir mokykitės iš savo sistemoje atsirandančių gedimų. Gedimus laikykite natūralia sudėtingų sistemų dalimi ir naudokite juos kaip galimybes mokytis bei pagerinti savo sistemos patikimumą.
Sugriauti sistemą. Sąmoningai į savo sistemą įšvirkškite gedimų ar streso, kad patikrintumėte jos atsparumą. Imituokite realius gedimus ar sutrikimus, kad patikrintumėte ir pagerintumėte savo darbo krūvio atkūrimo galimybes.
Sukurkite imunitetą. Naudokite chaoso inžinerijos eksperimentus, kad pagerintumėte savo darbo krūvio gebėjimą išvengti gedimų ir po jų atsigauti.
Chaoso inžinerija yra neatsiejama darbo krūvio komandos kultūros dalis ir nuolatinė praktika, o ne trumpalaikės taktinės pastangos reaguojant į vieną sutrikimą. Kurdami chaoso eksperimentus, vadovaukitės šiuo standartiniu metodu:
Pradėkite nuo hipotezės. Kiekvienas eksperimentas turėtų turėti aiškų tikslą, pavyzdžiui, patikrinti srauto gebėjimą atlaikyti konkretaus komponento praradimą.
Išmatuokite pradinį elgesį. Vykdydami eksperimentą, užtikrinkite, kad turėtumėte nuoseklius patikimumo ir našumo rodiklius srautui ir eksperimente dalyvaujantiems komponentams, kuriuos galėtumėte palyginti su suprastėjusia būsena.
Įterpkite gedimą arba gedimus. Eksperimentas turėtų būti sąmoningai nukreiptas į konkrečius komponentus, kuriuos galima greitai atkurti, ir jūs turėtumėte turėti pagrįstą lūkestį dėl poveikio, kurį sukels gedimo injekcija, kad padėtumėte kontroliuoti eksperimento sprogimo spindulį.
Stebėkite atsiradusį elgesį. Surinkite telemetrijos duomenis apie atskirus srauto komponentus ir viso proceso elgseną, į kurią orientuotas eksperimentas, kad tinkamai suprastumėte gedimo poveikį. Palyginkite surinktus rodiklius su baziniais rodikliais, kad susidarytumėte išsamų gedimų injekcijos rezultatų vaizdą.
Dokumentuokite procesą ir pastebėjimus. Išsamūs eksperimentų įrašai padės ateityje priimti sprendimus dėl darbo krūvio struktūros ir užtikrins, kad laikui bėgant išryškėjusios spragos bus pašalintos.
Nustatykite rezultatą ir imkitės veiksmų. Suplanuokite taisomuosius veiksmus, kuriuos galima įtraukti į jūsų darbo krūvio sąrašą kaip patobulinimus. Užtikrinti, kad projektavimo tobulinimo planai būtų peržiūrimi ir išbandomi negamybinėje aplinkoje pagal tuos pačius procesus kaip ir kiti diegimai.
Periodiškai patvirtinkite savo procesą, architektūros pasirinkimus ir kodą, kad greitai aptiktumėte technines skolas, integruotumėte naujas technologijas ir prisitaikytumėte prie besikeičiančių reikalavimų.
Kai atliekate gedimų injekcijos eksperimentus, jūs:
Patvirtinkite, kad stebėjimas vykdomas ir įspėjimai yra nustatyti.
Patvirtinkite savo procesą, kaip priskirti tiesiogiai atsakingą asmenį (DRI), kad jis prisiimtų atsakomybę už incidentą.
Įsitikinkite, kad jūsų dokumentacijos ir tyrimo procesai yra atnaujinti.
Integruokite šias rekomendacijas ir svarstymus, kad optimizuotumėte chaoso testavimo strategiją:
Iššūkių sistemos prielaidos. Atlikdami testavimą, bandote pagerinti savo darbo krūvio atsparumą ir darbo krūvio projektavimo strategijas. Ieškokite galimybių suleisti gedimus į komponentus ir srautus, kurie, jūsų manymu, yra patikimi, remiantis ankstesne patirtimi. Jie gali būti nepatikimi jūsų naujame darbo krūvyje.
Patikrinkite pakeitimą. Be išsamaus testavimo, įskaitant gedimų įpurškimo testavimą, atlikus pakeitimus galite susidaryti neišsamų vaizdą apie savo darbo krūvį. Pavyzdžiui, galite įvesti naujų priklausomybių, kurios nėra iš karto matomos.
Naudokite SLA buferius. Apribokite chaoso testavimą, kad neviršytumėte savo SLA ir išvengtumėte galimo neigiamo gedimų poveikio. Srauto ir komponentų atkūrimo tikslai padeda apibrėžti testavimo aprėptį.
Nustatykite klaidų biudžetą kaip investiciją į chaosą ir gedimų injekciją. Jūsų klaidų biudžetas yra skirtumas tarp 100% SLO pasiekimo ir sutarto SLO pasiekimo.
Sustabdykite eksperimentą, jei jis peržengia taikymo sritį. Nežinomi rezultatai yra tikėtinas chaoso eksperimentų rezultatas. Stenkitės pasiekti pusiausvyrą tarp esminių rezultatų duomenų rinkimo ir poveikio kuo mažiau gamybos vartotojų.
Glaudžiai bendradarbiaukite su kūrėjų komandomis, kad užtikrintumėte suleistų nesėkmių aktualumą. Naudokite ankstesnius incidentus ar problemas kaip vadovą. Išnagrinėkite priklausomybes ir įvertinkite rezultatus, kai pašalinsite tas priklausomybes.
Identifikuokite ir dokumentuokite anksčiau neatrastas priklausomybes tarp skirtingų jūsų darbo krūvio komponentų, kurios atskleidžiamos atliekant chaoso testavimą.
Jei reikia, koreguokite atkūrimo planus, kad būtų atsižvelgta į priklausomybes, kurios aptinkamos atliekant chaoso testavimą.
Naudokite eksperimentų ir bandymų rezultatus kaip naujų eksperimentų ir bandymų pagrindą. Atsiradus netikėtam elgesiui, nauji testai gali būti nukreipti tiesiogiai į tą elgesį ir suteikti jums galimybę sukurti jiems ištaisymo strategijas.
Kompromisas: Gedimų įpurškimo bandymai gamyboje gali būti trikdantys ir gali sukelti prastovas. Skaidriai bendraukite su suinteresuotosiomis šalimis apie šią galimybę ir įsitikinkite, kad turite apsaugos priemonių, leidžiančių nutraukti eksperimentus ir atšaukimo planus, kad greitai atšauktumėte įvestas nesėkmes.
Power Platform Palengvinimo
Galite naudoti statinius rezultatus Power Automate , kad pateiktumėte fiksuotą rezultatą ir patikrintumėte savo darbo krūvį.
Norėdami išbandyti visų tipų Power Apps, galite naudoti "Power Platform Playwright" pavyzdžius.
"Azure" testavimo planai yra paprastas naudoti, naršykle pagrįstas testavimo valdymo sprendimas, suteikiantis visas galimybes, reikalingas suplanuotam rankiniam testavimui, vartotojų priėmimo testavimui, tiriamajam testavimui ir atsiliepimų iš suinteresuotųjų šalių rinkimui.
Jei jūsų darbo krūvis apima "Azure" išteklius, galite naudoti "Azure Chaos Studio" – valdomą paslaugą, kuri naudoja chaoso inžineriją, kad padėtų įvertinti, suprasti ir pagerinti debesies programų ir paslaugų atsparumą.
Jei jūsų darbo krūvyje yra Microsoft Copilot Studio agentas, agentams ir testams konfigūruoti galite naudoti Copilot agentų rinkinį. Atliekant individualius testus su **API** (**a30**), agento atsakymai įvertinami pagal laukiamus rezultatus. Copilot Studio Direct Line
Susijusi informacija
Patikimumo kontrolinis sąrašas
Žr. visą rekomendacijų rinkinį.