Felelős Generatív AI-alkalmazások és -funkciók fejlesztése a Windows

Ez a dokumentum áttekintést nyújt a generatív mesterséges intelligenciával rendelkező Windows alkalmazások és szolgáltatások létrehozása során javasolt felelős fejlesztési eljárásokról.

Microsoft Foundry on Windows az eszközön futó generatív AI-modellek segíthetnek a helyi tartalombiztonsági funkciók, például a káros tartalmak eszközbesorolási motorjai és az alapértelmezett tiltólista kikényszerítésében. Microsoft előnyben részesíti a fejlesztőket abban, hogy biztonságos, megbízható AI-élményt építsenek ki a helyi modellekkel Windows.

Útmutató a generatív AI-alkalmazások és -funkciók felelős fejlesztéséhez a Windows

A Microsoft minden csapata mag-alapelveket és gyakorlatokat követ a mesterséges intelligencia felelősségteljes létrehozásához és szállításához, beleértve a Windows is. A felelős fejlesztés Microsoft megközelítéséről a Microsoft Felelős AI átláthatósági jelentésében olvashat bővebben. Windows az RAI-fejlesztés alappilléreit követi — irányítás, feltérképezés, mérés és menedzsment — amelyek igazodnak a Nemzeti Szabványügyi és Technológiai Intézet (NIST) AI kockázatkezelési keretrendszeréhez.

Szabályozás – Szabályzatok, eljárások és folyamatok

A szabványok az irányítási és megfelelőségi folyamatok alapjai. Microsoft kifejlesztette saját Responsible AI Standard, beleértve a six alapelveket, amelyekkel kiindulási pontként fejlesztheti a felelős AI-ra vonatkozó irányelveit. Javasoljuk, hogy AI-alapelveket alakítson ki a fejlesztési életciklus végéig, valamint az adatvédelmi, biztonsági és felelős AI-jogszabályoknak való megfelelést szolgáló folyamatokba és munkafolyamatokba. Ez az egyes AI-funkciók korai értékelésére terjed ki, olyan eszközök használatával, mint például az AI méltányossági ellenőrzőlista és a Microsoft Kutatás - Irányelvek az ember-AI interakcióhoz, az AI-referenciamutatók monitorozására és felülvizsgálatára, valamint a tesztelési és folyamatértékelési eszközök, mint például a Responsible AI scorecard alkalmazása révén, az AI-funkciók képességeinek és korlátainak, valamint a felhasználói tájékoztatások és irányítások nyilvános dokumentációja – értesítés, hozzájárulás, adatgyűjtés és adatfeldolgozás stb. – a vonatkozó adatvédelmi jogszabályokkal, szabályozási követelményekkel és szabályzatokkal összhangban.

Térkép – Kockázat azonosítása

A kockázatok azonosítására ajánlott eljárások a következők:

Teljes körű tesztelés

A teljes körű tesztelés az elejétől a végéig kiértékeli a teljes AI-rendszert annak biztosítása érdekében, hogy a rendszer a kívánt módon működjön, és megfeleljen a megállapított szabványoknak. Ez az átfogó megközelítés a következőket tartalmazhatja:

Piros összevonás

A red teaming kifejezés történelmileg az ellenfél szisztematikus támadásait írta le a biztonsági rések tesztelése céljából. A közelmúltban a kifejezés túlnyúlt a hagyományos kiberbiztonságon, és a gyakori használatban fejlődött az AI-rendszerek kipróbálásának, tesztelésének és támadásának számos típusának leírására.

A nagy nyelvi modellek (LLM-ek) és a kis nyelvi modellek (SLM-ek) esetén mind a jóindulatú, mind a támadó használat potenciálisan káros kimeneteket eredményezhet, amelyek számos formában jelentkezhetnek, beleértve a gyűlöletbeszédet, az erőszak felbujtását vagy dicsőítését vagy a szexuális tartalmakat. Az alapos piros csapat tevékenység lehetővé teszi, hogy stressztesztelje a rendszerét, és finomítsa a tartalomstratégiát annak érdekében, hogy csökkentse a rendszer által okozott károk lehetőségét.

Minden AI-rendszert piros csapattesztnek kell alávetni a funkciótól és a rendeltetéstől függően mind a generatív AI-t alkalmazó, mind a nem generatív AI-t használó alacsonyabb kockázatú rendszerek esetében:

  • Formális vörös összevonási: A nagy nyelvi modelleket (LLM-eket) használó, generatív AI-t alkalmazó, magas kockázatú rendszerek esetében a független vörös összevonást el kell végezni. A formális vörös csapatozás magában foglalja a szervezeten kívüli szakemberek felkérését, hogy részt vehessenek a vörös csapattevékenységekben.

  • Belső red teaming: Legalább tervezzen belső red teaminget az összes alacsonyabb kockázatú, nemgeneratív AI-rendszerre. Ezt a szervezeten belüli személyek is megtehetik.

További információ a vörös összevonásról, valamint a rendszer vörös összevonási igényeinek felméréséről: Microsoft AI Red Team

Modell kiértékelése

A végpontok közötti tesztelés részeként fontos magát a modellt kiértékelni.

  • Modellkártya: A nyilvánosan elérhető modellek, például az Ölelés arcon lévő modellek esetében hasznos hivatkozásként ellenőrizheti az egyes modellek modellkártyáját, hogy a használati esethez megfelelő modell-e. Tudjon meg többet a Model Cards.

  • manuális tesztelés: A szkriptek nélküli, lépésről-lépésre végzett teszteket emberek hajtják végre, akik a modellértékelés fontos összetevői, amely támogatja a...

    • A folyamat előrehaladásának mérése néhány prioritási probléma esetén. Adott károk mérséklésekor gyakran a leghatékonyabb, ha manuálisan ellenőrzi a haladást egy kis adatkészleten, amíg a kár már nem észlelhető az automatizált mérésre való áttérés előtt.

    • A metrikák meghatározása és jelentése mindaddig szükséges, amíg az automatizált mérés nem elég megbízható ahhoz, hogy önmagában használható legyen.

    • Rendszeres helyszíni ellenőrzés az automatikus mérés minőségének mérésére.

  • Automatizált tesztelési: Az automatikusan végrehajtott tesztelés a modellértékelés fontos összetevője, amely támogatja a...

    • Nagy léptékű mérés nagyobb lefedettséggel, hogy átfogóbb eredményeket nyújtson.

    • Folyamatos mérés a rendszer, a használat és a kockázatcsökkentések fejlődésével kapcsolatos regresszió monitorozásához.

  • Modell kiválasztása: Válasszon ki egy olyan modellt, amely megfelel az Ön céljának, és tanítsa magát a képességeinek, korlátainak és potenciális biztonsági kihívásainak megismerésére. A modell tesztelése során győződjön meg arról, hogy a modell az Ön számára megfelelő eredményeket hoz létre. Első lépésként a Microsoft (és nem Microsoft/nyílt forráskód) modellforrások célhelyei a következők:

Mérték – Kockázatok és kockázatcsökkentés értékelése

Ajánlott eljárások:

  • Tartalommoderátor kijelölése: A tartalommoderátor feladata a szöveges, képi és video tartalmak ellenőrzése, hogy az esetlegesen sértő, kockázatos vagy más módon nem kívánatos tartalmakat kiszűrje a tartalomból. További információ: Introduction to Content Moderator (Microsoft Learn Training).

    • Tartalombiztonsági szűrők használata: Ez a többosztályos besorolási modellek együttese a káros tartalmak négy kategóriáját (erőszak, gyűlölet, szexuális és önkárosítás) észleli különböző súlyossági szinteken (alacsony, közepes és magas). További információ: Az Azure OpenAI Service tartalomszűrők konfigurálása.

    • Meta-parancssor alkalmazása: A metaadat-parancssor egy rendszerüzenet, amely a parancssor elején található, és arra szolgál, hogy a modellt a használati eset szempontjából releváns kontextussal, utasításokkal vagy egyéb információkkal prímozza. Ezek az utasítások a modell viselkedésének irányítására szolgálnak. További információ: Hatékony biztonsági védőkorlátok létrehozása metaprompt- és rendszerüzenet-tervezéssel.

    • Blokklisták használata: Ez letiltja bizonyos kifejezések vagy minták használatát a parancssorban. További információ: Tiltólista használata az Azure OpenAI-ban.

    • Ismerkedjen meg a modell eredetével: Az eredet a modell tulajdonjogának története, vagy a ki-hol-mikor, és nagyon fontos megérteni. Ki gyűjtötte össze az adatokat egy modellben? Kikre vonatkoznak az adatok? Milyen típusú adatokat használ? Hol gyűjtötték az adatokat? Mikor gyűjtötték az adatokat? A modelladatok forrásának ismerete segíthet felmérni annak minőségét, megbízhatóságát, és elkerülni az etikátlan, tisztességtelen, elfogult vagy pontatlan adatfelhasználást.

    • Szabványos folyamat használata: Használjon egy egységes tartalommoderálási folyamatot ahelyett, hogy különböző részekből tevődne össze. További információ: Mik azok az Azure Machine Learning folyamatok?.

  • felhasználói felületmegoldásainak alkalmazása: Ezek fontosak abban, hogy egyértelművé tegyék a felhasználó számára az AI-alapú funkciók képességeit és korlátait. A felhasználók segítése és a funkció átláthatóságának biztosítása érdekében a következőket teheti:

    • A felhasználók ösztönzése a kimenetek szerkesztésére, mielőtt elfogadná őket

    • Az AI-kimenetek lehetséges pontatlanságainak kiemelése

    • Az AI szerepének feltárása az interakcióban

    • Idézethivatkozások és források

    • A bemenet és a kimenet hosszának korlátozása, ha szükséges

    • Strukturált bemenet vagy kimenet megadása – a kéréseknek szabványos formátumot kell követnie

    • Előre meghatározott válaszok előkészítése ellentmondásos kérdésekre.

  • Felhasználói visszajelzési ciklusok implementálása: A felhasználókat arra ösztönözzük, hogy aktívan vegyenek részt a visszajelzési ciklusokban:

    • Kérjen visszajelzést közvetlenül az alkalmazásában/ termékében egy egyszerű visszajelzési mechanizmus használatával, amely a felhasználói élmény részeként elérhető a kontextusban.

    • Alkalmazza a közösségi figyelési technikákat azokra a csatornákra, amelyeket az ügyfelek a funkcióval kapcsolatos problémákról, aggodalmakról és esetleges károkról szóló korai beszélgetésekhez használnak.

Kezelés – AI-kockázatok csökkentése

Az AI-kockázatok csökkentésére vonatkozó javaslatok a következők:

  • visszaélések monitorozása: Ez a módszer észleli és enyhíti az ismétlődő tartalmakat és/vagy viselkedéseket, amelyek arra utalnak, hogy a szolgáltatást olyan módon használták, amely megsértheti a magatartási kódexet vagy más vonatkozó termékfeltételeket. További információ: visszaélések monitorozása.

  • Fázisos bevezetés: Az AI-megoldás lassú bevezetése segít a bejövő jelentések és aggodalmak kezelésében.

  • incidenskezelési terv: Minden magas prioritású kockázat esetén értékelje ki, hogy mi fog történni, és mennyi ideig tart az incidensre való reagálás, és hogy hogyan fog kinézni a válaszfolyamat.

  • Funkció vagy rendszer kikapcsolásának lehetősége: Olyan funkció biztosítása, amely kikapcsolja a funkciót, ha olyan incidens történt, amely miatt a funkció szüneteltetése szükséges a további károk elkerülése érdekében.

  • Felhasználói hozzáférés-vezérlők/letiltó: A rendszer helytelenül használó felhasználóinak letiltásának módja.

  • Felhasználói visszajelzés: A felhasználói oldal problémáinak észleléséhez használjon mechanizmusokat.

    • Kérjen visszajelzést közvetlenül a termékben egy egyszerű visszajelzési mechanizmussal, amely egy tipikus munkafolyamat kontextusában érhető el.

    • Alkalmazza a közösségi figyelési technikákat azokra a csatornákra, amelyeket az ügyfelek a funkcióval kapcsolatos problémákról, aggodalmakról és esetleges károkról szóló korai beszélgetésekhez használnak.

  • Telemetriai adatok felelős üzembe helyezése: Azonosítsa, gyűjtse össze és figyelje a felhasználói elégedettséget vagy a rendszer rendeltetés szerinti használatára vonatkozó képességet jelző jeleket, biztosítva, hogy betartsa a vonatkozó adatvédelmi törvényeket, szabályzatokat és kötelezettségvállalásokat. Telemetriaadatokkal azonosíthatja a hiányosságokat, és javíthatja a rendszert.

Eszközök és erőforrások