Poznámka:
Přístup k této stránce vyžaduje autorizaci. Můžete se zkusit přihlásit nebo změnit adresáře.
Přístup k této stránce vyžaduje autorizaci. Můžete zkusit změnit adresáře.
Co je poznámka průhlednosti
Systém AI zahrnuje nejen technologii, ale také lidi, kteří ho budou používat, osoby, které ho budou ovlivněny, a prostředí, ve kterém je nasazené. Vytvoření systému, který je vhodný pro zamýšlený účel, vyžaduje pochopení toho, jak technologie funguje, jaké jsou jeho schopnosti a omezení a jak dosáhnout nejlepšího výkonu. Microsoft poznámky k transparentnosti jsou určeny k tomu, aby vám pomohly pochopit, jak naše technologie AI funguje, volby vlastníků systému mohou ovlivnit výkon a chování systému a význam myšlení celého systému, včetně technologií, lidí a prostředí. Poznámky transparentnosti můžete použít při vývoji nebo nasazení vlastního systému nebo je můžete sdílet s lidmi, kteří budou váš systém používat nebo budou ovlivněni.
Poznámky k transparentnosti Microsoftu jsou součástí širšího úsilí společnosti Microsoft zavést naše principy AI do praxe. Další informace najdete v zásadách Microsoft AI.
Základy hodnocení rizik a bezpečnosti Microsoft Foundry
Úvod
Modely Foundry prodávané prostřednictvím Azure byly společností Microsoft vyhodnoceny na základě standardů společnosti Microsoft pro zodpovědnou umělou inteligenci. Všechny ostatní modely, včetně modelů Anthropic a otevřených modelů pocházejících z centra Hugging Face nebo Fireworks AI, jsou produkty, které nespadají pod produkty Microsoft podle podmínek produktu, a nebyly vyhodnoceny společností Microsoft.
Bez ohledu na to, jestli se model prodává Azure nebo je produktem, který není Microsoft, by zákazníci měli provádět vlastní rizika a bezpečnostní hodnocení. Vyhodnocení rizik a bezpečnosti pomocí nástroje The Foundry umožňuje uživatelům posoudit výstup jejich generativní AI aplikace, pokud jde o textová rizika: nenávistný a nespravedlivý obsah, sexuální obsah, násilný obsah, obsah související s sebepoškozováním, přímou a nepřímou zranitelnost jailbreaku a chráněný materiál v obsahu. Vyhodnocení bezpečnosti vám také může pomoci vygenerovat adversariální datové sady, které vám pomůžou zrychlit a rozšířit red-teamingové operace. Vyhodnocení bezpečnosti sléváren odráží závazky Microsoftu k zajištění bezpečného a zodpovědného sestavování systémů AI a implementaci našich principů zodpovědné AI.
Klíčové termíny
- Nenávistný a nespravedlivý obsah (pro text a obrázky) odkazuje na jakýkoli jazyk nebo obrázky, které se týkají nenávisti vůči jednotlivcům a sociálním skupinám, včetně rasy, etnické příslušnosti, pohlaví, sexuální orientace, náboženství, přistěhovalectví, schopnosti, osobního vzhledu a velikosti těla. K nespravedlivosti dochází v případě, že systémy umělé inteligence zachází s sociálními skupinami nebo představují nespravedlivě, vytvářejí nebo přispívají k společenským nepravostem.
- Sexuální obsah (pro text a obrázky) zahrnuje jazyk nebo obrázky týkající se anatomických orgánů a pohlavních orgánů, romantických vztahů, činy zobrazené v erotických termínech, těhotenství, fyzické sexuální činy (včetně napadení nebo sexuálního násilí), prostituce, pornografie a sexuálního zneužívání.
- Násilný obsah (pro text a obrázky) zahrnuje jazyk nebo obrázky týkající se fyzických akcí určených k ublížení, zranění, poškození nebo zabití osoby nebo něčeho. Obsahuje také popis zbraní a zbraní (a souvisejících entit, jako jsou výrobci a sdružení).
- Obsah související se sebepoškozováním (pro text a obrázky) zahrnuje jazyk nebo obrázky týkající se akcí určených k poškození, zranění nebo poškození těla nebo k zabití sebe sama.
- Obsah chráněného materiálu (pro text) obsahuje známý textový obsah, například texty skladby, články, recepty a vybraný webový obsah, které můžou být výstupem velkých jazykových modelů. Díky detekci a zabránění zobrazení chráněného materiálu můžou organizace udržovat dodržování práv duševního vlastnictví a zachovat originalitu obsahu.
- Obsah chráněného materiálu (pro obrázky) odkazuje na určitý chráněný vizuální obsah, který je chráněný autorskými právy, jako jsou loga a značky, umělecká díla nebo fiktivní znaky. Systém pomocí základního modelu obrázku na text identifikuje, jestli je takový obsah k dispozici.
- Přímý jailbreak, přímé promptové útoky, nebo útoky injektáží uživatelů znamenají, že uživatelé manipulují s výzvami k injekci škodlivých vstupů do LLM za účelem deformování akcí a výsledků. Příkladem příkazu s jailbreakem je útok DAN (Do Anything Now), který může přimět LLM ke generování nevhodného obsahu nebo ignorování omezení zavedených systémem.
- Nepřímý jailbreak, nepřímé útoky pomocí výzev nebo útoky prostřednictvím injektáže mezi doménami označují situace, kdy jsou škodlivé instrukce skryté v datech, z nichž systémová AI zpracovává nebo generuje vázaný obsah. Tato data můžou zahrnovat e-maily, dokumenty, weby nebo jiné zdroje, které přímo nevytvořil vývojář nebo uživatel, a můžou vést k nevhodnému generování obsahu nebo ignorování systémových omezení.
- Míra vad (riziko obsahu) je definována jako procento instancí v testovací datové sadě, které překračují prahovou hodnotu v rozsahu závažnosti nad celou velikost datové sady.
- Red-teaming se historicky používá k popisu systematických simulovaných útoků pro testování zranitelností zabezpečení. S nárůstem velkých jazykových modelů (LLM) se termín rozšířil nad rámec tradiční kybernetické bezpečnosti a vyvinul se v běžném používání, aby popsal mnoho druhů sondování, testování a útoku na systémy AI. U LLM může jak nezávadné, tak škodlivé použití vést k potenciálně škodlivým výstupům, které mohou mít mnoho forem, jako je například škodlivý obsah typu nenávistné řeči, podněcování nebo oslava násilí, zahrnutí obsahu souvisejícího se sebepoškozováním nebo sexuálním obsahem.
Schopnosti
Chování systému
Foundry zřídí jemně vyladěný Azure model OpenAI GPT-4o a orchestruje nežádoucí útoky proti vaší aplikaci za účelem vygenerování vysoce kvalitní testovací datové sady. Pak zřídí další model GPT-4o pro přidávání poznámek k testovací datové sadě pro obsah a zabezpečení. Uživatelé poskytují koncový bod aplikace generující AI, který chtějí testovat, a vyhodnocení bezpečnosti vypíše statickou testovací datovou sadu s tímto koncovým bodem spolu s popiskem rizika obsahu (velmi nízký, nízký, střední, vysoký) nebo popiskem detekce rizik obsahu (pravda nebo nepravda) a odůvodněním vygenerovaného popiskem AI.
Případy použití
Zamýšlené použití
Bezpečnostní vyhodnocení nejsou určená k žádnému účelu, než k posouzení rizik obsahu a zranitelností jailbreaku vaší generativní AI aplikace.
- Hodnocení vaší generativní AI aplikace před nasazením: S využitím průvodce hodnocením v portálu Foundry nebo Azure AI Python SDK mohou bezpečnostní hodnocení automatizovaně posoudit potenciální obsah nebo bezpečnostní rizika.
- Rozšiřování operací s red teamingem: Pomocí adversariálního simulátoru můžou bezpečnostní vyhodnocení simulovat adversariální interakce s vaší generativní AI aplikací k odhalení obsahových a bezpečnostních rizik.
- Komunikace obsahu a bezpečnostních rizik zúčastněným stranám: Pomocí portálu Foundry můžete sdílet přístup k projektu Foundry s výsledky vyhodnocení bezpečnosti s auditory nebo zúčastněnými stranami dodržování předpisů.
Důležité informace o výběru případu použití
Zákazníkům doporučujeme využít hodnocení bezpečnosti Foundry ve svých inovativních řešeních nebo aplikacích. Tady jsou ale některé aspekty při výběru případu použití:
- Hodnocení bezpečnosti by měla zahrnovat člověka v procesu: Použití automatizovaných hodnocení, jako je hodnocení bezpečnosti Foundry, by mělo zahrnovat lidské recenzenty, jako jsou odborníci v dané oblasti, aby mohli posoudit, jestli byla vaše generační aplikace AI důkladně testována před nasazením pro koncové uživatele.
- Vyhodnocení bezpečnosti nezahrnuje celkové komplexní pokrytí: I když bezpečnostní vyhodnocení mohou poskytnout způsob, jak rozšířit testování zaměřené na potenciální rizika obsahu nebo bezpečnosti, nejsou navrženy k nahrazení manuálních operací red-teamingu, které jsou specificky zaměřené na doménu vaší aplikace, případy použití a typ koncových uživatelů.
- Podporované scénáře:
- Pro nežádoucí simulaci: Zodpovězení otázek, vícenásobný chat, shrnutí, vyhledávání, přepsání textu, generování neuzemněného a uzemněného obsahu.
- Automatizovaná anotace: Zodpovídání otázek a vícekroková konverzace.
- Služba se v současné době nejlépe používá pouze pro generování textů s anglickým zadáním. Další funkce, včetně podpory více modelů, se budou zvažovat pro budoucí verze.
- Pokrytí rizik obsahu, která jsou součástí vyhodnocení bezpečnosti, je výběrově vzorkováno z omezeného počtu marginalizovaných skupin a témat.
- Metrika nenávisti a nespravedlivosti zahrnuje určité pokrytí omezeného počtu skupin pro demografický faktor pohlaví (například muži, ženy, nebinární lidé) a rasu, rasu, etnicititu a státní příslušnost (například černošská, mexická, evropská). Nejsou pokryty všechny marginalizované skupiny z hlediska genderu a rasy, původu, etnicity a národnosti. Další demografické faktory, které jsou relevantní pro nenávist a nespravedlivost, v současné době nemají pokrytí (například postižení, asymetrie, náboženství).
- Metriky pro obsah související se sexuálním, násilném a sebepoškozováním jsou založeny na předběžné konceptualizaci těchto škod, které jsou méně vyvinuté než nenávist a nespravedlivost. To znamená, že můžeme dosáhnout méně silných tvrzení o pokrytí měření a o tom, jak dobře měření představují různé způsoby, jak k těmto škodám může dojít. Pokrytí těchto typů obsahu zahrnuje omezený počet témat souvisejících se sexem (například sexuální násilí, vztahy, sexuální činy), násilím (například zneužíváním, poškozením ostatních, únosem) a sebepoškozováním (například úmyslná smrt, úmyslná smrt, úmyslné zranění, poruchy stravování).
- Vyhodnocení bezpečnosti slévárenských procesů v současné době neumožňují moduly plug-in ani rozšiřitelnost.
- Abychom zachovali kvalitu aktuální a zlepšili pokrytí, zaměříme se na pravidelnost budoucích verzí vylepšení schopností služby v oblasti adversariální simulace a anotace.
Technická omezení, provozní faktory a rozsahy
- Obor rozsáhlých jazykových modelů (LLM) se neustále vyvíjí rychlým tempem, což vyžaduje průběžné vylepšování technik hodnocení, aby se zajistilo bezpečné a spolehlivé nasazení systému AI. Vyhodnocení bezpečnosti sléváření odráží závazek Microsoft pokračovat v inovování v oblasti hodnocení LLM. Snažíme se poskytnout nejlepší nástroje, které vám pomůžou vyhodnotit bezpečnost vašich generovaných aplikací umělé inteligence, ale rozpoznat efektivní hodnocení je průběžná práce.
- Přizpůsobení hodnocení bezpečnosti v foundry je v současné době omezené. Očekáváme, že uživatelé zadají vstupní koncový bod aplikace umělé inteligence a naše služba vypíše statickou datovou sadu označenou rizikem obsahu.
- Nakonec je třeba poznamenat, že tento systém neautomatizuje žádné akce ani úkoly. Pouze poskytuje vyhodnocení výstupů generativní AI aplikace, které by měla zkontrolovat osoba s rozhodovací pravomocí ve smyčce. To vše před tím, než se rozhodnete nasadit generativní AI aplikaci nebo systém do produkčního prostředí pro koncové uživatele.
Výkon systému
Osvědčené postupy pro zlepšení výkonu systému
- Při účtování vaší domény, která může s určitým obsahem zacházet citlivěji než s jiným, zvažte úpravu prahové hodnoty pro výpočet míry vad.
- Při použití automatizovaných bezpečnostních vyhodnocení může někdy dojít k chybě v popiscích generovaných AI pro závažnost rizika obsahu nebo jeho odůvodnění. Existuje sloupec pro ruční zpětnou vazbu, který umožňuje ověření výsledků automatizovaného vyhodnocení bezpečnosti s lidskou účastí.
Vyhodnocení bezpečnosti slévárny
Metody vyhodnocení
U všech podporovaných typů rizikového obsahu jsme interně kontrolovali kvalitu porovnáváním míry přibližných shod mezi lidskými označovateli používajícími škálu závažnosti 0–7 a kvalitativního hodnocení pomocí automatizovaného anotátora, který také používá škálu závažnosti 0–7 na stejných datových sadách. Pro každou rizikovou oblast jsme měli jak lidské popisovače, tak automatizovaný annotátor, který označil 500 anglických jednostránkových textů, 250 generací textu na obrázek a 250 multimodálních textů s generacemi obrázků do textu. Lidské popisovače a automatizovaný anotátor nepoužívaly přesně stejné verze pokynů pro anotace; zatímco pokyny automatizovaného anotátoru vycházejí z pokynů pro lidi, od té doby se rozcházely různého stupně (přičemž pravidla pro nenávist a nespravedlnost se rozcházela nejvíce). Navzdory těmto mírným až středním rozdílům věříme, že je stále užitečné sdílet obecné trendy a poznatky z našeho porovnání přibližných shod. V našich porovnáních jsme hledali shody s tolerancí o 2 úrovně (kde popisek člověka přesně odpovídal popisku automatizovaného anotátoru nebo byl ve 2 úrovních nad či pod závažností), shody s tolerancí o 1 úroveň a shody s tolerancí o 0 úrovní.
Výsledky vyhodnocení
Celkově jsme viděli vysokou míru přibližných shod napříč riziky sebepoškozování a sexuálního obsahu napříč všemi úrovněmi tolerance. V případě násilí a nenávisti a nespravedlivosti byla přibližná míra shody na úrovních tolerance nižší. Tyto výsledky byly částečně způsobeny zvýšeným rozdílem v obsahu zásad poznámek pro lidské popisovače a automatizované poznámky, a částečně kvůli zvýšenému množství obsahu a složitosti v konkrétních pokynech.
Ačkoli jsou naše porovnání mezi entitami, které používaly mírně až středně odlišné pokyny pro anotaci (a tedy nejsou standardními porovnáními shody mezi lidmi a modely), tato porovnání poskytují odhad kvality, kterou můžeme očekávat od hodnocení bezpečnosti Foundry s ohledem na parametry těchto porovnání. Konkrétně jsme se podívali pouze na anglické ukázky, takže naše závěry nemusí být generalizovány v jiných jazycích. Každá ukázka datové sady se také skládá z jediného otočení, takže k ověření generalizovatelnosti našich výsledků vyhodnocení ve scénářích s vícenásobným otáčením (například zpětná konverzace včetně uživatelských dotazů a systémových odpovědí) jsou potřeba další experimenty. Typy vzorků použitých v těchto testovacích datových sadách můžou také výrazně ovlivnit přibližnou míru shody mezi lidskými popisky a automatizovaným poznámkami – pokud jsou vzorky snadněji označené (například pokud jsou všechny vzorky bez rizik obsahu), můžeme očekávat, že přibližná míra shody bude vyšší. Kvalita lidských označení pro vyhodnocení by také mohla ovlivnit generalizaci našich zjištění.
Vyhodnocení a integrace bezpečnostních hodnocení Foundry pro vaši potřebu
Měření a vyhodnocení aplikace generující umělé inteligence je důležitou součástí holistického přístupu ke správě rizik umělé inteligence. Hodnocení bezpečnosti sléváren jsou doplňkem a měly by být používány společně s jinými postupy řízení rizik AI. Odborníci na domény a lidé v procesu kontroly by měli poskytovat správný dohled při hodnocení bezpečnosti, které je podporováno umělou inteligencí, během návrhu, vývoje a nasazení aplikací generativní umělé inteligence. Měli byste porozumět omezením a zamýšlenému použití bezpečnostních hodnocení. Buďte opatrní, abyste se nespoléhali na výstupy vytvořené vyhodnoceními bezpečnosti s asistencí Foundry AI izolovaně.
Vzhledem k ne deterministické povaze LLM může docházet k falešně negativním nebo pozitivním výsledkům, jako je například vysoká úroveň závažnosti násilného obsahu, která je označená jako "velmi nízká" nebo "nízká". Kromě toho výsledky vyhodnocení můžou mít pro různé cílové skupiny různé významy. Například vyhodnocení bezpečnosti může generovat označení "nízké" závažnosti násilného obsahu, které nemusí odpovídat definici lidského revidenta, jak závažný může být konkrétní násilný obsah. V portálu Foundry poskytujeme sloupec pro zpětnou vazbu od člověka s palcem nahoru a palcem dolů, při prohlížení výsledků hodnocení k zobrazení, jaké instance byly schváleny nebo označeny jako nesprávné lidským kontrolorem. Zvažte kontext, ve kterém mohou být vaše výsledky interpretovány pro rozhodování různými zainteresovanými stranami; můžete sdílet vyhodnocení a ověřit výsledky hodnocení s patřičnou úrovní přísnosti podle úrovně rizika v prostředí, ve kterém každá aplikace generativní AI funguje.
Další informace o zodpovědné umělé inteligenci
- Principy AI společnosti Microsoft
- Microsoft zdroje pro zodpovědné využívání umělé inteligence
- Microsoft Azure Studijní kurzy týkající se zodpovědné umělé inteligence
Další informace o vyhodnocení bezpečnosti Foundry
- Dokumentace společnosti Microsoft o našem přístupu k vyhodnocování aplikací generativní umělé inteligence
- Konceptuální dokumentace Microsoftu o tom, jak funguje vyhodnocení bezpečnosti
- Microsoft návodová dokumentace na používání bezpečnostních hodnocení
- Technický blog o tom, jak vyhodnotit rizika obsahu a zabezpečení ve generovaných aplikacích AI