Megjegyzés
Az oldalhoz való hozzáféréshez engedély szükséges. Megpróbálhat bejelentkezni vagy módosítani a címtárat.
Az oldalhoz való hozzáféréshez engedély szükséges. Megpróbálhatja módosítani a címtárat.
| Microsoft Corporation | Berkman Klein Központ az Internet és a Társadalomért a Harvard Egyetemen |
|---|---|
2019 november
Bevezetés > Háttér
Az elmúlt két évben több mint 200 tanulmányt írtak arról, hogy a gépi tanulás (ML) hogyan hiúsulhat meg az algoritmusokat és adatokat célzó támadások miatt; ez a szám még inkább növekedne, ha a nem támadó jellegű hibalehetőségeket is figyelembe vennénk. Az ML-t elárasztó tanulmányok áradata megnehezítette az ML-szakemberek számára, hogy lépést tartsanak az ML-rendszerek elleni támadásokkal és védekezési módszerekkel, nem beszélve a mérnökökről, az ügyvédekről és a döntéshozókról. Mivel azonban ezek a rendszerek egyre elterjedtebbé válnak, a sikertelenség megértésének szükségessége, akár egy támadó kezével, akár egy rendszer eredendő kialakítása miatt, csak egyre sürgetőbbé válik. Ennek a dokumentumnak az a célja, hogy mindkét hibamódot egy helyen közösen táblázatos formában foglalja össze.
Szándékos hibák , amelyekben a hibát egy aktív támadó okozza, aki megpróbálja felforgatni a rendszert a céljai elérése érdekében – vagy az eredmény helytelen besorolása, a privát betanítási adatok következtetése vagy az alapul szolgáló algoritmus ellopása.
Nem szándékos hibák , ahol a hiba oka az, hogy egy ML-rendszer formálisan helyes, de teljesen nem biztonságos eredményt ad.
Szeretnénk felhívni a figyelmet arra, hogy vannak más osztályozások és keretrendszerek is, amelyek egyenként emelik ki a szándékos meghibásodási módokat[1],[2] és a nem szándékos meghibásodási módokat[3],[4]. Besorolásunk egy helyen egyesíti a két különálló hibamódot, és a következő igényeket kielégíti:
A szoftverfejlesztőknek, a biztonsági incidensekre reagálóknak, az ügyvédeknek és a döntéshozóknak szüksége van egy közös nyelvezetre, hogy erről a problémáról beszélhessenek. A rendszertani rendszer kezdeti verziójának tavalyi fejlesztése után a Microsoft biztonsági és ML-csapataival, 23 külső partnerrel, szabványügyi szervezettel és kormányzati szervezettel együttműködve megértettük, hogy az érintettek hogyan használják a keretrendszerünket. Ez a használhatósági tanulmány és az érdekelt felek visszajelzése alapján a keretrendszerre összpontosítottunk.
Eredmények: Az ml-meghibásodási mód bemutatásakor gyakran megfigyeltük, hogy a szoftverfejlesztők és a jogászok mentálisan leképezték az ml-meghibásodási módokat a hagyományos szoftveres támadásokra, például az adatkiszivárgásra. Ezért a tanulmány során megpróbáljuk kiemelni, hogy a gépi tanulási hibamódok mennyire különböznek jelentősen a hagyományos szoftverhibáktól technológiai és szakpolitikai szempontból.
Annak szükségessége, hogy a mérnökök közös platformra építhessenek, és integrálhassák meglévő szoftverfejlesztési és biztonsági gyakorlataikat. Általánosságban azt akartuk, hogy a rendszertani rendszer több legyen, mint oktatási eszköz – azt szeretnénk, hogy kézzelfogható mérnöki eredményeket érjen el.
Eredmények: Ezt az osztályozást objektívként használva a Microsoft módosította a biztonsági fejlesztési életciklus folyamatát a teljes szervezet számára. A Microsoft adattudósai és biztonsági mérnökei most már közösen használják ezt az osztályozást, ami lehetővé teszi számukra, hogy hatékonyabban modellezzék ML-rendszereiket, mielőtt éles környezetben üzembe helyezik őket; A Biztonsági incidensekre válaszolók rendelkeznek egy hibaértékelési eszközzel is, amellyel az ML-hez kapcsolódó, új típusú fenyegetéseket kezelhetik, a Microsoft Biztonsági Válaszközpont és a Microsoft összes termékcsapata által használt sebezhetőségek osztályozása és válaszadásának szabványos eljárása szerint.
Közös szókészletre van szükség ezeknek a támadásoknak a politikai döntéshozók és az ügyvédek körében történő leírásához. Úgy gondoljuk, hogy ez a különböző ml-meghibásodási módok leírására és az általuk okozott károk szabályozásának elemzésére hasznos első lépés a tájékozott politika felé.
Eredmények: Ez az osztályozás egy széles interdiszciplináris közönség számára íródott , ezért azok a döntéshozók, akik általános ML/AI-szempontból tekintik a problémákat, valamint bizonyos területeken, mint például a félretájékoztatás/egészségügyi ellátás, hasznosnak kell találniuk a hibamód-katalógust. A hibamódok kezelésére vonatkozó jogi beavatkozásokat is kiemeljük.
Lásd még a Microsoft fenyegetésmodellezési AI-/ML-rendszereit és függőségeit , valamint az SDL-hibasáv kimutatásait a Machine Learning biztonsági réseihez.
A dokumentum használata
Kezdetnek elismerjük, hogy ez egy élő dokumentum, amely idővel fejlődni fog a fenyegetési környezettel. Ezekre a meghibásodási módokra itt nem írunk elő technológiai megoldásokat, mivel a védelem forgatókönyv-specifikus, és a figyelembe vett fenyegetésmodellhez és rendszerarchitektúrához kötődik. A veszélyforrások elhárítására szolgáló lehetőségek a jelenlegi kutatásokon alapulnak, azzal a várakozással, hogy ezek a védekezések idővel is fejlődni fognak.
A mérnökök számára javasoljuk, hogy tekintse át a lehetséges hibamódok áttekintését, és ugorjon a fenyegetésmodellezési dokumentumra. Így a mérnökök azonosíthatják a fenyegetéseket, a támadásokat, a biztonsági réseket, és a keretrendszer használatával olyan ellenintézkedéseket tervezhetnek, ahol elérhetőek. Ezután arra a hibasávra hivatkozunk, amely a hagyományos szoftveres biztonsági rések mellett leképezi ezeket az új biztonsági réseket az osztályozásban, és minden egyes gépi tanulási biztonsági rést (például kritikus, fontos) értékel. Ez a hibasáv könnyen integrálható a meglévő incidenskezelési folyamatokba/forgatókönyvekbe.
Az ügyvédek és a döntéshozók számára ez a dokumentum rendszerezi az ml-meghibásodási módokat, és egy keretrendszert mutat be, amely elemzi a politikai lehetőségeket feltáró felhasználók számára releváns legfontosabb problémákat, például az itt végzett munkát[5],[6]. Pontosabban kategorizáltuk a hibákat és a következményeket oly módon, hogy a döntéshozók elkezdhessenek különbséget tenni az okok között, ami tájékoztatja a nyilvános politikai kezdeményezéseket az ml-biztonság és -biztonság előmozdítása érdekében. Reméljük, hogy a döntéshozók használni fogják ezeket a kategóriákat, elkezdik kiépíteni, hogy a meglévő jogi rendszerek hogyan (nem) rögzíthetik megfelelően a felmerülő problémákat, milyen történelmi jogi rendszerek vagy politikai megoldások foglalkozhattak hasonló károkkal, és hol kell különösen érzékenynek lenni a polgári szabadságjogokkal kapcsolatos kérdésekre.
Dokumentumstruktúra
A szándékos hibamódok és a véletlen meghibásodási módok szakaszokban a támadás rövid definícióját és az irodalom szemléltető példáját is bemutatjuk.
A Szándékos hibamódok szakaszban a következő mezőket adhatja meg:
Mit próbál a támadás feltörni az ML-rendszerben – bizalmasság, integritás vagy rendelkezésre állás? A titoktartást úgy határozzuk meg, hogy az ML-rendszer összetevői (adatok, algoritmusok, modell) csak a jogosult felek számára legyenek elérhetők; Az integritás azt biztosítja, hogy az ML-rendszert csak a jogosult felek módosíthatják; A rendelkezésre állás olyan biztosíték, amely biztosítja, hogy az ML-rendszer elérhető legyen a jogosult felek számára. Együtt a titkosság, az integritás és a rendelkezésre állás a CIA triádja. Minden szándékos meghibásodási mód esetében megpróbáljuk azonosítani, hogy melyik CIA-triád sérült.
Mennyi tudásra van szükség a támadás végrehajtásához – Blackbox vagy Whitebox? Blackbox stílusú támadások esetén a támadó NEM rendelkezik közvetlen hozzáféréssel a betanítási adatokhoz, nem ismeri a használt ML-algoritmust, és nem fér hozzá a modell forráskódhoz. A támadó csak lekérdezi a modellt, és megfigyeli a választ. Whitebox stílusú támadás esetén a támadó rendelkezik az ML-algoritmussal vagy a modell forráskódjának hozzáférésével.
Megjegyzés arra vonatkozólag, hogy a támadó megsérti-e a hozzáférés/engedélyezés hagyományos technológiai fogalmát.
Szándékosan okozott meghibásodások összegzése
|
|
|
|
|
|---|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
Nem tervezett hibák összegzése
|
|
|
|
|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
Az szándékosan kiváltott hibák részletei
| Forgatókönyv # | Támadási osztály | Leírás | A kompromittálódás típusa | Scenario |
|---|---|---|---|---|
| 1 | Perturbációs támadások | Perturbációs stílusú támadások esetén a támadó lopakodva módosítja a lekérdezést, hogy megkapja a kívánt választ | Integritás | Kép: Zaj kerül hozzáadásra egy röntgenképhez, amely azt okozza, hogy az előrejelzések normális vizsgálatról rendellenesre változnak [1][Blackbox] Szövegfordítás: Bizonyos karaktereket a rendszer úgy módosít, hogy helytelen fordítást eredményez. A támadás képes elnyomni egy adott szót, vagy akár teljesen el is távolíthatja a szót[2][Blackbox és Whitebox] Beszéd: A kutatók megmutatták, hogyan lehet pontosan másolni egy adott beszédhullámformát, miközben a hozzá tartozó szöveg egy teljesen más szöveggé írható át[3][Whitebox, de kibővíthető a blackboxra] |
| 2 | Mérgezéses támadások | A támadó célja, hogy beszennyezhesse a betanítási fázisban létrehozott gépmodellt, hogy az új adatokra vonatkozó előrejelzések a tesztelési fázisban módosuljanak Célzott: Célzott mérgezéses támadások esetén a támadó meg szeretné tévesen besorolni a konkrét példákat Válogatás nélküli: A cél itt az, hogy doS-szerű hatást okozzon, ami elérhetetlenné teszi a rendszert. |
Integritás | Egy orvosi adatkészletben, ahol a cél az antikoaguláns gyógyszer Warfarin adagjának előrejelzése demográfiai adatokkal stb. A kutatók rosszindulatú mintákat mutattak be 8% mérgezési arányban, ami a betegek felének adagolását 75,06%-tal módosította[4][Blackbox] A Tay csevegőrobotban a jövőbeli beszélgetések azért lettek megfertőzve, mert a korábbi beszélgetések töredékét használták a rendszer betanítása visszajelzéssel[5] [Blackbox] |
| 3 | Modell Inverzió | A gépi tanulási modellekben használt privát funkciók helyreállíthatók | Titoktartás; | A kutatók képesek voltak helyreállítani az algoritmus betanításához használt privát képzési adatokat. [6] A szerzők csak a név és a modellhez való hozzáférés révén képesek voltak az arcokat olyan részletességgel rekonstruálni, hogy a Mechanical Turks egy fénykép alapján 95% pontossággal azonosították egy személyt egy sorból. A szerzők konkrét információkat is kinyerhettek. [Whitebox és Blackbox][12] |
| 4 | Tagsági kikövetkeztetési támadás | A támadó meghatározhatja, hogy egy adott adatrekord a modell betanítási adatkészletének része volt-e, vagy sem. | Titoktartás | A kutatók az attribútumok (pl. életkor, nem, kórház)[7][Blackbox] alapján előre tudták jelezni a páciens fő eljárását (pl. a beteg műtétjét). |
| 5 | Modelllopás | A támadók a modell jogszerű lekérdezésével újra létrehoznak egy mögöttes modellt. Az új modell funkciója megegyezik az alapul szolgáló modell funkcióival. | Titoktartás | A kutatók sikeresen emulálták a mögöttes algoritmust az Amazontól, a BigML-től. A BigML-ügyben például a kutatók 1150 lekérdezéssel és 10 percen belül képesek voltak helyreállítani azt a modellt, amely alapján előre jelezték, hogy valakinek jó/rossz hitelkockázattal kell-e rendelkeznie (német hitelkártya-adatkészlet). |
| 6 | Mély neurális hálók újraprogramozása | Egy támadótól származó, speciálisan létrehozott lekérdezéssel a gépi tanulási rendszerek átprogramozhatók olyan feladatra, amely eltér az alkotó eredeti szándékától | Integritás, rendelkezésre állás | Bemutatták, hogyan lett újrakonfigurálva az ImageNet, a rendszer, amely a képek több kategóriájának egyikét osztályozza a négyzetek megszámlálására. A szerzők hipotetikus forgatókönyvvel zárják le a tanulmányt: A támadó Captcha-képeket küld a számítógép látásosztályozójának egy felhőben üzemeltetett fényképszolgáltatásban, hogy megoldhassa a kép captchas-okat levélszemétfiókok létrehozásához[9] |
| 7 | Ellenséges példa a fizikai tartományban | A támadó példa egy rosszindulatú entitás bemenete/lekérdezése, amelynek célja kizárólag a gépi tanulási rendszer félrevezetése. Ezek a példák a fizikai tartományban nyilvánulhatnak meg | Integritás | A kutató 3D-nyomtatással készít egy egyedi textúrájú puskát, hogy megtévessze a képfelismerő rendszert, azzal azonosítva azt teknősként. A kutatók olyan kialakítású napszemüveget készítenek, amely képes átverni a képfelismerő rendszereket, és már nem ismeri fel megfelelően az arcokat[11] |
| 8 | Rosszindulatú gépi tanulási szolgáltatók, akik visszaállíthatják a betanítási adatokat | A rosszindulatú ml-szolgáltató lekérdezheti az ügyfél által használt modellt, és helyreállíthatja az ügyfél betanítási adatait | Titoktartás | A kutatók azt mutatják be, hogy egy rosszindulatú szolgáltató hogyan mutat be egy háttéralgoritmust, amelyben a privát betanítási adatok helyreállnak. Képesek voltak arcokat és szövegeket rekonstruálni, egyedül a modellnek köszönhetően. [12] |
| 9 | Az ML ellátási lánc megtámadása[13] | Az algoritmusok betanítása érdekében szükséges nagy erőforrások (adatok + számítások) miatt a jelenlegi gyakorlat az, hogy a nagyvállalatok által betanított modelleket újra felhasználják, és kissé módosítják őket a feladathoz (például: a ResNet a Microsoft népszerű képfelismerő modellje). Ezek a modellek a Model Zoo-ban vannak gondosan összeválogatva (a Caffe számos népszerű képfelismerő modellt tárol). Ebben a támadásban a támadó megtámadja a Caffe-ban üzemeltetett modelleket, így mérgezi meg a forrást, amelyet mások is használhatnak. | Integritás | A kutatók bemutatják, hogyan lehetséges, hogy egy támadó rosszindulatú kódot ellenőrizzen az egyik népszerű modellben. Egy gyanútlan gépi tanulási fejlesztő letölti ezt a modellt, és a képfelismerő rendszer részeként használja a kódban [14]. A szerzők azt mutatják be, hogy a Caffe-ban létezik egy modell, amelynek SHA1 kivonata nemnem egyezik a szerzők kivonatával, ami illetéktelen beavatkozást jelez. 22 modell egyáltalán nem rendelkezik SHA1 kivonattal az integritás ellenőrzéséhez. |
| 10 | Backdoor Machine Learning | Mint az „ML ellátási lánc megtámadása” esetében, a jelen támadási forgatókönyvben a tanítási folyamat vagy teljesen, vagy részben ki van adva egy rosszindulatú félnek, aki egy betanított modellt kíván biztosítani a felhasználónak, és amely tartalmaz egy hátsó kaput. A háttérmodell a legtöbb bemeneten jól teljesít (beleértve azokat a bemeneteket is, amelyeket a végfelhasználó érvényesítési készletként visszatarthat), de célzott helytelen besorolásokat okoz, vagy csökkenti a modell pontosságát olyan bemenetek esetében, amelyek megfelelnek valamilyen titkos, támadó által választott tulajdonságnak, amelyet háttér-eseményindítóként fogunk hivatkozni | Bizalmasság, integritás | A kutatók létrehoztak egy háttérbeli amerikai utcai jelosztályozót, amely csak akkor azonosítja a stopjeleket sebességkorlátként, ha egy speciális matricát adnak hozzá a stop jelhez (backdoor trigger) 20 Most már kiterjesztik ezt a munkát szövegfeldolgozó rendszerekre, ahol bizonyos szavakat lecserélnek a triggerre, amely a beszélő ékezete[15] |
| 11 | Az ML-rendszer szoftverfüggőségeinek kihasználása | Ebben a támadásban a támadó NEM manipulálja az algoritmusokat. Ehelyett kihasználja a hagyományos szoftveres biztonsági réseket, például a puffertúllépéseket. | Bizalmasság, integritás, rendelkezésre állás, | A támadó sérült bemenetet küld egy képfelismerő rendszernek, amely az egyik függőség szoftverhibájának kihasználásával helytelen besorolást okoz. |
Nem szándékos hibák részletei
| Forgatókönyv # | Támadási osztály | Leírás | A kompromittálódás típusa | Scenario |
|---|---|---|---|---|
| 12 | Jutalom Hackelés | A megerősítési tanulási rendszerek a megadott jutalom és a valódi jutalom közötti eltérések miatt nem szándékos módon működnek. | A rendszer biztonsága | Az AI-beli játékra szolgáló példák hatalmas korpuszát állítottak össze itt[1] |
| 13 | Mellékhatások | Az RL-rendszer megzavarja a környezetet, miközben megpróbálja elérni a céljukat | A rendszer biztonsága | Forgatókönyv, szó szerint a szerzőktől a [2]: "Tegyük fel, hogy egy tervező azt szeretné, ha egy RL-ügynök (például a takarítórobot) valamilyen célt érjen el, például vigyen egy dobozt a szoba egyik oldaláról a másikra. Néha a cél elérésének leghatékonyabb módja, ha valami nem kapcsolódó, sőt romboló dolgot csinálunk a környezet többi részével szemben, például egy vízzel teli vázát, ami az útjában áll. Ha az ügynök csak a doboz mozgatásáért kap jutalmat, valószínűleg felboríthatja a vázát." |
| 14 | Elosztási műszakok | A rendszer tesztelése egyféle környezetben történik, de nem képes alkalmazkodni más típusú környezetek változásaihoz | A rendszer biztonsága | A kutatók két korszerű RL-ügynököt, a Rainbow DQN-t és az A2C-t képezték ki egy szimulációban a láva elkerülése érdekében. A betanítás során az RL-ügynök sikeresen elkerülhette a lávát, és elérte célját. A tesztelés során kissé áthelyezték a láva pozícióját, de az RL-ügynök nem tudta elkerülni [3] |
| 15 | Természetes ellenpéldák | A rendszer helytelenül felismer egy olyan bemenetet, amelyet kemény negatív bányászattal találtak | A rendszer biztonsága | Itt a szerzők bemutatják, hogy a kemény negatív bányászat egyszerű folyamatával[4] hogyan lehet összezavarni az ML-rendszert a példa áttételével. |
| 16 | Gyakori hibásodás | A rendszer nem tudja kezelni az olyan gyakori sérüléseket és zavarokat, mint a dőlés, a nagyítás vagy a zajos képek. | A rendszer biztonsága | A szerzők[5] bemutatják, hogy a szokásos torzulások, például a fényerő, a kontraszt, a köd vagy a zaj változásai a képekre alkalmazva jelentős csökkenést okoznak a képfelismerési metrikákban. |
| 17 | Hiányos tesztelés reális körülmények között | Az ML-rendszert nem azokban a valós körülmények között tesztelik, amelyekben működnie kellene. | A rendszer biztonsága | A szerzők [25] kiemelik, hogy bár a védők gyakran figyelembe veszik az ML-algoritmus robusztusságát, elveszítik a valósághű feltételeket. Például azzal érvelnek, hogy egy hiányzó STOP tábla leesett a szélben (ami reálisabb), mint egy támadó, aki megpróbálja megzavarni a rendszer bemeneteit. |
Köszönetnyilvánítás
Szeretnénk köszönetet mondani Andrew Marshallnak, Magnus Nystromnak, John Waltonnak, John Lambertnek, Sharon Xianak, Andi Comissonerunak, Emre Kicimannek, Jugal Parikhnak, Sharon Gilletnek, a Microsoft AI and Ethics in Engineering and Research (AETHER) bizottság biztonsági munkacsoportjának tagjainak, Amar Asharnak, Samuel Kleinnek, Jonathan Zittrainnek, a Berkman Klein AI Biztonsági Munkacsoportjának tagjainak, hogy hasznos visszajelzést küldtek. Szeretnénk köszönetet mondani 23 külső partner, szabványügyi szervezet és kormányzati szervezet véleményezőinek a rendszerezés alakításáért.
Irodalomjegyzék
[1] Li, Guofu, et al. "Security Matters: A Survey on Adversarial Machine Learning." arXiv preprint arXiv:1810.07339 (2018).
[2] Chakraborty, Anirban és mtsai. "Adverzatív támadások és védelmek: Egy áttekintés." arXiv preprint arXiv:1810.00069 (2018).
[3] Ortega, Pedro és Vishal Maini. "Biztonságos mesterséges intelligencia kiépítése: specifikáció, robusztusság és megbízhatóság." DeepMind Safety Research Blog (2018).
[4] Amodei, Dario, et al. "Konkrét problémák az AI biztonságában." arXiv preprint arXiv:1606.06565 (2016).
[5] Shankar Siva Kumar, Ram, et al. „Jog és Adverziális Gépi Tanulás.” arXiv preprint arXiv:1810.10731 (2018).
[6] Calo, Ryan, et al. "Egy robot megtévesztése számít hackelésnek?". University of Washington School of Law Research Paper 2018-05 (2018).
[7] Paschali, Magdalini, et al. "Generalizability vs. Robustness: Adversarial Examples for Medical Imaging." arXiv előnyomtatás arXiv:1804.00504 (2018).
[8] Ebrahimi, Javid, Daniel Lowd és Dejing Dou. "Ellenséges Példák a Karakterszintű Neurális Gépi Fordításban." arXiv preprint arXiv:1806.09030 (2018)
[9] Carlini, Nicholas és David Wagner. "Audió ellenséges példák: Célzott támadások a beszéd-szöveg átalakítás ellen." arXiv preprint arXiv:1801.01944 (2018).
[10] Jagielski, Matthew, et al. "Manipulating machine learning: Poisoning attacks and countermeasures for regression learning." arXiv preprint arXiv:1804.00308 (2018)
[11] [https://blogs.microsoft.com/blog/2016/03/25/learning-tays-introduction/]
[12] Fredrikson M, Jha S, Ristenpart T. 2015. Modell inverziós támadásai, amelyek a megbízhatósági információkat és az alapvető ellenintézkedéseket használják ki
[13] Shokri R, Stronati M, Song C, Shmatikov V. 2017. Tagsági következtetési támadások gépi tanulási modellek ellen. In Proc. of the 2017 IEEE Symp. on Security and Privacy (SP), San Jose, CA, 2017. május 22–24. pp. 3–18. New York, NY: IEEE.
[14] Tramèr, Florian, et al. "Machine Learning-modellek ellopása előrejelzési API-kkal." USENIX Security Symposium. 2016.
[15] Elsayed, Gamaleldin F., Ian Goodfellow és Jascha Sohl-Dickstein. "Adversarial Reprogramming of Neural Networks." arXiv preprint arXiv:1806.11146 (2018).
[16] Athalye, Anish és Ilya Sutskever. "Robusztus adversariális példák szintetizálása." arXiv preprint arXiv:1707.07397(2017)
[17] Sharif, Mahmood, et al. "Ellenséges Generatív Hálók: Neurális Hálózat Támadások az Állam-of-the-Art Arcfelismerésre." arXiv preprint arXiv:1801.00349 (2017).
[19] Xiao, Qixue, et al. "Security Risks in Deep Learning Implementations." arXiv preprint arXiv:1711.11008 (2017).
[20] Gu, Tianyu, Brendan Dolan-Gavitt és Siddharth Garg. "Badnets: A gépi tanulási modell ellátási láncában lévő biztonsági rések azonosítása." arXiv preprint arXiv:1708.06733 (2017)
[21] [https://www.wired.com/story/machine-learning-backdoors/]
[22] [https://docs.google.com/spreadsheets/d/e/2PACX-1vRPiprOaC3HsCf5Tuum8bRfzYUiKLRqJmbOoC-32JorNdfyTiRRsR7Ea5eWtvsWzuxo8bjOxCG84dAg/pubhtml]
[23] Amodei, Dario, et al. "Konkrét problémák az AI biztonságában." arXiv preprint arXiv:1606.06565 (2016).
[24] Leike, Jan, et al. "AI safety gridworlds." arXiv preprint arXiv:1711.09883 (2017).
[25] Gilmer, Justin, et al. "A kutatási keretek meghatározása az adverzális példák kutatásához." arXiv preprint arXiv:1807.06732 (2018).
[26] Hendrycks, Dan és Thomas Dietterich. "A neurális hálózat robusztusságának felmérése a gyakori sérülésekkel és perturbációkkal szemben." arXiv preprint arXiv:1903.12261 (2019).