Ako Ilia Shumailov a Alexander Panfilov odhalili slabinu v AI modeloch

Vedci odhalili zraniteľnosť v pokročilých jazykových modeloch (GPT-4). Metóda „kradnutia stopy uvažovania“ umožňuje dešifrovať vnútorné premýšľanie AI, čo môže viesť k jailbreakingu a krádeži informácií. Postihuje aj Anthropic, OpenAI a Google.

Ako Ilia Shumailov a Alexander Panfilov odhalili slabinu v AI modeloch
Photo by Zach M/Unsplash

Nedávno sa objavil rozsiahly výskum, ktorý otriasal svetom umelej inteligencie. Vedci Ilia Shumailov a Alexander Panfilov zistili spôsob, ako dešifrovať vnútorné premýšľanie pokročilých jazykových modelov (LLM), ako je GPT-4. Ich objav, ktorý nazývajú „kradnutím stopy uvažovania“, odhaľuje znepokojujúcu zraniteľnosť v systémoch, ktoré poháňajú mnohé moderné AI aplikácie. V tomto článku sa pozrieme na to, čo presne našli a prečo je to dôležité.

Ako funguje „kradnutie stopy uvažovania“?

Moderné jazykové modely sú navrhnuté tak, aby boli relatívne neprehľadné. Keď položíte otázku, model vám vráti len odpoveď, nie proces, ako k nej dospel. Tento vnútorný proces je šifrovaný a skrytý. Shumailov a Panfilov však zistili spôsob, ako túto šifru obísť a „počúvať“, čo sa deje v hlave modelu.

Mastodon