Ako Ilia Shumailov a Alexander Panfilov odhalili slabinu v AI modeloch
Vedci odhalili zraniteľnosť v pokročilých jazykových modeloch (GPT-4). Metóda „kradnutia stopy uvažovania“ umožňuje dešifrovať vnútorné premýšľanie AI, čo môže viesť k jailbreakingu a krádeži informácií. Postihuje aj Anthropic, OpenAI a Google.