Transformátory a LLM: Budúcnosť AI
Transformátory a rozsiahle jazykové modely (LLM) predstavujú prelomový krok v AI. Prednáška zo Stanfordu vysvetľuje tokenizáciu, pozornosť a architektúru transformátorov – encoder a decoder – a prekonáva obmedzenia starších metód ako RNN/LSTM.
Táto prednáška zo Stanfordu predstavuje fascinujúci svet transformátorov a rozsiahlych jazykových modelov (LLM). Video CME295, ktoré je súčasťou kurzu z jesene 2026, sa ponorí do základných konceptov, od tokenizácie až po architektúru transformátora. Zistíme, ako tieto modely fungujú a prečo sú takým prelomovým krokom v oblasti umelej inteligencie. Prednáška sa dotýka starších metód, ako sú RNN a LSTM, aby ukázala výhody nového prístupu založeného na pozornosti.
Tokenizácia: Rozkladanie jazyka na menšie časti
Prvým krokom v porozumení akémukoľvek jazykovému modelu je tokenizácia. Predstavte si to ako rozdelenie textu na jednotlivé stavebné bloky – tokeny. V prednáške sa predstavuje Byte Pair Encoding (BPE), moderná metóda, ktorá inteligentne kombinuje najčastejšie páry znakov alebo slovíčok do nových tokenov. To umožňuje modelu efektívne spracovávať text a zároveň zvládať neznáme slová pomocou špeciálnych tokenov ako „unknown“. Dôležité je, že moderné tokenizátory môžu mať stovky tisíc tokenov, čo im umožňuje pracovať s rôznymi jazykmi.