Koniec éry neustáleho zväčšovania jazykových modelov?

Koniec éry neustáleho zväčšovania jazykových modelov? Výskum MIT odhalil, že škálovanie LLM má limit – ďalšie zdražovanie nemusí priniesť zlepšenia kvôli prekrývaniu konceptov a ekonomickým prekážkam.

Koniec éry neustáleho zväčšovania jazykových modelov?
Photo by Steve A Johnson/Unsplash

Nedávno publikovaný výskum z MIT priniesol znepokojujúcu správu pre fanúšikov umelej inteligencie: rast jazykových modelov (LLM), ako sú GPT-3 a ChatGPT, má svoju obmedzenú hranicu. Zatiaľ čo doteraz platilo, že čím väčší model, tým lepší výkon, nový výskum naznačuje, že ďalšie škálovanie nemusí priniesť očakávané zlepšenia a môže byť ekonomicky neudržateľné. V tomto článku sa pozrieme na to, prečo je to tak a čo to znamená pre budúcnosť AI.

Ako fungujú jazykové modely?

Predtým, ako sa ponoríme do detailov výskumu MIT, je dôležité pochopiť, ako tieto rozsiahle jazykové modely vlastne fungujú. V podstate sú trénované pomocou tzv. samoučenia. To znamená, že ich kŕmime obrovským množstvom textových dát – všetko od Wikipédie cez tisíce kníh až po rozsiahly výber verejného internetu. Model sa tak učí vzťahy medzi jednotlivými slovami bez toho, aby ho niekto explicitne učil gramatiku alebo iné pravidlá jazyka.

Mastodon