Llama.cpp vs vLLM: Ktorý Lokálny LLM Engine Zvládne Škálovanie?

Llama.cpp a vLLM sú dva populárne nástroje na spustenie lokálnych jazykových modelov (LLMs). Llama.cpp optimalizuje modely pre menší hardvér, zatiaľ čo vLLM je určený na škálovateľnosť v produkčných prostrediach.

Llama.cpp vs vLLM: Ktorý Lokálny LLM Engine Zvládne Škálovanie?
Photo by Steve A Johnson/Unsplash

V dnešnej dobe sa zdá, že každý hľadá spôsob, ako spustiť lokálne veľké jazykové modely (LLMs). A je to skvelé! Môžete si vlastne spúšťať modely štýlu GPT ako AI asistenti, editory kódu a oveľa viac priamo z vášho počítača alebo notebooku. Existuje toho hneď niekoľko dôvodov, prečo ľudia túto možnosť vyhľadávajú. Po prvé, LLMs môžu byť dosť drahé, takže ich spustenie na vlastnom hardvéri môže ušetriť peniaze. Okrem toho môžete naraziť na výpadky služieb AI alebo obmedzenia rýchlosti (rate limiting), čo je veľmi nepríjemné. A napokon, osobne pre mňa najväčší dôvod je súkromie a bezpečnosť, ktoré získate spustením modelu na vlastnom zariadení. Ak hľadáte spôsob, ako spustiť lokálne LLMs, pravdepodobne ste už počuli o dvoch známych nástrojoch: llama.cpp a vLLM. Obe sa zameriavajú na rôzne typy použitia, ale môžete ich stále využívať pre RAG (Retrieval Augmented Generation), vytvárať AI agentov alebo ich používať ako AI asistenty pri programovaní. Na konci tohto článku sa dozviete, ako a prečo si vybrať medzi týmito dvoma nástrojmi.

Llama 2: Revolúcia v Open-Source LLMs

Poďme sa vrátiť o pár rokov späť k vydaniu modelu s názvom Llama 2 od spoločnosti Meta. Bol to veľký jazykový model, ale bol veľmi unikátny, pretože patril medzi prvé komerčne úspešné modely s otvorenými váhami (open weights). Doteraz boli služby ako ChatGPT dostupné len cez API alebo za poplatok, no Llama 2 ste si mohli stiahnuť z Hugging Face alebo GitHub a skúsiť ho spustiť na vlastnom hardvéri.

Mastodon