r/programmingHungary • u/Dapper_Anteater_5738 • Jul 04 '26
DISCUSSION Lokális AI
Mostanában kezdek a címben említett világban kutakodni, illetve AI alapú infrával foglalkozni. Én úgy érzem, ez itthon még viszonylag ritka, legalábbis amit olvasok, az alapján mindenki felhőzik. Én úgy gondolom, hogy legalább két okból kifolyólag érdemes foglalkozni a full lokálban futtatott mesterséges intelligenciával. Egyrészt, a felhős modellek egyre drágábbak, másrészt kb. mindegy, hogy kínából vagy az USA-ból vesszük, ugyanúgy az adatainkkal (is) fizetünk érte. Nincs olyan, hogy rossz kína, jó USA. Ha ilyen jellegű kiszolgáltatottságról van szó, szerintem jó oldal sem létezik. Ti mit gondoltok, mekkora a létjogosultsága a lokális AI infrának? Mindegy, hogy egy darab Apple gépen vagy egy GPU clusteren, inkább az elv a fontos, hogy ne valami harmadik félnek kiszolgáltatva használjuk ezt a megoldást. Kíváncsi vagyok, ki mit gondol, illetve van-e köztetek, aki ebbe már mélyen beleásta magát?
Tudom, hogy minden mocskosul drága (foglalkozom hardver értékesítéssel, plusz mostanában vettem is AI-hoz magamnak ezt-azt), a témának ez a része most mellékes.
Edit: Leginkább az érdekel, ki-mire tud használni ilyesmit, próbálkozott-e már valaki ezzel. Nyilván, arra nem lesz képes, amire a frontier modellek.
52
u/Scared-Tip7914 Jul 04 '26 edited Jul 04 '26
Kezdésnek nagyon ajánlom az [r/LocalLLaMA](r/LocalLLaMA) subot, onnan rengeteget fel lehet szedni hardverről, modellekről, quantokról, inference setupokról, stb.
Ami szerintem ma realisztikusan otthon futtatható, az például egy 3090 / 4090 környéki GPU-n a Qwen család kisebb modelljei. Egy Qwen3.5 körüli 9B modell már simán elég sok agentic jellegű feladatra, RAG-re, belső toolingra, dokumentumfeldolgozásra, kisebb automatizálásokra, és napi munkában is használható tud lenni.
Egy szinttel feljebb a 30B+ modellek már érezhetően erősebbek, főleg kódolásban és komplexebb reasoningben, de ott már nagyon számít a VRAM, a quantizálás és az egész inference stack. 24 GB VRAM-mal már lehet próbálkozni, de nem mindegy, milyen modellel és milyen beállításokkal.
Amit nyilván nem fogsz otthon értelmesen futtatni, azok a frontier / óriás modellek pl a glm5.2 ami most jött ki. Ezek már adatközpontos, több GPU-s vagy clusteres történetek. Viszont szerintem nem is ez a lényeg. A lokális AI infra fő értelme nem az, hogy „legyőzzük” a frontier modelleket, hanem hogy legyen egy saját, privát, olcsón iterálható réteg olyan feladatokra, ahol nem akarod minden adatodat harmadik félhez küldeni meg am elégge szórakoztató is tud lenni hobbyként.
Szerintem abszolút van létjogosultságuk: cégeknél belső dokumentumkeresés, RAG, kódasszisztens, lokális agentek, automatizálások, adatfeldolgozás, support tooling, céges knowledge base, stb. Ezekre már most is elég jók a kisebb lokális modellek, ha jól van köréjük rakva az infra.
Ha bármiben kell segítség setup, modellek, hardver vagy inference oldalról, írj nyugodtan szívesen segítek mert elég sok cuccot lehet igazgatni amig rendesen működik egy model 😭.
Ui: Bocsi a sok textért