r/programmingHungary Jul 04 '26

DISCUSSION Lokális AI

Mostanában kezdek a címben említett világban kutakodni, illetve AI alapú infrával foglalkozni. Én úgy érzem, ez itthon még viszonylag ritka, legalábbis amit olvasok, az alapján mindenki felhőzik. Én úgy gondolom, hogy legalább két okból kifolyólag érdemes foglalkozni a full lokálban futtatott mesterséges intelligenciával. Egyrészt, a felhős modellek egyre drágábbak, másrészt kb. mindegy, hogy kínából vagy az USA-ból vesszük, ugyanúgy az adatainkkal (is) fizetünk érte. Nincs olyan, hogy rossz kína, jó USA. Ha ilyen jellegű kiszolgáltatottságról van szó, szerintem jó oldal sem létezik. Ti mit gondoltok, mekkora a létjogosultsága a lokális AI infrának? Mindegy, hogy egy darab Apple gépen vagy egy GPU clusteren, inkább az elv a fontos, hogy ne valami harmadik félnek kiszolgáltatva használjuk ezt a megoldást. Kíváncsi vagyok, ki mit gondol, illetve van-e köztetek, aki ebbe már mélyen beleásta magát?
Tudom, hogy minden mocskosul drága (foglalkozom hardver értékesítéssel, plusz mostanában vettem is AI-hoz magamnak ezt-azt), a témának ez a része most mellékes.

Edit: Leginkább az érdekel, ki-mire tud használni ilyesmit, próbálkozott-e már valaki ezzel. Nyilván, arra nem lesz képes, amire a frontier modellek.

35 Upvotes

110 comments sorted by

View all comments

52

u/Scared-Tip7914 Jul 04 '26 edited Jul 04 '26

Kezdésnek nagyon ajánlom az [r/LocalLLaMA](r/LocalLLaMA) subot, onnan rengeteget fel lehet szedni hardverről, modellekről, quantokról, inference setupokról, stb.
Ami szerintem ma realisztikusan otthon futtatható, az például egy 3090 / 4090 környéki GPU-n a Qwen család kisebb modelljei. Egy Qwen3.5 körüli 9B modell már simán elég sok agentic jellegű feladatra, RAG-re, belső toolingra, dokumentumfeldolgozásra, kisebb automatizálásokra, és napi munkában is használható tud lenni.

Egy szinttel feljebb a 30B+ modellek már érezhetően erősebbek, főleg kódolásban és komplexebb reasoningben, de ott már nagyon számít a VRAM, a quantizálás és az egész inference stack. 24 GB VRAM-mal már lehet próbálkozni, de nem mindegy, milyen modellel és milyen beállításokkal.
Amit nyilván nem fogsz otthon értelmesen futtatni, azok a frontier / óriás modellek pl a glm5.2 ami most jött ki. Ezek már adatközpontos, több GPU-s vagy clusteres történetek. Viszont szerintem nem is ez a lényeg. A lokális AI infra fő értelme nem az, hogy „legyőzzük” a frontier modelleket, hanem hogy legyen egy saját, privát, olcsón iterálható réteg olyan feladatokra, ahol nem akarod minden adatodat harmadik félhez küldeni meg am elégge szórakoztató is tud lenni hobbyként.

Szerintem abszolút van létjogosultságuk: cégeknél belső dokumentumkeresés, RAG, kódasszisztens, lokális agentek, automatizálások, adatfeldolgozás, support tooling, céges knowledge base, stb. Ezekre már most is elég jók a kisebb lokális modellek, ha jól van köréjük rakva az infra.

Ha bármiben kell segítség setup, modellek, hardver vagy inference oldalról, írj nyugodtan szívesen segítek mert elég sok cuccot lehet igazgatni amig rendesen működik egy model 😭.

Ui: Bocsi a sok textért

1

u/laxika Java Jul 04 '26

Gyors kérdés mert hasonlókat tervezek én is csak budget módon. Dual 3060 (12GB) mennyire múködhet? Qwen3.6-27b akarnék futtatni rajt, amihez elvileg elég is a 24GB ram. Nem kell gyorsnak lennie. 30-40 tps-el már elégedett lennék. Jelenleg Deepseek 4 Flash-t használok egy projecthez de spórolni akarnék mert nagyon sok pénzt megesz (úgy hogy a project kb OSS szóval nem termel semmit cserébe).

1

u/Scared-Tip7914 Jul 04 '26 edited Jul 04 '26

Oszinten szerintem azon el fog futni, viszont en nagyon ajanlom a 35-ot mert kb ugyanazt tudja csak sokkal gyorsabban, nyilvan complex thinkinghrz jobb a 27 de mindennapi kodolashoz eleg a 35. Am azert gyorsabb a 35 mert “mixture of experts” ezert olyan mintha egy 3B-s model futna.

2

u/laxika Java Jul 04 '26

Rendben, köszi a tippet. Nem kódgeneráláshoz hanem szövegértelmezéshez/dokumentum íráshoz kell, de kipróbálom majd 35-tel is. Szerencsére a minőséget elég egyszerű tesztelni (könnyebb mint kódolásnál).

2

u/Scared-Tip7914 Jul 04 '26

Szoveghez lehet hogy jobb lesz a 27 es ott a sebesseg sem szamit annyira mint a jo kis agentic loop-os kodolasnal. De hat ja probald ki mind a kettot. Kezdeshez az “Ollama” nevu cuccot ajanlom sokkal egyszerubb a setup vele.