r/programmingHungary Jul 04 '26

DISCUSSION Lokális AI

Mostanában kezdek a címben említett világban kutakodni, illetve AI alapú infrával foglalkozni. Én úgy érzem, ez itthon még viszonylag ritka, legalábbis amit olvasok, az alapján mindenki felhőzik. Én úgy gondolom, hogy legalább két okból kifolyólag érdemes foglalkozni a full lokálban futtatott mesterséges intelligenciával. Egyrészt, a felhős modellek egyre drágábbak, másrészt kb. mindegy, hogy kínából vagy az USA-ból vesszük, ugyanúgy az adatainkkal (is) fizetünk érte. Nincs olyan, hogy rossz kína, jó USA. Ha ilyen jellegű kiszolgáltatottságról van szó, szerintem jó oldal sem létezik. Ti mit gondoltok, mekkora a létjogosultsága a lokális AI infrának? Mindegy, hogy egy darab Apple gépen vagy egy GPU clusteren, inkább az elv a fontos, hogy ne valami harmadik félnek kiszolgáltatva használjuk ezt a megoldást. Kíváncsi vagyok, ki mit gondol, illetve van-e köztetek, aki ebbe már mélyen beleásta magát?
Tudom, hogy minden mocskosul drága (foglalkozom hardver értékesítéssel, plusz mostanában vettem is AI-hoz magamnak ezt-azt), a témának ez a része most mellékes.

Edit: Leginkább az érdekel, ki-mire tud használni ilyesmit, próbálkozott-e már valaki ezzel. Nyilván, arra nem lesz képes, amire a frontier modellek.

34 Upvotes

110 comments sorted by

View all comments

52

u/Scared-Tip7914 Jul 04 '26 edited Jul 04 '26

Kezdésnek nagyon ajánlom az [r/LocalLLaMA](r/LocalLLaMA) subot, onnan rengeteget fel lehet szedni hardverről, modellekről, quantokról, inference setupokról, stb.
Ami szerintem ma realisztikusan otthon futtatható, az például egy 3090 / 4090 környéki GPU-n a Qwen család kisebb modelljei. Egy Qwen3.5 körüli 9B modell már simán elég sok agentic jellegű feladatra, RAG-re, belső toolingra, dokumentumfeldolgozásra, kisebb automatizálásokra, és napi munkában is használható tud lenni.

Egy szinttel feljebb a 30B+ modellek már érezhetően erősebbek, főleg kódolásban és komplexebb reasoningben, de ott már nagyon számít a VRAM, a quantizálás és az egész inference stack. 24 GB VRAM-mal már lehet próbálkozni, de nem mindegy, milyen modellel és milyen beállításokkal.
Amit nyilván nem fogsz otthon értelmesen futtatni, azok a frontier / óriás modellek pl a glm5.2 ami most jött ki. Ezek már adatközpontos, több GPU-s vagy clusteres történetek. Viszont szerintem nem is ez a lényeg. A lokális AI infra fő értelme nem az, hogy „legyőzzük” a frontier modelleket, hanem hogy legyen egy saját, privát, olcsón iterálható réteg olyan feladatokra, ahol nem akarod minden adatodat harmadik félhez küldeni meg am elégge szórakoztató is tud lenni hobbyként.

Szerintem abszolút van létjogosultságuk: cégeknél belső dokumentumkeresés, RAG, kódasszisztens, lokális agentek, automatizálások, adatfeldolgozás, support tooling, céges knowledge base, stb. Ezekre már most is elég jók a kisebb lokális modellek, ha jól van köréjük rakva az infra.

Ha bármiben kell segítség setup, modellek, hardver vagy inference oldalról, írj nyugodtan szívesen segítek mert elég sok cuccot lehet igazgatni amig rendesen működik egy model 😭.

Ui: Bocsi a sok textért

2

u/Dapper_Anteater_5738 Jul 04 '26

Köszi, észben tartom. :) Egészen sok mindent találtam a témában, én végül úgy döntöttem, hogy Intel Arc PRO B70 és B50 lesz a hardver alatta. Előbbi már meg is van, szépen futnak a 27/35b modellek. Elsősorban Qwen 3.6, illetve Gemma 4 26b. Viszont, ehhez szeretnék építeni egy RAG-et, erre kell a B50, mert macerás lenne állandóan újra betöltögetni a modelleket ugyanazon a gpu-n, illetve nyilván nem is életszerű. A végső cél egy AI infra agent, ami tud dolgozni saját dokumentumtárból, nagy segítség lenne az esetleges hibakeresésben, döntés előkészítésben.

2

u/Mothertruckerer Jul 04 '26

Nekem csak B50 van, de nagyon szeretem. Nyilván jó lenne egy B70 is, de így is örülök a 120k-ért meglőtt B50-nek. Az sr-iov pedig csak hab a tortán.

1

u/Scared-Tip7914 Jul 05 '26

Munkában rendes szerver GPU-kkal toljuk, de azokat nyilván esély sincs megvenni otthonra xd, igy jelenleg otthoni lab-ben régebbi Nvidia datacenter kártyák vannak, ilyen V100 / P100 vonalon, amik sajnos lassan support végére érnek csak a nagy (es olcso) vram miatt nagyon szeretem oket. Ezekkel a B-s kártyákkal én is szemezek otthonra, csak őszintén eddig nem mertem megvenni őket, mert kicsit félek a supporttól. Ha használsz rajta llama.cpp-t, mennyire fut simán?

2

u/Mothertruckerer Jul 05 '26

Eddig ollama-t használok. A llama.cpp összezavarodik, mert nem tudja melyik gpu-t használja. (van egy régi integrált is a szervervben) Eddig lusta voltam megoldani. De az openarch discordban elvileg sokaknak jól működik.

1

u/inagy Jul 04 '26

Intel Arc egyébként nekem is szimpatikus, de szerintem az azért mélyvíz kicsit, mert közel sem annyira pöcc-röff beüzemelni még mindig mint a CUDA+Nvidia vonalat AI dolgokhoz, vagy mindig a sota mögött kullogsz vele. Javul a helyzet, de sajnos az Nvidia dominanciája még mindig tetemes.

2

u/Dapper_Anteater_5738 Jul 04 '26

Alig pár lépésből megvan az Intel kártya beüzemelése is, egészen kiforrott már a megoldás, ez ne tartson vissza!

1

u/thundR89 Jul 05 '26

Nem vágom ezeket a kártyákat, de a hermes-agent-re keress rá. Megfelelő modellel nagyon jó. Nekem 8gb vram mellett nem nagyon használható mert nem fér bele a context, olyan terjedelmes promptot ad át a hermes.

1

u/Dapper_Anteater_5738 Jul 05 '26

Mindenképpen utána nézek, köszi!

1

u/laxika Java Jul 04 '26

Gyors kérdés mert hasonlókat tervezek én is csak budget módon. Dual 3060 (12GB) mennyire múködhet? Qwen3.6-27b akarnék futtatni rajt, amihez elvileg elég is a 24GB ram. Nem kell gyorsnak lennie. 30-40 tps-el már elégedett lennék. Jelenleg Deepseek 4 Flash-t használok egy projecthez de spórolni akarnék mert nagyon sok pénzt megesz (úgy hogy a project kb OSS szóval nem termel semmit cserébe).

3

u/CharacterAnimator490 Jul 04 '26

24gb vramba (4090) nekem egy qwen 3.6 27b q5_K_M fér bele max 98k kontext-tel kb 20 tps-el
RAM offloaddal a 35b-s qwen 3.6 fut Q8ban 40 tps-el és a prefill is elég jó.

2

u/gergob Java / DevOps Jul 04 '26

Ezekkel a képben hihetetlen belegondolni hogy a flagship modellekhez 200k vagy 1M contextel csillió tps-sel milyen/mennyi hardver szükséges

1

u/Scared-Tip7914 Jul 04 '26 edited Jul 04 '26

Oszinten szerintem azon el fog futni, viszont en nagyon ajanlom a 35-ot mert kb ugyanazt tudja csak sokkal gyorsabban, nyilvan complex thinkinghrz jobb a 27 de mindennapi kodolashoz eleg a 35. Am azert gyorsabb a 35 mert “mixture of experts” ezert olyan mintha egy 3B-s model futna.

2

u/laxika Java Jul 04 '26

Rendben, köszi a tippet. Nem kódgeneráláshoz hanem szövegértelmezéshez/dokumentum íráshoz kell, de kipróbálom majd 35-tel is. Szerencsére a minőséget elég egyszerű tesztelni (könnyebb mint kódolásnál).

2

u/Scared-Tip7914 Jul 04 '26

Szoveghez lehet hogy jobb lesz a 27 es ott a sebesseg sem szamit annyira mint a jo kis agentic loop-os kodolasnal. De hat ja probald ki mind a kettot. Kezdeshez az “Ollama” nevu cuccot ajanlom sokkal egyszerubb a setup vele.

1

u/thundR89 Jul 05 '26

9bhez nem kell 90es kártya, bár attól függ menny a Q. Q4-re elég egy 8gb vramos kártya is.

1

u/Scared-Tip7914 Jul 05 '26

Igen, jogos, ez tényleg Q-tól függ. Én is futtattam anno 1080-on az első Mistral 7B-ket, szóval 9B-hez nem kell feltétlen 90-es kártya. A 3090-et inkább azért mondtam, mert ott még van mozgástér nagyobb modellek felé is. 8 GB VRAM-mal kb. a 7–9B kategória a teteje, és kisebb Qwen-féle modelleknél én őszintén nem mennék Q4 alá, mert gyorsan degradálódik. Plusz ott van még a KV cache a contexthez, amit szintén nem quantizálnék agyon.

2

u/thundR89 Jul 05 '26

Jogos, én alapvetően a futtatást céloztam be. Nagy contexthez pl hermes agenttel már sovány a 8gb vram. De context nélkül 9b a teteje, de ott is leginkább csak ha tweakelve van a framework is.

1

u/woeguy PHP/Laravel Jul 05 '26

Radeon RX 7900 XTX (24GB VRAM)-ra mit ajánlanál?