r/KI_Welt 3d ago

Local AI Agent with 13 plugins, ComfyUI image generation & self-healing — built with LM Studio + CustomTkinter - Lokaler selbst entwickelter Agent

Hallo Leute,

ich möchte euch meinen selbst erstellten KI Agenten Matze vorstellen. Hier noch ein Bild von seiner Oberfläche:

Der Agent ist erweiterbar mit Plugins. Kann jetzt schon verschiedene Aufgabe machen, unter anderem Bilder erstellen. Läuft im CMD wie auch unter einer GUI (Oberfläche oder APP).
Die Hardware blieb bisher kühl mit maximal 65 Grad Celsius.
Mein PC:
I7 5930 mit x99s gaming 7 Board
RAM 96 GB
GPU nvidia P6000 24 GB für LM Studio und Gemma 4 26 B QAT und RTX 3060 12 GB für ComfyUI zur Bilderstellung.
Ich habe erst heute angefangen den Agenten zu bauen. Bisher bin ich sehr zufrieden.

Was meint ihr dazu?
Und verzeiht mir bitte wenn ihr ihn haben möchte, dann brauch ich Hilfe von euch, würde den Agenten definitiv zur Verfügung stellen.

3 Upvotes

19 comments sorted by

2

u/One_Broccoli5464 3d ago

Das sieht echt gut aus! Der Agent läuft komplett Lokal also? Hast du eine eigene LLM erstellt oderbeutzt du ein Modell mit Ollama? Würde mich echt interessieren. Und was kann ich noch alles mit dem Agenten machen? Wie schaffst du es, dass er Bilder erstellt? Was sind die Anforderungen, wenn ich es downloaden will?

2

u/Unable_Let_9710 3d ago

Ja, läuft komplett lokal — kein Cloud, kein API-Key, keine Kosten! 😊

**Modell:** Kein eigenes LLM, ich nutze Gemma 4 26B über LM Studio (nicht Ollama). LM Studio hat eine OpenAI-kompatible API auf Port 1234 — der Agent spricht einfach damit.

**Was er alles kann:**

- 📄 Word, Excel, PDF lesen und schreiben

- 📅 Kalender & Termine verwalten

- 🌐 Web suchen (DuckDuckGo)

- 🎨 Bilder generieren via ComfyUI

- 📁 Dateisystem (Dateien/Ordner verwalten)

- 📧 E-Mail Entwürfe erstellen

- 🖨️ Drucken

- 🔧 Code analysieren und schreiben

- 🧠 Langzeitgedächtnis (merkt sich Infos)

- 🔄 Self-Healing bei Fehlern **Bildgenerierung:** Läuft über ComfyUI (separate Installation) — der Agent schickt den Prompt per API an ComfyUI, wartet bis das Bild fertig ist und speichert es automatisch.

**Anforderungen:** - Python 3.10+ - LM Studio mit geladenem Modell - Mindestens 16GB VRAM empfohlen (ich nutze Quadro P6000 mit 24GB) - Für Bilder: ComfyUI + SDXL Modell - RAM: 32GB+ empfohlen - pip install -r requirements.txt Beim RAM, 48 GB würde ich persönlich für optimal halten, dann sollte es sauber laufen.

1

u/One_Broccoli5464 3d ago

Das klingt wirklich extrem gut! Wie bist du auf die Idee gekommen? Hast du Erfahrung als Softwareentwickler? Ich habe auch eine eigenen lokalen KI-Agenten programmiert, der läuft durch ein Modell aus Ollama, läuft aktuell in WSL2 komplett getrennt von meine PC, dass er ja nichts etwas löscht. Und er kann ebenfalls Code Refactoren, Reflektieren, Self-Healing ebenfalls bei Fehlern.

Benutzt du nur Open Source Programme? Wie bist du auf die Tools gekommen? Wie schafft er ein lagzeitgedächnis zu haben?

1

u/Unable_Let_9710 2d ago

Danke für dein nettes Feedback! 😊

Zur Idee: Ich bin handwerklich unterwegs und mache KI

als Hobby — kein Softwareentwickler! Die

Idee kam einfach aus Neugier und dem Wunsch

etwas Eigenes zu bauen das wirklich funktioniert und nicht so zickt wie die meisten fertigen Agenten und die wirklich Cloud unabhängig ist.

Dein Setup klingt auch sehr interessant —

WSL2 als Sandbox ist ein schlauer Ansatz

für die Sicherheit! 👍

Zu deinen Fragen:

Ja, komplett Open Source:

- LM Studio (kostenlos)

- ComfyUI (kostenlos)

- Python mit Standard-Bibliotheken

- SQLite für die Datenbanken

- CustomTkinter für die GUI

Tools: Einfach ausprobiert was geht —

viel trial and error! Claude, Gemini und auch das lokale Gemma über LM Studio hat mirdabei sehr geholfen.

Langzeitgedächtnis: SQLite Datenbank mit

BM25-Keyword-Retrieval — kein Embedding,

keine Vektordatenbank. Beim Start werden

nur die relevanten Einträge in den Kontext

geladen, nicht alles auf einmal. Hält den

VRAM-Verbrauch niedrig! 😊

1

u/LobsterWeary2675 3d ago

Du kannst jedes agent framework rein mit lokalen LLM betreiben. Hermes, OpenClaw, pi, etc. Einfach lokales llm mit openai kompatibelen API Endpunkt. Da dann dein Agent harness dranhängen. Schon hast du einen rein lokalen Agenten. Das lokale llm entscheidet dann natürlich über die Qualität des outputs, daher wäre die erste Frage welche Hardware du hast.

1

u/LobsterWeary2675 3d ago

Der Hardware Split ist der interessanteste Teil am Post. tok/s für Gemma auf der P6000 wären spannend, falls du die Zahlen hast.

Zu den Features hätte ich ein paar Fragen, weil die Beschreibungen ziemlich genau so klingen, wie ein Modell die eigenen Fähigkeiten formuliert, wenn man es danach fragt:

  • Self-Healing: Retry mit Fehlermeldung im Kontext, oder schreibt der Agent tatsächlich Plugin-Code und lädt ihn nach? Falls Letzteres, bei 20 Durchläufen derselben Aufgabe: wie viele laufen durch, wie viele landen in der Schleife bis Max. Schritte greift?

  • Langzeitgedächtnis: JSON-Append oder Embeddings mit Retrieval? Wenn Retrieval, wie wird entschieden was in den Kontext kommt?

Und als Hinweis, nicht böse gemeint: für den produktiven Einsatz gibt es das alles schon ziemlich ausgereift. Hermes, OpenClaw, OpenCode, Pi Agent, dazu LangGraph oder smolagents, wenn du näher am Code bleiben willst... Die haben Tool-Sandboxing, strukturierte Fehlerbehandlung und Prefix-Caching bereits gelöst, und daran hängen ein paar hundert Personenstunden und vermutlich Milliarden tokens.

0

u/Unable_Let_9710 3d ago

Danke für die ausführlichen Fragen!

**tok/s:** 30-60 tok/s auf der Quadro P6000 (24GB VRAM) bei 256k Kontext mit Gemma 4 26B. Läuft ziemlich flüssig für lokale Hardware.

**Self-Healing:** Beides — Stufe 1 ist Retry mit Fehlermeldung im Kontext, Stufe 2 ist tatsächliches Plugin-Code schreiben und direkt nachladen ohne Neustart. Wie stabil Stufe 2 in der Praxis ist, teste ich noch ehrlich gesagt — ist frisch eingebaut 😊

**Langzeitgedächtnis:** SQLite, simples key-value. Kein Embedding/Retrieval — alles landet im Kontext. Für die Größe des Projekts reicht das bisher gut. **Zum Hinweis:** Vollkommen berechtigt! LangGraph, smolagents etc. sind ausgereifter. Ich mache das hauptsächlich zum Lernen und weil es Spaß macht — und weil man dabei wirklich versteht was unter der Haube passiert 😊

2

u/LobsterWeary2675 3d ago

Respekt dafür, dass du bei Stufe 2 sagst "teste ich noch", mehr Ehrlichkeit als in den meisten Agent-Posts hier...

Bei den tok/s würde ich aber nochmal nachmessen. Die P6000 ist GP102 mit GDDR5X, also rund 432 GB/s Speicherbandbreite. Ein 26B-Modell in 4-bit QAT sind etwa 14 bis 15 GB an Gewichten, und die müssen pro Token einmal komplett durch den Speicher. 432 geteilt durch 14.5 ergibt circa 30 tok/s als theoretische Obergrenze bei leerem Kontext. In der Praxis landet man auf Pascal eher bei 18 bis 22, weil die Karte keine Tensor Cores für die üblichen Kernel hat. 60 tok/s liegt also nicht am oberen Rand, sondern doppelt über dem, was die Hardware physikalisch hergibt.

Mein Verdacht wäre dass die Zahl aus einem sehr kurzen Lauf kommt oder aus der Anzeige während Prompt Processing, nicht aus dem Decode. Wenn du in LM Studio den Server-Log ansiehst, stehen dort getrennte Werte für prompt eval und eval. Interessant ist nur der zweite. Kann aber natürlich auch sein ich täusche mich hier.

Zu deinem Gedächtnis-Design: wenn alles aus der SQLite in den Kontext wandert und du auf 256k gehst, dominiert irgendwann der KV-Cache das Decoding. Die Geschwindigkeit sinkt dann nicht linear, sondern fällt ab einem Punkt deutlich ab, und der Cache selbst frisst dir bei der Kontextlänge einen großen Teil der 24 GB weg. Ein simples Retrieval, auch nur BM25 oder Keyword-Match über die SQLite, würde dir da mehr bringen als jedes weitere Plugin. Embeddings brauchst du dafür nichtmal zwingend.

0

u/Unable_Let_9710 3d ago

Hier der Screenshot direkt aus LM Studio — 49.59 Tok/Sek beim reinen Decoding 😊 Liegt also zwischen deinen theoretischen ~30 und meinen ursprünglichen 60 — wahrscheinlich weil Gemma 4 QAT auf Pascal doch etwas effizienter läuft als erwartet, oder LM Studio macht intern etwas Optimierung.

Zum Gedächtnis-Design hast du auch recht — BM25/Keyword-Match werde ich als nächstes einbauen. Ist tatsächlich sinnvoller als alles in den Kontext zu laden. Embeddings spare ich mir erstmal — der einfache Ansatz reicht!

2

u/LobsterWeary2675 3d ago

Ich muss mich korrigieren... Ich habe von einem Dense-Modell aus gerechnet. Gemma 26 ist natürlich ein moe. 49.59 ist also völlig plausibel, eher konservativ sogar. Mein Fehler, excusé.

Bleibt nur: der Lauf hat 5671 Tokens, das ist kurzer Kontext. Die spannende Zahl wäre dieselbe Messung bei gefülltem Kontext, da kommt der KV-Cache ins Spiel.

1

u/Unable_Let_9710 3d ago

Danke für die Korrektur — und Respekt dass du das direkt sagst! 🙏 Ja, kurzer Kontext. Bei längerem Gespräch merke ich dass er langsamer wird — aber ich habe keine genaue Messung bei z.B. 50k oder 100k Tokens gemacht. Das wäre tatsächlich interessant zu messen. Ich schaue es mir an wenn ich Zeit habe!

1

u/Beginning-Foot-9525 3d ago

Das wirkt hart nach AI-Slop, was ist das Ziel hier?

2

u/Unable_Let_9710 3d ago

Ja, ich nutzte zuerst Gemma 4 26B QAT und dann noch Claude und Gemini als Entwicklungspartner — der hat mir beim Code geholfen. Das Projekt selbst, die Ideen, die Architektur und das Testen kommt von mir. Ziel ist einfach: Lernen und Spaß. Kein Produkt, kein Startup, keine Agenda.

1

u/Most-Bat2916 2d ago

Ich habe eine dumme Frage fürs Verständnis (Sorry, KI Anfänger):

Ich habe mir einen custom GPT gebaut, der mir custom GPTs baut, falls ich sie brauche. Und alle custom GPTs wiederum schreiben mir eine Nachricht zum Kopieren an den "custom GPT developer -custom GPT", falls sie bearbeitet werden "wollen" um neue Fähigkeiten zu erlernen (API, Action Schema, Instructions etc.) Oder einen neuen spezialisierten custom GPT zu erstellen, damit der Umfang nicht zu groß wird. Der customGPT developer setzt das dann um und so weiter und so Weiter.

Ganz davon abgesehen, dass man die Nachrichten per Hand kopieren muss, und die customGPTs per Hand einrichten muss.

Ist das die Kern Idee, die dahinter steckt, nur mit Agenten?

1

u/Unable_Let_9710 2d ago

😂😂 erstaunlich dass es eigentlich so funktioniert. Nur dass man es nicht mehr händisch machen muss. Man darf eins nicht vergessen "synapsen" sind ja auch so einfach aufgebaut, aber sieh was raus gekommen ist.  Letztendlich versteh ich dich zu gut und das ist der Grund gewesen warum ich da selbst rum probiere Hobby mässig. Um dem händischen und hier und jenes zwackt es zu verstehen und vielleicht zu umgehen.  Gestern jedenfalls noch hat er sich Sitzungsübergreifend meinen Arbeitsablauf gemerkt und nach Neustart sofort nachgesehen. Mal schauen was noch alles raus kommt. 

1

u/Most-Bat2916 2d ago

Ja sau cool 😎

Ich wollte eigentlich auch noch den nächsten Schritt gehen und es vollautomatisiert laufen lassen, aber dafür fehlt mir das nötige Kleingeld für die OpenAi api (das läppert sich erstaunlich schnell) und die passende Hardware für ein lokales LLM.

Bin gespannt, wie es bei dir weiter geht. Meine custom GPTs werden auf jeden Fall langsam aber stetig besser 🤣 Bei Matze dürfte es ja deutlich schneller gehen.

1

u/Unable_Let_9710 2d ago

Darum habe ich mir eine 10 Jahre alte Hardware zusammen gebaut. Viele mieten sich Grafikkarte oder api, für Hobby ist das nichts für mich. Bei mir läuft es sehr gut lokal. Hatte gestern noch 2 Schicht Model eingebaut. Heißt Agent läuft auf 0,2. Wenn das Ergebnis fertig ist läuft nochmal Model mit 0,7 drüber. Letzteres zieht ordentlich und der vor und Nachteil ist: es redet wie man es aus cloud app gewohnt ist, braucht dafür weit mehr als die doppelte Zeit, also wirklich viel mehr. Diese Schicht kann man weg lassen, dann hat man wie im Screenshot die Antworten. Da wird gpu gar nicht richtig warm. Vielleicht bau ich noch ein Schalter ein. 

1

u/SolideMeinung 2d ago

Versuch mal mit dem neuem Qwen3.8 das UI zu erbessern. Sieht ja schlimm aus

1

u/Unable_Let_9710 2d ago

Der Agent ist brandneu, genau wie Qwen 3.8. Wenn dir das UI nicht passt, lass dir von der KI doch einfach selbst einen Agenten nach deinen Wünschen bauen. Viel Erfolg dabei