>_ DevTrendsde

Sprache

Start

Sprachen

Bereiche

Frontend Backend Mobile DevOps AI / ML GameDev Blockchain Embedded Sicherheit
JavaScript

Alle lokalen KI-Modelle in einem Fenster — Ein Blick auf Uncensored Local Studio

Wenn Sie schon einmal versucht haben, einen lokalen KI-Stack einzurichten, wissen Sie wahrscheinlich, wie chaotisch es werden kann. Sie installieren Ollama oder LM Studio für Text, Automatic1111 oder ComfyUI für Bilder, ein separates Whisper-Skript für Spracherkennung und noch ein weiteres Tool für Text-zu-Sprache. Das Ergebnis sind Gigabytes an Python virtual Environments, die sich auf der Festplatte anhäufen, widersprüchliche Ports und VRAM, das von mehreren Prozessen gleichzeitig verbraucht wird.

Neulich bin ich auf das techjarves/Uncensored-Local-Studio-Repository gestoßen. Der Autor hat versucht, das Problem der verstreuten Tools zu lösen, und die wichtigsten KI-Tools in einem einzigen Desktop-Client gebündelt.

Was Uncensored Local Studio kann

Dies ist ein vollständig autonomes Studio, das lokal auf Windows, Linux oder macOS läuft. Das Projekt hat etwa 800 Sterne auf GitHub und verwendet eine offene MIT-Lizenz.

In der Web-Oberfläche werden vier Aufgaben kombiniert:

  1. Bilderzeugung und -bearbeitung über Stable Diffusion (.safetensors, .gguf und .ckpt-Dateien).
  2. Dialog mit Sprachmodellen im GGUF-Format.
  3. Echtzeit-Sprachtranskription vom Mikrofon oder Audiodateien.
  4. Text-zu-Natürliche-Sprache-Konvertierung.

Der Hauptvorteil ist das vollständige Fehlen von Abhängigkeiten von Cloud-APIs, externen Servern, Registrierungen oder Abonnements. Alle Berechnungen finden ausschließlich auf Ihrem Computer statt.

Video ansehen

So funktioniert die Architektur

Aus Entwicklersicht kombiniert das Projekt auf interessante Weise bestehende Hochleistungs-C++-Engines.

Statt des üblichen schweren Python- und PyTorch-Stacks nutzt der Entwickler kompilierte C++-Backends. Die Bilderzeugung wird von stable-diffusion.cpp übernommen, der Chat mit Textmodellen von llama.cpp, die Sprachtranskription von whisper.cpp und die Text-zu-Sprache von kokoro-js mit dem Kokoro-82M neuronalen Netzwerk.

Das Frontend ist in Vite und React geschrieben. Der Webserver und der Backend-Lebenszyklusmanager laufen auf Node.js. Benutzer müssen also keine Zeit mit der Einrichtung einer Umgebung verbringen – das Startskript lädt eine portable Version von Node.js direkt in das App-Verzeichnis herunter. Systemvariablen bleiben unberührt.

Die VRAM-Verwaltung wird interessant gelöst. Chat und Bilderzeuger arbeiten nach dem Prinzip des gegenseitigen Ausschlusses. Beim Wechseln der Tabs gibt die aktive Engine den Videospeicher frei, sodass die App auch auf GPUs mit 6–8 GB VRAM vernünftig läuft.

Hardwarebeschleunigung und Arbeit mit Modellen

Die App kann automatisch die installierte Hardware erkennen und wählt das optimale Backend:

  • NVIDIA: Es werden CUDA-Optimierungen verwendet.
  • AMD und Intel Arc: Berechnungen laufen über die Vulkan-API oder ROCm.
  • Apple Silicon: Es wird die Metal-Engine verwendet (Intel Mac-Prozessoren werden nicht unterstützt).
  • Intel Core Ultra: Es gibt eine experimentelle Modellausführung auf integrierten NPUs über OpenVINO.

Für Windows besteht der Start aus dem Ausführen von windows.bat. Auf Linux und macOS werden die Befehlsskripte linux.sh und mac.sh verwendet.

So sieht die Verzeichnisstruktur der App aus:

Uncensored-AI-Studio/
├── windows.bat                # Скрипт запуска для Windows
├── linux.sh                   # Скрипт запуска для Linux
├── mac.sh                     # Скрипт запуска для macOS
├── scripts/                   # Конфигураторы бэкендов и веб-сервера
└── app/
    ├── frontend/              # Исходный код интерфейса (Vite + React)
    ├── models/                # Модели Stable Diffusion (.safetensors, .ckpt)
    ├── llm-models/            # Текстовые модели (.gguf)
    ├── speech-models/         # Модели Whisper (.bin)
    └── outputs/               # Сохраненные генерации и метаданные JSON

Das eingebaute Modellmanagement vereinfacht Downloads: Sie können einen direkten Hugging Face-Link einfügen, und die Datei wird direkt in den richtigen Ordner heruntergeladen. Ab Werk bietet es einen Schnellstart mit leichtgewichtigen Modellen wie Qwen2.5 Coder für Chat oder DreamShaper 8 für die Bilderzeugung.

Die Benutzeroberfläche zeigt einen eingebauten Ressourcenmonitor, der die CPU-Last, den System-RAM sowie die GPU- und VRAM-Nutzung in Echtzeit anzeigt.

Einschränkungen und Fallstricke

Kompaktheit hat einen Nachteil. Wenn Sie an spezialisierte Tools wie ComfyUI mit seinen Node-Graphen, ControlNet, LoRA oder komplexen Pipelines für Flux und Hunyuan gewöhnt sind, wird dieses Projekt sie nicht ersetzen. Hier werden nur eigenständige SD-1.5- und SDXL-Checkpoints unterstützt. Zusätzliche VAE-Dateien oder Text-Encoder werden nicht separat geladen.

Der zweite Punkt betrifft Linux-Systeme. Vorkompilierte Backend-Binärdateien sind für relativ aktuelle Distributionen mit glibc 2.38 oder neuer compiliert (zum Beispiel Ubuntu 24.04). Wenn Sie auf älteren Distributionen wie Ubuntu 22.04 laufen, wirft das Backend einen dynamischen Linker-Fehler. Sie müssen entweder das OS aktualisieren oder Binärdateien aus dem Quellcode mit dem beiliegenden Skript scripts/build/build_from_source.sh kompilieren.

Für wen ist dieses Projekt geeignet

Uncensored Local Studio ist ein großartiger Fund für alle, die einen universellen persönlichen Assistenten und Bildgenerator auf einem PC brauchen, ohne sich mit der Einrichtung von Python-Umgebungen herumschlagen zu müssen.

Für Entwickler ist das Projekt als anschauliches Beispiel für die Integration von llama.cpp und stable-diffusion.cpp in eine einheitliche Node.js/React-Oberfläche interessant. Der Code ist offen, und die Architektur zeigt, wie man reaktionsfähige neuronale Netzwerkanwendungen ohne gigabyteschwere Abhängigkeiten bauen kann.

Ähnliche Projekte