>_ DevTrendsfr

Langue

Accueil

Langages

Sections

Frontend Backend Mobile DevOps AI / ML GameDev Blockchain Embarqué Sécurité
JavaScript

Tous les modèles IA locaux dans une seule fenêtre — Un aperçu d'Uncensored Local Studio

Si vous avez déjà essayé de configurer une pile IA locale, vous savez probablement à quel point cela peut devenir chaotique. Vous installez Ollama ou LM Studio pour le texte, Automatic1111 ou ComfyUI pour les images, un script Whisper séparé pour la reconnaissance vocale, et encore un autre utilitaire pour la synthèse vocale. Le résultat : des gigaoctets d'environnements virtuels Python qui s'accumulent sur le disque, des ports conflictuels, et la VRAM dévorée par plusieurs processus simultanément.

Récemment, je suis tombé sur le dépôt techjarves/Uncensored-Local-Studio. L'auteur a tenté de résoudre le problème des utilitaires dispersés en regroupant les principaux outils d'IA dans un seul client de bureau.

Ce que peut faire Uncensored Local Studio

Il s'agit d'un studio entièrement autonome qui s'exécute localement sur Windows, Linux ou macOS. Le projet compte environ 800 étoiles sur GitHub et utilise une licence MIT ouverte.

Dans l'interface web, quatre tâches sont combinées :

  1. Génération et édition d'images via Stable Diffusion (fichiers .safetensors, .gguf et .ckpt).
  2. Dialogue avec des modèles de langage au format GGUF.
  3. Transcription vocale en temps réel depuis le microphone ou les fichiers audio.
  4. Conversion de texte en voix naturelle.

L'avantage principal est l'absence totale de dépendance aux API cloud, aux serveurs externes, aux inscriptions ou aux abonnements. Tous les calculs s'effectuent exclusivement sur votre ordinateur.

Voir la vidéo

Fonctionnement de l'architecture

D'un point de vue développement, le projet combine de manière intéressante des moteurs C++ haute performance existants.

Au lieu de la pile Python et PyTorch habituelle et lourde, le développeur a utilisé des backends C++ compilés. La génération d'images est assurée par stable-diffusion.cpp, le chat avec les modèles textuels par llama.cpp, la transcription vocale par whisper.cpp, et la synthèse vocale par kokoro-js avec le réseau neuronal Kokoro-82M.

Le frontend est écrit en Vite et React. Le serveur web et le gestionnaire de cycle de vie du backend fonctionnent sur Node.js. Ainsi, les utilisateurs n'ont pas à perdre de temps à configurer un environnement : le script de démarrage télécharge une version portable de Node.js directement dans le répertoire de l'application. Les variables système restent intactes.

La gestion de la VRAM est résolue de manière intéressante. Le chat et le générateur d'images fonctionnent sur un principe d'exclusion mutuelle. Lors du changement d'onglets, le moteur actif libère la mémoire vidéo, permettant à l'application de fonctionner correctement sur des GPU avec 6 à 8 Go de VRAM.

Accélération matérielle et travail avec les modèles

L'application peut détecter automatiquement le matériel installé et sélectionne le backend optimal :

  • NVIDIA : les optimisations CUDA sont utilisées.
  • AMD et Intel Arc : les calculs s'exécutent via l'API Vulkan ou ROCm.
  • Apple Silicon : le moteur Metal est utilisé (les processeurs Intel Mac ne sont pas pris en charge).
  • Intel Core Ultra : il existe un mode expérimental fonctionnant sur les NPU intégrés via OpenVINO.

Pour Windows, le lancement se résume à exécuter windows.bat. Sur Linux et macOS, les scripts de commande linux.sh et mac.sh sont utilisés.

Voici à quoi ressemble la structure du répertoire de l'application :

Uncensored-AI-Studio/
├── windows.bat                # Скрипт запуска для Windows
├── linux.sh                   # Скрипт запуска для Linux
├── mac.sh                     # Скрипт запуска для macOS
├── scripts/                   # Конфигураторы бэкендов и веб-сервера
└── app/
    ├── frontend/              # Исходный код интерфейса (Vite + React)
    ├── models/                # Модели Stable Diffusion (.safetensors, .ckpt)
    ├── llm-models/            # Текстовые модели (.gguf)
    ├── speech-models/         # Модели Whisper (.bin)
    └── outputs/               # Сохраненные генерации и метаданные JSON

Le gestionnaire de modèles intégré simplifie le téléchargement : vous pouvez coller un lien direct Hugging Face, et le fichier se télécharge directement dans le bon dossier. Dès le départ, il propose un démarrage rapide avec des modèles légers comme Qwen2.5 Coder pour le chat ou DreamShaper 8 pour la génération d'images.

L'interface affiche un moniteur de ressources intégré montrant la charge CPU, la RAM système, le GPU et l'utilisation de la VRAM en temps réel.

Limitations et pièges

La compacité a un revers. Si vous êtes habitué à des outils spécialisés comme ComfyUI avec leurs graphes de nœuds, ControlNet, LoRA ou des pipelines complexes pour Flux et Hunyuan, ce projet ne les remplacera pas. Seuls les checkpoints SD 1.5 et SDXL autonomes sont pris en charge ici. Les fichiers VAE supplémentaires ou les encodeurs textuels ne sont pas chargés séparément.

Le deuxième point concerne les systèmes Linux. Les binaires de backend précompilés sont compilés pour des distributions relativement récentes avec glibc 2.38 ou plus récent (par exemple, Ubuntu 24.04). Si vous exécutez sur des distributions plus anciennes comme Ubuntu 22.04, le backend déclenchera une erreur de lieur dynamique. Vous devrez soit mettre à jour l'OS, soit compiler les binaires depuis les sources en utilisant le script inclus scripts/build/build_from_source.sh.

À qui ce projet sera utile

Uncensored Local Studio est une trouvaille pour tous ceux qui ont besoin d'un assistant personnel universel et d'un générateur d'images sur un seul PC sans les tracas de configuration des environnements Python.

Pour les développeurs, le projet est intéressant comme exemple clair d'intégration de llama.cpp et stable-diffusion.cpp dans une interface Node.js/React unifiée. Le code est ouvert et l'architecture démontre comment construire des applications de réseaux neuronaux réactives sans des dépendances de plusieurs gigaoctets.

Projets similaires