>_ DevTrendses

Idioma

Inicio

Lenguajes

Secciones

Frontend Backend Móvil DevOps AI / ML GameDev Blockchain Embebidos Seguridad
JavaScript

Todos los Modelos de IA Locales en Una Ventana — Un Vistazo a Uncensored Local Studio

Si alguna vez has intentado configurar un stack de IA local, probablemente sabes lo desordenado que puede resultar. Instalas Ollama o LM Studio para texto, Automatic1111 o ComfyUI para imágenes, un script separado de Whisper para reconocimiento de voz, y otra utilidad más para texto a voz. El resultado es gigabytes de entornos virtuales de Python acumulándose en el disco, puertos en conflicto, y la VRAM siendo consumida por múltiples procesos al mismo tiempo.

Hace poco me encontré con el repositorio techjarves/Uncensored-Local-Studio. El autor intentó resolver el problema de las utilidades dispersas y agrupó las principales herramientas de IA en un único cliente de escritorio.

Qué puede hacer Uncensored Local Studio

Este es un estudio completamente autónomo que se ejecuta localmente en Windows, Linux o macOS. El proyecto tiene alrededor de 800 estrellas en GitHub y utiliza una licencia MIT de código abierto.

Dentro de la interfaz web, se combinan cuatro tareas:

  1. Generación y edición de imágenes mediante Stable Diffusion (archivos .safetensors, .gguf y .ckpt).
  2. Diálogo con modelos de lenguaje en formato GGUF.
  3. Transcripción de voz en tiempo real desde el micrófono o archivos de audio.
  4. Conversión de texto a voz natural.

La principal ventaja es la ausencia total de dependencia de APIs en la nube, servidores externos, registros o suscripciones. Todos los cálculos ocurren exclusivamente en tu computadora.

Ver video

Cómo funciona la arquitectura

Desde una perspectiva de desarrollo, el proyecto combina de manera interesante motores C++ de alto rendimiento existentes.

En lugar de la pila habitual de Python y PyTorch, el desarrollador utilizó backends C++ compilados. La generación de imágenes es manejada por stable-diffusion.cpp, el chat con modelos de texto por llama.cpp, la transcripción de voz por whisper.cpp, y el texto a voz por kokoro-js con la red neuronal Kokoro-82M.

El frontend está escrito en Vite y React. El servidor web y el gestor del ciclo de vida del backend se ejecutan en Node.js. Así que los usuarios no tienen que perder tiempo configurando un entorno, el script de inicio descarga una versión portátil de Node.js directamente en el directorio de la aplicación. Las variables del sistema permanecen intactas.

La gestión de la VRAM está resuelta de manera interesante. El chat y el generador de imágenes funcionan bajo un principio de exclusión mutua. Al cambiar de pestañas, el motor activo libera la memoria de video, permitiendo que la aplicación funcione adecuadamente en GPUs con 6–8 GB de VRAM.

Aceleración por hardware y trabajo con modelos

La aplicación puede detectar automáticamente el hardware instalado y selecciona el backend óptimo:

  • NVIDIA: se utilizan optimizaciones de CUDA.
  • AMD e Intel Arc: los cálculos se ejecutan a través de la API Vulkan o ROCm.
  • Apple Silicon: se utiliza el motor Metal (los procesadores Intel Mac no son compatibles).
  • Intel Core Ultra: existe un modelo experimental que se ejecuta en NPUs integradas a través de OpenVINO.

Para Windows, el lanzamiento se reduce a ejecutar windows.bat. En Linux y macOS, se utilizan los scripts de comandos linux.sh y mac.sh.

Así es como se ve la estructura del directorio de la aplicación:

Uncensored-AI-Studio/
├── windows.bat                # Скрипт запуска для Windows
├── linux.sh                   # Скрипт запуска для Linux
├── mac.sh                     # Скрипт запуска для macOS
├── scripts/                   # Конфигураторы бэкендов и веб-сервера
└── app/
    ├── frontend/              # Исходный код интерфейса (Vite + React)
    ├── models/                # Модели Stable Diffusion (.safetensors, .ckpt)
    ├── llm-models/            # Текстовые модели (.gguf)
    ├── speech-models/         # Модели Whisper (.bin)
    └── outputs/               # Сохраненные генерации и метаданные JSON

El gestor de modelos integrado simplifica la descarga: puedes pegar un enlace directo de Hugging Face, y el archivo se descarga directamente a la carpeta correcta. Desde el primer momento, ofrece un inicio rápido con modelos ligeros como Qwen2.5 Coder para chat o DreamShaper 8 para generación de arte.

La interfaz muestra un monitor de recursos integrado que muestra la carga de CPU, la RAM del sistema, la GPU y el uso de VRAM en tiempo real.

Limitaciones y consideraciones

La compacidad tiene un inconveniente. Si estás acostumbrado a herramientas especializadas como ComfyUI con sus grafos de nodos, ControlNet, LoRA, o pipelines complejos para Flux y Hunyuan, este proyecto no los reemplazará. Aquí solo se admiten checkpoints independientes de SD 1.5 y SDXL. Los archivos VAE adicionales o codificadores de texto no se cargan por separado.

El segundo punto concierne a los sistemas Linux. Los binarios de backend precompilados están compilados para distribuciones relativamente recientes con glibc 2.38 o superior (por ejemplo, Ubuntu 24.04). Si se ejecuta en distribuciones más antiguas como Ubuntu 22.04, el backend arrojará un error de enlazador dinámico. Necesitarás actualizar el sistema operativo o compilar los binarios desde el código fuente usando el script incluido scripts/build/build_from_source.sh.

A quién le será útil este proyecto

Uncensored Local Studio es un gran hallazgo para cualquiera que necesite un asistente personal universal y generador de imágenes en una sola PC sin la molestia de configurar entornos de Python.

Para los desarrolladores, el proyecto es interesante como un ejemplo claro de integración de llama.cpp y stable-diffusion.cpp en una interfaz unificada de Node.js/React. El código es abierto, y la arquitectura demuestra cómo construir aplicaciones de redes neuronales responsivas sin dependencias de tamaño gigabyte.

Proyectos relacionados