Cómo ejecutar una red neuronal de 27 mil millones de parámetros en un iPhone normal o PC de casa
Hace poco me encontré pensando: nos hemos acostumbrado a la idea de que ejecutar LLMs serios (Large Language Models) requiere racks de servidores con A100s o al menos RTX 4090 de gama alta. ¿Pero qué pasa si te digo que un modelo de nivel 27B ahora puede " comprimirse" en la RAM de un smartphone normal o portátil sin gráficos dedicados? El proyecto Bonsai-demo del equipo Prismml hace exactamente esto, usando la magia de la cuantización de 1 bit y ternaria.
Cuál es el Núcleo del Proyecto
El problema principal de los modelos grandes es su "codicia". Un modelo 27B estándar en formato de 16 bits pesa aproximadamente 50 GB. Incluso la compresión popular de 4 bits (Q4_K_M) requiere 16-17 GB de memoria de video solo para los pesos. Bonsai-demo ofrece pasar a un nivel extremo: modelos de 1 bit y ternarios (1.58-2 bits).
Como resultado, Bonsai-27B en configuración de 1 bit ocupa solo 3.5 GB. Esto es comparable al tamaño de un juego móvil promedio. Los desarrolladores afirman que el modelo conserva la capacidad de razonar, ver imágenes e incluso llamar herramientas.
Qué Puede Hacer Este "Árbol"
Revisé el repositorio y destaco algunas cosas que realmente destacan.
Visión y Procesamiento de Documentos
Los modelos de la serie 27B aquí no son solo basados en texto. Son sistemas multimodales. Puedes alimentarlos con capturas de pantalla, fotos o archivos PDF. En su interior, se utiliza un proyector especial que convierte los datos visuales en tokens que el modelo puede entender. Para un sistema local ejecutándose en CPU, esto parece magia.
Comportamiento Similar a Agentes y MCP
El demo incluye un cliente completo para el MCP (Model Context Protocol). Si te lo perdiste: este es un nuevo estándar de Anthropic que permite al modelo conectarse a datos externos. Bonsai-demo ya tiene herramientas configuradas de serie para trabajar con DeepWiki y Hugging Face. Así que el modelo no solo alucina—va a internet por los hechos.
Modo "Pensamiento"
Los modelos 27B tienen una función de razonamiento chain-of-thought. En la interfaz, puedes establecer un presupuesto de pensamiento: desde una respuesta rápida hasta un análisis profundo de más de 8,000 tokens. Si tu hardware es débil, es mejor configurarlo en Bajo, de lo contrario tendrás que esperar mucho mientras el modelo "da vueltas" a sus pensamientos en segundo plano.
Ahorro Extremo de Contexto
Por lo general, un contexto de 100,000 tokens consume gigabytes de memoria. Aquí, los autores añadieron soporte experimental para KV-cache de 4 bits. Esto reduce el consumo de memoria para conversaciones largas en 3.5 veces. En números: 100k tokens ocupan aproximadamente 1.8 GB en lugar de los habituales 6.3 GB.
Detalles Técnicos
El proyecto se basa en un fork de llama.cpp y el framework MLX para Apple Silicon. Curiosamente, el soporte de cuantización de 1 bit (Q1_0) ya ha comenzado a fluir hacia el upstream principal de llama.cpp. Con los pesos ternarios (Q2_0), la situación es ligeramente más compleja: actualmente están en proceso de migración, por lo que el proyecto incluye sus propios binarios precompilados para diferentes plataformas.
Si tienes un Mac con chip M, el script de compilación descargará MLX y compilará todos los componentes directamente para tu arquitectura. Para Windows y Linux, se proporcionan scripts con autodetección de CUDA y Vulkan.
Cómo Probarlo
Los desarrolladores hicieron el proceso lo más "sin interrupciones" posible. No necesitas descargar manualmente los pesos de Hugging Face ni configurar el entorno.
Para macOS o Linux, solo tres líneas son suficientes:
git clone https://github.com/PrismML-Eng/Bonsai-demo.git
cd Bonsai-demo
./setup.sh
El script instalará automáticamente el gestor de paquetes uv, creará un entorno virtual, descargará el modelo requerido (Ternary-Bonsai-27B por defecto) y preparará los binarios.
Después de eso, puedes iniciar un servidor local:
./scripts/start_llama_server.sh
Y abrir localhost:8080 en tu navegador. Habrá un chat familiar donde podrás probar tanto la visión como la velocidad de generación.
¿Vale la Pena Probarlo
Bonsai-demo no se trata de "matar a GPT-4", sino de accesibilidad. Si necesitas ejecutar un asistente inteligente en un portátil de oficina sin tarjeta gráfica o incrustar un LLM en una aplicación móvil, este proyecto proporciona una base lista para usar.
Por supuesto, los modelos de 1 bit son más limitados que sus contrapartes de tamaño completo. Pueden cometer más errores en tareas lógicas complejas. Pero para automatización básica, clasificación de texto o chatbots simples con un contexto de 256k tokens—esta es una de las soluciones más eficientes disponibles ahora mismo.
La principal ventaja del repositorio es su naturaleza "empaquetada". No necesitas ser un especialista en cuantización para ejecutar un modelo ternario. Todos los trucos sucios con compilación y ajuste de parámetros ya están ocultos dentro de los scripts bash.
Proyectos relacionados