>_ DevTrendspt

Idioma

Início

Linguagens

Seções

Frontend Backend Mobile DevOps AI / ML GameDev Blockchain Embarcados Segurança
Shell

Como Executar uma Rede Neural de 27 Bilhões de Parâmetros em um iPhone Comum ou PC de Casa

Recentemente me peguei pensando: já nos acostumamos com a ideia de que executar LLMs sérios (Large Language Models) requer racks de servidores com A100s ou pelo menos RTX 4090s de última geração. Mas e se eu te dissesse que um modelo de nível 27B agora pode ser "espremido" na RAM de um smartphone comum ou laptop sem gráficos dedicados? O projeto Bonsai-demo da equipe Prismml faz exatamente isso, usando a magia da quantização de 1 bit e ternária.

Bonsai

Qual é o核 do Projeto

O principal problema com modelos grandes é a sua "ganância". Um modelo 27B padrão em formato de 16 bits pesa cerca de 50 GB. Mesmo a compressão popular de 4 bits (Q4_K_M) requer 16-17 GB de memória de vídeo apenas para os pesos. O Bonsai-demo oferece ir a um nível extremo: modelos de 1 bit e ternários (1,58-2 bits).

Como resultado, o Bonsai-27B em configuração de 1 bit ocupa apenas 3,5 GB. Isso é comparável ao tamanho de um jogo mobile médio. Os desenvolvedores afirmam que o modelo mantém a capacidade de raciocinar, ver imagens e até chamar ferramentas.

O Que Essa "Árvore" Pode Fazer

Eu vasculhei o repositório e destaquei algumas coisas que realmente se destacam.

Visão e Processamento de Documentos

Os modelos da série 27B aqui não são apenas baseados em texto. Esses são sistemas multimodais. Você pode alimentá-los com capturas de tela, fotos ou arquivos PDF. Por dentro, um projetor especial é usado para converter dados visuais em tokens que o modelo consegue entender. Para um sistema local rodando em CPU, isso parece magia.

Comportamento Agente e MCP

O demo inclui um cliente completo para o MCP (Model Context Protocol). Se você perdeu: esse é um novo padrão da Anthropic que permite ao modelo se conectar a dados externos. O Bonsai-demo já tem ferramentas configuradas out-of-the-box para trabalhar com DeepWiki e Hugging Face. Então o modelo não apenas alucina—ele vai à internet buscar fatos.

Modo "Pensamento"

Os modelos 27B têm um recurso de raciocínio chain-of-thought. Na interface, você pode definir um orçamento de pensamento: desde uma resposta rápida até análise profunda de 8.000+ tokens. Se seu hardware for fraco, é melhor definir para Low, caso contrário você terá que esperar muito enquanto o modelo "gira" seus pensamentos em segundo plano.

Economia Extrema de Contexto

Normalmente, um contexto de 100.000 tokens consome gigabytes de memória. Aqui, os autores adicionaram suporte experimental para KV-cache de 4 bits. Isso reduz o consumo de memória para conversas longas em 3,5 vezes. Em números: 100k tokens ocupam cerca de 1,8 GB em vez dos habituais 6,3 GB.

Detalhes Técnicos

O projeto depende de um fork do llama.cpp e do framework MLX para Apple Silicon. Curiosamente, o suporte à quantização de 1 bit (Q1_0) já começou a fluir para o upstream principal do llama.cpp. Com pesos ternários (Q2_0), a situação é um pouco mais complexa: eles estão atualmente em processo de migração, então o projeto envia seus próprios binários pré-compilados para diferentes plataformas.

Se você tiver um Mac com chip M, o script de build vai puxar o MLX e compilar todos os componentes diretamente para sua arquitetura. Para Windows e Linux, são fornecidos scripts com auto-detecção de CUDA e Vulkan.

Como Experimentar

Os desenvolvedores tornaram o processo o mais "seamless" possível. Não é necessário baixar manualmente os pesos do Hugging Face ou configurar o ambiente.

Para macOS ou Linux, apenas três linhas são suficientes:

git clone https://github.com/PrismML-Eng/Bonsai-demo.git
cd Bonsai-demo
./setup.sh

O script vai automaticamente instalar o gerenciador de pacotes uv, criar um ambiente virtual, baixar o modelo necessário (Ternary-Bonsai-27B por padrão) e preparar os binários.

Depois disso, você pode iniciar um servidor local:

./scripts/start_llama_server.sh

E abrir localhost:8080 no seu navegador. Haverá um chat familiar onde você pode testar tanto a visão quanto a velocidade de geração.

Vale a Pena Experimentar

O Bonsai-demo não se trata de "matar o GPT-4", mas de acessibilidade. Se você precisa executar um assistente inteligente em um laptop de escritório sem placa gráfica ou embedar um LLM em um aplicativo mobile, este projeto fornece uma base pronta.

Claro, modelos de 1 bit são mais burros que seus counterparts de tamanho completo. Eles podem cometer mais erros em tarefas lógicas complexas. Mas para automação básica, classificação de texto ou chatbots simples com um contexto de 256k tokens—esta é uma das soluções mais eficientes disponíveis agora.

A principal vantagem do repositório é sua natureza "empacotada". Você não precisa ser um especialista em quantização para executar um modelo ternário. Todos os hacks sujos com compilação e ajuste de parâmetros já estão escondidos dentro dos scripts bash.

Projetos relacionados