>_ DevTrendsfr

Langue

Accueil

Langages

Sections

Frontend Backend Mobile DevOps AI / ML GameDev Blockchain Embarqué Sécurité
Shell

Comment exécuter un réseau de neurones de 27 milliards de paramètres sur un iPhone ordinaire ou un PC domestique

Récemment, je me suis surpris à penser : nous nous sommes habitués à l'idée qu'exécuter des LLMs sérieux (Large Language Models) nécessite des racks de serveurs avec des A100 ou au moins des RTX 4090 haut de gamme. Mais que diriez-vous si je vous disais qu'un modèle de niveau 27B peut maintenant être « compressé » dans la RAM d'un smartphone ordinaire ou d'un ordinateur portable sans graphics discrète ? Le projet Bonsai-demo de l'équipe Prismml fait exactement cela, en utilisant la magie de la quantification 1-bit et ternaire.

Bonsai

Quel est le cœur du projet

Le problème principal des grands modèles est leur « gourmandise ». Un modèle 27B standard au format 16 bits pèse environ 50 Go. Même la compression 4 bits populaire (Q4_K_M) nécessite 16-17 Go de mémoire vidéo juste pour les poids. Bonsai-demo propose d'aller à un niveau extrême : les modèles 1-bit et ternaires (1,58-2 bits).

Résultat : Bonsai-27B en configuration 1-bit ne pèse que 3,5 Go. C'est comparable à la taille d'un jeu mobile moyen. Les développeurs affirment que le modèle conserve la capacité de raisonner, de voir des images, et même d'appeler des outils.

Ce que cet « arbre » peut faire

J'ai exploré le dépôt et j'ai mis en avant quelques éléments qui sortent vraiment du lot.

Vision et traitement de documents

Les modèles de la série 27B ici ne sont pas seulement textuels. Ce sont des systèmes multimodaux. Vous pouvez leur fournir des captures d'écran, des photos ou des fichiers PDF. À l'intérieur, un projecteur spécial est utilisé pour convertir les données visuelles en tokens que le modèle peut comprendre. Pour un système local fonctionnant sur CPU, cela ressemble à de la magie.

Comportement de type agent et MCP

La démo inclut un client complet pour le MCP (Model Context Protocol). Si vous l'avez manqué : c'est une nouvelle norme d'Anthropic qui permet au modèle de se connecter à des données externes. Bonsai-demo dispose déjà d'outils prêts à l'emploi configurés pour travailler avec DeepWiki et Hugging Face. Ainsi, le modèle ne se contente pas d'halluciner — il va sur internet chercher des faits.

Mode « réflexion »

Les modèles 27B disposent d'une fonctionnalité de raisonnement par chaîne de pensée. Dans l'interface, vous pouvez définir un budget de réflexion : d'une réponse rapide à une analyse approfondie de plus de 8 000 tokens. Si votre matériel est faible, mieux vaut le mettre sur Bas, sinon vous devrez attendre longtemps pendant que le modèle « fait tourner » ses pensées en arrière-plan.

Économies extrêmes de contexte

D'habitude, un contexte de 100 000 tokens consomme des gigaoctets de mémoire. Ici, les auteurs ont ajouté un support expérimental pour le KV-cache 4 bits. Cela réduit la consommation de mémoire pour les longues conversations de 3,5 fois. En chiffres : 100k tokens prennent environ 1,8 Go au lieu des 6,3 Go habituels.

Détails techniques

Le projet repose sur un fork de llama.cpp et le framework MLX pour Apple Silicon. Fait intéressant : le support de la quantification 1-bit (Q1_0) a déjà commencé à être intégré dans la branche principale de llama.cpp. Avec les poids ternaires (Q2_0), la situation est légèrement plus complexe : ils sont actuellement en cours de migration, donc le projet fournit ses propres binaires précompilés pour différentes plateformes.

Si vous avez un Mac avec une puce M, le script de build récupérera MLX et compilera tous les composants directement pour votre architecture. Pour Windows et Linux, des scripts avec auto-détection de CUDA et Vulkan sont fournis.

Comment l'essayer

Les développeurs ont rendu le processus aussi « transparent » que possible. Pas besoin de télécharger manuellement les poids depuis Hugging Face ou de configurer l'environnement.

Pour macOS ou Linux, trois lignes suffisent :

git clone https://github.com/PrismML-Eng/Bonsai-demo.git
cd Bonsai-demo
./setup.sh

Le script installera automatiquement le gestionnaire de paquets uv, créera un environnement virtuel, téléchargera le modèle requis (Ternary-Bonsai-27B par défaut), et préparera les binaires.

Après cela, vous pouvez démarrer un serveur local :

./scripts/start_llama_server.sh

Et ouvrir localhost:8080 dans votre navigateur. Vous trouverez un chat familier où vous pourrez tester à la fois la vision et la vitesse de génération.

Cela vaut-il la peine d'essayer

Bonsai-demo n'est pas une question de « tuer GPT-4 », mais d'accessibilité. Si vous avez besoin d'exécuter un assistant intelligent sur un ordinateur de bureau sans carte graphique ou d'intégrer un LLM dans une application mobile, ce projet fournit une base prête à l'emploi.

Bien sûr, les modèles 1-bit sont moins intelligents que leurs homologues de taille normale. Ils peuvent faire plus d'erreurs dans des tâches logiques complexes. Mais pour l'automatisation de base, la classification de texte, ou de simples chatbots avec un contexte de 256k tokens — c'est l'une des solutions les plus efficaces disponibles actuellement.

Le principal avantage du dépôt est sa nature « packagée ». Vous n'avez pas besoin d'être un spécialiste de la quantification pour exécuter un modèle ternaire. Tous les bidouillages sales avec la compilation et le paramétrage sont déjà cachés dans les scripts bash.

Projets similaires