PrismML, jeune pousse issue de la communauté de recherche de Caltech, a récemment présenté Bonsai 2 27B, la dernière version d’une série de modèles de langage conçus pour être extrêmement compacts. En compressant le modèle open‑source Qwen 3.8 27B d’Alibaba de 27 Go à seulement 5,9 Go, l’entreprise affirme rendre l’intelligence artificielle capable de raisonner disponible sur des ordinateurs personnels et même sur des smartphones haut de gamme.
Une approche de compression révolutionnaire
Le cœur de la technologie de PrismML repose sur la réduction des « weights », les paramètres qui stockent les connaissances acquises par un modèle pendant son entraînement. Traditionnellement, chaque poids occupe 16 bits. PrismML adopte une méthode dite « ternary », limitant chaque poids à trois valeurs possibles : +1, –1 ou 0. Cette simplification diminue drastiquement la quantité de données à stocker, tout en préservant l’essentiel des capacités du modèle.
Le processus de ternarisation, combiné à des algorithmes d’optimisation spécifiques, permet d’obtenir une réduction de taille de l’ordre de 9 à 10 fois sans sacrifier de manière significative la précision. Selon les tests internes, Bonsai 2 atteint 98 % des scores agrégés du modèle Qwen original, contre 95 % pour la première version de Bonsai lancée quelques mois auparavant.
Bonsai 2 : performances et taille réduite
Le nouveau modèle, nommé Bonsai 2 27B, conserve 27 milliards de paramètres, mais grâce à la compression ternary, il ne nécessite que 5,9 Go de mémoire. Cette taille le rend compatible avec la plupart des PC modernes et ouvre la porte à une utilisation sur des smartphones puissants, où la contrainte de mémoire est souvent un obstacle majeur.
Les performances de Bonsai 2 ont été évaluées sur un large panel de benchmarks publics. Le modèle a ainsi reproduit 98 % des scores obtenus par Qwen 3.8 27B, montrant que la perte de précision est marginale. Cette amélioration par rapport à la version précédente (95 %) illustre la progression rapide de la technique de compression de PrismML.
Impacts pour les utilisateurs et le marché
La capacité à exécuter des modèles de langage avancés directement sur l’appareil offre plusieurs avantages concrets :
- Confidentialité renforcée : les données restent locales, évitant les transferts vers le cloud.
- Réduction des coûts : aucune dépendance à une infrastructure serveur coûteuse.
- Accessibilité accrue : les utilisateurs peuvent profiter d’une IA puissante sans matériel spécialisé.
Ces atouts sont particulièrement pertinents pour les développeurs d’applications mobiles, les entreprises soucieuses de la protection des données et les consommateurs recherchant une expérience fluide sans connexion permanente.
Perspectives et défis futurs
PrismML ne s’arrête pas à Bonsai 2. Le fondateur et directeur, le professeur Babak Hassibi, indique que les prochains modèles viseront des architectures de plusieurs centaines de milliards de paramètres. L’objectif est de démontrer que, à plus grande échelle, la compression peut être encore plus efficace, car les modèles plus volumineux offrent davantage de marge de manœuvre pour réduire les poids sans perdre d’intelligence.
Le principal défi reste la quête d’une parité parfaite avec les modèles non compressés. Bien que la perte de 2 % de performance soit jugée acceptable dans de nombreux scénarios, les applications critiques pourraient nécessiter une précision maximale. De plus, l’efficacité du modèle dépend également du logiciel d’inférence qui l’accompagne, soulignant l’importance d’un écosystème complet autour de la compression.
Parmi les soutiens de PrismML figurent Khosla Ventures, Cerberus Capital et le laboratoire Sky Computing de l’Université de Californie Berkeley, dirigé par Ion Stoica, co‑fondateur de Databricks. Cette combinaison de financement et d’expertise académique renforce la crédibilité de la startup dans un secteur où plusieurs acteurs, comme Multiverse Computing, poursuivent également des solutions de compression.
En résumé, la sortie de Bonsai 2 marque une étape importante vers la démocratisation de l’intelligence artificielle. En rendant les modèles de langage performants suffisamment légers pour être exécutés localement, PrismML ouvre la voie à une nouvelle génération d’applications où l’IA devient une fonctionnalité native de chaque appareil.