IA géante sur PC : PrismML révolutionne les modèles de raisonnement
Découvrez comment PrismML fait tenir des modèles d'IA géants sur un simple PC, sans data center. Performance intacte, révolution en marche.
Il y a une idée reçue qui colle à l’intelligence artificielle depuis ses débuts : plus un modèle est puissant, plus il est énorme, plus il consomme. Cette équation semblait gravée dans le marbre. Et puis une équipe de chercheurs californiens est venue rappeler que les certitudes techniques ont la vie courte.
PrismML et la promesse des modèles miniatures
PrismML n’est pas encore un nom qui fait trembler les géants de la tech. Mais cette jeune pousse mérite votre attention, non pas pour ses levées de fonds spectaculaires — elle a seulement bouclé un tour d’amorçage de 22,25 millions de dollars — mais pour les cerveaux qui la composent et la technologie qu’elle développe. Son pari : les grands modèles de langage capables de raisonner n’ont pas besoin d’être grands pour être performants.
Bonsai 2, ou comment compresser un géant en 5,9 Go
Jeudi dernier, PrismML a dévoilé Bonsai 2 27B, le dernier-né d’une famille de modèles qui compresse Qwen3.8 27B — un modèle open source très utilisé d’Alibaba — jusqu’à 5,9 Go. Concrètement, cela signifie que ce modèle peut tourner sur un PC, et probablement sur un smartphone haut de gamme. C’est une réduction de mémoire de 9 à 10 fois par rapport à l’original.
Ce chiffre mérite qu’on s’y arrête. Parce qu’un modèle compressé qui perd la moitié de ses capacités ne sert à rien. PrismML affirme que Bonsai 2 atteint 98 % des scores agrégés de Qwen sur les benchmarks. C’est mieux que le premier Bonsai, sorti en mars, qui plafonnait à 95 %. Et ce premier modèle a déjà été téléchargé plus de 11 millions de fois.
Qui se cache derrière cette technologie
PrismML a été fondée par un groupe de chercheurs de Caltech et dirigée par Babak Hassibi, professeur dans cette même institution et expert reconnu des technologies de compression. La startup compte aussi Ion Stoica comme conseiller — cofondateur de Databricks et directeur du célèbre Sky Computing Lab de Berkeley, d’où sont sortis des projets comme Letta ou SGLang. Parmi les investisseurs, on trouve Khosla Ventures, Cerberus Capital et Caltech.
Ce n’est pas la seule entreprise à travailler sur la compression des LLM. Multiverse Computing, fondée par un professeur espagnol du Donostia International Physics Center, avance aussi sur ce terrain, avec des moyens bien plus importants. Mais Hassibi défend une différence de taille : sa technologie ne sacrifie pratiquement pas la performance des modèles originaux.
Pourquoi la compression change la donne
Imaginez un instant ce que cela signifie. Un modèle de raisonnement capable de tenir dans votre poche, sans connexion permanente à un serveur distant. Cela ouvre la porte à des usages que l’on réservait jusqu’ici aux infrastructures cloud :
- Une confidentialité renforcée, puisque vos données ne quittent plus votre appareil.
- Une latence réduite, car les calculs se font localement.
- Une autonomie retrouvée pour les zones mal connectées ou les environnements sensibles.
- Un coût d’infrastructure drastiquement revu à la baisse pour les entreprises.
Ce basculement ne concerne pas seulement les développeurs. Il touche quiconque utilise l’IA au quotidien, souvent sans le savoir.
Pourquoi c’est important
Parce que la course à la taille des modèles a un coût écologique, économique et géopolitique que peu d’acteurs peuvent assumer. Si des modèles performants peuvent tourner sur des appareils ordinaires, l’accès à une IA de qualité cesse d’être le privilège de quelques entreprises capables de bâtir des data centers géants. Vous y gagnez en liberté, en maîtrise de vos données et en indépendance technologique.
Conclusion
L’histoire de l’informatique nous a appris une chose : ce qui commence dans les laboratoires finit toujours par se glisser dans nos poches. Les mainframes ont laissé place aux PC, les PC aux smartphones. PrismML et ses concurrents dessinent peut-être la prochaine étape de cette histoire : une intelligence artificielle puissante, discrète, et véritablement personnelle. Ce n’est pas une promesse lointaine — c’est déjà à portée de main.
Points clés à retenir
- PrismML a compressé un modèle de 27 milliards de paramètres à 5,9 Go, soit une réduction de mémoire de 9 à 10 fois.
- Bonsai 2 conserve 98 % des performances benchmarks de son modèle d’origine, une prouesse technique rare.
- La startup est portée par des chercheurs de Caltech et conseillée par Ion Stoica, figure majeure de l’écosystème IA.
- La compression des LLM rend possible une IA locale, privée et accessible sur PC et smartphones.
- Ce mouvement pourrait redistribuer l’accès à l’IA au-delà des seuls géants du cloud.