MiMo-V2.6-Pro : le modèle ouvert Xiaomi qui atteint 46
Xiaomi frappe fort avec MiMo-V2.6-Pro, un modèle ouvert de 1000 milliards de paramètres qui atteint le score 46. Découvrez ce qui se cache derrière.
Un score de 46 sur l'Artificial Analysis Intelligence Index. Sur 115 modèles passés au crible, cela place MiMo-V2.6-Pro tout en haut du classement. Xiaomi vient de publier un modèle à poids ouverts qui ne se contente pas de participer : il redéfinit ce qu'on peut attendre d'un modèle accessible à tous.
Si vous suivez l'actualité de l'IA de près, vous savez que les modèles ouverts comblent leur retard à une vitesse vertigineuse. MiMo-V2.6-Pro en est la preuve la plus récente, et peut-être la plus spectaculaire.
Un score qui dépasse largement la moyenne
Pour bien mesurer la performance, il faut la comparer. La médiane des modèles comparables se situe à 18 sur l'indice d'intelligence. Avec 46, MiMo-V2.6-Pro se place donc bien au-dessus de la moyenne, et truste la première place du classement général selon l'analyse d'Artificial Analysis .
Ce chiffre signifie concrètement que le modèle résout mieux les tâches de raisonnement, de codage et de compréhension que la grande majorité de ses concurrents. C'est d'autant plus remarquable qu'il s'agit d'un modèle à poids ouverts, sous licence MIT, disponible sur Hugging Face.
Une architecture taillée pour la performance
Derrière ce score, il y a des choix techniques ambitieux. MiMo-V2.6-Pro affiche 1 000 milliards de paramètres au total, mais n'en active que 42 milliards par token lors de l'inférence. C'est le principe du modèle à experts : mobiliser uniquement les ressources nécessaires pour chaque requête.
Multimodalité complète en entrée
Le modèle accepte le texte, les images, la parole et la vidéo en entrée, et produit du texte en sortie. Une polyvalence rare qui ouvre la porte à des usages très variés, de l'analyse de documents visuels à la transcription enrichie de contenus audio.
Une fenêtre de contexte d'un million de tokens
Concrètement, cela représente environ 1 500 pages A4 en police 12. Vous pouvez donc lui soumettre des rapports entiers, des bases de code volumineuses ou des transcriptions longues sans perdre le fil. C'est un atout majeur pour les projets qui exigent une mémoire étendue.
Un prix raisonnable, mais une vitesse à surveiller
Tous les voyants ne sont pas au vert. Comparons ce qui doit l'être.
- Coût d'entrée : 0,435 dollar par million de tokens, un peu au-dessus de la médiane (0,30 dollar).
- Coût de sortie : 0,87 dollar par million de tokens, plutôt compétitif face à la médiane de 1,18 dollar.
- Remise sur cache : jusqu'à 99 %, ce qui fait chuter le coût à 0,13 dollar par tâche d'évaluation.
- Vitesse : 46,1 tokens par seconde seulement, ce qui le classe 50e sur 115. C'est lent.
- Verbosité : 140 millions de tokens générés pour l'indice, ce qui le rend un peu bavard.
Autrement dit, vous obtenez une intelligence de premier plan à un prix correct, mais vous devrez composer avec des temps de réponse plus longs. Un compromis à évaluer selon votre usage.
Pourquoi c'est important
Parce que ce modèle prouve que l'open source n'est plus un second choix. Vous pouvez désormais accéder à une intelligence de pointe sans dépendre d'une API fermée, avec la liberté de l'héberger, de l'adapter et de l'auditer. Pour votre travail, cela signifie plus de contrôle, plus de transparence et souvent moins de coûts sur le long terme. Pour votre réflexion, c'est un rappel que la course à l'IA se joue désormais à armes presque égales.
Conclusion
MiMo-V2.6-Pro n'est pas parfait. Sa lenteur relative et sa verbosité tempèrent l'enthousiasme. Mais son score de 46 sur l'indice d'intelligence, associé à une licence MIT et à une fenêtre de contexte d'un million de tokens, en fait un candidat sérieux pour quiconque veut bâtir sur des fondations ouvertes. Xiaomi signe là une entrée remarquée dans la cour des grands, et la bonne nouvelle, c'est que vous pouvez l'essayer dès maintenant.
Points clés à retenir
- MiMo-V2.6-Pro obtient 46 sur l'Artificial Analysis Intelligence Index, soit le premier rang sur 115 modèles.
- Il s'agit d'un modèle à poids ouverts sous licence MIT, avec 1 000 milliards de paramètres dont 42 milliards actifs.
- Il traite texte, image, parole et vidéo en entrée, avec une fenêtre de contexte d'un million de tokens.
- Son coût reste raisonnable, surtout grâce à une remise cache pouvant atteindre 99 %.
- Sa vitesse de 46,1 tokens par seconde et sa verbosité constituent ses principaux points faibles.