AI Chronicles Explorer

NaiveAI : modèle MoE 309B sans attention complète

NaiveAI publie Naive-N0.5-Flash sous licence MIT : 309 milliards de paramètres, 1M de tokens de contexte et zéro attention complète. Découvrez

NaiveAI : modèle MoE 309B sans attention complète

Pendant que les grands laboratoires retiennent leurs modèles les plus puissants, une petite équipe vient de lâcher dans la nature un modèle massif, ouvert, et franchement audacieux. NaiveAI a publié Naive-N0.5-Flash sous licence MIT, et ce n'est pas une sortie comme les autres. On parle d'un modèle Mixture-of-Experts de 309 milliards de paramètres, dont seulement 15,5 milliards sont activés à chaque passage. Mais le vrai twist, c'est ailleurs : ce modèle n'utilise aucune couche d'attention complète sur ses 48 couches.

Une architecture qui refuse l'attention classique

Depuis l'invention du Transformer, l'attention complète a été la norme. Chaque token regarde tous les autres tokens, ce qui donne une qualité remarquable mais coûte une fortune en calcul dès que le contexte s'allonge. NaiveAI a décidé de tordre le cou à cette convention. Sur les 48 couches du modèle, aucune ne repose sur de l'attention pleine. À la place, l'équipe a empilé deux mécanismes bien précis.

39 couches à fenêtre glissante

La majorité des couches, soit 39 sur 48, utilisent une attention à fenêtre glissante. Concrètement, chaque token n'observe qu'un voisinage limité autour de lui. C'est plus léger, plus rapide, et ça suffit pour capter la structure locale du langage : syntaxe, proximité sémantique, cohérence immédiate. Vous perdez la vision globale d'un seul coup d'œil, mais vous gagnez une efficacité redoutable.

9 couches d'attention sparse inspirées de DeepSeek

Pour compenser la perte de vision globale, NaiveAI réserve 9 couches à une attention sparse directement inspirée des travaux de DeepSeek. Ces couches sélectionnent intelligemment les tokens à examiner, plutôt que de tous les regarder. Le résultat : une capacité à connecter des informations éloignées dans le contexte sans payer le prix d'une attention complète. C'est le mariage du local et du global, sans le coût du global.

Un contexte natif d'un million de tokens

Le contexte natif atteint un million de tokens. Vous pouvez donc avaler des romans entiers, des bases de code complètes ou des heures de transcription sans découper artificiellement votre contenu. Et surtout, grâce à l'absence d'attention complète, ce contexte géant ne fait pas exploser le coût de calcul de manière quadratique. C'est tout l'intérêt de la manœuvre : la longueur ne devient plus un mur infranchissable, mais un terrain de jeu.

Un MoE qui active seulement 15,5 milliards de paramètres

Le modèle compte 309 milliards de paramètres au total, mais n'en active que 15,5 milliards par token grâce à l'architecture Mixture-of-Experts. En pratique, vous profitez de la capacité brute d'un très grand modèle tout en ne payant que le coût d'un modèle de taille moyenne. C'est le pari central du MoE, et NaiveAI l'assume pleinement en poussant le ratio à l'extrême.

La licence MIT change la donne

Publier un modèle de cette ampleur sous licence MIT, c'est un signal fort. Vous pouvez l'utiliser, le modifier, le redistribuer, y compris dans un cadre commercial, sans les restrictions habituelles des licences dites « ouvertes » mais verrouillées. Pendant que certains gardent leurs meilleurs modèles en pause, d'autres choisissent l'ouverture totale. Ce contraste mérite qu'on s'y arrête.

Pourquoi c'est important

Parce que ce modèle prouve qu'on peut concevoir des architectures massives et longues en contexte sans dépendre de l'attention complète. Pour vous, cela signifie des outils plus accessibles, moins chers à faire tourner, et capables de traiter des documents entiers sans découpage. Pour le secteur, c'est une invitation à repenser des choix techniques qu'on croyait gravés dans le marbre.

Conclusion

Naive-N0.5-Flash n'est pas juste un gros modèle de plus. C'est une démonstration : on peut défier les conventions, ouvrir le code, et proposer une alternative crédible aux architectures dominantes. Que vous soyez développeur, chercheur ou simple curieux, gardez un œil sur cette approche. Les prochains modèles ouverts pourraient bien emprunter ce chemin.

Points clés à retenir

Sources