Positron AI lève 875 M$ pour une inférence IA sobre et moins chère
Positron AI lève 875 millions de dollars pour sa puce d'inférence Asimov. Découvrez pourquoi l'optimisation de l'inférence IA devient le nouvel enjeu
Il y a encore deux ans, tout le monde regardait les modèles d'IA s'entraîner. Aujourd'hui, la question qui compte est ailleurs : comment fait-on tourner ces modèles une fois qu'ils sont déployés ? C'est exactement le terrain de jeu de Positron AI, qui vient d'annoncer une levée de fonds spectaculaire pour accélérer sur ce créneau.
Une levée qui dit quelque chose du marché
Positron AI a bouclé un financement de série C de 875 millions de dollars, à une valorisation post-money de 5 milliards. Le tour est co-dirigé par NEA, Atreides Management, Valor Equity Partners, Andra Capital, SemiAnalysis Capital de Dylan Patel et Jim Clark, le fondateur de Silicon Graphics et Netscape. Ce n'est pas juste une ligne dans un tableau financier : c'est un signal fort sur l'endroit où se déplace la valeur dans l'IA.
Ces fonds vont financer deux chantiers concrets : la fabrication de la prochaine puce d'inférence, baptisée Asimov, et la montée en production du système Titan. Le tout s'appuie sur une première étape déjà franchie : un déploiement de plus de 50 racks, appelé Atlas, chez Oracle Cloud Infrastructure à Reno, dans le Nevada.
Pourquoi l'inférence est devenue le vrai enjeu
Le centre de gravité de l'IA s'est déplacé. On est passé de l'entraînement des modèles à leur exécution. Chaque agent, chaque assistant, chaque copilote tourne sur de l'inférence. Et servir cette demande à grande échelle se heurte de plus en plus à trois murs : la capacité mémoire, la bande passante mémoire et la puissance électrique disponible.
Positron attaque précisément ces contraintes avec une approche « memory-first ». Ses systèmes exploitent plus de 90 % de la bande passante mémoire disponible, s'appuient sur de la mémoire LPDDR5X standard — ce qui évite les chaînes d'approvisionnement tendues du HBM et du CoWoS — et affichent des résultats de tête en jetons par dollar et en jetons par watt.
Un avantage énergétique qui change tout
Parce que l'architecture est particulièrement sobre, les produits Positron peuvent être déployés aussi bien dans des data centers refroidis à l'air que dans des installations refroidies par liquide, avec des densités de racks très variables. C'est un détail qui compte : la flexibilité de déploiement est souvent ce qui bloque ou débloque un projet d'IA à grande échelle.
Ce que ça change pour vous, concrètement
Quand le coût de l'inférence baisse, tout ce qui tourne au-dessus devient plus accessible. Des agents IA qui tournent en permanence, des assistants qui répondent en temps réel, des copilotes intégrés à vos outils du quotidien : tout cela devient viable économiquement à mesure que le coût par jeton chute.
Autrement dit, ce type d'annonce n'est pas réservé aux ingénieurs ou aux investisseurs. Elle conditionne directement la vitesse à laquelle les outils d'IA que vous utilisez deviennent moins chers, plus rapides et plus disponibles.
Pourquoi c'est important
Parce que la promesse de l'IA ne tient pas seulement à la qualité des modèles, mais à notre capacité à les faire tourner sans exploser les coûts ni la consommation d'énergie. Positron AI attaque ce problème de front, et la confiance de ses investisseurs montre que le marché considère l'inférence comme le prochain grand champ de bataille. Pour vous, cela signifie des outils d'IA plus accessibles et plus sobres, plus vite que prévu.
Conclusion
Positron AI illustre un mouvement de fond : l'IA entre dans sa phase industrielle, celle où l'efficacité énergétique et le coût par jeton deviennent aussi stratégiques que la performance brute des modèles. Avec 875 millions de dollars en poche et une puce Asimov en préparation, l'entreprise se donne les moyens de peser sur cette bascule. Pour le reste d'entre nous, c'est une bonne nouvelle : plus l'inférence devient sobre et abordable, plus l'IA devient réellement utile au quotidien.
Points clés à retenir
- Positron AI lève 875 millions de dollars à une valorisation de 5 milliards pour accélérer sa puce d'inférence Asimov.
- Le marché de l'IA bascule de l'entraînement vers l'inférence, où les contraintes de mémoire et d'énergie sont décisives.
- L'approche « memory-first » de Positron vise un meilleur rendement en jetons par dollar et par watt.
- Le déploiement Atlas chez Oracle Cloud Infrastructure a servi de test grandeur réelle avant la montée en production de Titan.
- Une inférence moins chère et plus sobre rend les agents et assistants IA plus accessibles à tous.