Les coûts d'inférence se divisent : les moteurs ouverts s'ajustent, les fabricants de puces réduisent le matériel
Un moteur d'inférence open source lancé sur GitHub le 30 septembre affirme que les modèles ouverts fonctionnent jusqu'à 2 fois plus vite que llama.cpp en compilant et en ajustant ses noyaux sur l'appareil de l'utilisateur, tandis que MaxLinear indique que sa nouvelle puce Puma 9 DOCSIS peut réduire les coûts des équipements de bureau de 30 % à 50 %.

Magnitude, une entreprise de la promotion S25 de Y Combinator, a publié son dépôt le 30 septembre sous licence Apache 2.0. L'application de bureau ajuste les noyaux sur Apple Silicon, NVIDIA, AMD ou des processeurs standards avant l'exécution d'un modèle. MaxLinear a utilisé une séance d'information du 29 septembre pour affirmer que sa puce Puma 9 réduit les coûts des modems et des passerelles de 30 % à 50 % par rapport à sa prédécesseure, la Puma 8 introduite en 2023.
Les chiffres de Magnitude sont précis : le README revendique un décodage 92 % plus rapide sur Metal et 19 % sur CUDA par rapport à llama.cpp, 27 % de mémoire en moins par agent libérée lorsque les agents s'arrêtent, et des caches de préfixe partagés entre les sessions concurrentes. Il se connecte à Pi, OpenCode, Hermes, OpenClaw, Codex, Claude Code, Oh My Pi et Cline, avec tout le reste géré via une API compatible OpenAI. L'entreprise affirme que les invites, fichiers et modèles restent sur la machine et qu'aucune connexion internet n'est requise une fois le modèle téléchargé. C'est l'argument de vente. Si cela tient sur votre matériel est une autre question : le benchmark est celui du fournisseur, et le dépôt ne publie pas de reproduction tierce.
L'affirmation de MaxLinear repose sur un type d'ajustement différent. Le Puma 9 prend en charge DOCSIS 4.0, DOCSIS 3.1+ et DOCSIS 3.1, ajoute le support Wi-Fi 8 et passe pour la première fois à une architecture ARM dans la gamme Puma, que MaxLinear a héritée de l'acquisition en 2020 de l'unité Home Gateway Platform d'Intel.
Une source du secteur familiarisée avec la puce a confié à Light Reading que le passage à ARM aide à réduire la consommation d'énergie et certains coûts de licence. MaxLinear indique qu'il continuera à prendre en charge les produits x86 et que la plateforme logicielle RDK rend l'architecture CPU sous-jacente largement transparente pour les clients. Face aux pénuries de DDR4, le Puma 9 prend également en charge la DDR5. Puneet Sethi, SVP et directeur général de l'unité réseau et opérateur de MaxLinear, a déclaré que l'entreprise pense que l'écosystème, les prix et l'approvisionnement de la DDR5 deviendront plus détendus que la tension observée avec la DDR4. Jeff Heynen de Dell'Oro Group a déclaré à Light Reading que la plupart des fournisseurs passeront à la DDR5 pour les unités Wi-Fi 8 plus avancées en raison de la mémoire embarquée supplémentaire que les applications et diagnostics peuvent exiger.
MaxLinear indique qu'il a plusieurs engagements pour le Puma 9, cite Askey, Fritz! GmbH et Gemtek comme partenaires CPE, et bénéficie du soutien de l'opérateur australien NBN Co. Les modems et passerelles basés dessus sont attendus en 2027.
La pression sur les coûts ne se limite pas aux modems. Dans le secteur de la santé, Endpoints News a demandé le 1 octobre si l'IA augmente les coûts plutôt que de les réduire, en situant la question face à une vague de financements : Parakeet Health a levé $10M pour automatiser la relation patient et Devoted Health a levé $1.2B, tous deux rapportés le 1 octobre. CleanTechnica a rapporté le 29 septembre que l'analyse de Transport & Environment situe les coûts d'exploitation des véhicules électriques à moins de la moitié du diesel par kilomètre, les conducteurs de diesel payant €32 de plus par plein qu'au début de l'année, dont environ €16 de marge raffinage supplémentaire. Le même média a rapporté le 28 septembre sur les opérateurs de centres de données se tournant vers des générateurs portables au méthane, et sur la lutte contre les émissions diesel plus ancienne qui a suivi la classification des gaz d'échappement diesel comme cancérigènes par l'Organisation mondiale de la Santé en 2012.
Les fabricants de matériel tentent aussi de réduire les coûts des batteries. Electrek a rapporté le 29 septembre que Ultium Cells, la joint-venture de GM avec LG Energy Solution, produira en masse des cellules LMR prismatiques à Spring Hill, Tennessee, en revendiquant une densité énergétique 33 % plus élevée que le LFP à coût comparable. Le vice-président de GM, Kurt Kelty, a déclaré que l'ajout du LMR positionne l'entreprise pour dépasser les chimies plus abordables d'aujourd'hui. Les mises à niveau commencent plus tard cette année et devraient être terminées d'ici 2028, ajoutant 500 emplois pour une main-d'œuvre de 1 700 ; le premier véhicule avec des batteries LMR est attendu en 2028.
Exploitation moins chère, construction plus coûteuse
Le schéma dans le dossier est que l'inférence et les opérations deviennent moins chères tandis que les actifs sous-jacents restent coûteux. Xpeng a consolidé quatre lignes de produits en deux pour se concentrer sur la R&D et réduire les coûts, a rapporté 36Kr lundi via CnEVPost. Les chiffres derrière cette décision : les livraisons ont chuté de 10.49 % à 243 111 véhicules au cours des huit premiers mois de 2026, les dépenses de R&D ont augmenté de 32.1 % en glissement annuel pour atteindre 2 910 000 000 yuans au deuxième trimestre, et la perte nette trimestrielle s'est élargie à 1 340 000 000 yuans contre 480 000 000 yuans un an plus tôt. Les opérateurs télécoms suivent la même voie. Light Reading a rapporté le 30 septembre que StarHub et M1 sont en négociations de fusion à Singapour, où Singtel détenait reportedly 43 % de part mobile en juin, M1 22 %, StarHub 21 % et Simba 14 %. En Nouvelle-Zélande, 2degrees et OneNZ ont proposé de fusionner leurs réseaux d'accès radio dans une entité détenue conjointement, avec une décision attendue de la Commerce Commission l'année prochaine. L'accord 5G entre China Telecom et China Unicom, le plus grand partenariat du genre, couvre 1 500 000 stations de base et revendique 56 000 000 000 de dollars d'économies d'investissement.
La recherche grignote aussi le côté logiciel. Un article soumis à arXiv le 29 septembre, Demographic Pluralism, rapporte une réduction de la distance Jensen-Shannon de 8.4 % à 26.4 % par rapport au Modular Pluralism sur quatre backbones sur GlobalOpinionQA et VITAL sans données d'entraînement de distribution d'opinions ou de fine-tuning spécifique à la tâche. Un deuxième article accepté à NeurIPS 2026, FluxLite, rapporte des améliorations par rapport aux lignes de base standard de Monte Carlo séquentiel de Feynman-Kac de jusqu'à deux ordres de grandeur en KL terminal sur un benchmark CTMC à états finis, et des réductions de MSE de corrélation de lignes par 5-7x en moyenne géométrique et jusqu'à 55x au pic sur l'échantillonnage d'Ising 2D.
Microsoft Research a argué le 23 septembre que l'exécution de l'inférence d'IA physique uniquement sur des GPU embarqués limite les performances des robots, l'autonomie de la batterie et l'échelle, et que le déchargement vers des GPU de bord ou du cloud améliorait les taux de réussite des tâches et le temps de fonctionnement sur les charges de travail de manipulation mobile. Il a également introduit des outils basés sur Kubernetes pour conteneuriser et orchestrer les charges de travail robotiques entre robots, bord et cloud.
Une réserve traverse tout cela. Les chiffres de performance de Magnitude, Ultium Cells et MaxLinear sont ceux des fournisseurs, et les gains d'efficacité dans les deux articles arXiv sont mesurés sur des benchmarks académiques plutôt que sur le trafic de production.
Sources
11- 01Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for agentsEN
- 02MaxLinear claims new 'Puma 9' DOCSIS chip is a big cost-cutterEN
- 03Is AI jacking up healthcare costs?EN
- 04Driving An EV Now Costs Half As Much As Diesel, New Analysis ShowsEN
- 05The Human Cost Of Data Center PollutionEN
- 06GM's new EV battery tech will cut costs without sacrificing rangeEN
- 07Xpeng reportedly consolidates product lines to cut R&D costsEN
- 08Singapore, New Zealand operators seek partnerships to cut costsEN
- 09Demographic Pluralism: Inference-Time Modeling of Pluralistic Human Preference DistributionsEN
- 10FluxLite: Inference-Time Proposal Control for Discrete Diffusion ModelsEN
- 11Offloaded inference for real-world physical AI roboticsEN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.