Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Inferenzkosten entwickeln sich in zwei Richtungen: Offene Engines optimieren sich selbst, Chiphersteller senken Hardwarekosten

Eine Open-Source-Inferenz-Engine, die am 30. September auf GitHub veröffentlicht wurde, verspricht, offene Modelle laufen damit bis zu 2x schneller als mit llama.cpp, da Kernels auf dem eigenen Gerät des Nutzers kompiliert und optimiert werden. MaxLinear teilt mit, dass sein neuer Puma 9 DOCSIS-Chip die Kosten für Customer Premises Equipment um 30% bis 50% senken kann.

KI & ModelleAnalyseLena BrandtVeröffentlicht: 1. Oktober 20265 Min. LesezeitQuellen 11
Inferenzkosten entwickeln sich in zwei Richtungen: Offene Engines optimieren sich selbst, Chiphersteller senken Hardwarekosten

Magnitude, ein Unternehmen aus dem Y-Combinator-Programm S25, hat sein Repository am 30. September unter der Apache-2.0-Lizenz veröffentlicht. Die Desktop-App optimiert Kernels auf Apple Silicon, NVIDIA, AMD oder herkömmlichen CPUs, bevor ein Modell ausgeführt wird. MaxLinear nutzte ein Briefing am 29. September, um zu behaupten, dass sein Puma-9-Silizium die Kosten für Modems und Gateways im Vergleich zum Vorgänger, dem Puma 8, der 2023 eingeführt wurde, um 30% bis 50% senkt.

Die Zahlen von Magnitude sind spezifisch: Das README behauptet, dass das Decoding auf Metal 92% und auf CUDA 19% schneller ist als bei llama.cpp, dass der Speicherbedarf pro Agent um 27% sinkt, wenn Agenten gestoppt werden, und dass Präfix-Caches über gleichzeitige Sitzungen hinweg geteilt werden. Die Software verbindet sich mit Pi, OpenCode, Hermes, OpenClaw, Codex, Claude Code, Oh My Pi und Cline; alles andere läuft über eine OpenAI-kompatible API. Das Unternehmen erklärt, dass Prompts, Dateien und Modelle auf dem Rechner bleiben und nach dem Download eines Modells kein Internet nötig ist. Das ist das Versprechen. Ob es auf deiner Hardware hält, ist eine andere Sache: Der Benchmark stammt vom Hersteller selbst, und das Repository veröffentlicht keine unabhängige Replikation.

Der Anspruch von MaxLinear basiert auf einer anderen Art der Optimierung. Der Puma 9 unterstützt DOCSIS 4.0, DOCSIS 3.1+ und DOCSIS 3.1, fügt Wi-Fi 8 Unterstützung hinzu und wechselt erstmals in der Puma-Linie zur ARM-Architektur. MaxLinear übernahm diese Linie durch die Akquisition von Intels Home Gateway Platform Unit im Jahr 2020.

Eine Branchenquelle, die mit dem Silizium vertraut ist, sagte gegenüber Light Reading, dass der Wechsel zu ARM dabei hilft, den Stromverbrauch und einige Lizenzkosten zu senken. MaxLinear erklärt, dass es x86-Produkte weiterhin unterstützen werde und dass die RDK-Softwareplattform die zugrunde liegende CPU-Architektur für Kunden weitgehend transparent mache. Angesichts der DDR4-Verknappung unterstützt der Puma 9 auch DDR5. Puneet Sethi, SVP und GM der Netzwerk-Infrastruktur- und Carrier-Geschäftseinheit von MaxLinear, sagte, das Unternehmen gehe davon aus, dass das DDR5-Ökosystem, die Preise und das Angebot entspannter werden als der bei DDR4 beobachtete Stress. Jeff Heynen von der Dell'Oro Group erklärte gegenüber Light Reading, die meisten Anbieter würden zu DDR5 wechseln, da fortschrittlichere Wi-Fi-8-Geräte aufgrund der zusätzlichen Onboard-Speichers für Apps und Diagnosen mehr benötigen.

MaxLinear gibt an, mehrere Verpflichtungen für den Puma 9 zu haben, nennt Askey, Fritz! GmbH und Gemtek als CPE-Partner und erhält Unterstützung von dem australischen Betreiber NBN Co. Modems und Gateways auf Basis dieses Chips werden für 2027 erwartet.

Der Kostendruck beschränkt sich nicht auf Modems. Im Gesundheitswesen fragte Endpoints News am 1. Oktober, ob KI die Kosten erhöht, anstatt sie zu senken, und rahmte die Frage gegen eine Welle an Finanzierungen: Parakeet Health hob 10M auf, um die Patientenansprache zu automatisieren, und Devoted Health hob 1.2B auf, beide Meldungen vom 1. Oktober. CleanTechnica berichtete am 29. September, dass die Analyse von Transport & Environment die Betriebskosten von Elektroautos auf weniger als die Hälfte der Dieselfahrzeuge pro Kilometer schätzt, wobei Diesel-Fahrer pro Tank 32 € mehr zahlen als zu Jahresbeginn, davon etwa 16 € zusätzlicher Raffineriemarge. Dasselbe Medium berichtete am 28. September über Betreiber von Rechenzentren, die auf mit Methan betriebene portabile Generatoren umsteigen, sowie über den älteren Kampf gegen Dieselabgase, der nach der Einstufung von Dieselabgasen als krebserregend durch die Weltgesundheitsorganisation im Jahr 2012 folgte.

Hardwarehersteller versuchen auch, Kosten aus Batterien herauszudrücken. Electrek berichtete am 29. September, dass Ultium Cells, das Joint Venture von GM mit LG Energy Solution, prismatische LMR-Zellen in Spring Hill, Tennessee, in Massenproduktion nehmen wird, und behauptet, eine um 33% höhere Energiedichte als LFP bei vergleichbaren Kosten. GM-Vizepräsident Kurt Kelty sagte, die Hinzunahme von LMR positioniere das Unternehmen, um die heute günstigeren Chemiestoffe zu überholen. Aufrüstungen beginnen noch in diesem Jahr und sollen bis 2028 abgeschlossen sein, was 500 Arbeitsplätze für eine Belegschaft von 1.700 schafft; das erste Fahrzeug mit LMR-Batterien wird für 2028 erwartet.

Günstiger Betrieb, teurerer Aufbau

Das Muster in der Dossiersammlung ist, dass Inferenz und Betrieb günstiger werden, während die darunterliegenden Assets teuer bleiben. Xpeng bündelte vier Produktlinien zu zwei, um F&E zu fokussieren und Kosten zu senken, wie 36Kr am Montag über CnEVPost berichtete. Die Zahlen hinter dieser Entscheidung: Die Lieferungen fielen in den ersten acht Monaten von 2026 um 10.49% auf 243.111 Fahrzeuge, die F&E-Ausgaben stiegen um 32.1% im Vorjahresvergleich auf 2.910.000.000 Yuan im zweiten Quartal, und der Quartalsverlust vergrößerte sich auf 1.340.000.000 Yuan von 480.000.000 Yuan ein Jahr zuvor. Telekommunikationsanbieter gehen denselben Weg. Light Reading berichtete am 30. September, dass StarHub und M1 in Singapur in Fusionsgesprächen stehen, wo Singtel im Juni einen Mobilmarktanteil von 43% hatte, M1 22%, StarHub 21% und Simba 14%. In Neuseeland haben 2degrees und OneNZ vorgeschlagen, ihre Radio-Access-Networks in eine gemeinsam besitzene Einheit zu kombinieren, wobei die Commerce Commission voraussichtlich im nächsten Jahr entscheidet. Die 5G-Vereinbarung zwischen China Telecom und China Unicom, die größte solche Partnerschaft, umfasst 1.500.000 Basisstationen und beansprucht 56.000.000.000 USD an Capex-Einsparungen.

Die Forschung nagt auch an der Softwareseite. Eine am 29. September auf arXiv eingereichte Arbeit, Demographic Pluralism, berichtet über eine Reduktion des Jensen-Shannon-Abstands um 8.4% bis 26.4% gegenüber Modular Pluralism über vier Backbones auf GlobalOpinionQA und VITAL, ohne Meinungsbildungs-Trainingsdaten oder aufgabenbezogenes Feintuning. Eine zweite Arbeit, die auf der NeurIPS 2026 angenommen wurde, FluxLite, berichtet über Verbesserungen gegenüber Standard-Feynman-Kac-sequentiellen Monte-Carlo-Baselines von bis zu zwei Größenordnungen im terminalen KL auf einem endlichen Zustands-CTMC-Benchmark und Reduktionen der Zeilen-Korrelations-MSE bei 2D-Ising-Sampling um den Faktor 5-7 im geometrischen Mittel und bis zu 55x beim Peak.

Microsoft Research argumentierte am 23. September, dass das Ausführen von physischer KI-Inferenz nur auf Onboard-GPUs die Roboterleistung, die Batterielaufzeit und die Skalierung begrenzt, und dass das Offloading auf Edge- oder Cloud-GPUs die Erfolgssätze der Aufgaben und die Betriebszeit über mobile Manipulations-Arbeitslasten hinweg verbesserte. Es stellte auch Kubernetes-basierte Werkzeuge vor, um Robotik-Arbeitslasten über Roboter, Edge und Cloud hinweg zu containerisieren und zu orchestrieren.

Eine Einschränkung zieht sich durch alles. Die Leistungszahlen von Magnitude, Ultium Cells und MaxLinear sind die der Hersteller selbst, und die Effizienzgewinne in den beiden arXiv-Arbeiten werden auf akademischen Benchmarks gemessen, nicht auf Produktionsverkehr.

Kommentare 0

Quellen

11
  1. 01Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for agentsEN
  2. 02MaxLinear claims new 'Puma 9' DOCSIS chip is a big cost-cutterEN
  3. 03Is AI jacking up healthcare costs?EN
  4. 04Driving An EV Now Costs Half As Much As Diesel, New Analysis ShowsEN
  5. 05The Human Cost Of Data Center PollutionEN
  6. 06GM's new EV battery tech will cut costs without sacrificing rangeEN
  7. 07Xpeng reportedly consolidates product lines to cut R&D costsEN
  8. 08Singapore, New Zealand operators seek partnerships to cut costsEN
  9. 09Demographic Pluralism: Inference-Time Modeling of Pluralistic Human Preference DistributionsEN
  10. 10FluxLite: Inference-Time Proposal Control for Discrete Diffusion ModelsEN
  11. 11Offloaded inference for real-world physical AI roboticsEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Lena Brandt

Lena Brandt

KI, Modelle und Technik

Lena Brandt schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Herstellerangaben, Studien und öffentlich zugängliche Datensätze, statt Pressemitteilungen ungeprüft zu übernehmen. Bei Modellvergleichen kontrolliert sie Benchmark-Werte, Trainingsdaten und Versionsnummern und rechnet Angaben zu Rechenleistung und Kosten selbst nach. Sie spricht mit Entwicklern und Forschern, wartet auf angekündigte Updates und vergleicht Releases, bevor sie eine Einschätzung abgibt. Privat beschäftigt sie sich mit 3D-Druck, alten Rechnern und der Frage, wie Modelle aus Internetmüll lernen – Themen, die regelmäßig in ihre Texte einfließen. Sie publiziert keine Zahlen, deren Quelle sie nicht selbst überprüfen konnte.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.