Zwei Jahre lang hat die KI-Branche Ihnen eine einfache Geschichte erzählt: Größere Modelle brauchen mehr RAM, mehr RAM braucht mehr Chips, mehr Chips brauchen mehr Geld. Buchen Sie den Premium-Tarif. Rüsten Sie Ihre Hardware auf. Die Zukunft ist teuer, und Sie gewöhnen sich besser daran.

Google hat gerade ein Loch in diese Geschichte geschossen.

TurboQuant: 6-mal weniger Speicher, null Verlust

Gestern hat Google Research TurboQuant veröffentlicht — einen Kompressionsalgorithmus, der den KV-Cache (den Arbeitsspeicher, den LLMs während eines Gesprächs nutzen) auf 3 Bit pro Wert schrumpft. Kein Nachtrainieren. Kein Fine-Tuning. Kein Genauigkeitsverlust.

Die Zahlen: 6-fache Speicherreduktion. Bis zu 8-fache Beschleunigung auf H100-GPUs. Das Paper wird noch in diesem Monat auf der ICLR 2026 in Rio de Janeiro vorgestellt.

Das Internet nannte es sofort Pied Piper. Der Vergleich passt — nur war Pied Piper Fiktion, und TurboQuant hat Benchmarks.

Innerhalb von Stunden nach Erscheinen des Blogposts begannen Entwickler, es von Grund auf zu implementieren. Nicht mit Googles Code — Google hat keinen veröffentlicht. Sie haben die Mathematik gelesen und ihren eigenen geschrieben. Ein Entwickler erhielt auf einer RTX 4090 bei 2-Bit-Präzision eine zeichenidentische Ausgabe gegenüber der unkomprimierten Baseline. Community-Implementierungen existieren bereits für PyTorch, MLX und llama.cpp.

Die Aktien von Micron und Western Digital fielen zur Handelseröffnung.

Der Trend ist nicht neu. Die Konvergenz schon.

TurboQuant ist nicht aus dem Nichts aufgetaucht. Es ist der jüngste Punkt auf einer Kurve, die sich seit über einem Jahr biegt:

  • DeepSeek hat bewiesen, dass man konkurrenzfähige Modelle auf unterlegenen Chips zu einem Bruchteil der Kosten trainieren kann. Der Westen hielt das für unmöglich, bis es passierte.
  • GLM und Qwen bieten Modelle auf Frontier-Niveau zu einem Siebtel des Preises. Nicht weil sie schlechter sind — sondern weil sie effizienter sind.
  • MoE-Architekturen aktivieren pro Anfrage nur einen Bruchteil der Modellparameter und senken den Rechenbedarf dramatisch.
  • Spekulatives Dekodieren beschleunigt die Inferenz, indem kleinere Modelle Tokens entwerfen und größere sie verifizieren.

Jeder dieser Punkte ist ein eigenständiger Durchbruch. Zusammen ergeben sie ein Muster: Algorithmische Effizienz überholt die Hardware-Skalierung. Jeder Effizienzgewinn gleicht die Nachfrage nach roher Rechenleistung teilweise aus.

Die RAM-Hersteller haben auf die entgegengesetzte Entwicklung gewettet. Sie haben ihre Produktion ausgeweitet in der Annahme, die KI-Nachfrage würde linear skalieren. Wird sie nicht.

Die Symbiose zwischen Google und Apple

Und hier wird es interessant. Google hat TurboQuant nicht gebaut, damit Sie Llama auf Ihrem Mac Studio laufen lassen können. Sie haben es für ihre Rechenzentren gebaut, für die Gemini-Inferenz, für die Ökonomie, Milliarden von Anfragen zu bedienen.

Aber Google zahlt Apple rund 20 Milliarden Dollar pro Jahr für die Suchdistribution. Gemini wird in iOS integriert. Google braucht Apples Hardware, um seine Modelle effizient auszuführen — denn so erreicht man Hunderte Millionen Nutzer, ohne ein einziges Endgerät zu bauen.

Und Apple braucht Modelle, die auf dem Gerät laufen, für sein Privacy-Narrativ. Jeder Effizienzgewinn, der ein größeres Modell in den vereinheitlichten Speicher passen lässt, ist Munition für Apples Versprechen „Ihre Daten verlassen niemals Ihr Gerät“.

Das ist keine zufällige Zusammenarbeit. Es ist strukturelle Symbiose. Google optimiert die Inferenz → die Community portiert sie nach MLX → Apple Silicon führt größere Modelle aus → Apple verkauft mehr Hardware → Google bekommt mehr Distribution. Alle gewinnen.

Außer den Unternehmen, die den RAM verkauft haben.

Der Druck auf den RAM-Markt

Die Speicherindustrie hat von künstlicher Nachfrage gelebt. Rechenzentren horteten jeden verfügbaren Chip für das KI-Training. Die Preise gingen in die Stratosphäre. SK Hynix und Micron meldeten Rekordmargen. Samsung mühte sich, bei der HBM-Produktion aufzuholen.

Jetzt kommt der Druck von beiden Seiten:

Von oben: Algorithmen wie TurboQuant bedeuten, dass jede GPU weniger Speicher braucht, um dieselbe Last zu bedienen. Eine 6-fache Reduktion der KV-Cache-Größe heißt: Entweder bedienen Sie mit derselben Hardware 6-mal so viele Nutzer, oder Sie kaufen für dieselbe Last 6-mal weniger Hardware. Kein Szenario ist gut für den Speicherabsatz.

Von unten: Inferenz auf dem Gerät reduziert die Cloud-Abhängigkeit. Wenn Ihr Telefon oder Laptop lokal ein leistungsfähiges Modell ausführen kann, ist das ein Nutzer weniger, der ein Rechenzentrum belastet. Apple, Qualcomm und Intel treiben alle lokale KI voran — und jeder Effizienzdurchbruch macht ihr Versprechen glaubwürdiger.

Die Speicherhersteller werden sich anpassen. Das tun sie immer. Aber „anpassen“ bedeutet Preiswettbewerb, und das bedeutet, dass Consumer-Hardware billiger wird. Das $400-RAM-Upgrade für Ihre Workstation? Das wird sich in 18 Monaten sehr anders anfühlen.

Was das bedeutet, wenn Sie kein Rechenzentrum sind

Wenn Sie Modelle lokal ausführen — auf einem Mac, einer Linux-Kiste, einer Homelab-GPU —, lautet die praktische Übersetzung so:

Ein 4-Bit-quantisiertes Modell mit einem 4-Bit-TurboQuant-KV-Cache kann sinnvoll große Modelle auf Consumer-Hardware mit langen Kontexten ausführen. Vor einem Jahr wäre dieser Satz ein Wunsch gewesen. Heute machen Leute genau das auf 4090ern und M-Series-Macs.

Das 70B-Parameter-Modell, das früher 128 GB vereinheitlichten Speicher mit einem langen Kontextfenster ausgereizt hat? Mit Kompression im Stil von TurboQuant passt dasselbe Gespräch bequem hinein. Die Beschränkung verschiebt sich von „Habe ich genug RAM?“ zu „Habe ich genug Bandbreite?“ — und auf Apple Silicon ist Bandbreite eines der stärksten Verkaufsargumente.

Das ist die Demokratisierung, auf die es tatsächlich ankommt. Nicht noch ein Chatbot-Wrapper mit Monatsgebühr. Nicht noch eine API, die pro Token abrechnet. Echte Modelle, die auf Hardware laufen, die Ihnen gehört, und Ausgaben produzieren, die Sie kontrollieren.

Die Stunde der Sterblichen

Die KI-Branche hat ein Narrativ gebaut, in dem die Zukunft dem gehört, der sich die meiste Rechenleistung leisten kann. Größere Cluster. Mehr GPUs. Höhere Abo-Stufen.

Aber Algorithmen respektieren dieses Narrativ nicht. Ein Paper von Google Research und ein Tag Community-Hacking haben gerade jede existierende GPU leistungsfähiger gemacht. Chinesische Labore beweisen weiterhin, dass Beschränkungen Innovation hervorbringen statt Unterwerfung. Und die Symbiose zwischen Googles Effizienzforschung und Apples Hardware-Ökosystem sorgt dafür, dass die Vorteile bergab fließen — bis zu der Person mit einer Tastatur und einem Homelab.

Die Unternehmen, die Ihnen zwei Jahre lang erzählt haben, Sie bräuchten mehr, mehr, mehr, werden gleich entdecken, dass die Algorithmen anderer Meinung sind.

Das RAM-Wettrüsten geht zu Ende. Nicht mit einem Knall, sondern mit Kompression.


Der Betrieb von The Frontier View kostet $10.36 pro Jahr. Die Branche, über die es berichtet, verbrennt $19 Milliarden. TurboQuant komprimiert 6:1. Wir komprimieren 1,835,000:1. Effizienz gewinnt.