Table of Contents

32 GB auf dem Produktetikett bedeuten nicht 32 GB für einen Qwen-27B-Workload. Betriebssystem, Laufzeit, KV-Cache, Modellformat, Treiberstack und Kartenanordnung verändern das Ergebnis. Eine günstige Karte mit ausreichender Kapazität kann bei Prompt-Verarbeitung oder Einrichtungszeit trotzdem deutlich verlieren.

Vergleiche im Oktober 2026 nutzbaren Speicher und erledigte Arbeit pro Dollar, nicht nur die VRAM-Zahl.

Dieser Leitfaden zeigt praktische Wege, ein Qwen-27B-Modell mit 6-Bit-Qualität und großem Kontextfenster zu betreiben. Er trennt veröffentlichte Spezifikationen von gemeldeten Testergebnissen. Ein Tokens-pro-Sekunde-Ergebnis ist keine allgemeine Eigenschaft einer GPU.

Warum 32 GB das Ziel sind

Der Speicherbedarf beginnt bei den Gewichten. Ein dichtes 27B-Modell liest während der Generierung den vollständigen Parametersatz. Bei 6-Bit-Quantisierung belegen die Gewichte ungefähr 20,5 GB, bevor Laufzeit- und Kontextspeicher hinzukommen.

Ein Kontext mit 128K Tokens erfordert eine weitere große Reservierung. Die genaue KV-Cache-Größe hängt von Modellarchitektur, Cache-Präzision, Batch-Einstellungen und Backend ab. Eine praktische Schätzung von etwa 8 GB ergibt zusammen mit den Gewichten ungefähr 28,5 GB, bevor Betriebssystem und Inferenzlaufzeit ihren Anteil beanspruchen.

KonfigurationUnterstützt
24-GB-dedizierte GPU4-Bit-Gewichte mit reduziertem Kontext oder teilweises Offloading
32-GB-dedizierte GPU6-Bit-Gewichte mit einem sinnvollen Ziel von 128K Kontext
Zwei 16-GB-GPUsGeteiltes Modell mit weniger Spielraum für Laufzeit-Overhead
64 GB Unified MemoryGrößere Kontexte und Modelle, abhängig vom GPU-Speicherlimit

32 GB sind ein Dimensionierungspunkt, keine Garantie. Ein Modell kann laden und trotzdem zu wenig Platz für einen langen Prompt, einen größeren Batch, multimodale Eingaben oder einen zweiten Prozess lassen.

Das Video ist eine nützliche Praxishilfe

Das folgende Video vergleicht die wichtigsten Wege zu 32 GB für lokale KI. Es ist als Praxisreferenz für gemeldete Preise, Einrichtungsaufwand und Laufzeitergebnisse nützlich. Dieser Artikel vergleicht unabhängig anhand von Hardwarespezifikationen, Modell-Speicherverhalten, Softwareunterstützung und Gesamtbetriebskosten.

Nutzbarer Speicher schlägt den Kartenspeicher

Apple Unified Memory

Apple Silicon verwendet einen gemeinsamen Pool für CPU und GPU. Apple führt Mac-mini-Konfigurationen mit 32 GB Unified Memory auf. Der gesamte Pool ist aber keine dedizierte Grafikzuweisung. Auch macOS, Anwendung und Inferenzlaufzeit benötigen Platz.

Einige llama.cpp-Sitzungen melden auf einem 32-GB-System ungefähr 22.906 MB verfügbar. Das entspricht etwa 21,3 GiB und lässt wenig Raum für ein 6-Bit-27B-Modell mit großem KV-Cache. Das genaue Limit hängt von Betriebssystem, Modell-Runner, Speicherdruck und Startoptionen ab.

Apple Silicon bleibt für leise Systeme attraktiv. llama.cpp behandelt Metal als erstklassiges Backend. Apple vermeidet außerdem Treiber- und Stromprobleme vieler gebrauchter Rechenzentrumskarten. Der Nachteil ist geringerer Durchsatz als bei einer hochwertigen dedizierten GPU und weniger planbarer Speicher.

Zwei 16-GB-Karten

Zwei 16-GB-Karten bieten 32 GB physischen VRAM. Die Laufzeit benötigt aber gerätespezifische Puffer und Kommunikationsraum. Eine Karte kann 13,4 GB Nutzung melden, die andere 14,4 GB. Der verbleibende Platz ist keine saubere 4-GB-Reserve für den Kontext.

Auch die Aufteilung zählt. Layer-Splitting weist verschiedene Modellschichten verschiedenen Karten zu. Das erweitert die Kapazität, aber die Karten durchlaufen das Modell nacheinander. Tensor-Splitting verteilt Arbeit derselben Schicht auf beide Karten. Die Kommunikation steigt, doch beide Geräte tragen direkter bei.

Split-MethodeHauptvorteilHauptkosten
Layer-SplitEinfache KapazitätserweiterungEine Karte wartet häufig, während die andere arbeitet
Tensor-SplitBessere parallele Berechnung bei manchen WorkloadsMehr Tuning und mehr Interconnect-Verkehr
CPU- plus GPU-OffloadModelle über dem gesamten VRAM passen hineinGroßer Geschwindigkeitsverlust bei häufigen CPU-Schichten

Ein Zwei-Karten-Plan braucht vor dem Kauf ein getestetes Backend. PCIe-Generation, Steckplatzabstand, Stromversorgung, Treibersupport und die genaue Quantisierung beeinflussen das Ergebnis.

Einzelkarten-Optionen

RTX 5090

NVIDIA nennt für die RTX 5090 32 GB GDDR7 und 1.792 GB/s Speicherbandbreite. Sie bietet breite CUDA-Unterstützung, ausgereifte Werkzeuge und viele getestete Frontends. Die aktuelle CUDA-GPU-Tabelle führt die RTX 5090 mit Compute Capability 12.0.

Das Problem ist der Preis. Eine neue 5090 bietet einen klaren Weg zu 32 GB, doch der Kaufpreis konkurriert mit Monaten gemieteter Beschleunigerzeit. Sie benötigt außerdem bis zu 575 W Gesamtgrafikleistung. Das System braucht deshalb ein starkes Netzteil und gute Kühlung.

Radeon AI PRO R9700

Die R9700 ist eine 32-GB-AMD-Option mit hoher Speicherbandbreite und in vielen Angeboten niedrigerem Einstiegspreis als die 5090. Ihr Wert hängt stark von der Laufzeit ab. Ein Standardpfad mit llama.cpp liefert ein brauchbares Ergebnis. Ein schnelleres Community-Backend erreicht auf derselben Karte in manchen gemeldeten Tests deutlich mehr.

Das zeigt, warum ein GPU-Vergleich zwei Geschwindigkeitswerte braucht. Decode-Geschwindigkeit misst erzeugte Tokens. Prefill-Geschwindigkeit misst, wie schnell das Backend den Prompt vor dem ersten erzeugten Token liest. Eine Codebasis mit 50.000 Tokens zeigt einen schwachen Prefill-Pfad, auch wenn Decode akzeptabel aussieht.

Intel Arc Pro B70

Die Arc Pro B70 richtet sich mit 32 GB Speicher an professionelle Workloads. Sie ist interessant beim Verhältnis von Kapazität zu Preis, doch der Softwarepfad braucht mehr Prüfung als CUDA-Hardware. Standard-GGUF-Unterstützung, gepatchte Builds, Draft-Token-Einstellungen und Backend-Reife beeinflussen das Ergebnis.

Ein niedriger Kaufpreis gleicht keine Stunden bei der Suche nach einem funktionierenden Build aus. Für Bastler gehört diese Arbeit zum Projekt. Bei einer täglich genutzten Workstation haben Treiber- und Anwendungssupport einen echten Wert.

Gebrauchte Rechenzentrumskarten

Tesla V100

Gebrauchte Tesla-V100-Karten mit 32 GB wirken attraktiv, weil der Kartenpreis niedrig aussieht. Der vollständige Aufbau kostet mehr. Eine passive Rechenzentrumskarte braucht Luftstrom, Gehäuse oder Shroud, Stromadapter und einen Host mit genügend PCIe-Platz.

Ein weiteres Problem ist das Alter der Software. Die aktuelle CUDA-GPU-Tabelle konzentriert sich auf neuere Architekturen und führt die V100 nicht in ihrer aktuellen Architekturtabelle. Vor dem Kauf müssen CUDA-Version, Treiberzweig, Backend und Community-Fork geprüft werden.

Plane ein funktionierendes V100-System ein, keine nackte Karte. Eine Karte für etwa 680 Dollar kann nach Kühlung, Adaptern und Hostplattform zu einem Projekt von ungefähr 1.000 Dollar werden. Gebrauchtpreise steigen auch, wenn ein beliebter lokaler KI-Workload Käufer auf denselben alten Beschleuniger lenkt.

AMD Instinct MI50

Die MI50 bietet einen attraktiven Gebrauchtpreis pro Gigabyte, aber ihre aktuelle Softwareunterstützung ist eine ernste Einschränkung. Eine Karte, die einen älteren ROCm-Stack oder einen Community-Fork benötigt, ist nicht gleichwertig mit einer aktuellen Consumerkarte mit breiter Anwendungsunterstützung.

Die gemeldete Lücke bei der Prompt-Verarbeitung ist wichtiger als der Aufkleberpreis. Ein Vergleich maß auf einer MI50 etwa 128 Tokens pro Sekunde gegenüber ungefähr 2.652 Tokens pro Sekunde auf einer neueren 32-GB-Karte. Eine Codebasis mit 50.000 Tokens braucht auf dem langsameren Pfad Minuten und auf dem schnelleren Sekunden, bevor die Generierung beginnt.

Die MI50 passt zu einem engen Anwendungsfall. Sie passt zu einem Bastler, der Kapazität über Interaktionsgeschwindigkeit stellt und Treiberpflege akzeptiert. Für schnelle Codebasisanalyse ist sie bei wichtigem Prefill eine schlechte Wahl.

Software ist Teil der GPU

llama.cpp unterstützt CUDA, HIP, Metal, Vulkan, SYCL und weitere Backends. Es unterstützt auch hybride CPU-GPU-Inferenz und Multi-GPU-Betrieb. Diese Funktionen liefern bei verschiedenen Anbietern und Modellformaten nicht dieselbe Leistung.

Dieselbe physische Karte zeigt oft große Unterschiede zwischen:

  • Einem Standard-Applikationsbuild mit konservativen Einstellungen.
  • Einem optimierten llama.cpp-Build mit backend-spezifischen Kernels.
  • Einem Community-Fork mit spekulativer oder Multi-Token-Vorhersage.
  • Einem gepatchten Modellformat für einen Beschleunigerpfad.

Die gemeldeten Ergebnisse des Vergleichs umfassen etwa 27 Tokens pro Sekunde für einen standardmäßigen 32-GB-AMD-Pfad, ungefähr 46 Tokens pro Sekunde mit Multi-Token-Vorhersage und deutlich höhere Werte auf einem Spezial-Backend. Das zeigt Softwarepotenzial. Es ist keine Zusage für eine frische Installation.

Dokumentiere Backend, Commit, Modelldatei, Quantisierung, Kontextlänge, Prompt-Länge, Batch-Größe und Energiestatus bei jedem Benchmark. Ohne diese Felder ist Tokens pro Sekunde eine Werbezahl.

Mieten statt kaufen

Eine schnelle GPU zu mieten verändert die Rechnung. Ein gemeldeter Mietpreis für eine RTX 5090 von etwa 0,69 Dollar pro Stunde macht einen Kauf für 4.400 Dollar zu ungefähr 6.377 Mietstunden, bevor Strom, Hosthardware, Wartung und Wiederverkaufswert einfließen.

Das entspricht fast neun Monaten Dauermiete oder etwa zwei Jahren bei acht Stunden pro Tag. Ein Desktop mit zwei Karten für etwa 1.560 Dollar entspricht beim gleichen Mietpreis ungefähr 2.261 Stunden. Die gemietete 5090 vermeidet zusätzlich lokale Hitze, Lärm, Treibereinrichtung und Kartenausfall.

NutzungsmusterBesserer erster Test
Einige Stunden pro WocheGehostetes Modell oder gemietete GPU
Kurzes ProjektEine Karte der 5090-Klasse mieten und den echten Workload messen
Tägliche interaktive NutzungErst kaufen, wenn Backend und Kontextziel getestet sind
Nachts laufende AgentsEigene Hardware lässt sich leichter rechtfertigen
Private Daten mit gleichmäßiger LastEigene Hardware mit Netzwerkisolation

Miete vor dem Kauf, wenn Modell, Backend oder Kontextlänge noch unsicher sind. Ein gemessenes Wochenende kostet weniger als ein falscher Workstation-Kauf.

Kaufempfehlungen

Zwei RTX 5060 Ti mit 16 GB

Zwei 16-GB-Karten bieten einen praktischen CUDA-Weg für Käufer, die 32 GB und verbreitete Tutorials, Treiber und Frontends brauchen. Verwende Tensor-Splitting erst nach Prüfung von Modellformat und Backend. Layer-Splitting ist einfacher, lässt aber oft Leistung liegen.

Diese Lösung braucht außerdem ein Mainboard mit zwei nutzbaren Steckplätzen, genug Leistung und Luftstrom zwischen den Karten. Mit Plattformkosten ist ein Kartenpaar kein kleiner Workstation-Aufbau mehr.

Eine 32-GB-Karte

Wähle eine einzelne 32-GB-Karte, wenn Zuverlässigkeit, Garantie und einfache Bereitstellung wichtiger sind als der niedrigste Speicherpreis. R9700 und RTX 5090 stehen für unterschiedliche Varianten. AMD betont Kapazität und Preis. NVIDIA betont Softwarebreite und ausgereifte CUDA-Unterstützung.

Eine gebrauchte V100 oder MI50

Wähle gebrauchte Rechenzentrumshardware nur, wenn Treibertests, Kühlung und Backend-Wartung Teil des Projekts sind. Der Kartenpreis ist die erste Budgetzeile, nicht die letzte.

Apple Silicon

Wähle ein Apple-Silicon-System mit 32 GB, wenn Lautstärke, niedriger Leerlaufverbrauch und ein kompakter Desktop wichtiger sind als maximaler Durchsatz. Prüfe die vom genauen Runner gemeldete Speicherzuweisung, bevor du von 32 GB für das Modell ausgehst.

Cloud-Miete

Wähle Miete bei gelegentlichem Workload, häufig wechselnden Modellen oder wenn schnelle Prompt-Antworten wichtiger sind als lokales Eigentum. Schalte die Instanz nach dem Test ab. Leerlaufzeit entfernt den Preisvorteil schnell.

Ein besseres Vergleichsblatt

Notiere vor dem Kauf für jeden Kandidaten:

  • Nutzbarer Modellspeicher nach Laufzeit-Overhead.
  • Gewichtsformat und erwartete Modellgröße.
  • KV-Cache-Größe bei der Zielkontextlänge.
  • Prefill-Geschwindigkeit für einen repräsentativen Prompt.
  • Decode-Geschwindigkeit bei vollem Kontext.
  • Backend- und Treiberversion, die für das Ergebnis nötig sind.
  • Leerlauf- und Lastverbrauch zum lokalen Stromtarif.
  • Hostkosten, Kühlung, Adapter, Speicher und Garantie.
  • Mietäquivalent für die erwartete Nutzungsdauer.

Der nützlichste Test nutzt einen Prompt aus deinem echten Workload. Für Coding nimm eine repräsentative Codebasis. Für Recherche nimm ein langes Dokument mit dem normalen Retrieval- oder Einfügeablauf. Messe Zeit bis zum ersten Token, Prompt-Verarbeitung, Generierungsgeschwindigkeit, Speicherverbrauch und Ausgabequalität.

Abschließende Empfehlung

Kaufe zwei RTX 5060 Ti mit 16 GB für den reibungsärmsten 32-GB-CUDA-Aufbau. Nutze Tensor-Splitting erst, wenn ein kurzer Test das Backend bestätigt.

Kaufe eine einzelne 32-GB-Karte für eine sauberere Workstation. Bevorzuge die Karte mit dem stärkeren Softwarepfad für deinen Runner, nicht die Karte mit dem niedrigsten Dollar-pro-Gigabyte-Wert.

Nutze V100 oder MI50 nur, wenn du das Wartungsprojekt akzeptierst. Ein günstiger Beschleuniger mit schwachem Prefill ist bei langen Codebasis-Prompts kein Schnäppchen.

Miete eine GPU der 5090-Klasse bei unregelmäßiger Nutzung. Der Miettest liefert reale Speicher-, Geschwindigkeits- und Kontextdaten vor einem großen Kauf.

Die 32-GB-Frage lautet daher nicht: „Welche Karte hat das billigste Gigabyte?“ Sie lautet: „Welches System lässt genug nutzbaren Speicher, liest meinen Workload schnell, funktioniert mit meiner Software und verdient seinen Kaufpreis durch regelmäßige Nutzung?“

Quellen

Nächste Schritte

Nutze das Vergleichsblatt vor dem Kauf mit einem repräsentativen Prompt. Vergleiche Zeit bis zum ersten Token, Prompt-Verarbeitung, Decode-Geschwindigkeit, Speicher, Leistung und gesamte Plattformkosten. Miete bei einem kurzen Projekt zuerst und bewahre das Messergebnis mit der Kaufentscheidung auf.