← Alle Playbooks
Playbook· lokal

Lokal oder Cloud, die ehrliche Rechnung

Wann sich eigene Hardware rechnet und wann sie ein teures Hobby ist. Zehn Schritte durch eine Rechnung, die Strom, Arbeitszeit und Qualitätsverlust mitzählt, statt nur Hardwarepreis gegen Tokenpreis zu stellen.

Die Rechnung, die überall gemacht wird, geht so: die Grafikkarte kostet einmal so viel, die Cloud kostet pro Monat so viel, nach so vielen Monaten ist die Karte bezahlt. Diese Rechnung ist fast immer falsch, weil sie zwei Posten unterschlägt, die größer sind als der Hardwarepreis.

Der erste ist Deine Arbeitszeit. Der zweite ist der Qualitätsunterschied, der sich in längerem Nacharbeiten niederschlägt. Wenn beides drinsteht, sieht das Ergebnis anders aus, und für manche Anwendungsfälle kippt es dann in die andere Richtung. Dieses Playbook rechnet ehrlich, in beide Richtungen.

1. Sortier zuerst nach dem Grund, nicht nach dem Preis

Es gibt drei Gründe für lokal, und nur einer davon ist eine Rechenaufgabe.

Wenn der Grund Datenschutz ist, ist die Rechnung nachrangig. Daten, die das Haus nicht verlassen dürfen, dürfen es auch dann nicht, wenn die Cloud billiger wäre. Hier entscheidet die Anforderung, nicht das Geld.

Wenn der Grund Unabhängigkeit ist, kaufst Du eine Versicherung. Kein Anbieter, der Preise ändert, kein Modell, das plötzlich abgeschaltet wird, keine Sperre wegen einer Richtlinie. Das hat einen Wert, den man beziffern kann, aber nicht in Tokenpreisen.

Wenn der Grund Kosten sind, dann rechne. Die nächsten Schritte machen das.

Tipp: Wenn Du merkst, dass Dein eigentlicher Grund Neugier ist, ist das völlig legitim. Nur dann rechne nicht, sondern setz Dir ein Budget. Das ist ehrlicher und geht besser aus.

2. Miss Deinen echten Verbrauch, bevor Du rechnest

Fast alle schätzen ihren Verbrauch zu hoch. Der Eindruck von "wir nutzen KI ständig" entsteht aus der Häufigkeit der Nutzung, nicht aus der Menge der Token.

Schau in der Abrechnung Deines Anbieters nach, was die letzten drei Monate tatsächlich gekostet haben. Diese Zahl ist der Ausgangspunkt. Alles andere ist Bauchgefühl, und Bauchgefühl ist bei Tokenpreisen unzuverlässig, weil die Beträge so klein wirken.

Tipp: Trenn dabei zwei Dinge, die gern vermischt werden. Ein Pauschal-Abo deckt die interaktive Nutzung in der jeweiligen App ab, mit Nutzungsgrenzen und Fair-Use-Regeln, und es ist nicht als Kanal für automatisierte Massenverarbeitung gedacht. Für alles Automatisierte zahlst Du daneben API-Preise pro Token. Wer beides in einen Topf wirft, rechnet sich lokale Hardware entweder künstlich schön oder künstlich schlecht.

3. Zähl die volle Hardware, nicht nur die Grafikkarte

Wer für lokale Modelle einkauft, kauft selten nur die Karte. Es kommt ein Netzteil dazu, das die Karte tragen kann, oft ein anderes Gehäuse, manchmal mehr Arbeitsspeicher, und bei größeren Aufbauten ein Rechner, der auch nachts laufen darf.

Bei Apple-Rechnern ist es einfacher zu überblicken, weil der Speicher beim Kauf feststeht. Dafür ist er nicht nachrüstbar, was die Entscheidung endgültiger macht.

Tipp: Rechne mit drei Jahren Nutzungsdauer, nicht mit fünf. Bei dem Tempo, in dem sich Modelle und Anforderungen ändern, ist eine Karte nach drei Jahren nicht kaputt, aber sie ist zu klein für das, was dann üblich ist. Ein Restwert bleibt allerdings, Grafikkarten lassen sich gebraucht verkaufen, den kannst Du gegenrechnen.

Die Gesamtrechnung sieht damit so aus: (Hardware minus Restwert) geteilt durch die Monate der Nutzungsdauer, plus Strom pro Monat, plus Deine Betreuungszeit mal Stundensatz, plus die Nacharbeit aus Schritt 6. Diese Summe stellst Du der monatlichen Cloud-Rechnung gegenüber, nicht den reinen Anschaffungskosten.

4. Nimm den Strom mit hinein

Eine leistungsfähige Grafikkarte zieht unter Volllast mehrere hundert Watt. Bei deutschen Strompreisen ist das kein Rundungsfehler, sondern ein Posten.

Die Rechnung ist einfach: Leistungsaufnahme in Kilowatt, mal Stunden unter Last pro Monat, mal Dein Preis pro Kilowattstunde. Entscheidend ist die zweite Zahl, und die überschätzen die meisten stark, weil die Karte nur unter Last die volle Leistung zieht. Rechne den Leerlauf trotzdem mit, wenn die Maschine für den Zweck durchläuft: ein wartender Rechner zieht keine null Watt, und über einen Monat summiert sich das.

Tipp: Wenn der Rechner ohnehin läuft und Du nur gelegentlich etwas fragst, ist der Stromposten klein. Wenn eine Maschine dauerhaft für Massenverarbeitung läuft, ist er groß. Diese beiden Fälle sind wirtschaftlich völlig verschieden.

5. Setz Deine Arbeitszeit ein, ehrlich

Das ist der Posten, der in den meisten Vergleichen fehlt und der die Rechnung am häufigsten kippt.

Ein lokaler Aufbau will eingerichtet, aktualisiert und bei Problemen repariert werden. Modelle werden ersetzt, Laufzeitumgebungen bekommen Updates, gelegentlich funktioniert etwas nach einem Update nicht mehr. Rechne mit ein paar Stunden zu Beginn und danach mit wiederkehrendem Aufwand.

Setz Deinen eigenen Stundensatz ein. Wenn Du dabei feststellst, dass die Einrichtung mehr kostet als zwei Jahre Cloud-Nutzung, ist das ein Ergebnis und kein Argument dagegen, es trotzdem zu tun. Es muss nur bewusst sein.

Tipp: Wer das Thema ohnehin lernen will, darf diesen Posten kleiner ansetzen, weil er einen Teil davon als Weiterbildung verbucht. Wer nur ein Werkzeug will, darf das nicht.

6. Beziffer den Qualitätsunterschied

Ein lokales Modell der Mittelklasse ist bei einfachen Textaufgaben nah an den großen Anbietern. Bei schwierigen Aufgaben ist es das nicht, und der Unterschied kostet Zeit, weil Du mehr nacharbeitest.

Nimm zehn typische Aufgaben und lass sie von beiden erledigen. Miss nicht die Qualität in Punkten, sondern die Minuten, die Du nach der Antwort noch brauchst, bis das Ergebnis benutzbar ist. Diese Differenz mal Häufigkeit ist ein echter Kostenposten.

Tipp: Genau dieser Test entscheidet die Frage besser als jede Bestenliste. Der Ablauf dafür steht in Welches lokale Modell zu Deiner Hardware passt, Schritt 7.

7. Prüf, ob die Cloud-Seite überhaupt richtig gerechnet ist

Viele vergleichen lokale Hardware gegen das teuerste Cloud-Modell. Das ist unfair gegenüber der Cloud.

Wenn Deine Aufgabe einfach genug ist, dass ein lokales Modell mit acht Milliarden Parametern sie schafft, dann schafft sie in der Cloud auch das Budget-Modell. Und das kostet einen Bruchteil des Spitzenmodells. Der ehrliche Vergleich ist lokal gegen Budget-Tier, nicht lokal gegen Spitzenmodell.

Tipp: Ein Aufbau, der einfache Anfragen an ein günstiges Modell gibt und nur die schweren nach oben durchreicht, ist der größte Kostenhebel überhaupt, und zwar ohne eigene Hardware.

8. Erkenne die Fälle, in denen lokal klar gewinnt

Es gibt Muster, bei denen die Rechnung eindeutig ausgeht.

Sehr hohes Volumen bei einfacher Aufgabe. Zehntausende Dokumente klassifizieren, Texte in Kategorien sortieren, Massen von Einträgen normalisieren. Hier zahlt die Cloud pro Stück und die eigene Maschine läuft einfach durch.

Daten, die nicht raus dürfen. Schon behandelt, hier entscheidet die Anforderung.

Kein verlässliches Netz. Wer offline arbeiten muss, hat keine Wahl.

Dauerlast statt Spitzen. Eine Maschine, die durchgehend ausgelastet ist, amortisiert sich. Eine, die zu 95 Prozent wartet, nicht.

Tipp: Wenn keines dieser vier Muster auf Dich zutrifft und Datenschutz kein Thema ist, gewinnt die Cloud die Rechnung mit hoher Wahrscheinlichkeit.

9. Erkenne die Fälle, in denen die Cloud klar gewinnt

Auch das gehört ehrlich dazu.

Bei schwankender Nutzung zahlst Du in der Cloud nur, was Du verbrauchst, während die Hardware auch in ruhigen Monaten abgeschrieben wird. Bei schweren Denkaufgaben ist der Qualitätsabstand so groß, dass die Nacharbeit teurer wird als der Tokenpreis. Bei kleinen Teams ohne IT ist der Betriebsaufwand der eigentliche Kostentreiber. Und wer die jeweils neueste Modellgeneration braucht, bekommt sie in der Cloud am Erscheinungstag und lokal Monate später in kleinerer Form.

Tipp: Ein Pauschal-Abo verschiebt diese Rechnung zusätzlich, weil eine zusätzliche interaktive Anfrage darin nichts extra kostet, solange Du innerhalb der Nutzungsgrenzen bleibst. Oberhalb davon greifen Drosselung oder ein Zusatztarif, und für automatisierte Läufe gilt das Abo ohnehin nicht. Wer eines hat, sollte lokal deshalb vor allem aus den Gründen aus Schritt 1 bauen und aus Kostengründen nur dort, wo tatsächlich Masse anfällt.

10. Entscheide Dich für gemischt, wenn Du unsicher bist

Die beiden Lager reden über die Frage, als müsste man sich entscheiden. Muss man nicht, und die meisten produktiven Aufbauten tun es auch nicht.

Ein gemischter Aufbau schickt alles mit sensiblen Daten und alle Massenarbeit an das lokale Modell und alles Schwere in die Cloud. Du bekommst den Datenschutz da, wo Du ihn brauchst, und die Qualität da, wo sie zählt.

Eins darfst Du dabei nicht sparen, sonst hebelst Du genau den Datenschutz aus, für den Du das baust: zwei getrennte Umgebungen, nicht ein Umschalter. Die sensiblen Werkzeuge, Verläufe und Wissensspeicher gehören ausschließlich in die lokale Konfiguration, die Cloud-Zugangsdaten ausschließlich in die andere. Dieselbe Oberfläche mit einem Modell-Wahlschalter reicht nicht: was ein Lesewerkzeug einmal in den Verlauf geholt hat, wandert beim Umschalten mit hinaus.

Tipp: Dass es beide Male dieselbe Server-Software ist, spart Dir das Einrichten der zweiten Umgebung, nicht die Trennung selbst. Welche Server Du dort jeweils einträgst, bleibt eine Sicherheitsentscheidung. Die Details stehen in MCP mit lokalen Modellen, Schritt 10.

Was als nächstes

Wenn Du noch nichts laufen hast und die Rechnung erst mit eigener Erfahrung machen willst, dauert Dein erstes lokales KI-Modell in 30 Minuten genau so lange wie es heißt. Wenn Datenschutz Dein Hauptgrund ist, klärt Lokale KI und die DSGVO was lokal wirklich löst. Und wenn Du in der Cloud bleibst, aber die Rechnung drücken willst, ist Cost-Controls für den Daily-Driver der direktere Hebel.

Source

Preise und Modellstände ändern sich schnell. Die Rechenmethode oben bleibt gültig, die Zahlen musst Du jeweils frisch einsetzen.

  • Anthropic, aktuelle Preise pro Modell: https://www.anthropic.com/pricing
  • OpenAI, Preisübersicht: https://openai.com/api/pricing
  • Ollama, Modell-Bibliothek mit Größenangaben: https://ollama.com/library