Aus der Praxis
Zwei Sprachmodelle, 50 echte Fachfragen, eine Appliance
Über lokale KI wird viel behauptet und wenig gemessen. Wir haben auf unserer Referenzanlage zwei offene Sprachmodelle gegeneinander laufen lassen — mit echten Fachfragen an einen echten Dokumentenbestand. Ein Modell schreibt rund zehnmal so schnell wie das andere. Wo das herkommt, was es im Alltag ändert und was es nicht ändert, steht hier samt Zahlen.
Warum wir selbst messen
Veröffentlichte Geschwindigkeiten von Sprachmodellen entstehen unter Laborbedingungen: kurze Eingaben, lange Ausgaben, ein Modell allein auf der Maschine. Im Betrieb einer Wissensdatenbank zählt etwas anderes — die Zeit, bis eine belegte Antwort auf dem Schirm steht. Dazwischen liegen die Suche über die Dokumente, das Nachsortieren der Treffer und erst dann das Schreiben. Wir messen deshalb die ganze Kette und nicht nur das Modell.
Der Aufbau
Gerät ist unsere Referenzanlage, eine Appliance mit GB10-Chip, wie sie auch beim Kunden steht. Der Dokumentenbestand umfasst rund 2.500 Dateien aus einem echten Industriearchiv — Normen, Betriebsanleitungen, Prüfvorschriften, Qualitäts- und Logistikvorgaben —, zerlegt in etwa 103.000 durchsuchbare Abschnitte.
Die 50 Fragen sind Fachfragen, wie sie in der Arbeit gestellt werden, etwa „Welche Allgemeintoleranzen gelten nach DIN ISO 2768-1 mittel?" oder „Wie läuft die Sichtprüfung von Schweißnähten nach ISO 17637 ab?" Bewusst dabei: Fragen, deren Antwort im Bestand gar nicht steht. Ein System, das darauf etwas erfindet, ist im Betrieb nicht brauchbar.
Verglichen haben wir Qwen3-32B — ein dichtes Modell, bei dem für jedes Wort alle Gewichte gelesen werden — mit Qwen3.6-35B-A3B, einem Mixture-of-Experts-Modell, das je Wort nur rund 3 der 35 Milliarden Parameter benutzt. Beide in 4-Bit-Quantisierung (NVFP4), beide mit derselben Suche, demselben Reranking, demselben Längenrahmen für die Antwort, jede Frage einzeln und nacheinander.
Das Ergebnis
| Kennzahl | Qwen3-32B | Qwen3.6-35B-A3B | Anmerkung |
|---|---|---|---|
| Schreibrate des Modells | 11,6 Tokens/s | 114 Tokens/s | reine Modellmessung, ~3.000 Tokens Kontext |
| Erstes Wort (nur Modell) | 1,7 s | 0,5 s | ohne Suche, ohne Reranking |
| Suche bis zu den Quellen | 7,2 s | 7,1 s | hängt nicht am Sprachmodell |
| Erstes Wort im Chat | 8,5 s | 7,6 s | Suche, Reranking und Modell zusammen |
| Antwort fertig | 19,8 s | 11,4 s | Median über 50 Fragen |
| Geschriebene Wörter je Sekunde | 6,8 | 51 | aus Wortzahl und Schreibdauer |
| Länge der Antwort | 85 Wörter | 192 Wörter | gleicher Längenrahmen für beide |
| Alle 50 Fragen nacheinander | 17 min | 9 min | eine Frage nach der anderen |
| Belegte Quellen, alle Fragen | 144 | 229 | tatsächlich in der Antwort zitiert |
Warum das schnellere Modell schneller ist
Nicht wegen mehr Rechenleistung. Auf dieser Hardware teilen Prozessor und Grafikeinheit einen Speicher mit rund 273 Gigabyte pro Sekunde, und für jedes einzelne Wort müssen die benutzten Gewichte einmal durch diesen Speicher. Beim dichten Modell sind das rund 20 Gigabyte je Token — rechnerisch sind damit höchstens knapp 14 Token pro Sekunde möglich, gemessen wurden 11,6. Mehr gibt diese Bauart nicht her, gleichgültig wie schnell gerechnet wird. (Ein Token ist ungefähr eine Silbe bis ein kurzes Wort.) Das Mixture-of-Experts-Modell liest je Wort nur die aktiven Experten. Dieselbe Bandbreite, ein Bruchteil der Datenmenge.
Dazu kommt, wie die Modelle raten. Beide dürfen mehrere Wörter im Voraus entwerfen und in einem Durchgang prüfen — das ändert die Antwort nicht, spart aber Durchläufe. Das ältere Modell rät dabei aus dem Zusammenhang der Frage; das trägt nur, wenn die Antwort Wortlaut aus den Dokumenten übernimmt. Wir haben das am 9. September gemessen: 15,2 Tokens/s bei zitierenden Antworten, 11,0 bei frei formulierten. Das neuere Modell entwirft mit eigenen Zusatzschichten und wird deshalb bei jeder Antwort schneller.
Was die Zahlen nicht sagen
Geschwindigkeit ist die leichtere Hälfte. Wir haben zwölf Antwortpaare nebeneinander gelesen, und das Bild war gemischt.
Das schnellere Modell benennt Lücken ehrlicher. Auf die Frage nach dem Einbau einer Dosierpumpe hatte das ältere Modell aus einem einzelnen Satz über eine Verstellspindel eine Einbauanleitung geformt; das neuere sagt, dass die Unterlagen dazu nichts hergeben, und listet auf, was stattdessen darin steht. Bei Normtabellen ist es vollständiger und zitiert insgesamt deutlich mehr Fundstellen.
Zwei Schwächen zeigte es aber auch. Auf die Frage „Haben wir diese Norm im Bestand?" antwortete es, das lasse sich nicht sagen — obwohl die Norm als Datei in der Datenbank lag. Und wenn die Suche nichts fand, übernahm es einen Satz aus unserer internen Anweisung wörtlich in die Antwort. Beides lag nicht am Modell, sondern an einer Anweisung, die für das ältere Modell geschrieben war. Nach zwei Sätzen Änderung und einem zweiten Durchlauf derselben 50 Fragen: beides behoben, 245 statt 229 belegte Quellen, keine Frage hat ihre Quellen verloren.
Der Befund, auf den es im Betrieb ankommt: Bei den Fragen, deren Antwort nicht im Bestand stand, hat kein Modell etwas erfunden. Beide haben gesagt, dass sie die Antwort nicht kennen. Ein Wissenssystem, das im Zweifel schweigt, ist mehr wert als eines, das immer etwas liefert.
Drei Messfallen, die uns aufgefallen sind
- Pakete statt Tokens gezählt. Unser Messskript wies für das schnelle Modell konstant etwa 35 Tokens pro Sekunde aus — verdächtig glatt. Es zählte Datenpakete der Verbindung, und die API bündelt bei einem schnellen Modell mehrere Tokens in ein Paket. Die wirkliche Rate lag beim Dreifachen. Eine Kennzahl, die bei jeder Frage denselben Wert zeigt, misst nicht das, was sie behauptet.
- Die erste Antwort nach dem Start ist nicht die erste Antwort. Sie stockte reproduzierbar um etwa 30 Sekunden, weil die Rechenkerne beim ersten echten Durchlauf übersetzt werden. Ein Anwärmen nach dem Start und ein Zwischenspeicher für die übersetzten Kerne haben das erledigt — die Startzeit sank von 383 auf 226 Sekunden.
- Die neuere Softwarefassung bringt allein nichts. Das neue Modell verlangt eine neuere Fassung der Inferenz-Software. Wir haben das alte Modell auf beiden Fassungen gemessen: 11,6 gegen 11,3 Tokens/s — im Rahmen der Streuung gleich. Der Sprung kommt vom Modell, nicht vom Unterbau. Das ist eine gute Nachricht, weil ein Fassungswechsel damit keine Leistungsfrage ist, sondern nur eine Frage der Sorgfalt.
Was das für den Betrieb bedeutet
Die Wartezeit auf eine fertige Antwort hat sich nahezu halbiert, obwohl die Antworten mehr als doppelt so ausführlich sind. Wichtiger ist die Verschiebung des Engpasses: Von den 11,4 Sekunden entfallen jetzt rund 7 auf Suche und Reranking. Das Sprachmodell ist nicht mehr die langsamste Stelle — die nächste Verbesserung liegt in der Suche.
An der Anlage selbst ändert das nichts. Dieselbe Hardware, dasselbe Speicherbudget, dieselbe Investition; das Modell ist in der Verwaltung umschaltbar, und der Weg zurück ist derselbe Schalter. Für den Anwender heißt es schlicht: Die Antwort steht früher da, und sie nennt mehr Fundstellen.
Fazit
Wer eine lokale KI danach beurteilt, wie viele Milliarden Parameter das Modell hat, misst die falsche Größe. Auf Hardware wie dieser entscheidet, wie viele Gewichte je Wort durch den Speicher müssen — und ob das Modell im Zweifel schweigt. Beides lässt sich an einem Nachmittag messen, mit den eigenen Dokumenten. Genau das machen wir im Pilotbetrieb auch bei Ihnen.
Dieselbe Messung mit Ihren Unterlagen.
Im Pilotbetrieb läuft die Anlage 14 Tage mit Ihren echten Dokumenten – und mit Erfolgskriterien, die Sie vorher festlegen.