INROOM AI

INROOM AI · Messbericht · 24. September 2026

Sechs von sieben Läufen fehlerfrei.

Die 16-GB-Box ist unsere Messreferenz, und jedes System in unserem Preisrechner hat mehr Speicher als sie. Wir haben sie mit zwei realistischen Kanzlei-Aufgaben geprüft, mit 50, 250 und 1.000 Dateien im Aktenordner. Hier stehen alle Zahlen, dazu der direkte Vergleich mit 8 GB und das, was diese Messung noch nicht zeigt.

6 / 7Läufe mit voller Punktzahl im Wiener Kanzlei-Test
1.000Dateien im größten Aktenordner: beide Aufgaben mit 100 Punkten
0Abbrüche in allen Läufen auf der Box
280 / 300im Direktvergleich; das beste 8-GB-Ergebnis war 245

Was getestet wurde

Zwei Wiener Kanzlei-Aufgaben mit eingebauten Fallen

Der Test prüft, was eine Kanzlei wirklich braucht: den richtigen Mandanten unter ähnlich benannten finden, eine belegte Chronologie aufbauen, exakt rechnen, jede Aussage an eine Datei binden und prüfbare Ergebnisse ablegen. Eine flüssige Chat-Antwort allein zählt nicht als Erfolg. Alle Namen, Firmen und Beträge sind erfunden.

Fall 1 · Steuerberatung

Mandantenhistorie

„Was ist bei Mandant STB-1047 passiert, was fehlt noch, und wie hoch ist das dokumentierte Honorar?"

Ergebnis: ein strukturiertes Dossier und eine Notiz auf Deutsch für die Beraterin.

Fall 2 · Rechtsanwaltskanzlei

Fallvergleich

„Wie ist die Chronologie von RA-2026-184, welche alten Akten helfen wirklich, und was ist noch zu klären?"

Ergebnis: eine Analyse und ein Memo auf Deutsch an die Mandantin.

Die Falle ist die Verwechslung. Im Mandantenregister steht die gesuchte »Donau Atelier GmbH« (STB-1047) neben der »Donau Ateliers OG« (STB-1147), der »Donaublick Atelier GmbH« (STB-1407) und der »Atelier an der Donau GmbH« (STB-1740): ähnliche Namen, fast gleiche Nummern. Eindeutig ist nur die Mandantennummer. Im Anwaltsfall steht die »Sonnenhof Elektrotechnik GmbH« neben der »Sonnenhof Gastronomie GmbH« und der »Sonnenfeld Elektrotechnik OG«. Für den Belastungstest kommen Aktennotizen solcher ähnlich klingender Mandanten dazu, bis der Ordner 250 oder 1.000 Dateien hat; die gesuchte Akte selbst bleibt dieselbe. Die Musterlösung liegt nie im Arbeitsordner des Agenten. Bewertet wird automatisch mit 100 Punkten pro Aufgabe.

Die Ergebnisse

Sieben Läufe, ein einziger Fehler

Gemessen am 26. August 2026 auf der Box: RTX 3080 mit 16 GB, Qwen3.8 27B (UD-IQ3_S), 131.072 Token Kontext, lokal über llama.cpp. Die Box ist dabei voll ausgelastet: 95 % des Grafikspeichers belegt, bis zu 84 °C, rund 90 Watt.

MandantenhistorieLauf 1
50 Dateien
100
FallvergleichLauf 1 · Reihenfolge der Ereignisse falsch
50 Dateien
87
FallvergleichLauf 2 · 23,8 Min.
50 Dateien
100
Mandantenhistorie250er-Ordner · 31,8 Min.
250 Dateien
100
Fallvergleich1.000er-Ordner · 22,2 Min.
1.000 Dateien
100
Fallvergleichandere Beschleunigung (MTP2) · 30,8 Min.
50 Dateien
100
Mandantenhistorie1.000er-Ordner · 11,9 Min.
1.000 Dateien
100

Der einzige Punktverlust in sieben Läufen: Einmal standen die sechs Ereignisse eines Akts nicht in der richtigen Reihenfolge (13 Punkte Abzug). Derselbe Fall mit derselben Konfiguration im nächsten Lauf: 100. Für die ersten beiden Läufe gibt es noch kein Leistungsprotokoll, deshalb fehlt dort die Dauer.

Der direkte Vergleich

Dieselbe Aufgabe auf 8 und auf 16 GB

Direkt vergleichen lassen sich beide Setups in unserer zweiten Testreihe: drei Stufen Verwaltungsarbeit, bewertet mit je 100 Punkten, gemessen am 14. September 2026. Die ganze Messung steht im 8-GB-Bericht.

Arbeitsplatz-Laptop · 8 GB

Qwen3.5 9B

Modell
9 Milliarden Parameter, 65.536 Token Kontext
Erstmessung
drei Modelle auf 8 GB, neun Durchgänge, keiner bestanden
Bester Lauf
245 von 300 Punkten, nach Korrektur einer Konfigurationsdatei
Wiederholt
dieselbe Stufe dreimal: 100, 10 und 30 Punkte
Abbrüche
ja, darunter 15 Minuten Stillstand ohne eine geschriebene Datei
INROOM-Box · 16 GB

Qwen3.8 27B

Modell
27 Milliarden Parameter, 131.072 Token Kontext
Ergebnis
280 von 300 Punkten, zwei von drei Stufen bestanden
Punktverlust
nur die Wortwahl eines Mailentwurfs
Dauer
11,4 Minuten für alle drei Stufen
Abbrüche
keine

Der Unterschied liegt nicht in der besten Antwort. Auch das kleine Modell schafft einzelne Stufen fehlerfrei. Der Unterschied liegt darin, wie verlässlich überhaupt eine Antwort kommt. Auf 8 GB kann dieselbe Aufgabe einmal perfekt und beim nächsten Mal gar nicht gelöst werden. Die Box trägt ein dreimal größeres Modell mit doppelt so viel Kontext und hat in keinem unserer Läufe abgebrochen.

Dazu kommt ein praktischer Grund: Ein Windows-Arbeitsplatz belegt rund ein Achtel des Grafikspeichers, bevor die KI das erste Wort rechnet, und ein offener Browser noch einmal 861 MiB. Deshalb läuft das Modell bei uns auf einer eigenen Box, und der Arbeitsplatz bleibt frei für die Arbeit.

Was das für Ihre Kanzlei heißt

Die Testbox ist die Untergrenze

Die Box im Test ist ein Laptop mit 16 GB Grafikspeicher. Jedes System in unserem Preisrechner hat mehr, nämlich zwischen 24 und 128 GB. Mehr Speicher heißt mehr Spielraum: für längere Akten, mehrere Nutzer oder ein Modell mit weniger Kompression. Gemessen haben wir hier bewusst die kleinste Klasse.

Welche Hardware zu Ihrer Kanzlei passt, entscheiden wir nicht aus einem Datenblatt. Wir entscheiden es nach einem Test mit Aufgaben wie Ihren.

Was diese Messung noch nicht zeigt

  • Kleine Stichprobe. Sieben Läufe mit zwei Aufgaben, je Kombination ein oder zwei Durchgänge. Unsere eigene Testanleitung verlangt drei.
  • Der Wiener Test lief bisher nur auf der Box. Den direkten Vergleich mit 8 GB gibt es für die zweite Testreihe, für diesen Test noch nicht.
  • Synthetische Daten. Die Aufgaben sind echten Kanzlei-Abläufen nachgebaut, die Akten sind erfunden.
  • Zwei Messtage. Die Wiener Läufe stammen vom 26. August, der Direktvergleich vom 14. September.

Der nächste Schritt ist deshalb, jede Aufgabe dreimal auf beiden Setups laufen zu lassen. Diese Zahlen kommen dann ebenfalls hierher, auch wenn sie schlechter ausfallen.

Weiter