Guides
Welches Modell für welche Aufgabe
Keine Empfehlung, sondern ein Verfahren: fünf Aufgabenformen, vier Achsen, ein Messwerkzeug für eure eigenen Fälle. Unser 3B-Modell schaffte 4 von 10, die Attrappe auch; die Fehlliste ist der Unterschied.
- Stand

"Welches Modell sollen wir nehmen?" ist die Frage, die in jedem zweiten Gespräch kommt, und sie ist schwer zu beantworten — nicht weil die Antwort kompliziert wäre, sondern weil sie in drei Monaten nicht mehr stimmt. Modelle erscheinen im Wochentakt, Ranglisten ändern sich, und jeder Artikel mit einer Empfehlung ist bei Erscheinen bereits veraltet.
Deshalb steht hier keine Empfehlung. Hier steht, wonach ihr die Frage entscheidet, und ein Werkzeug, mit dem ihr sie in zwei Stunden an euren eigenen Fällen selbst beantwortet — und zwar wieder, wenn in sechs Monaten das nächste Modell da ist.
Fünf Aufgabenformen, und nur zwei davon sind anspruchsvoll
Was in Kanzleien und Beratungen tatsächlich anfällt, lässt sich in fünf Formen sortieren. Sie stellen sehr unterschiedliche Anforderungen.
- Zuordnen. Ein Dokument bekommt eine von wenigen Kategorien: Rechnung, Mahnung, Vertrag, Korrespondenz. Die Antwort ist kurz, die richtige Antwort ist bekannt, und die Aufgabe ist messbar. Hier reichen kleine Modelle fast immer.
- Herausziehen. Aus einem Text werden bestimmte Angaben geholt: Datum, Betrag, Beteiligte, Fristen. Ebenfalls messbar, ebenfalls gut für kleine Modelle — mit einer Einschränkung: Was nicht dasteht, darf nicht erfunden werden, und darin unterscheiden sich Modelle deutlich.
- Zusammenfassen. Aus zehn Seiten werden zehn Zeilen. Messbar nur mit Mühe, weil es mehrere richtige Antworten gibt. Mittlere Modelle genügen meist; die Frage ist weniger die Größe als die Anweisung.
- Formulieren. Ein Entwurf, ein Anschreiben, eine Passage. Hier ist der Abstand zwischen kleinen und großen Modellen am größten, und hier ist auch die Beurteilung am subjektivsten.
- Schlussfolgern über mehrere Schritte. Aus mehreren Dokumenten eine Folgerung ziehen, Widersprüche finden, eine Frist aus verschachtelten Klauseln bestimmen. Das ist die einzige Form, für die sich die sogenannten Denkmodelle wirklich lohnen — und die einzige, bei der kleine Modelle regelmäßig scheitern.
Die praktische Folgerung überrascht die meisten: Der weitaus größte Teil dessen, was in einer Kanzlei automatisiert wird, fällt in die ersten beiden Formen. Und dort ist die Modellwahl kaum entscheidend — die Qualität hängt an der Anweisung und an dem, was ihr dem Modell mitgebt, nicht an seiner Größe.
Wogegen ihr tauscht
Zwischen Modellen tauscht ihr entlang von vier Achsen, und drei davon werden regelmäßig übersehen.
Die Qualität ist die offensichtliche. Die Geschwindigkeit ist die, die über Annahme entscheidet: Ein Ablauf, der drei Sekunden braucht, wird benutzt; einer, der vierzig braucht, wird umgangen. Der Preis ist die, die erst bei Menge sichtbar wird — bei zwanzig Aufrufen am Tag ist jedes Modell billig, bei zwanzigtausend nicht. Und der Ort entscheidet darüber, ob das Vorhaben berufsrechtlich überhaupt möglich ist.
Diese vier ziehen nicht in dieselbe Richtung, und deshalb gibt es kein bestes Modell, sondern nur eins, das zu einer bestimmten Aufgabe passt. Es ist völlig normal, in einem Haus drei verschiedene im Einsatz zu haben: ein kleines für die Zuordnung von tausend Dokumenten am Tag, ein großes für die zwanzig Fälle, bei denen es auf Textqualität ankommt, und ein selbst betriebenes für alles, was das Haus nicht verlassen darf.
Denkmodelle sind nicht überall besser
Modelle, die vor der Antwort einen Denkschritt einlegen, sind bei mehrstufigen Aufgaben deutlich stärker. Bei einstufigen sind sie es nicht — sie brauchen dort nur länger und kosten mehr, weil die Denkschritte mitbezahlt werden.
Für eine Zuordnung in fünf Kategorien ist ein Denkmodell also die teurere und langsamere Art, dasselbe Ergebnis zu bekommen. Die Faustregel: Denkmodelle dort, wo ein Mensch auch überlegen müsste. Wo ein Mensch die Antwort auf einen Blick sieht, braucht es keins.
Die Messung, die ihr selbst machen könnt
Der belastbarste Weg zur Modellwahl ist unspektakulär: fünfzig eigene Fälle, bei denen ihr die richtige Antwort kennt, und ein Skript, das jedes in Frage kommende Modell dagegen laufen lässt. Das dauert einen halben Tag beim ersten Mal und danach zwanzig Minuten.
Was ihr dafür braucht: Python 3.12 ohne weitere Pakete, und ein Modell, das ihr ansprechen könnt. Für den Anfang reicht Ollama auf dem eigenen Rechner (Beitrag „Lokale Modelle: was das heißt“); für Anbieter außer Haus eine Adresse und ein Schlüssel. Und einen halben Tag für die Fälle.
Die Fälle liegen in einer JSON-Datei, ein Eintrag je Fall: Form, Anweisung, Eingabe, und entweder die erwartete Antwort oder Kriterien, wenn es keine einzige richtige gibt:
{"id": 1, "form": "zuordnen",
"system": "Ordne das Dokument genau einer Kategorie zu. Antworte nur mit der Kategorie: Rechnung, Mahnung, Vertrag, Korrespondenz, Sonstiges.",
"eingabe": "Sehr geehrte Damen und Herren, trotz unserer Zahlungserinnerung vom 12.08.2026 konnten wir zu Rechnung RE-2026-0042 über 499,80 EUR keinen Zahlungseingang feststellen.",
"erwartet": "Mahnung"}
{"id": 6, "form": "zusammenfassen",
"system": "Fasse den Vorgang in höchstens 30 Wörtern zusammen. Nenne den offenen Betrag und den Stand.",
"eingabe": "Rechnung RE-2026-0017 über 1.250,00 EUR ... zweite Mahnung mit Mahngebühr 5,00 EUR. Teilzahlung 500,00 EUR am 28.08.2026 ...",
"kriterien": {"max_woerter": 35, "muss_enthalten": ["755", "30.09.2026"]}}Für Zuordnen, Herausziehen und Schlussfolgern gibt es eine richtige Antwort, und die wird streng verglichen. Für Zusammenfassen und Formulieren gibt es keine; dort prüfen wir, ob die Pflichtangaben drinstehen, ob Verbotenes fehlt und ob die Länge eingehalten ist. Das ist gröber, aber es ist eine Messung, und die 755 in Fall 6 muss das Modell ausrechnen (1.250 minus 500 plus 5 Mahngebühr), nicht abschreiben.
Der Läufer spricht Ollama direkt an oder die Schnittstelle, die praktisch alle Anbieter und alle Server für den Eigenbetrieb verstehen: vLLM, LM Studio und die kommerziellen Anbieter gleichermaßen. Dadurch messt ihr alle Kandidaten mit demselben Skript, indem ihr nur Adapter, Adresse und Modellnamen tauscht:
python3 messung/messe.py aufgaben.beispiel.json --adapter ollama --modell llama3.2
python3 messung/messe.py aufgaben.beispiel.json --adapter openai --url https://api.anbieter.tld/v1 --modell gross --schluessel $KEY
python3 messung/auswertung.py messung/ergebnisse/llama3.2.jsonDie Auswertung sortiert nach den vier Achsen von oben. So sah sie am 19. September 2026 für llama3.2 aus, ein Modell mit 3,2 Milliarden Gewichten über Ollama auf einem Laptop, Temperatur 0:
Modell llama3.2 (ollama, 2026-09-19 10:45)
Ort lokal
Qualität 4/10 Treffer
zuordnen 1/2
herausziehen 1/2
zusammenfassen 1/2
formulieren 1/2
schlussfolgern 0/2
Tempo Median 0.3 s, langsamster Fall 1.9 s (Aufgabe 8)
Preis 1506 Tokens Eingabe, 554 Tokens Ausgabe für 10 Aufrufe; kein Preis je Token angegeben
Danebengelegen
Aufgabe 1 (zuordnen)
Erwartet Mahnung
Bekommen Rechnung
Aufgabe 4 (herausziehen)
Erwartet unbekannt
Bekommen 14
Aufgabe 6 (zusammenfassen)
Bekommen Der Vorgang besteht aus folgenden Schritten: 1. Rechnung vom 02.06.2026 ...
Grund fehlt: 755; 59 Wörter, erlaubt 35
Aufgabe 8 (formulieren)
Bekommen Sehr geehrte Damen und Herren, wir möchten Sie daran erinnern, dass ...
Grund fehlt: 03.10.2026
Aufgabe 9 (schlussfolgern)
Erwartet 21.09.2026
Bekommen Mittwoch, 13.10.2026.
Aufgabe 10 (schlussfolgern)
Erwartet 6 Wochen
Bekommen Keine KündigungsfristVier Angaben, und alle vier braucht ihr. Die Trefferquote sagt, ob es reicht. Der langsamste Fall sagt, ob es im Alltag benutzbar ist — der Median täuscht hier gern. Der Preis wird erst bei Menge sichtbar, deshalb rechnet die Auswertung auf Aufrufe je Tag hoch, sobald ihr einen Preis je Million Tokens angebt. Und die Liste der Fehlschläge ist die eigentliche Information: Sie sagt, welche Art von Fall Schwierigkeiten macht, und das ist die Grundlage für die nächste Verbesserung.
def vergleiche(erwartet, bekommen):
"""Absichtlich streng: normalisiert nur Rand und Groß-/Kleinschreibung.
Wer hier großzügig wird, misst sein eigenes Wunschdenken."""
return erwartet.strip().lower() == bekommen.strip().lower()Der strenge Vergleich ist eine bewusste Entscheidung. Es ist verlockend, "Rechnung." und "Es handelt sich um eine Rechnung" als Treffer zu zählen. Aber wenn das Ergebnis weiterverarbeitet wird, ist ein zusätzlicher Satz ein Fehler — und eine Messung, die nachsichtiger ist als der Ablauf danach, misst etwas, das es nicht gibt. Wenn ihr freiere Antworten braucht, ist das eine Frage an die Anweisung, nicht an den Vergleich.
Was der Lauf mit dem kleinen Modell zeigt
Vier von zehn ist keine Empfehlung gegen kleine Modelle. Es ist die Fehlliste, die zählt, und die liest sich genau entlang der fünf Formen von oben.
Beim Zuordnen hat das Modell eine Mahnung als „Rechnung“ eingeordnet, weil im Text eine Rechnungsnummer und ein Betrag stehen; die Gutschrift, unser bewusst schwerer Fall, hat es richtig. Beim Herausziehen hat es die Rechnungsnummer sauber geliefert und dann ein Zahlungsziel von „14“ Tagen genannt, das im Text nicht steht. Das ist der Fall, den wir für jedes Modell in die Sammlung legen: Was nicht dasteht, darf nicht erfunden werden, und ein 3B-Modell erfindet hier ohne Zögern. Beim Zusammenfassen war die Besprechungsnotiz in Ordnung, der Mahnvorgang nicht: 59 Wörter statt 35, und den offenen Betrag von 755 EUR hat es nicht ausgerechnet, sondern die Beträge aus dem Text aufgezählt. Beim Formulieren war die Terminbestätigung brauchbar, mit Datum, Uhrzeit und Halle; die Zahlungserinnerung nannte Nummer und Betrag, aber statt des Datums „innerhalb der nächsten 14 Tage ab heute“, dazu Platzhalter für Name und Kontaktdaten. Und beim Schlussfolgern ist es zweimal gescheitert: ein Fristende drei Wochen daneben, und „Keine Kündigungsfrist“ bei zwei Dokumenten, von denen das zweite die Frist ausdrücklich nennt.
Das ist das Muster aus dem Abschnitt über die Formen, an einem Nachmittag nachgemessen: Zuordnen und Herausziehen gehen, wenn die Anweisung das Erfinden ausdrücklich verbietet und die Prüfung danach den Rest fängt; Formulieren geht, solange nichts gerechnet werden muss; mehrstufiges Schlussfolgern geht mit dieser Größe nicht. Ob ein 8B- oder 32B-Modell die Fälle 9 und 10 schafft, haben wir nicht gemessen; das Skript ist dafür da, dass ihr es tut.
Die Attrappe liegt ebenfalls bei, ein kleiner Server mit Stichwortregeln, der die Schnittstelle nachbildet. Ihr Lauf endet ebenfalls bei 4 von 10: alle vier Zuordnungs- und Auslesefälle richtig, weil dafür ein Suchmuster reicht, und alle anderen falsch. Dieselbe Quote wie das Modell, und eines der beiden ist kein Modell. Wer nur die Quote liest, sieht keinen Unterschied. Richtet das Messwerkzeug erst auf die Attrappe, prüft, ob der Bericht so aussieht, wie ihr ihn braucht, und dann auf den echten Server. Das erspart die Fehlersuche an zwei Stellen gleichzeitig.
Wann ihr wechseln solltet
- Wenn die Trefferquote an euren Fällen bei einem Kandidaten deutlich höher liegt — deutlich heißt: mehr als die Schwankung zwischen zwei Läufen desselben Modells.
- Wenn der langsamste Fall aus dem erträglichen Bereich läuft. Menschen umgehen langsame Werkzeuge, ohne es zu melden.
- Wenn sich der Ort ändern muss, weil ein Mandat oder ein Berufsrecht es verlangt. Das ist kein Qualitätsargument und schlägt trotzdem alle anderen.
- Nicht, weil ein neues Modell in einer Rangliste oben steht. Ranglisten messen andere Aufgaben als eure.
Die kürzeste Fassung
Für Zuordnen und Herausziehen: das kleinste Modell, das eure Messung besteht. Für Zusammenfassen: ein mittleres, und mehr Mühe auf die Anweisung. Für Formulieren: das beste, das ihr an dieser Stelle einsetzen dürft. Für mehrstufiges Schlussfolgern: ein Denkmodell, und rechnet mit längeren Antwortzeiten.
Und für alles zusammen: fünfzig eigene Fälle, gezogen und nicht ausgesucht. Sie sind mehr wert als jede Empfehlung, die jemand ohne Kenntnis eurer Akten geben kann — unsere eingeschlossen.
Was das nicht kann
Es misst nicht, ob ein Text gut ist. Die Kriterien für Zusammenfassen und Formulieren prüfen Pflichtangaben, Verbote und Länge. Die Terminbestätigung von llama3.2 hat alle drei erfüllt und wäre so verschickbar; ein Text kann aber alle Kriterien erfüllen und im Ton daneben liegen. Für diese beiden Formen ersetzt die Fehlliste das Lesen nicht, sie sortiert nur vor.
Es misst nicht die Schwankung. Bei Temperatur 0 liefert ein Modell auf dieselbe Eingabe fast immer dieselbe Antwort, aber nicht immer, und ein Anbieter außer Haus kann das Modell hinter demselben Namen austauschen. Bevor ihr zwei Kandidaten vergleicht, lasst denselben zweimal laufen; der Unterschied zwischen den beiden Läufen ist die Schwelle, unter der ein Vorsprung nichts bedeutet.
Es misst nicht, was das Modell im Betrieb sieht. Zehn Fälle aus unserem Kopf sind eine Anschauung, fünfzig aus eurem Bestand eine Messung. Fall 2, die Gutschrift, ist bei uns mit „Rechnung“ hinterlegt, weil sie in der Buchhaltung als Rechnungskorrektur läuft; in eurem Haus kann dieselbe Entscheidung anders ausfallen, und dann ist die erwartete Antwort in der Datei zu ändern, nicht das Modell.
Zum Nachbauen
Das Paket zu diesem Beitrag enthält den Läufer, die Auswertung, den Aufgabensatz und die Attrappe. Entpacken, Ollama mit einem Modell starten oder Adresse und Schlüssel eines Anbieters bereitlegen, dann:
- aufgaben.beispiel.json: zehn Aufgaben, zwei je Form, mit erwarteter Antwort oder Kriterien; die eigenen fünfzig Fälle kommen an diese Stelle
- messung/messe.py: der Läufer mit den Adaptern ollama, openai und attrappe; schreibt Antworten, Tokens und Dauern nach messung/ergebnisse, mit Aufwärmaufruf bei Ollama
- messung/auswertung.py: Qualität je Form, Tempo, Preis mit Hochrechnung auf Aufrufe je Tag, Ort, und die Fehlliste mit Grund; nimmt mehrere Ergebnisdateien zum Vergleich
- messung/ergebnisse/: unsere beiden Läufe vom 19. September 2026, llama3.2 und Attrappe
- attrappe.py: das Modell, das keins ist, im Prozess oder als Server im OpenAI-Format, um den Adapter für Anbieter ohne Anbieter zu prüfen
Welches Modell für welche Aufgabe: Messwerkzeug, Aufgabensatz und Attrappe
HerunterladenStand dieses Artikels
Geschrieben am 12. September 2026, Messung und Paket ergänzt am 19. September 2026. Der abgedruckte Bericht stammt aus einem Lauf des Läufers gegen llama3.2 (3,2 Milliarden Gewichte, Q4_K_M) über Ollama 0.32.15 auf einem MacBook Pro mit M4 Pro und 24 GB, Python 3.12.2, Temperatur 0, Kontextfenster 8.192; der Attrappenlauf vom selben Tag. Andere Modelle haben wir mit diesem Aufgabensatz nicht gemessen; die Aussagen zu mittleren und großen Modellen in den Abschnitten über die Formen sind Erfahrung aus Kundenvorhaben, keine Messung von diesem Tag. Der openai-Adapter ist gegen die Attrappe als Server geprüft, nicht gegen einen Anbieter außer Haus. Die zehn Aufgaben sind erfunden; Firmen, Nummern und Beträge auch.
Was hier steht, ist so gebaut, dass es die nächsten Modellgenerationen überlebt: die Aufgabenformen, die vier Achsen, und ein Werkzeug, das ihr immer wieder anwerfen könnt.
Häufige Fragen
Wann lohnt sich ein Denkmodell?
Dort, wo auch ein Mensch überlegen müsste: mehrere Dokumente zusammenführen, Widersprüche finden, verschachtelte Klauseln auswerten. Unsere Fälle 9 und 10 sind von dieser Art, und das 3B-Modell hat beide verfehlt. Bei einstufigen Aufgaben wie einer Zuordnung ist ein Denkmodell nur die langsamere und teurere Art, dasselbe Ergebnis zu bekommen.
Wie wählt man die Testfälle aus?
Zufällig aus dem echten Bestand ziehen, nicht aussuchen. Wer aussucht, nimmt unwillkürlich die einfachen Fälle und misst 96 Prozent, wo im Betrieb 70 herauskommen. Faustregel: Wenn ihr bei keinem Fall selbst überlegen musstet, welche Antwort richtig ist, ist die Sammlung zu leicht. Und jeder Fall, der im Betrieb schiefgeht, kommt dazu.
Sollte man mehrere Modelle gleichzeitig einsetzen?
Das ist eher der Normalfall als die Ausnahme: ein kleines für Massenzuordnungen, ein großes für die wenigen Fälle mit Anspruch an die Textqualität, und gegebenenfalls ein selbst betriebenes für alles, was das Haus nicht verlassen darf. Ein Modell für alles ist fast immer an einer Stelle zu teuer und an einer anderen zu schwach. Der Läufer misst alle mit demselben Aufgabensatz, deshalb bleibt der Vergleich sauber.

Was ein automatisierter Ablauf wirklich kostet
Gefragt wird nach dem Preis pro Anfrage. Der macht rund ein Prozent aus. Drei Blöcke, eine durchgerechnete Beispielrechnung — und die Menge, an der alles kippt.

Warum es überzeugend falsch liegt
Eine erfundene Antwort klingt genau wie eine richtige. Abstellen lässt sich das nicht, aber ein Ablauf lässt sich so bauen, dass ein Irrtum auffällt. Vier Bauformen, an sieben Fällen mit einem kleinen Modell ausprobiert.

Was so ein Modell eigentlich tut
„Das weiß die KI doch." Ein Sprachmodell weiß nichts, es setzt fort. Was daraus folgt, ist die eine Unterscheidung, mit der sich fast jedes Vorhaben vorab einschätzen lässt.