Guides
Warum es überzeugend falsch liegt
Eine erfundene Antwort klingt genau wie eine richtige. Abstellen lässt sich das nicht, aber ein Ablauf lässt sich so bauen, dass ein Irrtum auffällt. Vier Bauformen, an sieben Fällen mit einem kleinen Modell ausprobiert.
- Stand

Das Unangenehme an einer falschen Antwort ist nicht, dass sie falsch ist. Es ist, dass sie genauso klingt wie eine richtige — gleicher Tonfall, gleiche Bestimmtheit, gleiche saubere Formulierung. Wer darauf wartet, dass ein Modell unsicher wirkt, bevor er nachprüft, wartet vergeblich.
Danach weißt du:
- warum sich das nicht abstellen lässt
- an welchen vier Stellen es zuverlässig passiert
- wie man einen Ablauf so baut, dass ein Irrtum nichts kostet
Es ist kein Fehler, den man abstellt
Ein Modell setzt Text fort. Wo es etwas Gelerntes gibt, sieht die Fortsetzung wie Wissen aus. Wo es nichts gibt, sieht sie immer noch wie Wissen aus, denn die Maschine kennt den Unterschied nicht. Sie hat keine Stelle, an der ein Lämpchen angeht.
Deshalb gibt es keine Einstellung, die das behebt, und keinen Anbieter, bei dem es nicht vorkommt. Was es gibt, sind Abläufe, in denen ein Irrtum auffällt, bevor er wirkt — und Abläufe, in denen er direkt in die Buchhaltung läuft. Der Unterschied liegt nicht am Modell, sondern an dem, was drumherum gebaut ist.
Vier Stellen, an denen es zuverlässig passiert
Es passiert nicht gleichmäßig verteilt, sondern schwerpunktmäßig. Wer diese vier kennt, hat den größten Teil abgedeckt:
- Zahlen aus dem Gedächtnis. Preise, Fristen, Sätze, Grenzwerte. Sie klingen präzise, weil Zahlen präzise klingen. Eine Zahl, die nicht im vorliegenden Material steht, ist immer verdächtig.
- Belegstellen. Paragrafen, Normen, Aktenzeichen, Quellenangaben. Die Form stimmt fast immer — es sieht aus wie eine echte Fundstelle — und der Inhalt passt oft nicht dazu. Das ist die teuerste Sorte, weil eine Fundstelle Prüfung vortäuscht.
- Vollständige Aufzählungen. Fragt man nach den Anforderungen, kommen gern fünf, auch wenn es vier sind. Eine Liste will voll werden.
- Randfälle des eigenen Betriebs. Alles, was nur bei euch so heißt oder so läuft. Das Modell hat es nie gesehen und setzt fort, wie es anderswo üblich ist.
Warum „sag mir, wenn du unsicher bist" wenig hilft
Der Satz steht in vielen Anweisungen und wirkt weniger, als man hofft. Auch die Einschätzung der eigenen Sicherheit ist eine Fortsetzung — das Modell erzeugt eine plausibel klingende Selbsteinschätzung, nicht eine gemessene.
Was dagegen wirkt, ist eine Anweisung, die auf etwas Prüfbares zeigt: nur antworten, was im vorliegenden Dokument steht, und ausdrücklich melden, wenn es dort nicht steht. Damit ist die Unsicherheit keine Selbstbeobachtung mehr, sondern eine Aussage über ein Dokument — und die kann stimmen oder nicht stimmen.
Vier Bauformen, mit denen man damit lebt
Keine davon macht das Modell besser. Alle vier machen den Irrtum folgenlos:
- Material danebenlegen. Die Frage „was steht in dieser Rechnung" ist eine andere Aufgabe als „was kostet so etwas üblicherweise". Die erste hat eine überprüfbare Grundlage, die zweite nicht.
- Rechnen und Lesen trennen. Das Modell liest die Zahlen aus dem Dokument, ein Programm rechnet damit. Kein Modell soll addieren, wenn es auf die Summe ankommt — nicht weil es nicht kann, sondern weil man das Ergebnis dann prüfen kann.
- Ergebnisse prüfbar machen. Eine Aussage, die sich gegen etwas halten lässt — eine Datei, eine Liste, eine Rechnung —, kann automatisch geprüft werden. Eine Einschätzung nicht. Das entscheidet, ob ein Ablauf ohne Aufsicht laufen darf.
- Stichproben statt Vertrauen. Auch ein Ablauf, der seit Monaten läuft, bekommt einmal im Monat zehn Vorgänge von Hand nachgesehen. Das ist keine Bürokratie, sondern die einzige Art zu merken, dass sich etwas verschoben hat.
Die vier Bauformen, an einem kleinen Modell ausprobiert
Zu jeder Bauform gehört im Paket eine Prompt-Vorlage und eine Regel, gegen die ein Programm die Antwort hält. Das Skript gegenprobe.py stellt sieben Fragen zu zwei erfundenen Dokumenten, einer Rechnung und einer Verfahrensanweisung zur Belegaufbewahrung, und prüft jede Antwort. Das ist die Zusammenfassung unseres Laufs vom 18. September 2026 mit llama3.2, drei Läufe je Fall:
Fall Bauform Regel bestanden Befund
F1 Fundstellenpflicht fundstellen 3/3 § 147 Abs. 3 AO, acht Jahre: beides steht im Dokument
F2 Fundstellenpflicht fundstellen 0/3 Beleg „Abschnitt 2.1“, den es nicht gibt
F3 Fundstellenpflicht zahlen 3/3 Modell hat sich enthalten statt 14 Tage auszurechnen
F4 Gegenrechnung gegenrechnung 3/3 Positionen 2088.00, Steuer 396.72, Brutto 2484.72
F5 Enthaltung erlaubt enthaltung 3/3 „Nicht im Dokument.“ auf die Kundennummer
F6 Enthaltung erlaubt enthaltung 3/3 Antwort gegeben, weil sie im Dokument stand
F7 Zweite Instanz zweite_instanz 0/3 Prüfer: BESTANDEN; Regel: Abschnitt 2.1 gibt es nichtDie Regeln sind bewusst mechanisch. Die Regel „fundstellen“ zieht jede Vorschrift in der Form „§ 147 AO“ und jede Abschnittsnummer aus der Antwort und sieht nach, ob sie im Dokument vorkommt. Das ist der Kern:
def regel_fundstellen(antwort, dokument, fall):
im_dok = fundstellen_in(dokument)
genannt = fundstellen_in(antwort)
fremd = sorted(genannt - im_dok)
hinweise = []
if fremd:
hinweise.append("Vorschrift nicht im Dokument: " + ", ".join(f"§ {p} {g}" for p, g in fremd))
falsche_abschnitte = sorted(set(ABSCHNITT.findall(antwort)) - abschnitte_in(dokument))
if falsche_abschnitte:
hinweise.append("Abschnitt gibt es nicht im Dokument: " + ", ".join(falsche_abschnitte))Mehr Intelligenz steckt da nicht drin, und das ist der Punkt. Ob „§ 147 Abs. 3 AO“ wirklich acht Jahre für Buchungsbelege sagt, kann die Regel nicht wissen; das haben wir am selben Tag im Normtext nachgelesen. Was die Regel kann: feststellen, dass eine Belegstelle in der Antwort steht, die im Material nicht vorkommt. Und genau das ist die teuerste Sorte Irrtum.
Drei Dinge aus dem Lauf, die wir nicht erwartet hatten:
- Bei F3 hätten wir gewettet, dass das Modell aus „Rechnungsdatum 03.09.2026“ und „zahlbar bis 17.09.2026“ die 14 Tage ausrechnet, und die Regel hätte das gemeldet, weil 14 nirgends im Dokument steht. Stattdessen hat es sich enthalten. Die Regel bleibt trotzdem so streng: Eine abgeleitete Zahl ist eine Rechnung, und Rechnen gehört ins Programm.
- Die zweite Instanz, also dasselbe Modell als Prüfer, hat in einem Vorabversuch einen eingebauten Zusatz „§ 257 HGB“ zuverlässig gefunden. Den erfundenen „Abschnitt 2.1“ in F7 hat sie dreimal durchgewinkt. Erst die mechanische Regel, die im Skript hinter dem Prüfer läuft, hat ihn gemeldet. Ein Prüfermodell ersetzt die Regel nicht; es ergänzt sie.
- Mit der Prüfanweisung im System-Teil der Anfrage hat llama3.2 die Anweisung zitiert oder Rückfragen gestellt, statt zu prüfen, in drei von drei Läufen. Mit derselben Anweisung am Ende der Nutzernachricht hält es das Format ein. Bei einem Modell mit 3 Milliarden Parametern entscheidet so etwas, ob eine Bauform überhaupt läuft. Die Vorlage im Paket ist deshalb so aufgebaut.
Was das für die Auswahl eines Anbieters heißt
Wer im Verkaufsgespräch sagt, seine Lösung halluziniere nicht, weiß es entweder nicht besser oder sagt nicht die Wahrheit. Beides ist ein Grund, vorsichtig zu werden.
Die nützlichere Frage lautet nicht, ob es passiert, sondern: Was passiert dann? Wer merkt es? Und woran? Ein Anbieter, der darauf konkret antwortet — mit Prüfschritten, Protokollen und einer Stelle, an der ein Mensch draufsieht —, hat sich mit dem Thema befasst. Wer stattdessen von einer besonders guten Datenbasis spricht, ist ausgewichen.
Zum Nachbauen
Das Paket zu diesem Beitrag enthält die vier Bauformen als Arbeitsblatt, zu jeder eine Prompt-Vorlage und das Skript, mit dem die Zusammenfassung oben entstanden ist. Entpacken, Ollama mit einem Modell starten, dann:
- bauformen.md: die vier Bauformen mit dem, was sie fangen und was nicht, und der Stichprobe, die immer dazugehört
- prompts/fundstellenpflicht.md, prompts/gegenrechnung.md, prompts/enthaltung-erlaubt.md, prompts/zweite-instanz.md: je Bauform Systemanweisung, Aufbau der Nachricht, Beispiel und Grenze
- gegenprobe.py: stellt die Fälle aus faelle.json an ein Modell und prüft jede Antwort gegen die passende Regel; Modell und Prüfermodell über MODELL und MODELL_PRUEFER wählbar
- faelle.json: die zwei erfundenen Dokumente und die sieben Fragen, mit Erwartung je Fall; eigene Fälle lassen sich anhängen
Warum es überzeugend falsch liegt: vier Bauformen, vier Prompt-Vorlagen und die Gegenprobe
HerunterladenStand dieses Artikels
Geschrieben am 12. September 2026. Das Verhalten, das hier beschrieben wird, ist keine Eigenheit eines bestimmten Anbieters und verschwindet nicht mit der nächsten Modellversion. Neuere Modelle irren seltener; sie irren weiterhin im selben Tonfall.
Die Gegenprobe wurde am 18. September 2026 mit Ollama und llama3.2 (3,2 Milliarden Parameter, Q4_K_M, Python 3.12.2) ausgeführt, drei Läufe je Fall, Temperatur 0. Die Zahlen oben sind die dieses Laufs. Mit einem größeren Modell oder einem anderen Modell als zweite Instanz haben wir nicht geprüft. Die Fristen in der erfundenen Verfahrensanweisung (acht Jahre für Rechnungen nach § 14b Abs. 1 UStG, acht Jahre für Buchungsbelege nach § 147 Abs. 3 AO) haben wir am 18. September 2026 bei gesetze-im-internet.de nachgelesen.
Häufige Fragen
Warum erfindet ein Sprachmodell Fundstellen und Zahlen?
Weil es Text fortsetzt und dabei nicht unterscheiden kann, ob eine Fortsetzung aus etwas Gelerntem stammt oder nur plausibel klingt. Eine Fundstelle hat eine sehr regelmäßige Form, die sich leicht fortsetzen lässt — deshalb stimmt die Form fast immer und der Inhalt oft nicht.
Kann man das abstellen?
Nein. Es gibt keine Einstellung dafür und keinen Anbieter, bei dem es nicht vorkommt. Was geht, ist der Ablauf drumherum: Material danebenlegen, Rechnen und Lesen trennen, Ergebnisse prüfbar machen und regelmäßig Stichproben ziehen.
Hilft es, das Modell nach seiner Sicherheit zu fragen?
Kaum, denn auch die Selbsteinschätzung ist eine Fortsetzung und keine Messung. Wirksam ist stattdessen die Anweisung, nur wiederzugeben, was im vorliegenden Dokument steht, und ausdrücklich zu melden, wenn es dort nicht steht.
Reicht ein zweites Modell als Prüfer?
Nein. In unserem Lauf hat der Prüfer einen eingebauten falschen Paragrafen gefunden, einen erfundenen Abschnitt aber dreimal durchgewinkt. Die zweite Instanz senkt die Quote; die mechanische Regel und die monatliche Stichprobe bleiben.

Was ein automatisierter Ablauf wirklich kostet
Gefragt wird nach dem Preis pro Anfrage. Der macht rund ein Prozent aus. Drei Blöcke, eine durchgerechnete Beispielrechnung — und die Menge, an der alles kippt.

Was so ein Modell eigentlich tut
„Das weiß die KI doch." Ein Sprachmodell weiß nichts, es setzt fort. Was daraus folgt, ist die eine Unterscheidung, mit der sich fast jedes Vorhaben vorab einschätzen lässt.

Make, Zapier, n8n
Nicht die Zahl der Anschlüsse entscheidet, sondern vier andere Fragen: Wo läuft es, was passiert mit den Daten, was gehört euch danach, und was kostet Erfolg. Derselbe Ablauf kostet 1.000 Durchläufe, 4.000 Credits oder 2.000 Tasks. Stand 19.09.2026.