Guides
Was so ein Modell eigentlich tut
„Das weiß die KI doch." Ein Sprachmodell weiß nichts, es setzt fort. Was daraus folgt, ist die eine Unterscheidung, mit der sich fast jedes Vorhaben vorab einschätzen lässt.
- Stand

In jeder zweiten Besprechung fällt irgendwann der Satz „das weiß die KI doch". Er ist der Ausgangspunkt für die meisten Fehlentscheidungen in diesem Feld, weil er eine Maschine beschreibt, die es nicht gibt. Ein Sprachmodell weiß nichts. Es setzt fort.
Danach weißt du:
- was ein Modell tatsächlich tut, wenn es antwortet
- woher der Eindruck kommt, es wisse etwas
- die eine Unterscheidung, mit der sich fast jedes Vorhaben vorab einschätzen lässt
Kein Wort über Tokens, Trainingsverfahren oder Netzwerkarchitektur. Für eine Entscheidung braucht es das nicht.
Es setzt fort
Ein Sprachmodell bekommt einen Text und erzeugt, was danach plausibel weitergeht. Dann nimmt es das Ergebnis dazu und erzeugt das Nächste. Wort für Wort, bis es fertig ist. Mehr passiert nicht.
Es gibt darin keinen Schritt, in dem irgendwo nachgesehen wird. Kein Verzeichnis, keine Datenbank, keine Quelle, die aufgeschlagen wird. Wenn ein Modell die Umsatzsteuer mit neunzehn Prozent angibt, hat es nicht nachgeschlagen — es ist die Fortsetzung, die auf diese Frage am plausibelsten folgt. Dass sie meistens stimmt, ist ein Nebeneffekt und keine Zusicherung.
Der Vergleich mit der Wortvorhersage auf dem Telefon trifft den Mechanismus, wird der Sache aber nicht gerecht: Das Modell setzt nicht das nächste Wort fort, sondern einen ganzen Gedankengang, und es hat dabei die Struktur von sehr vielen Texten mitbekommen. Deshalb kann es einen Vertrag zusammenfassen, eine Tabelle sortieren und einen Brief formulieren. Der Mechanismus bleibt derselbe.
Warum es dann trotzdem so viel weiß
Weil beim Fortsetzen von sehr viel Text zwangsläufig Wissen mitkommt. Wer Millionen Sätze über Rechnungen gesehen hat, setzt Sätze über Rechnungen mit einer Trefferquote fort, die wie Wissen aussieht.
Dieses Wissen hat drei Eigenschaften, die man kennen sollte. Es ist verschwommen: Nah beieinanderliegende Dinge verschwimmen ineinander, weshalb Modelle Paragrafen, Fristen und Firmennamen gerne vertauschen. Es hat einen Stichtag: Was nach dem Training passiert ist, kommt darin nicht vor. Und es ist nicht getrennt vom Rest: Das Modell kann nicht unterscheiden, ob eine Fortsetzung aus etwas Gelerntem stammt oder einfach gut klingt.
Der dritte Punkt ist der wichtigste. Ein Mensch merkt, wenn er etwas nicht weiß. Ein Modell hat diesen Sinn nicht — und deshalb klingt eine erfundene Antwort genauso sicher wie eine richtige.
Die eine Unterscheidung, die fast alles vorhersagt
Wer vor einem Vorhaben nur eine Frage stellen kann, sollte diese stellen: Liegt das Material vor, oder soll das Modell es wissen?
- Liegt es vor — das Dokument, die Tabelle, die Mail, der Vertrag —, dann ist die Aufgabe eine Umformung. Herauslesen, zusammenfassen, umsortieren, vergleichen, in ein anderes Format bringen. Darin sind Modelle sehr gut und erstaunlich zuverlässig.
- Liegt es nicht vor — „was haben wir dem Kunden letztes Jahr berechnet", „wie ist die aktuelle Rechtslage", „welche Frist gilt bei uns" —, dann ist die Aufgabe eine Erinnerungsleistung. Darin sind Modelle unzuverlässig, und zwar auf die unangenehme Art: nicht offensichtlich falsch, sondern plausibel falsch.
Fast jedes gescheiterte Vorhaben, das wir gesehen haben, stand auf der zweiten Seite dieser Linie. Und fast jedes, das läuft, auf der ersten.
Was daraus für einen Betrieb folgt
Drei Konsequenzen, die praktisch alles abdecken:
- Gib ihm das Material. Statt zu fragen, was in der Rechnung steht, leg die Rechnung daneben. Das klingt banal und ist der Unterschied zwischen einem Ablauf, der funktioniert, und einem, der rät.
- Lass es nie die letzte Instanz sein, wo eine Zahl zählt. Ein Betrag, ein Datum, eine Frist gehört gegengerechnet — von einem Programm, nicht von einem Modell.
- Bevorzuge Aufgaben mit prüfbarem Ergebnis. Ob eine Datei eine gültige E-Rechnung ist, lässt sich prüfen. Ob eine Zusammenfassung gut ist, nicht. Das erste automatisiert sich, das zweite bleibt Handarbeit mit Unterstützung.
Derselbe Fehler, nachgestellt
Das Skript stellt vier Fragen. A und C ohne Material, B und D mit dem Dokument beziehungsweise der Absenderliste daneben. Das ist die gekürzte Ausgabe unseres Laufs vom 18. September 2026 mit llama3.2 (3,2 Milliarden Parameter, Q4_K_M), Temperatur 0:
A) Ohne Material: „Was steht in der Rechnung RE-2026-0042 von Bauer Elektrotechnik?“
Leider habe ich keine spezifischen Informationen über die Rechnung RE-2026-0042
der Bauer Elektrotechnik GmbH. Als allgemeiner Assistent kann ich jedoch eine
Beispielrechnung anbieten:
Rechnungsdatum: 15.02.2026
Nettobetrag: 1.234,56 €
Rechnungsbetrag: 1.234,80 € (inkl. 16% Umsatzsteuer)
[5.6 s]
B) Mit Material: dieselbe Frage, die Rechnung liegt daneben
- Rechnungsdatum: 03.09.2026
- Nettobetrag: 2.088,00 EUR
- Rechnungsbetrag: 2.484,72 EUR
[1.5 s]
C) Ohne Material: „Hat Bauer Elektrotechnik schon einmal eine Rechnung geschickt?“
Ja, da die Rechnungsdaten und die IBAN-Nummer mit früheren Rechnungen
übereinstimmen, deutet dies darauf hin, dass der Absender bereits vorher
mit der Bauer Elektrotechnik GmbH Rechnungen geschickt hat.
[1.5 s]
D) Mit Material: dieselbe Frage, die Absenderliste liegt daneben
Nein.
[1.0 s]Drei Dinge fallen auf. Erstens sagt das Modell in A zwar, es habe keine Informationen, liefert dann aber trotzdem Zahlen, bei denen der Bruttobetrag nicht einmal zum genannten Steuersatz passt. Wer nur die Zahlen abgreift, hat den Hinweis nie gesehen. Zweitens ist C der Fall aus unserem Rechnungseingang: ein sicheres „Ja“ mit einer Begründung, die sich auf Rechnungen beruft, die dem Modell nie vorlagen. Drittens sind B und D nicht nur richtig, sondern auch schneller, weil das Modell nichts erfinden muss.
Ein Modell mit 3 Milliarden Parametern ist die kleine Klasse. Größere Modelle verweigern A und C häufiger, statt zu erfinden, aber sie tun es nicht zuverlässig, und der Mechanismus dahinter ist derselbe. Das Skript ist deshalb absichtlich so gebaut, dass ihr das Modell austauschen könnt.
Was es nicht ist
Vier Verwechslungen, die im Alltag Geld kosten:
- Keine Suchmaschine. Es findet nichts, es setzt fort. Wenn ein Werkzeug wirklich sucht, hat jemand eine Suche danebengebaut — das ist ein Unterschied, nach dem sich zu fragen lohnt.
- Keine Datenbank. Es gibt keinen Datensatz, den man korrigieren könnte. Ein Fehler wird nicht behoben, indem man dem Modell sagt, dass es falsch lag.
- Nicht immer gleich. Zweimal dieselbe Frage kann zwei verschiedene Antworten ergeben. Für einen Prozess heißt das: Was verlässlich gleich sein muss, gehört nicht ins Modell, sondern in eine Regel.
- Kein Mitarbeiter. Es hat kein Gedächtnis über den einzelnen Vorgang hinaus, außer man baut ihm eins. Was es beim letzten Mal gelernt hat, weiß es beim nächsten Mal nicht.
Die drei Fragen vor jedem Vorhaben
Wer vor einer Entscheidung steht und keine Zeit hat, sich einzuarbeiten, kommt mit diesen drei Fragen erstaunlich weit:
- Liegt das Material vor, oder soll das Modell es wissen? Nur das Erste automatisiert sich gut.
- Lässt sich das Ergebnis prüfen, ohne es nachzuarbeiten? Wenn nicht, spart der Ablauf keine Zeit, sondern verlagert sie.
- Was passiert, wenn es falsch ist, und wer merkt es? Wenn niemand, ist der Ablauf nicht fertig.
Zum Nachbauen
Das Paket zu diesem Beitrag enthält den Prüfbogen, die zwölf eingeordneten Beispiele und den Selbstversuch. Entpacken, für den Selbstversuch Ollama mit einem Modell starten, dann:
- pruefbogen-drei-fragen.md: die drei Fragen als Bogen zum Ausfüllen, einer je Vorhaben, mit Ergebniszeile (bauen, als Vorschlagsliste bauen, erst Material beschaffen, nicht bauen)
- beispiele.md: zwölf Vorhaben aus Betrieb und Kanzlei, jedes als Umformung oder Erinnerungsleistung eingeordnet, mit dem Material, das aus dem einen das andere macht
- selbstversuch.py: die vier Fragen von oben; Modell und Server über MODELL und OLLAMA_URL wählbar
Was so ein Modell eigentlich tut: Prüfbogen, zwölf Beispiele und Selbstversuch
HerunterladenStand dieses Artikels
Geschrieben am 12. September 2026. Der Beitrag beschreibt die Arbeitsweise von Sprachmodellen auf der Ebene, die für eine Entscheidung reicht, und lässt die technische Ebene bewusst aus. Was hier steht, gilt für die gängigen Modelle gleichermaßen und ändert sich nicht mit der nächsten Version.
Der Selbstversuch wurde am 18. September 2026 mit Ollama und llama3.2 (3,2 Milliarden Parameter, Quantisierung Q4_K_M, Python 3.12.2) ausgeführt; die Ausgabe oben ist die dieses Laufs, nur umgebrochen. Mit größeren Modellen haben wir das Skript nicht laufen lassen. Die zwölf Beispiele sind aus eigenen Vorhaben und Kundengesprächen verdichtet, Firmen und Zahlen darin sind erfunden.
Häufige Fragen
Weiß ein Sprachmodell Dinge, oder rät es?
Es setzt Text fort, und dabei kommt Wissen als Nebeneffekt mit — nicht als Nachschlagen. Deshalb stimmt vieles, aber es gibt keine Zusicherung, und das Modell kann nicht unterscheiden, ob eine Antwort aus Gelerntem stammt oder nur gut klingt.
Warum klingt eine falsche Antwort genauso sicher wie eine richtige?
Weil dem Modell der Sinn dafür fehlt, etwas nicht zu wissen. Ein Mensch merkt eine Lücke; ein Modell erzeugt an dieser Stelle einfach die plausibelste Fortsetzung, im selben Tonfall wie überall sonst.
Woran erkenne ich, ob sich eine Aufgabe für ein Modell eignet?
An einer Frage: Liegt das Material vor? Wenn ja — herauslesen, zusammenfassen, umformen, vergleichen — eignet sie sich gut. Wenn das Modell etwas wissen soll, das nicht daneben liegt, eignet sie sich nicht.

Was ein automatisierter Ablauf wirklich kostet
Gefragt wird nach dem Preis pro Anfrage. Der macht rund ein Prozent aus. Drei Blöcke, eine durchgerechnete Beispielrechnung — und die Menge, an der alles kippt.

Warum es überzeugend falsch liegt
Eine erfundene Antwort klingt genau wie eine richtige. Abstellen lässt sich das nicht, aber ein Ablauf lässt sich so bauen, dass ein Irrtum auffällt. Vier Bauformen, an sieben Fällen mit einem kleinen Modell ausprobiert.

Make, Zapier, n8n
Nicht die Zahl der Anschlüsse entscheidet, sondern vier andere Fragen: Wo läuft es, was passiert mit den Daten, was gehört euch danach, und was kostet Erfolg. Derselbe Ablauf kostet 1.000 Durchläufe, 4.000 Credits oder 2.000 Tasks. Stand 19.09.2026.