Alle Artikel

Neue Rechnungsvorlage, alte Prüfregeln: So erkennen KMU KI-Daten-Drift

von Claribill Redaktion·12. August 2026·7 Min. Lesezeit
Zwei Fachleute vergleichen in einer Bäckerei alte und neue Layouts von Lieferantenrechnungen.

Wenn ein Lieferant sein Rechnungsdesign ändert, kann eine zuvor zuverlässige KI plötzlich falsche Felder liefern. Das ist kein exotischer Modellfehler, sondern ein typischer Fall von Daten-Drift: Die Eingaben im laufenden Betrieb unterscheiden sich vom Material, mit dem das Verfahren getestet wurde. KMU sollten deshalb nicht nur die KI-Version überwachen, sondern auch Veränderungen bei Belegarten, Layouts, Sprachen und Übertragungswegen.

Der praktische Schutz besteht aus drei Ebenen: Veränderungen in den Eingaben sichtbar machen, kritische Felder unabhängig prüfen und die tatsächliche Fehlerquote regelmäßig anhand einer menschlich kontrollierten Stichprobe messen. Dieser Beitrag zeigt einen umsetzbaren Prozess für Buchhaltung und Rechnungseingang. Er beschreibt keine automatische Drift-Funktion von Claribill, sondern ein betriebliches Kontrollverfahren.

Was Daten-Drift bei Rechnungen bedeutet

Daten-Drift liegt vor, wenn sich die Eigenschaften der eingehenden Rechnungen verschieben. Ein Lieferant ersetzt beispielsweise eine tabellarische PDF durch ein grafisches Layout, druckt die IBAN an einer anderen Stelle oder liefert Rechnungen künftig als Foto statt als digitales PDF. Auch neue Sprachen, zusätzliche Währungen, andere Dezimaltrennzeichen oder ein wachsender Anteil an Gutschriften verändern den Belegmix.

Davon zu trennen ist Modell-Drift. Hier ändern sich Ergebnisse, weil der Anbieter Modell, Konfiguration oder Verarbeitungskette aktualisiert. In der Praxis können beide Effekte gleichzeitig auftreten. Für die Fehleranalyse ist die Unterscheidung wichtig: Ein neues Lieferantenlayout verlangt andere Testbelege und gegebenenfalls neue Prüfregeln; ein Modellwechsel verlangt einen reproduzierbaren Vergleich mit identischen Eingaben.

Warum eine stabile Durchschnittsquote täuschen kann

Angenommen, 95 von 100 Rechnungen werden weiterhin korrekt verarbeitet. Die Quote wirkt stabil. Wenn die fünf Fehler jedoch ausschließlich Bankdaten eines neuen Großlieferanten betreffen, ist das Risiko deutlich höher als bei fünf falsch gelesenen, nicht buchungsrelevanten Beschreibungen. Eine einzige Gesamtkennzahl verschleiert, welche Felder, Lieferanten oder Beleggruppen betroffen sind.

Die Messung sollte deshalb mindestens nach Lieferant, Dokumenttyp, Eingangsformat und kritischem Feld segmentiert werden. Für Zahlungsdaten, Bruttobetrag, Steuerbetrag, Rechnungsnummer und Leistungsdatum gelten andere Folgen als für interne Notizen. Das NIST AI Risk Management Framework empfiehlt, Messung und Bewertung in den Nutzungskontext einzubetten und Veränderungen über den Lebenszyklus zu beobachten.

Frühe Warnsignale im Rechnungseingang

SignalMögliche UrsachePrüfung
Mehr manuelle Korrekturen bei einem LieferantenNeues Layout oder ScanverfahrenVorher-/Nachher-Stichprobe vergleichen
Mehr leere PflichtfelderFeldposition oder Dokumenttyp geändertOriginalbelege und Extraktion paarweise prüfen
Warnquote sinkt trotz BeschwerdenFehler werden nicht erkanntWarnvollständigkeit mit Sollwerten messen
Bearbeitungszeit steigtMehr Fehlalarme oder unklare AusgabePrüfminuten je Beleggruppe erfassen
Neue DateiformateGeänderter LieferkanalFormat, Textlayer und Bildqualität protokollieren

Ein Warnsignal ist noch kein Beweis. Saisonale Effekte, neue Mitarbeitende oder eine kurzfristige Belegwelle können dieselben Kennzahlen verändern. Deshalb braucht es eine definierte Schwelle und anschließend eine fachliche Stichprobe, nicht sofort eine automatische Modellabschaltung.

Praxisbeispiel 1: Der neue Briefbogen eines Baustofflieferanten

Ein Installationsbetrieb erhält monatlich rund 180 Rechnungen von einem Baustofflieferanten. Nach einem Markenwechsel wandert die Rechnungsnummer in eine Seitenleiste, während eine Bestellnummer prominent über der Tabelle steht. Die KI übernimmt bei einem Teil der Belege die Bestellnummer als Rechnungsnummer. Der Gesamtfehleranteil bleibt klein, weil andere Lieferanten unverändert sind.

Die Buchhaltung erkennt den Effekt über eine lieferantenbezogene Korrekturquote. Sie sperrt keine Rechnungen pauschal, sondern setzt für diesen Lieferanten vorübergehend eine Pflichtprüfung der Rechnungsnummer. Zehn alte und zehn neue Belege werden mit dokumentierten Sollwerten verglichen. Erst nach erfolgreichem Nachtest wird die zusätzliche Kontrolle reduziert.

Praxisbeispiel 2: Fotos aus dem Außendienst

Ein Serviceunternehmen führt eine mobile Erfassung ein. Statt sauberer PDF-Dateien treffen nun Smartphone-Fotos ein, häufig mit Schatten oder angeschnittenem Rand. Betrag und Datum werden meist richtig gelesen, doch Steuerbetrag und UID fehlen häufiger. Die Ursache ist keine Änderung des KI-Modells, sondern ein neuer Eingangskanal mit anderer Bildqualität.

Der Betrieb trennt die Kennzahlen nach PDF, Scan und Foto. Für Fotos werden Mindestanforderungen an Schärfe, vollständige Ränder und Beleuchtung eingeführt. Unzureichende Bilder gehen in eine Ausnahme-Warteschlange. So wird die eigentliche Ursache behoben, statt die KI mit immer großzügigeren Toleranzen zu betreiben.

Ein Drift-Monitoring in sechs Schritten

1. Ausgangslage festhalten

Dokumentieren Sie einen Referenzzeitraum mit Belegzahlen, Lieferantenanteilen, Eingangsformaten, Feldgenauigkeit, Warnquote und manueller Prüfzeit. Ohne Ausgangswert lässt sich später nicht unterscheiden, ob eine Veränderung neu oder schon lange vorhanden ist.

2. Kritische Segmente bestimmen

Nicht jede Gruppe braucht dieselbe Detailtiefe. Priorisieren Sie große Lieferanten, hohe Rechnungsbeträge, Bankdatenänderungen, Fremdwährungen, Reverse-Charge-Fälle und Belege, die direkt eine Zahlung oder Buchung auslösen. Für seltene, aber folgenreiche Fälle kann eine feste Stichprobe sinnvoller sein als eine Prozentquote.

3. Veränderungen protokollieren

Erfassen Sie bekannte Modellupdates, neue Lieferanten, Layoutwechsel, geänderte Upload-Kanäle und neue Dokumenttypen mit Datum. Damit kann die Buchhaltung einen Kennzahlensprung zeitlich zuordnen. Das Protokoll sollte verantwortliche Person, Umfang und geplante Nachprüfung enthalten.

4. Kontrollstichproben ziehen

Prüfen Sie regelmäßig zufällige Belege und zusätzlich gezielt neue oder auffällige Gruppen. Vergleichen Sie Original, KI-Ausgabe und freigegebenes Ergebnis. Die Stichprobe muss auch Fälle ohne Warnung enthalten, denn unerkannte Fehler sind häufig gefährlicher als sichtbare Fehlalarme.

5. Schwellen und Reaktionen koppeln

Definieren Sie vorab, was bei einer Abweichung passiert. Eine leicht erhöhte Korrekturquote kann Beobachtung auslösen. Ein falscher Zahlungsempfänger oder eine unerkannte IBAN-Änderung sollte dagegen sofort zur manuellen Freigabe führen. Die Reaktion muss zur möglichen Schadenshöhe passen.

6. Nachtest und Rückkehr dokumentieren

Zusätzliche Kontrollen dürfen nicht stillschweigend verschwinden. Halten Sie fest, welches Testset verwendet wurde, welche Ergebnisse erreicht wurden und wer die Rückkehr zum Normalbetrieb freigegeben hat. So bleibt nachvollziehbar, warum eine Regel gelockert oder beibehalten wurde.

Österreich und Deutschland: Datenschutz bleibt Teil der Kontrolle

Rechnungen enthalten personenbezogene Daten, Kontaktdaten und teilweise sensible Geschäftsinformationen. Für österreichische und deutsche Unternehmen gelten die Vorgaben der DSGVO. Die österreichische Datenschutzbehörde weist bei KI-Anwendungen unter anderem auf Zweck, Rechtsgrundlage, Transparenz und Betroffenenrechte hin. Der EDPB behandelt Risiken und Minderungsmaßnahmen für große Sprachmodelle.

Für Drift-Analysen sollten nur die erforderlichen Daten gespeichert werden. Häufig reichen pseudonymisierte Kennzahlen, Lieferantengruppen und dokumentierte Fehlerarten. Originalbelege gehören in kontrollierte Zugriffsbereiche. Ein externes Analysewerkzeug darf nicht automatisch alle Rechnungsinhalte erhalten, nur weil es Diagramme erzeugen kann.

Typische Fehler im Betrieb

  • Nur eine globale Trefferquote beobachten.
  • Warnungen zählen, aber unerkannte Fehler nicht suchen.
  • Modellupdate und neuen Belegmix in derselben Auswertung vermischen.
  • Neue Lieferantenlayouts ohne Referenzbelege übernehmen.
  • Kontrollschwellen erst nach einem Vorfall definieren.
  • Zusätzliche manuelle Prüfzeit nicht als Kostenfaktor erfassen.
  • Originalbelege für Analysen unkontrolliert kopieren.
  • Temporäre Sonderregeln ohne Enddatum weiterlaufen lassen.

Checkliste für die Buchhaltung

Ein einfaches Messblatt statt eines komplexen Überwachungssystems

Für den Einstieg genügt häufig eine strukturierte Tabelle. Jede kontrollierte Rechnung erhält eine Beleggruppen-ID, Eingangsformat, Lieferantengruppe, Prüfdatum und die Information, ob das Layout neu oder bekannt war. Für jedes kritische Feld wird festgehalten: korrekt, falsch, leer oder nicht anwendbar. Zusätzlich notiert die prüfende Person, ob die KI selbst gewarnt hat und wie viele Minuten die Klärung beanspruchte.

Aus diesen Angaben entstehen vier unterschiedliche Kennzahlen. Die Feldfehlerquote zeigt die fachliche Leistung. Die Warnvollständigkeit zeigt, welcher Anteil tatsächlicher Fehler sichtbar gemacht wurde. Die Fehlalarmquote zeigt, wie oft Mitarbeitende ohne echten Befund unterbrochen wurden. Die Bearbeitungszeit macht sichtbar, ob eine vermeintlich genaue Lösung im Alltag dennoch teuer ist. Keine dieser Zahlen sollte durch eine andere ersetzt werden.

Vergleichen Sie nicht jeden kleinen Tageswert. Bei wenigen Belegen springen Prozentzahlen stark. Sinnvoller sind rollierende Zeiträume und Mindestmengen, ergänzt um sofortige Ereignisregeln für kritische Fehler. Eine falsche IBAN kann eine Sofortprüfung auslösen, auch wenn die Monatsquote noch unauffällig ist. Drei harmlose Fehlalarme in einer kleinen Gruppe rechtfertigen dagegen zunächst Beobachtung statt Eskalation.

Das Messblatt braucht eine klare Zuständigkeit. Die Buchhaltung prüft fachliche Sollwerte, IT oder Anbieter liefern technische Versionsinformationen, und eine benannte verantwortliche Person entscheidet über Sonderkontrollen. Damit wird Drift nicht zu einem anonymen Diagramm, sondern zu einem Prozess mit nachvollziehbaren Entscheidungen.

Was nach einer bestätigten Abweichung zu tun ist

Bestätigt die Stichprobe eine relevante Verschlechterung, sollte der Betrieb den betroffenen Umfang begrenzen. Das kann eine Lieferantengruppe, ein Dateiformat oder ein bestimmtes Feld sein. Setzen Sie dort eine zusätzliche Prüfung, statt vorschnell alle Automatisierung abzuschalten. Gleichzeitig sichern Sie Beispielbelege, Sollwerte, Protokolle und Versionsangaben für die Ursachenanalyse.

Danach folgt ein kontrollierter Nachtest. Änderungen an Prompt, Modell, Vorverarbeitung oder Regelwerk werden jeweils einzeln dokumentiert. Werden mehrere Stellschrauben gleichzeitig verändert, bleibt unklar, was die Verbesserung bewirkt hat. Der Nachtest verwendet sowohl die auffälligen Fälle als auch unveränderte Referenzbelege, damit eine lokale Korrektur nicht an anderer Stelle neue Fehler erzeugt.

  • Referenzwerte je kritischem Feld festlegen.
  • Lieferanten, Dokumenttypen und Eingangsformate segmentieren.
  • Neue Layouts und Kanäle mit Datum protokollieren.
  • Zufällige und risikobasierte Stichproben kombinieren.
  • Fälle ohne KI-Warnung ausdrücklich kontrollieren.
  • Schwellen mit abgestuften Reaktionen verbinden.
  • Bankdaten gegen freigegebene Stammdaten prüfen.
  • Nachtests und Freigaben nachvollziehbar dokumentieren.

Claribill-Inhalte für die Umsetzung

Die Claribill-Sicherheitsseite beschreibt öffentlich dokumentierte Schutzprinzipien. Zur Trennung von Modelländerung und fachlicher Kontrolle passt der Beitrag KI-Modellwechsel nachvollziehbar dokumentieren. Für mangelhafte Eingangsbilder hilft der Leitfaden KI-OCR und Scanqualität. Eine integrierte Drift-Erkennung wird hier nicht behauptet.

Die wichtigsten Takeaways

Daten-Drift beginnt oft unspektakulär: ein neues Layout, ein anderer Upload-Kanal oder eine verschobene Lieferantenstruktur. Gefährlich wird sie, wenn eine stabile Gesamtquote kritische Feldfehler verdeckt. KMU brauchen deshalb segmentierte Kennzahlen, kontrollierte Stichproben und vorab definierte Reaktionen.

Die stärkste Kontrolle verbindet Technik und Fachprozess. Eine KI darf Veränderungen anzeigen, aber Buchhaltung und Verantwortliche bewerten deren Bedeutung. Kritische Zahlungs- und Steuerdaten bleiben bis zum erfolgreichen Nachtest unter einer angemessenen menschlichen Kontrolle.

FAQ

Wie oft sollte ein Drift-Check stattfinden?

Das hängt von Belegmenge und Risiko ab. Ein monatlicher Trend plus gezielte Prüfung bei Modell-, Layout- oder Kanaländerungen ist für viele KMU ein praktikabler Start. Bei vollautomatischen Folgeaktionen sind engere Kontrollen sinnvoll.

Reicht die Korrekturquote der Mitarbeitenden?

Nein. Sie zeigt nur erkannte und korrigierte Fehler. Ergänzen Sie Stichproben aus scheinbar unauffälligen Belegen, damit auch unerkannte Fehler sichtbar werden.

Muss bei jedem neuen Layout alles gestoppt werden?

Nicht zwingend. Risikobasiert kann eine zusätzliche Pflichtprüfung für einzelne Felder oder Lieferanten genügen. Kritische Abweichungen brauchen strengere Reaktionen als kosmetische Änderungen.

Quellen

Verwandte Artikel

Kommentare

Noch keine Kommentare. Schreiben Sie den ersten.

    Kommentar schreiben

    Mit dem Absenden stimmen Sie der Verarbeitung gemäß Datenschutzerklärung zu. Kommentare werden vor Veröffentlichung geprüft.