Unscharf, schief, abgeschnitten: Wie KI Rechnungs-Scans zuverlässig ausliest

KI kann einen schlechten Rechnungs-Scan nicht zuverlässig „gesundrechnen“. Fehlen Seitenränder, sind Ziffern überbelichtet oder liegt ein Stempel auf dem Steuerbetrag, kann ein Modell trotzdem plausible Werte liefern. Für KMU ist deshalb nicht nur die Trefferquote wichtig, sondern ein kontrollierter Erfassungsprozess: Bildqualität prüfen, kritische Felder am Original vergleichen, Unsicherheit sichtbar machen und unbrauchbare Belege neu anfordern.
Dieser Leitfaden erklärt, welche Qualitätsmerkmale im Rechnungseingang zählen, wie Sie eine kleine Teststrecke aufbauen und wann ein Scan trotz lesbarer Einzelwerte nicht als verlässliche Arbeitsgrundlage taugt.
OCR, Dokumenten-KI und Originalbeleg unterscheiden
OCR wandelt sichtbare Zeichen in maschinenlesbaren Text um. Dokumenten-KI geht weiter: Sie ordnet Textstellen Feldern wie Rechnungsnummer, Datum, Netto, Steuer, Brutto oder IBAN zu. Beide Schritte können Fehler enthalten. Ein korrekt erkanntes Zeichen kann dem falschen Feld zugeordnet werden; ein falsch erkanntes Zeichen kann in einem plausiblen Gesamtwert verschwinden.
Der Originalbeleg bleibt deshalb die Referenz. Erfassungsergebnis, normalisierter Wert und Originaldarstellung sollten getrennt nachvollziehbar sein. Wird etwa „8.760,00“ als „3.760,00“ erkannt, darf eine nachträgliche Korrektur nicht so wirken, als hätte der falsche Wert nie existiert.
| Qualitätsproblem | Typischer KI-Fehler | Sichere Reaktion |
|---|---|---|
| Abgeschnittener Rand | UID, Seitennummer oder Betrag fehlt | Vollständigkeit stoppen und neu erfassen |
| Schräglage | Zeilen oder Spalten werden vermischt | Geraderichten, erneut auslesen, vergleichen |
| Geringer Kontrast | 8, 3, 6 oder 0 werden verwechselt | Kritische Zahlen am Original prüfen |
| Stempel oder Handschrift | Gedruckter Wert wird überlagert | Manuelle Sichtprüfung und Kennzeichnung |
| Mehrseitiger Beleg | Folgeseite oder Anlage fehlt | Seitenzahl und Zusammengehörigkeit prüfen |
| Foto mit Perspektive | Positionsspalten verschieben sich | Neu fotografieren oder Flachscan anfordern |
Vollständigkeit kommt vor Lesbarkeit
Ein scharfes Bild kann trotzdem unvollständig sein. Prüfen Sie deshalb zuerst, ob alle Seiten, Ränder und Anlagen vorhanden sind. Bei einer Rechnung mit „Seite 1 von 2“ darf die Verarbeitung nicht fortfahren, wenn Seite 2 fehlt. Gleiches gilt für eingebettete XML-Daten oder Leistungsnachweise, die zum konkreten Vorgang gehören.
Eine KI sollte fehlende Informationen nicht aus ähnlichen Belegen ergänzen. Ein vermuteter Lieferant oder Betrag ist kein Beleginhalt. Das System kann eine mögliche Zuordnung vorschlagen, muss die Lücke aber sichtbar lassen.
Auflösung ist nur ein Teil der Qualität
Mehr Pixel verbessern nicht automatisch das Ergebnis. Kompression, Bewegungsunschärfe, Reflexionen, Schatten und Perspektive können auch ein großes Bild unbrauchbar machen. Für die Praxis ist entscheidend, ob kleine Zeichen, Dezimaltrennzeichen und Konturen stabil erkennbar sind.
Definieren Sie keine einzelne technische Zahl als Freifahrtschein. Testen Sie stattdessen typische Eingänge: Scanner, Smartphone, E-Mail-PDF, Thermobeleg und Foto aus einer Baustelle. Für jede Gruppe wird festgelegt, welche Felder automatisch übernommen werden dürfen und welche einen Sichtvergleich brauchen.
Kritische Felder brauchen stärkere Kontrollen
Nicht jeder OCR-Fehler hat dieselbe Wirkung. Eine falsch erkannte Postleitzahl kann die Lieferantensuche erschweren; eine falsche IBAN oder Bruttosumme kann unmittelbar Geld kosten. Ordnen Sie Felder daher nach Risiko:
- Finanziell kritisch: Brutto, Steuerbetrag, Währung, IBAN und Zahlungsempfänger.
- Steuerlich relevant: Rechnungsdatum, Leistungsdatum, UID, Steuersatz und Steuerhinweise.
- Prozessrelevant: Rechnungsnummer, Bestellung, Projekt und Leistungszeitraum.
- Stammdatenbezogen: Name, Anschrift und Kontaktdaten.
Eine Konfidenzanzeige kann priorisieren, ersetzt aber keine risikobasierte Regel. Ein Modell kann bei einem falschen Wert sehr sicher wirken. Kritische Änderungen, insbesondere Bankdaten, verlangen zusätzlich einen unabhängigen Abgleich.
Wann automatische Nachbearbeitung hilft
Geraderichten, Zuschneiden, Rauschminderung und Kontrastanpassung können die Erkennung verbessern. Bewahren Sie jedoch die ursprüngliche Datei und dokumentieren Sie, welche Verarbeitungsschritte angewendet wurden. Eine optimierte Arbeitskopie darf nicht unbemerkt zum vermeintlichen Original werden.
Übertriebene Nachschärfung kann Zeichen verändern. Deshalb wird die optimierte Version gegen die Ausgangsdatei geprüft. Bei rechtlich oder finanziell kritischen Zweifeln ist ein neuer Beleg besser als eine aggressive Bildkorrektur.
BSI TR-RESISCAN als Qualitätsrahmen
Die Technische Richtlinie BSI TR-03138 zum ersetzenden Scannen betrachtet den Scanprozess umfassender als nur die Zeichenerkennung. Sie adressiert unter anderem Strukturanalyse, Verantwortlichkeiten, Verfahrensdokumentation und Schutzbedarf. Für private KMU ist eine Zertifizierung nicht automatisch vorgeschrieben. Die Denkweise ist trotzdem hilfreich: Qualität entsteht durch einen beherrschten Prozess, nicht durch ein einzelnes KI-Modell.
Der Leitfaden ist besonders relevant, wenn Papieroriginale nach dem Scannen vernichtet werden sollen. Ob das zulässig und sinnvoll ist, hängt vom Dokument, von Beweiswert und nationalen Anforderungen ab. Der Beitrag Papierbelege digitalisieren: Wann das Original bleiben muss ordnet diese Frage für KMU ein.
Praxisbeispiel 1: Baustellenfoto in Österreich
Ein österreichischer Handwerksbetrieb fotografiert eine Materialrechnung direkt auf der Baustelle. Das Blatt liegt schräg auf einer glänzenden Motorhaube. Die KI erkennt Lieferant und Rechnungsnummer, liest den Steuerbetrag aber aus einer Reflexion falsch.
Der neue Prozess zeigt vor dem Upload drei kurze Hinweise: Dokument flach ausrichten, alle Ränder sichtbar halten und Blitzreflexion vermeiden. Bei kritischen Feldern unter einer definierten Qualitätsschwelle wird keine Buchung vorgeschlagen. Die Sachbearbeitung fordert ein neues Foto an, statt den Wert zu erraten.
Praxisbeispiel 2: Mehrseitiges PDF in Deutschland
Ein deutscher Dienstleister erhält eine dreiseitige Rechnung. Seite 1 enthält Summen, Seite 2 die Leistungspositionen und Seite 3 einen Tätigkeitsnachweis. Beim Import ist nur die erste Seite verfügbar. Die KI liefert dennoch vollständige Kopfdaten.
Die Vollständigkeitsregel erkennt „Seite 1 von 3“ und stoppt vor der fachlichen Freigabe. Nach erneutem Eingang werden Seitenzahl, Dateizusammenhang und Leistungsbeschreibung geprüft. Erst dann entsteht ein Buchungsvorschlag.
Ein repräsentatives Testset aufbauen
Das NIST AI Risk Management Framework empfiehlt dokumentierte Testsets, Metriken und Bewertungen unter einsatznahen Bedingungen. Für KMU genügt zum Start ein kontrollierter Satz von 50 bis 100 anonymisierten Belegen, wenn er die reale Vielfalt abbildet:
- häufige Lieferanten und seltene Sonderfälle,
- PDF, Scan, Smartphone-Foto und strukturierte E-Rechnung,
- ein- und mehrseitige Dokumente,
- verschiedene Sprachen, Währungen und Steuersätze,
- gute und bewusst schlechte Bildqualität,
- Korrekturen, Gutschriften und Anlagen.
Markieren Sie für jeden Beleg einen fachlich geprüften Sollwert. Das Modell wird gegen diesen Goldstandard bewertet. Änderungen an Modell, Vorverarbeitung oder Feldlogik laufen erneut durch denselben unveränderten Testsatz.
Welche Kennzahlen Sie getrennt messen sollten
- Feldgenauigkeit: Anteil korrekter Werte pro Feld, nicht nur pro Dokument.
- Vollständigkeit: Anteil erkannter fehlender Seiten oder abgeschnittener Bereiche.
- Kritische Fehler: Falsche Beträge, Bankdaten oder Steuercodes.
- Fehlalarme: Gute Belege, die unnötig manuell blockiert werden.
- Korrekturzeit: Aufwand von Warnung bis sauberem Ergebnis.
- Lieferantenmuster: Wiederkehrende Qualitätsprobleme nach Quelle oder Kanal.
Eine durchschnittliche Genauigkeit verdeckt Risiken. Wenn Namen fast immer stimmen, Bankdaten aber selten falsch sind, kann der Gesamtwert ausgezeichnet aussehen. Berichten Sie kritische Felder separat.
Österreich und Deutschland
In beiden Ländern müssen steuerlich relevante Unterlagen vollständig, nachvollziehbar und entsprechend den geltenden Regeln aufbewahrt werden. Die konkreten Fristen und Anforderungen unterscheiden sich. Eine KI-Erfassung ändert nicht, welcher Beleg rechtlich maßgeblich ist.
Für deutsche Unternehmen sind GoBD und BSI-Hinweise wichtige Orientierungspunkte. In Österreich sind insbesondere BAO, UGB und Informationen von USP beziehungsweise Finanzverwaltung zu beachten. Dieser Beitrag beschreibt Prozesskontrollen und ersetzt keine individuelle Rechts- oder Steuerberatung.
Strukturierte E-Rechnung statt Bild bevorzugen
Liegt eine strukturierte E-Rechnung vor, sollten Pflichtfelder aus den strukturierten Daten gelesen und validiert werden. Eine PDF-Darstellung kann die Sichtprüfung unterstützen, ist aber keine bessere Datenquelle als korrektes XML. Der Beitrag E-Rechnungen archivieren: XML und PDF richtig einordnen erklärt die Rollen beider Dateien.
Für klassische Rechnungen bietet Claribill Rechnungsfunktionen öffentlich dokumentierte Abläufe. Eine KI-OCR-Funktion wird hier nicht behauptet; der Leitfaden beschreibt Anforderungen an eine mögliche Erfassungslösung.
Checkliste für den Rechnungseingang
- Alle Seiten und Ränder vor der Erkennung prüfen.
- Originaldatei unverändert aufbewahren.
- Nachbearbeitung als Arbeitskopie dokumentieren.
- Kritische Felder stärker kontrollieren als Adressdetails.
- Unsichere Werte nicht automatisch ergänzen.
- Bankdatenänderungen unabhängig bestätigen.
- Mehrseitige Belege als zusammengehörigen Vorgang prüfen.
- PDF-Bild und strukturierte XML-Daten nicht verwechseln.
- Testset mit schlechten und seltenen Belegen pflegen.
- Feldgenauigkeit und kritische Fehler getrennt berichten.
Häufige Fehler
- Nur die Gesamtgenauigkeit des Anbieters übernehmen.
- Hohe Modellkonfidenz als Richtigkeitsbeweis behandeln.
- Fehlende Seiten mit plausiblen Altwerten ergänzen.
- Optimierte Bilder ohne Original und Verarbeitungshistorie speichern.
- Alle Lieferanten und Kanäle mit derselben Schwelle behandeln.
- Nach einem Modellupdate kein unverändertes Vergleichstestset ausführen.
Die wichtigsten Takeaways
Gute Rechnungserfassung beginnt vor der KI: vollständiges Dokument, geeignete Aufnahme, unverändertes Original und klare Verantwortlichkeit. Die KI darf Felder vorschlagen und Qualitätsprobleme markieren. Kritische Werte brauchen einen risikobasierten Vergleich.
Mit einem kleinen, repräsentativen Goldstandard erkennen KMU, ob Modell oder Vorverarbeitung im eigenen Belegmix wirklich funktionieren. Messen Sie nicht nur Komfort, sondern vor allem fehlende Seiten, kritische Feldfehler und die Qualität des manuellen Prüfwegs. Öffnen Sie bei jeder kritischen Abweichung zusätzlich die unveränderte Originalansicht.
FAQ zu KI-OCR bei Rechnungen
Reicht ein gut lesbares PDF für die automatische Freigabe?
Nein. Lesbarkeit reduziert Erkennungsfehler, beweist aber weder die sachliche Richtigkeit noch die Berechtigung der Forderung. Bestellung, Leistung, Steuersachverhalt, Empfänger und Bankdaten können trotz perfekter Datei falsch oder manipuliert sein. Gute Bildqualität ist eine Eingangsvoraussetzung, keine Buchungs- oder Zahlungsfreigabe.
Soll ein niedriger Konfidenzwert immer blockieren?
Die Reaktion hängt vom Feld ab. Ein unsicherer Straßenname kann in eine normale Korrektur-Queue gehen. Ein unsicherer Bruttobetrag, Steuersatz oder Zahlungsempfänger sollte die weitere Verarbeitung stoppen. Dokumentieren Sie Schwellen pro Feld und prüfen Sie regelmäßig, ob sie echte Fehler finden oder nur Arbeitsaufwand erzeugen.
Darf die KI den Wert aus früheren Rechnungen ergänzen?
Ein Altwert kann als Vergleichshinweis dienen, darf aber einen fehlenden Beleginhalt nicht ersetzen. Zeigen Sie Vorschlag und Quelle getrennt. Wenn Rechnungsnummer, Datum oder Bankverbindung auf dem aktuellen Dokument nicht lesbar sind, braucht es eine bessere Datei oder eine bestätigte Klärung.
Wie oft sollte das Testset wiederholt werden?
Mindestens bei Änderungen an Modell, OCR-Bibliothek, Bildvorverarbeitung oder Feldlogik. Zusätzlich ist eine regelmäßige Stichprobe sinnvoll, weil neue Lieferantenlayouts und Aufnahmegeräte den Belegmix verändern. Verwenden Sie einen unveränderten Kernsatz für Vergleichbarkeit und ergänzen Sie neue Fehlerfälle separat.
Quellen
Verwandte Artikel
Kommentare
Noch keine Kommentare. Schreiben Sie den ersten.


