Zum Inhalt springen
Strategie & Management

APEX-Benchmark: KI in der Buchhaltung löst strukturierte Aufgaben fehlerfreier als zwölf Profis

Modelle wie Claude Opus 5.5 lösen Routineaufgaben in einem direkten Vergleich schneller als menschliche Profis. Bei komplexen Fällen kapitulieren sie.

Lukas GörögLukas Görög
Teilen
KI in der Buchhaltung: Sprachmodelle genauer als Prüfer
KI in der Buchhaltung: Sprachmodelle genauer als Prüfer

Künstliche Intelligenz arbeitet in der Buchhaltung verlässlicher. In einer am 2. Oktober 2026 publizierten Auswertung des US-Start-ups Mercor lösten Sprachmodelle vereinfachte, strukturierte Buchhaltungsaufgaben schneller und genauer als menschliche Profis (Quelle: The Decoder). Gegen die Software traten zwölf lizenzierte Wirtschaftsprüfer an. Sie brachten durchschnittlich fünfeinhalb Jahre Berufserfahrung mit. Vor 18 Monaten lagen die besten KI-Modelle bei denselben Anforderungen noch deutlich unter dem damaligen menschlichen Durchschnitt von rund 37 Prozent. Inzwischen arbeiten die Modelle bei reiner Fleißarbeit nahezu fehlerfrei.

Grenzen der KI in der Buchhaltung

Der sogenannte APEX-Accounting-Benchmark verlangt den Systemen mehr ab. Das Testverfahren simuliert 160 komplexe Aufgabenstellungen in zehn fiktiven Unternehmen (Quelle: Mercor). Hier führt das KI-Modell Claude Opus 5.5 mit 61,8 Prozent der erfüllten Kriterien. Dicht dahinter folgen Fable 5.1 mit 61,0 Prozent und GPT-6 Astra mit 57,9 Prozent. Keines dieser Systeme schließt Bücher autonom ab.

Die Fehlerquote bei mehrschichtigen Prüfungen bleibt hoch. Bei knapp 60 Prozent der Testfälle löst kein einziges Modell die Aufgabe vollständig. Die Software sucht detailgenau in Belegen und befolgt Anweisungen präzise. Sobald ein Fall jedoch Kontextwissen, Kommunikation mit Kunden oder Rückfragen an Kollegen erfordert, versagen die Modelle.

Diese Entwicklung verändert den Berufsstand. Wer Zahlen lediglich abgleicht und verbucht, verliert seinen Vorsprung gegenüber der Maschine. Wirtschaftsprüfer beschaffen künftig den Kontext, den keine Software aus isolierten Belegen ableitet.

Auch das beste Modell erfüllt nur 61,8 Prozent der KriterienErfüllte Kriterien im APEX-Accounting-Benchmark, 160 Aufgaben in zehn fiktiven Unternehmen, Oktober 2026 · %
61.8 Claude Opus 5.5 61 Fable 5.1 57.9 GPT-6 Astra
Mercor, APEX-Accounting-Benchmark

Häufige Fragen

Was wurde im APEX-Benchmark tatsächlich geprüft?

Der APEX-Benchmark bildet 160 anspruchsvolle Aufgaben in zehn fiktiven Unternehmen ab. Getestet werden unter anderem mehrschichtige Prüfungen und der Umgang mit verschiedenen Belegen. Claude Opus 5.5 erfüllte 61,8 Prozent der Kriterien. Zwölf lizenzierte Wirtschaftsprüfer dienten als menschlicher Vergleich. Ein vollständiger autonomer Jahresabschluss gelang keinem Modell.

Kann KI einen Wirtschaftsprüfer in absehbarer Zeit ersetzen?

Die Ergebnisse belegen das nicht. Sprachmodelle erledigen klar abgegrenzte Buchungen und Belegprüfungen sehr zuverlässig. Bei unvollständigem Kontext, Rückfragen und Kundenkommunikation scheitern sie jedoch häufig. Wirtschaftsprüfer müssen deshalb weiterhin Sachverhalte einordnen, fehlende Informationen beschaffen und Entscheidungen verantworten. Automatisiert wird vor allem standardisierte Fleißarbeit.

Welche Folgen hat die Entwicklung für Beschäftigte in der Buchhaltung?

Wer überwiegend Zahlen abgleicht und Belege verbucht, verliert einen Teil seines bisherigen Vorteils. Gefragt sind stärker Kenntnisse über Geschäftsabläufe, interne Kontrollen und die Einordnung ungewöhnlicher Fälle. Auch die Kommunikation mit Kunden und Kollegen bleibt wichtig. Der Wandel dürfte Aufgaben verschieben, doch die Auswertung sagt nichts über konkrete Stellenzahlen aus.

Lohnt sich der Einsatz von Sprachmodellen in der Buchhaltung bereits?

Das hängt vom Anwendungsfall ab. Bei wiederholbaren, strukturierten Aufgaben können Modelle Zeit sparen und Fehler verringern. Für komplexe Prüfungen reicht ihre Leistung derzeit nicht aus. Die Auswertung nennt weder Lizenzpreise noch Betriebskosten. Eine belastbare Wirtschaftlichkeitsrechnung braucht deshalb eigene Daten zu Fallzahlen, Prüfaufwand, Nachkontrollen und möglichen Fehlerfolgen.

Wie könnte ein Unternehmen mit KI in der Buchhaltung beginnen?

Ein sinnvoller Einstieg sind klar abgegrenzte Aufgaben mit gut prüfbaren Ergebnissen, etwa das Sortieren oder Abgleichen von Belegen. Jede Ausgabe sollte zunächst ein Mensch kontrollieren. Unternehmen brauchen außerdem Regeln für Zugriffsrechte, Datenschutz und die Dokumentation von Korrekturen. Komplexe Abschlüsse und unklare Fälle gehören vorerst nicht in einen autonomen Ablauf.

Was muss sich ändern, damit KI komplexe Prüfungen zuverlässig erledigt?

Die Modelle müssten fehlenden Kontext erkennen, gezielt Rückfragen stellen und Informationen aus mehreren Quellen richtig verbinden. Ebenso wichtig sind nachvollziehbare Prüfschritte und klare Zuständigkeiten bei Fehlern. Der APEX-Benchmark zeigt derzeit eine deutliche Lücke: In knapp 60 Prozent der Fälle löste kein Modell die Aufgabe vollständig. Ein Zeitplan für autonome Abschlüsse ergibt sich daraus nicht.

Fügen Sie KI-Amigo in Google als bevorzugte Quelle hinzu, um unsere Artikel häufiger zu sehen.