APEX-Benchmark: KI in der Buchhaltung löst strukturierte Aufgaben fehlerfreier als zwölf Profis
Modelle wie Claude Opus 5.5 lösen Routineaufgaben in einem direkten Vergleich schneller als menschliche Profis. Bei komplexen Fällen kapitulieren sie.

Künstliche Intelligenz arbeitet in der Buchhaltung verlässlicher. In einer am 2. Oktober 2026 publizierten Auswertung des US-Start-ups Mercor lösten SprachmodelleKünstliche Intelligenz, die mit großen Textmengen trainiert wurde, um Aufgaben zu verstehen und eigenständig Ergebnisse zu formulieren. vereinfachte, strukturierte Buchhaltungsaufgaben schneller und genauer als menschliche Profis (Quelle: The Decoder). Gegen die Software traten zwölf lizenzierte Wirtschaftsprüfer an. Sie brachten durchschnittlich fünfeinhalb Jahre Berufserfahrung mit. Vor 18 Monaten lagen die besten KI-Modelle bei denselben Anforderungen noch deutlich unter dem damaligen menschlichen Durchschnitt von rund 37 Prozent. Inzwischen arbeiten die Modelle bei reiner Fleißarbeit nahezu fehlerfrei.
Grenzen der KI in der Buchhaltung
Der sogenannte APEX-Accounting-BenchmarkEin standardisierter Leistungstest, der gezielt die Fähigkeiten von KI-Modellen bei praxisnahen Buchhaltungsaufgaben bewertet. verlangt den Systemen mehr ab. Das Testverfahren simuliert 160 komplexe Aufgabenstellungen in zehn fiktiven Unternehmen (Quelle: Mercor). Hier führt das KI-Modell Claude Opus 5.5 mit 61,8 Prozent der erfüllten Kriterien. Dicht dahinter folgen Fable 5.1 mit 61,0 Prozent und GPT-6 Astra mit 57,9 Prozent. Keines dieser Systeme schließt Bücher autonom ab.
Die Fehlerquote bei mehrschichtigen Prüfungen bleibt hoch. Bei knapp 60 Prozent der Testfälle löst kein einziges Modell die Aufgabe vollständig. Die Software sucht detailgenau in Belegen und befolgt Anweisungen präzise. Sobald ein Fall jedoch Kontextwissen, Kommunikation mit Kunden oder Rückfragen an Kollegen erfordert, versagen die Modelle.
Diese Entwicklung verändert den Berufsstand. Wer Zahlen lediglich abgleicht und verbucht, verliert seinen Vorsprung gegenüber der Maschine. Wirtschaftsprüfer beschaffen künftig den Kontext, den keine Software aus isolierten Belegen ableitet.
Häufige Fragen
Was wurde im APEX-Benchmark tatsächlich geprüft?
Der APEX-Benchmark bildet 160 anspruchsvolle Aufgaben in zehn fiktiven Unternehmen ab. Getestet werden unter anderem mehrschichtige Prüfungen und der Umgang mit verschiedenen Belegen. Claude Opus 5.5 erfüllte 61,8 Prozent der Kriterien. Zwölf lizenzierte Wirtschaftsprüfer dienten als menschlicher Vergleich. Ein vollständiger autonomer Jahresabschluss gelang keinem Modell.
Kann KI einen Wirtschaftsprüfer in absehbarer Zeit ersetzen?
Die Ergebnisse belegen das nicht. Sprachmodelle erledigen klar abgegrenzte Buchungen und Belegprüfungen sehr zuverlässig. Bei unvollständigem Kontext, Rückfragen und Kundenkommunikation scheitern sie jedoch häufig. Wirtschaftsprüfer müssen deshalb weiterhin Sachverhalte einordnen, fehlende Informationen beschaffen und Entscheidungen verantworten. Automatisiert wird vor allem standardisierte Fleißarbeit.
Welche Folgen hat die Entwicklung für Beschäftigte in der Buchhaltung?
Wer überwiegend Zahlen abgleicht und Belege verbucht, verliert einen Teil seines bisherigen Vorteils. Gefragt sind stärker Kenntnisse über Geschäftsabläufe, interne Kontrollen und die Einordnung ungewöhnlicher Fälle. Auch die Kommunikation mit Kunden und Kollegen bleibt wichtig. Der Wandel dürfte Aufgaben verschieben, doch die Auswertung sagt nichts über konkrete Stellenzahlen aus.
Lohnt sich der Einsatz von Sprachmodellen in der Buchhaltung bereits?
Das hängt vom Anwendungsfall ab. Bei wiederholbaren, strukturierten Aufgaben können Modelle Zeit sparen und Fehler verringern. Für komplexe Prüfungen reicht ihre Leistung derzeit nicht aus. Die Auswertung nennt weder Lizenzpreise noch Betriebskosten. Eine belastbare Wirtschaftlichkeitsrechnung braucht deshalb eigene Daten zu Fallzahlen, Prüfaufwand, Nachkontrollen und möglichen Fehlerfolgen.
Wie könnte ein Unternehmen mit KI in der Buchhaltung beginnen?
Ein sinnvoller Einstieg sind klar abgegrenzte Aufgaben mit gut prüfbaren Ergebnissen, etwa das Sortieren oder Abgleichen von Belegen. Jede Ausgabe sollte zunächst ein Mensch kontrollieren. Unternehmen brauchen außerdem Regeln für Zugriffsrechte, Datenschutz und die Dokumentation von Korrekturen. Komplexe Abschlüsse und unklare Fälle gehören vorerst nicht in einen autonomen Ablauf.
Was muss sich ändern, damit KI komplexe Prüfungen zuverlässig erledigt?
Die Modelle müssten fehlenden Kontext erkennen, gezielt Rückfragen stellen und Informationen aus mehreren Quellen richtig verbinden. Ebenso wichtig sind nachvollziehbare Prüfschritte und klare Zuständigkeiten bei Fehlern. Der APEX-Benchmark zeigt derzeit eine deutliche Lücke: In knapp 60 Prozent der Fälle löste kein Modell die Aufgabe vollständig. Ein Zeitplan für autonome Abschlüsse ergibt sich daraus nicht.
Fügen Sie KI-Amigo in Google als bevorzugte Quelle hinzu, um unsere Artikel häufiger zu sehen.
Weiterlesen
Mehr aus Strategie & Management →
KI-Strategie Europa: Der neue EU-Plan bevorzugt die Industrie gegenüber den Basismodellen
Die EU-Kommission ändert ihre KI-Politik. Verwaltungen und Unternehmen sollen die Technologie rasch anwenden, statt in den Wettlauf um die größten Sprachmodelle zu investieren.

Anthropic verliert: Pentagon darf Claude-Anbieter sperren
Ein US-Berufungsgericht hat den Ausschluss Anthropics von Militäraufträgen bestätigt. Auslöser war die Weigerung des Unternehmens, Claude für autonome Waffen und Massenüberwachung freizugeben.

Claude für Finanzberater: Anthropic baut erstmals ein Produkt um einen ganzen Beruf zu automatisieren
Anthropic hat am 14. September 2026 „Claude for Financial Advisors“ eingeführt, einen KI-Assistenten, der gezielt auf die Arbeit von Finanzberatern zugeschnitten ist. Charles Schwab will das Werkzeug mehr als 16.000 unabhängigen Vermögensverwaltern bereitstellen.

KI-Elektroschrott wird 40- bis 60-mal höher geschätzt als bisher
Das Basel Action Network beziffert den Elektroschrott der weltweiten KI-Infrastruktur bis 2050 auf 395 bis 617 Millionen Tonnen. Erstmals zählt der Bericht auch Kühlung, Stromverteilung und Netztechnik mit.

Gescheiterte KI-Projekte: 303 Tools im Friedhofsregister
TechCrunch sammelt seit dem 14. September 2026 eingestellte KI-Produkte und KI-Start-ups. ToolDirectory.AI zählt zum 15. September 303 abgeschaltete oder übernommene Tools – von Relay bis zur Assistants API von OpenAI. Die Modelle sind selten der Grund.

KI-Tempo drosseln: Amodei und Altman dafür, Trump dagegen
Anthropic-Chef Dario Amodei fordert in einem Essay vom 12. September 2026, das Tempo bei den leistungsfähigsten KI-Modellen zu drosseln. Sam Altman stimmt zu und kündigt Sicherheitsprüfungen vor großen Trainingsläufen an – Trump und Teile der Finanzmärkte halten dagegen.