🤖 Eidg. Expertenprüfung 2022: Claude Opus 4.6 im Chat vs. in Claude Code (Multi-Agenten-Test)

Letztes Wochenende habe ich das neue Claude Opus 4.6 mit der Eidg. Expertenprüfung Rechnungslegung & Controlling 2022 (Teil Controlling, 43 Seiten) getestet. Ergebnis: 95.75 von 100 Punkten

Nun wollte ich es wissen: Kann ich dieses Ergebnis durch ein spezialisiertes Multi-Agenten-System in „Claude Code“ noch toppen?

Die Theorie:
Wenn drei unabhängige Experten-Agenten (Agent 1: Lehrbuch, Agent 2: Praxis, Agent 3: kritischer Prüfer) die 43 Seiten starke Prüfung lösen und ein Agent 4 als „Master-Agent“ die Ergebnisse validiert, müsste die Präzision steigen.

🛠️ Das Experiment: Der „Orchestrator-Prompt“
Ich habe Claude gebeten, mir einen professionellen Prompt für Claude Code zu schreiben. Das System arbeitete in 5 Phasen:
👉 Analyse: Identifikation jeder Teilaufgabe und Punkteverteilung.
👉 Triangulation: Drei Agenten (Akademiker, Praktiker, kritischer Prüfer) lösen jede Aufgabe unabhängig.
👉 Abweichungsanalyse: Tabellarischer Vergleich der Ergebnisse.
👉 Master-Entscheid: Validierung und Konsensbildung durch eine vierte Instanz.
👉 Dokumentation: Erstellung eines sauberen Lösungsprotokolls.

📊 Das überraschende Ergebnis
➡️ Claude Opus 4.6 (Browser-Version): 95.75 Punkte 🏆
➡️ Claude Code (Variante 1): 91.75 Punkte
➡️ Claude Code (Variante 2 mit optimiertem Prompt): 92.25 Punkte

Obwohl das Multi-Agenten-System methodisch extrem sauber vorging und Abweichungen im Protokoll aufzeigte, schnitt die Desktop-Version am besten ab.

Viele bauen Agentensysteme in der Hoffnung, dass „mehr Rollen = mehr Qualität“. Dein Ergebnis zeigt vielleicht: Das ist nicht garantiert.

Spannend und ich werde das weiter verfolgen…

Picture of Roman Kalberer

Roman Kalberer

13. Februar 2026

Diesen Beitrag teilen

Nach oben scrollen