Letztes Wochenende habe ich das neue Claude Opus 4.6 mit der Eidg. Expertenprüfung Rechnungslegung & Controlling 2022 (Teil Controlling, 43 Seiten) getestet. Ergebnis: 95.75 von 100 Punkten
Nun wollte ich es wissen: Kann ich dieses Ergebnis durch ein spezialisiertes Multi-Agenten-System in „Claude Code“ noch toppen?
Die Theorie:
Wenn drei unabhängige Experten-Agenten (Agent 1: Lehrbuch, Agent 2: Praxis, Agent 3: kritischer Prüfer) die 43 Seiten starke Prüfung lösen und ein Agent 4 als „Master-Agent“ die Ergebnisse validiert, müsste die Präzision steigen.
🛠️ Das Experiment: Der „Orchestrator-Prompt“
Ich habe Claude gebeten, mir einen professionellen Prompt für Claude Code zu schreiben. Das System arbeitete in 5 Phasen:
👉 Analyse: Identifikation jeder Teilaufgabe und Punkteverteilung.
👉 Triangulation: Drei Agenten (Akademiker, Praktiker, kritischer Prüfer) lösen jede Aufgabe unabhängig.
👉 Abweichungsanalyse: Tabellarischer Vergleich der Ergebnisse.
👉 Master-Entscheid: Validierung und Konsensbildung durch eine vierte Instanz.
👉 Dokumentation: Erstellung eines sauberen Lösungsprotokolls.
📊 Das überraschende Ergebnis
➡️ Claude Opus 4.6 (Browser-Version): 95.75 Punkte 🏆
➡️ Claude Code (Variante 1): 91.75 Punkte
➡️ Claude Code (Variante 2 mit optimiertem Prompt): 92.25 Punkte
Obwohl das Multi-Agenten-System methodisch extrem sauber vorging und Abweichungen im Protokoll aufzeigte, schnitt die Desktop-Version am besten ab.
Viele bauen Agentensysteme in der Hoffnung, dass „mehr Rollen = mehr Qualität“. Dein Ergebnis zeigt vielleicht: Das ist nicht garantiert.
Spannend und ich werde das weiter verfolgen…

