Aus früheren Tests wissen wir: Claude Opus 4.6 performt aus der eidg. Höheren Fachprüfung erstaunlich gut.
Jetzt wollte ich wissen: Wie schlägt sich OpenClaw, mein eigener Bot mit denselben Prüfungsaufgaben?
🚨 Erster Versuch mit der vollständigen Prüfung (35 Seiten)? → Absturz. Der kleine Bot hat kapituliert.
Also zurück auf eine kleinere Teil-Aufgabe: 4-Seiten-Version (ca. 2’000 Token) und dann wurde es wirklich spannend.
🎯 Testaufgabe: Erstellung einer Geldflussrechnung
📄 4 Seiten | max. 4 Punkte
Neben den bewährten Anthropic-Modellen (Opus 4.6, Sonnet 4.5, Haiku 4.5) habe ich auch meine lokalen Modelle ins Rennen geschickt.
Die lokalen Modelle laufen bei mir abgeschirmt auf einem separaten Laptop mit NVIDIA RTX 4090 via Ollama, per Tunnel + API an OpenClaw angebunden. Vorteil: Token-Kosten im Griff, trotzdem zentral testen. Diese lokalen Modelle sind natürlich zum Teil langsamer. Ich musste dafür die akzeptierten Antwortzeiten von OpenClaw mit Claude Code erhöhen.💡
🎯 Resultate (max. 4 Punkte):
🏆Volle Punktzahl (4.00)
➡️Claude Opus 4.6
⚡gpt-oss – 20b (⚡2m 06s – Top-Zeit)
🚀Sehr stark (3.50-3.75)
⚡qwen3-coder – 30b, 3.75 Pkt. (⚡1m 14s – Top-Zeit)
➡️qwen3 – 32b, 3.75 Pkt. (12m 58s)
➡️ministral-3 – 8b, 3.50 Pkt. (15m 24s)
⚡qwen3 – 14b, 3.50 Pkt. (⚡2m 50s – Top-Zeit)
✅ Solides Mittelfeld (3.00-3.25)
➡️Claude Sonnet 4.5-3.25 Pkt.
➡️llama3.3 – 70b-instruct, 3.25 Pkt. (14m 34s)
➡️qwen2.5 – 32b-instruct, 3.00 Pkt. (6m 41s)
⚠️ MITTELFELD (2.00 – 2.50 Pkt.)
⚡ministral-3 – 14b, 2.50 Pkt. (⚡0m 43s – Top-Zeit)
⚡phi4 – 14b, 2.50 Pkt. (⚡0m 38s – Top-Zeit)
➡️Claude Haiku 4.5-2.00 Pkt.
➡️qwen2.5-Instruct-1m – 14b, 2.00 Pkt. (3m 45s)
➡️qwen2.5-Instruct-1m – 7b, 2.00 Pkt. (6m 44s)
❌ UNTERES MITTELFELD (< 2.00 Pkt.)
➡️mistral-nemo – 12b, 1.75 Pkt. (0m 17s)
➡️gemma2 – 27b-instruct, 1.75 Pkt. (4m 04s)
➡️qwen3 – 30b, 1.75 Pkt. (3m 57s)
➡️deepseek-r1 – 7b, 1.25 Pkt. (13m 09s)
➡️llama3.1 – 8b-instruct, 1.25 Pkt. (2m 41s)
➡️apertus – 8b, 1.00 Pkt. (14m 40s) – Unser Schweizer Modell
➡️deepseek-r1 – 14b, 1.00 Pkt. (1m 50s)
➡️hermes-2-pro-llama-3-8b, 1.00 Pkt. (14m 47s)
➡️codellama – 13b-instruct, 0.75 Pkt. (0m 12s)
➡️mistral – 7b-instruct, 0.75 Pkt. (2m 06s)
➡️mixtral – 8x7b-instruct, 0.25 Pkt. (2m 37s)
➡️qwen2.5-coder – 7b, 0.25 Pkt. (3m 54s)
Mein Fazit:
Ich war ehrlich sehr überrascht: Ich arbeite zwar viel mit lokalen Modellen (gpt-oss 20B und Qwen3 32B sind aktuell meine Favoriten), aber dass mehrere lokale Modelle bei dieser Aufgabe praktisch auf Opus 4.6-Niveau mitspielen, hätte ich so nicht erwartet.
Nächste Runde wird härter und ich bin gespannt, welche Modelle dann noch mithalten. Man sieht jedenfalls schön: Grösse allein gewinnt nicht, entscheidend ist das passende Modell für die konkrete Aufgabe. Und manchmal ist auch Geschwindigkeit wichtig.
Ich bleibe dran… und ja: OpenClaw ist wieder angeleint. 😄

