Zurück
ModellePrimärquelle

SWE-bench Verified gibt einem KI-Modell ein echtes GitHub-Issue und eine Codebasis und prüft, ob der geschriebene Patch den Fehler tatsächlich behebt. Stanfords AI Index 2026 berichtet, dass das führende Modell, Claude 4.5 Opus im High-Reasoning-Modus, bereits etwa 76,8 % der Benchmark-Probleme gelöst hatte (Stand Februar 2026)

QuelleStanford AI Index·Feb 2026

Geprüft 2026-09-04

DER INTELLIGENZ-CLUB

Fakten wie diese, sechs Tage die Woche

The Daily Receipts an Werktagen, The Weekly Brief am Samstag — jeder Fakt bis zur Quelle belegt. Kostenlos.

Für immer kostenlos. Sechs E-Mails pro Woche — The Daily Receipts an Werktagen, The Weekly Brief am Samstag. Jede einzeln mit einem Klick abbestellbar.

Die heutige Ausgabe lesen →