KI-Videogenerierungsmodelle erzeugen inzwischen visuell überzeugendes Filmmaterial, doch laut dem AI Index 2026 der Stanford University tun sie sich weiterhin schwer damit, Physik und Konsistenz korrekt darzustellen. Bei VBench-2.0, das Videos nach menschlich bewerteter Wirklichkeitstreue statt nach reiner visueller Politur bewertet, erreichte Anfang 2026 kein getestetes Modell einen Gesamtwert von mehr als Veo 3 führt den VBench-2.0-Realitätstreue-Test mit 66,7% an — kein getestetes KI-Videomodell erreicht 67%
Geprüft 2026-09-06
DER INTELLIGENZ-CLUB
Fakten wie diese, sechs Tage die Woche
The Daily Receipts an Werktagen, The Weekly Brief am Samstag — jeder Fakt bis zur Quelle belegt. Kostenlos.
Für immer kostenlos. Sechs E-Mails pro Woche — The Daily Receipts an Werktagen, The Weekly Brief am Samstag. Jede einzeln mit einem Klick abbestellbar.
Die heutige Ausgabe lesen →Mehr zu Modelle
- KI-Spitzenmodelle holen bei Benchmarks, die ihnen eigentlich widerstehen sollen, schnell auf. Vor einem Jahr erzielten sie bei Humanity's Last Exam, einem 2.700 Fragen umfassenden Test, der für KI schwer und für menschliche Experten günstig konzipiert ist, noch unter 10 %. Inzwischen erreicht die Genauigkeit 38,3 % bei Humanity's Last Exam, gegenüber unter 10 % ein Jahr zuvor
- KI-Agenten, die OSWorlds reale Computeraufgaben unter Ubuntu, Windows und macOS lösen sollen – Dateioperationen, Multi-App-Workflows – kamen historisch nur auf 1 bis 12 Prozent Erfolg. Laut Stanfords AI Index 2026 erreicht das beste Modell, Claude Opus 4.5, nun 66,3 % Genauigkeit, nur 6 Prozentpunkte hinter der menschlichen Basislinie von 72,35 % 66,3 % Genauigkeit im OSWorld-Benchmark für reale Computeraufgaben
- SWE-bench Verified gibt einem KI-Modell ein echtes GitHub-Issue und eine Codebasis und prüft, ob der geschriebene Patch den Fehler tatsächlich behebt. Stanfords AI Index 2026 berichtet, dass das führende Modell, Claude 4.5 Opus im High-Reasoning-Modus, bereits etwa 76,8 % der Benchmark-Probleme gelöst hatte (Stand Februar 2026)