Zurück
ModelleBerichtet

KI-Agenten, die OSWorlds reale Computeraufgaben unter Ubuntu, Windows und macOS lösen sollen – Dateioperationen, Multi-App-Workflows – kamen historisch nur auf 1 bis 12 Prozent Erfolg. Laut Stanfords AI Index 2026 erreicht das beste Modell, Claude Opus 4.5, nun 66,3 % Genauigkeit, nur 6 Prozentpunkte hinter der menschlichen Basislinie von 72,35 % 66,3 % Genauigkeit im OSWorld-Benchmark für reale Computeraufgaben

Geprüft 2026-08-31

DER INTELLIGENZ-CLUB

Fakten wie diese, sechs Tage die Woche

The Daily Receipts an Werktagen, The Weekly Brief am Samstag — jeder Fakt bis zur Quelle belegt. Kostenlos.

Für immer kostenlos. Sechs E-Mails pro Woche — The Daily Receipts an Werktagen, The Weekly Brief am Samstag. Jede einzeln mit einem Klick abbestellbar.

Die heutige Ausgabe lesen →
66,3 % Genauigkeit im OSWorld-Benchmark für reale Computerau