Zurück
Modelle6/Tag per E-MailPrimärquelle
Epoch AI verglich, wie die Flaggschiff-Modelle von OpenAI und Anthropic mit sehr langen Prompts umgehen, und stellte fest, dass GPT-5.6 Terra und Sol mit wachsendem Kontext quadratisch langsamer werden, während Claude Sonnet 5 und Opus 5 nahezu linear bleiben -- die zusätzliche Latenz für die nächsten 10.000 Token stieg bei GPT-5.6 Terra von 0,071 Sekunden bei einem 100.000-Token-Prompt auf 1,66 Sekunden bei einem 10-Millionen-Token-Prompt
Geprüft 2026-09-11
DER INTELLIGENZ-CLUB
Fakten wie diese, sechs Tage die Woche
The Daily Receipts an Werktagen, The Weekly Brief am Samstag — sechs belegte Fakten pro Tag per E-Mail, zwei mehr als die kostenlose Website zeigt. Jeder bis zur Quelle belegt. Kostenlos.
Für immer kostenlos. Sechs E-Mails pro Woche — The Daily Receipts an Werktagen, The Weekly Brief am Samstag. Jede einzeln mit einem Klick abbestellbar.
Die heutige Ausgabe lesen →Der Screener · 72 UnternehmenJede Ebene der KI-Kette, täglich bepreistWie das geprüft wurdeJede Zahl verlinkt auf den Bericht, aus dem sie stammt
Mehr zu Modelle
- KI-Modelle können inzwischen Gold bei der Internationalen Mathematikolympiade gewinnen, doch Stanfords AI Index 2026 zeigt, dass sie an einer Aufgabe scheitern, die die meisten Kinder früh beherrschen. Bei den 180 Zifferblatt-Designs und 720 Fragen von ClockBench las das beste Modell, GPT-5.4 High, analoge Uhren nur in 50,6 % der Fälle korrekt ab, gegenüber 90,1 % bei Menschen
- KI-Spitzenmodelle holen bei Benchmarks, die ihnen eigentlich widerstehen sollen, schnell auf. Vor einem Jahr erzielten sie bei Humanity's Last Exam, einem 2.700 Fragen umfassenden Test, der für KI schwer und für menschliche Experten günstig konzipiert ist, noch unter 10 %. Inzwischen erreicht die Genauigkeit 38,3 % bei Humanity's Last Exam, gegenüber unter 10 % ein Jahr zuvor
- KI-Agenten, die OSWorlds reale Computeraufgaben unter Ubuntu, Windows und macOS lösen sollen – Dateioperationen, Multi-App-Workflows – kamen historisch nur auf 1 bis 12 Prozent Erfolg. Laut Stanfords AI Index 2026 erreicht das beste Modell, Claude Opus 4.5, nun 66,3 % Genauigkeit, nur 6 Prozentpunkte hinter der menschlichen Basislinie von 72,35 % 66,3 % Genauigkeit im OSWorld-Benchmark für reale Computeraufgaben