Zurück
Modelle6/Tag per E-MailPrimärquelle
Epoch AIs Capabilities Index sieht OpenAIs GPT-6 Astra insgesamt vorn und mit einem Rekordwert bei Mathe-Benchmarks, doch beim speziellen Software-Engineering-Index liegt Astra hinter Anthropics Claude Fable 5.1: SWE-ECI von 167 für Fable 5.1 gegenüber 164 für Astra
Geprüft 2026-10-05
Mit Insider verfolgenDER INTELLIGENZ-CLUB
Fakten wie diese, sechs Tage die Woche
The Daily Receipts an Werktagen, The Weekly Brief am Samstag — sechs belegte Fakten pro Tag per E-Mail, zwei mehr als die kostenlose Website zeigt. Jeder bis zur Quelle belegt. Kostenlos.
Treten Sie jetzt bei, und Sie starten mit 100 Receipts in The Receipts Ledger — Ihr erster Schritt zu einem kostenlosen Jahr Insider oder Pro. So funktioniert es →
Die heutige Ausgabe lesen →Der Screener · 72 UnternehmenJede Ebene der KI-Kette, täglich bepreistWie das geprüft wurdeJede Zahl verlinkt auf den Bericht, aus dem sie stammt
Mehr zu Modelle
- KI-Modelle können inzwischen Gold bei der Internationalen Mathematikolympiade gewinnen, doch Stanfords AI Index 2026 zeigt, dass sie an einer Aufgabe scheitern, die die meisten Kinder früh beherrschen. Bei den 180 Zifferblatt-Designs und 720 Fragen von ClockBench las das beste Modell, GPT-5.4 High, analoge Uhren nur in 50,6 % der Fälle korrekt ab, gegenüber 90,1 % bei Menschen
- Stanfords KI-Index 2026 verfolgt, wie KI-Modelle bei GPQA Diamond abschneiden, einem Satz von Chemie- und Physikfragen auf Doktorandenniveau, die bewusst so gestaltet sind, dass Google-Suchen nicht weiterhelfen. Die mittlere Modellgenauigkeit bei diesem Benchmark erreichte 2025 93 %, verglichen mit einer Basislinie menschlicher Expertenvalidierer von 81,2 % -- KI-Modelle schlagen promovierte Experten nun um 12 Punkte bei GPQA Diamond
- KI-Spitzenmodelle holen bei Benchmarks, die ihnen eigentlich widerstehen sollen, schnell auf. Vor einem Jahr erzielten sie bei Humanity's Last Exam, einem 2.700 Fragen umfassenden Test, der für KI schwer und für menschliche Experten günstig konzipiert ist, noch unter 10 %. Inzwischen erreicht die Genauigkeit 38,3 % bei Humanity's Last Exam, gegenüber unter 10 % ein Jahr zuvor