Volver
Modelos6/día por emailInformada
El Índice de IA 2026 de Stanford cita un estudio en el que el Orquestador de Diagnóstico de IA de Microsoft, junto con el modelo de razonamiento o3 de OpenAI, se enfrentó a 21 médicos en ejercicio con entre cinco y veinte años de experiencia, trabajando sin ayuda en condiciones comparables sobre casos diagnósticamente difíciles extraídos del New England Journal of Medicine. La precisión del sistema de IA alcanzó 85,5%, frente a aproximadamente el 20% de los médicos sin ayuda
Verificado 2026-09-28
EL INTELLIGENCE CLUB
Datos como este, seis días a la semana
The Daily Receipts entre semana, The Weekly Brief los sábados — seis datos con fuente al día por email, dos más que la web gratuita. Cada uno trazado hasta el documento del que salió. Gratis.
Gratis para siempre, pero solo mientras queden plazas fundadoras. Entra ahora, antes de que esto sea solo un boletín en el que está todo el mundo.
Leer la edición de esta mañana →Exposición de MicrosoftQué parte del negocio es realmente la expansión de la IAEl filtro · 72 empresasCada capa de la cadena de la IA, con precios diariosCómo se verificóCada cifra enlaza con el informe del que salió
Más sobre Modelos
- Los modelos de IA ya pueden ganar el oro en la Olimpiada Internacional de Matemáticas, pero el AI Index 2026 de Stanford halló que aún fallan en una tarea que la mayoría de los niños dominan pronto. En los 180 diseños de reloj y 720 preguntas de ClockBench, el mejor modelo, GPT-5.4 High, leyó correctamente relojes analógicos solo el 50,6 % de las veces, frente al 90,1 % de los humanos
- Los modelos de IA más avanzados están alcanzando rápidamente a los exámenes diseñados para resistirles. Hace un año obtenían menos del 10 % en Humanity's Last Exam, una prueba de 2700 preguntas diseñada para ser difícil para la IA y favorable a los expertos humanos. Ahora la precisión ha alcanzado 38,3 % en Humanity's Last Exam, frente a menos del 10 % un año antes
- Los agentes de IA que abordan las tareas informáticas reales de OSWorld en Ubuntu, Windows y macOS —operaciones de archivos, flujos de trabajo multiaplicación— históricamente alcanzaban solo entre el 1 % y el 12 % de éxito. El AI Index 2026 de Stanford indica que el mejor modelo, Claude Opus 4.5, ahora llega al 66,3 % de precisión, a solo 6 puntos porcentuales de la línea base humana del 72,35 % 66,3 % de precisión en el benchmark de tareas informáticas reales OSWorld