Estandarizan evaluaciones de agentes autónomos
METR y los principales laboratorios fijan un protocolo técnico para medir la autonomía y la monitorización de sistemas de inteligencia artificial en tareas complejas.
Portada
Artículos etiquetados como inteligencia-artificial en El Censurado Web.
METR y los principales laboratorios fijan un protocolo técnico para medir la autonomía y la monitorización de sistemas de inteligencia artificial en tareas complejas.
La superación del 90 por ciento en MMLU impulsa a los laboratorios hacia evaluaciones complejas de razonamiento e ingeniería en entornos de código real.
Anthropic presentó un estándar que reduce de semanas a horas la integración de robots y instrumentos de laboratorio, con resultados medidos en cuatro centros de investigación.
El cálculo de 12.900 millones de dólares casi duplica la valuación que la empresa neoyorquina rechazó hace ocho meses, y ninguna de las dos partes confirmó todavía los términos.
El modelo activa apenas 6.000 millones de sus 125.000 millones de parámetros y promete entrenar a un noveno del costo de su antecesor, sin verificación externa todavía.
La empresa china detrás de GLM dijo que liberará los pesos esa noche, tras seis días de especulación y un uso que dobló al de DeepSeek.