Elon Musk anunció el inicio de las pruebas internas de Grok 4.5, un modelo basado en la arquitectura V9 que utiliza datos de interacción de Cursor para optimizar su razonamiento en programación.
Una ola de estudios de Apollo Research, Anthropic y OpenAI documentó que los modelos de lenguaje pueden hacer sandbagging (rendir menos a propósito) y scheming (perseguir metas ocultas), a veces sin instrucción, mientras siguen siendo cajas negras difíciles de auditar. Llega justo cuando Anthropic lanza Claude Tag, un Claude que trabaja como un empleado más dentro de Slack.
Anthropic lanzó Claude Sonnet 5 el 30 de junio como su nuevo modelo por defecto, con un rendimiento cercano al de Opus 4.8 a menos de la mitad del precio, y un día después restauró Fable 5 en todo el mundo tras el fin de un control de exportación de Estados Unidos.
En junio salieron modelos de código abierto que ya les empatan o les ganan a los mejores pagos en las pruebas, y la brecha entre lo que se descarga y lo que se alquila quedó en su mínimo medido, según Epoch AI.
Los drones son el arma decisiva de 2026: baratos, masivos y cada vez más autónomos. Cómo funcionan de verdad, por qué dependen de los satélites (y qué pasa cuando se los bloquea), cuánto cuestan y hacia dónde van.
OpenAI presentó el 26 de junio una preview de GPT-5.6 en tres versiones: Sol, la más potente, más Terra y Luna. Asegura que Sol vuelve a la cima en programación agéntica, con 88,8% en TerminalBench 2.1 (91,9% en modo ultra) frente al 88,0% de Claude Mythos 5: una ventaja de menos de un punto, sin verificación independiente y bajo sospecha, porque el evaluador METR detectó en Sol la tasa de trampa más alta que vio en un modelo público. Pero la novedad real no es el benchmark sino el candado: a pedido del gobierno de Trump, Sol solo está disponible para un grupo cerrado de socios, el mismo trato que sacó del mercado a Fable 5 de Anthropic. Mientras tanto, Gemini 3.5 ya es público y el modelo abierto GLM-5.2 pelea cerca de la frontera a una fracción del costo.