MOUNTAIN VIEW, 29 de julio de 2026. Un equipo de Google publicó SkillSmith, un sistema que trata los pesos de un modelo, en concreto los cachés de prefijo clave-valor que codifican una capacidad ya aprendida, como una modalidad de entrada más que un modelo de lenguaje puede leer, de la misma forma en que lee texto. El paper, subido a arXiv el 29 de julio, describe un modelo aumentado que ingiere a la vez ese caché de prefijo y texto (una descripción de la tarea, ejemplos y una explicación de cómo se relaciona la capacidad de origen con la de destino) y con una sola pasada hacia adelante produce un caché de prefijo nuevo para un modelo Gemma 3 4B congelado. La composición ocurre en el momento de la inferencia, no mediante una corrida de entrenamiento nueva para cada tarea.
La pieza de evidencia más clara del paper es una ablación sobre Composite-SNI, un banco de unas 21.000 tareas compuestas que el equipo generó pidiéndole a Gemini 2.5 Pro que combinara pares de tareas de Super-Natural Instructions. Medido en Elo, el sistema saca 1.209 sin ninguna entrada, 1.455 usando solo los cachés clave-valor, 1.622 usando solo texto y 1.714 usando ambas entradas juntas.
La ganancia no se explica por un prompt más rico ni por un fusionador de pesos aprendido por separado: solo aparece cuando el modelo lee las dos modalidades a la vez.
SkillSmith compite contra dos familias de líneas de base y les gana a ambas. En el espacio de los pesos: LERP (promediar pesos por interpolación lineal), Concat (concatenar cachés de prefijo), la transferencia directa del caché de la tarea de origen, y SVD (descomposición en valores singulares). En el espacio del texto: aprendizaje en contexto con ejemplos. También supera al prefix-tuning entrenado desde cero o inicializado con esos mismos ejemplos, la opción sin ningún tipo de transferencia entre tareas.
Dónde ayuda más y dónde no ayuda
El beneficio se nota más cuando después hay que afinar el modelo con pocos datos. En MMLU-ProX, un banco multilingüe de 14 categorías en 29 idiomas y cinco regiones, el equipo lo evaluó en los idiomas donde Gemma 3 4B rinde peor y dejó tres categorías completas afuera del entrenamiento, unas 250 tareas en total. Ahí, afinar los pesos de prefijo que SkillSmith ya inicializó supera con margen claro tanto a la línea de base no composicional más fuerte como a seguir entrenando después de un promediado aritmético de pesos convencional.
La ventaja se angosta en el otro extremo. En las tareas más simples de Super-Natural Instructions, con del orden de 1.000 ejemplos cada una, los métodos ajustados finamente terminan agrupados en el mismo techo de rendimiento: son tareas de procesamiento de lenguaje natural armadas en 2022, como clasificación de sentimiento simple, que ya le resultan triviales a un modelo de lenguaje base actual. El propio paper reconoce además que su capa de recuperación agrega ruido cuando no hay un mapeo confirmado entre la tarea de origen y la de destino, y que el método necesita una biblioteca de tareas fuente entrenada de antemano para funcionar. No informa el costo de cómputo, el tiempo de entrenamiento ni la latencia de inferencia frente a esas líneas de base.
SkillSmith no elimina el entrenamiento: sigue haciendo falta una biblioteca de capacidades fuente ya aprendidas y, para el mejor resultado en tareas difíciles, un afinado posterior. Lo que cambia es el punto de partida de una capacidad nueva, que ahora puede componerse a partir de lo que un agente escribió sobre una tarea y de lo que ya aprendió en los pesos de otra, en la misma pasada.

