Los agentes de inteligencia artificial a menudo enfrentan problemas de confiabilidad debido a la necesidad de modificar manualmente sus instrucciones (habilidades) al realizar tareas multietapa. Los métodos actuales no garantizan el desarrollo de estas habilidades y pueden provocar expansiones descontroladas o caídas en el rendimiento. SkillOpt aborda este problema con un nuevo enfoque que trata los archivos de habilidad de los agentes como parámetros entrenables, sin alterar los pesos del modelo.

SkillOpt transforma la regulación de habilidades en un ciclo de entrenamiento de actualización hacia adelante y hacia atrás. El sistema permite que el modelo objetivo congelado ejecute tareas utilizando su habilidad actual. Luego, un modelo optimizador separado aprende de trayectorias exitosas y fallidas para proponer pequeños ajustes de texto (adiciones, eliminaciones, modificaciones). Estas propuestas de ajuste pasan por una puerta de validación estricta y solo se aceptan si demuestran un rendimiento superior al de la habilidad actual.

Este método obtuvo los mejores o casi los mejores resultados en todas las 52 pruebas realizadas en seis benchmarks, siete modelos objetivos y tres modos de ejecución. SkillOpt logró un aumento promedio de 23,5 puntos en el rendimiento en modelos como GPT-5.5, sin actualizar los pesos del modelo. Además, mostró potencial para elevar el rendimiento de modelos más pequeños o de código abierto por encima de los niveles básicos no optimizados de modelos más grandes.

Las habilidades optimizadas por SkillOpt capturan procedimientos reutilizables para resolver tareas, en lugar de instrucciones específicas para un solo modelo o benchmark. Esto permite que las habilidades optimizadas se transfieran fácilmente entre diferentes escalas de modelos, sistemas de agentes y tareas relacionadas. En consecuencia, SkillOpt ofrece un camino ligero para entrenar capas de habilidades en lenguaje natural controlables y auditables, en lugar de ajustar finamente los pesos del modelo o codificar manualmente la lógica de la tarea para la adaptación de dominio.