Google crea WikiSkill para que los agentes de IA recuerden sus errores y mejoren

By: www.diariobitcoin.com|2026/08/29 13:32:09

Investigadores de Google Research presentaron WikiSkill, un marco que conserva los errores y aciertos de los agentes de IA en una wiki persistente para crear mejores instrucciones en ejecuciones futuras. Las pruebas muestran avances importantes en matemáticas, hojas de cálculo y entornos interactivos, aunque el sistema todavía no representa aprendizaje continuo en sentido estricto. ***

  • WikiSkill separa las trazas de ejecución, el conocimiento acumulado y las instrucciones activas en tres capas.
  • El marco elevó el promedio de Gemini 3.5 Flash de 49,5% a 68,1% y el de Qwen-3.6-27B de 39,4% a 63,3%.
  • Los modelos grandes aprovechan mejor las habilidades evolucionadas, mientras los pequeños pueden cerrar parte de la brecha.

Una memoria externa para agentes que olvidan

Investigadores de Google Research presentaron WikiSkill como un marco destinado a resolver una limitación recurrente de los agentes de inteligencia artificial: cada ejecución termina y gran parte de la experiencia obtenida desaparece. En lugar de modificar los parámetros del modelo después de cada tarea, el sistema reúne información sobre fallos, aciertos y estrategias útiles en una estructura similar a una enciclopedia colaborativa. El agente consulta luego ese material para actuar con mejores instrucciones en la siguiente oportunidad.

La propuesta no implica que el modelo aprenda de manera continua en el sentido tradicional. El modelo conserva su entrenamiento original, pero genera instrucciones más precisas para sí mismo a partir de la experiencia registrada, una solución menos elegante que el aprendizaje permanente y potencialmente vulnerable a errores acumulados. Aun así, los resultados del estudio indican que esta memoria externa puede mejorar de forma significativa el rendimiento en tareas que exigen varios pasos y uso coordinado de herramientas.

El concepto parte de una perspectiva atribuida a Andrej Karpathy sobre una especie de wiki para modelos de lenguaje, donde la experiencia de los agentes se transforma en conocimiento persistente y acumulativo. WikiSkill lleva esa idea al desarrollo automático de habilidades, con un proceso que intenta convertir las ejecuciones anteriores en procedimientos reutilizables sin tocar el comportamiento aprendido durante el entrenamiento. La distinción resulta relevante porque permite probar cambios de conducta sin realizar un nuevo ajuste completo del modelo.

El trabajo fue evaluado en cinco tipos de pruebas: razonamiento matemático, búsqueda web, manipulación de hojas de cálculo, preguntas y respuestas sobre documentos y tareas interactivas en un entorno virtual. Los investigadores utilizaron Qwen en versiones de 4.000 millones, 9.000 millones y 27.000 millones de parámetros, además de Gemma-4-31B y Gemini-3.5-Flash. Esa combinación permitió observar cómo la memoria acumulada funciona en modelos de distintas capacidades y frente a tareas con exigencias muy diferentes.

Tres capas y un ciclo de mejora

WikiSkill organiza el espacio de trabajo en tres niveles que cumplen funciones separadas. La Raw Layer conserva las trazas completas de cada ejecución, incluidas las llamadas a herramientas, las respuestas obtenidas y los pasos seguidos por el agente; esos registros son inmutables y sirven como materia prima para analizar el comportamiento. Por encima está la Wiki Layer, donde la experiencia se convierte en conclusiones estructuradas, como patrones de fallo, recomendaciones operativas y estrategias que produjeron resultados favorables.

La Wiki Layer no se reinicia después de una tarea, sino que crece con cada iteración, de acuerdo con la descripción de los investigadores. Esa continuidad permite que una ejecución posterior consulte problemas detectados anteriormente, incluso si la estrategia que los provocó ya no se encuentra activa. La tercera capa, llamada Skill Layer, contiene las instrucciones procedimentales que el agente utiliza durante la ejecución y funciona como la parte modificable del sistema.

El ciclo comienza cuando un agente de inferencia completa una tarea con las habilidades disponibles y produce una nueva traza. Después, un Wiki Maintainer revisa esos registros para identificar qué salió mal y qué decisiones ayudaron, mientras un Skill Proposer utiliza las conclusiones acumuladas para sugerir cambios concretos en las instrucciones activas. La arquitectura separa así la observación de los hechos, la interpretación de la experiencia y la aplicación de una nueva conducta.

Antes de aceptar una modificación, un mecanismo de validación o gating la prueba en un conjunto independiente de tareas. Si el cambio mejora los resultados, puede incorporarse a la Skill Layer; si perjudica el desempeño, se revierte sin eliminar la información que originó la propuesta. Incluso una actualización fallida conserva utilidad, porque la wiki registra qué se intentó y por qué no funcionó, de modo que el sistema puede evitar repetir el mismo camino o diseñar una alternativa en rondas posteriores.

Resultados desiguales según el modelo y la tarea

El estudio reportó mejoras de WikiSkill frente a agentes sin habilidades adicionales. En promedio, Gemini-3.5-Flash pasó de 49,5% sin habilidades a 68,1% con WikiSkill, mientras Qwen-3.6-27B avanzó de 39,4% a 63,3%. Las cifras corresponden al promedio de los cinco benchmarks y fueron calculadas a partir de tres ejecuciones independientes, según la tabla incluida en el trabajo.

Al observar tareas individuales, las diferencias resultan todavía más visibles. Gemini-3.5-Flash subió de 33,0% a 72,6% en LiveMath y de 50,5% a 76,6% en SpreadSheet, dos de los escenarios donde las instrucciones acumuladas parecen tener mayor impacto. En el caso de Qwen-3.6-27B, WikiSkill alcanzó 61,9% en LiveMath y 81,7% en SpreadSheet, frente a 33,9% y 40,8% respectivamente cuando el modelo trabajó sin habilidades.

Las ganancias no fueron uniformes en todos los dominios. Las tareas matemáticas y la manipulación de hojas de cálculo mostraron los saltos más amplios, mientras OfficeQA, que exige responder preguntas sobre documentos y manejar contextos largos, presentó avances más limitados en varias configuraciones. En Gemini-3.5-Flash, por ejemplo, la puntuación de OfficeQA pasó de 48,6% a 60,7%, una mejora relevante, aunque menor que la observada en LiveMath y SpreadSheet.

El tamaño del modelo también influyó en la capacidad de aprovechar las habilidades evolucionadas. Los investigadores señalaron que Qwen-3.5-4B tuvo dificultades para ejecutar de forma fiable estrategias de búsqueda de varios pasos cuando debía sostenerlas a través de contextos extensos, por lo que a menudo regresaba a su comportamiento predeterminado. Sin embargo, un modelo pequeño equipado con WikiSkill puede igualar el desempeño de un modelo mayor que no utilice el marco, lo que abre una posible vía para elevar la utilidad de sistemas con menos recursos.

Transferencia de habilidades y límites pendientes

Otra observación del estudio es que las habilidades creadas por un modelo pueden transferirse a otro y, en algunos casos, funcionar mejor que las instrucciones que el modelo receptor desarrolló por su cuenta. Esa posibilidad apunta a un repositorio compartido de procedimientos, donde una habilidad útil para resolver hojas de cálculo o navegar por la web podría reutilizarse en distintos agentes. No obstante, los resultados no garantizan que la transferencia sea beneficiosa en todos los casos, por lo que los investigadores plantean verificarla de manera individual.

La transferencia exige cautela porque una instrucción que funciona en un modelo puede depender de sus capacidades, estilo de razonamiento o forma de interactuar con las herramientas. Un agente más pequeño podría interpretar de manera incompleta una estrategia diseñada para un sistema mayor, especialmente cuando la tarea requiere mantener muchos pasos en contexto. El mecanismo de validación ofrece una barrera contra ese riesgo, pero no elimina la necesidad de evaluar cada habilidad en el entorno donde se utilizará.

WikiSkill también expone una diferencia fundamental entre memoria y aprendizaje. La wiki conserva información y el Skill Proposer genera instrucciones nuevas, pero los parámetros del modelo permanecen sin cambios; por eso, el sistema no adquiere una comprensión interna permanente de la misma manera que lo haría un proceso de entrenamiento continuo. La solución puede mejorar el comportamiento observable, aunque una mala conclusión, un registro incompleto o una inferencia equivocada podrían incorporarse a la base de conocimiento y afectar futuras decisiones.

El diseño de capas intenta contener ese problema al mantener separadas las trazas originales, las conclusiones y las habilidades activas. La posibilidad de revertir una actualización protege la ejecución inmediata, mientras la conservación de los intentos fallidos evita perder información útil para el análisis posterior. En conjunto, el enfoque muestra cómo los desarrolladores pueden construir agentes con una historia operativa acumulada sin afirmar que han resuelto el aprendizaje continuo, un desafío que todavía permanece abierto.

Los resultados sugieren que la memoria externa puede convertirse en una pieza importante para agentes que trabajan repetidamente en los mismos tipos de tareas. WikiSkill no elimina las limitaciones de los modelos ni asegura que cada experiencia produzca una mejora, pero ofrece un procedimiento sistemático para observar errores, documentar estrategias, probar cambios y conservar las lecciones obtenidas. La principal promesa del marco está en transformar el olvido entre ejecuciones en un proceso gradual de refinamiento controlado.

Este contenido se ofrece únicamente con fines informativos generales y no constituye un asesoramiento financiero, de inversión, legal ni fiscal. Cualquier evento, recompensa, promoción en línea o información relacionada que se mencione en el presente documento no debe considerarse como una recomendación, solicitud o invitación a comprar, vender, operar o de negociar de otra manera con cualquier criptoactivo. Los criptoactivos son sumamente volátiles y pueden provocar pérdidas. La disponibilidad de los servicios, productos y eventos relacionados de WEEX puede variar según la región. Tienes la responsabilidad de asegurarte de que tu participación esté de acuerdo con las leyes y regulaciones locales vigentes.

Te puede gustar

Artículos recientes

Más

Últimos listados de monedas en WEEX

iconiconiconiconiconiconicon
Atención al cliente:@weikecs
Cooperación empresarial:@weikecs
Trading cuantitativo y CM:bd@weex.com
Programa VIP:support@weex.com