Google crea WikiSkill para que los agentes de IA recuerden sus errores y mejoren
Investigadores de Google Research presentaron WikiSkill, un marco que conserva los errores y aciertos de los agentes de IA en una wiki persistente para crear mejores instrucciones en ejecuciones futuras. Las pruebas muestran avances importantes en matemáticas, hojas de cálculo y entornos interactivos, aunque el sistema todavía no representa aprendizaje continuo en sentido estricto. ***
- WikiSkill separa las trazas de ejecución, el conocimiento acumulado y las instrucciones activas en tres capas.
- El marco elevó el promedio de Gemini 3.5 Flash de 49,5% a 68,1% y el de Qwen-3.6-27B de 39,4% a 63,3%.
- Los modelos grandes aprovechan mejor las habilidades evolucionadas, mientras los pequeños pueden cerrar parte de la brecha.
Una memoria externa para agentes que olvidan
Investigadores de Google Research presentaron WikiSkill como un marco destinado a resolver una limitación recurrente de los agentes de inteligencia artificial: cada ejecución termina y gran parte de la experiencia obtenida desaparece. En lugar de modificar los parámetros del modelo después de cada tarea, el sistema reúne información sobre fallos, aciertos y estrategias útiles en una estructura similar a una enciclopedia colaborativa. El agente consulta luego ese material para actuar con mejores instrucciones en la siguiente oportunidad.
La propuesta no implica que el modelo aprenda de manera continua en el sentido tradicional. El modelo conserva su entrenamiento original, pero genera instrucciones más precisas para sí mismo a partir de la experiencia registrada, una solución menos elegante que el aprendizaje permanente y potencialmente vulnerable a errores acumulados. Aun así, los resultados del estudio indican que esta memoria externa puede mejorar de forma significativa el rendimiento en tareas que exigen varios pasos y uso coordinado de herramientas.
El concepto parte de una perspectiva atribuida a Andrej Karpathy sobre una especie de wiki para modelos de lenguaje, donde la experiencia de los agentes se transforma en conocimiento persistente y acumulativo. WikiSkill lleva esa idea al desarrollo automático de habilidades, con un proceso que intenta convertir las ejecuciones anteriores en procedimientos reutilizables sin tocar el comportamiento aprendido durante el entrenamiento. La distinción resulta relevante porque permite probar cambios de conducta sin realizar un nuevo ajuste completo del modelo.
El trabajo fue evaluado en cinco tipos de pruebas: razonamiento matemático, búsqueda web, manipulación de hojas de cálculo, preguntas y respuestas sobre documentos y tareas interactivas en un entorno virtual. Los investigadores utilizaron Qwen en versiones de 4.000 millones, 9.000 millones y 27.000 millones de parámetros, además de Gemma-4-31B y Gemini-3.5-Flash. Esa combinación permitió observar cómo la memoria acumulada funciona en modelos de distintas capacidades y frente a tareas con exigencias muy diferentes.
Tres capas y un ciclo de mejora
WikiSkill organiza el espacio de trabajo en tres niveles que cumplen funciones separadas. La Raw Layer conserva las trazas completas de cada ejecución, incluidas las llamadas a herramientas, las respuestas obtenidas y los pasos seguidos por el agente; esos registros son inmutables y sirven como materia prima para analizar el comportamiento. Por encima está la Wiki Layer, donde la experiencia se convierte en conclusiones estructuradas, como patrones de fallo, recomendaciones operativas y estrategias que produjeron resultados favorables.
La Wiki Layer no se reinicia después de una tarea, sino que crece con cada iteración, de acuerdo con la descripción de los investigadores. Esa continuidad permite que una ejecución posterior consulte problemas detectados anteriormente, incluso si la estrategia que los provocó ya no se encuentra activa. La tercera capa, llamada Skill Layer, contiene las instrucciones procedimentales que el agente utiliza durante la ejecución y funciona como la parte modificable del sistema.
El ciclo comienza cuando un agente de inferencia completa una tarea con las habilidades disponibles y produce una nueva traza. Después, un Wiki Maintainer revisa esos registros para identificar qué salió mal y qué decisiones ayudaron, mientras un Skill Proposer utiliza las conclusiones acumuladas para sugerir cambios concretos en las instrucciones activas. La arquitectura separa así la observación de los hechos, la interpretación de la experiencia y la aplicación de una nueva conducta.
Antes de aceptar una modificación, un mecanismo de validación o gating la prueba en un conjunto independiente de tareas. Si el cambio mejora los resultados, puede incorporarse a la Skill Layer; si perjudica el desempeño, se revierte sin eliminar la información que originó la propuesta. Incluso una actualización fallida conserva utilidad, porque la wiki registra qué se intentó y por qué no funcionó, de modo que el sistema puede evitar repetir el mismo camino o diseñar una alternativa en rondas posteriores.
Resultados desiguales según el modelo y la tarea
El estudio reportó mejoras de WikiSkill frente a agentes sin habilidades adicionales. En promedio, Gemini-3.5-Flash pasó de 49,5% sin habilidades a 68,1% con WikiSkill, mientras Qwen-3.6-27B avanzó de 39,4% a 63,3%. Las cifras corresponden al promedio de los cinco benchmarks y fueron calculadas a partir de tres ejecuciones independientes, según la tabla incluida en el trabajo.
Al observar tareas individuales, las diferencias resultan todavía más visibles. Gemini-3.5-Flash subió de 33,0% a 72,6% en LiveMath y de 50,5% a 76,6% en SpreadSheet, dos de los escenarios donde las instrucciones acumuladas parecen tener mayor impacto. En el caso de Qwen-3.6-27B, WikiSkill alcanzó 61,9% en LiveMath y 81,7% en SpreadSheet, frente a 33,9% y 40,8% respectivamente cuando el modelo trabajó sin habilidades.
Las ganancias no fueron uniformes en todos los dominios. Las tareas matemáticas y la manipulación de hojas de cálculo mostraron los saltos más amplios, mientras OfficeQA, que exige responder preguntas sobre documentos y manejar contextos largos, presentó avances más limitados en varias configuraciones. En Gemini-3.5-Flash, por ejemplo, la puntuación de OfficeQA pasó de 48,6% a 60,7%, una mejora relevante, aunque menor que la observada en LiveMath y SpreadSheet.
El tamaño del modelo también influyó en la capacidad de aprovechar las habilidades evolucionadas. Los investigadores señalaron que Qwen-3.5-4B tuvo dificultades para ejecutar de forma fiable estrategias de búsqueda de varios pasos cuando debía sostenerlas a través de contextos extensos, por lo que a menudo regresaba a su comportamiento predeterminado. Sin embargo, un modelo pequeño equipado con WikiSkill puede igualar el desempeño de un modelo mayor que no utilice el marco, lo que abre una posible vía para elevar la utilidad de sistemas con menos recursos.
Transferencia de habilidades y límites pendientes
Otra observación del estudio es que las habilidades creadas por un modelo pueden transferirse a otro y, en algunos casos, funcionar mejor que las instrucciones que el modelo receptor desarrolló por su cuenta. Esa posibilidad apunta a un repositorio compartido de procedimientos, donde una habilidad útil para resolver hojas de cálculo o navegar por la web podría reutilizarse en distintos agentes. No obstante, los resultados no garantizan que la transferencia sea beneficiosa en todos los casos, por lo que los investigadores plantean verificarla de manera individual.
La transferencia exige cautela porque una instrucción que funciona en un modelo puede depender de sus capacidades, estilo de razonamiento o forma de interactuar con las herramientas. Un agente más pequeño podría interpretar de manera incompleta una estrategia diseñada para un sistema mayor, especialmente cuando la tarea requiere mantener muchos pasos en contexto. El mecanismo de validación ofrece una barrera contra ese riesgo, pero no elimina la necesidad de evaluar cada habilidad en el entorno donde se utilizará.
WikiSkill también expone una diferencia fundamental entre memoria y aprendizaje. La wiki conserva información y el Skill Proposer genera instrucciones nuevas, pero los parámetros del modelo permanecen sin cambios; por eso, el sistema no adquiere una comprensión interna permanente de la misma manera que lo haría un proceso de entrenamiento continuo. La solución puede mejorar el comportamiento observable, aunque una mala conclusión, un registro incompleto o una inferencia equivocada podrían incorporarse a la base de conocimiento y afectar futuras decisiones.
El diseño de capas intenta contener ese problema al mantener separadas las trazas originales, las conclusiones y las habilidades activas. La posibilidad de revertir una actualización protege la ejecución inmediata, mientras la conservación de los intentos fallidos evita perder información útil para el análisis posterior. En conjunto, el enfoque muestra cómo los desarrolladores pueden construir agentes con una historia operativa acumulada sin afirmar que han resuelto el aprendizaje continuo, un desafío que todavía permanece abierto.
Los resultados sugieren que la memoria externa puede convertirse en una pieza importante para agentes que trabajan repetidamente en los mismos tipos de tareas. WikiSkill no elimina las limitaciones de los modelos ni asegura que cada experiencia produzca una mejora, pero ofrece un procedimiento sistemático para observar errores, documentar estrategias, probar cambios y conservar las lecciones obtenidas. La principal promesa del marco está en transformar el olvido entre ejecuciones en un proceso gradual de refinamiento controlado.
Este contenido se ofrece únicamente con fines informativos generales y no constituye un asesoramiento financiero, de inversión, legal ni fiscal. Cualquier evento, recompensa, promoción en línea o información relacionada que se mencione en el presente documento no debe considerarse como una recomendación, solicitud o invitación a comprar, vender, operar o de negociar de otra manera con cualquier criptoactivo. Los criptoactivos son sumamente volátiles y pueden provocar pérdidas. La disponibilidad de los servicios, productos y eventos relacionados de WEEX puede variar según la región. Tienes la responsabilidad de asegurarte de que tu participación esté de acuerdo con las leyes y regulaciones locales vigentes.
Te puede gustar

Ciberataque en Manchester: 8,7 millones de viajeros atrapados por el Wi-Fi gratuito de los aeropuertos

Contratos perpetuos de acciones de Ethena: Ethena busca nueva rentabilidad para USDe en contratos perpetuos de acciones

Las plataformas de criptomonedas perdieron $3,63 mil millones debido a ciberataques

La policía del Reino Unido incauta 1,4 millones de dólares vinculados a actividades del mercado darknet

Lambda capta 1.000 millones de dólares en deuda para comprar chips de Nvidia

Los fabricantes chinos apuestan por robots humanoides como nueva fuente de ingresos

Reflexión de un Fundador: ¿Por qué Fomo Avanzó Más Que Nosotros Desde el Mismo Punto de Partida?

El token GOLD se desploma un 99% tras una publicación vinculada a Trump, venta de 1 millón de dólares

Hyperliquid obtiene el primer DEX de resultado HIP-4 con OUT

La cara B de bStocks: No hacer un mejor Nasdaq, sino luchar por el poder de fijación de precios con Perp

Los ETFs de XRP ganan terreno en dos presentaciones de fondos en EE. UU.

RWA: CZ quiere que los Estados tokenicen todo para atraer capital extranjero

Dólar, tipos e inflación: por qué septiembre puede ser un mes clave para esta carrera

Se lanza un nuevo sistema de pago de cuentas de débito, pero los bancos anticipan un uso limitado

Las ventas de NFT caen un 44,7% a 63,3 millones de dólares mientras Ethereum lidera

Polygon Labs emite un aviso urgente de actualización para clientes tras los hardforks de Austin y Kioto

La inteligencia encarnada entra en la segunda mitad, y las empresas automotrices son cada vez más imprescindibles

Blockchain: Mastercard revela lo que realmente exigen los bancos

Sigue el dinero: 2 mil millones de dólares para Strategy, el incubador YZi Labs y el dominio de DeFi
![[Columna] El dólar en blockchain, el yuan en oro... La guerra de las divisas ha cambiado](/public-static/26_2e1840f602.png?format=avif)
[Columna] El dólar en blockchain, el yuan en oro... La guerra de las divisas ha cambiado

Charles Schwab añade Solana, Avalanche y Chainlink a su oferta de criptomonedas

¿Qué significa la nueva postura de la FED para Bitcoin y las criptomonedas? Análisis detallado

Criptomonedas en Brasil: Leyes, impuestos, cómo comprar y cómo encontrar las mejores tasas de cambio

Financiación de capital de riesgo en criptomonedas: RQD* recauda 74 millones de dólares, Fasset obtiene 68 millones

Diálogo con el fundador de Epoch Ventures: Se ha iniciado una rotación masiva de capital, el ciclo de cuatro años ha terminado

FWA realiza transacciones por 17,000 ETH, continuando después del fin de recompensas

Cardone Capital añade 1.200 BTC utilizando ingresos por alquiler

La SEC se mueve para eximir los futuros de deuda de la UE bajo las reglas de EE. UU.

OPEP: Venezuela discute una salida con EE. UU., 5 meses después de los Emiratos


