Anoche, Silicon Valley vivió la batalla de los dioses de la IA
Autor: Max, Fundador de 01
Editor: Max
Anoche, Silicon Valley fue testigo de tres eventos importantes.
Google lanzó Gemini 3.8 Flash, Meta presentó Muse Spark 1.3, y una startup previamente desconocida, Mostik, fue entrevistada por el prestigioso medio WIRED.
Si solo observamos los dos primeros eventos, parece otra noche ordinaria de escalada en el ranking de IA.
Google acaba de llevar a Gemini a la cima de la lista de DeepSWE, y unas horas después, Meta anunció un rendimiento aún mejor, con el título de número uno del mundo que apenas se mantuvo unas horas.
Para 2026, todos estaremos casi insensibles a esto.
Lanzamientos de modelos, actualizaciones de benchmarks, celebraciones en X durante unas horas, y luego esperar a que la siguiente empresa continúe la escalada.
Pero si conectamos estos tres eventos de anoche, creo que lo realmente digno de atención no está en esas listas.
La economía de la IA está experimentando una transformación radical.
En los últimos años, al discutir los costos de la IA, los números más observados han sido el costo por millón de tokens.
Pero con la llegada de los Agentes, esta forma de medir se está volviendo cada vez más insuficiente.
Las preguntas realmente importantes en el futuro pueden no ser "¿cuánto cuesta un millón de tokens?", sino "¿cuánto cuesta arreglar un error?", "¿cuánto cuesta completar una investigación?", "¿cuánto cuesta hacer que un Agente trabaje durante tres horas seguidas?".
Y anoche, los costos de inferencia estaban disminuyendo desde varias direcciones completamente diferentes.
Google está incorporando capacidades de nivel frontera en modelos cada vez más baratos, Meta está haciendo que los Agentes completen la misma tarea con menos tokens y llamadas a herramientas, y Mostik va un paso más allá, comenzando a cuestionar:
Si ambas partes de la comunicación son IA, ¿por qué los modelos aún necesitan comunicarse en un lenguaje diseñado para humanos?
PARTE.01, Gemini ha vuelto
Empecemos con Google.
Google lanzó su nuevo modelo insignia, Gemini 3.8 Flash, que oficialmente se describe como su modelo de inferencia y código más potente hasta la fecha.
Esta es también la tercera actualización de la serie Flash en seis semanas, pasando de 3.6 a 3.7 y ahora a 3.8.
La impresión que siempre ha dejado Flash ha sido muy simple: más rápido, más barato, pero con capacidades algo inferiores a los modelos más potentes.
Google está comenzando a cambiar poco a poco esta definición.
Esta vez, la mejora más significativa de 3.8 Flash se centra en la codificación a largo plazo y el flujo de trabajo agente.
En la evaluación de la capacidad de ingeniería de software a largo plazo de IA, DeepSWE v1.1, obtuvo aproximadamente un 74%.
La principal diferencia entre DeepSWE y los benchmarks de código tradicionales es que no se le lanza al modelo un problema algorítmico, sino que realmente se coloca a un Agente en un repositorio de código.
El modelo necesita entender el problema, buscar código, modificar archivos, llamar herramientas, ejecutar pruebas y, tras fallar, seguir buscando la causa.
Una tarea completa puede durar decenas o incluso cientos de pasos.
En estas pruebas, Gemini 3.8 Flash llegó a ocupar el primer lugar del mundo.
Claude Opus 5 también obtuvo aproximadamente un 74%, GPT-5.6 Sol alrededor del 73%, y el anteriormente líder Fable 5 cerca del 70%.
Si solo observamos las capacidades, ya no hay diferencias enormes entre estos modelos más potentes.
Lo verdaderamente aterrador es otro número: el dinero.
El precio de lanzamiento de la API de Gemini 3.8 Flash se mantiene en 0.75 dólares por 1M de tokens de entrada y 3.75 dólares por 1M de tokens de salida.
Completar una tarea completa en DeepSWE tiene un costo promedio de solo 2.36 dólares.
En comparación, Claude Opus 5, que también tiene aproximadamente un 74%, tiene un costo promedio por tarea de 11.84 dólares; GPT-5.6 Sol, con aproximadamente un 73%, también tiene un costo promedio de 6.46 dólares.
Es decir, para un nivel similar de capacidad de ingeniería de software, el costo de ejecución puede diferir por varios factores.
Esto se volverá muy importante en la era de los Agentes.
En la era de los chatbots, un par de centavos de diferencia en el costo de una respuesta no es percibido por el usuario promedio.
Pero los Agentes son completamente diferentes; un agente de codificación puede ejecutar 100 pasos consecutivos, un agente de investigación puede buscar decenas de páginas web, leer cientos de páginas de material, y en el futuro, los Agentes en las empresas pueden trabajar durante varias horas seguidas.
Google incluso mencionó que 3.8 Flash, al enfrentar tareas complejas, trabajará más duro, realizando más inferencias y llamadas a herramientas.
Google no ha hecho que el modelo "piense menos" para ahorrar dinero, sino que, dado que los tokens son lo suficientemente baratos, se permite ejecutar bucles más largos.
Por lo tanto, creo que lo verdaderamente importante de 3.8 Flash no es que haya alcanzado nuevamente el primer lugar del mundo.
Sino que está comprimiendo capacidades que antes solo podían ofrecer los modelos frontera más caros en el rango de precios de Flash.
PARTE.02, Meta regresa tres horas y media después
Mientras los empleados de Google celebraban el lanzamiento de Gemini 3.8 Flash, Meta hizo su aparición repentina.
Meta lanzó de repente el modelo Muse Spark 1.3.
Según la evaluación publicada por Meta, Muse Spark 1.3 alcanzó un 75.4% en DeepSWE v1.1.
Este número supera a Gemini 3.8 Flash, Claude Opus 5 y GPT-5.6 Sol.
Más sorprendente es que Muse Spark 1.2 solo obtuvo aproximadamente un 55% en esta prueba.
De 1.2 a 1.3, una pequeña actualización de versión aumentó directamente alrededor de 20 puntos porcentuales.
Pero creo que lo que realmente vale la pena observar de Meta esta vez no es solo el 75.4%.
Hay otros dos números: las llamadas a herramientas se redujeron en aproximadamente un 20%, y el consumo de tokens se redujo en aproximadamente un 25%.
Este aspecto puede ser fácilmente pasado por alto, pero en realidad se acerca a uno de los problemas más importantes después de la comercialización real de un Agente.
Un Agente a menudo desperdicia dinero no por pensar normalmente, sino por desviarse.
Por ejemplo, si un agente de codificación malinterpreta los requisitos en el paso 20, puede continuar modificando cinco archivos, ejecutar tres rondas de pruebas, buscar mucho código, y solo al final darse cuenta de que se ha equivocado, y luego empezar de nuevo.
Decenas de llamadas a herramientas y miles de tokens se desperdician así.
Por lo tanto, si un modelo puede detectar ambigüedades en la tarea más temprano, darse cuenta de que no puede continuar más pronto, o preguntar al usuario antes, en realidad está reduciendo costos directamente.
Las capacidades que Muse Spark 1.3 ha reforzado pertenecen a esta categoría: puede mantener múltiples flujos de trabajo simultáneamente en un hilo largo, preguntar proactivamente ante tareas ambiguas, solicitar ayuda ante problemas que no puede resolver, confirmar antes de realizar operaciones irreversibles, y después de muchas rondas de ejecución de tareas largas, es menos probable que olvide las restricciones iniciales.
Meta incluso ha comenzado a enfatizar el reconocimiento del modelo de sus propios límites de capacidad: sabe lo que puede hacer y lo que no puede hacer.
Estas capacidades pueden no parecer tan atractivas como un aumento de 20 puntos en el benchmark en la era de los chatbots, pero en la era de los Agentes, todas pueden traducirse directamente en dinero.
Un Agente que comete un error menos es, en sí mismo, una optimización de la inferencia.
Por lo tanto, al observar a Google y Meta juntos, la unidad de medida de la competencia entre grandes modelos está cambiando silenciosamente.
En el futuro, es posible que cada vez menos personas se preocupen por "¿cuánto cuesta un millón de tokens?", y cada vez más se preocupen por otro número:
¿Cuánto cuesta ejecutar una tarea real de principio a fin?
PARTE.03, Mostik, un avance disruptivo
Si Google y Meta aún están investigando cómo completar tareas de manera más barata y con menos tokens, Mostik ha comenzado a abordar una cuestión más fundamental:
¿Por qué estos tokens deben existir?
Mostik significa "puente" en ruso.
La CEO Sasha Malysheva es la principal desarrolladora de este método, y su científico jefe es el profesor de la Universidad de Ginebra y ganador de la Medalla Fields de 2010, Stanislav Smirnov.
Están intentando hacer algo que suena muy simple, pero que es extremadamente difícil: hacer que dos modelos de IA dejen de comunicarse entre sí a través del lenguaje natural.
Hoy en día, la gran mayoría de los sistemas Multi-Agent funcionan de esta manera:
El Modelo A recibe cierta información y luego genera cientos o incluso miles de tokens, expresando su conclusión en lenguaje natural; el Modelo B luego lee todo este texto, lo comprende y establece su propia representación interna, y luego continúa razonando.
Pero el problema es que lo que realmente se calcula dentro de un modelo grande no es ni chino ni inglés, sino:
Representaciones matemáticas continuas de alta dimensión.
Esto es como si dos computadoras pudieran transferir datos directamente, pero la computadora A primero imprime el archivo en cientos de páginas y luego la computadora B usa una cámara para escanearlo página por página mediante OCR.
Durante mucho tiempo, todos han estado investigando cómo reducir los costos de impresión, pero Mostik quiere simplemente deshacerse de la impresora.
Intentan establecer un puente entre las representaciones internas de diferentes modelos, permitiendo que los modelos intercambien representaciones latentes directamente, en lugar de generar primero un lenguaje natural.
Un experimento revelado por el medio de Silicon Valley WIRED es muy interesante.
Mostik conectó la versión completa de GLM-5.2 753B con Qwen 3.5, que solo tiene 4B y puede funcionar en dispositivos móviles.
El sistema híbrido resultante tiene capacidades entre los dos modelos, pero el costo de inferencia es solo 1/20 del GLM-5.2 completo.
Por supuesto, es demasiado pronto para decir que Mostik ha resuelto la comunicación entre modelos.
La comunicación latente no es algo nuevo, ya ha habido varios estudios en los últimos años que intentan intercambiar embeddings, estados ocultos, cachés KV y otras representaciones internas.
El verdadero desafío es que las arquitecturas, parámetros, datos de entrenamiento y sistemas de coordenadas internos de los diferentes modelos son distintos; hacer que dos modelos entiendan realmente el espacio latente del otro es en sí mismo un problema muy complicado.
Smirnov también admite que actualmente incluso falta un lenguaje matemático maduro para describir las representaciones comunes entre diferentes modelos.
Pero el número 1/20 aún me emociona mucho.
Porque me hace empezar a pensar seriamente en una arquitectura de IA completamente diferente en el futuro.
PARTE 04: En el futuro, solo necesitarás un modelo de 0.xB
En los últimos dos años, al discutir la IA en el borde, hemos estado investigando cómo meter modelos más grandes en los teléfonos: 7B, 4B, 3B, 1B, destilando, cuantificando y comprimiendo constantemente.
Pero si la ruta de Mostik realmente puede funcionar, creo que en el futuro los teléfonos quizás no necesiten un gran modelo "que lo haga todo".
Tu dispositivo podría necesitar ejecutar solo un pequeño modelo de 0.xB o unos pocos B.
Es muy barato, puede funcionar continuamente, y es responsable de entender en qué aplicación estás, qué has hecho recientemente, cuál es el estado del dispositivo y manejar la mayoría de las tareas simples y frecuentes.
Cuando te enfrentes a problemas realmente difíciles, puedes llamar a un gran modelo remoto a través de la comunicación en el espacio latente.
Pero la diferencia clave es que no necesita enviar todo el contexto de cien mil tokens a la nube como lo hace hoy, permitiendo que el modelo remoto lo lea desde el principio.
Podría necesitar transmitir solo un estado latente altamente comprimido.
Después de que el gran modelo remoto complete la inferencia compleja, no necesariamente necesita generar miles de tokens de explicaciones en lenguaje natural para el modelo local, sino que simplemente devuelve la nueva representación interna.
De esta manera, el pequeño modelo local se encarga de las tareas de alta frecuencia, baratas y de funcionamiento continuo, mientras que el modelo fronterizo en la nube se encarga de la inferencia de baja frecuencia pero realmente difícil, utilizando algún tipo de puente para una comunicación eficiente.
Si realmente se puede lograr esto en el futuro, la reducción en el costo de inferencia podría ser mucho más que la reducción del 30% o 50% en el precio de la API de hoy.
Podría cambiar la forma en que organizamos el cálculo de IA en sí mismo.
PARTE 05: Conclusión
Así que al mirar hacia atrás a anoche, superficialmente eran tres noticias completamente diferentes.
Google lanzó Gemini 3.8 Flash, llevando capacidades de nivel fronterizo al rango de precios de Flash;
Meta lanzó Muse Spark 1.3, permitiendo que los agentes hagan más cosas con menos tokens y llamadas a herramientas;
Mostik fue un paso más allá, comenzando a intentar que una parte de los tokens entre modelos no se generen desde el principio.
En realidad, todas apuntan a un mismo cambio:
La inteligencia se está volviendo increíblemente barata a una velocidad asombrosa.
Y esta reducción de precios ya no se trata solo de la disminución del precio por API.
Los precios de los modelos están bajando, la cantidad de cálculo necesaria para completar tareas está disminuyendo, e incluso la forma en que los modelos intercambian información está comenzando a rediseñarse.
El impacto que esto podría tener al final podría ser mucho mayor que un par de puntos porcentuales en los benchmarks.
Porque muchas tecnologías realmente explotan, no cuando "por fin son utilizables", sino cuando "finalmente son lo suficientemente baratas como para usarse libremente".
Hoy en día, hacer que un agente gaste decenas de dólares en completar una tarea pequeña de una persona común puede no ser rentable en absoluto.
Si en el futuro solo se necesita unos pocos centavos, muchas aplicaciones que hoy parecen locas podrían comenzar a existir.
Hoy no podemos hacer que decenas de agentes funcionen 24 horas al día alrededor de una persona; si el costo de inferencia disminuye uno o dos órdenes de magnitud, podría convertirse en el estado predeterminado.
Ya son las siete de la mañana, debería haber estado durmiendo hace unas horas.
Pero después de que se lanzó Gemini, Meta siguió unas horas después, y luego vi el experimento de Mostik de 1/20.
Estuve pensando en estas cosas mientras estaba en la cama, pensando en el modelo de 0.xB en el teléfono, en el gran modelo en la nube, y en que quizás ni siquiera necesiten hablarse en lenguaje natural.
Cuanto más pensaba, menos podía dormir, así que me levanté y terminé escribiendo este artículo.
El 74% de Gemini, el 75.4% de Muse, en unos días podrían aparecer nuevos números que los superen.
Pero ahora realmente me cuesta calmar esta emoción.
Porque en lugar de quién ha logrado el primer lugar en el mundo, me importa cada vez más otra pregunta:
¿Hasta qué punto puede ser barato un AI tan inteligente?
Una vez que una inteligencia poderosa sea realmente lo suficientemente barata como para ser invocada libremente, creo que muchos productos de IA que hoy parecen locos podrían estar apenas comenzando.
Precio de --
Este contenido se ofrece únicamente con fines informativos generales y no constituye un asesoramiento financiero, de inversión, legal ni fiscal. Cualquier evento, recompensa, promoción en línea o información relacionada que se mencione en el presente documento no debe considerarse como una recomendación, solicitud o invitación a comprar, vender, operar o de negociar de otra manera con cualquier criptoactivo. Los criptoactivos son sumamente volátiles y pueden provocar pérdidas. La disponibilidad de los servicios, productos y eventos relacionados de WEEX puede variar según la región. Tienes la responsabilidad de asegurarte de que tu participación esté de acuerdo con las leyes y regulaciones locales vigentes.
Te puede gustar

Información importante de anoche y esta mañana (2 de septiembre - 3 de septiembre)

Meta lanza el modelo Muse Spark 1.3, mejorando el rendimiento de los agentes de IA personales

Robinhood estalla, ¿por qué sube UNI?

Resumen de los grandes eventos de Web3 en septiembre de 2026

NVIDIA invierte 3.500 millones de dólares en bonos convertibles de MediaTek

El volumen de préstamos activos en DeFi alcanza los 26.1 mil millones de dólares, creciendo casi un 30%

Asus y MSI agotan las reservas de los primeros modelos de RTX Spark

Spark activa un nuevo dominio spark.finance e integra funciones de préstamo

Spark registra ingresos de 40,6 millones de dólares en el segundo trimestre, márgenes de préstamo negativos
![[ETH Letter] Confirmación de Glamsterdam y publicación de detalles sobre contrataciones y financiamiento de la fundación](/public-static/14_1ee1df8c36.png?format=avif)
[ETH Letter] Confirmación de Glamsterdam y publicación de detalles sobre contrataciones y financiamiento de la fundación

NVIDIA anuncia la expansión de la biblioteca CUDA-X

Meta lanza Muse Code, una herramienta de codificación AI, reduciendo las tarifas de uso de tokens en un 80%

Muse Spark 1.2 Versión Contributor gratis por tiempo limitado

Reestructuración de la competencia en IA: presión de costos en Open Weight

Google ofrece un año de suscripción gratuita a Google AI para estudiantes universitarios

El proyecto está ganando dinero, pero el token sigue cayendo: ¿cuál es el problema?

Morgan Stanley interpreta: ¿Por qué Amazon y Google siguen siendo optimistas en medio de la guerra de precios de IA?

Informe de financiación semanal | Mastercard adquiere la empresa de infraestructura de stablecoin BVNK; Yellow Card completa una financiación estratégica de 40 millones de dólares con la participación de Standard Chartered, Sony y otros

Informe financiero del segundo trimestre de Spark: ingresos totales de 40,6 millones de dólares, ingresos de la línea de distribución de 4,53 millones de dólares

Informe de financiación semanal | Amazon invierte 50.000 millones de dólares en OpenAI; Axis Robotics completa una ronda de financiación semilla de 12 millones de dólares

Informe del ecosistema de Robinhood Chain: Calor de negociación, fuentes de TVL, expansión de stablecoins y lógica de evolución de corredores

IOSG: Análisis completo de L2 construido por Robinhood, desde el arranque frío de Meme hasta la implementación de RWA

¡Ver el AI no significa ver el objetivo correcto! ¿Cómo equilibrar hardware y software en la segunda mitad del año? Desde grandes tecnologías, Intel hasta la industria militar y médica

¿Qué hacen los proyectos que nacen en el mercado bajista de las criptomonedas?

Meta está desarrollando un asistente de IA personalizado que ayuda a los usuarios a crear robots agentes autónomos

Informe matutino | Aethir asegura un contrato empresarial de $260 millones con Axe Compute; New Fire Technology adquiere el equipo comercial de Avenir Group; el volumen de operaciones de Polymarket es superado por Kalshi

Santiment: Después del incidente de Kelp, surgió el "comercio de refugiados", y el token SPK aumentó un 100% en 48 horas

Sun Yuchen ha depositado un total de 1.300 millones de dólares en activos en Spark, con recompensas de USDS Farming que alcanzan hasta 5,38 millones de dólares.

Mientras el edificio de Aave se derrumba, el rascacielos de Spark está en construcción











