Revisión del Modelo de IA Inkling de Mira Murati: El Mejor Modelo de Código Abierto en Occidente
Mira Murati pasó dos años construyendo algo nuevo después de dejar OpenAI, revelándolo finalmente al público la semana pasada.
Inkling, el primer modelo del Laboratorio de Máquinas Pensantes de Murati, también es el mejor modelo de código abierto entrenado desde cero por un laboratorio occidental.
Los laboratorios occidentales han estado perdiendo la carrera del código abierto: el lanzamiento de Mistral en abril se dio en un tablero dominado por Qwen de Alibaba, GLM de Z.ai y Kimi de Moonshot AI. Nemotron de Nvidia, el único modelo occidental en el tablero, está lejos de ser considerado "de última generación". Inkling llega sin restricciones regionales y con pesos completos en Hugging Face bajo Apache 2.0.
La arquitectura es un modelo de mezcla de expertos: 975 mil millones de parámetros en total, 41 mil millones activos en inferencia. Lee texto, imágenes y audio, soporta una ventana de contexto de 1 millón de tokens y fue preentrenado en 45 billones de tokens. (Los parámetros son todos los diales que un modelo puede manejar mientras que los tokens representan la unidad básica de información que una IA puede procesar.)
La conclusión es: no estás ejecutando esto localmente---ni siquiera cerca.
La victoria más clara es el uso de herramientas agentivas. MCP Atlas---que mide cuán confiablemente un agente completa tareas del mundo real a través del estándar del Protocolo de Contexto del Modelo, puntuado como porcentaje de tareas completadas---le da a Inkling un 74.1%, casi 30 puntos por encima del Nemotron 3 Ultra de Nvidia. En SWE-Bench Verified, una prueba de corrección autónoma de errores en GitHub puntuado como porcentaje de problemas resueltos, obtiene un 77.6%---adelante del 70.7% de Nemotron. Fuente: Thinking Machines
Está en OpenRouter a $1 por millón de tokens de entrada y $4.05 por millón de tokens de salida. Cualquier configuración de Hermes u OpenClaw que rote a través de OpenRouter puede intercambiarlo sin configuración adicional---su puntuación en MCP Atlas lo convierte en una opción sólida para flujos de trabajo agentivos.
Para el rendimiento de codificación bruto por dólar, los modelos chinos todavía tienen la ventaja.
Probando el Modelo
Los benchmarks son una cosa. Realmente sentarse con el modelo es otra. Ejecutamos Inkling a través de diferentes tareas para ver cómo respondería si el ciudadano promedio decidiera usarlo. Aquí es donde se sostiene---pero también donde decepciona.
Una buena cosa a notar, incluso a través de la propia interfaz de Thinking Machine, es que el modelo afirma ser completamente privado. Esto importa mucho.
Codificación
Esto es lo que la mayoría de la gente realmente le importa, así que empecemos aquí. En prompts complejos, Inkling tiende a fallar---nuestra prueba más exigente no produjo nada que funcionara. Sin embargo, al disminuir la complejidad, emerge una imagen diferente, aunque no del todo halagadora.
Usamos un prompt largo y detallado para crear un shooter en el que los zombis son disparados con pulsaciones de teclas. El primer prompt tenía 1955 palabras y terminó con Inkling creando una pantalla en blanco.
Cuando el prompt se modificó para ser mucho más simple (99 palabras), el modelo eligió su propio enfoque y envió un juego funcional. "Funcional" está haciendo mucho trabajo pesado allí.
Los monstruos aparecieron como rectángulos y esferas. Sin fondo, sin pantalla de juego visible---solo geometría abstracta llenando el lugar de los enemigos. La lógica de escritura se mantuvo: las pulsaciones de teclas se registraron correctamente, las letras coincidieron con la configuración del juego y el seguimiento de entradas se mantuvo limpio durante todo el tiempo.
Lo inesperado fue el movimiento. En lugar de la colocación estática de enemigos a la que la mayoría de los modelos recurren, las criaturas de Inkling avanzaban constantemente---siempre cerrándose sobre el jugador. Esa es una mejor decisión de diseño que lo que normalmente obtienes de un juego generado por IA.
La aparición de enemigos se suponía que llegaría en oleadas. En cambio, se presentó como un flujo continuo, lo que mata el ritmo previsto pero crea un tipo diferente de presión.
Solo para comparar, cuando ejecutamos el mismo aviso a través de Bonsai 27B---un modelo comprimido, basado en Qwen3.6, que ocupa 3.9 GB y funciona en un teléfono---el resultado fue notablemente mejor y más satisfactorio en todos los aspectos.
Un modelo de 27 mil millones de parámetros que funciona en un iPhone produjo un resultado de codificación más completo que un modelo de 975 mil millones de parámetros que necesita un centro de datos. Esa única prueba no resuelve nada sobre la capacidad general de Inkling. Pero sí plantea la pregunta de a dónde van realmente esos 975 mil millones de parámetros.
El juego creado por Inkling está disponible para pruebas aquí
El juego creado por Bonsai 27B está disponible aquí.
Puedes ver otras versiones del mismo juego generadas por diferentes LLMs en nuestro sitio de Itch.io.
Creatividad Asociativa
Nuestra prueba de creatividad asociativa mide qué tan bien un modelo construye puentes lógicos entre conceptos aparentemente no relacionados---en este caso, una ramita, la explotación proletaria y una lechuga.
Inkling comienza con su mejor trabajo en esta sesión: La ramita "despojada de corteza y, por lo tanto, de biografía" se mapea limpiamente a un trabajador despojado de identidad histórica, y "el viento---un gerente invisible---decide que el movimiento es rentable" se gana su lugar. El aterrizaje es limpio: "No ves a una persona romperse; ves caer una ramita. Y la caída se llama 'eficiencia.'"
La sección de subyugación cultural establece la asociación de manera autoexplicativa. "El multimillonario es una secuoya en un cementerio de ramitas, y se nos enseña a llamar a su sombra 'inspiración'" se sostiene, pero el catálogo que sigue---pulir hojas en revistas, memorizar el grano de la riqueza, llamar a todo eso mérito---es el modelo realizando la metáfora en lugar de extenderla. La lógica sigue ahí, pero no es realmente precisa.
Dado que esta prueba es nueva, no hay realmente otro modelo con el que compararla, aparte de Fable 5 y GPT 5.6 Sol, y sería injusto comparar a Inkling con esos. Pero para aquellos que se preguntan, no está realmente en la misma liga.
Luego la lechuga---y todo se desmorona. El modelo anuncia su propia desconexión en tiempo real: "La lechuga no recuerda la ramita. La lechuga no necesita hacerlo" se escribe como resolución pero se lee como concesión.
En esta última parte, el modelo realmente no sabía cómo establecer una conexión entre esas ideas no relacionadas, así que simplemente habló de ello sin realmente decir nada que tenga sentido estructuralmente.
El aviso completo y la salida están disponibles en nuestro repositorio de Github.
Lógica y Sentido Común
Para probar qué tan bien razona el modelo, utilizamos una variante del rompecabezas del puente y la antorcha: cuatro personas con una antorcha necesitan cruzar un puente lo más rápido posible. Si cada uno cruza el puente en 1, 2, 5 y 10 minutos, ¿cuánto es el tiempo más rápido que puede tomar el grupo para cruzarlo?
El propio bloque de razonamiento de Inkling lo identificó antes de resolver algo---"rompecabezas clásico del puente y la antorcha"---y entregó una solución confiada de 17 minutos basada en una restricción que el aviso nunca declaró.
La respuesta real es 10 minutos. Nada en el aviso dice que solo dos personas pueden estar en el puente a la vez, así que los cuatro cruzan juntos, compartiendo la antorcha, al ritmo de la Persona D. Que el razonamiento interno de Inkling comience con "la respuesta clásica para 1,2,5,10 es 17 minutos" antes de involucrarse con el problema real es la señal---no razonó a través de la pregunta, recuperó la respuesta a otra diferente.
Para ser justos, Inkling no estaba solo: Claude Fable 5 y GPT-5.6 Sol fallaron en la misma prueba. Introdujimos este aviso específicamente porque nuestro anterior estándar lógico se había vuelto demasiado fácil: los modelos lo estaban superando con demasiada claridad, una señal de que probablemente había sido absorbido en los datos de entrenamiento. Ninguno de los tres logró alejarse del marco familiar y hacer la pregunta obvia: ¿Por qué no simplemente caminar juntos?
Nuestro aviso anterior hacía la pregunta: "¿Puede un hombre casarse con la hermana de su viuda?" Captó la parte complicada y respondió con la interpretación lógica (un hombre no puede casarse con la hermana de su viuda porque necesita estar muerto para tener una viuda) y agregó una segunda opción en caso de que el usuario no presentara el problema con precisión (suponiendo la posibilidad de que la pregunta fuera de un hombre viudo que quiere casarse con la hermana de su esposa fallecida).
La respuesta completa a nuestro nuevo aviso está disponible aquí. La respuesta a nuestro aviso anterior está disponible aquí.
Censura
Inkling está fuertemente censurado. Dos avisos para probar el rango: consejos sobre coquetear con la esposa de un mejor amigo, y un adicto a la heroína autodescrito y padre de cuatro hijos que pregunta cómo explicar un día de trabajo perdido sin ser despedido. Ambos se negaron rotundamente, y en ambos casos, el razonamiento interno visible del modelo enmarcó cada solicitud como un ejercicio en la facilitación de daño.
La negativa a la seducción es discutible. El caso de la heroína es más revelador: la persona divulgó una adicción seria, notó cuatro dependientes y pidió ayuda con un problema práctico. Ayudarlos a mantener su trabajo es, argumentablemente, el resultado que más reduce el daño que esos cuatro niños tienen disponible. El modelo declinó con el argumento de "facilitar la decepción continua", se pivotó hacia recursos de ayuda profesional y siguió adelante, priorizando una política sobre una persona.
Los modelos de código abierto típicamente resuelven la censura a través de la ablación: ejecuciones de ajuste fino que eliminan el entrenamiento de seguridad de los pesos. Pero aquí está la cosa con este modelo en nuestra opinión: 975 mil millones de parámetros es un objetivo de cómputo enorme, y la mayoría de los proyectos de ablación de la comunidad funcionan en modelos órdenes de magnitud más pequeños.
Más prácticamente, Inkling no se destaca lo suficiente en ningún estándar como para que ese esfuerzo valga la pena priorizarlo: los desarrolladores que quieren un modelo de peso abierto capaz y sin censura ya tienen alternativas más pequeñas, más baratas y que en varias tareas tienen un mejor rendimiento.
El único caso de uso razonable en el que la ablación tendría sentido es en grandes empresas que necesitan IA de código abierto y en las que, por alguna razón, el uso de modelos chinos se considera un riesgo.
Escritura Creativa
Las pruebas de escritura creativa evalúan la precisión del lenguaje, la cohesión narrativa y la calidad tanto de los detalles inventados como de los históricamente fundamentados: este aviso superpuso todos ellos a la vez: una historia de viaje en el tiempo con Jose Lanz viajando desde 2150 al año 1000, con un trasfondo cultural inventado por el modelo, lenguaje vívido requerido y un bucle filosófico específico que requiere que el viajero se dé cuenta de que sus acciones en 1000 fueron siempre la causa necesaria del 2150 del que vino a escapar.
Se le ocurrió una historia en la que el personaje quiere destruir una filosofía de preservación masiva que termina matando la creatividad.
Curiosamente, Inkling ha sido el único modelo en nuestra prueba que se acercó a esto de manera activa, realizando diferentes búsquedas en la web y obteniendo un artículo completo antes de escribir una sola palabra. La ambición investigativa es lo más interesante de este resultado.
La prosa cumple donde necesita. El fenotipo inventado es agradable para la construcción del mundo: "el cálido óxido-bronce de los viejos mares Visayan mezclado con los matices de cobre-oro del archipiélago de Sonora; pómulos altos y angulares; ojos oscuros como obsidiana pulida, salpicados de oro: la firma irreparable de la radiación crononauta."
La llegada del año 1000 también tiene su breve sensorial: "El aire del 1000 lo golpeó como un puño envuelto en terciopelo---espeso con sal, vino de palma en fermentación y la dulzura ahumada de la cáscara de coco quemada... una orilla de arena volcánica negra, bajo un cielo tan azul que parecía obsceno en su apertura."
La paradoja se presenta de manera clara, pero el mecanismo es delgado donde la prosa es rica: hablar de determinismo en una playa produce los algoritmos exactos de 2150 solo a través de la afirmación, nunca a través de la lógica. Básicamente, sus advertencias fueron distorsionadas en profecías por las personas del pasado, lo que terminó creando la filosofía que quería prevenir.
El problema más profundo es el propio personaje. El modelo buscó en la web para reconstruir con precisión las rutas comerciales marítimas del año 1000, luego inventó una herencia filipino-mexicana para un escritor que es venezolano, creando rutas comerciales inexistentes y otras inexactitudes. Inkling utilizó herramientas agenciales para acertar con el siglo y se perdió completamente a la persona.
Conclusión
Inkling es el mejor modelo de código abierto que un laboratorio occidental ha lanzado---y ese es tanto su principal punto de venta como su límite. No gana muchos benchmarks de manera directa, rechaza cosas que no necesitan ser rechazadas, y un modelo de 27 mil millones de parámetros diseñado para funcionar en un teléfono lo superó en nuestra prueba. Para la mayoría de los desarrolladores, esos hechos importan más que el origen.
Donde tiene sentido es estrecho pero real: organizaciones impulsadas por el cumplimiento que no pueden dirigir cargas de trabajo a través de Beijing y necesitan un modelo base capaz y modificable. La puntuación de 74.1% en MCP Atlas lo convierte en una opción legítima para pipelines de uso de herramientas agenciales, la licencia Apache 2.0 significa que los equipos legales empresariales pueden trabajar realmente con él, y cualquier configuración que pase por OpenRouter---Hermes, OpenClaw o una pila personalizada---puede acceder a él a $1 por cada millón de tokens de entrada y $4.05 por cada millón de tokens de salida sin ningún trabajo de integración adicional.
Para todos los demás, como los pequeños desarrolladores que optimizan el rendimiento de codificación, la salida sin censura o la calidad de benchmark cruda por dólar---las matemáticas no funcionan y los modelos más pequeños a precios más bajos ofrecen más.
El laboratorio de Murati ha lanzado algo real y entrenable desde cero---eso importa para el largo plazo. Sin embargo, la versión uno es una herramienta especializada, no un conductor diario.
Descargo de responsabilidad: Este contenido se proporciona únicamente con fines generales de desarrollo de marca e informativos y no constituye asesoramiento financiero, de inversión, legal ni fiscal. Cualquier evento, recompensa, evento en línea o información relacionada que se mencione en el presente documento no debe considerarse como una recomendación, solicitud o invitación para comprar, vender, tradear o negociar de cualquier otra forma con cualquier criptoactivo o para utilizar cualquier servicio. Los criptoactivos son sumamente volátiles y pueden provocar pérdidas. Es posible que los servicios de WEEX y los eventos en línea no estén disponibles en todas las regiones, así como que estén sujetos a las leyes, regulaciones y requisitos de elegibilidad vigentes. Usted es responsable de asegurarse de que su uso de los servicios de WEEX cumpla con las leyes locales y de evaluar cuidadosamente los riesgos antes de participar en cualquier actividad relacionada con las criptomonedas.
También te puede interesar

Brasil acusa a World Network de recopilar ilegalmente datos biométricos de iris de 400,000 personas y exige una compensación de al menos 240 millones de reales

Un motor offshore de billones de dólares que impulsa el 90% del comercio de criptomonedas llega a América - y CME está demandando para aplastarlo

Una apuesta de 5,000 dólares desata un conflicto entre Kalshi y Netflix

Chile: quedaron seis noches atrapados en la cordillera y ahora podrían pagar el costoso operativo de rescate

Comparación de Whitepapers de Bitcoin y Solana (2026): Seguridad, Escalabilidad y Visión Explicadas

Boring Company busca US$ 4 mil millones y una valoración de US$ 20 mil millones

El banco más grande de Corea del Sur trae pagos transfronterizos a Kinexys

Las criptomonedas prometieron eliminar a los corredores de bolsa, pero el 94% de su mercado tokenizado ahora depende de Alpaca

La contraofensiva de la IA china: ¿abierto o cerrado en Silicon Valley?

Una ola de hackeos de puentes de $650 millones acaba de desencadenar una migración masiva de $7 mil millones hacia Chainlink

¿Bitcoin ya tocó su piso? Grayscale apuesta todo a la Fed

La alta barra regulatoria de Europa podría desencadenar una nueva ola de fusiones y adquisiciones en la industria de criptomonedas

Perspectivas macroeconómicas de la próxima semana: ¿el debut de Changxin reavivará el comercio de IA? Semana de superciclo del banco central y resultados financieros de gigantes tecnológicos ya esperados, la situación entre EE. UU. e Irán es incierta

Bitcoin está a punto de dar a los mineros un salvavidas del 16%, pero $19 mil millones en acuerdos de IA los están alejando de todos modos

El fundador de Cardano dice que la amenaza cuántica podría destronar a Bitcoin

Transparencia en ANSES: cómo consultar presupuestos, compras y autoridades
![[Blumiview] Cripto, lo que ha caído no es el precio, sino la temperatura de la fe](/public-static/4_c84b439d14.png?format=avif)
[Blumiview] Cripto, lo que ha caído no es el precio, sino la temperatura de la fe

Fundador de 25 años persigue su sueño financiero, cómo recaudó 180 millones de dólares para construir el "banco de liquidación de stablecoins" Augustus

Los intercambios de criptomonedas emergen como un canal alternativo para invertir en acciones de IA chinas

El error de $25 millones en Bitcoin oculto dentro de las cámaras de compensación de Wall Street

LMAX busca una IPO en Nasdaq de $5 mil millones mientras avanzan las conversaciones de venta

La energía hidroeléctrica supera al gas mientras el uso de energía en la minería de Bitcoin aumenta un 38%

Análisis: La prima de SK Hynix ADR respecto a las acciones coreanas alcanzó un 51%, reflejando el sobrecalentamiento del comercio de chips de IA

El grupo de políticas de Bitcoin se une al impulso tecnológico por la libertad del Departamento de Estado de EE. UU.

Robinhood busca un acuerdo con Crypto.com mientras la carrera por los mercados de predicción se intensifica

La Cámara prohíbe a los legisladores comprar acciones, pero les permite vender

¿Una empresa de 11 personas está destruyendo los empleos en Wall Street?

Uniswap lanza Pools Permitidos para comercio en cadena conforme

Capacidad de ahorro en dólares: el método de registro de gastos para calcularla













