Cohere ha abierto su modelo de lenguaje visual más pequeño, North Micro Vision, con 2.4B de parámetros, bajo la licencia Apache 2.0. Este modelo se centra en documentos, tablas, gráficos, capturas de pantalla y OCR, y puede procesar imágenes en su proporción y resolución originales sin necesidad de compresión previa. El modelo está compuesto por un modelo de lenguaje de 2B y un codificador visual de 400M. En las pruebas oficiales, obtuvo una puntuación de 92.1% en DocVQA, superando el 89.6% de Ministral 3 3B y el 73.2% de Gemma 4 E2B, acercándose al 92.6% de Qwen3.5-2B. En la localización visual, RefCOCO alcanzó un 73.2%, también superior a Ministral y Gemma. Sin embargo, North Micro Vision no supera a Qwen3.5-2B en la mayoría de los benchmarks de visión general, OCR y multimodal, con sus ventajas concentradas principalmente en la comprensión de documentos y la localización visual. Además, este modelo no soporta inferencias ni llamadas a herramientas, y tiene capacidades limitadas en matemáticas y programación.
Este contenido se ofrece únicamente con fines informativos generales y no constituye un asesoramiento financiero, de inversión, legal ni fiscal. Cualquier evento, recompensa, promoción en línea o información relacionada que se mencione en el presente documento no debe considerarse como una recomendación, solicitud o invitación a comprar, vender, operar o de negociar de otra manera con cualquier criptoactivo. Los criptoactivos son sumamente volátiles y pueden provocar pérdidas. La disponibilidad de los servicios, productos y eventos relacionados de WEEX puede variar según la región. Tienes la responsabilidad de asegurarte de que tu participación esté de acuerdo con las leyes y regulaciones locales vigentes.





























