Odaily Planet Daily informa que NVIDIA ha lanzado el sistema de enrutamiento de modelos de IA NeMo Switchyard, diseñado para ayudar a los desarrolladores a asignar dinámicamente tareas de agentes de IA entre múltiples modelos grandes, garantizando el rendimiento mientras se reducen los costos y la latencia.
Se señala que construir un agente de IA no significa que se deba depender de un único modelo grande. Diferentes modelos tienen ventajas en términos de capacidad de inferencia, velocidad de respuesta y costos operativos; por ejemplo, las tareas de clasificación pueden ser adecuadas para modelos ligeros, mientras que el razonamiento complejo requiere modelos de vanguardia más potentes. Si todas las solicitudes se envían al modelo de mayor escala, esto resultará en un aumento de costos y latencia; mientras que el uso exclusivo de modelos pequeños puede disminuir la calidad en la finalización de tareas complejas. NeMo Switchyard, a través de un mecanismo de enrutamiento inteligente, selecciona automáticamente el modelo de ejecución más adecuado entre múltiples modelos dedicados y modelos de vanguardia, basándose en factores como las necesidades de la tarea, las capacidades del modelo, los costos, la latencia y el estado del sistema. Este sistema permite a los desarrolladores cambiar entre diferentes proveedores de modelos y versiones de modelos sin alterar la arquitectura de la aplicación.
Se introduce que NeMo Switchyard ofrece varias estrategias de enrutamiento, incluyendo enrutamiento de clasificadores LLM sin necesidad de entrenamiento, enrutamiento por etapas (Stage Router), enrutamiento de escalada (Escalation Router) y modelos de enrutamiento ajustables entrenados con datos de carga de trabajo reales. Entre ellos, el enrutamiento de escalada prioriza la asignación de tareas a modelos de bajo costo y, al detectar un aumento en la complejidad de la tarea, errores persistentes o estancamiento en la ejecución, eleva la solicitud a un modelo más potente, logrando así un equilibrio entre rendimiento y costo.
Se indica que, en pruebas relevantes, NeMo Switchyard ha logrado reducir significativamente los costos de operación de los agentes de IA al asignar tareas entre diferentes modelos, manteniendo una alta tasa de finalización de tareas. Por ejemplo, en comparación con el uso exclusivo de modelos de vanguardia, la solución basada en enrutamiento de escalada redujo aproximadamente un 74% de los costos en las pruebas de múltiples agentes de LangChain, con solo un 7% de las solicitudes requiriendo la invocación de un modelo de vanguardia.
Además, se ha colaborado con empresas como Cognition, Nous Research, Ramp, LangChain, LiteLLM y Kong para integrar NeMo Switchyard en el proceso de desarrollo de agentes de IA y en la infraestructura de aplicaciones empresariales.
Este contenido se ofrece únicamente con fines informativos generales y no constituye asesoramiento financiero, de inversión, legal ni fiscal. Cualquier evento, recompensa, promoción en línea o información relacionada que se mencione en el presente documento no debe considerarse como una recomendación, solicitud o invitación a comprar, vender, tradear o de negociar de otra manera con cualquier criptoactivo. Los criptoactivos son sumamente volátiles y pueden provocar pérdidas. La disponibilidad de los servicios, productos y eventos relacionados de WEEX puede variar según la región. Tienes la responsabilidad de asegurarte de que tu participación esté de acuerdo con las leyes y regulaciones locales vigentes.





























