La plataforma Vera Rubin incorpora Groq 3 LPX y expande su enfoque de codesign

De esta forma NVIDIA introduce mejoras en computación, redes y conectividad para responder a la demanda de modelos con contextos extensos.

0
5
Foto NVIDIA

La más reciente comunicación de NVIDIA detalla una ampliación de su plataforma Vera Rubin, orientada a cargas de inferencia de gran escala y a sistemas de inteligencia artificial agentica que requieren generación rápida de tokens y manejo de contextos extensos. La compañía informó que el sistema Vera Rubin NVL72 se integra ahora con Groq 3 LPX, un acelerador de inferencia diseñado para reducir la latencia en la decodificación de tokens y mejorar la capacidad de respuesta en aplicaciones que dependen de interacciones continuas entre agentes. En una prueba con el modelo Gemma 4 31B, el hardware alcanzó 3.400 tokens por segundo en escenarios de 100.000 tokens de contexto, una cifra que la empresa comparó con plataformas alternativas del mercado.

NVIDIA señaló que diversos socios tecnológicos han comenzado a adoptar estas arquitecturas. SpaceXAI planea utilizar CPUs Vera para tareas intensivas en procesamiento y orquestación dentro de flujos agenticos, mientras que CoreWeave ya opera Spectrum‑X Multiplane en producción para conectar racks Vera Rubin mediante múltiples rutas paralelas. Nebius, por su parte, se convirtió en el primer proveedor de nube en incorporar Groq 3 LPX, con el objetivo de habilitar aplicaciones de respuesta rápida en agentes y sistemas de codificación.

La compañía enmarcó estos anuncios en un cambio estructural del sector, donde la inferencia —y no solo el entrenamiento— se ha convertido en un punto crítico para la operación de modelos de gran tamaño. Firmas de análisis como IDC y Gartner han señalado que la demanda de infraestructura para inferencia crece a medida que las empresas migran hacia aplicaciones que requieren respuestas inmediatas y manejo de múltiples fuentes de información. En paralelo, competidores como AMD y proveedores de aceleradores especializados han presentado arquitecturas orientadas a reducir la latencia en modelos generativos, lo que ha intensificado la competencia en este segmento.

Durante la conferencia Hot Chips, NVIDIA explicó que su estrategia se basa en el concepto de “extreme codesign”, que consiste en diseñar de manera conjunta computación, redes y aceleración de inferencia para operar como un sistema unificado. Según la empresa, esta aproximación permite que GPUs Rubin y LPUs Groq 3 LPX trabajen de forma coordinada en cada capa del modelo, con el fin de mantener un flujo constante de tokens y evitar cuellos de botella en contextos prolongados. La compañía indicó que una implementación a escala de Groq 3 LPX puede incluir hasta 256 aceleradores LP30 conectados mediante enlaces directos entre chips.

El comunicado también presentó Spectrum‑X Multiplane, una arquitectura Ethernet que divide las conexiones de red en múltiples planos independientes para escalar hasta 512.000 GPUs sin añadir una tercera capa de red. NVIDIA afirmó que esta estructura permite mantener aproximadamente 90% del ancho de banda incluso si uno de los planos falla, y que la recuperación automática en hardware es más rápida que los mecanismos tradicionales basados en software. La empresa destacó que esta solución busca reducir la complejidad y el costo de expansión de grandes centros de datos, un tema que analistas de firmas como Omdia han identificado como uno de los principales desafíos en la construcción de infraestructura para IA.

Finalmente, NVIDIA presentó NVLink Fusion, una tecnología que conecta XPUs y CPUs personalizados con su plataforma de infraestructura para IA. La compañía explicó que esta integración permite a los operadores ajustar la combinación de procesadores según disponibilidad y necesidades de carga, manteniendo un diseño de rack y un ecosistema de software unificado. De acuerdo con la empresa, esta arquitectura busca facilitar la adopción de silicio especializado sin requerir rediseños completos de centros de datos.

Fuente: NVIDIA | Editado por CDOL

Custom Text
Artículo anteriorCuestionan la precisión de los anillos inteligentes Oura Ring en los tribunales de Estados Unidos
Artículo siguienteEl 22% de los jóvenes latinoamericanos utiliza la IA como un acompañante personal, según estudio de Kaspersky