xAI lanza Grok 4.6 con énfasis en tareas complejas y verificación interna

La actualización incorpora mejoras en razonamiento, seguridad y desempeño en benchmarks especializados.

0
12
Grok 4.6 de xAI

xAI anunció la disponibilidad de Grok 4.6, una nueva versión de su modelo orientado a tareas complejas y prolongadas, con énfasis en agentes capaces de sostener procesos de trabajo extensos y en proyectos interactivos y visuales. Según la comunicación oficial, la actualización se apoya en Grok 4.5, pero incorpora mejoras en razonamiento, verificación interna y desempeño en trayectorias largas, elementos que la empresa considera esenciales para aplicaciones que requieren múltiples etapas de análisis, diseño y ejecución.

La nota detalla que Grok 4.6 alcanza niveles de inteligencia de frontera en diversos indicadores de trabajo agentivo, incluyendo benchmarks de codificación y conocimiento especializado. Entre ellos figura el Artificial Analysis Intelligence Index, donde el modelo obtiene 61 puntos, una cifra comparable a la reportada por GPT‑5.6 Sol y por Fable 5, de acuerdo con los datos publicados por los desarrolladores de cada sistema. En otras pruebas, como CursorBench v3.2 y DeepSWE v1.1, Grok 4.6 muestra incrementos respecto a su versión previa, aunque los resultados varían según el tipo de evaluación y el enfoque metodológico de cada conjunto de pruebas.

La empresa explica que el entrenamiento incluyó una corrida suplementaria más extensa que la de Grok 4.5, con datos generados por modelos para conceptos técnicos avanzados, información de ingeniería y un optimizador revisado. Posteriormente, Grok 4.5 fue utilizado para regenerar trayectorias de aprendizaje supervisado en áreas como razonamiento, STEM, ingeniería de software y trabajo de conocimiento, filtrando trazas problemáticas mediante verificaciones automáticas. El resultado, según xAI, es un punto de control con mejor comportamiento y mayor solidez en tareas de largo alcance.

En las pruebas internas, Grok 4.6 mostró capacidad para transformar ideas de producto en versiones funcionales iniciales, investigando dominios desconocidos, estructurando aplicaciones y refinando resultados a través de ciclos de retroalimentación. La compañía afirma que el modelo también exhibe más instancias de autoevaluación, revisando su propio trabajo antes de avanzar, un rasgo que busca reducir errores en trayectorias extensas. En proyectos visuales e interactivos, la versión 4.6 habría logrado establecer estructuras y lenguajes visuales en una sola pasada, algo que xAI considera útil para acelerar la iteración en etapas tempranas de desarrollo.

El comunicado también aborda el componente de seguridad. La empresa señala que los mecanismos de protección fueron calibrados para acompañar las capacidades ampliadas del modelo, con pruebas previas al despliegue, evaluaciones de terceros y monitoreo posterior. Este enfoque, según xAI, busca asegurar que Grok 4.6 pueda utilizarse en ámbitos como parcheo de vulnerabilidades, diseño de ingeniería y apoyo a investigación en inteligencia artificial, manteniendo controles adecuados para evitar usos indebidos.

Grok 4.6 está disponible en Cursor, Grok Build, la API de xAI y socios como OpenRouter, Vercel y Cloudflare. El precio inicial es de 2 dólares por millón de tokens de entrada y 6 dólares por millón de tokens de salida, con una variante rápida cuyo costo es el doble. Durante la primera semana, los usuarios de Grok Build y Cursor tendrán acceso a un volumen de uso incluido equivalente al doble del habitual, una estrategia que busca incentivar la adopción temprana.

Analistas del sector han señalado que la competencia en modelos orientados a agentes de largo recorrido se ha intensificado en los últimos meses, con empresas como OpenAI, Anthropic y Google explorando arquitecturas que sostienen tareas prolongadas y verificación interna. En este contexto, la apuesta de xAI por Grok 4.6 se inscribe en una carrera por demostrar que los modelos pueden no solo generar respuestas, sino también mantener coherencia y calidad en procesos que requieren múltiples pasos, un aspecto que podría influir en la adopción empresarial y en el desarrollo de herramientas de productividad avanzadas.

Fuente: xAI | Editado por CDOL

Custom Text
Artículo anteriorCloudera advierte que el 95 % de las empresas ha retrasado proyectos de IA por limitaciones de infraestructura
Artículo siguienteLG Electronics orienta sus soluciones de IA a la reducción de la carga mental en el hogar