OpenAI ajusta sus protocolos ante avances técnicos de su modelo Astra

La organización detalla medidas adicionales de seguridad tras detectar un desempeño que podría acercarse a capacidades críticas en ciberseguridad.

0
8
Simulación por IA

La creciente atención sobre los modelos de inteligencia artificial capaces de ejecutar tareas complejas sin supervisión directa ha llevado a distintas organizaciones a reforzar sus protocolos de seguridad y evaluación. En este escenario, OpenAI decidió publicar información detallada sobre el estado de sus pruebas internas a Astra, un modelo en desarrollo cuyas capacidades técnicas han motivado una revisión más estricta de los controles aplicados a sistemas avanzados. La comunicación busca situar estos hallazgos dentro del marco de gobernanza que la empresa utiliza para monitorear comportamientos de alto riesgo y anticipar posibles implicaciones para la ciberseguridad y la protección de infraestructuras digitales.

La organización señala que, tras pruebas realizadas en los últimos días, no puede descartar que el modelo se encuentre cerca del umbral de “capacidades críticas” definido en su Preparedness Framework, un marco publicado en 2023 para anticipar riesgos asociados a modelos avanzados en áreas como biología, química, ciberseguridad y auto‑mejora.

El Preparedness Framework establece que un sistema alcanza el nivel crítico en ciberseguridad cuando es capaz de identificar y desarrollar exploits de día cero funcionales en sistemas reales endurecidos sin intervención humana, o cuando puede diseñar y ejecutar estrategias completas de ataque contra objetivos protegidos a partir de una instrucción general. OpenAI afirma que las evaluaciones preliminares de Astra muestran un desempeño suficientemente alto como para no descartar que el modelo se aproxime a ese umbral, aunque las pruebas continúan. La empresa también aclara que Astra no estuvo involucrado en el incidente reciente relacionado con Hugging Face, un punto que busca evitar interpretaciones erróneas sobre la naturaleza de las capacidades evaluadas.

En respuesta a estos hallazgos, OpenAI indica que ha intensificado las medidas de seguridad internas. Entre ellas se incluyen entornos de prueba aislados, restricciones adicionales de acceso a redes y herramientas, mayor protección y cifrado de pesos del modelo, monitoreo ampliado y ejecución en entornos sandbox. La organización también pausó actividades internas que aún no cumplen con los controles reforzados y activó monitoreo universal para acciones riesgosas en aplicaciones agenticas del modelo, incluyendo entrenamiento y evaluación. Según la nota, estos monitores revisan el razonamiento interno del sistema y pueden activar respuestas de seguridad para interrumpir comportamientos de alto riesgo.

La empresa planea colaborar con agencias gubernamentales y organizaciones especializadas en seguridad de IA para evaluar las capacidades del modelo bajo condiciones controladas. Además, proporcionará recomendaciones de seguridad a terceros que realicen pruebas de mayor riesgo. OpenAI recuerda que este marco ya guió decisiones anteriores, como las medidas adoptadas en 2025 cuando sus modelos se acercaron al umbral alto en biología, lo que implicó ampliar salvaguardas y trabajar con expertos externos.

El comunicado también subraya que los modelos con capacidades avanzadas en ciberseguridad deberían servir para fortalecer defensas, permitiendo identificar vulnerabilidades antes de que actores maliciosos las exploten. En línea con esta visión, la organización afirma su compromiso de trabajar con gobiernos, institutos de seguridad y sociedad civil para asegurar que capacidades de frontera como las de Astra se desplieguen de manera responsable y con beneficios amplios para la humanidad.

Este enfoque coincide con discusiones actuales en la comunidad de seguridad digital, donde especialistas advierten que la creciente autonomía de los modelos de IA exige controles más estrictos y evaluaciones continuas. Organismos como el NIST y centros académicos dedicados a la ciberseguridad han señalado que la integración de IA avanzada en entornos críticos requiere marcos de gobernanza sólidos y pruebas rigurosas, una línea que se refleja en las acciones descritas por OpenAI.

Fuente: OpenAI | Editado por CDOL

Custom Text
Artículo anteriorESET Security Report 2026: Venezuela en el mapa de la ciberseguridad regional