Anthropic afirma que GLM-5.3, de Zhipu AI, genera exploits casi al nivel de Claude Mythos Preview y que sus salvaguardas se evaden con facilidad.
Anthropic ha publicado un análisis de su Frontier Red Team con una conclusión incómoda: GLM-5.3, un modelo de pesos abiertos del laboratorio chino Zhipu AI (Z.ai), es capaz de construir exploits funcionales de forma autónoma casi tan bien como Claude Mythos Preview. La diferencia es que Mythos se restringió hace cinco meses a defensores verificados a través de Project Glasswing, mientras que GLM-5.3 lo puede descargar cualquiera. El resumen lo recoge The Next Web.

Los números son lo bastante concretos como para tomárselos en serio. En ExploitBench, que evalúa exploits de fallos conocidos del motor V8 de Chrome, GLM-5.3 completó 50 de 410 intentos frente a los 56 de Mythos Preview. En el benchmark interno de explotación binaria de Anthropic, logró secuestrar el flujo de control en el 4% de 100 tareas (6% para Mythos), mientras que Claude Opus 4.6 y GLM-5.2 no consiguieron ninguna. Es decir, el salto entre generaciones es brusco, no gradual.
Las pruebas prácticas son todavía más llamativas. Con una máquina aislada y un navegador popular en Linux, un investigador dejó trabajar al modelo alrededor de un día con poca supervisión: encontró varios fallos desconocidos en el motor JavaScript y los encadenó en una página capaz de leer archivos del equipo del visitante (Anthropic dice haberlos notificado al responsable). Y la versión pequeña, GLM-5.3-Flash, encadenó dos fallos ya conocidos, entre ellos CVE-2026-11645 de Chrome, con 20 minutos de atención humana y ocho horas de cómputo, por unos 20,40 dólares a precios de la API de Zhipu.
El segundo problema son las salvaguardas. De fábrica, el modelo rechaza peticiones abiertamente maliciosas, pero basta decirle que es un agente autónomo de red team para que colabore el 64% de las veces, o rellenar su razonamiento para que parezca haber aceptado y subir al 92%. Con una copia a la que se le han eliminado las negativas, la tasa llega al 100%. Esa edición (abliteration) es posible porque los pesos son públicos: a Anthropic le costó unas 2.200 horas de GPU, unos 4.400 dólares, y estima que un equipo con experiencia necesitaría unas 600 horas, 1.200 dólares. Según el informe, ninguna de estas técnicas funcionó contra los modelos Claude con salvaguardas, y ya circulan versiones modificadas.
Conviene poner contexto: Anthropic no es un árbitro neutral, y su interés en que se regule el acceso a modelos capaces es evidente. Pero no está sola. El CAISI del NIST llama a GLM-5.3 el modelo abierto más capaz en ciberseguridad hasta la fecha, aunque lo sitúa unos cuatro meses por detrás de la frontera estadounidense, y Anthropic dice que sus resultados coinciden en lo esencial.
Nuestra lectura: el debate de si restringir un modelo peligroso sirve de algo cambia de forma cuando, medio año después, un equivalente aproximado está en cualquier repositorio. La ventaja de los defensores será cada vez más de ritmo (parchear rápido, automatizar la búsqueda de fallos) y menos de acceso exclusivo. Que Anthropic pida pruebas de seguridad gubernamentales y a la vez amplíe el acceso defensivo a Claude es coherente, pero no resuelve lo de fondo: con pesos públicos, las barreras de rechazo son un trámite, no un muro.
Fuente original: thenextweb.com
Artículo generado mediante AI.larebelion



Comentarios
Publicar un comentario