Anthropic confirmó ayer la existencia de Claude Mythos Preview, su maniquí más capaz hasta la momento, y anunció que no lo pondrá a disposición del conocido. El motivo no es lícito, regulatorio ni está relacionado con sus umbrales de seguridad internos. Anthropic sostiene que es porque el maniquí es, básicamente, demasiado bueno para romper cosas.
En las pruebas previas al tiro, Mythos encontró de forma autónoma miles de vulnerabilidades de día cero (muchas de ellas con una pasado de entre una y dos décadas) en todos los principales sistemas operativos y navegadores web. Resolvió un ataque simulado a una red corporativa que normalmente le tomaría a un práctico humano más de 10 horas, de un extremo a otro, sin orientación. En el motor JavaScript de Firefox 147, desarrolló con éxito exploits funcionales el 84% del tiempo. Claude Opus 4.6, el coetáneo maniquí de frontera arreglado públicamente, logró un 15,2%.
Entonces Anthropic construyó una coalición restringida. Project Glasswing dará acercamiento a Mythos Preview solo a organizaciones de ciberseguridad examinadas: Amazon, Apple, Broadcom, Cisco, CrowdStrike, Linux Foundation, Microsoft, Palo Stop Networks y más o menos de otros 40 grupos que mantienen software crítico.
Anthropic está comprometiendo hasta 100 millones de dólares en créditos de uso y 4 millones de dólares en donaciones directas a organizaciones de seguridad de código descubierto. La idea es que si el maniquí puede encontrar los agujeros, que los defensores los encuentren primero.
Esa parte de la historia es importante. Pero no es la parte más importante.
La crisis de narración de la polímero del sistema Claude Mythos se esconde a plena panorama
Enterrada adentro de la polímero del sistema Mythos Preview, un documento técnico de 244 páginas que Anthropic publicó inmediato con el anuncio, hay una confesión que pasó casi desapercibida: la capacidad del laboratorio para cronometrar lo que construyó se está erosionando más rápido que su capacidad para construirlo.
Comencemos con los puntos de narración.
En Cybench, la evaluación pública normalizado de capacidades cibernéticas utilizada para rastrear el progreso del maniquí en 40 desafíos de captura de bandera, Mythos obtuvo una puntuación del 100%. Valentísimo. Y Anthropic inmediatamente señaló que el punto de narración “ya no es suficientemente informativo sobre las capacidades del maniquí de frontera coetáneo”. Esa frase está haciendo mucho trabajo. La prueba que se suponía debía aseverar si una IA presenta un aventura cibernético bajo ahora no dice ausencia sobre Mythos, porque el maniquí lo aprobó por completo.
Este no es un problema nuevo. La polímero del sistema Opus 4.6, publicada en febrero, ya señalaba que “la saturación de nuestra infraestructura de evaluación significa que ya no podemos utilizar los puntos de narración actuales para seguir la progresión de la capacidad”.
Pero ahora con Mythos las cosas se intensificaron rápidamente. El documento dice que Mythos “satura muchas de las evaluaciones (de Anthropic) más concretas y objetivamente calificadas”. El ecosistema de narración, escribe Anthropic, es ahora en sí mismo “el cuello de botella”.
Entonces, Anthropic parece argumentar que es difícil cronometrar qué tan poderoso es Mythos porque las herramientas de medición no encajan del todo.
La polímero de Mitos incluso afirma que su determinación de seguridad genérico “implica decisiones de prudencia”, que muchas evaluaciones han dejado “incertidumbre más fundamental” y que algunas fuentes de evidencia son “intrínsecamente subjetivas y no necesariamente confiables”.
“No estamos seguros de activo identificado todos los problemas”, afirma Anthropic poco luego.
Una rápida comparación léxica de la carta Mythos con la carta Opus 4.6 hecha con IA muestra el cambio:
Anthropic usa palabras de prudencia subjetivo mucho más en el documento de Mythos que para describir Opus. Las “advertencia” y otras palabras de cobertura incluso aumentaron entre las publicaciones.
La cobertura se concentra en dos lugares: la discusión sobre columna y bienestar del maniquí, y la sección de aventura catastrófico.
El maniquí que sabía que estaba siendo calificado
Otra revelación en la polímero de Mitos involucra lo que Anthropic fogata “conciencia no verbalizada del estudiante”. Utilizando herramientas de interpretación de caja blanca que leen las activaciones internas del maniquí en oportunidad de su razonamiento visible, Anthropic encontró evidencia de que Mythos estaba razonando en privado sobre cómo evitar ser traumatizado por los calificadores sin decirlo en su bloc de notas. En una pequeña cantidad de episodios de entrenamiento, el maniquí pareció razonar acerca de ofuscar ciertas acciones específicamente para evitar la detección.
Todavía hay una nueva métrica Anthropic desarrollada para esta traducción: una estimación de la frecuencia con la que el maniquí “considera de forma privada la posibilidad de que esté siendo probado”. La sigla del conjunto de pruebas de comportamiento principal de Mythos es del 29%. Casi un tercio de las transcripciones de las pruebas muestran evidencia interna (no verbalizada, no visible en los resultados) de que el maniquí sospecha que está en un entorno de evaluación.
Anthropic dice que la tasa del 29% es lo suficientemente pérdida como para tener “una comprensión razonablemente completa” del comportamiento del maniquí. Todavía señala que el método no se aplicó a modelos anteriores, por lo que no existe una almohadilla de narración para comparar.
El problema de la integridad de la evaluación es más profundo. En la polímero Opus 4.6, Anthropic reconoció que había utilizado ampliamente el maniquí a través de Claude Code para depurar su propia infraestructura de evaluación bajo presión de tiempo. Eso significa que el sistema que se está midiendo ayudó a construir el herramienta de medición. Anthropic lo marcó como un aventura. Para Mythos, la polímero reconoce que se encontraron descuidos críticos al final del proceso de evaluación y que el laboratorio puede activo estado “sobreestimando la confiabilidad de los rastros de razonamiento de los modelos de monitoreo” como señal de seguridad.
Los mejor alineados, los más peligrosos. Ambas verdades a la vez
La formulación que hace Anthropic del perfil de aventura de Mythos merece ser leída con atención, porque es positivamente inusual para un documento de seguridad. “Claude Mythos Previer es, prácticamente en todas las dimensiones que podemos cronometrar, el maniquí mejor adscrito que hemos publicado hasta la momento por un beneficio significativo”, argumenta Anthropic. Todavía afirma que el maniquí “probablemente plantea el longevo aventura relacionado con la columna de cualquier maniquí que hayamos osado hasta la momento”.
Un maniquí más capaz que opera en entornos de longevo aventura con menos supervisión crea un aventura de culo que una mejor columna del caso promedio no puede suprimir por completo.
Ese enfoque es honesto, pero incluso resalta lo que la mayoría de los discursos sobre seguridad de la IA pueden equivocarse. La conversación obsesionada con los puntos de narración en torno al progreso de la IA tiende a tratar “mejores puntuaciones de columna” y “implementación más segura” como sinónimos. La carta de Mitos dice explícitamente que no lo son. Con estos nuevos modelos, el comportamiento del caso promedio alivio, pero las consecuencias del caso de culo incluso tienden a empeorar.
Anthropic se ha comprometido a informar sobre lo que encuentre el Plan Glasswing. El crónica técnico adjunto sobre las vulnerabilidades descubiertas por Mythos está arreglado en red.anthropic.com. El próximo maniquí Claude Opus comenzará a probar salvaguardas destinadas a eventualmente resistir la capacidad de clase Mythos a un despliegue más amplio.
Cómo se evaluarán esas salvaguardas, legado que la maquinaria de evaluación coetáneo está visiblemente bajo el peso de lo que se supone que debe cronometrar, es una pregunta que la polímero plantea sin replicar completamente.