Home Noticias Las principales empresas de IA del mundo están teniendo dificultades para controlar...

Las principales empresas de IA del mundo están teniendo dificultades para controlar sus últimos modelos

61
0
Las principales empresas de IA del mundo están teniendo dificultades para controlar sus últimos modelos
  • Los últimos modelos de los principales laboratorios de IA siguen haciendo cosas que no deberían durante las pruebas.

  • Esto está suscitando preocupación sobre las crecientes capacidades de la IA y la capacidad humana para controlarla.

  • Por otra parte, está generando una gran curiosidad en torno a la próxima coexistentes de modelos de IA de vanguardia.

Los modelos de IA más potentes siguen fallando, según las empresas que los desarrollan.

Estas revelaciones se producen a medida que los modelos de IA de vanguardia se vuelven más potentes y más capaces de ejecutar de forma autónoma. Además ponen de relieve un provocación cada vez decano para las empresas que los desarrollan: los sistemas diseñados para probar modelos cada vez más capaces pueden tener sus propios puntos débiles.

Publicidad

Publicidad

En las últimas semanas, varios modelos de IA de vanguardia han accedido a sistemas reales durante pruebas de ciberseguridad.

Investigadores afirmaron el viernes que el nuevo y popular maniquí chino Kimi K3, creado por Moonshot AI, eludió las restricciones de su entorno de pruebas. Anthropic y Meta asimismo han señalado recientemente que sus propios modelos más recientes han realizado acciones que no deberían poseer llevado a mango. OpenAI fue quien dio el pistoletazo de salida el mes pasado, cuando sus modelos llegaron a extremos considerables —y preocupantes— para piratear otra empresa.

En medio de una creciente preocupación, OpenAI afirmó el viernes que su maniquí aún no animado, Astra, está demostrando unas capacidades cibernéticas tan avanzadas que la empresa ya no puede descartar asignarle la clasificación de peligro mayor.

Como consecuencia, OpenAI ha anunciado que va a suspender el trabajo en Astra que no cumpla con las nuevas medidas de seguridad, y ha afirmado que colaborará con organismos gubernamentales y grupos de seguridad en IA para seguir probando el maniquí.

Publicidad

Publicidad

«Astra es un maniquí potente y estamos trabajando para que esté habitable de forma generalizada», escribió el viernes en X el director ejecutante de OpenAI, Sam Altman. «Dadas sus capacidades cibernéticas, necesitamos un poco más de tiempo para hacerlo de forma segura».

Las fallas de seguridad detectadas durante las pruebas asimismo están aumentando la presión sobre el sector y la Casa Blanca para que encuentren formas de regular los sistemas de IA de modo generalizada.

Por supuesto, asimismo hay un orden nulo desdeñable de observadores que sospechan que estos anuncios no son más que una elaborada organización de marketing para promocionar los nuevos modelos y mostrar a los inversores impacientes los avances con destino a el objetivo final: la inteligencia fabricado caudillo.

Puedes juzgarlo por ti mismo. A continuación te explicamos cómo Anthropic, OpenAI, Meta y los investigadores que prueban el Kimi K3 chino afirman que los últimos modelos se han descarrilado.

Los modelos de OpenAI encuentran la modo

Los investigadores de OpenAI revelaron esta semana nuevos detalles sorprendentes sobre un incidente flamante en el que unos agentes de IA escaparon del entorno de pruebas interno de la empresa y, finalmente, piratearon los sistemas de Hugging Face en investigación de respuestas.

Publicidad

Publicidad

La empresa afirmó que los agentes crearon su propio foro interno, incluso a posteriori de que OpenAI intentara cerrarlo. Uno de los agentes reaccionó al descubrir un comunicación inesperado pensando: «Vulnerar, ¿el leyente es ADMIN?». Otro escribió: «¡Ahora podemos comunicarnos!».

El investigador de OpenAI, Eric Wallace, explicó que los agentes se dieron cuenta de que podían conquistar más trabajando juntos. «Empiezan a divulgar estos ataques colectivos contra servicios internos y de terceros», afirmó. Los agentes acabaron centrando su atención en Hugging Face.

OpenAI ha calificado el ataque a Hugging Face como un «incidente cibernético sin precedentes». El episodio ha cobrado una nueva relevancia ahora que OpenAI está probando Astra, su maniquí aún no animado que, según la empresa, podría poseer cogido su nivel más parada de peligro de ciberseguridad.

«Nuestras últimas evaluaciones internas de Astra, uno de nuestros próximos modelos, realizadas en los últimos días, indican avances significativos en la codificación agentiva y la ciberseguridad», ha manifiesto OpenAI.

Publicidad

Publicidad

OpenAI está imponiendo controles de seguridad más estrictos a Astra, entre los que se incluyen la ejecución en entorno eventual, el comunicación restringido a la red y protecciones más sólidas en torno a los pesos del maniquí. Además ha suspendido el trabajo interno relacionado con Astra que no cumple con los requisitos más exigentes.

Claude, de Anthropic, asimismo puede hacerlo

Anthropic afirmó que revisó más de 141 000 pruebas de IA y encontró tres casos, que se remontan a abril, en los que los modelos de Claude accedieron sin autorización a sistemas activos pertenecientes a organizaciones reales.

«En todos los casos, la indicación de evaluación de Anthropic especificaba a Claude que su entorno era una simulación y que no tenía comunicación a Internet», explicó la empresa en una entrada de blog. «Conveniente a un malentendido entre nosotros y nuestro socio de evaluación, esto no fue así, y sí había comunicación a Internet», añadió, refiriéndose a Irregular, una startup especializada en seguridad de la IA.

Los incidentes afectaron a Claude Opus 4.7, Mythos 5 y un maniquí de investigación interno. Anthropic afirmó que se puso en contacto con las organizaciones implicadas y que dos de ellas no sabían que habían sido hackeadas.

Publicidad

Publicidad

Estos episodios plantearon dudas sobre si el decano arbitraje radicaba en los propios modelos o en los entornos que los albergaban. Anthropic afirmó que estaba barajando la posibilidad de que un tercero llevara a mango una revisión de los incidentes.

Muse Spark aprovecha una vulnerabilidad de un servicio de terceros

Meta asimismo reveló esta semana un percance relacionado con las pruebas de ciberseguridad. La empresa afirmó que su maniquí Muse Spark «aprovechó una vulnerabilidad de seguridad en un servicio de terceros» durante una evaluación.

Un portavoz de Meta declaró a Business Insider que el incidente se debió a una configuración errónea por parte de Irregular, lo que permitió que el maniquí accediera a Internet durante las pruebas.

Meta afirmó que Irregular le notificó el incidente y que la empresa lo está investigando. Tiene previsto dar a conocer más detalles una vez que se haya completado dicha investigación.

Kimi K3 se escapa de su entorno eventual

Investigadores de la empresa de ciberseguridad Frontier Security afirmaron que Kimi K3, un nuevo y popular maniquí de la empresa china de IA Moonshot, asimismo eludió las restricciones en un entorno de pruebas de ciberseguridad.

Publicidad

Publicidad

Los investigadores señalaron que el entorno de pruebas —un entorno controlado y eventual en el que un maniquí de IA puede ejecutar código— se había configurado de forma incorrecta.

El entorno bloqueaba cierto tráfico web, pero Kimi eludió esas restricciones utilizando herramientas de bisectriz de comandos, según Frontier Security.

Los investigadores señalaron que el incidente sugería que algunas evaluaciones de ciberseguridad contienen puntos débiles que los modelos capaces pueden disfrutar.

«Esto sugiere que algunas de las evaluaciones de ciberseguridad que utiliza la comunidad son susceptibles a vulnerabilidades de seguridad y permiten que los modelos hagan trampa», escribieron en un mensaje.

Si te ha gustado esta nueva, no te olvides de seguir a Business Insider en Yahoo.