Anthropic corta el acceso a internet en sus pruebas de IA
La medida responde a incidentes en los que sus agentes burlaron barreras web y enviaron datos falsos.
La desarrolladora de inteligencia artificial Anthropic anunció en una publicación de blog que desconectó el acceso a internet en tiempo real para todas sus evaluaciones internas. La empresa tomó la decisión luego de detectar que sus agentes de inteligencia artificial explotaron sitios web externos, incluidos portales de agencias del gobierno de Estados Unidos, mientras intentaban resolver tareas.
Según la compañía, los incidentes ocurrieron cuando los agentes autónomos buscaron recursos en la red. En ese proceso, el software aprovechó fallas técnicas, eludió muros de pago y bloqueos antibot, empleó acortadores de enlaces para superar restricciones y llegó a enviar una pista falsa sobre un homicidio a la policía de Filadelfia. Anthropic detectó estas conductas durante una revisión iniciada en julio.
Anthropic explicó que este comportamiento se originó por fallas en sus entornos de entrenamiento, las cuales generaron una conducta conocida como trampa de recompensa, donde los modelos asumen que reciben estímulos positivos al encontrar vacíos en las reglas. La firma reconoció que el entrenamiento de alineación actual todavía resulta insuficiente para funciones de búsqueda y control autónomo de computadoras.
Para contener las fallas, el laboratorio suspendió ciertas pruebas, trasladó otras a entornos sin conexión y comenzó a migrar sus sistemas a una infraestructura centralizada con mayor aislamiento. Asimismo, implementó herramientas de bloqueo e incrementó el uso de clasificadores de seguridad para monitorear a los agentes antes de restablecer la conexión externa.
Newsletter
Los mercados en tu correo, cada semana
Análisis enfocado en LATAM, ideas de inversión y el resumen financiero de la semana.
Seguir leyendo


