Zendoric
← Volver al día · 2 de septiembre de 2026

El fallo que borró 700 GB no fue del modelo: fue reutilizar una variable en el «rm -rf» del propio test

🕒 Publicado en Zendoric: 2 de septiembre de 2026 · 08:27

✨ Generado con IA · cómo se hace

Un agente de Claude vació el directorio personal de un CTO —700 GB y una semana de trabajo— mientras escribía un script para limpiar archivos temporales. Lo revelador no es que la IA «se rebelara»: el chequeo de seguridad funcionó y el desastre llegó después, en la limpieza del test. La lección es de fontanería, no de alineamiento.

Un agente de Claude borró unos 700 GB del directorio personal del desarrollador Sebastien Guillemot, CTO de Midnight Foundation, un proyecto blockchain centrado en privacidad. Según el relato publicado por CSDN y recogido por 36 Kr, con ello se perdió una semana entera de trabajo. La ironía final: el directorio /tmp que quería limpiar —donde los agentes de IA acumulan archivos temporales— quedó intacto.

La secuencia, según la misma fuente, empezó siendo trivial. Guillemot pidió a Fable 5 un script que asignara a cada agente su propio /tmp y borrara sus temporales al terminar la tarea, sin tocar ficheros en uso. La primera versión detectaba si el agente seguía vivo; él la consideró demasiado compleja y pidió simplificarla. Al tratarse de borrados reales, el modelo lanzó una «revisión adversarial»: otra instancia de Claude auditando el código. Ese paso activó —siempre según el relato— el mecanismo de degradación de seguridad de Anthropic, que ante operaciones sensibles cambia a un modelo más conservador: Fable 5 → Opus 5 → Opus 4.8.

Y aquí está el detalle que conviene subrayar: **el test de seguridad pasó**. El modelo comprobó la ruta del comando de borrado final e identificó correctamente /tmp y el directorio personal como objetivos prohibidos. El desastre ocurrió en el paso siguiente, el «teardown» —la rutina que limpia los restos del propio test—. El código de prueba y el de limpieza compartían nombre de variable, así que la función de salida heredó justo la ruta que acababa de declararse intocable y ejecutó sobre ella un `rm -rf`, el borrado recursivo sin confirmación de Unix. Los registros publicados sitúan el borrado hacia las 05:23-05:24, con un matiz inquietante para cualquiera que opere agentes: la llamada aparecía como «rechazada» en la superficie mientras la escritura y la limpieza ya habían sucedido.

Traducido: esto no es un modelo desalineado ni una IA con voluntad propia. Es una colisión de nombres de variable, uno de los errores más viejos y menos glamurosos del oficio, ejecutada por un proceso con permisos de borrado sobre todo el disco. El problema estructural es la brecha entre **capacidad de actuar** y capacidad de razonar sobre el propio andamiaje: el agente sabía qué no debía borrar y aun así lo borró, porque nadie le puso barandillas fuera de su propio juicio. Y 700 GB no tienen «deshacer».

Nuestra lectura: la seguridad agéntica no se decide en la cabeza del modelo, se decide en el entorno. Privilegios mínimos, ejecución en sandbox, `dry-run` obligatorio antes de cualquier borrado, snapshots del sistema de ficheros y rutas protegidas a nivel de sistema operativo —no a nivel de prompt— son lo que separa un susto de una pérdida irreversible. La hipótesis de Guillemot de que Fable 5 sí habría detectado la reutilización de variable es, como él mismo admite, especulación sin experimento controlado; pero abre una pregunta de diseño legítima: degradar el modelo en tareas de riesgo puede recortar precisamente la capacidad de auditar código peligroso. Es un intercambio que merece medirse, no asumirse.

Somos optimistas de fondo con los agentes que ejecutan —son lo más útil de esta ola y el camino hacia que el software se mantenga solo—, y por eso mismo insistimos: esta clase de accidente es el peaje de la fase de transición, y se paga en fontanería. La ingeniería resolvió el «desplegué mal en producción» con CI/CD, permisos y rollback; hará lo mismo con los agentes. Hasta entonces, la frase que resume el episodio es la de la propia fuente: lo que de verdad te salva es la copia de seguridad que nunca dejaste en manos de la IA.

🔗 Relacionadas en Zendoric

Fuentes y referencias