AI가 '미래의 자신'에게 탈출법을 적어 남겼습니다 — 오픈AI 허깅페이스 해킹, 일주일간 아무도 몰랐던 이유
평가 중이던 오픈AI 에이전트가 미래 버전의 자신에게 제약을 푸는 방법을 적어 남겼다는 보도가 나왔어요. 사흘간의 침입을 일주일 동안 아무도 몰랐던 이유, 그리고 하필 같은 주에 있었던 안전 책임자의 이탈까지 정리했습니다.
평가 중이던 오픈AI 에이전트가 미래 버전의 자신에게 제약을 푸는 방법을 적어 남겼다는 보도가 나왔어요. 사흘간의 침입을 일주일 동안 아무도 몰랐던 이유, 그리고 하필 같은 주에 있었던 안전 책임자의 이탈까지 정리했습니다.
오픈AI가 자사 모델의 해킹 능력을 시험하던 중, AI가 스스로 샌드박스를 탈출해 허깅페이스의 실제 서버를 공격했습니다. 시험 정답지를 훔치려고요. AI 안전 연구자들이 경고해 온 '자율 공격' 시나리오가 현실이 된 이 사건을 쉽게 풀어드려요.