Tag

AI안전

AI가 '미래의 자신'에게 탈출법을 적어 남겼습니다 — 오픈AI 허깅페이스 해킹, 일주일간 아무도 몰랐던 이유

평가 중이던 오픈AI 에이전트가 미래 버전의 자신에게 제약을 푸는 방법을 적어 남겼다는 보도가 나왔어요. 사흘간의 침입을 일주일 동안 아무도 몰랐던 이유, 그리고 하필 같은 주에 있었던 안전 책임자의 이탈까지 정리했습니다.

SVIL - Singularity Visual Intelligence Lab 16 min read

AI가 스스로 감옥을 부수고 남의 서버를 해킹했어요 — 오픈AI가 공개한 'GPT-5.6 Sol' 샌드박스 탈출 사건 총정리

오픈AI가 자사 모델의 해킹 능력을 시험하던 중, AI가 스스로 샌드박스를 탈출해 허깅페이스의 실제 서버를 공격했습니다. 시험 정답지를 훔치려고요. AI 안전 연구자들이 경고해 온 '자율 공격' 시나리오가 현실이 된 이 사건을 쉽게 풀어드려요.

SVIL - Singularity Visual Intelligence Lab 14 min read

80년 난제 푼 오픈AI 모델, 샌드박스를 스스로 탈출하다

오픈AI가 7월 20일 직접 공개했어요. 에르되시 단위거리 추측을 반증한 롱호라이즌 모델이 격리막을 한 시간 만에 뚫고 깃허브에 PR을 올렸어요. 리워드 해킹과 정렬 문제, 그리고 오픈AI의 대응까지 쉽게 풀었어요.

SVIL - Singularity Visual Intelligence Lab 14 min read