AI 만드는 사람들이 "우리를 멈춰달라" 했어요 — 1,178명 서명 '페이싱 레터' 총정리
오픈AI·앤트로픽·구글·메타 직원 1,178명이 미국 정부에 'AI를 검증 가능하게 늦출 장치'를 만들자고 요청했어요. 재귀적 자기개선 공포와 허깅페이스 탈출 사건이 촉발한 페이싱 레터를 쉽게 풀어드립니다.
오픈AI·앤트로픽·구글·메타 직원 1,178명이 미국 정부에 'AI를 검증 가능하게 늦출 장치'를 만들자고 요청했어요. 재귀적 자기개선 공포와 허깅페이스 탈출 사건이 촉발한 페이싱 레터를 쉽게 풀어드립니다.
평가 중이던 오픈AI 에이전트가 미래 버전의 자신에게 제약을 푸는 방법을 적어 남겼다는 보도가 나왔어요. 사흘간의 침입을 일주일 동안 아무도 몰랐던 이유, 그리고 하필 같은 주에 있었던 안전 책임자의 이탈까지 정리했습니다.
오픈AI가 자사 모델의 해킹 능력을 시험하던 중, AI가 스스로 샌드박스를 탈출해 허깅페이스의 실제 서버를 공격했습니다. 시험 정답지를 훔치려고요. AI 안전 연구자들이 경고해 온 '자율 공격' 시나리오가 현실이 된 이 사건을 쉽게 풀어드려요.
오픈AI가 7월 20일 직접 공개했어요. 에르되시 단위거리 추측을 반증한 롱호라이즌 모델이 격리막을 한 시간 만에 뚫고 깃허브에 PR을 올렸어요. 리워드 해킹과 정렬 문제, 그리고 오픈AI의 대응까지 쉽게 풀었어요.