연구자 세 명이 클로드로 오픈AI에 들어갔습니다 — 72시간 해킹과 버그바운티 6,500달러

연구자 세 명이 클로드로 오픈AI에 들어갔습니다 — 72시간 해킹과 버그바운티 6,500달러

AI가 코드를 잘 짠다는 이야기는 이제 새롭지 않습니다. 그런데 그 코드가 세계에서 가장 앞선 AI 회사의 내부 시스템을 뚫는 열쇠가 된다면 이야기가 달라집니다.

보안 연구자 세 명이 앤스로픽의 클로드를 써서 오픈AI 직원들의 챗GPT와 코덱스 계정에 침입했습니다. 처음 취약점을 들여다본 순간부터 오픈AI 내부 저장소에 손을 대기까지 걸린 시간은 72시간이 채 되지 않았습니다.

오늘은 무슨 일이 있었는지, 어떤 구멍을 어떻게 이었는지, 클로드가 정확히 무엇을 했는지, 그리고 이 사건이 왜 우리 모두에게 중요한지를 차근차근 살펴보겠습니다.

좁은 틈으로 청록빛 점들이 빠져나가는 어두운 장벽 — 방어를 뚫고 지나가는 침입을 표현한 개념 이미지

연구자 세 명이 72시간 만에 오픈AI에 들어갔습니다

이번 사건을 한 줄로 줄이면 이렇습니다. 해크트론이라는 보안 스타트업의 연구자 세 명이, 오픈AI가 운영하는 게시판의 허점을 파고들어 직원 계정을 손에 넣었습니다.

놀라운 것은 방법이 아니라 속도와 도구입니다. 이들은 취약점을 찾고 공격 코드를 만드는 어려운 과정을 경쟁사 AI인 클로드에게 맡겼습니다.

발견부터 침입까지 걸린 시간은 세 시간이 아니라 세 시간의 스물넷 배, 즉 72시간이 채 안 됐습니다. 사람이 몇 주씩 붙어야 하던 일이 사흘로 줄었습니다.

무엇이 밝혀졌나 — 9월 18일의 공개

이 내용은 9월 18일 여러 기술·보안 매체를 통해 공개됐습니다. 월스트리트저널이 먼저 보도했고, 테크크런치와 더레지스터 같은 매체가 뒤이어 기술적인 내용을 자세히 전했습니다.

공격 자체는 이미 7월 25일에 이뤄졌고, 오픈AI가 문제를 고친 뒤 시간이 지나 이제 공개된 것입니다.

해크트론은 자사 블로그에 이 작업을 정리한 글을 올렸습니다. 이들은 이 프로젝트에 이름을 붙여 두 달에 걸쳐 파고들었다고 밝혔습니다.

어둠을 가로질러 셋으로 갈라지는 청록빛 광선 — 하나의 공격이 여러 갈래로 번지는 모습을 담은 개념 이미지

해크트론은 누구인가 — 세 사람의 팀

해크트론은 AI로 보안 취약점을 찾는 일을 하는 스타트업입니다. 이번 작업을 이끈 사람은 하시 자이스왈, 모한 페다파티, 라훌 마이니 세 명입니다.

이들은 자신들이 만든 것을 오픈AI에 몰래 심으려던 것이 아니라, 취약점을 찾아 알려 주고 그 대가를 받는 정식 보안 연구자들입니다.

목적은 파괴가 아니라 증명이었습니다. 지금의 AI 도구가 어디까지 위험해질 수 있는지를 실제로 보여 주려 한 것입니다.

출발점은 게시판의 이미지 한 장이었습니다

공격의 시작은 뜻밖에도 오픈AI의 커뮤니티 게시판이었습니다. 주소는 community.openai.com이고, 디스코스라는 널리 쓰이는 게시판 소프트웨어로 만들어져 있습니다.

이 게시판은 사용자가 올린 아이폰 사진 형식(HEIF)을 일반 이미지로 바꿔 주는 처리를 합니다. 그 변환을 맡는 부품이 libheif라는 이미지 해독 라이브러리였습니다.

연구자들은 바로 이 변환 과정에 공격자가 만든 이미지를 흘려 넣을 수 있다는 점에 주목했습니다.

큰 빈 고리 옆에 모여 빛나는 세 개의 작은 청록빛 구 — 세 사람으로 이뤄진 연구팀을 표현한 개념 이미지

libheif의 메모리 구멍 — 힙 오버플로

libheif 안에는 힙 버퍼 오버플로라는 종류의 결함이 있었습니다. 쉽게 말하면, 프로그램이 준비해 둔 그릇보다 큰 데이터를 억지로 부어 넣어 옆자리 기억을 덮어쓰는 방식입니다.

이 자리를 잘 조종하면 공격자가 원하는 명령을 서버에서 실행시킬 수 있습니다. 보안에서 가장 위험하다고 보는 원격 코드 실행입니다.

다만 이 결함을 실제로 작동하는 공격 코드로 만드는 일은 매우 까다롭습니다. 현대 시스템에는 기억의 위치를 매번 뒤섞는 방어 장치가 있기 때문입니다.

클로드 오퍼스 4.8은 처음에 실패했습니다

연구자들은 이 공격 코드를 사람이 직접 짜는 대신 클로드에게 맡겼습니다. 처음 쓴 것은 클로드 오퍼스 4.8이었습니다.

그런데 4.8은 기억 위치를 뒤섞는 방어 장치를 뚫는 안정적인 공격 코드를 만들어 내지 못했습니다. 여기까지는 AI의 한계가 사람을 지켜 준 셈입니다.

바로 이 지점이 이번 사건에서 가장 중요한 대목입니다. 며칠 사이에 무엇이 바뀌었는지 보면 그렇습니다.

청록빛 액체가 가장자리로 넘쳐흐르는 투명 구 — 넘쳐서 새어 나가는 접근 권한을 표현한 개념 이미지

오퍼스 5가 나오자 세 시간 만에 뚫렸습니다

7월 24일, 클로드 오퍼스 5가 공개됐습니다. 연구자들은 곧바로 새 세션을 열어 같은 문제를 다시 맡겼습니다.

오퍼스 5는 맥에서 작동하는 ARM64용 공격 코드를 세 시간 만에 만들어 냈습니다. 그다음에는 그 코드를 다른 종류의 시스템에도 옮겨 붙였습니다.

모델 한 세대가 올라가자, 며칠 전만 해도 못 하던 일이 몇 시간짜리 일이 됐습니다. AI 보안에서 가장 무섭게 여기는 변화가 바로 이 속도입니다.

AI를 자율 루프에 걸어 두었더니

연구자들은 클로드를 자신들이 마련한 시험용 디스코스 서버에 붙여 두고, 스스로 반복해서 공격을 시도하는 자율 루프에 걸어 두었습니다.

아침에 다시 확인했을 때, 모델은 이미 그 서버에서 원격 코드 실행에 성공해 있었습니다. 접근을 증명하려고 서버의 내부 설정 파일까지 읽어 둔 상태였습니다.

사람이 밤새 지켜보지 않아도 AI가 알아서 뚫어 놓았다는 뜻입니다. 도구가 아니라 조수에 가까운 역할을 한 것입니다.

한 부분이 끊긴 어두운 고리와 그 틈에 감도는 청록빛 — 시스템에 뚫린 취약점을 표현한 개념 이미지

두 번째 구멍 — 로그인 방식의 허점

서버를 장악한 것만으로는 직원 계정까지 갈 수 없습니다. 여기서 두 번째 취약점이 등장합니다.

오픈AI는 이 게시판에 자사 계정으로 로그인하는 방식(SSO)을 연결해 두었는데, 그 연결에 잘못 설정된 부분이 있었습니다.

연구자들은 이 허점을 이용해, 게시판에 로그인해 있던 오픈AI 직원의 활성 세션을 가로챘습니다. 두 개의 서로 다른 구멍을 사슬처럼 이어 붙인 것입니다.

가로챈 것은 챗GPT와 코덱스 계정이었습니다

세션을 가로채자 연구자들의 손에 들어온 것은 오픈AI 직원의 챗GPT 계정과 코덱스 계정이었습니다.

코덱스는 오픈AI의 코딩 도구입니다. 문제는 이 계정이 오픈AI의 깃허브 조직과 연결돼 있었다는 점입니다.

챗GPT와 코덱스에는 깃허브, 슬랙, 이메일 같은 여러 서비스를 연결할 수 있어서, 이론적으로 접근 가능한 범위가 매우 넓었습니다.

아랫부분은 어둡고 윗부분만 강렬하게 빛나는 청록빛 방추 — 능력이 한 단계 도약하는 순간을 담은 개념 이미지

내부 저장소에 남긴 증거 — 풀 리퀘스트 하나

연구자들은 실제로 회사의 민감한 코드를 빼내지는 않았습니다. 대신 자신들이 그 안에 들어왔다는 사실만 증명했습니다.

방법은 오픈AI 내부 코드 저장소에 변경 제안, 즉 풀 리퀘스트를 하나 여는 것이었습니다. 기록에 흔적을 남겨 '우리가 여기까지 왔다'를 보여 준 셈입니다.

데이터를 훔치지 않고 증거만 남기는 것은 정식 보안 연구자들이 지키는 선입니다. 목적이 공격이 아니라 경고였음을 여기서 알 수 있습니다.

전체 타임라인 — 사흘 안에 벌어진 일

시간표를 보면 속도가 더 실감 납니다. 7월 23일에 게시판의 이미지 처리 과정을 살펴보기 시작했습니다.

7월 24일에 작동하는 공격 코드가 나왔고, 7월 25일 새벽에 원격 코드 실행과 관리자 권한을 확인했습니다. 같은 날 오후에 직원 계정을 가로채고 증거 풀 리퀘스트를 열었습니다.

그리고 그날 밤 오픈AI는 이미 수정을 마쳤습니다. 발견부터 대응까지 모두 사흘 안에 끝났습니다.

밝은 점 하나가 자취를 남기며 청록빛 고리를 빠르게 도는 모습 — 세 시간 만의 성공이라는 속도를 표현한 개념 이미지

오픈AI는 14시간 만에 막았습니다

이 사건에서 오픈AI가 잘한 부분도 분명합니다. 문제 보고를 받고 약 14시간 만에 구멍을 막았습니다.

보안 사고에서 대응 속도는 피해 규모를 가르는 핵심입니다. 반나절 남짓 만에 조치한 것은 빠른 편입니다.

게시판 소프트웨어를 만든 디스코스도 며칠 안에 별도의 수정과 보안 권고를 내놓아, 다른 사이트들도 같은 공격을 피할 수 있게 했습니다.

상금은 6,500달러였습니다

오픈AI는 이 발견에 대해 버그 바운티, 즉 취약점 신고 포상금으로 6,500달러를 지급했습니다.

이 금액은 오픈AI 쪽에서 발견된 문제에 대한 것이고, 게시판 소프트웨어 자체를 뚫은 부분은 오픈AI의 포상 범위 밖이라 제외됐습니다.

세계에서 가장 앞선 AI 회사의 내부 저장소에 들어간 대가치고는 크지 않은 금액이라는 평가가 뒤따랐습니다.

교차점에서 한쪽 고리로 옮겨가는 작은 불꽃과 맞물린 두 청록빛 고리 — 자율 루프의 반복 시도를 담은 개념 이미지

두 달, 3,000달러어치 토큰

해크트론은 이 프로젝트 전체를 두 달에 걸쳐 진행했고, AI를 쓰는 데 든 비용은 토큰 값으로 3,000달러가 채 되지 않았다고 밝혔습니다.

여기서 토큰이란 AI에게 글을 주고받을 때 세는 단위이고, 그만큼을 쓰는 데 든 요금이 3,000달러 미만이었다는 뜻입니다.

거대한 조직이 아니라 세 사람과 얼마 안 되는 AI 사용료만으로 이 정도 일을 해냈다는 사실이 이 사건의 핵심 메시지입니다.

왜 방어보다 공격이 먼저 빨라지나

보안에는 오래된 비대칭이 있습니다. 공격하는 쪽은 구멍 하나만 찾으면 되지만, 지키는 쪽은 모든 구멍을 다 막아야 합니다.

AI는 이 비대칭을 더 벌려 놓을 수 있습니다. 공격 코드를 만드는 지루하고 어려운 작업을 AI가 대신해 주면, 적은 인원이 많은 대상을 노릴 수 있기 때문입니다.

이번 사건은 그 우려가 이론이 아니라 실제라는 것을 보여 준 사례입니다.

중앙에 작은 점 하나만 고요히 놓인 청록빛 모서리의 커다란 다면체 — 로그인 방식의 허점을 표현한 개념 이미지

한 달 200달러면 누구나 쓸 수 있습니다

한 보안 업계 관계자는 이 사건을 두고, 한 달에 200달러 남짓이면 누구나 이런 도구를 쓸 수 있다는 점을 지적했습니다.

과거에는 국가나 대형 조직만 가능하던 수준의 공격이, 이제는 개인의 손이 닿는 곳까지 내려왔다는 뜻입니다.

기술이 널리 퍼지는 것은 대체로 좋은 일이지만, 공격 능력이 함께 퍼지는 것은 새로운 종류의 위험입니다.

맞붙은 두 개의 어두운 기둥 사이로 남은 가느다란 청록빛 틈 — 가로챈 세션의 좁은 통로를 표현한 개념 이미지

앤스로픽과 오픈AI는 무엇이라 했나

공개 시점에 앤스로픽과 오픈AI 모두 공식 논평을 내놓지는 않았습니다.

오픈AI는 문제를 이미 고쳤고 포상금을 지급했다는 사실로 대응을 갈음했습니다. 앤스로픽은 자사 모델이 이런 식으로 쓰인 데 대해 별도 입장을 밝히지 않았습니다.

AI 회사들이 자사 모델의 악용 가능성에 어떻게 대응할지는 앞으로 계속 시험받을 문제입니다.

작은 다면체 안으로 흘러드는 청록빛 입자들 — 내부 저장소에 남긴 흔적을 표현한 개념 이미지

이미지 처리는 오래된 약점입니다

이번 구멍의 뿌리는 화려한 AI 기술이 아니라, 이미지 파일을 처리하는 오래된 부품이었습니다.

사용자가 올린 파일을 서버가 자동으로 변환하는 곳은 어디에나 있고, 그 변환 부품에 낡은 결함이 남아 있는 경우도 흔합니다.

AI 시대의 새로운 위협을 이야기하면서도, 정작 뚫린 곳은 20년 된 방식의 약점이었다는 점이 아이러니합니다.

실제 사례 — 게시판 하나가 열어 준 문

이 사건을 회사 건물에 비유하면 이렇습니다. 로비 옆에 있는 방문객 게시판이 낡은 자물쇠로 잠겨 있었습니다.

공격자는 그 게시판을 통해 건물 안으로 들어왔고, 마침 직원 한 명이 열어 둔 사원증으로 사무실 문까지 지나갔습니다. 사원증은 내부 창고 열쇠와 연결돼 있었습니다.

핵심 금고를 열지는 않았지만, 창고 방명록에 이름을 남겨 '여기까지 왔다'를 증명하고 조용히 알렸습니다. 이번 해킹의 구조가 정확히 이랬습니다.

수많은 흐린 청록 점들 속에서 밝은 원에 둘러싸인 단 하나의 점 — 사흘 안에 벌어진 일의 집중을 담은 개념 이미지

우리 같은 사용자에게 주는 교훈

이 이야기는 기업 보안팀만의 일이 아닙니다. 우리도 챗봇에 여러 서비스를 연결해 씁니다.

하나의 계정이 이메일, 문서, 코드 저장소와 이어져 있으면, 그 계정 하나가 뚫릴 때 잃을 것이 그만큼 많아집니다.

연결은 편리하지만 위험도 함께 늘립니다. 정말 필요한 연결만 남기고, 로그인 알림을 켜 두는 것만으로도 방어의 첫 단추가 됩니다.

남는 질문 — 이 속도를 누가 따라잡나

가장 무거운 질문은 이것입니다. 공격을 만드는 AI가 이렇게 빨라지는데, 그것을 막는 방어는 같은 속도로 빨라질 수 있을까요.

AI 회사들은 자사 모델이 공격에 쓰이지 못하게 막는 안전장치를 두고 있지만, 이번처럼 정당한 보안 연구라는 이름으로 쓰이면 경계가 흐려집니다.

방어도 AI로 빨라질 수 있다는 것이 유일한 희망입니다. 문제는 공격과 방어 중 어느 쪽이 더 빨리 이 도구를 손에 익히느냐입니다.

오른쪽 구의 작은 구멍을 꿰뚫는 왼쪽 구의 청록빛 광선 — 표적을 정확히 노린 침입을 표현한 개념 이미지

핵심 정리

보안 연구자 세 명이 클로드로 오픈AI 직원의 챗GPT·코덱스 계정을 뚫었고, 발견부터 내부 저장소 접근까지 72시간이 걸렸습니다.

공격은 게시판의 이미지 처리 취약점과 로그인 방식의 허점을 사슬처럼 이어 이뤄졌고, 클로드 오퍼스 4.8은 실패했지만 오퍼스 5는 세 시간 만에 성공했습니다.

오픈AI는 14시간 만에 막고 6,500달러를 지급했습니다. 이 사건이 남긴 진짜 메시지는, 세 사람과 3,000달러어치 토큰만으로 이런 일이 가능해졌다는 사실입니다.

참고하실 만한 것

원문 보고서는 해크트론 블로그에서 직접 보실 수 있습니다. 공격의 기술적 흐름과 시간표가 자세히 적혀 있습니다.

AI와 보안이 겹치는 흐름이 궁금하시면 최근 AI 안전 관련 뉴스도 함께 보시면 좋습니다.

SVIL 블로그는 AI 뉴스를 큰 글씨와 쉬운 설명으로 매일 전해 드립니다. 다른 AI 뉴스도 함께 둘러보세요.

출처


협업문의 : kuroicode@gmail.com
블로그 : https://blog.svil.dev/
홈페이지 : https://svil.dev/