앤스로픽이 자기 건물 안에 감시자를 들였습니다 — 액센츄어 내장 평가자와 10억 달러씩 5년

앤스로픽이 자기 건물 안에 감시자를 들였습니다 — 액센츄어 내장 평가자와 10억 달러씩 5년

AI 회사가 자기 모델이 안전하다고 말할 때, 그 말을 어떻게 믿을 수 있을까요. 지금까지는 대체로 믿는 수밖에 없었습니다.

앤스로픽이 9월 18일 그 구조를 바꾸겠다고 발표했습니다. 외부 회사 직원을 자기 회사 안으로 들여서, 직원에 준하는 권한으로 학습 중인 모델을 지켜보게 하겠다는 것입니다. 상대는 컨설팅 회사 액센츄어입니다.

두 회사가 각각 10억 달러 이상을 5년에 걸쳐 쓰기로 했습니다. 적은 돈이 아닙니다. 무엇을 하겠다는 것인지 차근차근 보겠습니다.

반으로 갈라져 벌어진 거대한 어두운 구체 사이에 작은 청록 고리가 떠 있는 이미지 — 회사 안에 들어온 감시자를 표현했습니다

앤스로픽이 9월 18일 첫 내장 평가자를 발표했습니다

앤스로픽과 액센츄어는 2026년 9월 18일 내장 평가자 팀을 구성하는 협약을 발표했습니다. 영어로는 임베디드 이밸류에이터라고 부릅니다.

이 팀은 앤스로픽 내부 팀과 나란히 일하면서 모델을 평가하고 레드팀 시험을 하고 정렬 상태를 점검하고 안전장치를 시험합니다.

앤스로픽이 이런 형태의 외부 평가를 공식 계약으로 맺은 것은 처음입니다.

내장 평가자가 정확히 무엇인가요

말 그대로 안에 들어와 있는 평가자입니다. 외부 조직 소속이지만 근무는 평가 대상 회사 안에서 합니다.

회계 감사와 비슷하다고 생각하실 수 있는데, 차이가 있습니다. 감사는 이미 끝난 일의 장부를 봅니다. 내장 평가자는 지금 만들어지는 중인 것을 봅니다.

즉 사후 확인이 아니라 과정 관찰입니다. 이것이 이 제도의 핵심입니다.

큰 어두운 정육면체를 청록 고리가 관통해 절반이 안쪽에 숨은 이미지 — 안쪽에서 보는 평가를 표현했습니다

바깥에서 보는 평가와 무엇이 다른가요

지금까지의 외부 평가는 대체로 완성된 모델을 받아서 시험하는 방식이었습니다. 회사가 주는 것만 볼 수 있었습니다.

무엇을 언제까지 어디까지 보여 줄지를 평가받는 쪽이 정했습니다. 그러면 독립적인 평가라고 부르기 어렵습니다.

실제로 한 대형 AI 회사가 외부 조사의 범위와 일정과 자료 접근을 자기가 통제한 사례가 지적된 적이 있습니다. 내장 평가자는 바로 그 한계를 겨냥해 설계된 것입니다.

직원에 준하는 접근 권한을 줍니다

이 협약의 가장 특이한 점은 접근 권한입니다. 평가자들은 앤스로픽 직원에 준하는 수준의 시스템 접근 권한을 받습니다.

회사 밖 사람에게 내부 시스템을 여는 것은 보통 있는 일이 아닙니다. 경쟁사에 정보가 새 나갈 위험, 보안 위험이 모두 커집니다.

그런 위험을 감수하겠다는 것은 이 제도를 진지하게 밀고 나가겠다는 신호로 읽힙니다.

어두운 각진 판들 사이에 놓인 청록 구체 이미지 — 바깥 평가와 내부 평가의 차이를 표현했습니다

학습 중인 모델을 옆에서 봅니다

평가자들은 모델이 학습되는 과정을 지켜봅니다. 완성된 결과물이 아니라 만들어지는 중간 상태를 본다는 뜻입니다.

학습 도중에만 드러나는 신호가 있습니다. 어떤 데이터를 넣었을 때 모델이 어떻게 반응이 바뀌는지, 어느 단계에서 이상한 성향이 나타났다가 사라지는지 같은 것들입니다.

완성된 모델만 보면 그런 흔적은 이미 덮여 있습니다. 옆에서 봐야만 보이는 것이 있습니다.

배포 결정을 따라다닙니다

평가자들은 모델을 어떻게 만들고 어떻게 내보낼지 정하는 결정 과정도 따라갑니다.

기술적인 측정만으로는 잡히지 않는 것이 여기에 있습니다. 위험 신호가 나왔을 때 회사가 그것을 어떻게 다뤘는지, 일정 압박 앞에서 어떤 선택을 했는지 같은 것들입니다.

안전 사고는 대개 기술이 아니라 결정에서 시작됩니다. 그 결정을 보겠다는 것입니다.

가는 청록 선 수십 줄이 사방에서 관통하는 어두운 정육면체 이미지 — 직원에 준하는 접근 권한을 표현했습니다

직원과 직접 대화할 수 있습니다

평가자들은 앤스로픽 직원들과 직접 이야기할 수 있습니다. 공식 보고 창구를 거치지 않고 말입니다.

이것이 왜 중요한지는 짐작이 가실 것입니다. 회사가 정리해서 내놓는 설명과 현장에서 일하는 사람이 느끼는 것 사이에는 늘 간격이 있습니다.

그 간격을 직접 확인할 수 있어야 평가가 형식에 그치지 않습니다.

상대는 액센츄어, 그중에서도 패컬티입니다

실제로 일할 조직은 액센츄어 산하의 패컬티입니다. 액센츄어의 AI 전문 부문 역할을 하는 곳입니다.

패컬티는 영국에 기반을 둔 응용 AI 회사로, 이 분야에서는 알려진 이름입니다.

즉 컨설팅 회사의 일반 인력이 아니라 AI를 다뤄 온 전문 조직이 들어간다는 구조입니다.

한쪽 면이 열린 어두운 육각기둥 옆에 가느다란 청록 막대가 곧게 서 있는 이미지 — 학습 중인 모델을 옆에서 지켜보는 장면을 표현했습니다

패컬티는 올해 1월에 인수된 회사입니다

액센츄어는 2026년 1월 패컬티를 인수했습니다. 이번 협약은 그 인수가 여덟 달 만에 구체적인 형태로 나타난 것이기도 합니다.

인수 당시에는 컨설팅 회사가 AI 역량을 사들이는 흔한 움직임으로 보였습니다. 그런데 지금 보면 AI 안전 평가라는 새 시장에 들어갈 채비였다고도 읽힙니다.

AI 안전 평가가 하나의 산업이 되어 가고 있다는 신호이기도 합니다.

두 회사가 각각 10억 달러씩 5년을 걸었습니다

앤스로픽과 액센츄어는 각각 최소 10억 달러를 향후 5년에 걸쳐 투입할 것으로 예상한다고 밝혔습니다. 합치면 20억 달러 규모입니다.

우리 돈으로 각각 1조 4천억 원 안팎입니다. 상징적인 제스처로 치부하기에는 큰 금액입니다.

다만 금액이 크다는 것과 제도가 잘 작동한다는 것은 별개의 문제입니다. 돈이 어디에 어떻게 쓰이는지가 나중에 드러날 것입니다.

어두운 선 위에 놓인 흐릿한 청록 점들 가운데 하나만 훨씬 밝게 빛나는 이미지 — 배포 결정의 흐름을 따라가는 것을 표현했습니다

무엇을 하게 되나 — 레드팀과 정렬 평가와 안전장치 시험

발표에 적힌 업무는 세 갈래입니다. 모델을 상대로 공격을 시도하는 레드팀, 모델이 사람의 가치에 맞게 움직이는지 보는 정렬 평가, 그리고 안전장치가 실제로 작동하는지 확인하는 시험입니다.

레드팀은 일부러 나쁜 요청을 넣어 모델이 뚫리는지 보는 일입니다. 방어하는 쪽과 공격하는 쪽이 같은 회사 사람이면 아무래도 덜 집요해집니다.

그래서 공격 역할을 바깥에 맡기는 것에는 그 자체로 의미가 있습니다.

9월 12일 아모데이 에세이가 출발점입니다

이 협약은 갑자기 나온 것이 아닙니다. 9월 12일 앤스로픽 대표 다리오 아모데이가 프런티어의 속도를 맞춰야 한다는 제목의 글을 냈습니다.

그 글의 요지는 AI 성능을 끌어올리는 속도 자체를 늦춰야 한다는 것이었습니다.

경쟁의 한복판에 있는 회사의 대표가 속도를 줄이자고 말한 것이라 당시에도 화제가 됐습니다.

두 개의 어두운 정육면체가 단 하나의 곧은 청록 선으로 이어진 이미지 — 직원과의 직접 대화를 표현했습니다

프런티어의 속도를 맞추자는 3단계 제안

그 글에는 3단계 계획이 담겨 있었습니다. 첫째 외부 평가자를 회사 안에 들이는 것, 둘째 민주주의 국가의 선도 연구소들이 서로 보조를 맞추는 것, 셋째 국제 합의로 가는 것입니다.

뒤로 갈수록 어려워지는 순서입니다. 회사 하나가 결심하면 되는 일에서 시작해 여러 나라가 합의해야 하는 일로 이어집니다.

그래서 첫 단계가 실제로 굴러가는지가 나머지의 설득력을 좌우합니다.

1단계가 바로 이 내장 평가자입니다

이번 액센츄어 협약이 그 1단계의 첫 실행입니다. 제안이 나온 지 엿새 만에 계약 형태로 나왔습니다.

앤스로픽은 이 약속을 다른 회사의 동참 여부와 관계없이 스스로 하겠다는 일방적 선언의 성격으로 내놨습니다.

경쟁 상대가 따라오지 않으면 자기만 손해를 보는 구조인데도 먼저 하겠다는 것입니다.

큰 어두운 고리의 바깥 가장자리에 훨씬 작은 청록 고리가 꼭 맞게 끼워진 이미지 — 액센츄어와 패컬티의 관계를 표현했습니다

비독점 계약이라는 점

이 협약은 배타적이지 않습니다. 앤스로픽은 다른 평가자와도 일할 수 있고, 액센츄어도 다른 AI 회사에 같은 역할을 할 수 있습니다.

이 조건은 중요합니다. 한 쌍이 고정되면 오래 함께 일하면서 관계가 가까워지고, 그러면 평가가 무뎌집니다.

앤스로픽은 앞으로 몇 주 안에 추가 평가자를 발표하겠다고 밝혔습니다.

METR과도 이야기 중이라고 했습니다

앤스로픽은 AI 안전 평가 비영리 조직인 METR을 비롯한 여러 단체와도 논의 중이라고 했습니다.

이들에 대해서는 자체 자금으로 내장 평가의 일부 요소를 시험해 보는 방식을 이야기하고 있다고 덧붙였습니다.

평가자가 평가 대상에게서 돈을 받지 않는 구조를 만들어 보려는 시도로 읽힙니다.

두 덩어리가 맞닿은 자리를 따라 청록 이음새가 길게 빛나는 어두운 육각 덩어리 이미지 — 1월 패컬티 인수를 표현했습니다

그런데 METR의 독립성에 의문이 붙었습니다

공교롭게도 비슷한 시기에 METR의 독립성을 문제 삼는 지적이 나왔습니다.

METR과 앤스로픽 사이에 인적 연결과 자금 관계, 그리고 효과적 이타주의 운동을 매개로 한 관계망이 오래 이어져 왔다는 내용입니다.

감시하는 쪽과 감시받는 쪽이 같은 사람들과 같은 자금줄을 공유한다면 독립성을 주장하기 어렵다는 것이 지적의 요지입니다.

평가자가 돈을 받는 구조의 문제

여기에 더 근본적인 질문이 있습니다. 평가받는 회사가 평가자에게 돈을 준다면 그 평가가 얼마나 날카로울 수 있느냐는 것입니다.

우리는 이 문제를 이미 다른 분야에서 봤습니다. 회계 감사, 신용평가, 제품 인증 모두 같은 구조적 약점을 안고 있습니다.

구조를 바꾸지 않고 선의에만 기대면 결국 같은 자리로 돌아온다는 것이 그동안의 경험입니다.

긴 어두운 막대 양 끝에 크기가 완전히 같은 두 개의 청록 팔면체가 떠 있는 이미지 — 각각 10억 달러씩이라는 대칭을 표현했습니다

컨설팅 회사가 안전 평가를 맡는다는 선택

많은 사람이 놀란 지점은 상대가 비영리 연구 조직이 아니라 대형 컨설팅 회사라는 점이었습니다.

컨설팅 회사는 고객 관계로 먹고사는 업종입니다. 고객에게 불리한 결론을 내는 일에 구조적으로 강하지 않습니다.

반대로 보는 시각도 있습니다. 비영리 조직에는 대규모 인력을 오래 투입할 여력이 없고, 실제로 사람을 붙여 상시로 돌릴 수 있는 곳은 이런 규모의 회사뿐이라는 것입니다.

액센츄어 주가는 시간외에서 8퍼센트 올랐습니다

발표 직후 액센츄어 주가는 시간외 거래에서 8퍼센트 올랐습니다.

시장이 이것을 AI 안전 평가라는 새 사업 기회의 신호탄으로 읽었다는 뜻입니다.

안전 평가가 돈이 되는 시장이 되는 것은 인력과 자원이 몰린다는 점에서 좋은 일입니다. 동시에 평가가 영업의 수단이 될 위험도 함께 자랍니다.

사방에서 뻗어 온 어두운 쐐기들 한가운데 놓인 밝은 청록 정육면체 이미지 — 레드팀 시험을 표현했습니다

아직 기준이 없다고 스스로 밝혔습니다

앤스로픽은 평가자의 접근 범위나 소통 방식에 대한 기준이 아직 존재하지 않는다고 밝혔습니다. 그래서 자신들의 방식도 시간이 지나며 바뀔 것으로 본다고 했습니다.

솔직한 인정입니다. 동시에 지금은 회사가 정한 대로 굴러간다는 뜻이기도 합니다.

무엇을 보여 주고 무엇을 안 보여 줄지, 평가자가 문제를 발견했을 때 어디까지 말할 수 있는지가 아직 정해져 있지 않습니다.

규제 포획이라는 반론

아모데이의 속도 조절 제안에는 처음부터 다른 해석이 따라붙었습니다. 앞서 나간 회사가 규칙을 만들어 뒤따라오는 경쟁자의 길을 좁히려는 것 아니냐는 시각입니다.

이런 구조를 규제 포획이라고 부릅니다. 규칙을 지킬 여력이 있는 큰 회사에게는 규칙이 오히려 방어벽이 됩니다.

의도가 무엇이든 결과를 보면 알 수 있습니다. 1년쯤 지나 이 제도가 실제로 무엇을 막았는지를 보면 판단할 수 있을 것입니다.

한 곳이 끊겨 양 끝이 서로 만나지 못하는 청록 고리 이미지 — 독립성에 생긴 의문을 표현했습니다

이 구조가 실제로 작동하려면 무엇이 필요한가요

몇 가지가 필요해 보입니다. 첫째 평가자가 발견한 것을 회사의 허락 없이 공개할 수 있는 통로입니다.

둘째 평가자의 보수가 평가 대상의 재량에 매이지 않는 구조입니다. 셋째 여러 평가자가 서로를 견제하도록 하는 복수 체제입니다.

앤스로픽이 말한 비독점 조건과 추가 평가자 발표는 셋째에 해당합니다. 첫째와 둘째는 아직 답이 나오지 않았습니다.

한국에서 이 뉴스를 읽는 법

국내에서도 AI 안전과 검증 체계 논의가 이어지고 있습니다. 이번 사례는 민간이 스스로 만든 장치가 어디까지 갈 수 있는지를 보여 주는 실험대입니다.

정부 규제만으로는 학습 중인 모델 내부를 볼 수 없습니다. 그러려면 안에 들어가야 하는데 그 권한을 국가가 갖는 것은 또 다른 문제를 낳습니다.

이 실험이 잘 굴러가면 제도 설계의 참고가 되고, 실패하면 어디가 무너지는지를 보여 주는 자료가 됩니다. 어느 쪽이든 지켜볼 가치가 있습니다.

서로를 향해 부드럽게 휘어진 청록 띠 이미지 — 제도가 실제로 작동하기까지 남은 거리를 표현했습니다

핵심 정리

앤스로픽이 9월 18일 액센츄어를 첫 내장 평가자로 선임했습니다. 실제 업무는 액센츄어가 올해 1월 인수한 패컬티가 맡습니다.

평가자들은 직원에 준하는 접근 권한으로 학습 중인 모델을 지켜보고 배포 결정을 따라가며 직원과 직접 대화합니다. 두 회사가 각각 10억 달러 이상을 5년에 걸쳐 투입합니다.

9월 12일 아모데이의 속도 조절 제안 3단계 중 1단계에 해당합니다. 비독점 계약이고 METR 등과도 논의 중이지만, 평가자 독립성과 기준 부재를 둘러싼 의문은 남아 있습니다.

참고하실 만한 것

SVIL 블로그에서는 AI 안전과 규제 논의를 기술 뉴스와 같은 무게로 다루고 있습니다. 모델이 무엇을 할 수 있는지만큼 누가 그것을 확인하는지도 중요하다고 보기 때문입니다.

앤스로픽과 오픈AI의 안전 관련 발표를 그때그때 정리해 두고 있으니 흐름을 따라가고 싶으시면 함께 보셔도 좋겠습니다.

의견이나 다뤄 주셨으면 하는 주제가 있으시면 아래 메일로 알려 주세요.

출처


협업문의 : kuroicode@gmail.com
블로그 : https://blog.svil.dev/
홈페이지 : https://svil.dev/