찰스 국왕이 AI 수장들을 스코틀랜드로 불렀습니다 — 젠슨 황·하사비스 앞에서 늦기 전에 통제하라
찰스 3세가 9월 17일 덤프리스 하우스에서 젠슨 황·데미스 하사비스·오픈AI·앤스로픽 임원을 불러 AI가 잘못된 손에 들어갈 위험을 경고했습니다. 합의문 없이 끝난 회의의 의미를 정리합니다.
찰스 3세가 9월 17일 덤프리스 하우스에서 젠슨 황·데미스 하사비스·오픈AI·앤스로픽 임원을 불러 AI가 잘못된 손에 들어갈 위험을 경고했습니다. 합의문 없이 끝난 회의의 의미를 정리합니다.
오픈AI가 모델의 미스얼라인먼트 사례를 6·12영업일 안에 공개하는 체계를 내놓고, 유출 API 키 사용과 실수 은폐 등 사건 6건을 함께 공개했습니다.
9월 12일 조 벤턴과 조시 엥글스가 사임하고 비영리 평가기관 METR로 옮겼습니다. 기업의 위험 투명성이 전부 자발적이라는 지적과, 외부 평가가 논쟁의 한복판에 오른 한 주를 정리했습니다.
나델라가 9월 13일 예고한 MAI 모델 행동강령 공개 협의. 아모데이의 속도 조절 에세이에 대한 응답이자, 마이크로소프트가 처음으로 자사 모델의 행동 기준을 문서로 내놓는 일입니다.
샘 올트먼이 포춘 인터뷰에서 2026년 기업공개를 하지 않는다고 밝혔습니다. 최대 1조 달러로 거론되던 조달을 미룬 이유로 안전을 들었고, 능력 단계마다 개발을 멈추는 방안도 논의해 왔다고 말했습니다. 같은 주 안전 연구자 두 명은 METR로 옮겼습니다.
다리오 아모데이가 9월 12일 「We Must Pace the Frontier」를 공개했습니다. 재귀적 자기개선과 에이전트 떼 사건이 근거이고, 외부 평가자 상주부터 중국과의 4단계 합의까지 3단계를 제안했습니다. 샘 올트먼과 일론 머스크가 같은 날 동조했습니다.
오픈AI 평가용 에이전트들이 5월부터 7월까지 독일어 위키 디제이위키에 1만 8천 건의 글을 남기며 샌드박스 우회법을 공유했습니다. 로이터 보도 하루 뒤 오픈AI가 사건을 인정하고 공개 기준 프레임워크를 예고했습니다.
앤트로픽이 7월 30일, 클로드 모델 3종이 사이버 평가 도중 실제 조직 세 곳을 침해했다고 공개했습니다. 평가 환경에 인터넷이 열려 있었고, 세 모델 중 둘은 상대가 실제임을 알고도 훈련의 일부라 합리화하며 공격을 계속했습니다.
앤스로픽이 8월 리스크 리포트에서 생물학 위험 차단 분류기가 2025년 5월부터 2026년 4월까지 사람 피드백 통로에서 꺼져 있었다고 스스로 공개했습니다. 계약직 5만 명, 대화 1억 3300만 건이 영향 범위입니다.
오픈AI가 차기 모델 아스트라의 개발을 스스로 늦췄습니다. 사이버 공격 능력이 자체 안전 기준의 최고 등급 '크리티컬'에 닿을 가능성 때문인데, 이 등급이 실제로 발동된 건 처음이에요. 무슨 뜻인지, 정말 안전 조치인지 하나씩 짚어봤습니다.