반값에 플래그십급 — 클로드 오퍼스 5가 하루 만에 해커뉴스를 뒤집은 이유
단 하루 만에 해커뉴스를 뒤집은 숫자 하나
2026년 7월 24일, 앤트로픽이 새 인공지능 모델 '클로드 오퍼스 5(Claude Opus 5)'를 조용히 내놓았어요. 그런데 반응은 전혀 조용하지 않았습니다. 개발자들이 모이는 해커뉴스(Hacker News)에서 이 소식은 몇 시간 만에 1,378포인트, 댓글 746개를 찍으며 첫 페이지를 통째로 점령했어요.
이유는 딱 한 줄이었습니다. 추상적 추론 능력을 재는 'ARC-AGI-3'라는 시험에서 오퍼스 5가 30.2%를 받았는데, 이게 2등 모델의 약 세 배 점수였거든요. 게다가 가격은 이전과 똑같이 유지했습니다. 성능은 사실상 최상위인데 값은 반값. 오늘은 이 사건이 무슨 의미인지, 왜 업계가 이렇게 술렁이는지 천천히 풀어드릴게요.
클로드 오퍼스 5, 한마디로 뭔가요
오퍼스 5는 앤트로픽이 만든 대규모 언어모델(LLM) 제품군에서 'Opus' 등급, 즉 가장 무겁고 똑똑한 계열의 최신 버전이에요. 앤트로픽의 모델 이름은 크게 세 갈래로 나뉘는데, 가볍고 빠른 하이쿠(Haiku), 균형형 소넷(Sonnet), 그리고 최상위 오퍼스(Opus)가 있습니다. 오퍼스 5는 그중 머리 좋은 맏이형 자리를 이어받은 셈이에요.
흥미로운 건 앤트로픽에 이미 '페이블 5(Fable 5)'라는 플래그십이 따로 있다는 점입니다. 오퍼스 5는 그 페이블 5에 거의 근접하는 성능을, 훨씬 싼 값에 낸다는 포지션으로 나왔어요. '거의 최고인데 값은 절반'이라는 자리를 노린 거죠.
가장 큰 충격은 '반값'이었어요
오퍼스 5의 가격은 입력 100만 토큰당 5달러, 출력 100만 토큰당 25달러입니다. 숫자만 보면 감이 잘 안 오시죠. 핵심은 이 가격이 페이블 5의 입력 가격의 절반 수준이라는 데 있어요. 성능은 비슷하게 맞추면서 값을 반으로 깎아버린 겁니다.
여기에 '패스트 모드'도 있어요. 기본보다 약 2.5배 빠르게 돌리는 대신 값은 두 배(입력 10달러, 출력 50달러)로 올라갑니다. 급할 땐 돈을 더 내고 속도를 사고, 평소엔 기본으로 아끼는 식이죠. 오퍼스 5는 클로드 맥스(Max) 요금제의 기본 모델이자 프로(Pro) 요금제에서 고를 수 있는 가장 강한 선택지가 됐어요.
토큰이 뭐고, 왜 가격이 그렇게 중요한가요
'토큰'은 AI가 글을 잘게 쪼개 세는 단위예요. 대략 영어 단어 하나가 1~2토큰, 한글은 글자마다 더 잘게 쪼개진다고 보시면 됩니다. AI에게 질문을 넣는 것(입력)과 답을 받는 것(출력) 모두 토큰 수만큼 돈이 나가요. 마치 택시 미터기가 거리마다 올라가는 것과 비슷합니다.
기업이 AI를 서비스에 붙이면 하루에도 수십억 토큰이 오갑니다. 이럴 때 토큰당 단가가 절반이 되면 회사 입장에선 청구서가 통째로 반으로 줄어드는 셈이에요. 그래서 '성능 그대로, 가격 절반'이라는 조합이 그렇게 큰 뉴스가 된 거랍니다. 개인 사용자에겐 추상적인 이야기지만, AI로 사업하는 사람들에겐 직격탄이거든요.

ARC-AGI-3가 대체 무슨 시험이길래
오퍼스 5를 화제로 만든 ARC-AGI는 '기계가 처음 보는 문제를 스스로 추론하는가'를 재는 아주 까다로운 시험이에요. 대부분의 AI 벤치마크는 방대한 지식을 얼마나 외웠는지를 보지만, ARC-AGI는 정반대예요. 외워서는 못 풀고, 규칙을 그 자리에서 알아내야 하는 퍼즐을 냅니다.
비유하자면 이렇습니다. 보통 시험이 '수도 이름 대기' 같은 암기 문제라면, ARC-AGI는 처음 보는 보드게임을 설명서 없이 몇 판 보고 규칙을 스스로 파악하는 것에 가까워요. 그래서 이 점수는 '진짜 사고력'에 가깝다고 평가받습니다.
왜 '3배'가 그렇게 대단한가요
오퍼스 5의 ARC-AGI-3 점수 30.16%는 ARC Prize 재단이 '높은 노력(high effort)' 조건에서 직접 검증했어요. 중요한 건 절대 점수보다 '격차'입니다. 2등 모델의 약 세 배거든요.
이런 종류의 시험은 점수를 1~2%p 올리기도 어렵기로 악명이 높아요. 그런데 세 배 차이를 벌렸다는 건, 단순히 조금 더 똑똑한 게 아니라 다른 층위의 추론을 하고 있다는 신호로 읽힙니다. 물론 30%라는 숫자 자체는 아직 인간(대개 이런 문제를 쉽게 푸는)에 한참 못 미친다는 점도 함께 기억해두면 좋아요.
수학 올림피아드 42문제 만점 이야기
또 하나 눈길을 끈 성과는 2026년 국제수학올림피아드(IMO) 문제에서의 42점 만점이에요. 그것도 외부 계산 도구 없이, 모델 혼자 풀어낸 결과라고 합니다. IMO는 전 세계 수학 영재들이 겨루는 무대라 문제 하나하나가 창의적 증명을 요구해요.
계산기 없이 만점이라는 건, 단순 산수가 아니라 '증명의 논리'를 스스로 세웠다는 뜻이에요. 다만 벤치마크 점수는 늘 조건과 맥락을 함께 봐야 하니, '수학을 완벽히 정복했다'기보다 '특정 시험 세트에서 매우 뛰어났다'로 이해하는 게 정확합니다.
에이전틱 코딩 1위 — Frontier-Bench 43.3%
오퍼스 5는 실제 개발 업무를 흉내 낸 'Frontier-Bench(에이전틱 코딩)'에서 43.3%로 선두를 기록했어요. 지식 업무 능력을 재는 GDPval-AA v2에서는 1,861 Elo, 컴퓨터를 직접 조작하는 OSWorld 2.0에서는 70.57%를 냈습니다.
여기서 '에이전틱(agentic)'이라는 단어가 자꾸 나오죠. 이게 요즘 AI의 핵심 키워드라 다음 섹션에서 따로 풀어드릴게요.

'에이전틱 AI'가 뭔가요
예전 챗봇은 질문하면 답 한 번 주고 끝이었어요. 에이전틱 AI는 여기서 한 발 더 나갑니다. 목표를 주면 스스로 여러 단계를 계획하고, 도구를 쓰고, 중간 결과를 보고 방향을 고쳐가며 일을 '끝까지' 해내려 해요.
비유하자면, 예전 AI가 '레시피를 알려주는 요리책'이었다면, 에이전틱 AI는 '재료를 사 와서 직접 요리하고 설거지까지 하려는 견습 요리사'에 가깝습니다. 코드를 짜고, 실행해서 에러를 확인하고, 스스로 고치는 반복 작업이 대표적이에요. 오퍼스 5가 코딩·컴퓨터 조작 시험에서 강한 이유가 바로 이 지점이에요.
새로 생긴 조작법 — '노력(effort) 다이얼'
오퍼스 5에는 요청마다 '노력' 수준을 낮음·중간·높음으로 조절하는 다이얼이 생겼어요. 쉬운 일은 낮음으로 싸고 빠르게, 어려운 추론은 높음으로 모델의 온 힘을 끌어내는 방식입니다. 자동차의 '에코 모드'와 '스포츠 모드'를 떠올리시면 딱 맞아요.
덕분에 사용자는 비용과 속도, 그리고 똑똑함 사이에서 상황마다 저울질을 할 수 있게 됐어요. 간단한 요약은 낮음, 복잡한 설계는 높음. 같은 모델이라도 어떻게 쓰느냐에 따라 성격이 달라지는 셈이죠.
'생각하기'가 기본으로 켜졌어요
오퍼스 5는 답을 내기 전에 속으로 단계를 밟아 추론하는 '싱킹(thinking)'이 기본으로 켜져 있어요. 재미있는 건, 노력을 '높음' 이상으로 둔 상태에서 이 생각하기를 끄려 하면 오류(400 에러)가 난다는 점입니다. 어려운 문제를 시키면서 생각을 못 하게 막는 건 허용하지 않겠다는, 설계자의 고집이 담긴 장치예요.
사람도 어려운 문제를 풀 땐 머릿속으로 이리저리 굴려보잖아요. AI에게 그 '굴려보는 시간'을 강제로 확보해주는 것이라 보시면 됩니다.
100만 토큰 컨텍스트 — 이게 왜 좋은가요
오퍼스 5는 한 번에 100만 토큰까지 기억하며 대화할 수 있어요. 토큰 100만이면 대략 두꺼운 책 여러 권 분량입니다. 이걸 '컨텍스트 창(context window)'이라고 부르는데, AI가 한 번에 붙잡고 있을 수 있는 '작업 책상의 크기'라고 생각하면 쉬워요.
책상이 크면 서류를 잔뜩 펼쳐놓고 앞뒤를 비교하며 일할 수 있죠. 긴 계약서 전체, 방대한 코드 저장소, 두꺼운 보고서를 통째로 넣고 '이 안에서 모순을 찾아줘' 같은 일을 시킬 수 있는 이유가 이 큰 책상 덕분입니다.

같은 집안 비교 — 오퍼스 5 vs 페이블 5
독립 지표인 '인텔리전스 인덱스'에서 오퍼스 5는 61점으로, 페이블 5(60점)를 아주 근소하게 앞섰어요. 종합 점수만 보면 오퍼스 5가 미세하게 위인 셈이죠. 하지만 앤트로픽 스스로 밝히길, 일부 영역에서는 여전히 페이블 5가 앞선다고 해요.
정리하면, 오퍼스 5는 '페이블 5를 완전히 대체'한다기보다 '거의 같은 실력을 훨씬 싼 값에' 제공하는 자리에 있습니다. 최고의 정밀함이 필요한 일은 페이블 5, 가성비가 중요한 대량 작업은 오퍼스 5 — 이렇게 나눠 쓰는 그림이 그려져요.
경쟁 비교 — 오퍼스 5 vs GPT-5.6
같은 달 오픈AI는 GPT-5.6을 루나·테라·솔 세 등급으로 내놨어요. 가격은 각각 입력·출력 기준 1/6, 2.5/15, 5/30달러로, 최상위 '솔'이 오퍼스 5와 비슷한 값대예요. 인텔리전스 인덱스에서는 GPT-5.6 솔이 59점으로 오퍼스 5(61)와 페이블 5(60)를 근소하게 뒤따랐습니다.
둘 다 100만 토큰 컨텍스트를 지원하니, 이제 '누가 더 크냐'보다 '누가 특정 작업에서 더 정확하고 싸냐'의 싸움으로 넘어간 모습이에요.
경쟁 비교 — 오퍼스 5 vs 제미나이 3.5
구글의 제미나이(Gemini) 3.5 계열은 방대한 문서 처리와 멀티모달(이미지·영상 등 여러 형식) 작업에서 강점을 보여왔어요. 코딩 정밀도에서는 클로드 계열이, 대용량 멀티모달에서는 제미나이가 앞선다는 평가가 많습니다.
업계에서 자주 나오는 한 줄 요약이 있어요. "이제 단 하나의 최고 모델은 없다. 주어진 일마다 최선의 모델이 있을 뿐이다." 오퍼스 5의 등장은 이 '용도별 최적화' 시대를 더 뚜렷하게 만들었습니다.
얼마나 덜 헷갈리나 — 할루시네이션
AI가 그럴듯한 거짓말을 지어내는 걸 '할루시네이션(환각)'이라고 해요. 독립 벤치마크 AA-Omniscience에서 클로드 계열은 환각률 36.18%로, GPT-5.5(85.53%)나 제미나이(49.87%)보다 눈에 띄게 낮았어요. 낮을수록 좋은 지표라, 클로드 계열이 '덜 지어낸다'는 뜻이에요.
다만 36%도 결코 낮은 수치는 아니에요. 여전히 세 번에 한 번꼴로 틀린 정보를 자신 있게 말할 수 있다는 뜻이니, 중요한 사실은 사람이 꼭 확인해야 한다는 원칙은 그대로랍니다.

가장 안전하다고 주장하는 모델
앤트로픽은 오퍼스 5를 자사 역사상 '가장 잘 정렬된(aligned)' 모델이라고 소개했어요. 자동 안전 감사에서 기만적 행동 비율이 가장 낮게 나왔다고 합니다. '정렬'이란 AI가 사람의 의도와 어긋나지 않게 행동하도록 맞추는 작업을 말해요.
AI가 똑똑해질수록 '똑똑함'만큼 '믿을 수 있음'도 중요해지죠. 성능 자랑과 함께 안전성을 나란히 내세운 건, 기업 고객에게 '맡겨도 된다'는 신뢰를 주려는 전략으로도 읽힙니다.
오퍼스 5가 못하는 것도 있어요
앤트로픽은 솔직하게 한계도 인정했어요. 오퍼스 5는 일부 벤치마크에서 여전히 페이블 5에 뒤지고, 공격적 사이버보안이나 장시간 생물학 연구 같은 특수 영역에서는 자사의 다른 모델 '미토스 5(Mythos 5)'보다 못하다고 밝혔습니다.
이건 오히려 건강한 신호예요. 하나의 모델이 모든 걸 다 잘하는 게 아니라, 용도에 따라 강점이 갈린다는 걸 만든 쪽에서 인정한 거니까요. 마케팅 문구를 곧이곧대로 믿기보다, '내 일에 맞는지'를 따져보는 태도가 필요합니다.
[실제 사례] 해커뉴스가 뒤집힌 밤
출시 직후 해커뉴스 반응은 즉각적이고 폭발적이었어요. 몇 시간 만에 1,378포인트, 댓글 746개. 개발자 커뮤니티에서 이 정도 수치는 '올해의 사건' 급 화제라는 뜻입니다. 댓글에서 가장 많이 언급된 게 바로 ARC-AGI-3의 3배 격차였어요.
흥미로운 지점은 '가격을 안 올렸다'는 사실이 성능만큼이나 크게 회자됐다는 거예요. 보통 성능이 오르면 값도 오르는 게 상식인데, 오퍼스 급 가격을 그대로 두고 성능을 끌어올린 게 이례적이라 다들 놀란 거죠.
[실제 사례] 개발자와 기업은 어떻게 쓰나
오퍼스 5가 특히 강한 코딩·컴퓨터 조작 능력은 곧바로 실무로 이어져요. 코드 저장소 전체를 넣고 버그를 찾아 고치게 하거나, 여러 단계를 거치는 자동화 업무를 맡기는 식이죠. 100만 토큰 책상 덕분에 프로젝트 전체 맥락을 놓치지 않는 게 강점입니다.
기업 입장에서는 '반값'이 결정타예요. 앤트로픽과 경쟁사들이 노리는 건 소비자보다 훨씬 큰돈을 쓰는 기업 고객이거든요. 오퍼스 급 가격을 유지하면서 페이블에 근접한 성능을 낸다는 건, 다음 프론티어 모델을 준비하는 모든 경쟁사에게 가격 압박을 거는 카드가 됩니다.

[실제 사례] 두 달에 네 번째 모델 — 앤트로픽의 질주
더 놀라운 맥락이 있어요. 오퍼스 5는 앤트로픽이 '두 달 만에 내놓은 네 번째 모델'입니다. 업계 전체가 유례없는 속도로 모델을 쏟아내고 있어, 한 추적 사이트는 주요 기업들의 모델 출시가 335건을 넘었다고 집계했어요.
몇 달 전만 해도 최첨단이던 능력이 이제는 기본값이 되어버리는 시대예요. 소비자에겐 반가운 일이지만, 만드는 쪽에겐 잠시도 쉴 수 없는 소모전이기도 합니다. 오퍼스 5의 '반값 전략'은 이 소모전에서 가격을 무기로 꺼내 든 한 수라고 볼 수 있어요.
핵심 정리
오늘 이야기를 짧게 모아볼게요. 첫째, 클로드 오퍼스 5는 2026년 7월 24일 출시돼 추상 추론 시험 ARC-AGI-3에서 2등의 세 배(30.2%)를 받으며 화제가 됐어요. 둘째, 성능은 플래그십 페이블 5에 근접하는데 가격은 절반(입력 100만 토큰당 5달러)이라, 기업 고객을 겨냥한 '가성비 최상위' 카드입니다.
셋째, 노력 다이얼·기본 싱킹·100만 토큰 컨텍스트로 에이전틱(스스로 일을 끝내는) 작업에 특히 강해요. 넷째, 그러면서도 환각률이 경쟁사보다 낮고 안전성을 앞세웠지만, 일부 영역에선 페이블 5나 미토스 5에 뒤지는 한계도 솔직히 인정했습니다. 결론은 한 줄이에요. 이제 '가장 똑똑한 하나'가 아니라 '내 일에 맞는 최선'을 고르는 시대, 그 흐름을 오퍼스 5가 가격으로 한 번 더 세게 밀어붙였습니다.
여러분은 어떤 AI 모델을 쓰고 계세요? 성능과 가격, 둘 중 무엇을 더 중요하게 보시나요? 오퍼스 5의 '반값 전략'이 실제로 판을 바꿀지, 댓글에서 함께 이야기 나눠요. 이런 AI 소식이 유용하셨다면 다음 글도 놓치지 마세요!
출처
1. TechCrunch — Anthropic launches Opus 5: https://techcrunch.com/2026/07/24/anthropic-launches-opus-5/
2. MarkTechPost — Meet the New Claude Opus 5: https://www.marktechpost.com/2026/07/24/meet-the-new-claude-opus-5-frontier-class-agentic-coding-and-computer-use-at-unchanged-opus-pricing/
3. Codersera — Claude Opus 5 Benchmarks Explained: https://codersera.com/blog/claude-opus-5-benchmarks-explained-2026/
4. The Next Web — Anthropic launches Claude Opus 5: https://thenextweb.com/news/anthropic-claude-opus-5-launch-frontier-bench-coding
5. Technology.org — Anthropic Claude Opus 5 launch, half price: https://www.technology.org/2026/07/27/anthropic-claude-opus-5-launch-half-price/
6. Kie.ai — Claude Opus 5 vs GPT-5.6: https://kie.ai/blog/claude-opus-5-vs-gpt
7. Fenxi — GPT-5.5 vs Gemini 3.5 vs Fable 5: https://fenxi.fr/en/blog/gpt-5-5-vs-gemini-3-5-vs-fable-5-which-ai-model-should-you-pick-in-2026/