'반값에 최정상급' Claude Opus 5 공개 — 같은 값에 훨씬 똑똑해진 앤트로픽 새 모델 완전정리
반값에 최정상급? — Claude Opus 5가 던진 도발적인 질문
만약 누군가 "성능은 지금까지 나온 최고급 모델에 거의 맞먹는데, 값은 절반"이라고 말한다면 어떠세요? 보통은 "그럴 리가"라며 의심부터 들죠. 그런데 2026년 7월 24일, 앤트로픽(Anthropic)이 정확히 그 문장을 들고 나왔습니다. 새 모델 Claude Opus 5가 공개됐거든요.
더 놀라운 건 가격입니다. 성능은 크게 올랐는데, 입력·출력 요금은 이전 세대인 Opus 4.8과 완전히 똑같이 유지됐어요. "성능이 오르면 값도 오른다"는 그동안의 공식을 정면으로 깨버린 셈이죠. 오늘은 이 모델이 대체 무엇이고, 왜 업계가 술렁이는지 하나하나 뜯어보겠습니다.
Claude Opus 5, 한 줄로 정리하면
Claude Opus 5는 앤트로픽의 최신 '플래그십(최상위)' AI 모델입니다. 코딩, 과학 연구, 그리고 스스로 여러 단계를 밟아 일을 처리하는 '에이전트(agent)' 작업에 특히 강하도록 만들어졌어요. 쉽게 비유하면, 혼자서 며칠짜리 프로젝트를 붙잡고 끝까지 물고 늘어지는 성실한 신입이 갑자기 10년 차 베테랑으로 진화한 느낌입니다.
이번 모델은 기존 Opus 4.8을 대체하며, API에서는 claude-opus-5라는 이름으로 부를 수 있습니다. 유료 요금제인 Claude Max에서는 이제 이 모델이 기본값으로 깔립니다.
'Honeycomb(벌집)'이라는 코드네임의 정체
사실 이 모델은 정식 발표 며칠 전부터 커뮤니티에서 화제였어요. 'Honeycomb'이라는 코드네임과 1M(100만) 토큰 컨텍스트, 그리고 'xhigh'라는 초강력 추론 모드가 유출되면서 "곧 Opus 5가 나온다"는 소문이 파다했거든요. 당시만 해도 모델 ID도, 가격표도, 시스템 카드도 없어서 반신반의하는 분위기였습니다.
그런데 7월 24일, 그 소문이 현실이 됐습니다. 벌집(Honeycomb)이라는 이름처럼, 수많은 작은 작업들을 벌집의 방처럼 촘촘하게 관리하며 처리하는 모델이라는 인상을 주죠.
가장 큰 뉴스: 가격은 그대로, 성능은 껑충
이번 발표의 핵심은 딱 하나로 요약됩니다. "같은 값에 훨씬 더 좋은 두뇌."
앤트로픽은 Opus 5를 자사 최상위 모델인 Fable 5의 성능에 근접하면서도, 비용은 약 50% 저렴한 '가성비 대안'으로 포지셔닝했습니다. 최고급 스테이크 맛을 내는데 값은 등심 정도라고 생각하시면 됩니다. 많은 복잡한 작업에서 굳이 제일 비싼 모델을 쓰지 않아도 되는 선택지가 생긴 거예요.

벤치마크 뜯어보기 (1) — 추론의 최전선
숫자로 보면 도약의 폭이 확 와닿습니다. Opus 5는 어려운 추론 시험대인 Frontier-Bench v0.1에서 43.3%를 기록했는데, 이는 이전 Opus 4.8의 두 배가 넘는 점수예요. 또 다른 고난도 시험인 ARC-AGI-3에서는 30.2%를 받아, 차순위 모델의 약 3배에 달했습니다.
벤치마크 점수는 학교 시험 성적표 같은 거라, 절대적인 정답은 아니지만 '얼마나 어려운 문제까지 풀 수 있느냐'를 가늠하는 지표가 됩니다. 두 배, 세 배라는 숫자는 단순한 개선이 아니라 계단을 한 칸 올라섰다는 신호로 읽히죠.
벤치마크 뜯어보기 (2) — 코딩 실력
개발자들이 가장 주목하는 코딩 성능도 크게 올랐습니다. 실제 소프트웨어 버그를 고치는 능력을 평가하는 SWE-bench Pro 계열에서 Opus 5는 약 79~80%를 기록했어요. 같은 시험에서 Opus 4.8이 69.2%였던 걸 생각하면 큰 폭의 상승입니다.
더 까다로운 FrontierCode Diamond에서는 29.3%를 받았는데, Opus 4.8은 13.4%에 그쳤죠. 어려운 문제일수록 격차가 더 벌어진다는 점이 인상적입니다. 쉬운 문제야 누구나 풀지만, 진짜 실력은 어려운 문제에서 드러나니까요.
벤치마크 뜯어보기 (3) — 컴퓨터를 직접 다루는 능력
요즘 AI의 화두 중 하나는 '컴퓨터 사용(computer use)'입니다. 사람처럼 마우스를 움직이고 화면을 보며 프로그램을 조작하는 능력이죠. 이를 평가하는 OSWorld 2.0에서 Opus 5는 70.57%를 기록했습니다. Opus 4.8의 55.7%에서 크게 뛴 수치예요.
이건 단순히 글을 잘 쓰는 걸 넘어, AI가 실제 화면 속 버튼을 누르고 창을 옮기며 '일을 대신 해주는' 방향으로 진화하고 있다는 뜻입니다.
1M 토큰 컨텍스트, 이게 왜 대단할까
Opus 5는 100만 토큰이라는 거대한 '컨텍스트 창'을 갖췄습니다. 컨텍스트 창은 AI가 한 번에 기억하고 참고할 수 있는 정보의 양이에요. 토큰은 대략 단어 조각이라고 보시면 되는데, 100만 토큰이면 웬만한 장편소설 여러 권 분량입니다.
비유하자면, 예전 모델이 책상 위에 서류 몇 장만 펼쳐놓고 일했다면, 이제는 도서관 한 층을 통째로 펼쳐놓고 작업하는 셈이에요. 방대한 코드베이스나 긴 문서를 통째로 이해시켜야 하는 작업에서 특히 위력을 발휘합니다.
low/medium/high — '노력 토글'이라는 신박한 기능
이번 모델에는 재미있는 스위치가 하나 붙었습니다. 요청마다 low(저)/medium(중)/high(고)로 '생각의 강도'를 조절할 수 있는 노력 토글이에요.
간단한 질문에는 힘을 빼서 빠르고 저렴하게, 복잡한 문제에는 힘을 실어 깊게 고민하도록 시킬 수 있습니다. 마치 자동차의 에코 모드와 스포츠 모드처럼, 상황에 따라 비용과 성능을 내가 직접 저울질하는 거죠. 늘 최고 출력으로 달릴 필요가 없으니 비용 관리에 큰 도움이 됩니다.

Fable 5와의 관계 — '절반 가격'의 진짜 의미
앤트로픽의 라인업에서 Fable 5는 가장 비싸고 강력한 최상위 모델입니다. Opus 5의 입력 요금은 이 Fable 5의 절반 수준이에요. 그런데 성능은 여러 복잡한 작업에서 Fable 5에 근접합니다.
즉, "최고를 원하면 Fable 5, 하지만 대부분의 실무는 Opus 5로 충분하다"는 구도가 만들어진 거예요. 기업 입장에서는 비용을 절반으로 줄이면서 거의 같은 결과를 낼 수 있으니, 계산기를 두드릴 수밖에 없습니다.
경쟁 구도: GPT-5.6, Gemini와 나란히 놓고 보면
지금 최전선은 3파전입니다. 오픈AI의 GPT-5.6 계열, 구글의 Gemini 3.1 Pro, 그리고 앤트로픽의 Claude 라인이죠. 참고로 released 모델 기준으로 Opus 4.8은 SWE-bench Verified에서 88.6%, GPT-5.5는 88.7%로 엎치락뒤치락해 왔습니다.
Opus 5는 이 접전에 "같은 값, 더 나은 성능"이라는 카드를 던진 셈입니다. 성능 경쟁이 이제 '누가 더 똑똑하냐'를 넘어 '누가 더 싸게 똑똑하냐'로 옮겨가고 있다는 걸 보여주죠.
가격표 자세히 보기
Opus 5의 표준 요금은 입력 100만 토큰당 5달러, 출력 100만 토큰당 25달러입니다. 이는 Opus 4.8과 완전히 동일한 가격이에요. 참고로 Gemini 3.1 Pro는 입력 2달러·출력 12달러로 더 저렴하고, GPT-5.5는 입력 5달러·출력 30달러 수준이었습니다.
가격만 보면 Gemini가 가장 싸지만, '성능 대비 가격'을 따지면 Opus 5가 새로운 균형점을 제시했다는 평가가 나옵니다.
안전성 점수, 조용히 이룬 성과
화려한 성능 뒤에 가려지기 쉬운 부분이 안전성인데요. 앤트로픽의 자체 행동 감사에서 Opus 5는 '어긋난 행동(misaligned behavior)' 종합 점수 2.30을 받았습니다. 이는 최근 Claude 모델 중 가장 낮은 수치로, Opus 4.8·Sonnet 5·Fable 5보다도 안전하다는 뜻이에요.
점수가 낮을수록 좋은 이 지표에서 최고 기록을 세운 건, 성능과 안전을 동시에 잡으려는 노력이 반영된 결과로 볼 수 있습니다.

수백 개의 에이전트를 지휘하는 능력
Opus 5가 특히 빛나는 지점은 '대규모 에이전트 오케스트레이션'입니다. 하나의 큰 작업을 잘게 쪼개 수백 개의 백그라운드 에이전트에게 나눠주고, 그 결과를 조율하는 능력이죠.
지휘자 한 명이 수백 명의 연주자를 이끌어 하나의 교향곡을 완성하는 장면을 떠올려 보세요. Opus 5는 여기서 훨씬 나은 '설계 판단력(design judgment)'을 보여줬다고 합니다. 단순히 일을 나누는 걸 넘어, 어떻게 나눠야 전체가 조화롭게 굴러가는지를 안다는 거죠.
실제 사례 (1) — 개발자들의 첫 반응
출시 직후 개발자들의 반응은 대체로 긍정적이었습니다. 특히 "긴 호흡의 다단계 작업을 잘 붙든다"는 평가가 많았어요. 코드베이스를 깊이 이해하고, 복잡한 작업 중에도 맥락의 실을 놓치지 않으며, 기능 개발과 버그 수정에서 요구사항을 더 정확히 짚어낸다는 겁니다.
이전에는 사람이 잘게 쪼개서 시켜야 했던 일을, 이제는 통째로 던져줘도 알아서 처리하더라는 후기가 이어졌습니다.
실제 사례 (2) — 코드베이스를 통째로 뜯어고치다
한 사례에서는 Opus 5가 '기초 연구 어시스턴트(Fundamental Research Assistant)' 코드베이스 전반에 걸쳐 대규모 변경을 수행했다고 합니다. 작업 도중 사람이 주는 피드백에 그때그때 적응하면서요.
더 인상적인 건, 자신이 왜 그렇게 판단했는지를 이전 어떤 모델보다 명확하게 설명했다는 점입니다. 보통이라면 훨씬 작은 조각으로 쪼개서 맡겼을 법한 일을, 큰 덩어리째 소화해냈다는 후기예요. AI가 '왜'를 설명할 수 있다는 건, 결과를 믿고 맡기는 데 굉장히 중요한 요소죠.
실제 사례 (3) — Claude Max의 새 기본값
일반 사용자에게 가장 체감되는 변화는 이겁니다. Claude Max 요금제를 쓰는 분들은 이제 별도 설정 없이도 Opus 5를 기본으로 쓰게 됐어요. 구독료는 그대로인데 두뇌가 업그레이드된 셈이죠.
또한 컴퓨터 사용 능력이 좋아진 덕분에, 화면을 보고 클릭하며 반복 업무를 대신 처리하는 '디지털 비서'로서의 쓸모도 한 단계 올라갔습니다.

이 소식이 산업에 주는 신호 — '지능의 상품화'
Opus 5의 등장은 한 가지 큰 흐름을 보여줍니다. 바로 지능이 점점 싸지고 있다는 겁니다. 작년까지만 해도 최고급 성능은 최고급 가격을 요구했지만, 이제는 같은 값에 더 나은 성능이 당연해지고 있어요.
이건 마치 반도체가 매년 더 싸고 빨라지던 무어의 법칙을 떠올리게 합니다. AI 성능이 이런 속도로 저렴해지면, 지금은 비싸서 못 쓰던 아이디어들이 줄줄이 현실이 될 수 있죠.
한계와 주의할 점
물론 장밋빛만 있는 건 아닙니다. 벤치마크 점수가 높다고 실제 업무에서 항상 완벽한 건 아니에요. 여전히 AI는 그럴듯하게 틀린 답을 내놓기도 하고, 중요한 결정은 사람이 최종 검토해야 합니다.
또한 100만 토큰을 다 채워 쓰면 그만큼 비용도 커집니다. '노력 토글'이나 컨텍스트 크기를 상황에 맞게 조절하는 지혜가 필요해요. 강력한 도구일수록 쓰는 사람의 안목이 결과를 가릅니다.
그래서, 우리에게 무엇이 바뀔까
결국 핵심은 "더 좋은 AI를 더 싸게 쓸 수 있게 됐다"는 점입니다. 개발자라면 더 큰 작업을 한 번에 맡길 수 있고, 기업이라면 비용을 아끼면서 자동화의 폭을 넓힐 수 있어요. 일반 사용자에게는 더 똑똑한 비서가 같은 값에 손에 들어온 셈이고요.
무엇보다 이번 발표는 "성능이 오르면 값도 오른다"는 상식을 깨뜨렸다는 데 의미가 있습니다. 앞으로 경쟁사들도 가격 압박을 받을 수밖에 없고, 그 혜택은 결국 우리 사용자에게 돌아옵니다.
핵심 정리
오늘 내용을 짧게 정리해 볼게요. Claude Opus 5는 2026년 7월 24일 공개된 앤트로픽의 새 플래그십 모델로, 가격은 이전과 동일한데 성능은 크게 올랐습니다. Frontier-Bench·ARC-AGI-3·SWE-bench Pro·OSWorld 등 주요 시험에서 이전 세대를 크게 앞섰고, 최상위 Fable 5에 근접한 성능을 절반 값에 제공합니다.
1M 토큰 컨텍스트, low/medium/high 노력 토글, 대규모 에이전트 지휘 능력, 그리고 역대 최고 수준의 안전성 점수까지 갖췄어요. 한마디로 '같은 값에 더 똑똑한 두뇌'이며, 이는 AI 지능이 빠르게 저렴해지는 큰 흐름을 상징하는 사건입니다.

여러분의 생각은 어떠세요?
Opus 5의 '반값 최정상급' 전략, 여러분은 어떻게 보시나요? 실제로 코딩이나 업무에 써보셨다면 체감 성능이 어땠는지 댓글로 들려주세요. 가격 경쟁이 사용자에게 축복일지, 아니면 또 다른 함정이 숨어 있을지 — 여러분의 의견이 궁금합니다! 다음에도 따끈한 AI 소식으로 찾아올게요. 🐝
출처
- Anthropic — Introducing Claude Opus 5: https://www.anthropic.com/news/claude-opus-5
- MarkTechPost — Meet the New Claude Opus 5: https://www.marktechpost.com/2026/07/24/meet-the-new-claude-opus-5-frontier-class-agentic-coding-and-computer-use-at-unchanged-opus-pricing/
- MacRumors — Anthropic's New Claude Opus 5 Nearly Matches Fable 5 at Half the Cost: https://www.macrumors.com/2026/07/24/anthropic-opus-5/
- explainX — Claude Opus 5 Launch, Benchmarks, Price, Fast Mode: https://explainx.ai/blog/claude-opus-5-launch-july-2026
- Codersera — Claude Opus 5 Benchmarks Explained: https://codersera.com/blog/claude-opus-5-benchmarks-explained-2026/
- Vellum — Claude Opus 5 Benchmarks Explained: https://www.vellum.ai/blog/claude-opus-5-benchmarks-explained
- kie.ai — Claude Opus 5 vs GPT-5.6: 1M Context & Honeycomb: https://kie.ai/blog/claude-opus-5-vs-gpt
- CodeRabbit — Claude Opus 5 Benchmarks for AI Code Review: https://www.coderabbit.ai/blog/opus-5-model-review
협업문의 : kuroicode@gmail.com
블로그 : https://ghost-production-0ec2.up.railway.app/
홈페이지 : https://kuroicode-beep.github.io/svil-homepage/