메인 칼럼 개발일지 작업물 연락처

Claude Opus 5 출시: 성능 향상 폭과 경쟁 모델 비용 분석

Opus 5의 성능 향상 폭과 GPT-5.6 Sol, Kimi K3 대비 가격 경쟁력을 분석합니다.

Anthropic이 2026년 7월 24일 Claude Opus 5를 공개했습니다. Opus 티어의 세대 교체급 개선 모델로, Fable 5라는 프론티어 모델에 근접한 지능을 절반 가격에 제공하는 것이 핵심 포지셔닝입니다. Claude Max의 새 기본 모델이자 Claude Pro에서 사용 가능한 가장 강력한 모델로 지정되었습니다.

코딩과 지식노동 성능 향상

Opus 5는 코딩과 지식노동 평가에서 신규 SOTA를 달성했습니다. Frontier-Bench v0.1에서 전 모델 중 최고 성능을 기록했으며, Opus 4.8 대비 2배 이상 향상된 수치입니다. 비용은 전 모델보다 더 낮추면서도 성능만 끌어올린 셈입니다.

CursorBench 최고 효율 설정에서는 Fable 5 최고점 대비 0.5% 이내 차이를 절반 비용으로 달성했습니다. 0.5%라는 격차는 실사용 환경에서 체감하기 어려운 수준입니다. 프론티어급 최상위 모델과 거의 동등한 코딩 능력을 절반 가격에 쓸 수 있다는 뜻이 됩니다.

지식노동 영역에서도 차이가 분명합니다. ARC-AGI 3에서 차순위 모델 대비 3배 점수를 기록했고, Zapier AutomationBench에서는 차순위 대비 약 1.5배 통과율을 보였습니다. 컴퓨터 사용 벤치마크인 OSWorld 2.0에서는 Fable 5 최고 기록을 3분의 1 수준 비용으로 상회했습니다.

과학 연구 분야에서도 전 평가 항목에서 Opus 4.8 대비 개선되었습니다. 유기화학에서 분광 데이터로 분자구조를 추론하는 과제에서 10.2%p가 올랐고, 단백질 서열-기능 예측에서는 7.7%p가 상승했습니다.

자체 검증과 반복 능력 강화

이번 모델의 가장 큰 특징은 자체 검증과 반복 능력이 크게 강화되었다는 점입니다. 시각 정보 없이 도면만으로 3D CAD 모델을 코드로 재구성하는 사례가 소개되었습니다. 커뮤니티 패치가 놓친 근본 원인을 찾아 수정하는 사례도 있습니다. 한 번의 추론으로 끝내지 않고 스스로 점검하며 결과를 다듬는 작업 스타일이 눈에 띕니다.

정렬 측면에서도 역대 가장 잘 된 모델로 평가되었습니다. 자체 행동 감사에서 Opus 4.8, Sonnet 5, Fable 5보다 기만 행동 비율이 낮고 비가역적 위험 행동 회피 능력도 최고 수준입니다.

반면 사이버보안 작업에서는 여전히 Mythos 5에 뒤처집니다. 취약점 탐지는 Mythos 5와 비슷한 수준이지만 익스플로잇 개발 능력은 크게 낮습니다. 의도적으로 사이버 작업에 대한 학습을 배제한 결과입니다. Fable 5 대비 사이버 분류기 개입이 약 85% 적었으며, 소스코드 취약점 탐지는 허용하되 바이너리 익스플로잇 작성은 막아놓았습니다.

API 사용 비용 비교

Opus 5의 API 가격은 입력 토큰 100만 개당 $5, 출력 토큰 100만 개당 $25입니다. GPT-5.6 Sol과 비교해 보면 입력 토큰 단가는 동일하지만 출력 토큰에서 차이가 납니다. Sol은 출력 토큰 100만 개당 $30로 Opus 5보다 20% 비쌉니다.

장문 처리 시 추가 요금 구조도 다릅니다. Sol은 입력이 272K 토큰을 넘으면 긴 컨텍스트 추가 요금이 붙습니다. Opus 5는 컨텍스트 창 1M 토큰을 제공하고, Sol은 1.05M 토큰을 제공합니다. 두 모델 모두 출력은 최대 128K 토큰까지 허용합니다. 대규모 코드베이스를 한 번에 처리하는 워크로드에서는 추가 요금이 붙지 않는 Opus 5가 유리할 수 있습니다.

Kimi K3와 비교하면 가격 차이가 더 큽니다. Kimi K3는 입력 토큰 100만 개당 $3, 출력 토큰 100만 개당 $15입니다. Opus 5 입력 단가의 60%, 출력 단가의 60% 수준입니다. 컨텍스트 창은 1,000K 토큰으로 Opus 5와 비슷한 규모를 제공합니다.

구분Claude Opus 5GPT-5.6 SolKimi K3
입력 토큰 / 1M$5$5$3
출력 토큰 / 1M$25$30$15
컨텍스트 창1M1.05M1,000K
최대 출력128K128K-
긴 컨텍스트 추가 요금없음272K 초과 시 부과-

Kimi K3는 가격 경쟁력만 놓고 보면 가장 저렴합니다. 다만 코딩 벤치마크 최고점이나 자체 검증 능력에서 Opus 5가 보여준 수준을 Kimi K3가 따라잡았는지는 별도로 확인해야 합니다. 가격이 절반 이하라는 점만으로 동일한 작업 품질을 보장하지는 않기 때문입니다.

GPT-5.6 Sol 대비 경쟁성

Opus 5와 GPT-5.6 Sol은 사양이 비슷하지만 모든 워크로드에서 같은 성능을 내지는 않습니다. Opus 5는 신중한 검토, 시각적 작업, 자기 점검이 중요한 장기 작업에서 더 강력한 출발점입니다. 반면 GPT-5.6 Sol은 터미널 중심 실행, 깊은 디버깅, OpenAI 네이티브 워크플로에 더 잘 맞습니다.

코딩 능력을 비교할 때는 첫 번째 코드 블록만 보지 말고 전체 실행 과정을 판단해야 합니다. 근본 원인 진단, 파일 수정, 테스트, 복구, 정리까지 모두 봐야 합니다. Opus 5는 자체 검증과 반복 능력이 강화되었기 때문에 긴 작업 흐름에서 후처리가 줄어드는 장점이 있습니다. Sol은 터미널 기반 디버깅 과정에서 더 빠른 실행을 보여주는 경향이 있습니다.

두 모델 중 선택하는 방법은 명확합니다. 같은 실제 작업, 같은 워크스페이스, 같은 도구, 같은 성공 기준을 적용해 보는 것입니다. 더 적은 후처리만 남기는 쪽이 승자입니다. 이론적 벤치마크 점수보다 실제 워크플로에서 남는 수정 분량이 더 정확한 판단 기준이 됩니다.

Kimi K3 대비 경쟁성

Kimi K3는 2026년 7월에 출시되어 Opus 5와 같은 시기에 공개된 모델입니다. 가격에서는 확실한 우위를 점하지만, 성능 차원에서는 고려할 점이 있습니다.

Opus 5가 Frontier-Bench에서 신규 SOTA를 달성하고 Opus 4.8 대비 2배 이상 향상된 코딩 성능을 보인 반면, Kimi K3의 벤치마크 성적은 제공된 자료에서 구체적으로 확인되지 않습니다. 컨텍스트 창 1,000K 토큰은 Opus 5의 1M 토큰과 실질적으로 같은 규모입니다.

가격 민감도가 높은 배치 작업이나 대량 토큰 소비가 필요한 파이프라인에서는 Kimi K3가 분명한 대안이 됩니다. 입력 $3, 출력 $15 단가는 반복 호출이 잦은 작업에서 누적 비용 차이를 크게 만듭니다. 다만 단일 작업의 정확도나 자체 검증 능력이 코딩 품질에 직결되는 경우, Opus 5의 SOTA급 성능과 정렬 안전성이 가격 차이를 상쇄할 수 있습니다.


Opus 5의 출시는 프론티어급 지능을 절반 가격에 제공하려는 시도입니다. Fable 5에 근접한 성능을 절반 비용으로, Opus 4.8 대비 2배 이상의 코딩 성능 향상을 달성했습니다. GPT-5.6 Sol과는 출력 토큰 단가와 긴 컨텍스트 추가 요금 구조에서 차이가 나며, Kimi K3와는 가격 대비 성능의 균형이 다른 지점에 있습니다. 작업 유형과 비용 구조를 매칭해 보면 어느 모델이 현재 워크로드에 더 적합한지 판단할 수 있습니다.

김현빈 Developer & Writer

기술, 포스팅 관련 질문, 프로젝트 협업 등 연락주시면 언제든지 회신 드립니다.