코딩 1위를 내준 자리에 놓인 카드 — Claude Opus 4.8과 그 다음의 청구서

4월 어느 아침, 한국의 한 개발자가 클로드 코드를 닫았다. 같은 작업인데 카드 명세서에 찍힌 청구액이 부쩍 늘어 있었다. 그가 처음 켠 건 코덱스(Codex) 창이었다. 한 달 남짓 뒤, 모니터에 알림 하나가 떴다. 앤트로픽(Anthropic)이 새 모델 Claude Opus 4.8을 공개했다는 소식이었다.

발표문을 열어보면 첫 화면이 묘하다. 모델 카드의 무게중심이 코딩 성능이 아니라 한 단어에 쏠려 있다. ‘정직성(honesty)’이다. 더 빠른 모델도, 더 똑똑한 모델도 아니다. 더 솔직한 모델이라는 것이 5월의 메시지다. 어제 카드 명세서를 보고 떠난 그 개발자가 받기엔 의외의 키워드다.

코딩 1위를 GPT-5.5에 내준 회사가 꺼낸 새 카드

한국 개발자가 4월에 클로드를 떠난 이유는 단순하지 않다. 두 배에 가까워진 카드 명세서가 직접 동기였다면, 그 한 달 동안 누적된 신호가 배경이었다. GPT-5.5가 SWE-bench 같은 주요 코딩 벤치마크에서 앞서갔고, 오픈AI(OpenAI)의 코드 도구 코덱스가 클로드 코드 헤비 유저들을 빠르게 끌어갔다. IT 매체 요즘IT는 그 한 달을 “주도권을 내준 시기”로 정리했다. 시리즈 [알파고10년 기획-4]가 추적한 다섯 가지 회수 신호가 같은 시기에 한국 사용자의 카드에 도착했다.

그러니 5월의 새 모델이 코딩 성능 1위 탈환을 외쳐도 이상하지 않았을 자리에서, 앤트로픽은 다른 카드를 꺼냈다. 시스템 카드의 평가에 따르면 4.8은 자신이 쓴 코드의 결함을 지적 없이 통과시킬 확률이 직전 모델보다 약 4배 낮다. 사용자가 잘했다고 거짓 칭찬을 해도 결함을 짚고, 모르는 것을 모른다고 말한다. 이 진화는 환영할 만하다.

다만 카드의 위치가 흥미롭다. 가장 빠른 AI도, 가장 똑똑한 AI도 아니다. ‘가장 믿을 수 있는 AI’다. AI 모델은 셀 수 없이 많지만 환각이 적고 자기 한계를 솔직히 말하는 모델이라는 자리는 아직 비어 있다. 앤트로픽이 그 자리에 깃발을 꽂으려 한다. 코딩 1위 자리에서 밀린 회사가 시장 포지셔닝을 한 칸 옆으로 옮긴 사건이다.

정직성을 말하는 발표문이 정직하지 않은 자리

다만 발표문 자체가 같은 정직성으로 쓰여 있는지는 별개 문제다. 4.6 출시 때 13개, 4.7 때 12개였던 비교 벤치마크 개수가 4.8에서는 6개로 줄었다. 이전 모델들이 거의 매번 등장시켰던 SWE-bench를 포함한 코딩 벤치마크 일부가 이번에는 빠졌다. 해커뉴스(Hacker News)의 한 사용자는 누락 패턴을 짚으며 “1위라고 발표할 수 있는 항목만 보여주려는 의도가 아니라면 설명되지 않는다”고 적었다.

더 묵직한 단서는 측정 도구에서 나왔다. AI 모델 평가 사이트 한 곳의 측정에 따르면 4.8은 같은 작업을 마치는 데 4.7보다 토큰을 두 배 가까이 쓴다. 단가는 동결됐지만 실제 청구서는 두 배가 된다는 뜻이다. 출시 당일 한 한국 개발자는 “프로 사용량이 10분 만에 다 녹아버렸다”고 적었다. 어제 카드 명세서를 보고 떠난 사람의 손에 새 모델이 들어와도, 청구서의 무게는 줄어들 기색이 없다.

한국 사용자에게 진짜 가격은 어디 적혀 있나

이 지점이 한국 사용자가 잡아야 할 실용적인 단서다. 앤트로픽이 가격을 동결했다고 발표할 때 봐야 할 숫자는 입력 100만 토큰당 5달러나 출력 25달러가 아니다. 같은 작업을 마치는 데 모델이 평균 몇 개의 토큰을 쓰느냐다. 그 수치는 발표문에 없다. 출시 1~2주가 지나 사용자 측정이 누적될 때야 윤곽이 드러난다.

시리즈 4편이 이미 같은 구조를 짚었다. 4월의 토크나이저 변경 때 단가는 그대로였지만 같은 입력이 더 많은 토큰으로 환산되면서 청구서가 1.5배까지 늘었던 사건이다. 5월의 4.8 출시도 같은 흐름의 연장이라면, 한국 사용자가 다가올 카드 명세서에서 답을 받아 든다. 그래서 4.8을 쓰는 동안 자기 토큰 소비를 기록해두는 일이 의외로 중요하다. 같은 작업을 4.7과 4.8에서 한 번씩 돌려보고 토큰 수를 비교하는 단순한 기록 한 줄이, 다음 청구서의 진짜 가격을 미리 알려준다.

빠른 출시 주기는 누구의 시계인가

4.6, 4.7, 4.8이 모두 한 달 남짓 간격으로 잇따라 나왔다. 사용자 입장에서는 새 기능이 자주 도착하는 모양새다. 그런데 같은 주기를 다른 시선으로 보면 한 분기 매출 지표를 맞추기 위한 출시 일정으로도 읽힌다.

4.8 발표문 마지막에 적힌 관련 콘텐츠 첫 줄이 단서를 흘렸다. “앤트로픽 시리즈 H 라운드 650억 달러 모금, 포스트 머니 평가 9,650억 달러”였다. 새 모델 출시가 기술 진보의 주기인 동시에 IPO를 앞둔 회사의 분기 보고서 데이터 입력 시점이라는 게 우연이 아니다. 노력 제어(effort control)와 동적 워크플로(dynamic workflows) 같은 새 기능은 사용자 편의처럼 포장되지만, 한편으로는 비용·마진·연간 반복 매출을 조율하는 손잡이다. 사용자가 매번 새 버전으로 갈아타면서도 “정말 좋아졌는지 모르겠다”는 피로가 누적되면, 빠른 출시 주기는 신뢰의 자산이 아니라 피로의 원천이 된다.

새 카드를 받아들이되, 그 뒷면도 본다

시리즈 [알파고10년 기획-5]가 마무리한 자세는 단순했다. 변화에 뒤쳐지지도, 한 도구에 종속되지도 않는다. 5월의 4.8 출시 앞에서 그 자세가 다시 시험대에 오른다.

코딩 작업이 클로드 코드에 묶여 있는 한국 개발자라면 4.8의 동적 워크플로는 환영할 진보다. 코덱스의 /goal 기능을 한 발 넘어선 설계로, 단일 세션에서 수십에서 수백 개의 서브 에이전트를 알아서 오케스트레이션한다. 4월에 떠난 사람을 다시 끌어올 단단한 카드다. 그러나 그 환영 옆에 한 가지 메모를 같이 적어둘 만하다. 정직성이라는 새 카드를 받아들이되, 그 카드의 뒷면이 IPO 분기 보고서일 가능성을 함께 본다.

답은 발표문이 아니라 다음 카드 명세서가 알려준다. 4.8이 같은 작업에 몇 개의 토큰을 쓰는지, 5월에 받은 약관 변경 메일이 다가올 청구서를 어떻게 바꾸는지, 그 수치 한 줄이 새 카드의 진짜 가격이다. 그때까지 한국 사용자가 할 수 있는 가장 합리적인 행동은 한 가지로 좁혀진다. 자기 토큰 소비를 기록해두고, 4.7과 4.8을 비교 가능한 상태로 만들어두는 것. 어제 카드 명세서를 보고 클로드 코드를 닫았던 그 개발자가 한 달 뒤 같은 결정을 다시 내릴지 아닐지는, 그 기록이 답한다.

본 콘텐츠는 검색 및 뉴스, 보고서 등 공개된 다양한 정보를 바탕으로 작성한 전문가적 견해이며, 실제 비즈니스 의사결정이나 실행 시에는 반드시 해당 분야 전문가의 자문을 구하시기 바랍니다.

참고자료

  • Anthropic, “Introducing Claude Opus 4.8”, 2026.05.28
  • GeekNews(news.hada.io), “Anthropic, Claude Opus 4.8 출시” 및 해커뉴스(Hacker News) 사용자 반응 번역, 2026.05.29
  • 요즘IT(yozm.wishket.com), “Opus 4.8 등장: 클로드는 빼앗긴 주도권을 찾아올까?”, 2026.05.29
  • aibenchy.com, Claude Opus 4.7·4.8 토큰 소비 비교 측정, 2026.05.29

댓글 남기기