클로드, “더 멍청해졌다”고 인정: GPT-5.5 출시 후 3가지 중대한 버그 드러나

클로드, “더 멍청해졌다”고 인정… GPT 5.5 출시 후 3가지 중대한 버그 드러나

바로 출시 무렵에 GPT-5.5, 클로드가 마침내 인정했다:

클로드, “점점 더 멍청해지고 있다”고 인정

네, 모델의 성능이 “떨어졌으며”, 모든 사용 한도가 초기화되었습니다.

한 달 넘게 부인해 오던 끝에, 정보 유출 버그에 대한 소식이 마침내 직접 인류학 그 자체:

  • 추론 수준이 조용히 “높음’에서 ”중간’으로 하향 조정되었다“
  • 캐싱 버그로 인해 매 턴마다 사고 흔적이 지워졌다
  • 25단어라는 프롬프트 제한이 출력 품질을 저하시켰다

이 세 가지 버그가 겹치면서 클로드의 전반적인 사용 경험이 크게 저하되었습니다.

다행히 경쟁사들이 딱 적절한 시점에 압박을 가해 주었습니다. “사용자를 교육”하려는 시도는 분명히 통하지 않을 것이 분명했습니다.

그래도 버그를 수정하는 건 언제나 좋은 일입니다. 다만… 타이밍이 좀 수상하네요. GPT-5.5가 출시되자마자, 갑자기 클로드가 “패배를 인정”하네요.”

5.5 버전이 디버깅에 도움이 되었나요?

다리오… GPT-5.5가 출시될 때 반전 장면을 연출하려고 일부러 클로드의 성능을 떨어뜨린 건 아니지?

클로드의 성능 저하의 원인으로 확인된 세 가지 버그

우선, 이번이 처음은 아닙니다.

작년 8월, 앤트로픽(Anthropic)은 오푸스(Opus) 4.0 및 4.1과 관련된 유사한 사후 분석을 발표하며, “모델의 품질을 저하시키려는 의도는 결코 없었다”고 밝힌 바 있습니다.”

이번 새로운 사후 분석의 제목은 “최근 세 가지 사안에 대한 사후 분석.”

“최근”이 핵심입니다 — 단순히 지금 이 순간만이 아니라, 지난 기간 전체를 의미합니다.

지역사회는 이미 그 사실을 눈치채고 있었다

클로드의 상태가 악화되고 있다는 점은 한동안 널리 논의되어 왔다.

10일여 전, AMD AI 부문 수석 이사인 스텔라 로렌조가 GitHub에 심층 감사 보고서를 게시했습니다:

AMD AI 부문 수석 이사인 스텔라 로렌조가 GitHub에 심층 감사 보고서를 게시했다
  • 6,852건의 대화
  • 17,871개의 추론 블록
  • 230,000회 이상의 도구 호출

조사 결과: 2월 이후 추론 깊이가 급격히 감소했다.

더 자세한 관찰 내용:

  • 클로드는 점점 빠져들기 시작했고 추론 루프
  • 점점 더 ~를 선택하게 되었다 가장 간단한 해결책, 올바른 것이 아닙니다

한편, BridgeMind의 BridgeBench 벤치마크 결과에 따르면 작품 4.6 정확도가 83.3%에서 68.3%로 하락했으며, 순위는 #2에서 #10으로 떨어졌다.

BridgeMind의 BridgeBench 벤치마크 결과에 따르면, Opus 4.6의 정확도는 83.3%에서 68.3%로 하락했으며, 순위는 #2에서 #10으로 떨어졌다.

비록 그 연구 방법이 나중에 비판을 받았지만, 그 주장은 여전히 통용되고 있다:

클로드가 점점 더 멍청해지고 있다.

사람들은 심지어 ‘~’라는 용어까지 만들어 냈는데 — AI에 의한 인플레이션 위장. 가격은 똑같은데, 제품 함량이 줄어든 거예요.

다시 말해, 사용자들은 마치 “어린이 세트’를 받는 듯한 느낌을 받았던 것이다.”

세 가지 버그에 대한 설명

추론 수준의 은밀한 저하

3월 4일, 클로드 코드의 채무 불이행 추론 수준 지연 문제에 대한 우려로 인해 “높음”에서 “중간”으로 하향 조정되었습니다.

하지만 UI에는 여전히 “높음”이라고 표시되어 있었다.”

사용자들은 최대 출력으로 사용하고 있다고 생각했지만, 실제로는 성능이 저하된 버전을 사용하고 있었던 것이다.

이 조치는 한 달 넘게 지속된 끝에 철회되었다.

대화를 오래 할수록 점점 더 멍청해진다

3월 26일, 캐싱 최적화 기능이 도입되었습니다:

  • 의도: 1시간 동안 활동이 없을 경우 기존 추론을 지우기
  • 실제: 버그로 인해 초기화되었습니다 매 턴마다

결과:

  • 클로드는 계속 일을 했지만, 자신의 목표를 잊어버렸다
  • 증상: 건망증, 말의 반복, 도구 사용의 무질서

더 나쁜 점은:

추론 결과가 끊임없이 지워지다 보니 캐시에 적중하는 경우가 전혀 없었고, 그 결과 토큰 사용량이 급증했다.

고치는 데 15일이 걸렸다.

단 한 줄의 프롬프트가 출력 품질을 망쳐버렸다

4월 16일, 시스템 지침이 추가되었습니다:

  • 도구 호출 사이에 최대 25단어
  • 최종 답변은 100단어로 제한됩니다.

영향:

  • Opus 4.6 및 4.7 둘 다 ~3% 성능이 떨어졌다
  • 4일 만에 이전 버전으로 되돌림

4월: 자초한 문제들의 연속

일정을 살펴보면, 4월은 단순히 버그 문제만 있었던 것이 아니라 일련의 의문스러운 조치들이 이어진 달이었습니다.

4월 4일 — 타사 도구 차단

Anthropic은 다음과 같은 도구들의 사용을 차단했습니다. OpenClaw Pro/Max 구독 이용 시.

계속 사용하고 싶으신가요? API 과금 방식으로 전환하세요.

4월 21일 — 조용히 이루어진 가격 변경

클로드 코드가 삭제되었습니다. Pro 요금제 페이지에서.

지원 문서가 다음에서 변경되었습니다:

  • “Pro 또는 Max” → “Max만”

논란이 일자, 성장 부문 책임자인 아몰 아바사레는 이것이 단지 2% A/B 테스트였을 뿐이라고 주장했다.

문제: 변경 사항이 사이트 전체에 적용되었습니다.

몇 시간 만에 원상복구되었습니다.

가격 책정의 현실

  • 프로: 월 $20 → 연 $240
  • 최대 5배: 월 $100 → 연 $1200 (5배 증가)
  • 최대 20배: 연간 $2400 (10배 증가)

중간 계층이 없다.

4월 23일 — 사후 분석과 “보상”

보상? 사용 한도를 초기화합니다.

일부 사용자들은 다음과 같이 지적했습니다:

이는 이미 Opus 4.7 릴리스 당시 발생했던 일입니다.

그러니까 이 “보상”은 기본적으로 그냥 평소와 같은 주기 초기화에 불과했던 셈입니다.

사용자들은 그 말을 믿지 않는다

반응은 엇갈리고 있다.

어떤 이들은 이렇게 말합니다:

  • 버그는 어쩔 수 없이 발생하기 마련입니다
  • 사후 분석은 투명합니다
  • 보리스 체르니가 해커뉴스에서 적극적으로 반응했다

다른 이들은 또 다른 문제에 주목하고 있다:

두 달 동안의 침묵

  • 공식적인 발표 없음
  • X에는 산발적인 댓글만 달렸습니다
  • 일관성 없는 메시지

“캐시 최적화”에 대한 의혹”

일각에서는 이 시점(캐시 만료 시점과 일치함)이 다음과 같은 점을 시사한다고 보고 있습니다:

지연 시간 최적화가 아니라 — 비용 절감입니다.

A/B 테스트에 대한 반발

서로 다른 사용자들이 아무런 알림 없이 각기 다른 제품 구성을 배정받았습니다.

신뢰가 또 한 번 타격을 입었다.

이주는 이미 진행 중입니다

해커 뉴스에서 눈에 띄는 한 가지 흥미로운 추세:

자신의 “이주 이야기”를 나누는 사람들.”

어떤 이들은 무의식적으로 ~로 바꿨다고 말했다 코덱스 지난 2월 — 이제 와서야 클로드의 쇠퇴가 그들을 그렇게 만들었을지도 모른다는 사실을 깨달았다.

일각에서는 GPT-5.4가 이미 Opus 4.6을 능가했다고 주장한다.

일부는 MiniMax를 보충제로 섭취하고 있습니다:

  • $40 → 5시간 주기당 4500건의 메시지
  • 추론 과정 전체 확인

풍경이 달라졌다

6개월 전만 해도 “코딩할 때는 클로드를 사용하자”는 의견이 거의 만장일치에 가까웠다.

지금:

  • 보도에 따르면 코덱스의 활성 사용자 수는 400만 명에 달한다고 한다
  • GPT-5.5는 코딩과 컴퓨터 조작에 중점을 둡니다.
  • OpenAI 직원들은 이를 심지어 “참모총장” 모델이라고 묘사하기도 합니다

클로드의 상태가 꼭 더 나빠진 것은 아니었다.

다른 선수들은 실력이 향상되었지만, 클로드는 가장 안 좋은 순간에 실수를 저질렀다.

창이 점점 작아지고 있다

Anthropic은 이제 다음을 수행할 수 있는 시간이 이전보다 더 부족해졌습니다:

  • 버그 수정
  • 신뢰를 다시 쌓다

한편:

  • GPT-5.5는 이미 출시되었습니다
  • DeepSeek V4 준비되었습니다

그리고 사람들은 기다리고 있습니다:

쌍둥이자리, 이제 네 차례야.

위로 스크롤