AI가 다음 AI를 만든다: Anthropic 재귀적 자기개선의 현재와 한계

2026-09-25 · AI · 쥬곰 편집부

#Anthropic#재귀적 자기개선#Claude#AI 연구#AI 안전#자동화

한 AI 시스템이 통제된 연구실에서 다음 세대 AI 코어를 조립하는 장면

AI가 코드를 쓰고 실험을 분석해 다음 모델 개발을 돕는 단계는 이미 시작됐다. Anthropic의 재귀적 자기개선 연구는 이를 ‘완성된 지능 폭발’로 선언하지 않는다. 대신 연구 조직 안에서 AI가 AI 개발 속도를 얼마나 높이고, 그 결과 더 강한 AI가 다음 개발을 다시 가속하는 순환이 어디까지 왔는지 내부 자료로 측정한다.

Anthropic은 연구 인력 130명을 조사했고, 2026년 3월 Mythos Preview 사용 시 산출량이 약 4배 늘었다는 응답 중앙값을 공개했다. 엔지니어의 분기당 코드 출하량은 2021~2025년 약 8배, 내부 Claude Code의 개방형 과제 성공률은 약 26%에서 91%로 상승했다고 설명한다. 수치는 크지만 대부분 회사 내부 측정이고, Claude가 Claude의 결과를 평가한 항목도 있다.

세 줄 요약

Anthropic이 공개한 지표

Anthropic이 공개한 지표: 지표, 회사 공개값, 해석상 한계

재귀적 자기개선이란 무엇인가

넓은 의미에서 AI가 AI 연구에 기여하는 순환이다. 모델이 학습 코드의 버그를 찾고, 데이터 필터를 만들고, 새로운 실험을 제안하고, 결과를 평가한다. 그 도움으로 더 강한 모델이 만들어지면 다음 연구 주기의 생산성이 다시 올라간다.

강한 표현은 AI가 인간 도움 없이 자신의 목표, 학습 데이터, 아키텍처, 컴퓨팅과 배포를 모두 통제하며 반복적으로 능력을 높이는 상황이다. Anthropic은 현재가 이 단계라고 주장하지 않는다. 사람은 여전히 어떤 문제를 풀지 정하고, 실험 자원을 배정하고, 위험을 평가하며 최종 모델을 출시한다.

따라서 지금 관찰되는 것은 ‘AI가 AI를 혼자 만든다’보다 ‘AI 연구 조직의 자동화율이 빠르게 높아진다’에 가깝다. 이 차이를 지키지 않으면 생산성 연구를 의식 있는 시스템의 자기 진화 이야기로 과장하게 된다.

코드와 실험, 평가, 개선된 모델이 안전 검문을 거치며 순환하는 구조

약 4배 산출량은 어떻게 측정했나

Anthropic은 Mythos Preview를 사용한 연구 인력에게 도움이 없을 때와 비교해 얼마나 많은 일을 했는지 물었다. 응답 중앙값은 약 4배였다. 연구자가 하루에 처리하는 분석, 코드, 실험 준비와 문서화가 크게 늘었다는 체감 지표다.

하지만 자기보고는 시간을 정확히 계측한 실험이 아니다. AI를 잘 활용하는 직원이 설문에 더 적극적일 수 있고, ‘산출량’의 정의도 논문 아이디어와 코드 수정에서 다르다. AI 도움으로 시도 수가 늘어도 검증하지 못한 결과가 쌓이면 과학적 생산성은 같은 비율로 늘지 않는다.

코드 출하량 8배 증가도 전부 모델 효과로 돌릴 수 없다. 2021년부터 2025년 사이 Anthropic의 인력, 내부 플랫폼, 테스트 자동화와 제품 규모가 모두 변했다. 중요한 신호는 방향과 속도이지, ‘Claude 하나가 개발자를 정확히 8명으로 만들었다’는 등식이 아니다.

성공률 26%에서 91%가 말하는 것

Anthropic은 Claude Code가 내부 개방형 과제를 완료하는 성공률이 약 26%에서 91%로 높아졌다고 설명한다. 정형화된 벤치마크보다 실제 저장소의 모호한 문제를 오래 추적하는 능력이 개선됐다는 주장이다.

다만 과제 선정과 채점이 회사 내부에 있고, 일부 평가는 Claude가 Claude의 결과를 판단한다. 같은 모델 계열이 선호하는 문체나 해결 방식을 높게 평가할 가능성이 있다. 외부 재현을 위해서는 과제 원본, 성공 기준, 사람 검토와 실패 사례 분포가 필요하다.

높은 내부 성공률은 운영 자동화를 가능하게 하지만 ‘연구의 91%를 자율 수행한다’는 뜻은 아니다. 코드 과제를 잘 푸는 것과 새로운 과학적 질문을 선택하고 틀린 전제를 버리는 것은 다른 능력이다.

인간 병목은 어디로 이동하나

코드 작성이 빨라질수록 다음 단계가 병목이 된다. 실험을 실행할 GPU, 정확한 평가 데이터, 결과를 해석할 전문가, 현실 세계 실험과 안전 승인이다. 모델이 하루에 수천 개 가설을 만들 수 있어도 사람이 모두 검증할 수 없다면 가치 있는 결과를 고르는 문제가 더 어려워진다.

인간 연구진이 거대한 자동화 연구 공장을 방향 설정과 검증 중심으로 감독하는 장면

인간의 역할은 직접 모든 코드를 쓰는 것에서 연구 목표와 평가 기준을 설계하고, 서로 독립적인 검증을 요구하며, 실패 비용을 판단하는 쪽으로 이동한다. 이 변화는 사람을 없애기보다 적은 수의 결정이 더 큰 계산 자원을 움직이게 만든다. 따라서 승인 권한과 책임 소재가 더 중요해진다.

과학·의학에서 기대할 수 있는 이점

AI가 문헌을 정리하고 실험 코드를 작성하며 결과를 비교하면 연구자는 더 많은 가설을 빠르게 버리거나 발전시킬 수 있다. 단백질 설계, 신약 후보, 재료 탐색과 수학처럼 검색 공간이 큰 분야에서 효과가 클 수 있다.

그러나 생물학·의학은 코드 테스트만으로 검증되지 않는다. 실험실 재현, 임상 안전성, 환자 다양성과 규제 절차가 필요하다. AI가 개발 속도를 높일수록 부정적 결과와 데이터 계보를 보존하고, 독립 연구자가 같은 결론을 얻는지 확인해야 한다.

왜 안전 문제가 더 어려워지는가

개발 속도가 안전 연구와 평가 설계 속도보다 빨라지면 새 모델을 이해하기 전에 다음 모델이 나온다. AI가 평가 코드와 안전 필터까지 작성하면, 같은 계열의 오류가 모델과 검사 체계에 동시에 들어갈 수 있다. 시스템이 의도적으로 속이지 않더라도 자동화된 조직 전체가 공통 가정을 공유하는 것이 위험하다.

따라서 재귀적 자기개선 시대의 안전은 모델 한 개의 답변 필터가 아니다. 학습 환경, 데이터, 평가 독립성, 샌드박스, 외부 감사, 출시 승인과 사고 보고를 함께 봐야 한다. AI가 만든 코드는 다른 모델과 사람이 교차 검토하고, 중요한 평가 세트는 개발 모델에서 분리해야 한다.

한국 기업과 연구기관의 적용 원칙

국내 조직은 ‘AI 개발자를 몇 명 대체하는가’보다 병목 지도를 먼저 그려야 한다. 코드 작성이 느린지, 테스트 환경 준비가 느린지, 보안 승인이나 데이터 접근이 느린지에 따라 효과가 달라진다. 자동 생성량만 늘리면 검토 대기열이 폭증할 수 있다.

실제 도입은 세 단계가 안전하다. 첫째, 비식별 내부 과제로 기준 성공률과 사람 검수 시간을 측정한다. 둘째, AI 생성 코드에 자동 테스트·정적 분석·의존성 검사를 의무화한다. 셋째, 모델 개발·평가·승인 권한을 한 시스템에 집중하지 않는다.

개인정보, 산업기술과 미공개 연구가 포함되면 외부 API 전송 범위와 로그 보존도 정해야 한다. 생산성이 4배라는 회사 조사보다 국내 데이터에서 오류 한 건의 비용이 얼마인지가 도입 결정을 좌우한다.

자주 묻는 질문

AI가 이미 스스로 다음 AI를 만들고 있나

부분적으로 돕고 있지만 완전히 자율적인 순환은 아니다. 코드·실험·평가를 가속하고 있으나 연구 방향, 컴퓨팅, 검증과 출시는 사람이 통제한다.

4배와 8배 수치를 그대로 믿어도 되나

내부 변화의 강한 신호로 볼 수 있지만 독립적인 인과 추정은 아니다. 자기보고, 조직 성장과 평가 편향을 함께 고려해야 한다.

가장 큰 위험은 무엇인가

AI 개발 속도가 인간 감독과 안전 평가 능력을 앞지르고, 같은 오류가 모델·코드·평가 체계에 동시에 퍼지는 것이다.

결론

재귀적 자기개선은 먼 미래의 단어이면서 이미 시작된 업무 변화다. 완전 자율 AI는 아니지만, AI가 다음 모델의 코드·실험·평가를 돕고 그 결과 더 강한 도구가 돌아오는 순환은 현실이 됐다.

Anthropic의 4배·8배·91% 수치는 속도를 보여 주지만 독립 검증된 보편 법칙은 아니다. 앞으로의 경쟁력은 더 많은 결과를 만드는 능력보다 무엇을 믿고 출시할지 검증하는 능력에서 갈릴 가능성이 크다.

출처와 이용 고지

Anthropic, Claude, OpenAI와 관련 명칭과 상표는 각 권리자에게 속한다. 이 글은 어느 회사의 후원·승인을 받은 공식 콘텐츠가 아니며 회사 내부 측정과 독립적으로 확정된 사실을 구분했다. 본문 이미지는 실제 연구 시설·제품 화면이 아닌 독립 편집 이미지다.

출처: Anthropic · 직접 캡처/제작 이미지 포함

이 포스팅은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.