Claude가 생명과학 AI 30개를 최적화했다, 평균 4배 가속의 의미

2026-09-26 · AI · 쥬곰 편집부

#Anthropic#Claude#생명과학 AI#단백질 설계#GPU 최적화#FlashPairformer

여러 생체분자 예측 모델이 하나의 AI 최적화 과정을 거쳐 빠르게 실행되는 연구 환경

Anthropic이 Claude로 생명과학용 오픈소스 AI 모델 30개 이상을 4주가 채 되지 않는 기간에 최적화했다고 발표했다. 회사 측 측정에서 최소한의 정밀도 감소를 허용한 작업은 평균 약 4배 빨라졌고, 동일한 출력을 유지하는 조건에서도 거의 2배에 가까운 향상이 보고됐다.

이 결과가 의미 있는 이유는 Claude가 단백질 구조 하나를 예측했다는 데 있지 않다. 서로 구조가 다른 수십 개의 과학 모델을 읽고, 병목 코드를 찾아 GPU 커널과 메모리 사용을 바꾸고, 결과가 원래 과학적 성능을 유지하는지 시험하는 연구 엔지니어 역할을 수행했다는 주장이다.

다만 숫자를 그대로 범용 성능으로 확대하면 안 된다. 결과는 Anthropic의 내부 연구 모델과 자체 평가에서 나온 것이며, 일부 고속 모드는 정밀도를 조금 양보한다. 7만 토큰이 넘는 초대형 분자 시스템은 실행에는 성공했지만 구조 예측에는 실패했다.

세 줄 요약

핵심 수치와 의미

핵심 수치와 의미: 항목, Anthropic 발표 수치, 해석할 때 주의할 점

Claude는 무엇을 최적화했나

Anthropic의 공식 연구 발표에 따르면 대상에는 생체분자 구조 예측, 단백질 설계, 단백질 언어 모델과 유전체학 모델이 포함됐다. 서로 다른 아키텍처를 사용하기 때문에 하나의 설정값을 바꿔 모두 빨라진 것이 아니다.

Claude는 반복 계산을 캐시하고, 실제로는 일정한 값을 내는 불필요한 분기를 제거하고, 모델별 병목을 수정했다. 연구는 생체분자 모델링 경험은 있지만 추론 최적화나 GPU 커널 엔지니어링 경험은 없던 Anthropic 기술진 두 명의 감독 아래 진행됐다.

이 구성이 중요한 이유는 완전 무인 자동화를 뜻하지 않기 때문이다. Claude가 코드를 탐색하고 최적화안을 만들었지만, 사람은 목표를 정하고 성능과 정확도를 검토하며 어떤 변경을 받아들일지 결정했다.

FlashPairformer가 겨냥한 병목

단백질 구조 예측 모델은 아미노산이나 분자 요소 두 개의 관계를 표현하는 Pairformer 계열 연산을 많이 사용한다. 특히 triangle attention과 triangle multiplication은 세 요소의 관계를 계산해 3차원 기하를 파악하는 데 도움을 주지만, 시스템이 커질수록 시간과 메모리 요구량이 빠르게 증가한다.

Anthropic은 Claude와 함께 이 연산을 위한 커스텀 GPU 커널 묶음 FlashPairformer를 개발했다고 밝혔다. 회사 측 비교에서 triangle attention은 기존 기준보다 평균 2.72.9배, triangle multiplication은 모델 구성에 따라 1.73.2배 빠르게 실행됐다.

커널 하나의 가속과 전체 모델의 가속은 같은 숫자가 아니다. 데이터 준비, 다른 네트워크 층과 후처리가 남아 있기 때문이다. Anthropic은 커널 개선과 모델별 수정을 합쳐 구조 예측 모델에서 평균 약 4배 향상을 보고했으며, 각 모델의 하위 작업 성능이 유지되는지 별도로 확인했다고 설명한다.

4배와 ‘동일 출력’의 차이

가장 큰 약 4배 수치는 원래 결과와 통계적으로 비슷한 과학적 품질을 유지하면서 일부 수치 정밀도나 실행 방식을 조정한 고속 모드의 평균이다. 완전히 동일한 출력을 요구하면 개선 폭은 줄어든다.

Anthropic의 전체 요약은 동일 출력 조건에서 거의 2배라고 표현하지만, 구조 예측 모델만 모은 설명에서는 약 1.6배로 제시한다. 기사를 읽을 때는 4배가 모든 모델·모든 입력·완전히 동일한 출력에서 보장되는 숫자가 아니라는 점을 구분해야 한다.

이 차이는 과학 계산에서 중요하다. 탐색 단계에서는 약간의 정밀도 차이를 허용하고 많은 후보를 빠르게 거르는 것이 유리할 수 있다. 규제 제출이나 최종 결과 재현 단계에서는 완전히 결정적인 출력과 보수적인 설정이 더 중요할 수 있다.

여러 GPU 노드가 필요한 기존 흐름과 단일 노드 최적화·사람 검증을 거치는 흐름의 비교

단일 GPU 노드에서 더 큰 분자를 다룬 Big 모드

생체분자 시스템이 커지면 Pairformer 계열 연산의 시간과 메모리 비용이 급격히 증가한다. Anthropic은 Claude가 만든 저메모리 Big 모드로 1만 토큰이 넘는 분자 시스템을 단일 NVIDIA GPU 노드에서 정확하게 예측했다고 밝혔다. 여기서 토큰은 아미노산, 핵산과 작은 분자·이온의 원자를 포함하는 생체분자 표현 단위다.

회사는 인간 미토콘드리아 복합체 I, TRiC 샤페론, 프로테아좀과 세균 리보솜 등 큰 구조의 예측이 실험 구조와 가깝게 나왔다고 설명한다. 이전에는 여러 GPU 노드가 필요했던 규모를 한 노드로 낮추면 중소 연구실의 접근성이 좋아질 수 있다.

그러나 극한 시험에서는 명확한 한계가 드러났다. 단일 8-GPU B300 노드에서 3만~7만 토큰이 넘는 바이러스 캡시드와 단백질 구획을 실행하는 데는 성공했지만, 예측 구조가 붕괴해 정확하지 않았다. 메모리에 들어가고 프로그램이 끝까지 실행된다는 사실과 과학적으로 올바른 결과가 나온다는 사실은 다르다.

단백질 설계 비용이 줄었다는 주장의 범위

Anthropic의 이전 단백질 설계 실험은 표적 하나당 최대 1만 달러, 약 2,500시간의 NVIDIA H100 GPU 시간을 사용할 수 있었다. 이번 단순화된 흐름은 하나의 Claude 모델, NVIDIA H200 한 대와 24시간을 사용했다.

16개 표적에서 계산한 in silico 결합 점수는 이전 캠페인과 비슷했고, 회사 추산 GPU와 토큰 비용 합계는 약 150달러였다. GPU 시간은 약 100분의 1 수준이라는 설명이다.

하지만 in silico 점수가 실제 결합 실험을 대신하지는 않는다. 컴퓨터상 점수가 좋은 단백질이 실험에서 안정적으로 만들어지고 원하는 표적에 결합하며 안전하게 작동하는지는 wet lab에서 확인해야 한다. Anthropic도 별도 단백질 설계 대회에서 5,000개가 넘는 설계를 실험 검증하겠다고 밝혔다.

오픈소스 공개가 중요한 이유

Anthropic은 최적화한 모델 코드와 기술 보고서를 공개했다. 이는 회사가 제시한 숫자를 다른 연구자가 재현하고, 다른 GPU와 데이터에서 속도·메모리·정확도 관계를 확인할 수 있게 하는 출발점이다.

독립 검증에서는 같은 하드웨어, 같은 입력 크기, 컴파일 시간 포함 여부, 워밍업 횟수와 정확도 기준을 맞춰야 한다. 회사 내부에서 선택한 유리한 입력만 측정했는지, 실패한 최적화가 얼마나 있었는지, 유지보수 비용은 어떤지도 확인할 필요가 있다.

AI가 만든 저수준 GPU 코드는 빠르더라도 드물게 발생하는 수치 오류나 특정 장치에서만 나타나는 버그를 포함할 수 있다. 과학 모델에서는 일반 웹 서비스보다 작은 오류가 연구 결론에 더 큰 영향을 줄 수 있으므로 회귀 테스트와 코드 검토가 필수다.

한국 연구기관과 바이오 기업에 주는 의미

국내 연구실이 얻을 수 있는 가장 직접적인 이익은 최고급 GPU 수량보다 소프트웨어 최적화의 가치가 커진다는 점이다. 이미 공개된 구조 예측 모델을 무조건 더 큰 클러스터로 돌리기 전에, 메모리 사용과 병목 커널을 줄이면 같은 장비로 더 많은 후보를 시험할 수 있다.

도입 순서는 보수적이어야 한다. 먼저 공개 코드의 라이선스와 의존성을 확인하고, 자체 데이터셋에서 원본 모델과 결과를 비교한다. 다음으로 속도뿐 아니라 재현성, 실패율과 수치 안정성을 측정한 뒤 탐색 단계에 제한적으로 사용한다. 환자 자료나 비공개 후보물질을 외부 모델에 전달할 때는 기관 보안·윤리 기준을 별도로 적용해야 한다.

또한 작업당 비용을 원화로 계산할 때 GPU 임대료와 토큰뿐 아니라 엔지니어 검토, 재실행, 실험 검증과 장기 유지보수를 포함해야 한다. 초기 데모에서 150달러가 들었다고 해서 실제 신약 후보 한 건의 검증 비용이 그 수준으로 내려갔다는 뜻은 아니다.

자주 묻는 질문

모든 생명과학 모델이 정확히 4배 빨라졌나

아니다. 약 4배는 여러 작업을 합친 평균이며 최소한의 정밀도 감소를 허용한 결과다. 동일 출력을 요구하면 향상 폭이 더 작고 모델별 차이도 있다.

7만 토큰 분자 구조를 정확히 예측했나

아니다. 7만 토큰이 넘는 시스템을 단일 노드에서 실행하는 데는 성공했지만 예측 구조는 붕괴했다. 정확한 결과가 보고된 범위는 1만 토큰을 넘는 일부 시스템이다.

Claude가 사람 없이 GPU 커널을 만들었나

Anthropic 기술진 두 명이 목표 설정과 검증을 감독했다. Claude가 코드 최적화를 폭넓게 수행했지만 완전 무인 연구로 설명하는 것은 부정확하다.

150달러로 신약을 만들 수 있다는 뜻인가

아니다. 약 150달러는 16개 표적의 계산 기반 단백질 설계 실험에서 GPU와 토큰을 합친 추산 비용이다. 합성, 실험, 안전성·유효성 검증과 임상 개발 비용은 포함하지 않는다.

결론

이번 발표의 핵심은 Claude가 생명과학 지식을 말로 설명했다는 것이 아니라, 수십 개의 실제 과학 소프트웨어를 읽고 병목을 줄였다는 데 있다. 재현된다면 연구자는 같은 GPU로 더 많은 후보를 시험하고, 이전에는 여러 노드가 필요했던 큰 시스템을 더 작은 환경에서 다룰 수 있다.

그러나 속도는 정확도를 대신하지 않는다. 4배 수치의 조건, 동일 출력과 고속 모드의 차이, 극한 크기에서의 실패와 in silico·wet lab의 간극을 함께 봐야 한다. 공개 코드를 이용한 독립 재현이 이번 발표의 진짜 시험대다.

출처와 이용 고지

Anthropic, Claude, NVIDIA와 관련 명칭·상표는 각 권리자에게 속한다. 이 글은 Anthropic의 후원이나 승인을 받은 공식 콘텐츠가 아니다. 공식 연구 발표의 수치와 한계를 자체 문장으로 분석했으며, 회사 내부 측정과 독립 검증 완료 결과를 구분했다. 본문 이미지는 실제 실험실·제품 화면·단백질 구조를 복제한 것이 아닌 독립 편집 이미지다.

출처: Anthropic · 직접 캡처/제작 이미지 포함

이 포스팅은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.