GPT-6 Astra보다 강한 내부 모델과 1만 AI 에이전트의 수학 연구

OpenAI가 2026년 9월 8일 공개한 Navier–Stokes 존재성과 매끄러움 문제 결과는 새 모델의 벤치마크 점수보다 더 큰 변화를 보여 준다. 회사 설명대로라면 약 1만 개의 AI 에이전트가 동시에 서로 다른 접근을 탐색했고, 유망한 중간 결과를 교환한 뒤 하나의 분석적 증명과 Lean 형식화로 수렴했다.
가장 자극적인 문장은 “GPT-6 Astra보다 상당히 강력한 내부 모델”이다. 그러나 이것을 아직 출시되지 않은 단일 챗봇이 질문 한 번으로 난제를 풀었다는 뜻으로 읽으면 틀린다. 결과는 대규모 강화학습 중인 내부 모델, 에이전트 조정 시스템, 코드·캐시된 인터넷 도구, 인간 연구진의 자원 배분, Codex를 통한 아이디어 통합, 그리고 Astra의 형식 검증이 결합된 연구 프로젝트다.
세 줄 요약
- OpenAI는 내부 시스템이 매끄러운 초기 상태에서도 3차원 비압축성 유체가 유한 시간 안에 특이점을 만들 수 있음을 보이는 결과를 냈다고 발표했다.
- Navier–Stokes 작업만 약 270만 메시지·1,300억 출력 토큰·88시간, 이후 Lean 형식화와 검증에 17시간이 추가됐다.
- 공개 논문과 형식 증명은 검토 가능한 출발점이지만, 공식 상금 인정과 수학계의 독립 검증은 별개의 과정이다.
핵심 수치와 의미

무엇을 증명했다고 발표했나
Navier–Stokes 방정식은 항공기 설계, 날씨 예측, 혈류 연구 등에서 유체의 움직임을 기술한다. 오랜 질문은 매끄럽게 시작한 3차원 비압축성 유체의 속도가 항상 매끄럽게 유지되는지, 아니면 유한 시간 안에 무한히 커지는 특이점이 생길 수 있는지다.
OpenAI는 매끄러운 외력이 적용된, 처음에는 정지한 유체가 유한 시간 안에 특이점을 만들 수 있다는 분석적 증명과 Lean 형식화를 공개했다. 핵심 구성은 안쪽으로 나선형으로 말려 들어가면서 길게 늘어나는 소용돌이다. 속도는 발산하지만 에너지는 유한하게 유지되고, 가속·압력·점성 등 큰 항들이 정교하게 상쇄돼 외력 자체는 매끄럽게 남는다는 주장이다.
회사는 이것이 Clay Mathematics Institute의 공식 정식화에서 C와 D 진술을 해결한다고 설명한다. 다만 공개와 인정은 같은 일이 아니다. 논문 심사, 전문가의 독립 재현, 형식화 코드 검토, 오류 수정과 Clay의 공식 절차가 남아 있다. OpenAI도 이 발표로 밀레니엄상을 청구할 의도가 없다고 명시했다.

1만 에이전트 연구소는 어떻게 작동했나
OpenAI는 8월 28일부터 이전에 사전학습한 모델에 대규모 강화학습을 진행했고, 9월 1일 여러 밀레니엄 문제와 고영향 문제를 시험하기 시작했다고 밝혔다. 연구 시스템은 문제 정식화의 서로 다른 변형을 여러 집단에 배분했다. 각 집단은 캐시된 인터넷을 읽고 코드를 실행할 수 있었으며 집단 안에서 통신했다.
처음부터 Navier–Stokes 하나에 모든 자원을 건 것은 아니다. 약 100개 에이전트가 50시간 동안 외력이 없는 Euler 방정식의 규칙성 반례를 찾자, 연구진은 그 결과를 단서로 보고 다른 문제의 에이전트를 Navier–Stokes로 옮겼다. 내부 모델의 더 훈련된 버전이 준비되자 실행 중인 에이전트도 새 버전으로 교체했다.
서로 다른 집단이 같은 생각만 반복하지 않도록 접근을 다양화했고, 일정 시점에는 Codex가 각 집단의 유용한 중간 결과를 정리해 다른 집단의 후속 프롬프트에 주입했다. 이 구조는 검색의 폭과 아이디어 결합을 동시에 노린다. 중요한 점은 인간이 완전히 사라지지 않았다는 것이다. 연구진은 문제 선택, 자원 이동, 프롬프트 설계, 중간 결과의 가치 판단과 발표 책임을 맡았다.
1,300억 출력 토큰이 뜻하는 것
Navier–Stokes 한 문제에서 사용된 약 1,300억 출력 토큰은 일반 사용자가 긴 대화를 한 것과 차원이 다르다. 에이전트가 병렬로 가설을 세우고 계산하고 서로 반박하며 실패 경로를 버리는 연구 탐색의 총량이다. 전체 시도는 약 3,000억 출력 토큰이었다. 절반 이상이 최종 문제 외의 탐색과 실패에 쓰였다는 뜻이다.
그렇다고 공개 API 가격표를 곱해 연구비를 계산해서는 안 된다. 내부 추론 토큰의 회계 방식, 하드웨어 이용률, 캐시, 병렬 처리, 학습 비용과 실패 재실행 비용이 공개되지 않았다. 토큰 수는 계산 규모를 보여 주는 지표이지, 정확한 달러 비용표가 아니다.
이 수치는 동시에 경제적 한계를 드러낸다. 1만 에이전트를 88시간 돌리는 방식은 모든 대학 연구실이 바로 반복할 수 있는 표준 절차가 아니다. 과학적 중요성을 판단하려면 결과뿐 아니라 다른 조직이 어느 정도의 계산 자원으로 검증하고 재현할 수 있는지도 봐야 한다.
Lean 검증이 왜 중요한가
자연어 수학 증명은 그럴듯해 보여도 숨은 가정, 부호 오류나 경계 조건의 빈틈을 포함할 수 있다. Lean은 정의와 추론 단계를 형식 언어로 적고 커널이 각 단계를 검사하게 한다. OpenAI는 에이전트가 결과에 도달한 뒤 GPT-6 Astra를 사용해 Lean 형식화와 검증에 17시간을 더 썼다고 밝혔다.

형식 증명은 강력한 안전망이지만 만능 인증서는 아니다. 정리의 입력 정의가 원래 수학 문제와 정확히 대응하는지, 라이브러리 가정이 적절한지, 논문의 해석이 형식화 결과보다 앞서 나가지 않는지는 사람이 다시 확인해야 한다. 반대로 공개된 Lean 코드가 있으면 전 세계 연구자가 같은 커널로 검사를 반복할 수 있어 자연어 주장만 공개하는 것보다 검증 가능성이 높다.
‘Bel이 풀었다’고 부르면 안 되는 이유
온라인에서는 OpenAI의 차기 내부 모델을 Bel이라고 부르는 추측이 퍼져 있다. 그러나 Navier–Stokes 공식 발표는 모델명을 공개하지 않았고, “GPT-6 Astra보다 상당히 강력한 새로운 내부 모델”이라고만 설명한다. 학습이 계속 진행 중이라는 사실도 함께 밝혔다.
따라서 현재 확인 가능한 표현은 ‘OpenAI 내부 모델’이다. Bel, GPT-7 또는 특정 파라미터 수와 연결하는 것은 별도 근거가 나오기 전까지 루머다. 모델의 능력과 연구 시스템의 능력도 구분해야 한다. 같은 내부 가중치를 일반 채팅 화면에서 사용한다고 해서 1만 에이전트·도구·검증 파이프라인과 같은 결과가 자동으로 나오는 것은 아니다.
연구 가속의 가능성과 위험
OpenAI의 연구 가속 설명에서 회사는 AI가 가설 생성, 코드 작성, 문헌 탐색과 검증 루프를 빠르게 만들고 있다고 설명한다. 이번 사례는 그 주장을 구체적인 운영 규모로 보여 준다. 잘 설계하면 여러 접근을 동시에 탐색하고, 사람이 놓친 연결을 찾고, 형식 검증으로 결과를 압축할 수 있다.
반면 대규모 에이전트는 오류를 빠르게 증폭하거나 같은 잘못된 전제를 공유할 수도 있다. 연구 결과가 화려할수록 독립 평가, 데이터 계보, 도구 접근 기록과 실패 경로 보존이 중요해진다. OpenAI가 별도로 공개한 모델 오정렬 보고 프레임워크와 오정렬 모니터링 안내는 규모가 커질수록 행동 감시가 필요하다는 점을 보여 준다.
한국 연구기관과 기업이 봐야 할 점
국내 대학과 연구기관이 이 방식을 그대로 복제하기는 어렵지만 설계 원칙은 활용할 수 있다. 한 모델에게 최종 답을 요구하는 대신, 가설 생성·반례 탐색·문헌 확인·코드 검증·최종 심사를 분리하고 서로 다른 모델이나 사람에게 맡기는 방식이다. 계산 자원이 제한되면 에이전트 수를 늘리기보다 각 단계의 종료 조건과 자동 검사를 먼저 설계하는 편이 낫다.
연구 계약과 지식재산권도 점검해야 한다. 캐시된 인터넷이나 내부 논문에 대한 접근 범위, 생성된 중간 결과의 보관, 외부 모델 사업자에게 전송되는 비공개 데이터, 발명자·저자 표기와 오류 책임을 사전에 정해야 한다. 수학 증명처럼 공개 검증이 가능한 분야와 개인정보·영업비밀이 섞인 산업 연구는 같은 정책을 쓸 수 없다.
자주 묻는 질문
밀레니엄 문제가 공식적으로 해결된 것인가
OpenAI는 공식 정식화의 C·D 진술을 해결하는 증명이라고 발표했다. 하지만 수학계의 독립 검토와 Clay Mathematics Institute의 절차는 별도다. 발표 직후 ‘상금 수상 확정’이라고 쓰는 것은 이르다.
GPT-6 Astra가 문제를 푼 것인가
주된 탐색은 Astra보다 강하다고 설명된 내부 모델과 약 1만 에이전트 시스템이 맡았다. Astra는 이후 Lean 형식화와 검증에 사용됐다.
일반 사용자가 같은 모델을 쓸 수 있나
아니다. 내부 모델은 공개 모델 카탈로그에 없다. 이름, 출시 일정, 가격과 컨텍스트 길이도 공식 확인되지 않았다.
1만 에이전트가 사람 1만 명과 같은가
아니다. 에이전트는 동일하거나 유사한 모델의 여러 실행 인스턴스이며, 독립적인 인간 연구자 1만 명과 경험·책임·관점이 같지 않다.
결론
이번 발표의 핵심은 ‘더 똑똑한 챗봇’보다 ‘계산으로 확장되는 연구 조직’이다. 강한 내부 모델, 약 1만 개 에이전트, 수백만 메시지, 인간의 방향 설정과 Lean 검증이 하나의 파이프라인으로 묶였다. 성공 여부가 독립 검토를 통과한다면 AI 연구 가속의 중요한 사례가 된다.
동시에 비용·재현성·오류 전파·모델명 루머를 분리해서 봐야 한다. 공개된 증명과 형식화가 검증의 시작이며, 1,300억 토큰이라는 규모가 결과의 진실을 대신하지는 않는다.
출처와 이용 고지
- OpenAI, On the Navier–Stokes Millennium Prize Problem
- OpenAI, A view inside AI-accelerated research
- OpenAI, Model misalignment reporting framework
- OpenAI Developers, Misalignment monitoring
- Clay Mathematics Institute, Navier–Stokes equation
OpenAI, GPT, Codex와 Lean 관련 명칭과 상표는 각 권리자에게 속한다. 이 글은 어느 회사나 기관의 후원·승인을 받은 공식 콘텐츠가 아니며 공개 자료를 바탕으로 사실, 회사 주장과 해석을 구분했다. 본문 이미지는 공식 연구 장면이나 제품 화면이 아닌 독립 편집 이미지다.



