GPT-6 vs Claude Opus 5.5: 딸깍 게임 만들기는 누가 더 잘하나

2026-09-26 · AI · 쥬곰 편집부

#GPT-6 Astra#Claude Opus 5.5#AI 게임 제작#바이브 코딩#Codex#Claude Code#게임 개발

두 AI 작업 환경이 하나의 브라우저 게임을 함께 구축하는 편집 이미지

“게임 하나 만들어 줘”라고 입력하고 기다리면 어느 모델이 더 완성도 높은 결과를 내놓을까. 2026년 9월 현재 최고급 모델끼리 비교하면 대상은 OpenAI의 GPT-6 Astra와 Anthropic의 Claude Opus 5.5다. GPT-6 Sol과 Luna도 게임을 만들 수 있지만, OpenAI가 Astra를 자사 최고 성능 모델로 규정하기 때문에 정면 비교는 Astra 대 Opus 5.5가 맞다.

결론부터 말하면, 한 번의 프롬프트로 더 풍부하고 눈에 띄는 게임을 내놓는 능력은 현재 공개 사례에서 Opus 5.5가 앞섰다. 반면 게임을 실제로 실행하고 화면을 확인하며 오류를 고치는 종단간 작업은 Astra가 강하게 설계돼 있다. 비용까지 포함하면 Astra가 항상 비싼 것도, Opus가 항상 싼 것도 아니다. 모델이 얼마나 많은 기능과 코드를 스스로 추가하느냐가 최종 청구액을 바꾼다.

여기서 ‘딸깍 게임 만들기’란 무엇인가

이 글에서 말하는 딸깍 게임 제작은 단순히 HTML 파일 하나를 출력하는 일이 아니다. 자연어 프롬프트를 받은 에이전트가 요구를 해석하고, 파일을 만들고, 브라우저나 게임 엔진에서 실행하고, 오류를 찾아 수정해 플레이 가능한 상태까지 가져가는 흐름을 뜻한다.

한 번의 프롬프트가 요구 해석부터 배포 준비까지 이어지는 여섯 단계

따라서 비교 기준도 코드 길이나 일반 코딩 벤치마크 하나로 끝나지 않는다. 첫 실행 성공, 조작감, 규칙의 깊이, 애니메이션과 사운드, 여러 파일의 일관성, 브라우저 테스트, 오류 복구, 모바일 대응과 자산 라이선스까지 함께 봐야 한다. 같은 모델이라도 브라우저·터미널·게임 엔진을 얼마나 잘 연결한 에이전트 환경에서 실행하느냐에 따라 결과가 크게 달라진다.

같은 프롬프트로 게임 두 개를 만든 공개 실험

가장 직접적인 자료는 2026년 9월 25일 공개된 Moe Lueker의 동일 프롬프트 비교다. 실험자는 빈 폴더와 독립된 Git 저장소를 모델마다 준비한 뒤, 같은 프롬프트를 넣고 추가 수정 지시 없이 기다렸다. 과제는 비행 구간이 있는 러너 게임과 여러 시스템을 요구하는 아일랜드 건설 게임이었다.

러너 게임에서 Opus 5.5는 점프 외에 다이브·브레이크·질주·체크포인트·버섯 부스트·글라이더·스윙과 배경 음악까지 만들었다. Astra는 패럴랙스 배경과 상승 가능한 글라이드 구간을 구현했지만 기능 수는 더 적었다. 실험자가 집계한 게임 코드도 Opus가 2,405줄, Astra가 358줄이었다.

아일랜드 건설 게임에서도 Opus는 건물 배치에 따른 보상, 밤에 켜지는 조명, 이동하는 주민과 보트, 고래 연출까지 넣었다. Astra는 더 단순한 화면과 건설 규칙을 제공했다. 실험자는 두 번 모두 Opus 결과물을 더 좋은 게임으로 평가했다.

더 많이 만들면 비용과 시간도 늘어난다

아래 금액은 구독제 사용량이 아니라, 실험자가 로컬 로그의 빌드 턴을 API 정가로 환산한 수치다. 후속 수정 프롬프트는 포함되지 않았다.

더 많이 만들면 비용과 시간도 늘어난다: 모델, 러너 게임, 아일랜드 게임, 두 게임 합계, 총 빌드 시간

첫 번째 러너 게임에서 Opus는 약 25만 6천 출력 토큰을 사용해 Astra의 약 3만 6천 토큰보다 7배 이상 많은 결과를 냈다. 토큰당 단가는 Opus가 낮았지만, 훨씬 많은 작업을 수행해 최종 비용은 Opus 15.25달러, Astra 7.09달러가 됐다. 두 번째 과제에서는 출력량 차이가 약 3배로 줄어 Opus가 5.40달러, Astra가 6.88달러로 오히려 더 저렴했다.

핵심은 토큰 가격이 아니라 완성된 한 작업의 비용이다. Opus가 스스로 기능을 대폭 추가하면 첫 결과물은 화려해지지만 시간과 출력량이 늘 수 있다. Astra가 더 작은 범위에서 끝내면 빠르고 저렴할 수 있지만, 사용자가 원하는 깊이에 도달하려면 후속 지시가 더 필요할 수 있다.

이 실험만으로 모델의 절대 승자를 정할 수 없는 이유

동일 프롬프트라는 장점은 있지만 통제된 연구는 아니다. Opus 5.5는 Claude Code, GPT-6 모델은 Codex에서 실행됐다. 러너 게임에서는 Luna만 max, 나머지는 xhigh였고, 아일랜드 게임에서는 Luna를 제외한 모델이 high였다. 각 도구의 시스템 프롬프트, 브라우저 제어, 기본 테스트 습관과 컨텍스트 관리가 다르다.

표본도 게임 두 개뿐이다. 2D 브라우저 게임에서 잘한 모델이 Unity의 3D 물리, Godot 장면 트리, 네트워크 동기화나 모바일 메모리 최적화에서도 같은 순위를 유지한다는 보장은 없다. 그래서 이 결과는 “현재 가장 구체적인 실전 사례”로는 유용하지만, 재현 가능한 대규모 게임 벤치마크로 읽어서는 안 된다.

일반 코딩 벤치마크는 무엇을 보완해 주나

Anthropic의 Opus 5.5 공식 자료에서 Terminal-Bench 4.0은 Opus 5.5가 66.4%, GPT-6 Astra가 57.9%다. 장시간 터미널 작업과 여러 단계를 이어 가는 코딩 능력에서 Opus가 강하다는 근거다. 그러나 같은 표의 AutomationBench에서는 Astra가 41.4%, Opus가 40.0%로 앞선다. 과학 연구형 터미널 평가도 Astra 64.6%, Opus 58.7%다.

Artificial Analysis의 독립 비교에서는 설정에 따라 결과가 더 가까워진다. Opus 5.5 high는 Intelligence Index 54점, Astra max는 53점이었고, Terminal-Bench 4.0은 두 모델 모두 59.6%로 측정됐다. 코딩 벤치마크가 Opus의 긴 작업 능력을 뒷받침하지만, 게임의 재미·조작감·미술 완성도를 직접 측정하지는 않는다.

Astra의 강점은 ‘만든 뒤 직접 보는’ 루프다

OpenAI의 Astra 소개는 코드를 쓰는 능력뿐 아니라 웹사이트를 만들고 프런트엔드 QA를 실행하며, 소프트웨어를 설치·테스트하고 화면에서 본 문제를 해결하는 컴퓨터 사용 능력을 핵심으로 내세운다. Lovable의 초기 평가는 추론 강도를 올릴수록 새 빌드에서 더 많이 반복하고 브라우저 테스트를 더 수행했다고 설명한다.

게임 제작에서도 이 방향은 분명하다. OpenAI Developers의 게임 제작 사례는 명명된 테스트 장면, Playwright 스크린샷, 실제 조작 경로와 상태 변화를 함께 사용했다. 지형 수치만 맞추는 것으로 끝내지 않고 브라우저에서 셰이더 컴파일, GPU 업로드, 움직임과 전환 감각을 다시 확인했다.

Playco 사례도 Unity와 Godot 안에서 장면을 수정하고, 직접 플레이하고, 테스트와 검증을 반복하는 구조다. Playco는 Astra가 같은 회색 상자 기반에서 테마가 다른 프로토타입 세 개를 한 번에 만들었고, 이전 모델보다 수동 수정이 50% 줄었다고 보고했다. 다만 이는 OpenAI가 공개한 고객 사례이며 독립 대조 실험은 아니다.

Opus 5.5가 첫 결과물을 풍부하게 만드는 이유

Claude Opus 5.5 공식 문서는 이 모델을 장시간 에이전트 코딩과 지식 업무용으로 규정한다. 100만 토큰 컨텍스트, 최대 12만 8천 토큰 출력과 항상 켜진 적응형 추론을 제공한다. 기본 effort는 medium이며 필요에 따라 높일 수 있다.

공개 게임 실험에서 보인 특징은 요구된 최소 기능만 완성하기보다 게임다운 요소를 스스로 확장한 점이다. 조작 종류, 보상 구조, 분위기 변화, 이동 오브젝트와 음악을 함께 구성했다. 게임 디자인 관점에서는 강점이지만, 사용자가 원하지 않은 기능까지 늘어나면 범위 초과와 유지보수 부담이 될 수도 있다. 원샷 결과의 화려함과 제품 코드의 단순성은 같은 목표가 아니다.

한국 사용자가 고를 때의 현실적인 기준

첫 결과물, 종단간 검증과 반복 비용에 따라 달라지는 모델 선택

ChatGPT·Codex 구독 한도와 Claude 구독 한도는 API 정가와 별개다. 구독 환경에서는 요청당 달러보다 5시간·주간 한도, 재시도 횟수와 작업 중단 위험이 더 중요한 비용이 될 수 있다. 사용하는 플랜 안에서 같은 프롬프트, 같은 추론 강도, 같은 시간 제한으로 직접 비교해야 한다.

가장 좋은 운영 방식은 역할을 나누는 것이다

한 모델만 고집할 필요는 없다. Opus 5.5로 게임 기획과 화면·조작이 풍부한 첫 버전을 만들고, Astra로 브라우저 테스트와 오류 복구를 수행하는 조합이 가능하다. 비용을 낮추려면 Opus가 상세 설계서를 만들고 Sol이 여러 프로토타입을 구현한 뒤, 최종 후보만 Astra나 Opus로 검수할 수 있다.

어떤 조합이든 배포 전에는 사람이 직접 플레이해야 한다. 모바일 입력, 프레임 저하, 저장 데이터, 접근성, 외부 패키지 보안, 음원·이미지·폰트의 라이선스는 코드가 실행된다는 사실만으로 검증되지 않는다. AI가 만든 자산도 유명 게임 캐릭터나 UI를 닮지 않았는지 확인하고, 사용한 생성 도구와 프롬프트, 사람이 수행한 선택과 수정 내역을 내부 기록으로 남기는 편이 안전하다.

최종 판단

“프롬프트 한 번으로 가장 인상적인 게임을 만들 모델”을 묻는다면, 현재 가장 직접적인 공개 비교에서는 Claude Opus 5.5가 우세하다. “게임을 실행하고 화면을 보며 테스트와 수정까지 끝낼 에이전트”를 묻는다면 GPT-6 Astra가 매우 강한 선택이다. “많은 아이디어를 실제로 만들어 보며 비용을 통제할 모델”은 GPT-6 Sol이 더 현실적이다.

따라서 절대 승자 한 명보다 목적에 맞는 평가표가 필요하다. 같은 게임 요구서로 첫 실행 성공률, 완성까지의 후속 프롬프트 수, 회귀 오류, 플레이 테스트 시간, 총 토큰과 사람의 수정 시간을 기록하면 자신에게 맞는 모델이 드러난다.

출처 및 이용 고지

OpenAI, GPT, Codex, Anthropic, Claude와 각 제품명은 해당 권리자의 상표다. 이 글은 어느 회사의 후원이나 승인을 받지 않은 독립 비교 기사다. 공식 수치, 기업 고객 사례, 독립 평가와 개인의 동일 프롬프트 실험을 서로 구분했으며, 타사 게임 화면·공식 제품 UI·X 화면·외부 사진을 복제하지 않았다.

출처: Moe Lueker · 직접 캡처/제작 이미지 포함

이 포스팅은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.