Gemini 4 Argon 벤치마크와 9가지 루머 팩트체크

Gemini 4 Argon은 가짜 모델명이 아니다. Google이 2026년 9월 30일 발표한 실제 모델이다. 그러나 X에서 함께 퍼지는 문장 가운데는 확인된 숫자, 조건을 뺀 홍보 문구, 아직 검증할 수 없는 추측이 한 게시물 안에 섞여 있다.
이 글은 10월 3일 한국시간 기준으로 공개된 Google 자료와 독립 평가, Arena 발표, 전문 업무 평가를 다시 대조했다. 한국·미국·일본 반응은 국적을 확인한 여론조사가 아니라 한국어 X, 미국 영어권 기술 담론, 일본어 X의 공개 표본을 나눈 관찰이다. 직접 Argon을 사용해 재현한 성능 시험도 아니다.
위 이미지는 사실 확인 과정을 표현한 새 개념 일러스트다. 실제 Google 화면, X 게시물, 벤치마크 대시보드나 특정 인물을 촬영한 자료가 아니다.
1분 결론부터 읽기
- 확인: Argon은 공식 발표됐고 전문 지식 노동, 장기 소프트웨어 작업, 텍스트 선호도에서 최상위권 결과가 있다.
- 확인: 100만 토큰은 Google이 밝힌 최대 출력 한도다. 단순한 입력 컨텍스트 수치가 아니다.
- 조건부: 입력 100만 토큰당 2달러, 출력 10달러는 도입 할인이다. 할인 종료 뒤에는 4달러와 20달러가 적용된다.
- 과장: 모든 GPT와 Claude를 전 영역에서 이겼다는 주장은 틀리다. 터미널 작업, 웹 개발, 컴퓨터 조작에서는 더 낮은 순위가 있다.
- 오해: 약 15%의 낮은 환각률은 환각 해결을 뜻하지 않는다. 정확도와 답변 보류 성향을 함께 봐야 한다.
- 미확인: 일반 사용자의 앱·공개 API 이용일,
Velox와 Argon의 동일성, 공개판 대폭 너프설은 확인되지 않았다. - 보도·반박 병존: 일부 내부 직원의 회의론을 전한 익명 보도가 있지만 Google은 부정확하다고 반박했다.
즉 Argon을 가장 안전하게 설명하면 “몇몇 중요한 평가에서 선두인 비공개 프런티어 모델”이다. “누구나 지금 쓸 수 있는 절대 최강 모델”은 아니다.
벤치마크 숫자는 한 줄 순위가 아니다
Google이 직접 공개한 결과
Google의 공식 발표는 DeepSWE v1.1 77.9%, AutomationBench 51.3%, LVBench 91.7%, CWE-bench v1 68%를 제시한다. 각각 장시간 소프트웨어 엔지니어링, 여러 도구를 잇는 자동화, 긴 동영상 이해, 취약점 수정을 보는 평가다.
의미 있는 결과지만 출시사가 선택하고 공개한 수치라는 한계가 있다. 한 평가의 1위를 “코딩 전체 1위”로 넓히거나, 서로 다른 평가의 백분율을 단순 비교하면 안 된다. 실제 저장소 수정과 운영 도구 사용은 평가 환경, 추론 설정, 시간 제한에 크게 영향을 받는다.
Vals에서는 강점과 약점이 함께 보인다
Vals의 전체 모델 카드에서 Argon은 Vals Index 68.90%±0.97로 41개 모델 중 1위다. Finance Agent v2는 65.40%로 1위, Vibe Code Bench v1.1은 91.91%로 2위, Code Migration은 68.17%로 2위다.
그러나 Terminal-Bench 4.0은 57.58%로 5위이고, 컴퓨터 화면을 조작하는 CUA-bench는 4.83%로 8개 모델 중 7위다. Vals가 사용한 설정의 최대 출력은 262,144토큰이어서 공식 사양의 100만 출력 전체를 시험한 결과도 아니다. 따라서 이 페이지가 말해 주는 것은 “모든 작업의 승자”가 아니라 “전문 업무 종합과 일부 코딩 과제에 강하지만 실제 도구 조작에는 약점이 보인다”는 것이다.
종합 지수 53점과 환각률 15%의 관계
Artificial Analysis의 분석은 Intelligence Index 53점으로 Argon을 GPT-6 Astra 최고 설정과 같은 수준에 놓는다. 현재 할인 가격을 적용한 과제당 비용은 약 1.99달러다. 이 분석에서 Argon은 과제당 평균 약 6만 2천 출력 토큰을 사용해 Astra의 약 2만 7천보다 훨씬 길게 생성했다.
AA-Omniscience의 환각률은 약 15%로 낮지만 정확도는 약 50%다. 잘 모를 때 잘못 추측하기보다 답을 보류하는 성향이 수치에 반영됐다는 뜻이다. 사실 확인 업무에는 장점이 될 수 있지만, 답변 완성률이 중요한 작업에서는 별도 평가가 필요하다. “환각이 사라졌다”와 “모를 때 덜 추측한다”는 다른 주장이다.
전문 업무와 사람 선호도도 결과가 갈린다
Mercor APEX-Agents에서 Argon은 Pass@1 82.2%±4.4로 1위다. 세부 결과는 컨설팅 90.3%, 투자은행 80.9%, 기업법무 75.3%다. 장기 전문 업무에서 매우 강한 신호지만, 특정 과제와 하네스의 결과를 모든 사무업무 생산성으로 일반화할 수는 없다.
Arena의 Text·WebDev 발표에서는 Text Arena 1,525점으로 1위, Code Arena: WebDev 1,679점으로 8위다. 같은 발표 안에서도 채팅 답변 선호와 웹 개발 순위가 다르다. 별도의 Agent Arena 초기 결과는 약 3,000개 세션을 바탕으로 Argon을 8위에 놓았다. 예비 결과를 확정 순위처럼 쓰면 안 된다.
PublicAI의 초기 종합 집계는 전체 4위, 인간 선호와 전문업무 1위, 추론 181개 중 24위로 표시했다. 당시 19개 보드 중 5개만 반영한 초기 화면이므로 이 숫자는 모델의 영구적인 최종 순위가 아니라 업데이트 전 스냅샷에 가깝다.
루머 1: 이미 모든 사용자가 쓸 수 있다
판정: 거짓에 가까운 과장
발표와 일반 출시를 구분해야 한다. 현재 확인된 접근은 Fairwind의 신뢰된 사이버 방어 조직과 평가자 중심의 제한 제공이다. Google은 이후 유료 API 고객과 Google AI Ultra 가입자부터 넓히겠다고 밝혔지만 날짜는 공개하지 않았다.
따라서 “Argon이 발표됐다”는 사실이고, “내 Gemini 앱에서 지금 선택할 수 있다”는 일반화는 사실이 아니다. 구독 이름만 보고 접근 가능하다고 판단하지 말고 실제 모델 선택 화면과 공식 API 문서를 확인해야 한다.
루머 2: GPT와 Claude를 모두 이겼다
판정: 거짓
DeepSWE, Vals Index, APEX-Agents, Text Arena처럼 Argon이 앞선 평가가 있다. 반대로 Vals의 Terminal-Bench와 CUA-bench, Arena의 WebDev와 Agent 결과처럼 선두가 아닌 평가도 있다. Artificial Analysis 종합 점수는 Astra와 같고, PublicAI 초기 종합은 4위다.
“몇 개 평가에서 1위”를 “18개 중 13개를 이겼으니 전 분야 최강”처럼 압축하면 평가 수, 과제 종류, 동률, 설정 차이가 사라진다. 한국어 게시물에서 숫자만 카드뉴스처럼 재전파될 때 가장 자주 생기는 오류다.
루머 3: 환각률 15%로 환각을 해결했다
판정: 오해를 부르는 표현
낮은 환각률은 분명 좋은 신호다. 다만 같은 평가의 정확도 약 50%와 함께 읽어야 한다. Argon은 모르는 문제에 무리하게 답하지 않는 전략으로 잘못된 추측을 줄였을 가능성이 크다.
업무에 따라 필요한 지표도 다르다. 규정 검색은 근거 없는 답변을 줄이는 것이 중요하고, 고객 문의 분류는 일정 수준 이상의 응답률이 필요하다. 둘 다 “환각률” 한 숫자로 결정할 수 없다.
루머 4: Astra보다 40% 싸거나 가격이 5분의 1이다
판정: 비교 조건에 따라 달라진다
도입 할인은 입력 100만 토큰당 2달러, 출력 10달러다. Artificial Analysis의 동일 과제에서는 Argon 약 1.99달러, GPT-6 Astra 약 3.26달러여서 Argon이 약 40% 저렴하다.
그러나 할인 종료 뒤 Argon 표준 요금은 입력 4달러, 출력 20달러다. 같은 사용량을 적용한 예상 과제 비용은 약 3.98달러로 올라가 Astra보다 약 20% 비싸질 수 있다. Argon이 더 긴 출력을 사용한 점도 실제 비용에 영향을 준다. “토큰 단가”, “현재 할인 과제 비용”, “표준가 완료 비용”을 섞지 않아야 한다.
루머 5: 지금 한 번에 100만 토큰을 안정적으로 출력한다
판정: 사양은 확인, 일반 이용은 미확인
100만 토큰이 최대 출력 한도라는 설명은 공식이다. 이전 64K보다 크게 늘었다. 그러나 일반 공개 API가 없고, 초기 독립 평가도 더 낮은 출력 설정에서 수행됐다.
실제 제품에서는 연속 생성, 응답 시간, 중간 재개, 계정별 할당량, 실패 후 재시도, 저장 비용이 함께 작동할 수 있다. “설계상 지원”과 “일반 사용자가 오늘 단일 호출로 안정적으로 받음”은 같은 문장이 아니다.
루머 6: Google 내부에서도 실패한 모델로 본다
판정: 보도는 존재하지만 결론은 미확정
Madison Mills가 쓴 Axios의 양측 정리는 Bloomberg가 익명 관계자를 바탕으로 일부 직원의 내부 테스트 회의론을 보도했고 Google은 그 설명이 부정확하다고 반박했다고 전한다. 그러므로 “내부 우려 보도가 있었다”는 사실로 쓸 수 있지만 “내부 테스트에서 실패가 입증됐다”고 단정할 수는 없다.
이 논쟁을 확인하려면 익명 평가 한 줄보다 공개 후 동일 저장소, 동일 권한, 동일 시간 예산으로 재현한 결과가 필요하다. 보도와 회사 반박 중 하나를 성능 데이터로 대신 사용해서도 안 된다.
루머 7: Velox나 Gemini 3.8 Flash 익명판이 Argon이었다
판정: 미확인
출시 전 Arena의 익명 모델과 Velox라는 별칭, 비정상적으로 강한 3.8 Flash 체크포인트를 Argon으로 연결하는 추측이 있었다. Google이나 Arena가 동일성을 확인한 공개 자료는 찾지 못했다. 익명 모델의 인상적인 답변을 현재 Argon의 재현 가능한 증거로 사용하면 안 된다.
루머 8: 공개판은 반드시 크게 너프된다
판정: 근거 없는 예상
공개판의 추론 설정, 속도, 할당량, 안전 제한, 지역별 접근 조건은 아직 확정되지 않았다. 과거 앱과 API의 체감 차이를 근거로 가능성을 말할 수는 있지만, Argon에 이미 적용된 사실처럼 표현할 수 없다. 공개 뒤에는 모델 식별자와 설정, 날짜를 남긴 비교가 필요하다.
루머 9: Gemini 3.5 Pro가 취소됐고 Neon·Helium도 확정됐다
판정: 이름과 계보 추측
예상됐던 3.5 Pro가 일반 공개되지 않은 채 Gemini 4가 발표된 것은 맞다. 그러나 Google은 3.5 Pro 프로젝트의 공식 취소나 Argon으로의 단순 개명, Neon·Helium이라는 제품군 구성을 확인하지 않았다. 안전한 표현은 “3.5 Pro 일반판이 나오기 전에 Gemini 4가 발표됐다”까지다.
한국·미국·일본의 공개 X 반응은 무엇이 달랐나
한국어 X에서는 DeepSWE 77.9%, Vals 1위, 100만 출력, 2달러·10달러 같은 숫자가 짧게 묶이는 경향이 눈에 띄었다. 빠르게 이해하기 좋지만 할인 조건, 평가별 패배, 제한 접근이 빠지면 “싸고 완벽하며 지금 쓸 수 있는 모델”로 변한다. 한국 독자는 숫자 옆에 제공 주체, 순위 분모, 가격 기간을 붙여 읽는 것이 중요하다.
미국 영어권 담론은 Artificial Analysis와 Arena의 방법론, 출력량, 과제당 비용, 내부 회의론 보도를 놓고 논쟁하는 비중이 컸다. 성능 점수보다 재현 가능성과 할인 종료 뒤 비용을 따지는 시선이 강했다. 동시에 익명 체크포인트와 공개판 너프설도 빠르게 확대됐다.
일본어 X에서는 100만 출력과 도입 가격이 계약서, 공시, 코드베이스 같은 장문 작업에 어떤 의미인지에 관심이 모였다. 직접 써 보지 못했다는 단서와 함께 사양을 소개한 게시물도 많았다. 반면 “공개될 때는 늘 약해진다”는 과거 경험 기반 추측이 Argon의 확정 정보처럼 번지는 모습도 있었다.
이 차이는 계정 국적을 인증한 통계가 아니다. 추천 알고리즘, 검색어, 관찰 시간에 따라 달라지는 언어 커뮤니티 표본이다. 국가별 선호율이나 찬반 비율로 바꾸어 인용해서는 안 된다.
공개 뒤 실제로 확인해야 할 7가지
- 앱과 API에서 표시되는 정확한 모델 식별자와 버전 날짜
- 추론 강도, 도구 권한, 최대 출력과 연속 생성 설정
- 같은 과제를 완료하기까지의 입력·출력·캐시·재시도 비용
- 답변 보류율과 오답률, 근거 링크의 정확성
- 실제 저장소에서 테스트 통과, 불필요한 변경, 보안 회귀 여부
- 한국어 장문에서 고유명사, 숫자, 표 구조와 문맥 유지 품질
- 속도, 중단 복구, 할당량과 피크 시간 실패율
지금은 벤치마크를 더 모으는 것보다 공개 후 같은 조건으로 재현할 시험표를 준비할 시점이다. 한 번의 멋진 답변보다 성공 기준을 충족한 작업 수와 사람이 고친 시간을 기록해야 한다.
최종 판단
Gemini 4 Argon은 Google의 프런티어 경쟁 복귀를 보여 주는 강한 모델이다. 전문 업무, 장기 코딩, 텍스트 선호도와 긴 출력에서 주목할 근거가 충분하다. 동시에 터미널 작업, 웹 개발, 컴퓨터 조작에서는 경쟁 모델이 앞서는 결과가 있고, 일반 공개 전이라 실사용 재현도 부족하다.
따라서 지금 믿어도 되는 문장은 “Argon은 여러 중요한 평가에서 최상위권이며 100만 출력 사양과 공격적인 도입 가격을 제시했다”이다. 아직 믿기 어려운 문장은 “모든 모델을 이겼고 환각을 해결했으며 누구나 지금 저렴하게 쓸 수 있다”이다. 다음 결론은 출시 홍보가 아니라 공개 API의 실제 설정과 완료 비용이 결정할 것이다.
출처 이용과 편집 고지
이 글은 링크한 자료에서 날짜, 공개 사양, 일부 점수·순위와 방법상 한계만 확인해 독립적으로 분석했다. 원문의 문장, 표, 차트, 벤치마크 화면, X 게시물 화면, 로고, 제품 UI와 이미지는 복제하지 않았다. 특히 Axios 보도는 Madison Mills의 기사로 귀속했으며, 익명 정보와 Google의 반론이 존재한다는 사실만 전달하고 어느 쪽도 검증된 성능 결과로 채택하지 않았다. 각 평가의 전체 방법, 표본, 설정과 최신 상태는 링크한 원문에서 확인해야 한다.



