샤오미 MiMo-V2.6 완전 분석: 1M 컨텍스트·멀티모달·대규모 RL이 바꾼 것

샤오미가 2026년 9월 22일 MiMo-V2.6 시리즈를 공식 공개했다. 이번 제품군은 최고 성능을 지향하는 MiMo-V2.6-Pro, 비용과 처리량의 균형을 노린 MiMo-V2.6-Flash, 에이전트 강화학습 연구를 위한 9B 증류 체크포인트로 구성된다. Pro와 Flash의 가중치, 기술 보고서, 강화학습 자원도 함께 공개됐다.
핵심은 모델 크기만이 아니다. Xiaomi는 텍스트·이미지·영상·오디오를 한 모델에서 처리하고, 100만 토큰 문맥 안에서 코딩·웹·컴퓨터 조작·사이버보안 같은 장기 작업을 수행하도록 학습했다. 그 과정의 일부를 공식 라이브 RL 대시보드로 공개해 학습 단계, 토큰, 비용, 재시작 사유와 평가 변화를 기록했다.
결론부터 말하면 MiMo-V2.6은 저렴한 API와 공개 가중치를 동시에 제시한 강한 에이전트 모델 후보다. 다만 공개 첫날의 벤치마크 대부분은 Xiaomi가 실행한 결과이며, 1M 컨텍스트가 모든 작업에서 정확도와 경제성을 보장하지 않는다. 국내 이용자는 성능표보다 데이터 처리 조건, 결제 가능 여부, 도구 연동 안정성부터 확인하는 편이 안전하다.
세 줄 요약
- Pro는 1.02T 전체·42B 활성 파라미터, Flash는 309B 전체·15B 활성 파라미터의 Sparse MoE 모델이다.
- 둘 다 1M 컨텍스트, 128K 최대 출력, 네이티브 멀티모달 입력과 도구 호출을 지원한다.
- API 단가는 공격적이지만 원본 가중치의 자체 실행은 대규모 GPU 구성이 필요하며, 공개 성능은 독립 재현 결과를 기다려야 한다.

MiMo-V2.6은 한 개의 모델이 아니다
Pro는 복잡한 프로젝트와 장기 에이전트 작업을 위한 플래그십이다. 공식 모델 카드는 1.02T 전체 파라미터 가운데 매 토큰 처리에 42B를 활성화한다고 설명한다. Flash는 309B 전체·15B 활성 구조로, 같은 입력 종류와 장문 기능을 더 낮은 가격에 제공한다.
이와 별도로 MiMo-V2.6-Distill-Qwen-9B가 있다. 이는 Pro를 작게 압축한 소비자용 버전이라기보다 Qwen3.5-9B를 기반으로 Xiaomi가 만든 데이터로 지도 미세조정한 연구용 시작점이다. 코드, 일반 에이전트, 시각 코딩, 사이버보안 데이터를 포함하지만 Pro·Flash와 구조와 능력 범위가 같다고 보면 안 된다.
세 모델의 용도는 다음처럼 나뉜다.
- 최고 성능과 복잡한 장기 작업이 우선이면 Pro
- 반복 호출, 대량 처리, 비용 통제가 우선이면 Flash
- 공개 가중치 실험과 에이전트 RL 연구가 목적이면 Distill 9B
1.02T 모델인데 한 번에 42B만 작동하는 이유
Pro와 Flash는 Sparse MoE, 즉 희소 전문가 혼합 구조를 사용한다. 모든 파라미터를 매 토큰마다 계산하지 않고 라우터가 일부 전문가를 선택한다. Pro는 384개 라우팅 전문가 중 8개, Flash는 256개 중 8개를 활성화한다. 이 방식은 방대한 지식·기능 용량과 실제 계산량 사이의 균형을 노린다.
그렇다고 42B 활성 모델이 42B 밀집 모델만큼 가볍다는 뜻은 아니다. 추론 시 선택되는 계산량과 전체 가중치를 저장·분산하는 데 필요한 메모리는 다른 문제다. 공식 SGLang 예시도 Pro는 텐서 병렬 16, 데이터 병렬 2와 2개 노드를 사용하고, Flash는 텐서 병렬 8과 데이터 병렬 2를 제시한다. 원본 가중치를 개인용 Mac이나 단일 보급형 GPU에서 간단히 실행할 수 있는 모델은 아니다.
100만 토큰 컨텍스트가 실제로 의미하는 것
Pro와 Flash의 최대 컨텍스트는 1M 토큰이고 최대 출력은 128K 토큰이다. 큰 코드 저장소, 여러 세션에 걸친 도구 기록, 장문 문서 묶음, 영상·오디오에서 추출한 토큰을 한 요청에 담을 수 있는 규모다.
하지만 1M 지원과 1M에서 항상 잘 작동은 다르다. 문맥이 길어질수록 다음 비용이 생긴다.
- 캐시가 적중하지 않으면 입력 비용이 늘어난다.
- 검색·정렬해야 할 정보가 많아져 응답 지연이 커질 수 있다.
- 오래된 지시와 최신 지시가 충돌할 가능성이 높아진다.
- 멀티모달 입력은 텍스트와 다른 방식으로 토큰화돼 예상보다 문맥을 많이 쓸 수 있다.
- 에이전트가 도구 결과를 계속 누적하면 불필요한 기록이 성능을 떨어뜨릴 수 있다.
실무에서는 전체 저장소를 매번 넣기보다 검색, 요약, 체크포인트, 컨텍스트 캐시를 함께 설계하는 편이 낫다. 1M은 컨텍스트 관리가 필요 없다는 선언이 아니라, 관리 가능한 상한이 크게 늘었다는 뜻에 가깝다.
네이티브 멀티모달과 컴퓨터 조작
공식 모델 카드는 텍스트, 이미지, 영상, 오디오를 하나의 모델에서 입력받는다고 설명한다. 시각 인코더는 681M 파라미터 MiMo ViT이며, 오디오는 308M AudioTokenizer와 127M 패치 인코더를 사용한다. 두 모델 모두 추론, 도구 호출, 스트리밍, 웹 검색, 구조화 출력과 컨텍스트 캐싱을 지원한다.
Xiaomi가 공개한 활용 범위는 일반 챗봇보다 넓다.
- 이미지·영상·문장으로 3D 게임 장면과 상호작용 로직 구성
- Blender에서 장면과 물체 모델링
- 화면을 보고 오피스·생산성 도구 조작
- 시각 피드백으로 결과 점검과 다음 행동 수정
- 문헌 검색, 계산 도구 호출과 재료 후보 선별
- Figma, 프런트엔드, 슬라이드, 영상·음악 제작 흐름
이 사례는 기능 가능성을 보여 주지만, 모든 데스크톱 환경에서 그대로 재현된다는 보증은 아니다. 컴퓨터 조작은 모델뿐 아니라 스크린 캡처, 클릭·키 입력 도구, 앱 권한, 재시도 정책과 안전 장치의 영향을 크게 받는다.

공식 라이브 RL 대시보드가 보여 준 것
MiMo-V2.6의 가장 흥미로운 부분은 결과표만 공개한 것이 아니라 학습 진행을 공식 대시보드로 노출했다는 점이다. 9월 22일 확인 시 Pro와 Flash 학습은 모두 ended 상태였고 각각 30단계를 마쳤다.
대시보드 기록은 다음과 같다.
- 모델별 1단계에 1,568개 프롬프트와 16개 rollout, 총 25,088개 trajectory 사용
- 30단계 누적 trajectory는 모델별 752,640개
- Pro 누적 학습 토큰 약 750억 개, 마지막 단계 약 34.3억 개
- Flash 누적 학습 토큰 약 814억 개, 마지막 단계 약 37.0억 개
- 추정 비용 Pro 약 262만 달러, Flash 약 85만 달러
- Pro 재시작 14회, Flash 재시작 5회
재시작 공지도 중요한 자료다. 운영진은 Pro 학습 중 전문가 부하 불균형에 따른 GPU 메모리 부족, 학습 클러스터와 평가 시스템 사이 네트워크 문제를 알렸다. Flash는 한 데이터셋의 인프라 오류가 늦게 감지돼 15단계부터 재시작됐다. 사이버보안 데이터의 좋지 않은 rollout 패턴을 발견해 후속 Pro 실행에서 제외했다는 공지도 있다.
이 기록은 대규모 RL이 한 번의 매끄러운 실행이 아니라 데이터, 분산 시스템, 평가기와 보상 설계를 계속 조정하는 엔지니어링 과정임을 보여 준다. 동시에 대시보드 수치는 Xiaomi가 운영한 시스템의 로그이므로 외부 감사나 독립 재현 결과와 같지는 않다.
자기개선이라는 표현을 어떻게 읽어야 하나
Xiaomi는 MiMo-V2.6을 reinforcement learning toward self-improvement로 설명한다. 여기서 자기개선은 모델이 스스로 무제한으로 재작성되는 뜻이 아니다. 공개된 방식은 다음에 가깝다.
- 코드·일반 업무·시각·보안 환경에서 여러 해결 경로를 생성한다.
- 테스트 통과 여부뿐 아니라 같은 그룹의 성공 경로끼리 품질을 비교한다.
- 더 짧고 효율적인 성공 경로에 유리한 보상 신호를 준다.
- 보상 해킹을 줄이기 위해 적대적 평가, 이상 감지와 검증기 교차 확인을 사용한다.
- 여러 도구 실행 프레임워크를 섞어 학습해 보지 않은 프레임워크로의 일반화를 노린다.
핵심은 평가 신호 자체를 더 정교하게 만들어 반복 학습한다는 것이다. 제품이 배포 후 사용자 몰래 자신의 가중치를 바꾼다는 뜻으로 받아들이면 안 된다.
성능표는 강하지만 아직 제작사 보고값이다
공식 모델 카드에서 Pro와 Flash는 여러 에이전트 평가에서 높은 수치를 기록했다. 예를 들어 Pro·Flash 순으로 DeepSWE v1.1은 71.9·67.9, Toolathlon-Verified는 76.9·73.6, OSWorld-Verified는 82.0·80.8, MiMo VisualCoding은 72.3·71.5다.
Flash가 Pro에 근접한 점은 인상적이다. 일부 항목에서는 Flash가 더 높다. CyberGym은 Flash 95.1, Pro 94.0으로 보고됐다. 그러나 표를 읽을 때 네 가지 제한을 같이 봐야 한다.
- 수치는 Xiaomi가 선택한 하네스와 설정으로 실행했다.
- MiMo Code Bench, MiMo Cyber Bench 등 일부는 제작사 내부 평가다.
- 모델 카드의 비교 대상도 동일 비용·지연·도구 예산으로 통일됐다고 단정할 수 없다.
- 공개 당일에는 제3자의 재현 평가와 장기간 운영 안정성 자료가 충분하지 않다.
따라서 모든 폐쇄형 모델을 이겼다보다 공개 모델 중 경쟁력 있는 초기 결과를 제시했다가 더 정확한 결론이다.
API 가격은 얼마나 저렴한가
해외 종량제 API에서 100만 토큰당 가격은 다음과 같다.
- Pro: 캐시 적중 입력 0.0036달러, 캐시 미적중 입력 0.435달러, 출력 0.87달러
- Flash: 캐시 적중 입력 0.0028달러, 캐시 미적중 입력 0.14달러, 출력 0.28달러
- Pro UltraSpeed: 캐시 적중 입력 0.036달러, 캐시 미적중 입력 4.35달러, 출력 8.70달러
예를 들어 캐시가 없는 입력 100만 토큰과 출력 10만 토큰을 사용하면 토큰 비용은 Pro 약 0.522달러, Flash 약 0.168달러다. 웹 검색은 해외 기준 1,000회당 5달러가 별도로 붙고, 검색 결과가 입력 문맥에 추가돼 토큰 비용도 늘어난다. Batch API는 Pro·Flash의 실시간 단가에서 50% 할인된다.
UltraSpeed는 Pro 능력을 유지하면서 최대 20배 빠른 출력을 목표로 하지만, 토큰 단가도 기본 Pro의 10배다. 단순히 더 좋은 옵션이라기보다 응답 지연이 사업 비용보다 중요한 서비스용이다.
한국에서 사용하는 방법
공식 접근 경로는 네 가지다.
- Xiaomi MiMo Open Platform에서 API 키를 발급받아 OpenAI 또는 Anthropic 호환 방식으로 호출
- MiMo Desktop에서 구독 또는 본인 API 키 사용
- MiMo Code, MiMo Studio, MiMo Claw 같은 공식 도구 사용
- Hugging Face 가중치를 내려받아 SGLang·vLLM으로 자체 운영
한국 사용자는 중국 본토가 아닌 해외 USD 가격을 기준으로 보되, 실제 가입·결제·지역 제공 상태를 콘솔에서 확인해야 한다. 공식 API 모델명은 모두 소문자로 mimo-v2.6-pro, mimo-v2.6-flash, mimo-v2.6-pro-ultraspeed다.
OpenAI 호환 API라는 말은 기존 SDK에서 base_url과 모델명을 바꿀 수 있다는 뜻이다. OpenAI 계정 요금제에 MiMo 사용량이 포함되거나, ChatGPT·Codex의 공식 모델 목록에 자동으로 들어간다는 뜻은 아니다. 도구 호출의 reasoning 필드, 멀티모달 파일 입력 방식과 스트리밍 이벤트는 사용하는 클라이언트에서 별도 검증해야 한다.
로컬 실행은 누구에게 현실적인가
Pro와 Flash의 원본 체크포인트는 공개됐지만 일반 PC용 모델은 아니다. 공식 SGLang 구성이 이미 여러 GPU와 병렬 실행을 전제로 한다. 양자화본이 나오더라도 전체 가중치 크기, KV 캐시, 1M 문맥과 멀티모달 인코더까지 고려하면 긴 문맥을 원활히 처리하는 데 큰 메모리가 필요하다.
개인 개발자가 시작하기에는 9B Distill 체크포인트가 더 현실적이다. 공식 모델 카드는 llama.cpp, Ollama, LM Studio용 커뮤니티 양자화 탐색 링크를 제공한다. 다만 커뮤니티 양자화는 Xiaomi 공식 API와 응답 품질, 컨텍스트 상한, 도구 호출 형식이 다를 수 있다.
오픈웨이트와 MIT 라이선스의 의미
Hugging Face의 Pro·Flash·Distill 9B 모델 카드에는 MIT 라이선스가 표시돼 있다. 이는 연구·수정·상업적 사용에 비교적 관대한 조건이다. 그러나 모든 사용에 법적 제한이 없다는 뜻은 아니다.
- 기반 모델이나 포함된 제3자 구성 요소의 조건을 별도로 확인해야 한다.
- 모델이 생성한 결과물의 저작권·초상권·상표권 책임은 사용 사례에 따라 남는다.
- API 사용은 오픈웨이트 라이선스가 아니라 Xiaomi 서비스 약관과 개인정보처리방침의 적용을 받는다.
- 보안 자동화는 허가받은 시스템에서만 수행해야 한다.
- 고위험 의사결정은 모델 출력만으로 자동화하면 안 된다.
상업 서비스에 넣기 전에는 모델 저장소의 LICENSE, 의존성, 데이터 고지, API 약관을 배포 시점 기준으로 다시 확인하는 것이 좋다.
개인정보와 기업 데이터는 어떻게 다뤄야 하나
호스팅 API에 소스코드, 고객 문서, 학생·직원 정보 또는 미공개 연구 데이터를 보내기 전에는 데이터 저장 기간, 학습 사용 여부, 처리 지역, 삭제·감사 기능과 기업용 계약 조건을 확인해야 한다. 공개된 가격표나 모델 카드만으로 이 질문들이 모두 해결되지는 않는다.
자체 호스팅은 외부 전송을 줄일 수 있지만 운영 책임이 사라지는 것은 아니다. 모델 서버 접근 제어, 로그 마스킹, 비밀키 차단, 도구 권한 최소화, 출력 검증과 사고 대응 체계가 필요하다. 특히 컴퓨터 조작과 사이버보안 기능은 모델이 강할수록 실행 권한을 좁게 설계해야 한다.
누구에게 맞는가
MiMo-V2.6 Flash는 비용을 통제하면서 코딩 에이전트, 문서 처리, 반복 도구 호출을 대량으로 수행하려는 팀에 가장 매력적이다. Pro는 더 복잡한 장기 프로젝트, 시각 자료와 도구를 함께 쓰는 연구·설계 작업에 맞는다. 이미 GPU 클러스터가 있거나 모델 내부를 연구해야 하는 조직은 공개 가중치의 이점을 크게 누릴 수 있다.
반대로 독립 검증이 충분히 쌓인 모델만 허용하는 규제 산업, 한국어 품질과 국내 데이터 처리 조건을 먼저 확정해야 하는 조직, 단일 개인용 컴퓨터에서 원본 모델을 돌리려는 사용자는 서두를 이유가 적다.
자주 묻는 질문
MiMo-V2.6은 오픈소스인가
Pro와 Flash 가중치, 기술 보고서, Distill 9B와 일부 RL 자원이 공개됐고 모델 카드에는 MIT 라이선스가 표시돼 있다. 다만 API 서비스와 제3자 의존성에는 별도 조건이 적용될 수 있다.
Pro와 Flash 중 무엇이 좋은가
최고 성능과 긴 복합 작업이 우선이면 Pro, 호출량과 가격이 중요하면 Flash가 합리적이다. 실제 업무 샘플로 품질·지연·비용을 함께 측정해야 한다.
100만 토큰을 항상 넣어도 되나
가능하다는 것과 효율적이라는 것은 다르다. 관련 자료만 검색해 넣고 캐시와 요약을 쓰는 편이 대체로 더 빠르고 저렴하다.
Mac mini에서 Pro나 Flash를 실행할 수 있나
원본 모델의 공식 배포 구성은 다중 GPU 병렬화를 전제로 한다. 개인용 Mac에서는 Distill 9B의 적절한 양자화본을 검토하는 편이 현실적이다.
한국어 성능은 좋은가
모델 카드에는 영어와 중국어가 주요 언어로 표시돼 있고, 공개 자료만으로 한국어 장문·업무 정확도를 확정하기 어렵다. 한국어 문서, 존댓말, 고유명사, 법·행정 용어로 별도 평가해야 한다.
Xiaomi의 라이브 대시보드는 아직 학습 중인가
9월 22일 확인 시 Pro와 Flash 모두 30단계를 마치고 ended 상태였다. 페이지는 실시간 방송을 마친 뒤에도 학습 로그와 평가 변화를 확인할 수 있는 기록으로 남아 있다.
결론
MiMo-V2.6은 거대한 Sparse MoE, 1M 컨텍스트와 멀티모달 입력을 저렴한 API·공개 가중치와 묶었다. 특히 Flash가 Pro에 가까운 초기 에이전트 점수를 훨씬 낮은 가격에 제시한 점과, 학습 비용·재시작·평가 변화를 공식 대시보드로 공개한 점은 주목할 만하다.
그러나 출시 당일의 성능표만으로 승자를 정하기는 이르다. 제3자 재현, 한국어 평가, 긴 문맥에서의 실제 정확도, 개인정보와 서비스 지역 조건, 도구 호출 안정성이 확인돼야 한다. 지금 가장 좋은 접근은 작은 실제 업무 평가셋으로 Pro와 Flash를 시험하고, 비용과 실패 복구까지 측정한 뒤 도입 범위를 넓히는 것이다.
상표와 이미지 안내
Xiaomi, MiMo, Qwen과 관련 상표는 각 권리자에게 속한다. 이 글은 Xiaomi의 후원이나 승인을 받은 공식 광고가 아니다. 본문 이미지는 실제 제품 화면, 상표 로고, 공식 발표 이미지 또는 제3자 사진을 복제하지 않았다.
공식 자료
- Xiaomi MiMo: MiMo-V2.6 공식 발표
- Xiaomi MiMo: 공식 라이브 RL 대시보드
- Xiaomi MiMo: MiMo-V2.6-Pro 모델·가격
- Xiaomi MiMo: MiMo-V2.6-Flash 모델·가격
- Hugging Face: MiMo-V2.6-Pro-RL 모델 카드
- Hugging Face: MiMo-V2.6-Flash-RL 모델 카드
- Hugging Face: MiMo-V2.6-Distill-Qwen-9B
- Xiaomi MiMo: Batch API 가격
- Xiaomi MiMo: 웹 검색 지원 모델과 요금



