새로 나온 모델 · 2026.09.22

MiMo V2.6 Pro·Flash 동시 공개: 성능은 어디까지 왔나

MiMo V2.6 소식을 한 줄로 옮기면 Pro만 나온 것처럼 보이기 쉽습니다. 실제 발표는 Pro와 Flash가 한 묶음입니다. Pro는 1조 파라미터를 넘는 상위 모델이고, Flash는 전체 규모를 약 309B로 줄였습니다. 그런데 샤오미가 공개한 코딩과 에이전트 평가에서는 두 모델의 차이가 이름에서 느껴지는 것만큼 크지 않습니다. 이 글은 최고 점수만 늘어놓지 않습니다. 어떤 시험에서 강했고, Flash가 왜 함께 볼 만한지, 가중치를 직접 운영하려면 어느 정도 장비를 생각해야 하는지 차례로 살펴봅니다.

핵심 내용

01
Pro와 Flash는 2026년 9월 21일 함께 공개됐으며, 둘 다 텍스트·이미지·비디오·오디오 입력과 1M 문맥을 지원합니다.
02
Pro는 전체 1.02T·활성 42B, Flash는 전체 309B·활성 15B의 희소 MoE이며 둘 다 5단 MTP 디코더를 사용합니다.
03
공식 표에서 DeepSWE v1.1은 Pro 71.9·Flash 67.9, AutomationBench는 53.1·52.3, OSWorld Verified는 82.0·80.8입니다.

Pro와 Flash는 같은 날 나온 두 모델입니다

MiMo V2.6의 중심은 Pro 하나가 아닙니다. 샤오미는 2026년 9월 21일 Pro-RL과 Flash-RL을 함께 공개했습니다. Pro는 총 1.02T 가운데 토큰마다 약 42B가 활성화되고, Flash는 총 309B 가운데 약 15B가 활성화됩니다. 둘 다 전문가 전체를 보관하되 요청마다 일부 경로를 골라 계산하는 희소 MoE입니다. Flash의 15B를 일반 15B 밀집 모델의 파일 크기로 읽으면 실행 조건을 크게 잘못 잡게 됩니다.

구조도 닮았습니다. Pro는 70개 층, Flash는 48개 층이며 각각 다수의 짧은 창 어텐션 층 사이에 전역 어텐션을 둡니다. 전문가 수는 Pro 384개, Flash 256개이고 한 토큰에는 8개가 선택됩니다. 답변을 한 토큰씩만 예측하지 않도록 두 모델 모두 5단 MTP 디코더를 붙였습니다. 따라서 Flash는 Pro에서 기능을 많이 덜어낸 체험판이라기보다, 같은 설계를 더 작은 운영 단위로 맞춘 모델에 가깝습니다.

같은 설계의 큰 희소 모델과 중간 크기 희소 모델에서 일부 전문가 서랍만 켜진 작업실
Pro와 Flash는 같은 희소 MoE 계열이지만 전체 보관 규모와 토큰당 활성 계산량이 다릅니다.

성능표에서 먼저 볼 코딩과 에이전트 작업

공식 발표에서 가장 눈에 띄는 부분은 저장된 지식을 묻는 시험보다 실제 도구를 쓰는 작업입니다. DeepSWE v1.1은 Pro 71.9, Flash 67.9이고 ProgramBench는 26.5와 26.0입니다. AutomationBench는 53.1과 52.3, Toolathlon은 76.9와 73.6입니다. Pro가 앞서지만 Flash가 모델 규모 차이만큼 멀리 떨어지지는 않았습니다. 여러 파일을 고치고 도구를 호출하는 작업을 염두에 둔 모델이라는 설명과 성능표가 같은 방향을 가리킵니다.

컴퓨터 사용 평가에서도 간격은 좁습니다. OSWorld Verified는 Pro 82.0, Flash 80.8이고 JobBench는 62.0과 61.2입니다. Terminal Bench 2.1은 89.9와 87.6, Visual Coding은 72.3과 71.5입니다. 반대로 Terminal Bench 4.0에서는 34.9와 28.8로 차이가 커집니다. 모든 시험에서 Flash가 Pro와 같다고 말할 수는 없습니다. 다만 비용과 처리량까지 함께 보는 운영 환경에서는 Flash가 별도 후보가 될 만큼 가까운 구간이 많습니다.

하나의 계산 장치가 코드 편집과 브라우저 조작, 작업 검증 도구로 갈라지는 에이전트 작업대
공식 성능표에서 두 모델의 강점은 긴 문장 생성보다 코드 수정과 도구 사용, 컴퓨터 조작에서 두드러집니다.

Flash가 성능을 많이 남긴 방법

Flash의 전체 가중치는 Pro의 약 30%이고 활성 계산량은 약 36%입니다. 그렇다고 공개 점수가 같은 비율로 줄지는 않았습니다. 두 모델이 같은 입력 형식과 긴 문맥, 도구 사용 학습 방식을 공유하고, Flash에도 충분한 전문가 수와 MTP 디코더를 남긴 영향으로 볼 수 있습니다. 특히 CyberGym에서는 Flash 95.1이 Pro 94.0보다 높고 ProgramBench 차이는 0.5점입니다. 큰 모델이 언제나 모든 작업에서 앞선다는 식으로 읽기 어려운 결과입니다.

여기서 Flash라는 이름을 응답 지연이 짧다는 보증으로 받아들이면 곤란합니다. 실제 속도는 가중치 정밀도, 텐서·전문가 병렬 방식, 연결 대역폭, MTP 승인률과 동시 요청 수에 따라 달라집니다. 공식 카드는 Flash에 SGLang TP8·DP2 예시와 vLLM TP4 예시를 제공합니다. 이는 단일 소비자 GPU 최고 속도보다 여러 가속기에 나눠 안정적으로 서비스하는 방법을 먼저 제시한 구성입니다.

텍스트 모델 하나로만 보면 놓치는 부분

두 모델은 텍스트뿐 아니라 이미지·비디오·오디오를 입력으로 받습니다. 약 681M 비전 인코더와 오디오 토크나이저·패치 인코더를 함께 쓰며, 네이티브 문맥은 1,048,576토큰입니다. 코드 저장소를 살펴보면서 화면 캡처를 읽거나, 영상과 음성을 같은 작업 흐름에 넣는 용도를 한 모델로 다루려는 설계입니다. 멀티모달을 별도 기능처럼 덧붙인 모델과는 출발점이 다릅니다.

1M 문맥도 처음부터 최대치로 켤 기본 설정은 아닙니다. 긴 입력은 KV 캐시와 프리필 시간을 늘리고, 이미지·비디오·오디오 토큰까지 더해지면 요청 하나의 부담이 커집니다. 실제 운영에서는 자주 쓰는 문서 길이와 동시 사용자 수를 정한 뒤 필요한 캐시를 계산해야 합니다. 긴 문맥을 지원한다는 사실과 1M 입력을 낮은 지연으로 계속 처리한다는 사실은 다른 장비 조건입니다.

로컬 실행은 데스크톱보다 서버에 가깝습니다

공식 저장소의 파일을 합치면 Flash 가중치는 약 177.7GB, Pro는 약 573.5GB입니다. 여기에 KV 캐시와 런타임 작업 공간이 더 필요합니다. 32GB나 48GB 그래픽카드 한 장에 활성 파라미터만 올리고 나머지를 생략하는 모델이 아닙니다. Flash조차 여러 대의 고메모리 가속기나 대용량 통합 메모리 서버를 전제로 살펴봐야 합니다.

Pro의 공식 SGLang 예시는 두 노드와 TP16·EP16을 사용하고, vLLM 예시는 TP8입니다. Flash도 공식 예시가 TP4 이상입니다. 가중치가 공개돼 외부 API 없이 직접 운영할 수 있다는 점에서는 로컬 AI가 맞습니다. 다만 여기서 로컬은 책상 위 PC 한 대보다 조직 내부의 멀티 GPU 서버를 가리키는 경우가 많습니다. 공개 가중치와 개인용 모델을 같은 말로 쓰지 않는 편이 정확합니다.

큰 가중치 보관함의 여러 묶음이 여섯 개 가속기 모듈에 나뉘어 연결된 작업대
Flash도 공식 가중치가 약 177.7GB이므로 개인용 GPU 한 장보다 여러 가속기에 나눠 싣는 서버 구성이 현실적입니다.

어떤 경우에 Flash부터 검토할까

한두 명이 최고 성능을 쓰는 연구 환경이라면 Pro가 비교의 기준이 됩니다. 여러 사용자의 코딩 에이전트와 자동화 요청을 받아야 하고, Pro와의 점수 차이가 작은 작업이 중심이라면 Flash가 현실적인 출발점입니다. 같은 서버 비용에서 더 많은 요청을 받거나 첫 배치를 작게 시작할 여지가 생기기 때문입니다. 반대로 Terminal Bench 4.0처럼 차이가 큰 작업이 중요하다면 Pro를 직접 검증해야 합니다.

두 모델 모두 새 장비를 먼저 사서 확인할 규모는 아닙니다. 현재 업무에서 실패하던 저장소 수정, 브라우저 조작, 보안 분석 사례를 평가 묶음으로 만들고 임대 서버나 기존 클러스터에서 먼저 비교하는 편이 안전합니다. 공개 점수는 시작할 후보를 줄여줍니다. 최종 선택은 내 작업의 성공률, 한 요청의 지연, 동시에 받을 수 있는 요청 수와 운영비를 함께 기록한 뒤에 내려야 합니다.