새로 나온 모델 · 2026-09-04

Qwen3.8-Flash-Next 공개: 활성 6B인데 왜 180B를 담아야 하나

활성 6B라는 설명을 보면 가벼운 모델처럼 느껴집니다. 그런데 파일은 훨씬 크고 128GB 장비에서도 특별한 설정이 필요하다고 합니다. Qwen3.8-Flash-Next를 이해하려면 계산할 부분과 보관할 부분이 왜 다른지부터 나누어야 합니다.

작다는 말이 가리키는 부분

Flash-Next는 일부 전문가를 선택해 계산하는 MoE 구조입니다. 활성 규모는 한 토큰에서 쓰는 경로를 설명합니다. 모델의 전체 가중치를 그만큼만 내려받거나 작은 GPU에 담아도 된다는 뜻은 아닙니다.

이 모델의 등록 구성은 코어 LM 약 125B, PLE 계열 테이블 약 51B, MTP 약 4B를 구분합니다. 합계 약 180B의 보관 규모와 토큰당 약 6B 활성 수치를 같은 용량 칸에 넣으면 장비 요구량을 크게 오해할 수 있습니다.

대형 가중치 보관 벽에서 일부 모듈만 작업등 아래 활성화된 희소 모델 작업실 사진
토큰마다 약 6B만 활성화돼도 전체 가중치는 접근 가능한 메모리나 저장장치에 있어야 하므로 작은 모델처럼 적재할 수는 없습니다.

큰 테이블을 다른 곳에 두는 방법

PLE 테이블을 RAM이나 SSD에 배치하는 지원 경로가 있으면 고속 메모리의 부담을 줄일 수 있습니다. 이것은 디코드 후보를 만드는 반복 문구 가속과 다릅니다. MTP는 후보 예측, PLE 오프로드는 저장 위치라는 역할을 나누어 봐야 합니다.

저장 위치를 바꾸면 조회와 전송 비용이 생길 수 있습니다. 특히 SSD 경로는 첫 접근과 캐시가 남은 반복 접근의 차이가 큽니다. 모델이 실행된다는 장점과 평소 질문이 빨리 끝난다는 장점을 별도로 확인해야 합니다.

가속기와 시스템 메모리, 저장장치가 세 층으로 나뉜 대형 모델 적재 작업대 사진
코어 모델과 PLE 테이블, 캐시의 위치를 나누면 제한된 고속 메모리에서도 실행 경로를 만들 수 있지만 저장장치 전송 지연이 붙습니다.

단일 Spark 기록은 실행 묶음으로 읽습니다

단일 DGX Spark의 실험 경로는 특정 NVFP4 체크포인트와 PLE mmap 패치 같은 구성을 사용합니다. 명령어 한 줄이나 토큰 속도만 가져오면 필요한 파일과 패치가 빠질 수 있습니다. 일반 설치로 바로 재현된다는 뜻은 아닙니다.

같은 128GB 안에서 GPU와 CPU의 위치만 바꾸는 것은 물리 메모리를 늘리지 않습니다. 어떤 부분이 NVMe에 있는지, 나머지 가중치와 캐시가 어디에 있는지를 확인해야 단일 장비 경로가 왜 가능한지 이해할 수 있습니다.

짧은 고속 케이블로 연결된 두 대의 동일한 소형 AI 컴퓨터 사진
두 노드 구성은 한 대보다 넉넉하게 모델을 나눠 담지만, 한 답변 속도는 연결 비용 때문에 장비 수만큼 늘지 않습니다.

두 대를 연결할 때 얻는 것은 무엇일까요?

두 노드에 나눠 담으면 공간의 여유를 늘릴 수 있습니다. 반면 계산 중 결과를 주고받는 시간이 추가됩니다. 한 답변의 속도가 정확히 두 배가 되는 것은 아니며, 모델 분할과 연결·가속 설정에 따라 달라집니다.

두 대 결과와 한 대 결과를 비교할 때는 모델 파일과 MTP, 입력 길이를 맞춰야 합니다. 서로 다른 압축본의 최고 기록을 장비 수의 효과로만 설명하면 다음 구매에서도 같은 차이를 기대하게 됩니다.

이 실험이 내게 필요한지

새 실행 경로를 만들어보고 큰 모델을 다루는 것 자체가 목적이라면 충분히 흥미로운 선택입니다. 하지만 매일 문서와 코드를 처리할 도구가 필요하다면 설치와 복구, 업데이트 부담도 함께 봐야 합니다.

이미 작은 모델로 되는 일을 위해 복잡성을 늘릴 필요는 없습니다. 반대로 이 모델에서만 얻는 결과가 있다면 해당 레시피의 조건을 확인하고 예상 체감을 비교하세요. ‘돌릴 수 있다’ 다음에 ‘내가 계속 쓸 수 있다’가 남아 있는 모델입니다.