새로 나온 모델 · 2026-09-04
Qwen3.8-Flash-Next 공개: 활성 6B인데 왜 180B를 담아야 하나
활성 6B라는 설명을 보면 가벼운 모델처럼 느껴집니다. 그런데 파일은 훨씬 크고 128GB 장비에서도 특별한 설정이 필요하다고 합니다. Qwen3.8-Flash-Next를 이해하려면 계산할 부분과 보관할 부분이 왜 다른지부터 나누어야 합니다.
작다는 말이 가리키는 부분
Flash-Next는 일부 전문가를 선택해 계산하는 MoE 구조입니다. 활성 규모는 한 토큰에서 쓰는 경로를 설명합니다. 모델의 전체 가중치를 그만큼만 내려받거나 작은 GPU에 담아도 된다는 뜻은 아닙니다.
이 모델의 등록 구성은 코어 LM 약 125B, PLE 계열 테이블 약 51B, MTP 약 4B를 구분합니다. 합계 약 180B의 보관 규모와 토큰당 약 6B 활성 수치를 같은 용량 칸에 넣으면 장비 요구량을 크게 오해할 수 있습니다.

큰 테이블을 다른 곳에 두는 방법
PLE 테이블을 RAM이나 SSD에 배치하는 지원 경로가 있으면 고속 메모리의 부담을 줄일 수 있습니다. 이것은 디코드 후보를 만드는 반복 문구 가속과 다릅니다. MTP는 후보 예측, PLE 오프로드는 저장 위치라는 역할을 나누어 봐야 합니다.
저장 위치를 바꾸면 조회와 전송 비용이 생길 수 있습니다. 특히 SSD 경로는 첫 접근과 캐시가 남은 반복 접근의 차이가 큽니다. 모델이 실행된다는 장점과 평소 질문이 빨리 끝난다는 장점을 별도로 확인해야 합니다.

단일 Spark 기록은 실행 묶음으로 읽습니다
단일 DGX Spark의 실험 경로는 특정 NVFP4 체크포인트와 PLE mmap 패치 같은 구성을 사용합니다. 명령어 한 줄이나 토큰 속도만 가져오면 필요한 파일과 패치가 빠질 수 있습니다. 일반 설치로 바로 재현된다는 뜻은 아닙니다.
같은 128GB 안에서 GPU와 CPU의 위치만 바꾸는 것은 물리 메모리를 늘리지 않습니다. 어떤 부분이 NVMe에 있는지, 나머지 가중치와 캐시가 어디에 있는지를 확인해야 단일 장비 경로가 왜 가능한지 이해할 수 있습니다.

두 대를 연결할 때 얻는 것은 무엇일까요?
두 노드에 나눠 담으면 공간의 여유를 늘릴 수 있습니다. 반면 계산 중 결과를 주고받는 시간이 추가됩니다. 한 답변의 속도가 정확히 두 배가 되는 것은 아니며, 모델 분할과 연결·가속 설정에 따라 달라집니다.
두 대 결과와 한 대 결과를 비교할 때는 모델 파일과 MTP, 입력 길이를 맞춰야 합니다. 서로 다른 압축본의 최고 기록을 장비 수의 효과로만 설명하면 다음 구매에서도 같은 차이를 기대하게 됩니다.
이 실험이 내게 필요한지
새 실행 경로를 만들어보고 큰 모델을 다루는 것 자체가 목적이라면 충분히 흥미로운 선택입니다. 하지만 매일 문서와 코드를 처리할 도구가 필요하다면 설치와 복구, 업데이트 부담도 함께 봐야 합니다.
이미 작은 모델로 되는 일을 위해 복잡성을 늘릴 필요는 없습니다. 반대로 이 모델에서만 얻는 결과가 있다면 해당 레시피의 조건을 확인하고 예상 체감을 비교하세요. ‘돌릴 수 있다’ 다음에 ‘내가 계속 쓸 수 있다’가 남아 있는 모델입니다.