새로 나온 모델 · 2026.09.12
DeepSeek V4.1 Flash 로컬 실행: 552B보다 먼저 볼 숫자
DeepSeek V4.1 Flash는 입력 처리 때 8B, 답변 생성 때 16B만 활성화한다고 소개됩니다. 그러나 이것은 가중치 용량이 8GB나 16GB라는 뜻이 아닙니다. 공식 배포본은 552B 백본에 196B Engram을 더한 구조이며 다운로드 크기만 약 475.2GiB입니다. 지금 개인 장비에서 시험하려면 모델 성능표보다 파일, 메모리 배치, 개발 브랜치의 제약을 먼저 봐야 합니다.
552B, 196B, 8B와 16B는 서로 다른 숫자입니다
552B는 40개 층으로 이뤄진 백본의 파라미터 수입니다. 여기에 두 개의 큰 Engram 테이블 196B가 붙고, 비전 인코더와 투영층, 추측 디코딩용 구성도 체크포인트에 포함됩니다. 따라서 552B를 곧 모델 전체 크기로 쓰거나, 552B와 196B의 단순 합만으로 파일 크기를 예측하면 실제 배포본과 어긋날 수 있습니다.
입력 처리에서 8B, 생성에서 16B가 활성화된다는 설명은 토큰마다 계산에 참여하는 백본 경로를 가리킵니다. 저장장치와 메모리에는 선택되지 않은 전문가 가중치도 존재해야 합니다. 특히 8B나 16B를 VRAM 요구량으로 바꾸는 것은 잘못된 계산입니다.

Engram은 흔히 말하는 작은 n-gram 캐시가 아닙니다
Engram은 토큰 n-gram을 해시해 두 개의 FP8 테이블에서 행을 찾아 잔차 스트림에 결합하는 학습된 조건부 메모리입니다. 한 단계에서 읽는 행은 적지만 테이블 전체는 약 189GiB를 차지합니다. 프롬프트 캐시처럼 지워도 되는 임시 데이터나, 일반적인 PLE 기능과 같은 것으로 보면 안 됩니다.
SGLang의 초기 구현은 Engram 테이블을 호스트 메모리로 옮길 수 있습니다. 이 방식은 GPU 공간을 늘리지만 시스템 메모리와 CPU-GPU 연결 조건을 요구하며, 모델 나머지 부분이나 KV 캐시까지 사라지게 하지는 않습니다. ‘오프로딩 지원’이라는 한마디만 보고 작은 GPU 한 장에서 된다고 결론 내리면 안 됩니다.
공식 파일은 475.2GiB이고, 실행에는 더 필요합니다
공식 배포본은 FP8, FP4, BF16과 일부 정밀도가 섞인 체크포인트이며 다운로드 크기는 약 475.2GiB입니다. 이것은 폴더를 저장할 최소치에 가깝습니다. 변환본을 만들면 원본과 결과 파일이 동시에 필요할 수 있고, 실행 중에는 프로그램, 작업 버퍼, 이미지 처리와 문맥 길이에 따른 KV 캐시 공간이 더해집니다.
서드파티 Q2_K 파일은 약 246.3GiB까지 줄어든 사례가 있지만 현재 llama.cpp 정식 지원을 뜻하지 않습니다. 확인된 것은 제한된 포크의 짧은 텍스트 스모크 테스트이며, 16K를 넘는 경로, 비전, MTP, 품질 비교가 완료되지 않았습니다. 이 숫자를 최소 권장 메모리나 완성된 개인용 배포판으로 소개하기에는 이릅니다.

지금은 런타임 이름보다 브랜치를 확인해야 합니다
공개 직후 검증된 중심 경로는 SGLang과 vLLM의 전용 개발 이미지나 브랜치이며 H200, B300, GB300 같은 다중 GPU 환경입니다. 모델 페이지의 간단한 설치 명령은 출발점일 뿐, 모든 정식 릴리스와 모든 하드웨어에서 같은 기능이 된다는 보증이 아닙니다. 도구 호출, 이미지 입력, 긴 문맥까지 쓸 계획이면 정확한 커밋과 배포 레시피를 함께 기록하세요.
llama.cpp와 MLX 모두 전용 포크나 사용자 정의 런타임에서 실제 실행 사례가 나왔지만, 일반 설치 경로로 확대해석하면 안 됩니다. M3 Ultra 256GB의 MLX 2-bit는 16토큰 입력과 23개 시간 측정 디코드 단계에서 8.8 tok/s였고, 런타임 문맥 상한은 128토큰입니다. RTX 5090도 128GB RAM과 PCIe 5 NVMe를 함께 쓴 원본 혼합 FP4/FP8 스트리밍에서 새 입력 기준 5.1 tok/s가 측정됐습니다. 두 경로 모두 프리필은 미측정입니다.
Spark 경로도 한 가지가 아닙니다. 한 대에서는 Q2_K를 CPU mmap으로 읽는 CUDA-cmoe 실험이 프리필 1.9 tok/s, 디코드 2.8 tok/s를 보고했습니다. 원본 혼합 FP4/FP8과 전용 분산 런타임을 쓰는 3대 구성은 디코드 37.9 tok/s만 공개됐고, 4대 구성은 디코드 43.12 tok/s와 별도의 차가운 프리필 기준점을 공개했습니다. 프리필이 없는 경로에는 TTFT를 만들어 넣지 않으며, 노드 수와 포맷이 다른 수치를 서로 옮기지 않습니다.
DSpark 속도는 조건표와 함께 읽습니다
DSpark는 체크포인트에 포함된 다단계 예측 구성을 이용해 여러 토큰을 제안하고 검증하는 추측 디코딩 방식입니다. 초기 SGLang 측정에서는 4대의 B300과 특정 개발 브랜치, 고정된 반복형 기상 노트 입력을 사용했습니다. 이 결과는 기능이 실제로 작동한다는 좋은 근거지만, 소비자 GPU 한 장이나 다른 질문에서도 같은 속도가 나온다는 뜻은 아닙니다.
조합 제약도 남아 있습니다. SGLang의 인코더 SWA bounded replay는 추측 디코딩과 함께 쓸 수 없고, 프리필·디코드 분리와 DSpark의 결합도 아직 진행 중입니다. vLLM에서는 DSpark를 켠 상태의 CPU KV 오프로딩 오류가 보고됐습니다. 구매 판단에서는 최고 속도 대신 내가 필요한 오프로딩, 긴 문맥, 이미지 입력을 동시에 통과한 공개 측정이 나올 때까지 기다리는 편이 안전합니다.

수정 내역
사이트의 안내가 바뀐 기록입니다. 설치된 엔진·모델 버전을 자동으로 확인한 결과는 아닙니다.
새 모델의 단일 Spark 실행 경로 추가
DeepSeek과 Ling의 공개 단일 Spark 측정을 속도 체감에 연결했습니다. 확인되지 않은 장비에는 같은 속도나 실행 명령을 적용하지 않습니다.