새로 나온 모델 · 2026.09.12
Ling-3.0-flash-VL 로컬 실행: INT4 70.87GiB부터 확인할 것
Ling-3.0-flash-VL은 이미지와 영상을 읽는 약 124.85B MoE 모델입니다. 활성 파라미터는 SGLang 실행 안내 기준 약 5.1B로, 실제로 저장할 가중치 크기와는 다릅니다. 공식 INT4 파일은 약 70.87GiB입니다. DGX Spark 한 대의 공개 측정도 있어, 이제 양자화 형식에 따른 답변 속도를 직접 비교해 볼 수 있습니다.
124.85B 전체와 5.1B 활성은 함께 읽어야 합니다
Ling-3.0-flash-VL은 전문가 일부를 선택해 계산하는 MoE 모델입니다. 124.85B는 모델 전체의 파라미터 수이고 5.1B는 한 토큰을 처리할 때 활성화되는 부분입니다. 후자는 계산량을 이해하는 데 도움을 주지만, 선택되지 않은 전문가 가중치도 저장하고 실행 중 접근할 수 있어야 합니다.
따라서 5.1B를 소형 밀집 모델처럼 보고 일반 노트북 메모리를 정하면 안 됩니다. 파일을 담는 공간 외에도 런타임, 작업 버퍼와 KV 캐시가 필요합니다. 특히 256K 문맥을 끝까지 열면 짧은 대화보다 훨씬 큰 캐시 여유가 필요하므로 문맥 상한과 평소 입력 길이를 구분해야 합니다.

BF16, INT4와 FP4는 파일 크기부터 다릅니다
공식 저장소의 파일을 합치면 BF16은 약 232.55GiB, INT4는 70.87GiB, FP4는 64.81GiB입니다. 이 수치는 다운로드와 보관 계획의 출발점입니다. 실제 실행에는 추가 여유가 필요하고, 변환 작업을 한다면 원본과 결과 파일을 동시에 보관할 공간도 고려해야 합니다.
공식 FP4라는 표시는 NVIDIA NVFP4 파일이나 GGUF라는 뜻이 아니며, INT4도 모든 엔진의 4비트 로더와 자동 호환되지 않습니다. 이름이 같은 비트 수라도 스케일 방식과 커널 요구가 다를 수 있습니다. 다운로드 전에는 해당 배포본을 지원하는 정확한 서버 이미지와 명령을 확인하세요.

영상 입력과 영상 생성은 다른 기능입니다
이 모델은 텍스트와 함께 이미지나 영상 프레임을 입력해 내용을 이해하고 텍스트로 답하는 비전·언어 모델입니다. 동영상을 새로 만들어 내는 생성 모델은 아닙니다. 제품 영상 요약이나 장면 질의가 목적이라면 후보가 될 수 있지만, 영상 생성 시간을 비교하려는 경우에는 다른 모델군을 찾아야 합니다.
SGLang 실행 설정은 기본 128K 문맥이며 256K는 YaRN 확장 설정입니다. 영상 프레임과 긴 문서가 모두 같은 입력 예산과 메모리를 사용하므로 프레임 수, 해상도, 텍스트 길이를 한꺼번에 최대치로 올리지 말고 실제 작업 하나로 시작하세요.
DGX Spark 한 대에서는 얼마나 빠를까
SGLang 공식 실행 가이드에는 DGX Spark 한 대의 INT4와 MXFP4 측정이 있습니다. 입력 8,192토큰, 출력 1,024토큰, 동시 요청 한 개에서 토큰 사이 지연 시간의 중앙값은 INT4 44.18ms, MXFP4 30.18ms였습니다. 답변 생성 속도로 바꾸면 각각 약 22.6 tok/s, 33.1 tok/s입니다. MXFP4와 NVFP4는 이름이 비슷하지만 다른 형식이므로 같은 옵션으로 취급하지 않습니다.
같은 조건에서 첫 토큰까지의 중앙값은 INT4 약 2.89초, MXFP4 약 2.54초였습니다. 우리 사이트에서는 이 8K 입력 측정을 기준으로 프리필과 디코드를 나눠 체감할 수 있습니다. 입력 길이를 바꾼 값은 추정이며, 이 텍스트 측정에 이미지 전처리 시간은 포함하지 않습니다. 다른 GPU나 Mac에 같은 속도를 옮겨 적용하지도 않습니다.

수정 내역
사이트의 안내가 바뀐 기록입니다. 설치된 엔진·모델 버전을 자동으로 확인한 결과는 아닙니다.
새 모델의 단일 Spark 실행 경로 추가
DeepSeek과 Ling의 공개 단일 Spark 측정을 속도 체감에 연결했습니다. 확인되지 않은 장비에는 같은 속도나 실행 명령을 적용하지 않습니다.