[
  {
    "url": "https://localai.co.kr/models/qwen-3.8-27b",
    "modelId": "qwen-3.8-27b",
    "slug": "qwen-3.8-27b",
    "title": "Qwen3.8 27B 로컬 LLM 권장 사양·속도·양자화",
    "description": "Qwen3.8 27B Q4 실행에 필요한 약 18GB 메모리와 장비별 프리필, 토큰 생성 속도, 양자화 및 262,144 토큰 문맥 조건을 비교합니다.",
    "headline": "27B 밀도형 모델, 최소 메모리와 체감 속도를 함께 보세요.",
    "decisionLine": "27B 밀도형 오픈 가중치 모델로 다단계 MTP(다중 토큰 예측) 학습 헤드가 내장되어 있습니다. 네이티브 262,144(256K) 토큰 컨텍스트를 지원합니다.",
    "minimumMemoryGB": 18,
    "recommendedHardwareIds": [
      "nvidia-rtx-5060-ti-16gb",
      "nvidia-dual-rtx-5090-64gb",
      "macbook-air-m4-24gb"
    ],
    "model": {
      "id": "qwen-3.8-27b",
      "name": "Qwen3.8 27B",
      "family": "Qwen",
      "developer": "Alibaba Cloud",
      "architecture": "dense",
      "totalParamsB": 27,
      "activeParamsB": 27,
      "nativeContextTokens": 262144,
      "simulationContextTokens": 4096,
      "badge": "커뮤니티 주류",
      "description": "27B 밀도형 오픈 가중치 모델로 다단계 MTP(다중 토큰 예측) 학습 헤드가 내장되어 있습니다. 네이티브 262,144(256K) 토큰 컨텍스트를 지원합니다.",
      "supportedQuantizations": [
        "Q4_K_M",
        "Q8_0",
        "FP16"
      ],
      "supportsNgram": true,
      "supportsMtp": true,
      "supportsDraftModel": true,
      "mtpNotes": "내장 다단계 MTP 헤드 지원 (CUDA vLLM/SGLang 및 MLX 지원)",
      "sourceUrl": "https://huggingface.co/Qwen/Qwen3.8-27B",
      "sourceLabel": "Hugging Face / Qwen3.8-27B 공식 리포지토리",
      "retrievedAt": "2026-08-31",
      "releaseStatus": "공식 배포 모델",
      "sourceClassification": "공식 모델 카드 및 가중치"
    },
    "updatedAt": "2026-09-01"
  },
  {
    "url": "https://localai.co.kr/models/qwen-3.8-flash-next",
    "modelId": "qwen-3.8-flash-next",
    "slug": "qwen-3.8-flash-next",
    "title": "Qwen3.8-Flash-Next 로컬 LLM 권장 사양·속도·양자화",
    "description": "Qwen3.8-Flash-Next Q4 실행에 필요한 약 108GB 메모리와 장비별 프리필, 토큰 생성 속도, 양자화 및 262,144 토큰 문맥 조건을 비교합니다.",
    "headline": "총 125B 중 토큰당 6B가 활성화되는 MoE 모델, 최소 메모리와 체감 속도를 함께 보세요.",
    "decisionLine": "125B 코어 LM(6B 활성)과 아키텍처 내장 51B n-gram 임베딩 및 4B MTP로 구성된 약 180B 상주 가중치 MoE 모델입니다. 내장 51B n-gram 테이블은 아키텍처 구성 요소이며 UI의 선택형 투기 디코딩 토글과 별개입니다.",
    "minimumMemoryGB": 108,
    "recommendedHardwareIds": [
      "nvidia-a40-48gb",
      "mac-studio-m5-ultra-256gb",
      "macbook-pro-m3-max-128gb"
    ],
    "model": {
      "id": "qwen-3.8-flash-next",
      "name": "Qwen3.8-Flash-Next",
      "family": "Qwen",
      "developer": "Alibaba Cloud",
      "architecture": "moe",
      "totalParamsB": 125,
      "activeParamsB": 6,
      "residentParamsB": 180,
      "nativeContextTokens": 262144,
      "simulationContextTokens": 4096,
      "description": "125B 코어 LM(6B 활성)과 아키텍처 내장 51B n-gram 임베딩 및 4B MTP로 구성된 약 180B 상주 가중치 MoE 모델입니다. 내장 51B n-gram 테이블은 아키텍처 구성 요소이며 UI의 선택형 투기 디코딩 토글과 별개입니다.",
      "supportedQuantizations": [
        "Q4_K_M",
        "Q8_0",
        "FP16"
      ],
      "supportsNgram": true,
      "supportsMtp": true,
      "supportsDraftModel": false,
      "mtpNotes": "내장 4B MTP 모듈 및 QSA 최적화 경로 지원",
      "sourceUrl": "https://huggingface.co/Qwen/Qwen3.8-Flash-Next",
      "sourceLabel": "Hugging Face / Qwen3.8-Flash-Next 공식 리포지토리",
      "retrievedAt": "2026-08-31",
      "releaseStatus": "공식 배포 모델",
      "sourceClassification": "공식 모델 카드 및 가중치"
    },
    "updatedAt": "2026-09-01"
  },
  {
    "url": "https://localai.co.kr/models/gemma-4-12b",
    "modelId": "gemma-4-12b",
    "slug": "gemma-4-12b",
    "title": "Gemma 4 12B 로컬 LLM 권장 사양·속도·양자화",
    "description": "Gemma 4 12B Q4 실행에 필요한 약 8GB 메모리와 장비별 프리필, 토큰 생성 속도, 양자화 및 262,144 토큰 문맥 조건을 비교합니다.",
    "headline": "11.95B 밀도형 모델, 최소 메모리와 체감 속도를 함께 보세요.",
    "decisionLine": "11.95B 파라미터 밀도형 단일 모델로 256K(262,144) 네이티브 컨텍스트를 지원합니다. 16GB~24GB GPU 및 Mac 환경에서 고속 단독 구동이 가능합니다.",
    "minimumMemoryGB": 8,
    "recommendedHardwareIds": [
      "mac-mini-m4-16gb",
      "nvidia-dual-rtx-5090-64gb",
      "macbook-air-m4-16gb"
    ],
    "model": {
      "id": "gemma-4-12b",
      "name": "Gemma 4 12B",
      "family": "Gemma",
      "developer": "Google DeepMind",
      "architecture": "dense",
      "totalParamsB": 11.95,
      "activeParamsB": 11.95,
      "nativeContextTokens": 262144,
      "simulationContextTokens": 4096,
      "description": "11.95B 파라미터 밀도형 단일 모델로 256K(262,144) 네이티브 컨텍스트를 지원합니다. 16GB~24GB GPU 및 Mac 환경에서 고속 단독 구동이 가능합니다.",
      "supportedQuantizations": [
        "Q4_K_M",
        "Q8_0",
        "FP16"
      ],
      "supportsNgram": true,
      "supportsMtp": true,
      "supportsDraftModel": true,
      "mtpNotes": "외부 Gemma 4 assistant drafter 기반 VLM MTP; 별도 drafter 체크포인트 필요",
      "sourceUrl": "https://huggingface.co/google/gemma-4-12B",
      "sourceLabel": "Hugging Face / Google Gemma 4 12B 공식 리포지토리",
      "retrievedAt": "2026-08-31",
      "releaseStatus": "공식 배포 모델",
      "sourceClassification": "공식 모델 카드 및 가중치"
    },
    "updatedAt": "2026-09-01"
  },
  {
    "url": "https://localai.co.kr/models/gemma-4-26b-a4b",
    "modelId": "gemma-4-26b-a4b",
    "slug": "gemma-4-26b-a4b",
    "title": "Gemma 4 26B-A4B (MoE) 로컬 LLM 권장 사양·속도·양자화",
    "description": "Gemma 4 26B-A4B (MoE) Q4 실행에 필요한 약 16GB 메모리와 장비별 프리필, 토큰 생성 속도, 양자화 및 262,144 토큰 문맥 조건을 비교합니다.",
    "headline": "총 25.2B 중 토큰당 3.8B가 활성화되는 MoE 모델, 최소 메모리와 체감 속도를 함께 보세요.",
    "decisionLine": "총 25.2B 파라미터 중 토큰당 3.8B가 활성화되는 MoE 모델입니다. 256K(262,144) 네이티브 컨텍스트를 지원하며 적재 대비 빠른 디코딩을 제공합니다.",
    "minimumMemoryGB": 16,
    "recommendedHardwareIds": [
      "mac-mini-m4-16gb",
      "nvidia-dual-rtx-5090-64gb",
      "macbook-air-m4-16gb"
    ],
    "model": {
      "id": "gemma-4-26b-a4b",
      "name": "Gemma 4 26B-A4B (MoE)",
      "family": "Gemma",
      "developer": "Google DeepMind",
      "architecture": "moe",
      "totalParamsB": 25.2,
      "activeParamsB": 3.8,
      "nativeContextTokens": 262144,
      "simulationContextTokens": 4096,
      "description": "총 25.2B 파라미터 중 토큰당 3.8B가 활성화되는 MoE 모델입니다. 256K(262,144) 네이티브 컨텍스트를 지원하며 적재 대비 빠른 디코딩을 제공합니다.",
      "supportedQuantizations": [
        "Q4_K_M",
        "Q8_0",
        "FP16"
      ],
      "supportsNgram": true,
      "supportsMtp": true,
      "supportsDraftModel": true,
      "mtpNotes": "외부 Gemma 4 assistant drafter 기반 VLM MTP; 별도 drafter 체크포인트 필요",
      "sourceUrl": "https://huggingface.co/google/gemma-4-26B-A4B",
      "sourceLabel": "Hugging Face / Google Gemma 4 26B-A4B 공식 리포지토리",
      "retrievedAt": "2026-08-31",
      "releaseStatus": "공식 배포 모델",
      "sourceClassification": "공식 모델 카드 및 가중치"
    },
    "updatedAt": "2026-09-01"
  },
  {
    "url": "https://localai.co.kr/models/qwen-3.6-35b-a3b",
    "modelId": "qwen-3.6-35b-a3b",
    "slug": "qwen-3.6-35b-a3b",
    "title": "Qwen3.6 35B-A3B (MoE) 로컬 LLM 권장 사양·속도·양자화",
    "description": "Qwen3.6 35B-A3B (MoE) Q4 실행에 필요한 약 22GB 메모리와 장비별 프리필, 토큰 생성 속도, 양자화 및 262,144 토큰 문맥 조건을 비교합니다.",
    "headline": "총 35B 중 토큰당 3B가 활성화되는 MoE 모델, 최소 메모리와 체감 속도를 함께 보세요.",
    "decisionLine": "총 35B 파라미터 중 토큰당 약 3B가 활성화되는 MoE 모델입니다. 메모리 적재는 35B 용량이 필요하고, 디코딩 대역폭은 3B 활성 파라미터 기준으로 소비됩니다.",
    "minimumMemoryGB": 22,
    "recommendedHardwareIds": [
      "nvidia-rtx-5060-ti-16gb",
      "nvidia-dual-rtx-5090-64gb",
      "macbook-air-m4-24gb"
    ],
    "model": {
      "id": "qwen-3.6-35b-a3b",
      "name": "Qwen3.6 35B-A3B (MoE)",
      "family": "Qwen",
      "developer": "Alibaba Cloud",
      "architecture": "moe",
      "totalParamsB": 35,
      "activeParamsB": 3,
      "nativeContextTokens": 262144,
      "simulationContextTokens": 4096,
      "description": "총 35B 파라미터 중 토큰당 약 3B가 활성화되는 MoE 모델입니다. 메모리 적재는 35B 용량이 필요하고, 디코딩 대역폭은 3B 활성 파라미터 기준으로 소비됩니다.",
      "supportedQuantizations": [
        "Q4_K_M",
        "Q8_0",
        "FP16"
      ],
      "supportsNgram": true,
      "supportsMtp": true,
      "supportsDraftModel": false,
      "mtpNotes": "MoE 라우팅 연계 MTP 헤드 지원",
      "sourceUrl": "https://huggingface.co/Qwen/Qwen3.6-35B-A3B",
      "sourceLabel": "Hugging Face / Qwen3.6-35B-A3B 공식 리포지토리",
      "retrievedAt": "2026-08-31",
      "releaseStatus": "공식 배포 모델",
      "sourceClassification": "공식 모델 카드 및 가중치"
    },
    "updatedAt": "2026-09-01"
  },
  {
    "url": "https://localai.co.kr/models/glm-5.3-flash",
    "modelId": "glm-5.3-flash",
    "slug": "glm-5.3-flash",
    "title": "GLM-5.3-Flash (MoE) 로컬 LLM 권장 사양·속도·양자화",
    "description": "GLM-5.3-Flash (MoE) Q4 실행에 필요한 약 191GB 메모리와 장비별 프리필, 토큰 생성 속도, 양자화 및 1,048,576 토큰 문맥 조건을 비교합니다.",
    "headline": "총 320B 중 토큰당 18B가 활성화되는 MoE 모델, 최소 메모리와 체감 속도를 함께 보세요.",
    "decisionLine": "총 320B 파라미터(18B 활성)의 하이브리드 희소+선형 어텐션 MoE 모델입니다. 공식 1,048,576(1M) 토큰 컨텍스트(text_config.max_position_embeddings)를 지원하며 256GB 이상의 대용량 메모리 환경에 적재됩니다.",
    "minimumMemoryGB": 191,
    "recommendedHardwareIds": [
      "nvidia-dual-a40-96gb",
      "mac-studio-m5-ultra-256gb",
      "mac-studio-m3-ultra-512gb"
    ],
    "model": {
      "id": "glm-5.3-flash",
      "name": "GLM-5.3-Flash (MoE)",
      "family": "GLM",
      "developer": "Zhipu AI / THUDM",
      "architecture": "moe",
      "totalParamsB": 320,
      "activeParamsB": 18,
      "nativeContextTokens": 1048576,
      "simulationContextTokens": 4096,
      "description": "총 320B 파라미터(18B 활성)의 하이브리드 희소+선형 어텐션 MoE 모델입니다. 공식 1,048,576(1M) 토큰 컨텍스트(text_config.max_position_embeddings)를 지원하며 256GB 이상의 대용량 메모리 환경에 적재됩니다.",
      "supportedQuantizations": [
        "Q4_K_M",
        "Q8_0",
        "FP16"
      ],
      "supportsNgram": true,
      "supportsMtp": false,
      "supportsDraftModel": false,
      "mtpNotes": "공식 MTP 미명시 (MTP 가속 미지원)",
      "sourceUrl": "https://huggingface.co/zai-org/GLM-5.3-Flash",
      "sourceLabel": "Hugging Face / zai-org GLM-5.3-Flash 공식 리포지토리 (config.json)",
      "retrievedAt": "2026-08-31",
      "releaseStatus": "공식 배포 모델",
      "sourceClassification": "공식 모델 카드 및 가중치"
    },
    "updatedAt": "2026-09-01"
  },
  {
    "url": "https://localai.co.kr/models/deepseek-v4-flash",
    "modelId": "deepseek-v4-flash",
    "slug": "deepseek-v4-flash",
    "title": "DeepSeek-V4-Flash-0731 (MoE) 로컬 LLM 권장 사양·속도·양자화",
    "description": "DeepSeek-V4-Flash-0731 (MoE) Q4 실행에 필요한 약 169GB 메모리와 장비별 프리필, 토큰 생성 속도, 양자화 및 1,048,576 토큰 문맥 조건을 비교합니다.",
    "headline": "총 284B 중 토큰당 13B가 활성화되는 MoE 모델, 최소 메모리와 체감 속도를 함께 보세요.",
    "decisionLine": "총 284B 파라미터(13B 활성)의 대규모 MoE 모델로 공식 1,048,576(1M) 토큰 컨텍스트(max_position_embeddings)를 지원하며 256GB 이상의 대용량 메모리 환경에 적재됩니다.",
    "minimumMemoryGB": 169,
    "recommendedHardwareIds": [
      "nvidia-a40-48gb",
      "mac-studio-m5-ultra-256gb",
      "mac-studio-m3-ultra-512gb"
    ],
    "model": {
      "id": "deepseek-v4-flash",
      "name": "DeepSeek-V4-Flash-0731 (MoE)",
      "family": "DeepSeek",
      "developer": "DeepSeek AI",
      "architecture": "moe",
      "totalParamsB": 284,
      "activeParamsB": 13,
      "nativeContextTokens": 1048576,
      "simulationContextTokens": 4096,
      "description": "총 284B 파라미터(13B 활성)의 대규모 MoE 모델로 공식 1,048,576(1M) 토큰 컨텍스트(max_position_embeddings)를 지원하며 256GB 이상의 대용량 메모리 환경에 적재됩니다.",
      "supportedQuantizations": [
        "Q4_K_M",
        "Q8_0",
        "FP16"
      ],
      "supportsNgram": true,
      "supportsMtp": true,
      "supportsDraftModel": true,
      "mtpNotes": "네이티브 MTP 및 CUDA/MLX MTP 지원",
      "sourceUrl": "https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731",
      "sourceLabel": "Hugging Face / deepseek-ai DeepSeek-V4-Flash-0731 공식 리포지토리 (config.json)",
      "retrievedAt": "2026-08-31",
      "releaseStatus": "공식 배포 모델",
      "sourceClassification": "공식 모델 카드 및 가중치"
    },
    "updatedAt": "2026-09-01"
  }
]
