# 로컬 AI 장비 가이드 > 한국 사용자가 로컬 LLM 장비를 구매하기 전에 프리필, 토큰 생성 속도, 메모리 적재, 전기요금과 총비용을 비교하는 무료 도구입니다. - 대표 URL: https://localai.co.kr - 언어: 한국어 - 데이터 업데이트: 2026-09-01 - 기본 계산 조건: Q4 양자화, 4K 문맥, 단일 사용자 - 주의: 표시 속도와 비용은 조건별 예상 범위이며 실제 환경에 따라 달라질 수 있음 ## 디렉터리 - [장비별 가이드](https://localai.co.kr/hardware) - [모델별 권장 사양](https://localai.co.kr/models) - [장비 직접 비교](https://localai.co.kr/compare) - [구매 기준](https://localai.co.kr/guides) - [기계 판독용 데이터](https://localai.co.kr/data) - [사이트 소개](https://localai.co.kr/about) - [계산 기준](https://localai.co.kr/methodology) - [제휴 안내](https://localai.co.kr/affiliate-disclosure) - [개인정보 안내](https://localai.co.kr/privacy) ## 장비 - [맥북 프로 M5 Pro 64GB 로컬 LLM 추천 모델과 속도](https://localai.co.kr/hardware/macbook-pro-m5-pro-64gb): 휴대 가능한 한 대의 장비에서 35B급 모델과 긴 문맥을 안정적으로 쓰려는 선택입니다. - [MacBook Air M5 16GB 로컬 LLM 속도·메모리·전기요금](https://localai.co.kr/hardware/macbook-air-m5-16gb): 휴대성과 가격을 우선하는 16GB 입문 구성. 8B~12B Q4 모델과 짧은 문맥에 적합합니다. - [MacBook Air M5 24GB 로컬 LLM 속도·메모리·전기요금](https://localai.co.kr/hardware/macbook-air-m5-24gb): 휴대성과 모델 수용량의 균형이 좋은 24GB 구성. 12B급과 일부 27B Q4 모델을 비교할 수 있습니다. - [MacBook Air M5 32GB 로컬 LLM 속도·메모리·전기요금](https://localai.co.kr/hardware/macbook-air-m5-32gb): Air 최대 메모리 구성. 27B Q4급을 휴대형 기기에서 적재할 수 있지만 장시간 부하에서는 팬리스 특성을 고려해야 합니다. - [MacBook Air M4 16GB 로컬 LLM 속도·메모리·전기요금](https://localai.co.kr/hardware/macbook-air-m4-16gb): 재고 할인과 리퍼비쉬를 함께 비교하기 좋은 M4 입문 구성. 8B~12B Q4 모델 중심입니다. - [MacBook Air M4 24GB 로컬 LLM 속도·메모리·전기요금](https://localai.co.kr/hardware/macbook-air-m4-24gb): 가격이 내려간 M4 Air에서 메모리 여유를 확보한 구성. 12B급과 일부 27B Q4 모델을 비교할 수 있습니다. - [맥북 프로 M5 Pro 48GB 로컬 LLM 성능](https://localai.co.kr/hardware/macbook-pro-m5-pro-48gb): 노트북 한 대로 이동성과 27B~35B급 로컬 추론을 함께 해결하려는 구성입니다. - [MacBook Pro M5 Max 64GB 로컬 LLM 속도·메모리·전기요금](https://localai.co.kr/hardware/macbook-pro-m5-max-64gb): 높은 메모리 대역폭과 휴대성을 함께 원하는 사용자를 위한 64GB M5 Max 구성입니다. - [맥 미니 M4 16GB 로컬 LLM 속도와 추천 모델](https://localai.co.kr/hardware/mac-mini-m4-16gb): 비용을 최소화해 8B~12B급 모델부터 시작할 때 맞는 구성입니다. - [맥 미니 M4 24GB 로컬 LLM 성능과 적정 모델](https://localai.co.kr/hardware/mac-mini-m4-24gb): 12B급 모델을 자주 쓰면서 본체 가격과 전력 사용을 낮추고 싶을 때 균형이 좋습니다. - [맥 미니 M4 32GB 로컬 LLM 27B 구동 성능](https://localai.co.kr/hardware/mac-mini-m4-32gb): 작은 본체에서 27B Q4급 모델 적재를 우선하고 생성 속도는 기다릴 수 있을 때 적합합니다. - [맥 미니 M4 Pro 24GB 로컬 LLM 속도 비교](https://localai.co.kr/hardware/mac-mini-m4-pro-24gb): 큰 모델보다 12B급 모델의 빠른 응답과 작은 설치 공간을 우선할 때 맞습니다. - [맥 미니 M4 Pro 48GB 로컬 LLM 27B·35B 성능](https://localai.co.kr/hardware/mac-mini-m4-pro-48gb): 27B~35B급 모델을 무리 없이 적재하면서 가격과 속도를 함께 맞추기 좋은 구성입니다. - [맥 미니 M4 Pro 64GB 로컬 LLM 추천 구성](https://localai.co.kr/hardware/mac-mini-m4-pro-64gb): 작은 완제품에서 35B급 모델과 긴 문맥을 안정적으로 운용하려는 사람에게 맞습니다. - [Mac mini M6 16GB 로컬 LLM 속도·메모리·전기요금](https://localai.co.kr/hardware/mac-mini-m6-16gb): 최신 M6 기본형의 16GB 구성. 8B~12B Q4 모델 중심의 예약 구매 비교 항목입니다. - [Mac mini M6 24GB 로컬 LLM 속도·메모리·전기요금](https://localai.co.kr/hardware/mac-mini-m6-24gb): 170GB/s 메모리 대역폭을 적용한 M6 24GB 구성. 12B급과 일부 27B Q4 모델을 비교할 수 있습니다. - [Mac mini M6 32GB 로컬 LLM 속도·메모리·전기요금](https://localai.co.kr/hardware/mac-mini-m6-32gb): 최신 M6 기반 소형 데스크톱의 32GB 최대 메모리 구성. 2026년 9월 출시 일정이 반영된 비교용 항목입니다. - [Mac mini M5 Pro 24GB 로컬 LLM 속도·메모리·전기요금](https://localai.co.kr/hardware/mac-mini-m5-pro-24gb): 높은 대역폭을 우선하는 M5 Pro 기본 메모리 구성. 12B급 고속 구동용 예약 구매 항목입니다. - [Mac mini M5 Pro 48GB 로컬 LLM 속도·메모리·전기요금](https://localai.co.kr/hardware/mac-mini-m5-pro-48gb): 27B~35B Q4 모델 적재량과 307GB/s 대역폭을 균형 있게 확보한 최신 구성입니다. - [Mac mini M5 Pro 64GB 로컬 LLM 속도·메모리·전기요금](https://localai.co.kr/hardware/mac-mini-m5-pro-64gb): 64GB 메모리와 307GB/s 대역폭을 갖춘 최신 고성능 Mac mini 구성입니다. - [맥 스튜디오 M4 Max 64GB 로컬 LLM 속도](https://localai.co.kr/hardware/mac-studio-m4-max-64gb): 35B급 모델의 빠른 생성과 조용한 지속 부하 성능을 함께 원할 때 유리합니다. - [맥 스튜디오 M4 Max 128GB 로컬 LLM 대형 모델 성능](https://localai.co.kr/hardware/mac-studio-m4-max-128gb): 단일 완제품에서 70B급과 고정밀 모델까지 넓게 비교하려는 사용자에게 맞습니다. - [Mac Studio M5 Max 64GB 로컬 LLM 속도·메모리·전기요금](https://localai.co.kr/hardware/mac-studio-m5-max-64gb): 614GB/s 대역폭을 갖춘 최신 64GB 데스크톱 구성. 지속 부하 성능을 우선하는 사용자용입니다. - [Mac Studio M5 Max 128GB 로컬 LLM 속도·메모리·전기요금](https://localai.co.kr/hardware/mac-studio-m5-max-128gb): 대형 모델 적재량과 높은 지속 대역폭을 함께 확보한 최신 M5 Max 데스크톱 구성입니다. - [NVIDIA GeForce RTX 3090 24GB 로컬 LLM 속도·메모리·전기요금](https://localai.co.kr/hardware/nvidia-rtx-3090-24gb): 936 GB/s 384비트 GDDR6X 24GB VRAM. 중고 가성비 및 커뮤니티에서 가장 널리 활용되는 24GB 로컬 LLM 기준 그래픽 카드입니다. - [NVIDIA GeForce RTX 4090 24GB 로컬 LLM 속도·메모리·전기요금](https://localai.co.kr/hardware/nvidia-rtx-4090-24gb): 1,008 GB/s 384비트 GDDR6X 24GB VRAM. 27B 밀도형 및 35B MoE Q4 모델을 100% VRAM에 적재하여 고속 디코딩합니다. - [NVIDIA GeForce RTX 5090 32GB 로컬 LLM 속도·메모리·전기요금](https://localai.co.kr/hardware/nvidia-rtx-5090-32gb): 1,792 GB/s(1.79 TB/s) 512비트 GDDR7 VRAM. 27B~35B급 4비트 모델을 단일 32GB GPU에 100% 적재하여 초고속 디코딩합니다. - [AMD Ryzen AI Max+ 395 128GB Unified 로컬 LLM 속도·메모리·전기요금](https://localai.co.kr/hardware/amd-ryzen-ai-max-plus-395-128gb): 256 GB/s LPDDR5X 256비트 통합 메모리 APU 플랫폼. 128GB 대용량 메모리로 대형 오픈 가중치 모델을 미니 PC/랩톱 폼팩터에서 구동합니다. - [MacBook Pro M5 Max 128GB 로컬 LLM 속도·메모리·전기요금](https://localai.co.kr/hardware/macbook-pro-m5-max-128gb): 614 GB/s 통합 메모리 대역폭과 128GB 메모리로 대형 모델 및 Flash-Next(180B 상주) Q4 모델을 높은 대역폭으로 적재합니다. - [Mac Studio M5 Ultra 256GB 로컬 LLM 속도·메모리·전기요금](https://localai.co.kr/hardware/mac-studio-m5-ultra-256gb): 1,200 GB/s(1.2 TB/s) 통합 대역폭과 256GB 메모리로 초대형 MoE 모델(DeepSeek-V4, GLM-5.3 등)을 단일 기기에서 적재합니다. - [Mac Studio M5 Ultra 512GB 로컬 LLM 속도·메모리·전기요금](https://localai.co.kr/hardware/mac-studio-m5-ultra-512gb): 512GB 통합 메모리 공간으로 300B+ MoE 대규모 모델을 단일 머신에 고정밀(Q8 등)로 적재합니다. - [NVIDIA GeForce RTX 5060 Ti 16GB 로컬 LLM 속도·메모리·전기요금](https://localai.co.kr/hardware/nvidia-rtx-5060-ti-16gb): 448 GB/s GDDR7 VRAM. 8B 및 12B Q4 모델을 전용 VRAM에 100% 적재할 수 있는 16GB 엔트리 데스크톱 GPU입니다. - [NVIDIA A40 48GB 로컬 LLM 속도·메모리·전기요금](https://localai.co.kr/hardware/nvidia-a40-48gb): 696 GB/s 384비트 48GB ECC VRAM. 중고 워크스테이션 및 서버 환경에서 70B급 4비트 또는 27B~35B 고정밀 모델을 단일 카드에 적재할 수 있는 대용량 GPU입니다. - [NVIDIA RTX PRO 6000 Blackwell 96GB 로컬 LLM 속도·메모리·전기요금](https://localai.co.kr/hardware/nvidia-rtx-pro-6000-blackwell-96gb): 1,792 GB/s 96GB ECC VRAM 워크스테이션 GPU. 가용 93GB VRAM 예산 이내의 70B~120B급 4비트 모델을 단일 카드에 완전 적재합니다. - [MacBook Pro M5 32GB 로컬 LLM 속도·메모리·전기요금](https://localai.co.kr/hardware/macbook-pro-m5-32gb): 153 GB/s 통합 메모리 대역폭. 12B dense 및 26B MoE Q4 모델을 단일 랩톱에서 단독 구동하기에 적합한 엔트리 구성입니다. - [MacBook Pro M4 Pro 48GB 로컬 LLM 속도·메모리·전기요금](https://localai.co.kr/hardware/macbook-pro-m4-pro-48gb): 273 GB/s 통합 메모리 대역폭과 48GB 메모리로 27B~35B MoE 모델을 여유 있게 적재할 수 있는 M4 세대 전문 랩톱 구성입니다. - [MacBook Pro M4 Max 128GB 로컬 LLM 속도·메모리·전기요금](https://localai.co.kr/hardware/macbook-pro-m4-max-128gb): 546 GB/s 통합 메모리 대역폭과 128GB 메모리로 70B급 고정밀 모델 및 Flash-Next(180B 상주) Q4를 고속 디코딩하는 M4 최고 사양 랩톱 구성입니다. - [Mac Studio M3 Ultra 512GB 로컬 LLM 속도·메모리·전기요금](https://localai.co.kr/hardware/mac-studio-m3-ultra-512gb): 819 GB/s 통합 메모리 대역폭과 512GB 대용량 메모리로 대규모 오픈 모델 벤치마크의 표준 기준점 역할을 하는 M3 세대 최고 사양 워크스테이션입니다. - [MacBook Pro M3 Max 128GB 로컬 LLM 속도·메모리·전기요금](https://localai.co.kr/hardware/macbook-pro-m3-max-128gb): 400 GB/s 통합 대역폭과 128GB 대용량 메모리로 70B급 및 Flash-Next(180B 상주) Q4 모델을 단독 적재하는 M3 세대 하이엔드 랩톱 구성입니다. - [MacBook Pro M3 Pro 36GB 로컬 LLM 속도·메모리·전기요금](https://localai.co.kr/hardware/macbook-pro-m3-pro-36gb): 150 GB/s 통합 메모리 대역폭과 36GB 메모리로 12B~14B dense 및 26B MoE Q4 모델을 안정적으로 구동하는 M3 세대 랩톱 구성입니다. - [NVIDIA DGX Spark 128GB 로컬 LLM 속도·메모리·전기요금](https://localai.co.kr/hardware/nvidia-dgx-spark-128gb): 273 GB/s 일관 통합 메모리(Coherent Unified Memory) 128GB를 탑재한 GB10 단일 노드 AI 워크스테이션입니다. - [2× NVIDIA DGX Spark 클러스터 256GB 로컬 LLM 속도·메모리·전기요금](https://localai.co.kr/hardware/nvidia-dual-dgx-spark-256gb): ConnectX-7 200Gbps(25 GB/s) 링크로 연결된 2개 노드(총 256GB 분산 메모리, 546 GB/s 합산 로컬 대역폭). 분산 모델 샤딩을 통해 최대 405B급 모델 수용이 가능하나 투명 UMA가 아니며 노드 간 통신 오버헤드가 발생합니다. - [2× NVIDIA GeForce RTX 3090 NVLink 48GB 로컬 LLM 속도·메모리·전기요금](https://localai.co.kr/hardware/nvidia-dual-rtx-3090-48gb): 2× 24GB VRAM(합산 48GB, 합산 로컬 대역폭 1,872 GB/s)과 3세대 NVLink(112.5 GB/s 양방향)로 연결된 듀얼 GPU 구성입니다. 텐서/파이프라인 병렬화 지원 시 70B급 모델을 온전 적재합니다. - [2× NVIDIA GeForce RTX 5090 PCIe 64GB 로컬 LLM 속도·메모리·전기요금](https://localai.co.kr/hardware/nvidia-dual-rtx-5090-64gb): 2× 32GB GDDR7 VRAM(합산 64GB, 합산 로컬 대역폭 3,584 GB/s). RTX 5090은 NVLink를 지원하지 않으며 PCIe Gen5 인터페이스로만 통신하므로 All-Reduce 통신 병목에 따른 병렬 효율 감쇠가 발생합니다. - [2× NVIDIA A40 NVLink 96GB 로컬 LLM 속도·메모리·전기요금](https://localai.co.kr/hardware/nvidia-dual-a40-96gb): 2× 48GB ECC VRAM(합산 96GB, 합산 로컬 대역폭 1,392 GB/s)과 NVLink(112.5 GB/s)로 결합된 엔터프라이즈 듀얼 워크스테이션 구성입니다. 70B~120B급 모델을 텐서 병렬화로 구동합니다. ## 모델 - [Qwen3.8 27B 로컬 LLM 권장 사양·속도·양자화](https://localai.co.kr/models/qwen-3.8-27b): Q4 필요 메모리 약 18GB - [Qwen3.8-Flash-Next 로컬 LLM 권장 사양·속도·양자화](https://localai.co.kr/models/qwen-3.8-flash-next): Q4 필요 메모리 약 108GB - [Gemma 4 12B 로컬 LLM 권장 사양·속도·양자화](https://localai.co.kr/models/gemma-4-12b): Q4 필요 메모리 약 8GB - [Gemma 4 26B-A4B (MoE) 로컬 LLM 권장 사양·속도·양자화](https://localai.co.kr/models/gemma-4-26b-a4b): Q4 필요 메모리 약 16GB - [Qwen3.6 35B-A3B (MoE) 로컬 LLM 권장 사양·속도·양자화](https://localai.co.kr/models/qwen-3.6-35b-a3b): Q4 필요 메모리 약 22GB - [GLM-5.3-Flash (MoE) 로컬 LLM 권장 사양·속도·양자화](https://localai.co.kr/models/glm-5.3-flash): Q4 필요 메모리 약 191GB - [DeepSeek-V4-Flash-0731 (MoE) 로컬 LLM 권장 사양·속도·양자화](https://localai.co.kr/models/deepseek-v4-flash): Q4 필요 메모리 약 169GB ## 사이트 운영 및 계산 기준 - [로컬 AI 장비 가이드 소개](https://localai.co.kr/about): 로컬 AI 장비 가이드는 한국 사용자가 맥과 GPU를 구매하기 전에 모델 적재량, 프리필, 토큰 생성 속도, 전력과 총비용을 같은 기준으로 비교하는 도구입니다. - [로컬 LLM 속도·비용 계산 기준](https://localai.co.kr/methodology): 로컬 LLM 장비별 프리필, 첫 토큰 시간, 디코드 속도, 메모리 적재, 전력, 시세와 TCO를 어떤 조건과 보정 기준으로 계산하는지 설명합니다. - [제휴 링크 운영 안내](https://localai.co.kr/affiliate-disclosure): 로컬 AI 장비 가이드의 쿠팡 파트너스 제휴 링크 표시 방식, 수수료 관계와 장비 비교 결과가 제휴 여부와 분리되는 운영 기준을 안내합니다. - [개인정보 및 데이터 이용 안내](https://localai.co.kr/privacy): 로컬 AI 장비 가이드에서 장비 추천, 속도 체감, 전기요금과 TCO 계산을 이용할 때 입력값과 외부 링크가 어떻게 처리되는지 안내합니다. ## 장비별 구조화 요약 ### Apple MacBook Pro M5 Pro (64GB) - URL: https://localai.co.kr/hardware/macbook-pro-m5-pro-64gb - 가용 메모리: 56GB - 메모리 대역폭: 307GB/s - 지속 부하: 약 90W - 판단: 휴대 가능한 한 대의 장비에서 35B급 모델과 긴 문맥을 안정적으로 쓰려는 선택입니다. - 모델 예상: Gemma 4 12B 31.3 ~ 34.8 tok/s, 첫 토큰 5.1 ~ 11.0초; Qwen3.6 35B-A3B (MoE) 23.5 ~ 56.3 tok/s, 첫 토큰 2.2 ~ 5.2초 ### Apple MacBook Air M5 (16GB) - URL: https://localai.co.kr/hardware/macbook-air-m5-16gb - 가용 메모리: 13GB - 메모리 대역폭: 153GB/s - 지속 부하: 약 28W - 판단: 휴대성과 가격을 우선하는 16GB 입문 구성. 8B~12B Q4 모델과 짧은 문맥에 적합합니다. - 모델 예상: Gemma 4 12B 14.7 ~ 16.5 tok/s, 첫 토큰 10.2 ~ 24.9초; Gemma 4 26B-A4B (MoE) 12.3 ~ 19.1 tok/s, 첫 토큰 5.4 ~ 15.0초 ### Apple MacBook Air M5 (24GB) - URL: https://localai.co.kr/hardware/macbook-air-m5-24gb - 가용 메모리: 20GB - 메모리 대역폭: 153GB/s - 지속 부하: 약 30W - 판단: 휴대성과 모델 수용량의 균형이 좋은 24GB 구성. 12B급과 일부 27B Q4 모델을 비교할 수 있습니다. - 모델 예상: Gemma 4 12B 14.7 ~ 16.5 tok/s, 첫 토큰 10.2 ~ 24.9초; Qwen3.6 35B-A3B (MoE) 15.6 ~ 24.2 tok/s, 첫 토큰 5.0 ~ 13.6초 ### Apple MacBook Air M5 (32GB) - URL: https://localai.co.kr/hardware/macbook-air-m5-32gb - 가용 메모리: 27GB - 메모리 대역폭: 153GB/s - 지속 부하: 약 32W - 판단: Air 최대 메모리 구성. 27B Q4급을 휴대형 기기에서 적재할 수 있지만 장시간 부하에서는 팬리스 특성을 고려해야 합니다. - 모델 예상: Gemma 4 12B 14.7 ~ 16.5 tok/s, 첫 토큰 10.2 ~ 24.9초; Qwen3.6 35B-A3B (MoE) 9.4 ~ 25.6 tok/s, 첫 토큰 4.8 ~ 13.1초 ### Apple MacBook Air M4 (16GB) - URL: https://localai.co.kr/hardware/macbook-air-m4-16gb - 가용 메모리: 13GB - 메모리 대역폭: 120GB/s - 지속 부하: 약 26W - 판단: 재고 할인과 리퍼비쉬를 함께 비교하기 좋은 M4 입문 구성. 8B~12B Q4 모델 중심입니다. - 모델 예상: Gemma 4 12B 11.2 ~ 12.6 tok/s, 첫 토큰 12.8 ~ 31.1초; Gemma 4 26B-A4B (MoE) 9.6 ~ 15 tok/s, 첫 토큰 6.2 ~ 18.0초 ### Apple MacBook Air M4 (24GB) - URL: https://localai.co.kr/hardware/macbook-air-m4-24gb - 가용 메모리: 20GB - 메모리 대역폭: 120GB/s - 지속 부하: 약 28W - 판단: 가격이 내려간 M4 Air에서 메모리 여유를 확보한 구성. 12B급과 일부 27B Q4 모델을 비교할 수 있습니다. - 모델 예상: Gemma 4 12B 11.2 ~ 12.6 tok/s, 첫 토큰 12.8 ~ 31.1초; Qwen3.6 35B-A3B (MoE) 12.2 ~ 19 tok/s, 첫 토큰 5.7 ~ 16.3초 ### Apple MacBook Pro M5 Pro (48GB) - URL: https://localai.co.kr/hardware/macbook-pro-m5-pro-48gb - 가용 메모리: 41GB - 메모리 대역폭: 307GB/s - 지속 부하: 약 85W - 판단: 노트북 한 대로 이동성과 27B~35B급 로컬 추론을 함께 해결하려는 구성입니다. - 모델 예상: Gemma 4 12B 31.3 ~ 34.8 tok/s, 첫 토큰 5.1 ~ 11.0초; Qwen3.8 27B 13.9 ~ 15.4 tok/s, 첫 토큰 6.6 ~ 11.7초; Qwen3.6 35B-A3B (MoE) 23.5 ~ 56.3 tok/s, 첫 토큰 2.2 ~ 5.2초 ### Apple MacBook Pro M5 Max (64GB) - URL: https://localai.co.kr/hardware/macbook-pro-m5-max-64gb - 가용 메모리: 56GB - 메모리 대역폭: 614GB/s - 지속 부하: 약 120W - 판단: 높은 메모리 대역폭과 휴대성을 함께 원하는 사용자를 위한 64GB M5 Max 구성입니다. - 모델 예상: Gemma 4 12B 64.4 ~ 71.3 tok/s, 첫 토큰 3.4 ~ 6.6초; Qwen3.6 35B-A3B (MoE) 43.1 ~ 92.1 tok/s, 첫 토큰 1.3 ~ 2.9초 ### Apple Mac mini M4 (16GB) - URL: https://localai.co.kr/hardware/mac-mini-m4-16gb - 가용 메모리: 13GB - 메모리 대역폭: 120GB/s - 지속 부하: 약 42W - 판단: 비용을 최소화해 8B~12B급 모델부터 시작할 때 맞는 구성입니다. - 모델 예상: Gemma 4 12B 11.6 ~ 12.9 tok/s, 첫 토큰 12.8 ~ 31.1초; Gemma 4 26B-A4B (MoE) 9.6 ~ 15 tok/s, 첫 토큰 6.2 ~ 18.0초 ### Apple Mac mini M4 (24GB) - URL: https://localai.co.kr/hardware/mac-mini-m4-24gb - 가용 메모리: 20GB - 메모리 대역폭: 120GB/s - 지속 부하: 약 45W - 판단: 12B급 모델을 자주 쓰면서 본체 가격과 전력 사용을 낮추고 싶을 때 균형이 좋습니다. - 모델 예상: Gemma 4 12B 11.6 ~ 12.9 tok/s, 첫 토큰 12.8 ~ 31.1초; Qwen3.6 35B-A3B (MoE) 12.2 ~ 19 tok/s, 첫 토큰 5.7 ~ 16.3초 ### Apple Mac mini M4 (32GB) - URL: https://localai.co.kr/hardware/mac-mini-m4-32gb - 가용 메모리: 27GB - 메모리 대역폭: 120GB/s - 지속 부하: 약 48W - 판단: 작은 본체에서 27B Q4급 모델 적재를 우선하고 생성 속도는 기다릴 수 있을 때 적합합니다. - 모델 예상: Gemma 4 12B 11.6 ~ 12.9 tok/s, 첫 토큰 12.8 ~ 31.1초; Qwen3.8 27B 5.1 ~ 5.7 tok/s, 첫 토큰 16.4 ~ 35.5초; Qwen3.6 35B-A3B (MoE) 7.8 ~ 22.5 tok/s, 첫 토큰 5.5 ~ 15.7초 ### Apple Mac mini M4 Pro (24GB) - URL: https://localai.co.kr/hardware/mac-mini-m4-pro-24gb - 가용 메모리: 20GB - 메모리 대역폭: 273GB/s - 지속 부하: 약 86W - 판단: 큰 모델보다 12B급 모델의 빠른 응답과 작은 설치 공간을 우선할 때 맞습니다. - 모델 예상: Gemma 4 12B 27.8 ~ 30.9 tok/s, 첫 토큰 6.3 ~ 14.2초; Qwen3.6 35B-A3B (MoE) 27.8 ~ 43.2 tok/s, 첫 토큰 2.8 ~ 6.5초 ### Apple Mac mini M4 Pro (48GB) - URL: https://localai.co.kr/hardware/mac-mini-m4-pro-48gb - 가용 메모리: 41GB - 메모리 대역폭: 273GB/s - 지속 부하: 약 92W - 판단: 27B~35B급 모델을 무리 없이 적재하면서 가격과 속도를 함께 맞추기 좋은 구성입니다. - 모델 예상: Gemma 4 12B 27.8 ~ 30.9 tok/s, 첫 토큰 6.3 ~ 14.2초; Qwen3.8 27B 12.3 ~ 13.7 tok/s, 첫 토큰 7.8 ~ 14.3초; Qwen3.6 35B-A3B (MoE) 19.6 ~ 46.1 tok/s, 첫 토큰 2.7 ~ 6.3초 ### Apple Mac mini M4 Pro (64GB) - URL: https://localai.co.kr/hardware/mac-mini-m4-pro-64gb - 가용 메모리: 56GB - 메모리 대역폭: 273GB/s - 지속 부하: 약 95W - 판단: 작은 완제품에서 35B급 모델과 긴 문맥을 안정적으로 운용하려는 사람에게 맞습니다. - 모델 예상: Gemma 4 12B 27.8 ~ 30.9 tok/s, 첫 토큰 6.3 ~ 14.2초; Qwen3.6 35B-A3B (MoE) 19.6 ~ 46.1 tok/s, 첫 토큰 2.7 ~ 6.3초 ### Apple Mac mini M6 (16GB) - URL: https://localai.co.kr/hardware/mac-mini-m6-16gb - 가용 메모리: 13GB - 메모리 대역폭: 153GB/s - 지속 부하: 약 48W - 판단: 최신 M6 기본형의 16GB 구성. 8B~12B Q4 모델 중심의 예약 구매 비교 항목입니다. - 모델 예상: Gemma 4 12B 15.2 ~ 16.9 tok/s, 첫 토큰 9.1 ~ 22.6초; Gemma 4 26B-A4B (MoE) 12.3 ~ 19.1 tok/s, 첫 토큰 4.9 ~ 12.9초 ### Apple Mac mini M6 (24GB) - URL: https://localai.co.kr/hardware/mac-mini-m6-24gb - 가용 메모리: 20GB - 메모리 대역폭: 170GB/s - 지속 부하: 약 52W - 판단: 170GB/s 메모리 대역폭을 적용한 M6 24GB 구성. 12B급과 일부 27B Q4 모델을 비교할 수 있습니다. - 모델 예상: Gemma 4 12B 16.9 ~ 18.8 tok/s, 첫 토큰 9.1 ~ 22.6초; Qwen3.6 35B-A3B (MoE) 17.3 ~ 26.9 tok/s, 첫 토큰 4.5 ~ 11.7초 ### Apple Mac mini M6 (32GB) - URL: https://localai.co.kr/hardware/mac-mini-m6-32gb - 가용 메모리: 27GB - 메모리 대역폭: 170GB/s - 지속 부하: 약 55W - 판단: 최신 M6 기반 소형 데스크톱의 32GB 최대 메모리 구성. 2026년 9월 출시 일정이 반영된 비교용 항목입니다. - 모델 예상: Gemma 4 12B 16.9 ~ 18.8 tok/s, 첫 토큰 9.1 ~ 22.6초; Qwen3.6 35B-A3B (MoE) 11 ~ 28.7 tok/s, 첫 토큰 4.3 ~ 11.2초 ### Apple Mac mini M5 Pro (24GB) - URL: https://localai.co.kr/hardware/mac-mini-m5-pro-24gb - 가용 메모리: 20GB - 메모리 대역폭: 307GB/s - 지속 부하: 약 92W - 판단: 높은 대역폭을 우선하는 M5 Pro 기본 메모리 구성. 12B급 고속 구동용 예약 구매 항목입니다. - 모델 예상: Gemma 4 12B 31.3 ~ 34.8 tok/s, 첫 토큰 5.1 ~ 11.0초; Qwen3.6 35B-A3B (MoE) 31.2 ~ 48.6 tok/s, 첫 토큰 2.3 ~ 5.4초 ### Apple Mac mini M5 Pro (48GB) - URL: https://localai.co.kr/hardware/mac-mini-m5-pro-48gb - 가용 메모리: 41GB - 메모리 대역폭: 307GB/s - 지속 부하: 약 97W - 판단: 27B~35B Q4 모델 적재량과 307GB/s 대역폭을 균형 있게 확보한 최신 구성입니다. - 모델 예상: Gemma 4 12B 31.3 ~ 34.8 tok/s, 첫 토큰 5.1 ~ 11.0초; Qwen3.6 35B-A3B (MoE) 23.5 ~ 56.3 tok/s, 첫 토큰 2.2 ~ 5.2초 ### Apple Mac mini M5 Pro (64GB) - URL: https://localai.co.kr/hardware/mac-mini-m5-pro-64gb - 가용 메모리: 56GB - 메모리 대역폭: 307GB/s - 지속 부하: 약 100W - 판단: 64GB 메모리와 307GB/s 대역폭을 갖춘 최신 고성능 Mac mini 구성입니다. - 모델 예상: Gemma 4 12B 31.3 ~ 34.8 tok/s, 첫 토큰 5.1 ~ 11.0초; Qwen3.6 35B-A3B (MoE) 23.5 ~ 56.3 tok/s, 첫 토큰 2.2 ~ 5.2초 ### Apple Mac Studio M4 Max (64GB) - URL: https://localai.co.kr/hardware/mac-studio-m4-max-64gb - 가용 메모리: 56GB - 메모리 대역폭: 546GB/s - 지속 부하: 약 120W - 판단: 35B급 모델의 빠른 생성과 조용한 지속 부하 성능을 함께 원할 때 유리합니다. - 모델 예상: Gemma 4 12B 57.2 ~ 63.4 tok/s, 첫 토큰 4.3 ~ 8.3초; Qwen3.6 35B-A3B (MoE) 39.2 ~ 81.9 tok/s, 첫 토큰 1.5 ~ 3.1초 ### Apple Mac Studio M4 Max (128GB) - URL: https://localai.co.kr/hardware/mac-studio-m4-max-128gb - 가용 메모리: 114GB - 메모리 대역폭: 546GB/s - 지속 부하: 약 130W - 판단: 단일 완제품에서 70B급과 고정밀 모델까지 넓게 비교하려는 사용자에게 맞습니다. - 모델 예상: Gemma 4 12B 57.2 ~ 63.4 tok/s, 첫 토큰 4.3 ~ 8.3초; Qwen3.8-Flash-Next 22 ~ 42.9 tok/s, 첫 토큰 4.4 ~ 8.6초 ### Apple Mac Studio M5 Max (64GB) - URL: https://localai.co.kr/hardware/mac-studio-m5-max-64gb - 가용 메모리: 56GB - 메모리 대역폭: 614GB/s - 지속 부하: 약 155W - 판단: 614GB/s 대역폭을 갖춘 최신 64GB 데스크톱 구성. 지속 부하 성능을 우선하는 사용자용입니다. - 모델 예상: Gemma 4 12B 64.4 ~ 71.3 tok/s, 첫 토큰 3.4 ~ 6.6초; Qwen3.6 35B-A3B (MoE) 43.1 ~ 92.1 tok/s, 첫 토큰 1.3 ~ 2.9초 ### Apple Mac Studio M5 Max (128GB) - URL: https://localai.co.kr/hardware/mac-studio-m5-max-128gb - 가용 메모리: 114GB - 메모리 대역폭: 614GB/s - 지속 부하: 약 165W - 판단: 대형 모델 적재량과 높은 지속 대역폭을 함께 확보한 최신 M5 Max 데스크톱 구성입니다. - 모델 예상: Gemma 4 12B 64.4 ~ 71.3 tok/s, 첫 토큰 3.4 ~ 6.6초; Qwen3.8-Flash-Next 24.1 ~ 48.3 tok/s, 첫 토큰 3.9 ~ 7.8초 ### NVIDIA GeForce RTX 3090 (24GB) - URL: https://localai.co.kr/hardware/nvidia-rtx-3090-24gb - 가용 메모리: 22.5GB - 메모리 대역폭: 936GB/s - 지속 부하: 약 420W - 판단: 936 GB/s 384비트 GDDR6X 24GB VRAM. 중고 가성비 및 커뮤니티에서 가장 널리 활용되는 24GB 로컬 LLM 기준 그래픽 카드입니다. - 모델 예상: Gemma 4 12B 95.5 ~ 106.1 tok/s, 첫 토큰 2.6 ~ 3.3초; Qwen3.6 35B-A3B (MoE) 58.2 ~ 146.3 tok/s, 첫 토큰 1.2 ~ 1.5초 ### NVIDIA GeForce RTX 4090 (24GB) - URL: https://localai.co.kr/hardware/nvidia-rtx-4090-24gb - 가용 메모리: 22.5GB - 메모리 대역폭: 1008GB/s - 지속 부하: 약 470W - 판단: 1,008 GB/s 384비트 GDDR6X 24GB VRAM. 27B 밀도형 및 35B MoE Q4 모델을 100% VRAM에 적재하여 고속 디코딩합니다. - 모델 예상: Gemma 4 12B 107.1 ~ 118.5 tok/s, 첫 토큰 1.5 ~ 1.6초; Qwen3.6 35B-A3B (MoE) 62.7 ~ 157.5 tok/s, 첫 토큰 0.68 ~ 0.71초 ### NVIDIA GeForce RTX 5090 (32GB) - URL: https://localai.co.kr/hardware/nvidia-rtx-5090-32gb - 가용 메모리: 30.5GB - 메모리 대역폭: 1792GB/s - 지속 부하: 약 620W - 판단: 1,792 GB/s(1.79 TB/s) 512비트 GDDR7 VRAM. 27B~35B급 4비트 모델을 단일 32GB GPU에 100% 적재하여 초고속 디코딩합니다. - 모델 예상: Gemma 4 12B 198 ~ 218.3 tok/s, 첫 토큰 1.2 ~ 1.4초; Qwen3.6 35B-A3B (MoE) 111.5 ~ 280 tok/s, 첫 토큰 0.55 ~ 0.62초 ### AMD Ryzen AI Max+ 395 (128GB Unified) - URL: https://localai.co.kr/hardware/amd-ryzen-ai-max-plus-395-128gb - 가용 메모리: 116GB - 메모리 대역폭: 256GB/s - 지속 부하: 약 125W - 판단: 256 GB/s LPDDR5X 256비트 통합 메모리 APU 플랫폼. 128GB 대용량 메모리로 대형 오픈 가중치 모델을 미니 PC/랩톱 폼팩터에서 구동합니다. - 모델 예상: Gemma 4 12B 25.4 ~ 28.3 tok/s, 첫 토큰 21.9 ~ 40.6초; Qwen3.8-Flash-Next 15.2 ~ 21.4 tok/s, 첫 토큰 27.2 ~ 64.1초 ### Apple MacBook Pro M5 Max (128GB) - URL: https://localai.co.kr/hardware/macbook-pro-m5-max-128gb - 가용 메모리: 114GB - 메모리 대역폭: 614GB/s - 지속 부하: 약 120W - 판단: 614 GB/s 통합 메모리 대역폭과 128GB 메모리로 대형 모델 및 Flash-Next(180B 상주) Q4 모델을 높은 대역폭으로 적재합니다. - 모델 예상: Gemma 4 12B 64.4 ~ 71.3 tok/s, 첫 토큰 3.4 ~ 6.6초; Qwen3.8-Flash-Next 24.1 ~ 48.3 tok/s, 첫 토큰 3.9 ~ 7.8초 ### Apple Mac Studio M5 Ultra (256GB) - URL: https://localai.co.kr/hardware/mac-studio-m5-ultra-256gb - 가용 메모리: 236GB - 메모리 대역폭: 1200GB/s - 지속 부하: 약 300W - 판단: 1,200 GB/s(1.2 TB/s) 통합 대역폭과 256GB 메모리로 초대형 MoE 모델(DeepSeek-V4, GLM-5.3 등)을 단일 기기에서 적재합니다. - 모델 예상: Gemma 4 12B 122.4 ~ 136 tok/s, 첫 토큰 2.5 ~ 4.5초; GLM-5.3-Flash (MoE) 81.3 ~ 90.3 tok/s, 첫 토큰 15.0 ~ 26.1초 ### Apple Mac Studio M5 Ultra (512GB) - URL: https://localai.co.kr/hardware/mac-studio-m5-ultra-512gb - 가용 메모리: 480GB - 메모리 대역폭: 1200GB/s - 지속 부하: 약 330W - 판단: 512GB 통합 메모리 공간으로 300B+ MoE 대규모 모델을 단일 머신에 고정밀(Q8 등)로 적재합니다. - 모델 예상: Gemma 4 12B 122.4 ~ 136 tok/s, 첫 토큰 2.5 ~ 4.5초; GLM-5.3-Flash (MoE) 81.3 ~ 90.3 tok/s, 첫 토큰 15.0 ~ 26.1초 ### NVIDIA GeForce RTX 5060 Ti (16GB) - URL: https://localai.co.kr/hardware/nvidia-rtx-5060-ti-16gb - 가용 메모리: 15GB - 메모리 대역폭: 448GB/s - 지속 부하: 약 250W - 판단: 448 GB/s GDDR7 VRAM. 8B 및 12B Q4 모델을 전용 VRAM에 100% 적재할 수 있는 16GB 엔트리 데스크톱 GPU입니다. - 모델 예상: Gemma 4 12B 47.6 ~ 52.7 tok/s, 첫 토큰 3.5 ~ 4.7초; Qwen3.6 35B-A3B (MoE) 15.1 ~ 19.5 tok/s, 첫 토큰 2.1 ~ 2.7초 ### NVIDIA A40 (48GB) - URL: https://localai.co.kr/hardware/nvidia-a40-48gb - 가용 메모리: 46GB - 메모리 대역폭: 696GB/s - 지속 부하: 약 400W - 판단: 696 GB/s 384비트 48GB ECC VRAM. 중고 워크스테이션 및 서버 환경에서 70B급 4비트 또는 27B~35B 고정밀 모델을 단일 카드에 적재할 수 있는 대용량 GPU입니다. - 모델 예상: Gemma 4 12B 71 ~ 78.9 tok/s, 첫 토큰 3.0 ~ 3.8초; DeepSeek-V4-Flash-0731 (MoE) 3.4 ~ 3.4 tok/s, 첫 토큰 10.5 ~ 13.3초 ### NVIDIA RTX PRO 6000 Blackwell (96GB) - URL: https://localai.co.kr/hardware/nvidia-rtx-pro-6000-blackwell-96gb - 가용 메모리: 93GB - 메모리 대역폭: 1792GB/s - 지속 부하: 약 650W - 판단: 1,792 GB/s 96GB ECC VRAM 워크스테이션 GPU. 가용 93GB VRAM 예산 이내의 70B~120B급 4비트 모델을 단일 카드에 완전 적재합니다. - 모델 예상: Gemma 4 12B 198 ~ 218.3 tok/s, 첫 토큰 1.1 ~ 1.4초; GLM-5.3-Flash (MoE) 6.6 ~ 6.6 tok/s, 첫 토큰 4.2 ~ 5.1초 ### Apple MacBook Pro M5 (32GB) - URL: https://localai.co.kr/hardware/macbook-pro-m5-32gb - 가용 메모리: 27GB - 메모리 대역폭: 153GB/s - 지속 부하: 약 55W - 판단: 153 GB/s 통합 메모리 대역폭. 12B dense 및 26B MoE Q4 모델을 단일 랩톱에서 단독 구동하기에 적합한 엔트리 구성입니다. - 모델 예상: Gemma 4 12B 15.2 ~ 16.9 tok/s, 첫 토큰 10.2 ~ 24.9초; Qwen3.6 35B-A3B (MoE) 9.4 ~ 25.6 tok/s, 첫 토큰 4.8 ~ 13.1초 ### Apple MacBook Pro M4 Pro (48GB) - URL: https://localai.co.kr/hardware/macbook-pro-m4-pro-48gb - 가용 메모리: 41GB - 메모리 대역폭: 273GB/s - 지속 부하: 약 85W - 판단: 273 GB/s 통합 메모리 대역폭과 48GB 메모리로 27B~35B MoE 모델을 여유 있게 적재할 수 있는 M4 세대 전문 랩톱 구성입니다. - 모델 예상: Gemma 4 12B 27.8 ~ 30.9 tok/s, 첫 토큰 6.3 ~ 14.2초; Qwen3.6 35B-A3B (MoE) 19.6 ~ 46.1 tok/s, 첫 토큰 2.7 ~ 6.3초 ### Apple MacBook Pro M4 Max (128GB) - URL: https://localai.co.kr/hardware/macbook-pro-m4-max-128gb - 가용 메모리: 114GB - 메모리 대역폭: 546GB/s - 지속 부하: 약 115W - 판단: 546 GB/s 통합 메모리 대역폭과 128GB 메모리로 70B급 고정밀 모델 및 Flash-Next(180B 상주) Q4를 고속 디코딩하는 M4 최고 사양 랩톱 구성입니다. - 모델 예상: Gemma 4 12B 57.2 ~ 63.4 tok/s, 첫 토큰 4.3 ~ 8.3초; Qwen3.8-Flash-Next 22 ~ 42.9 tok/s, 첫 토큰 4.4 ~ 8.6초 ### Apple Mac Studio M3 Ultra (512GB) - URL: https://localai.co.kr/hardware/mac-studio-m3-ultra-512gb - 가용 메모리: 480GB - 메모리 대역폭: 819GB/s - 지속 부하: 약 230W - 판단: 819 GB/s 통합 메모리 대역폭과 512GB 대용량 메모리로 대규모 오픈 모델 벤치마크의 표준 기준점 역할을 하는 M3 세대 최고 사양 워크스테이션입니다. - 모델 예상: Gemma 4 12B 83.5 ~ 92.8 tok/s, 첫 토큰 3.9 ~ 5.2초; GLM-5.3-Flash (MoE) 55.5 ~ 61.6 tok/s, 첫 토큰 19.3 ~ 26.1초 ### Apple MacBook Pro M3 Max (128GB) - URL: https://localai.co.kr/hardware/macbook-pro-m3-max-128gb - 가용 메모리: 114GB - 메모리 대역폭: 400GB/s - 지속 부하: 약 110W - 판단: 400 GB/s 통합 대역폭과 128GB 대용량 메모리로 70B급 및 Flash-Next(180B 상주) Q4 모델을 단독 적재하는 M3 세대 하이엔드 랩톱 구성입니다. - 모델 예상: Gemma 4 12B 41.9 ~ 46.5 tok/s, 첫 토큰 5.4 ~ 11.0초; Qwen3.8-Flash-Next 15.4 ~ 32.2 tok/s, 첫 토큰 5.9 ~ 12.3초 ### Apple MacBook Pro M3 Pro (36GB) - URL: https://localai.co.kr/hardware/macbook-pro-m3-pro-36gb - 가용 메모리: 30GB - 메모리 대역폭: 150GB/s - 지속 부하: 약 70W - 판단: 150 GB/s 통합 메모리 대역폭과 36GB 메모리로 12B~14B dense 및 26B MoE Q4 모델을 안정적으로 구동하는 M3 세대 랩톱 구성입니다. - 모델 예상: Gemma 4 12B 14.9 ~ 16.6 tok/s, 첫 토큰 11.7 ~ 27.6초; Qwen3.6 35B-A3B (MoE) 9.4 ~ 25.6 tok/s, 첫 토큰 4.8 ~ 13.1초 ### NVIDIA DGX Spark (128GB) - URL: https://localai.co.kr/hardware/nvidia-dgx-spark-128gb - 가용 메모리: 116GB - 메모리 대역폭: 273GB/s - 지속 부하: 약 190W - 판단: 273 GB/s 일관 통합 메모리(Coherent Unified Memory) 128GB를 탑재한 GB10 단일 노드 AI 워크스테이션입니다. - 모델 예상: Gemma 4 12B 27.8 ~ 30.9 tok/s, 첫 토큰 3.8 ~ 5.1초; Qwen3.8-Flash-Next 16.7 ~ 23.4 tok/s, 첫 토큰 3.1 ~ 4.2초 ### 2× NVIDIA DGX Spark 클러스터 (256GB) - URL: https://localai.co.kr/hardware/nvidia-dual-dgx-spark-256gb - 가용 메모리: 232GB - 메모리 대역폭: 546GB/s - 지속 부하: 약 380W - 판단: ConnectX-7 200Gbps(25 GB/s) 링크로 연결된 2개 노드(총 256GB 분산 메모리, 546 GB/s 합산 로컬 대역폭). 분산 모델 샤딩을 통해 최대 405B급 모델 수용이 가능하나 투명 UMA가 아니며 노드 간 통신 오버헤드가 발생합니다. - 모델 예상: Gemma 4 12B 27.8 ~ 44.5 tok/s, 첫 토큰 2.7 ~ 5.4초; GLM-5.3-Flash (MoE) 18.5 ~ 29.6 tok/s, 첫 토큰 6.4 ~ 12.6초 ### 2× NVIDIA GeForce RTX 3090 NVLink (48GB) - URL: https://localai.co.kr/hardware/nvidia-dual-rtx-3090-48gb - 가용 메모리: 45GB - 메모리 대역폭: 1872GB/s - 지속 부하: 약 780W - 판단: 2× 24GB VRAM(합산 48GB, 합산 로컬 대역폭 1,872 GB/s)과 3세대 NVLink(112.5 GB/s 양방향)로 연결된 듀얼 GPU 구성입니다. 텐서/파이프라인 병렬화 지원 시 70B급 모델을 온전 적재합니다. - 모델 예상: Gemma 4 12B 129.8 ~ 180.3 tok/s, 첫 토큰 1.6 ~ 2.7초; DeepSeek-V4-Flash-0731 (MoE) 3.4 ~ 3.4 tok/s, 첫 토큰 5.8 ~ 9.7초 ### 2× NVIDIA GeForce RTX 5090 PCIe (64GB) - URL: https://localai.co.kr/hardware/nvidia-dual-rtx-5090-64gb - 가용 메모리: 61GB - 메모리 대역폭: 3584GB/s - 지속 부하: 약 1100W - 판단: 2× 32GB GDDR7 VRAM(합산 64GB, 합산 로컬 대역폭 3,584 GB/s). RTX 5090은 NVLink를 지원하지 않으며 PCIe Gen5 인터페이스로만 통신하므로 All-Reduce 통신 병목에 따른 병렬 효율 감쇠가 발생합니다. - 모델 예상: Gemma 4 12B 198 ~ 305.6 tok/s, 첫 토큰 0.89 ~ 1.4초; GLM-5.3-Flash (MoE) 5.1 ~ 5.2 tok/s, 첫 토큰 4.2 ~ 6.6초 ### 2× NVIDIA A40 NVLink (96GB) - URL: https://localai.co.kr/hardware/nvidia-dual-a40-96gb - 가용 메모리: 92GB - 메모리 대역폭: 1392GB/s - 지속 부하: 약 700W - 판단: 2× 48GB ECC VRAM(합산 96GB, 합산 로컬 대역폭 1,392 GB/s)과 NVLink(112.5 GB/s)로 결합된 엔터프라이즈 듀얼 워크스테이션 구성입니다. 70B~120B급 모델을 텐서 병렬화로 구동합니다. - 모델 예상: Gemma 4 12B 96.5 ~ 132.5 tok/s, 첫 토큰 1.9 ~ 3.1초; GLM-5.3-Flash (MoE) 3.4 ~ 3.4 tok/s, 첫 토큰 7.1 ~ 11.9초 ## 직접 비교 - [맥 미니 M4 32GB vs M4 Pro 48GB 로컬 LLM 비교](https://localai.co.kr/compare/mac-mini-m4-32gb-vs-m4-pro-48gb): 가격과 27B 적재만 보면 M4 32GB, 35B 여유와 대역폭까지 원하면 M4 Pro 48GB가 맞습니다. - [RTX 3090 vs RTX 5090 로컬 LLM 성능·전기요금 비교](https://localai.co.kr/compare/rtx-3090-vs-rtx-5090-local-llm): 24GB 안에서 가성비를 우선하면 3090, 27B급 속도와 32GB 적재 여유가 중요하면 5090이 유리합니다. - [RTX 3090 2장 vs RTX 5090 1장 로컬 LLM 비교](https://localai.co.kr/compare/dual-rtx-3090-vs-rtx-5090): 큰 모델을 넣는 것이 우선이면 3090 두 장, 단일 GPU 속도와 단순한 구성이 우선이면 5090 한 장이 맞습니다. - [RTX 4090 vs RTX 5090 로컬 LLM 속도·VRAM 비교](https://localai.co.kr/compare/rtx-4090-vs-rtx-5090-local-llm): 24GB에 들어가는 모델이면 4090 중고가 합리적일 수 있고, 32GB 적재 한계가 필요하면 5090으로 좁혀집니다. - [NVIDIA DGX Spark vs 맥 스튜디오 128GB 로컬 LLM 비교](https://localai.co.kr/compare/dgx-spark-vs-mac-studio-128gb): CUDA 개발 환경과 NVIDIA 생태계가 필요하면 DGX Spark, 조용한 완제품과 MLX 사용성이 중요하면 맥 스튜디오가 맞습니다. - [DGX Spark 2대 vs RTX 5090 2장 로컬 LLM 비교](https://localai.co.kr/compare/dual-dgx-spark-vs-dual-rtx-5090): 초대형 모델 적재량은 DGX Spark 두 대, 64GB 안의 CUDA 처리 속도는 RTX 5090 두 장이 유리합니다. - [Ryzen AI Max+ 395 128GB vs 맥 스튜디오 128GB 비교](https://localai.co.kr/compare/ryzen-ai-max-395-vs-mac-studio-128gb): Windows·Linux 호환성과 가격을 우선하면 Ryzen AI Max+, 메모리 대역폭과 MLX 완성도를 우선하면 맥 스튜디오가 유리합니다. - [NVIDIA A40 48GB vs RTX 3090 2장 로컬 LLM 비교](https://localai.co.kr/compare/a40-48gb-vs-dual-rtx-3090): 단일 48GB VRAM과 서버 환경을 원하면 A40, 부품 접근성과 총 대역폭을 중시하면 3090 두 장을 검토할 수 있습니다. ## 계산 해석 - 프리필은 입력 토큰 처리 단계이며 첫 토큰 시간에 직접 영향을 줍니다. - 디코드는 답변 토큰을 순차 생성하는 단계이며 단일 사용자 환경에서는 메모리 대역폭과 활성 파라미터의 영향을 크게 받습니다. - 멀티 GPU와 멀티 장비는 메모리가 자동 결합되지 않으며 런타임 분산 지원과 인터커넥트 병목을 확인해야 합니다.