이 기기에서 작은 LLM 돌려보기

작은 한국어 언어 모델을 WebGPU로 브라우저 안에서 직접 내려받고 자유롭게 질문해 첫 토큰 시간과 토큰 생성 속도를 확인합니다.

내 컴퓨터는 상위 몇 %일까?

로컬 AI 생성 속도를 직접 측정합니다. GPU 이름과 논리 프로세서 수는 브라우저가 공개하는 범위에서 표시합니다. 칩셋 상세 확인을 누르면 그래픽 드라이버의 추가 정보를 조회합니다. 확인되지 않는 CPU와 RAM은 직접 입력할 수 있으며, 직접 입력한 사양은 기기 안에만 저장하고 순위에는 반영하지 않습니다.

표준 측정은 준비 실행 후 같은 질문으로 첫 토큰을 제외한 128토큰 디코딩을 세 번 측정하고 중간값을 기록합니다. 개인 최고 기록과 결과를 공유할 수 있습니다.

초기에는 체험용 가상 비교군 기준의 상위 %를 표시합니다. 실제 컴퓨터 분포를 측정하거나 추정한 값은 아닙니다. 순위 제출에 동의한 동일 조건 기록이 30개 이상이면 참여자 순위로 전환하며 가상 비교군과 실제 참여 자료를 혼합하지 않습니다. 전체 컴퓨터의 종합 성능이나 큰 모델의 속도 순위가 아닙니다.

무엇을 확인할 수 있나요?

미리 정한 문장만 재생하는 시뮬레이션이 아닙니다. 질문을 직접 입력하면 모델 파일과 연산이 사용자의 브라우저 안에서 실행되고 답변이 한 토큰씩 나타납니다. 완료 후에는 첫 토큰이 나오기까지 걸린 시간과 실제 토큰 생성 속도를 함께 표시합니다.

실행 전에 알아둘 점

처음 실행할 때 Qwen2.5 0.5B 모델 파일을 내려받고 다음 실행부터는 브라우저 캐시를 사용합니다. 실행에는 약 945MB의 GPU 메모리가 필요하며 WebGPU를 지원하는 최신 Chrome, Edge 또는 Safari가 필요합니다. 작은 모델이므로 최신 사실을 확인하는 용도보다 로컬 실행 과정과 기기별 체감 속도를 살펴보는 데 적합합니다.

질문은 어디에서 처리되나요?

입력한 질문과 생성된 답변은 이 체험 기능의 분석 데이터로 전송하지 않습니다. 모델은 버튼을 누른 뒤에만 다운로드되며, 현재 탭을 닫으면 실행 중인 작업도 종료됩니다.

더 큰 모델과 장비의 예상 프리필·토큰 생성 속도 비교하기