새로 나온 모델 · 2026.09.29
Holo4 로컬 컴퓨터 조작: 모델·실행기·권한 경계
모델은 화면에서 다음 행동을 고르고, 실행기는 실제 입력을 수행합니다.
Holo4는 화면을 보고 다음 행동을 제안하는 컴퓨터 사용 모델이며, 실제 클릭·키 입력에는 hai-agents 같은 별도 실행기가 필요합니다. 27B와 35B-A3B는 구조와 가중치 라이선스가 다르므로 모델 카드와 backend를 확인하세요. 먼저 읽기 전용 작업부터 시험하고 메시지 발송·삭제·결제 같은 외부 변경은 사람 승인을 둡니다.
채팅 모델에 화면 관찰과 도구 실행이 더해집니다
일반 채팅 모델은 텍스트를 받아 답을 돌려줍니다. 컴퓨터 사용 모델은 화면 이미지와 작업 지시를 받아 다음에 누를 위치, 입력할 문자열, 호출할 도구를 고릅니다. Holo4의 응답은 행동 계획 또는 구조화된 도구 요청이며 그 자체가 마우스 클릭은 아닙니다. 화면을 캡처해 모델에 전달하고 응답을 실제 입력으로 옮기는 runner가 따로 필요합니다.
모델, harness, 연결 도구, 운영체제 권한은 각각 다른 구성요소입니다. 모델이 브라우저 조작을 요청해도 harness가 지원하지 않으면 수행되지 않습니다. 반대로 harness가 브라우저나 파일에 강한 권한을 가지면 잘못된 계획도 실제 변경으로 이어질 수 있습니다. ‘로컬 모델’이라고 해서 작업이 안전하거나 오프라인이라고 추정하지 마세요.
첫 시험은 비민감한 테스트 페이지에서 특정 문구를 찾는 읽기 전용 작업으로 정합니다. 캡처와 도구 요청이 로그에 남는지 확인하고, 실제 메일·결제·계정 설정·중요 파일은 초기 실습에서 제외합니다.

체크포인트 구조와 라이선스를 이름으로 확인합니다
Holo4-27B 모델 카드는 Qwen3.8 기반 27B dense 구조와 262,144 토큰1 context 설정을 설명합니다. 설정값은 해당 길이에서 메모리나 속도가 충분하다는 보장이 아닙니다. 화면 이미지와 긴 행동 기록이 쌓이면 vision 처리와 KV cache2에도 메모리가 필요합니다.
Holo4-35B-A3B는 Qwen3.6 기반의 다른 MoE3 체크포인트4입니다. 전체 가중치 규모와 토큰당 활성량을 구분해야 하며 활성 3B만큼의 파일만 필요하지 않습니다. 27B의 CC BY-NC 4.0 조건은 35B-A3B의 Apache-2.0과 다릅니다. Holotron4 등 비슷한 이름의 다른 모델과 섞지 말고 정확한 repository ID를 확인하세요.
모델 가중치 사용 허가가 웹사이트 접근이나 자동 클릭 권한까지 허용하지는 않습니다. 실행기 코드, 연결 도구, 모델 가중치를 각각 검토하고 업무용 사용은 조직의 법무·보안 정책을 따릅니다.
| 항목 | 공식 카드의 설명 | 확인할 점 |
|---|---|---|
| Holo4-27B | Qwen3.8 기반 밀집형, 27B | CC BY-NC 4.0, vision 메모리 |
| Holo4-35B-A3B | Qwen3.6 기반 MoE, 35B-A3B | Apache-2.0, 전체 가중치와 활성량 |
| hai-agents | 모델 응답을 도구 작업으로 전달 | 코드·도구·실행 권한 별도 검토 |
체크포인트 선택 시 이름·구조·조건을 함께 봅니다.
Holo4-27B
- 공식 카드의 설명
- Qwen3.8 기반 밀집형, 27B
- 확인할 점
- CC BY-NC 4.0, vision 메모리
Holo4-35B-A3B
- 공식 카드의 설명
- Qwen3.6 기반 MoE, 35B-A3B
- 확인할 점
- Apache-2.0, 전체 가중치와 활성량
hai-agents
- 공식 카드의 설명
- 모델 응답을 도구 작업으로 전달
- 확인할 점
- 코드·도구·실행 권한 별도 검토

지원 포맷과 runner 조합을 먼저 고릅니다
실행 경로는 모델 카드의 포맷과 runner backend 지원이 만나는 조합이어야 합니다. Transformers, vLLM 또는 다른 구현을 확인하고, 해당 backend가 screenshot 입력과 tool call5도 처리하는지 확인합니다. 텍스트 생성이 된다는 사실만으로 화면 이해까지 동작한다고 볼 수 없습니다.
GGUF6·FP87·NVFP48는 파일 표현과 요구 하드웨어가 다릅니다. 특정 포맷이 존재해도 모든 GPU9나 Mac에서 같은 실행기가 지원하는 것은 아닙니다. NVFP4는 호환 장치와 커널을, GGUF는 현재 llama.cpp 계열 버전의 모델·vision 지원을 확인하세요. 파일 크기만으로 실제 실행 메모리를 추정하지 말고 로드 로그와 장치 사용량을 살핍니다.
hai-agents quickstart의 현재 설치법과 지원 모델을 확인하고 별도 테스트 프로필에서 시작하세요. 현재 문서와 설치 코드가 맞지 않거나 체크포인트 지원이 명시되지 않으면 임의 명령을 만들지 말고 공식 release를 확인합니다. 이 글은 장비별 성능을 새로 측정하지 않았습니다.
읽기 전용 smoke test부터 단계별로 넓힙니다
별도 브라우저 프로필이나 테스트 계정을 만들고 민감한 로그인 세션을 제거합니다. 도메인을 테스트 페이지 하나로 제한하고 ‘환불 가능 기간을 찾아 보고하라’는 읽기 작업을 실행합니다. 정상이라면 runner는 화면을 캡처하고 모델은 관련 문장을 찾아 보고하며, 도구 호출과 화면이 로그에 남습니다.
다음에는 임시 폴더의 파일을 읽어 목록으로 만드는 작업처럼 되돌릴 수 있는 로컬 일만 허용합니다. runner가 승인한 경로 밖을 열지 않는지 확인하고 작업 전후 파일을 비교하세요.
그 다음 제한된 쓰기 작업을 시험합니다. 초안 작성은 허용하되 발송은 차단하거나, 임시 파일 저장은 허용하되 덮어쓰기는 사람 승인을 받게 설정하세요. 삭제·결제·메시지 발송·계정 변경은 실행 전에 대상과 내용을 사람이 확인합니다. pause/stop가 도구 호출 중에도 동작하는지 시험합니다.
목표: 테스트 웹페이지에서 환불 가능 기간을 찾아 한 문장으로 보고한다.
허용: 지정 도메인 읽기, 화면 캡처, 텍스트 응답.
금지: 로그인 정보 입력, 링크 열기, 양식 제출, 파일 다운로드, 메시지 발송.
중단: 예상하지 못한 팝업이나 계정 정보가 보이면 멈추고 사람에게 알린다.
검토: 모델 요청, 도구 호출, 캡처 화면, 최종 답을 함께 확인한다.
성공률과 실패의 영향·회복을 함께 측정합니다
같은 테스트를 다섯 번 반복해 성공 여부, 잘못된 클릭, 첫 행동 대기, 완료 시간, 사람 개입 횟수를 기록합니다. 레이아웃이나 팝업이 달라져도 무리하게 다음 행동을 계속하는지 확인하세요. 속도가 빨라도 위험 버튼을 반복해서 누르면 운영할 수 없습니다.
모델 계획과 runner 기록을 보관하되 로그에 비밀번호·개인정보·세션 토큰이 남지 않게 합니다. 화면 캡처 보관 기간과 접근 권한을 제한하고, backend나 telemetry가 외부로 데이터를 보내는지 확인하세요.
화면이 예상과 다르면 자동 진행을 멈추고 사람에게 묻는 것이 바람직합니다. 임시 폴더 복구와 브라우저 초기화 등 실패 회복 절차를 미리 정합니다. 성공률뿐 아니라 피해 범위, 발견 시간, 중단 가능성, 권한 최소화까지 도입 기준에 포함합니다.
확대 전 한 가지 반복 업무로 판단합니다
현재 장비에서 모델이 로드되는지, vision 입력과 tool call이 backend에서 동작하는지, runner 제한 권한이 의도대로 적용되는지 분리해 확인합니다. 로드 오류는 체크포인트·포맷·메모리를, 화면 오독은 캡처 경로를, tool call 실패는 harness 호환을 점검합니다.
다섯 번의 반복 업무에서 사람의 확인과 수정까지 포함한 총 시간이 줄었는지 판단하세요. 작업 대부분이 요약이나 코드 질의라면 일반 언어 모델이 더 단순할 수 있습니다. Holo4를 선택할 근거는 안전한 경계 안에서 화면·도구 작업을 실제로 줄였다는 기록입니다.
공식 카드와 실행기 자료
아키텍처·라이선스·지원 포맷은 각 체크포인트의 최신 공식 카드에 따릅니다. 이 글은 장비 성능 측정을 제시하지 않으며 속도와 성공률은 선택한 runner·작업에서 직접 확인해야 합니다.
용어 각주
토큰 — 모델이 입력이나 출력을 나누어 처리하는 단위입니다. 토큰 하나가 글자 하나나 일정한 시간 길이에 해당하지는 않습니다.
본문으로 돌아가기KV 캐시 — 어텐션에서 이전 토큰의 키·값을 저장해 다음 토큰 생성 때 재사용하는 메모리입니다. 문맥 길이와 배치 크기에 따라 용량이 달라집니다.
본문으로 돌아가기MoE — 여러 전문가 하위망 중 일부를 입력에 따라 선택해 사용하는 모델 구조입니다. 총 파라미터 수와 한 토큰 처리에 활성화되는 파라미터 수는 다를 수 있습니다.
본문으로 돌아가기체크포인트 — 학습된 모델의 가중치 등을 저장한 파일입니다. 같은 모델 계열도 버전이나 용도에 따라 다른 체크포인트를 쓸 수 있습니다.
본문으로 돌아가기도구 호출 — 모델이 파일 읽기·검색·명령 실행 같은 외부 기능의 이름과 인자를 요청하는 형식입니다. 요청을 실제로 실행할지는 에이전트 런타임과 권한 설정이 결정합니다.
본문으로 돌아가기GGUF — 모델 정보를 담는 파일 형식으로 llama.cpp 계열 도구에서 널리 사용됩니다. 파일 형식만으로 특정 하드웨어 호환성이나 속도가 보장되지는 않습니다.
본문으로 돌아가기FP8 — 8비트 부동소수점 수치 형식 계열입니다. 세부 형식과 지원 범위는 하드웨어 및 소프트웨어에 따라 다릅니다.
본문으로 돌아가기NVFP4 — NVIDIA가 정의한 4비트 부동소수점 데이터 형식입니다. 지원 여부는 GPU 세대, 모델과 소프트웨어 구현에 따라 다릅니다.
본문으로 돌아가기GPU — 많은 계산을 병렬로 처리하는 프로세서입니다. AI 모델 실행에서는 모델 계산을 맡습니다.
본문으로 돌아가기