新規モデル · 2026.09.29
ローカルPC操作向けHolo4:モデル・runner・権限の境界
モデルは画面から次の行動を選び、別のrunnerが実際の入力を実行します。
Holo4は画面を見て次の行動を提案し、hai-agentsなどの別runnerがクリックやキー入力を実行します。27Bと35B-A3Bでは構造と重みのライセンスが異なるため、checkpoint1を選ぶ前にmodel cardとbackendを確認してください。読み取り専用の作業から始め、メッセージ送信・削除・購入など外部状態を変える操作には人の承認を設けます。
画面認識とtool実行がchat modelに加わる
一般的なchat modelはtextを受け取り回答を返します。PC操作modelは画面画像とtask指示を受け取り、次にclickする場所、入力する文字列、呼び出すtoolを選びます。Holo4の応答は行動計画または構造化tool requestであり、それ自体がmouse clickではありません。画面をcaptureしてmodelへ送り、応答を実際の入力に変換するrunnerが別途必要です。
model、harness、接続tool、OS権限はそれぞれ別の構成要素です。modelがbrowser操作を要求しても、harnessがそのtoolに対応していなければ実行されません。反対にharnessがbrowserやfileに広い権限を持つと、誤った計画が実際の変更につながる可能性があります。「ローカルmodel」だから安全、またはofflineだと決めつけないでください。
最初のtestは非機密のtest pageで特定の文言を探す読み取り専用作業にします。screenshotとtool requestがlogに残ることを確認してください。実際のemail、購入、account設定、重要fileは初回の実習から除外します。

checkpointの構造とlicenseを正確なmodel名で確認する
Holo4-27Bのmodel cardは、Qwen3.8ベースの27B dense architectureと262,144 token2のcontext設定を記載しています。この設定は、その長さで十分なmemoryや速度が得られる保証ではありません。screenshotや長い行動履歴もvision処理とKV cache3用のmemoryを消費します。
Holo4-35B-A3BはQwen3.6ベースの別のMoE4 checkpointです。全weight規模とtokenごとの活性量を区別してください。3B相当のfileだけで動くわけではありません。27BのlicenseはCC BY-NC 4.0、35B-A3BはApache-2.0です。Holotron4など似た名前のmodelと混同せず、正確なrepository IDを確認します。
model weightsの利用許可は、websiteへのaccessやclick自動化の権限を付与するものではありません。runner code、接続tool、model weightsを個別に確認してください。業務利用では組織の法務・security policyに従います。
| checkpoint | 公式cardの説明 | 確認事項 |
|---|---|---|
| Holo4-27B | Qwen3.8ベースのdense、27B | CC BY-NC 4.0、vision用memory |
| Holo4-35B-A3B | Qwen3.6ベースのMoE、35B-A3B | Apache-2.0、全weightと活性parameterの違い |
| hai-agents | model応答をtool作業へ渡すharness | code、tool、権限を個別に確認 |
model選択時はcheckpoint名、構造、利用条件を合わせて比較します。
Holo4-27B
- 公式cardの説明
- Qwen3.8ベースのdense、27B
- 確認事項
- CC BY-NC 4.0、vision用memory
Holo4-35B-A3B
- 公式cardの説明
- Qwen3.6ベースのMoE、35B-A3B
- 確認事項
- Apache-2.0、全weightと活性parameterの違い
hai-agents
- 公式cardの説明
- model応答をtool作業へ渡すharness
- 確認事項
- code、tool、権限を個別に確認

対応するformatとrunnerの組み合わせを先に選ぶ
実行経路は、modelが提供するformatとrunnerが対応するbackendの組み合わせである必要があります。model cardでTransformers、vLLMなどの実装を確認し、そのbackendがscreenshot入力とtool call5にも対応するか調べてください。text生成だけでは画面理解も動作する証明になりません。
GGUF6、FP87、NVFP48ではweight表現と必要hardwareが異なります。formatが公開されていても、すべてのrunnerがすべてのGPU9やMacで対応するとは限りません。NVFP4は対応hardwareとkernelを、GGUFは現在のllama.cpp系versionでmodelとvisionが対応するか確認します。file sizeだけから実行時memoryを推測せず、load logとdevice使用量を確認してください。
hai-agents quickstartで最新のinstall手順と対応modelを確認し、別のtest profileで始めてください。現在のdocsとinstall済みcodeが一致しない場合やcheckpoint対応が不明な場合は、commandを作らず公式releaseを確認します。このガイドではデバイス別の新たな性能測定は行っていません。
読み取り専用のsmoke testから段階的に広げる
browser profileまたはtest accountを別に作成し、機密性のあるlogin sessionを外します。access先をtest domain一つに制限し、「返品可能期間を見つけて報告して」といった読み取り専用taskを実行します。正常ならrunnerがpageをcaptureし、modelが該当文を探して報告し、tool callと画面がlogに記録されます。
次に、一時folder内のfileを読んで一覧化するなど、取り消せるローカル作業だけを許可します。runnerが許可directory外を開けないことを確認し、taskの前後でfileを比較してください。
その後、制限付きの書き込み操作を試します。下書き作成は許可して送信をblockする、または一時fileの保存は許可して上書きには承認を必要とする、といった設定が考えられます。削除、購入、message送信、account変更の前には、対象と内容を人が確認してください。tool call実行中にもpause/stopが機能するか試します。
목표: 테스트 웹페이지에서 환불 가능 기간을 찾아 한 문장으로 보고한다.
허용: 지정 도메인 읽기, 화면 캡처, 텍스트 응답.
금지: 로그인 정보 입력, 링크 열기, 양식 제출, 파일 다운로드, 메시지 발송.
중단: 예상하지 못한 팝업이나 계정 정보가 보이면 멈추고 사람에게 알린다.
검토: 모델 요청, 도구 호출, 캡처 화면, 최종 답을 함께 확인한다.
成功率と失敗の影響・復旧を合わせて測る
同じtestを5回繰り返し、成功の有無、誤click、最初の操作までの時間、完了時間、人の介入回数を記録します。layout変更やpopup表示後も無理に操作を続けるか確認してください。速くても危険なbuttonを何度も押そうとするagentは、運用に適しません。
model planとrunner logを保存する場合も、password、個人data、session tokenが記録されないようにします。screenshotの保存期間とaccessを制限し、backendやtelemetryが外部へdataを送るか確認してください。
画面が予想と異なる場合、agentは自動で続行せず停止して人に確認するべきです。test前に一時folderの復旧やbrowserのresetなど、失敗時の手順を準備してください。導入基準には成功率だけでなく、影響範囲、検知時間、停止可能性、least-privilege制御も含めます。
拡大前に反復作業を一つ試して判断する
modelが端末に読み込まれるか、backendがvision入力とtool callを処理できるか、runnerの権限が意図どおりに機能するかを個別に確認します。load失敗ではcheckpoint、format、memoryを、画面の読み違いではcapture経路を、tool call失敗ではharness互換性を調べます。
人による確認と修正も含め、5回の反復で作業時間全体が短縮したかを判断します。作業の大半が要約やcode質問なら、一般的なlanguage modelのほうが簡単かもしれません。Holo4を選ぶ根拠は、定めた境界内で画面・tool作業を実際に安全に減らせたという記録です。
公式model cardとrunner資料
architecture、license、対応formatは各checkpointの最新公式cardに基づきます。このガイドは端末性能の測定値を示しません。選択したrunnerとtaskで速度と成功率を直接確認してください。
用語の注釈
チェックポイント — 学習済みモデルの重みなどを保存したファイルです。同じモデル系列でも、版や用途によって異なるチェックポイントを使うことがあります。
本文に戻るトークン — モデルが入力や出力を分けて処理する単位です。1トークンが1文字や一定の時間に相当するわけではありません。
本文に戻るKVキャッシュ — 過去トークンのAttention用キー・バリューを保存し、後続トークン生成で再利用するメモリです。容量はコンテキスト長やバッチサイズで変わります。
本文に戻るMoE — 複数の専門家サブネットワークから入力に応じて一部を選ぶモデル構造です。総パラメータ数と1トークン処理時に有効な数は異なることがあります。
本文に戻るツール呼び出し — ファイル読み取り、検索、コマンド実行などの外部機能を、名前と引数でモデルが要求する形式です。実行の有無はエージェントランタイムと権限設定が決めます。
本文に戻るGGUF — モデル情報を格納するファイル形式で、llama.cpp系のツールで広く使われます。形式だけで特定ハードウェアへの対応や速度が保証されるわけではありません。
本文に戻るFP8 — 8ビット浮動小数点形式の総称です。具体的な形式や対応範囲はハードウェアとソフトウェアによって異なります。
本文に戻るNVFP4 — NVIDIAが定義した4ビット浮動小数点データ形式です。対応状況はGPU世代、モデル、ソフトウェア実装によって異なります。
本文に戻るGPU — 多くの計算を並列に処理するプロセッサーです。AIモデルの実行ではモデル計算を担います。
本文に戻る