新規モデル · 2026.09.29

ローカルPC操作向けHolo4:モデル・runner・権限の境界

モデルは画面から次の行動を選び、別のrunnerが実際の入力を実行します。

Holo4は画面を見て次の行動を提案し、hai-agentsなどの別runnerがクリックやキー入力を実行します。27Bと35B-A3Bでは構造と重みのライセンスが異なるため、checkpoint1を選ぶ前にmodel cardとbackendを確認してください。読み取り専用の作業から始め、メッセージ送信・削除・購入など外部状態を変える操作には人の承認を設けます。

実行条件と要点
  • モデルは行動を提案し、別runnerが画面を取得して入力を実行します。
  • 27BはQwen3.8ベースのdense checkpoint、35B-A3BはQwen3.6ベースのMoE checkpointです。
  • 27BのCC BY-NC 4.0と35B-A3BのApache-2.0を混同しないでください。
  • 読み取り専用・一時データから始め、取り消しにくい操作には人の承認を設けます。

画面認識とtool実行がchat modelに加わる

一般的なchat modelはtextを受け取り回答を返します。PC操作modelは画面画像とtask指示を受け取り、次にclickする場所、入力する文字列、呼び出すtoolを選びます。Holo4の応答は行動計画または構造化tool requestであり、それ自体がmouse clickではありません。画面をcaptureしてmodelへ送り、応答を実際の入力に変換するrunnerが別途必要です。

model、harness、接続tool、OS権限はそれぞれ別の構成要素です。modelがbrowser操作を要求しても、harnessがそのtoolに対応していなければ実行されません。反対にharnessがbrowserやfileに広い権限を持つと、誤った計画が実際の変更につながる可能性があります。「ローカルmodel」だから安全、またはofflineだと決めつけないでください。

最初のtestは非機密のtest pageで特定の文言を探す読み取り専用作業にします。screenshotとtool requestがlogに残ることを確認してください。実際のemail、購入、account設定、重要fileは初回の実習から除外します。

モデル画面とデスクトップrunnerが接続された環境
モデルが行動を提案しrunnerが画面と入力を扱います。

checkpointの構造とlicenseを正確なmodel名で確認する

Holo4-27Bのmodel cardは、Qwen3.8ベースの27B dense architectureと262,144 token2のcontext設定を記載しています。この設定は、その長さで十分なmemoryや速度が得られる保証ではありません。screenshotや長い行動履歴もvision処理とKV cache3用のmemoryを消費します。

Holo4-35B-A3BはQwen3.6ベースの別のMoE4 checkpointです。全weight規模とtokenごとの活性量を区別してください。3B相当のfileだけで動くわけではありません。27BのlicenseはCC BY-NC 4.0、35B-A3BはApache-2.0です。Holotron4など似た名前のmodelと混同せず、正確なrepository IDを確認します。

model weightsの利用許可は、websiteへのaccessやclick自動化の権限を付与するものではありません。runner code、接続tool、model weightsを個別に確認してください。業務利用では組織の法務・security policyに従います。

model選択時はcheckpoint名、構造、利用条件を合わせて比較します。
checkpoint公式cardの説明確認事項
Holo4-27BQwen3.8ベースのdense、27BCC BY-NC 4.0、vision用memory
Holo4-35B-A3BQwen3.6ベースのMoE、35B-A3BApache-2.0、全weightと活性parameterの違い
hai-agentsmodel応答をtool作業へ渡すharnesscode、tool、権限を個別に確認

model選択時はcheckpoint名、構造、利用条件を合わせて比較します。

Holo4-27B

公式cardの説明
Qwen3.8ベースのdense、27B
確認事項
CC BY-NC 4.0、vision用memory

Holo4-35B-A3B

公式cardの説明
Qwen3.6ベースのMoE、35B-A3B
確認事項
Apache-2.0、全weightと活性parameterの違い

hai-agents

公式cardの説明
model応答をtool作業へ渡すharness
確認事項
code、tool、権限を個別に確認
denseとMoEの重み・メモリ構造の比較
活性パラメータと全重みを区別します。

対応するformatとrunnerの組み合わせを先に選ぶ

実行経路は、modelが提供するformatとrunnerが対応するbackendの組み合わせである必要があります。model cardでTransformers、vLLMなどの実装を確認し、そのbackendがscreenshot入力とtool call5にも対応するか調べてください。text生成だけでは画面理解も動作する証明になりません。

GGUF6、FP87、NVFP48ではweight表現と必要hardwareが異なります。formatが公開されていても、すべてのrunnerがすべてのGPU9やMacで対応するとは限りません。NVFP4は対応hardwareとkernelを、GGUFは現在のllama.cpp系versionでmodelとvisionが対応するか確認します。file sizeだけから実行時memoryを推測せず、load logとdevice使用量を確認してください。

hai-agents quickstartで最新のinstall手順と対応modelを確認し、別のtest profileで始めてください。現在のdocsとinstall済みcodeが一致しない場合やcheckpoint対応が不明な場合は、commandを作らず公式releaseを確認します。このガイドではデバイス別の新たな性能測定は行っていません。

読み取り専用のsmoke testから段階的に広げる

browser profileまたはtest accountを別に作成し、機密性のあるlogin sessionを外します。access先をtest domain一つに制限し、「返品可能期間を見つけて報告して」といった読み取り専用taskを実行します。正常ならrunnerがpageをcaptureし、modelが該当文を探して報告し、tool callと画面がlogに記録されます。

次に、一時folder内のfileを読んで一覧化するなど、取り消せるローカル作業だけを許可します。runnerが許可directory外を開けないことを確認し、taskの前後でfileを比較してください。

その後、制限付きの書き込み操作を試します。下書き作成は許可して送信をblockする、または一時fileの保存は許可して上書きには承認を必要とする、といった設定が考えられます。削除、購入、message送信、account変更の前には、対象と内容を人が確認してください。tool call実行中にもpause/stopが機能するか試します。

最初の安全test用task card
목표: 테스트 웹페이지에서 환불 가능 기간을 찾아 한 문장으로 보고한다.
허용: 지정 도메인 읽기, 화면 캡처, 텍스트 응답.
금지: 로그인 정보 입력, 링크 열기, 양식 제출, 파일 다운로드, 메시지 발송.
중단: 예상하지 못한 팝업이나 계정 정보가 보이면 멈추고 사람에게 알린다.
검토: 모델 요청, 도구 호출, 캡처 화면, 최종 답을 함께 확인한다.
実accountや外部状態を変更する前に、task範囲と禁止操作を定めます。
PC操作を実行するか停止するか選ぶ人
外部状態の変更前に人が確認します。

成功率と失敗の影響・復旧を合わせて測る

同じtestを5回繰り返し、成功の有無、誤click、最初の操作までの時間、完了時間、人の介入回数を記録します。layout変更やpopup表示後も無理に操作を続けるか確認してください。速くても危険なbuttonを何度も押そうとするagentは、運用に適しません。

model planとrunner logを保存する場合も、password、個人data、session tokenが記録されないようにします。screenshotの保存期間とaccessを制限し、backendやtelemetryが外部へdataを送るか確認してください。

画面が予想と異なる場合、agentは自動で続行せず停止して人に確認するべきです。test前に一時folderの復旧やbrowserのresetなど、失敗時の手順を準備してください。導入基準には成功率だけでなく、影響範囲、検知時間、停止可能性、least-privilege制御も含めます。

拡大前に反復作業を一つ試して判断する

modelが端末に読み込まれるか、backendがvision入力とtool callを処理できるか、runnerの権限が意図どおりに機能するかを個別に確認します。load失敗ではcheckpoint、format、memoryを、画面の読み違いではcapture経路を、tool call失敗ではharness互換性を調べます。

人による確認と修正も含め、5回の反復で作業時間全体が短縮したかを判断します。作業の大半が要約やcode質問なら、一般的なlanguage modelのほうが簡単かもしれません。Holo4を選ぶ根拠は、定めた境界内で画面・tool作業を実際に安全に減らせたという記録です。

公式model cardとrunner資料

architecture、license、対応formatは各checkpointの最新公式cardに基づきます。このガイドは端末性能の測定値を示しません。選択したrunnerとtaskで速度と成功率を直接確認してください。

用語の注釈

  1. チェックポイント — 学習済みモデルの重みなどを保存したファイルです。同じモデル系列でも、版や用途によって異なるチェックポイントを使うことがあります。

    本文に戻る
  2. トークン — モデルが入力や出力を分けて処理する単位です。1トークンが1文字や一定の時間に相当するわけではありません。

    本文に戻る
  3. KVキャッシュ — 過去トークンのAttention用キー・バリューを保存し、後続トークン生成で再利用するメモリです。容量はコンテキスト長やバッチサイズで変わります。

    本文に戻る
  4. MoE — 複数の専門家サブネットワークから入力に応じて一部を選ぶモデル構造です。総パラメータ数と1トークン処理時に有効な数は異なることがあります。

    本文に戻る
  5. ツール呼び出し — ファイル読み取り、検索、コマンド実行などの外部機能を、名前と引数でモデルが要求する形式です。実行の有無はエージェントランタイムと権限設定が決めます。

    本文に戻る
  6. GGUF — モデル情報を格納するファイル形式で、llama.cpp系のツールで広く使われます。形式だけで特定ハードウェアへの対応や速度が保証されるわけではありません。

    本文に戻る
  7. FP8 — 8ビット浮動小数点形式の総称です。具体的な形式や対応範囲はハードウェアとソフトウェアによって異なります。

    本文に戻る
  8. NVFP4 — NVIDIAが定義した4ビット浮動小数点データ形式です。対応状況はGPU世代、モデル、ソフトウェア実装によって異なります。

    本文に戻る
  9. GPU — 多くの計算を並列に処理するプロセッサーです。AIモデルの実行ではモデル計算を担います。

    本文に戻る