実行プログラムと拡張機能

Huskyとは?MacでWoofを高速化する仕組みと730 tok/sの条件

ローカルAIの返事を待つと、新しいMacが欲しくなることがあります。Huskyは別の道を選び、Woofという一つのモデルに実行エンジンを合わせました。730 tok/sという数字より先に、その数字が出た作業を見ておきましょう。

要点

01
HuskyはApple Silicon上のWoof向けです。すべてのLLMに効く共通設定ではありません。
02
730 tok/sは開発元がM5 Maxで関数を修正した際の測定値です。
03
Mac版Underdogで利用します。韓国語の品質や自分の作業速度は別途確認が必要です。

Husky・Woof・Underdogはそれぞれ何か

Underdogがアプリ、Woofが回答を作るモデル、Huskyが実行エンジンです。9月20日の発表では、同じ4ビットWoof 4BをM5 Maxの40コアGPU・128GBメモリで比較しています。

本を読む場面で考えると、内容がモデル、探して開いてページをめくる方法がエンジンです。速くめくっても内容が正しくなるわけではありません。実行速度と回答能力は分けて判断します。

汎用治具と一つの形専用の治具を比べる概念図
一つのモデル専用のエンジンは、汎用エンジンとは選択が異なります。

730 tok/sが出る作業とは

発表表の関数修正はMLXが163、Huskyが614、Flash有効時が730 tok/sです。短いメール作成では151、164、260でした。どちらも高速化していますが倍率は違います。同じ重みとgreedy decodingで、各3回の中央値を比較しています。

修正対象のコードが入力にあれば、回答の多くはその再掲になります。白紙から書く文章には再利用できる部分が少なくなります。自分の回答が入力をどれほど繰り返すかが判断の手掛かりです。最大値を長い韓国語の説明文や別モデルに当てはめると、この違いが失われます。

Flashが回答を代わりに書くのか

Huskyは入力から次の候補を探すか、Woof向けの小さなdraftに候補を提案させ、Woofが検証します。入力再利用とdraftを使い分ける方式です。他社の同名Flashモデルとは別物です。

白紙から書く代わりに下書きを直す感覚です。ただし候補が外れ続ければ、確認する負担が残ります。一度に提案する数を増やせば必ず速くなるわけではなく、投機的デコードを理解する際も同じ考え方が役立ちます。

原文と一部だけ修正した文書、束ねたトークンの木片
原文が多く残る修正では、再利用できる候補も多くなります。

最初の返事までの条件もそろえる

会話の続きでは、以前読んだ内容のキャッシュが効きます。長い文書を初めて読む場合と、最後の一文だけ新しく読む場合は別です。最初の返事、生成中の速度、モデルの初回読み込みを分けて見ましょう。

同じ文書で新規会話と追加質問を別々に記録すると、会話継続の速さを評価しつつ、新しいPDFでも同じ待ち時間だと誤解せずに済みます。

読みかけの位置にしおりを挟んだ本とノー��トPC
会話の前半を覚えていることと、新しい文書を読むことは別です。

Macでどう試すか

案内されている利用経路はMac版Underdogです。必要なOSと導入手順を確認し、メールやカレンダーへの権限は必要な範囲に絞りましょう。ローカル推論だからといって、連携サービスの通信までなくなるわけではありません。

最初は個人情報を含まない短文で、誤字修正、文体変更、TODO抽出を別々に試しましょう。意味の欠落や韓国語の敬語も原文と比べて、仕事に使えるか判断します。

Qwen・oMLX利用者は何を変えるべきか

この発表だけで動いているQwenサーバーを置き換える理由はありません。Woof専用最適化をQwenに適用する公開の汎用設定は確認できていません。モデル切替やAPI連携が必要なら、まず現在の経路を維持しましょう。

購入判断への示唆は控えめです。遅いと感じる端末を買い替える前に、モデルと実行方法が作業に合うか見直せます。本サイトの速度体験は別の機器・モデルの比較用であり、Woofの測定再現や一律4.5倍の計算ではありません。