応答速度と加速

Lightning MTPとは:oMLXの高速化を理解する

マックでLightning MTPを有効にすると速くなる、と聞きますが、自分のアプリにはそのメニューが存在しない可能性があります。マックのチップに隠された機能を落としにしているのでしょうか?この名前はハードウェアスペックではなく、oMLXの実行パスを指します。機器・アプリ・モデルファイルのどれを正しく設定すべきか、順を追って確認します。

Macを買うだけで、Lightning MTPが使えるわけではない

MTPは将来の複数トークンを予測する構造を指し、Lightning MTPはそのApple Siliconでの利用を実装したoMLXの名称です。すべてのマック用AIアプリに同じ機能が存在するわけではありません。同じモデルでも、異なるアプリでは異なるアクセラレーションパスを使用したり、一般生成のみを行う場合があります。

したがって、機能を求めるために機器を変更する必要はありません。現在のアプリおよびバージョン、ダウンロードされたモデルファイルがサポートされているかをまず確認してください。モデル製品名が同じであっても、詳細な構成や変換方法が異なる場合、互換性が異なる可能性があります。

ユニファイドメモリチップ内ではMTP候補の生成と検証が短い経路で接続されている図
Lightning MTPはApple SiliconおよびoMLX向けの実行経路であり、マック本体にMTP機能を新たに追加するものではありません。

ダウンロードされたファイルが同じように見えるとき

重みだけを含む変換バージョンと、MTP部分を保持した変換バージョンでは、一般的な回答に必要な内容が異なる可能性があります。ファイル名にMTPが表示されているかどうかはヒントに過ぎず、それだけでは実行を保証しません。変換の説明と現在のoMLXがサポートしている範囲を併せて確認する必要があります。

正常に実行されているファイルは削除せず、基準として残してください。新しいファイルや機能を同時に変更した後に問題が生じた場合、原因を特定するのが難しくなります。同じ質問に対しては、まず一般生成を確認したのち、MTPをオンにする順に進めることが復元を容易にします。

MTP追加重みが含まれるモデルファイルと欠損したモデルファイルの構造の違いを示す図
同じモデル名であっても、変換プロセスにおいてMTPテンソルが欠落すると、通常の生成のみが可能となり、加速パスは使用できません。

より深い予測をすればより速くなるでしょうか?

候補を長くすると、一度に複数トークンを受け取る機会が増えるものの、誤った候補を作成して検証するコストも増大します。本モデルが実際に受け取った長さが短い場合、高い設定値は逆に損失になる可能性があります。

短い回答だけでは設定を決まらないでください。通常使うコードや長い文脈を使用し、準備実行後に3回の中央値を比較してください。設定が改善された場合は、その時のモデルファイルとアプリバージョンも一緒に記録しておいてください。

MTP検証パスが対応するKVキャッシュに接続され、対応しないキャッシュでは基本パスにリダイレクトされる図
モデルに対応しているだけでは十分ではありません。KVキャッシュの量子化やバッチ処理との組み合わせも、実際に使うランタイムで確認する必要があります。

他のアクセラレーションを同時にオンにしたい場合

KVキャッシュの圧縮、長いコンテキストと同時リクエストの設定は、MTPのメモリおよび検証パスに影響を与える可能性があります。それぞれが単独で良好に動作していた2つのオプションを同時に有効にした場合でも、同じ効果をもたらすとは保証できません。一度ずつ変更していくのは遅いように見えますが、原因を特定する時間を節約できます。

結果が良ければともかく、複数のリクエストを同時に受けるサーバーについては、別に確認します。オンスイッチの表示だけを見てはいけず、実際のログのパスとリクエストごとの生成速度を確認してください。総処理量が増加し、1人のユーザーの待ち時間も増加する状況を区別して対応します。

必要かどうか確認します

良い設定とは、最も複雑な設定ではなく、繰り返し使用する際にメリットが残る設定です。応答速度が十分に向上した場合、MTPを有効にすることで、機器のアップグレードを検討できます。メリットがないからといって機器が間違っているとは限りません。モデルとタスクがこのパスに適していない可能性もあります。

購入前に互換組み合わせの結果を参考にしながら、別のモデルを使用する際の基本速度も確認してください。1つの機能の最大倍率よりも、実際に継続して使用するモデルの待ち時間の把握が、長期間使用する機器を選びやすくします。