実行プログラムと拡張機能
QwenでJev型のローカル判断:SemIf・Simple Jev・openjev-sglang
Jevを検索すると、小さなQwenの実験からB200サーバーまで並びます。中身は同じではありません。既存モデルの次トークンロジットを読むもの、判断ヘッドを学習するもの、API互換を重視するものがあります。ノートPCで試す実装と大量処理用サーバーを同じ基準で比べないよう、動かし方から分けます。
最も単純な出発点は次トークンのスコアです
選択肢をA、B、Cのような短いトークンに対応させ、次の位置でモデルが付けたロジットを読みます。softmaxで候補内の相対確率が得られます。文章を生成せず、JSONはサーバー側が組み立てます。ただし選択肢を正しく理解するか、ラベルが想定どおり一トークンになるか、確率が実際の正答率と合うかは別問題です。Jevと同じモデルではなく、比較の基準線です。

SemIfは検証可能な4B基準線を作ります
SemIfは旧OpenJevが改名したプロジェクトで、Qwen3.5-4Bの候補ロジットを直接読みます。同じ状態を複数の質問で使う場合、共通プリフィルを再利用し、枝を並列評価できます。RTX 3090の実験と生データを公開し、Apple Silicon向けMLXもあります。高速な再利用経路ではfresh評価と一部の判断が変わった例もあるため、速度と一致率を一緒に確認してください。購入前に自分の質問十件でfreshとsharedを比べます。
Simple Jevは小型モデルでAPIを確かめます
Simple Jevは専用の分類ヘッドを学習せず、TransformersとPyTorchで公開モデルのロジットを読みます。Qwen3.5-0.8BをCPUで始められるため、大きなGPUがなくてもリクエストと応答の形を確認できます。動いたことは業務判断の精度を意味しません。まず二、三択の短い分類で誤りを集め、必要なら4B以上へ進みます。互換性が必要なら`/v1/classifier`と`/v1/systemone`が同じ実装を呼ぶことも確認できます。

openjev-sglangはサーバー処理量を狙います
openjev-sglangはQwen3.6-35B-A3BのNVFP4をSGLangで配信し、radix cacheと並列要求を使います。公開された標準環境はB200一枚で、一般向けGPUの手順ではありません。注目すべきは、共通接頭辞を保持して多くの質問でプリフィルを再利用する設計です。64問を高速処理したという値も、その加速器、入力長、同時性の条件に依存します。家庭で一件を速く処理するなら4Bの直接スコアから始める方が容易です。
学習型は確率の意味まで変えます
kevはQwen2.5-0.5BにLoRAと小さな判定ヘッドを加え、一つの系列で文書と複数の質問を処理します。qwen-rlcdはQwen3.5-0.8BをChoice、Score、Noulの判断向けに学習します。未変更モデルのロジットを読む方法よりJev型に近づきますが、学習データと評価範囲で得意分野が狭い場合があります。容量や一度の遅延だけでなく、候補数と表現変更に対する安定性を確認してください。まだ標準的なローカルJevが一つに定まった段階ではありません。
