このデバイスで小さなLLMを試してみる
小規模の韓国語言語モデルをWebGPUを使ってブラウザ内で直接ダウンロードし、自由に質問して最初のトークン生成時間とトークン生成速度を確認します。
私のコンピュータは、上位何パーセントですか?
ローカルAI生成の速度を直接測定します。GPUの名前および論理プロセッサ数はブラウザが公開する範囲で表示されます。チップセットの詳細を確認すると、グラフィックドライバーの追加情報を取得できます。確認できないCPUおよびRAMは直接入力可能です。直接入力したスペックはデバイス内部にのみ保存され、ランキングに反映されません。
標準測定では、準備実行後に同じ質問で最初のトークンを除く128トークンのデコードを3回測定し、中央値を記録します。個人の最高記録と結果を共有できます。
初期には、体験用仮想比較グループの上位%を表示します。実際のコンピュータの分布を測定または推定した値ではありません。同意された同等条件の記録が30件以上ある場合に、参加者の順位に変更し、仮想比較グループと実際の参加データを混同しません。全体コンピュータの総合性能や大きなモデルの速度順位ではありません。
何を確認できますか?
単に事前に定義された文だけを再生成するシミュレーションではありません。質問を直接入力すると、モデルファイルおよび演算はユーザーのブラウザ内で実行され、回答はトークンごとに表示されます。完了後には、最初のトークンが出力されるまでの時間と実際のトークン生成速度を併せて表示します。
注意事項(実行前)
最初の実行時にはQwen2.5 0.5Bモデルファイルをダウンロードし、次の実行以降はブラウザキャッシュを使用します。実行には約945MBのGPUメモリが必要で、WebGPUをサポートする最新のChrome、EdgeまたはSafariが必要です。小さなモデルであるため、最新の事実の確認よりもローカル実行のプロセスやデバイスごとの体感速度を確認するのに適しています。
どこで処理されますか?
入力された質問および生成された回答は、この体験機能の分析データとして送信されません。モデルはボタンを押した後にのみダウンロードされ、現在のタブを閉じると実行中の作業も終了します。