ローカルAIの動作確認
LM StudioでGPUが使われない?CPU実行になっているか確認する方法
公開日:2026-09-08 著者:組立テルノ
結論:GPU使用率の「0%」だけで、CPU実行と決めない

選部マヨ子

組立テルノ

選部マヨ子

組立テルノ
「応答が遅い」と「GPUを使っていない」は別の問題です。設定を一度に変える前に、今どこで処理しているのかを確かめましょう。
この記事はWindowsのLM Studio内チャットが対象です。実画面は2026年9月8日に確認した0.4.23(Build 1)の英語UI。バージョンや実行環境によって、項目の位置・名称は変わります。
1. ダウンロード済みと、ロード済みは違う
モデルのファイルがPCにあるだけでは、まだ推論の準備はできていません。チャット下部のモデル選択欄から、使うモデルを読み込みます。これが「ロード」です。
今回も、起動直後はモデルが未ロードでした。読み込み完了後は、Developer画面のLoaded Modelsにモデル名とREADYが表示されました。


選部マヨ子

組立テルノ
この画面のままでも、アプリ内の日本語チャットは動きました。「サーバー停止」を「モデルが使えない」「GPUが無効」と読み替えないでください。
2. GPU Offloadで、GPUに任せる量を見る
GPU Offloadは、モデルの処理をGPUへ移す設定です。画面のスライダーは、モデルの層をどれだけGPU側に置くかを示しています。GPU使用率のパーセントではありません。
- 使いたいモデルを選ぶメニューを開きます。簡易メニューなら「Open model loader」へ進みます。
- 「Manually choose model load parameters」をオンにし、モデルを選びます。
- 「GPU Offload」と、上部のメモリ使用量の見積もりを確認します。
- 変更する前の値を控え、メモリに余裕のある条件で「Load Model」を押します。

0ならGPUへのモデル層の割り当てを無効にする設定です。途中の値なら一部、最大なら全層をGPUへ載せる設定になります。ただし、設定値だけで実際の動作まで断定せず、ロードの成否と生成中の負荷も見ます。
設定の意味:LM Studio公式:GPU Offloadとモデルロード

組立テルノ
Context Lengthは、会話や入力をどこまで扱うかに関わる長さです。長くするとメモリの負担も増えるため、今回は短い動作確認用に2,048へ下げました。普段の長文処理にも2,048が最適、という意味ではありません。
設定を変えたら、モデルをその条件で読み直します。ロード済みのモデルが、入力欄を変えただけで切り替わったと思い込まないようにしてください。
3. 応答が終わる前に、GPU負荷を確認する
先に監視画面を開き、それからLM Studioへ質問を送ります。短すぎる返事では見逃すので、数百文字程度の説明を頼むと確認しやすくなります。
まずはタスクマネージャー
- Ctrl + Shift + Escで開き、「パフォーマンス」から使うGPUを選びます。
- GPU 0・GPU 1という番号だけでなく、表示された製品名を確かめます。
- 「3D」のグラフだけで判断せず、グラフ名から切り替えられるCompute・CUDAなどの計算用エンジンも確認します。名称はドライバーによって異なります。
- 生成中のグラフの変化と、専用GPUメモリの使用量を合わせて見ます。
グラフとGPUエンジンの意味:Microsoft公式:タスクマネージャーのGPU表示。この手順の画面写真は今回撮影していません。
NVIDIAなら、nvidia-smiでも確認できる
コマンドを使える場合は、PowerShellで次を実行すると1秒ごとに状態を表示できます。読み取り専用の確認で、電力制限などの設定は変えません。
nvidia-smi --query-gpu=index,name,memory.used,utilization.gpu --format=csv -l 1nameはGPU名、memory.usedはGPUメモリ使用量、utilization.gpuはGPU使用率です。確認が済んだらCtrl + Cで監視を止めます。AMDやIntelのGPUには使えません。
コマンドの公式資料:NVIDIA System Management Interface

選部マヨ子
メモリの確保と、計算中の負荷は別です。ほかのアプリの使用分も含むので、ロード前後の変化と、生成開始・終了に合わせた変化をセットで見てください。
画像生成やゲームを同時に動かしていると見分けにくくなります。作業を保存してから一時停止し、VRAMを使うモデルも必要に応じて解放すると切り分けやすくなります。
4. 実機では、生成後すぐ0%へ戻っていた
今回は画像生成を止め、手元に保存してあったQwenモデルで日本語の応答を2回生成しました。新しいモデルのダウンロードや、CPU専用実行との速度比較はしていません。
- 確認日・アプリ
- 2026年9月8日 / LM Studio 0.4.23(Build 1)
- モデル
- Qwen3.6 35B A3B / Q4_K_M / 約22.07GB(20.55GiB)
- GPU
- RTX 5080 16GB + RTX 4080 SUPER 16GB
- 電力上限
- RTX 5080:250W / RTX 4080 SUPER:160W
- ロード設定
- GPU Offload 40 / Context Length 2048 / Parallel 4 / KV CacheのGPU配置オン
- 生成条件
- Thinkオフ / Speculative Decodingオフ / NVIDIAドライバー596.36

2回目の生成に合わせて、約0.85秒間隔でGPUを監視しました。以下はその抜粋です。
| 時刻(JST) | 状態 | RTX 5080 | RTX 4080 SUPER |
|---|---|---|---|
| 21:21:33 | 生成前 | 13% | 0% |
| 21:21:34 | 生成中 | 55% | 81% |
| 21:21:35 | 生成中 | 56% | 37% |
| 21:21:36 | 生成後 | 12% | 0% |
値は採取時点のGPU全体の使用率です。真の瞬間最大値ではなく、画面表示などの処理も含みます。

組立テルノ
生成中のGPUメモリは、RTX 5080が約13,200MiB、RTX 4080 SUPERが11,883MiBでした。前者にはデスクトップの使用分も含まれます。両GPUの負荷変化と合わせ、CPUだけではない実行を確認できました。
実行ログの生成速度は初回141.64、2回目131.14 tokens/s。ただし、短い応答で、2回目には入力のキャッシュもあります。この数字をGPU同士の性能比較や、誰でも出る速度の目安には使いません。
5. まだ動かない・遅いときは、症状ごとに分ける
ロードに失敗するなら、まずメモリの条件
今回の約22GBのモデルは、16GBのGPU 1枚には丸ごと収まりません。モデル本体だけでなく、会話を保持する領域などにもメモリが必要です。
まずは小さなモデルと短いContext Lengthで試します。それで動くなら、元のモデルの容量・割り当てを見直す手がかりになります。部分的なGPU割り当ては、全部載らないモデルを使う選択肢です。
LM Studioには複数GPUの制御や、専用GPUメモリに合わせた割り当ての機能があります。ただ、16GBを2枚挿せば、常に1枚の32GB GPUと同じになるわけではありません。使う実行環境の対応と実際の割り当てを確認してください。
機能の公式説明:LM Studio:複数GPUの制御(0.3.14での導入時の資料。現在の画面位置を示すものではありません)
GPU自体が認識されないなら、対応環境を確認
WindowsでGPUが認識されているか、LM Studioの対応条件を満たすか、GPUに対応した実行エンジンが利用できるかを確認します。CPU専用の実行環境なら、GPU Offloadの指定だけでは解決しません。
アプリやドライバーを見直す際は現在のバージョンとエラーを控え、一度に全部変えないでください。いきなりGPUの買い替えや、手当たり次第のツール追加へ進む必要はありません。
対応条件:LM Studio公式:System Requirements
GPUは動くのに遅いなら、別の切り分けへ
GPUの負荷が確認できたら、「GPUが無効」という話から離れます。モデルサイズ、入力の長さ、Thinkの有無、CPUとの分担、ほかのアプリによるメモリ使用を順に見ます。

選部マヨ子

組立テルノ
電力制限は動作クロックや性能に影響しますが、GPU Offloadとは別の設定です。詳しくは電力制限と低電圧化の実測記事へ。今回、制限なしとの速度差は測っていません。
電力上限の説明:NVIDIA公式 nvidia-smiドキュメント
まとめ:設定と実動作を、同じタイミングで見る
- 使うモデルがロード済みかを確認する。
- GPU Offloadとメモリの余裕を確認し、変更後は読み直す。
- 生成している最中のGPU負荷とメモリ使用量を見る。
- GPUが動いているなら、「遅い理由」は別に切り分ける。

組立テルノ
モデルを大きくしたいなら、速度だけでなくVRAMとメインメモリの配分も重要です。必要容量の考え方はローカルLLMのメモリ解説にまとめています。
ジサラボではGPUのVRAM容量や価格を比較できます。ただし、シミュレーターの互換性判定は、特定のAIモデルが収まることやLM Studioでの動作を保証するものではありません。
FAQ
よくある質問
GPU使用率が100%にならないと、GPUで動いていないの?

選部マヨ子
Q1

組立テルノ
GPUを使っているのにCPU使用率も上がるのはおかしい?

選部マヨ子
Q2

組立テルノ
GPUが1枚しかないけど、この記事の確認はできる?

選部マヨ子
Q3

組立テルノ
nvidia-smiが見つからないと表示されたら?

選部マヨ子
Q4

組立テルノ
参考にした公式情報と検証範囲
確認日:2026年9月8日。実画面はJisaLabのWindows実機で撮影。GPUによる日本語応答生成を確認した記事であり、CPU専用実行との比較・全GPUや全モデルの動作検証ではありません。
