ローカルAIの動作確認

LM StudioでGPUが使われない?CPU実行になっているか確認する方法

公開日:2026-09-08 著者:組立テルノ

結論:GPU使用率の「0%」だけで、CPU実行と決めない

選部マヨ子(初心者)

選部マヨ子

LM Studioで返事は来たんだけど、GPUを見たら0%だった。これ、CPUだけで動いてるの?
組立テルノ(専門家)

組立テルノ

返事が終わってから見たなら、もう処理が終わっているかもしれないね。設定と、文章を生成している最中の動きを見てみよう。
選部マヨ子(初心者)

選部マヨ子

返事が来てから確認するんじゃ遅いんだ。
組立テルノ(専門家)

組立テルノ

短い返事だと数秒で終わるからね。モデルが読み込まれているか、GPUへ処理を任せる設定か、実際に負荷が上がるか。この順番で見ようか。

「応答が遅い」と「GPUを使っていない」は別の問題です。設定を一度に変える前に、今どこで処理しているのかを確かめましょう。

この記事はWindowsのLM Studio内チャットが対象です。実画面は2026年9月8日に確認した0.4.23(Build 1)の英語UI。バージョンや実行環境によって、項目の位置・名称は変わります。

1. ダウンロード済みと、ロード済みは違う

モデルのファイルがPCにあるだけでは、まだ推論の準備はできていません。チャット下部のモデル選択欄から、使うモデルを読み込みます。これが「ロード」です。

今回も、起動直後はモデルが未ロードでした。読み込み完了後は、Developer画面のLoaded Modelsにモデル名とREADYが表示されました。

LM StudioのDeveloper画面。Loaded ModelsにQwenモデルとREADYが表示されている
実際のロード完了画面。右側でモデル名・量子化形式、下部で実行ログを確認できます。 画像を押すと拡大できます。
選部マヨ子(初心者)

選部マヨ子

でも、上の方にServer not runningって出てるよ?
組立テルノ(専門家)

組立テルノ

それは外部のアプリから呼び出すAPIサーバーの状態だよ。LM Studio内でチャットするだけなら、そこを起動しなくても使えるんだ。

この画面のままでも、アプリ内の日本語チャットは動きました。「サーバー停止」を「モデルが使えない」「GPUが無効」と読み替えないでください。

2. GPU Offloadで、GPUに任せる量を見る

GPU Offloadは、モデルの処理をGPUへ移す設定です。画面のスライダーは、モデルの層をどれだけGPU側に置くかを示しています。GPU使用率のパーセントではありません。

  1. 使いたいモデルを選ぶメニューを開きます。簡易メニューなら「Open model loader」へ進みます。
  2. 「Manually choose model load parameters」をオンにし、モデルを選びます。
  3. 「GPU Offload」と、上部のメモリ使用量の見積もりを確認します。
  4. 変更する前の値を控え、メモリに余裕のある条件で「Load Model」を押します。
LM Studioの手動ロード設定。Context Lengthは2048、GPU Offloadは40
今回のモデルでは40が最大でした。モデルによって層数は違うため、別モデルへ「40」をそのまま入力する必要はありません。 画像を押すと拡大できます。

0ならGPUへのモデル層の割り当てを無効にする設定です。途中の値なら一部、最大なら全層をGPUへ載せる設定になります。ただし、設定値だけで実際の動作まで断定せず、ロードの成否と生成中の負荷も見ます。

設定の意味:LM Studio公式:GPU Offloadとモデルロード

組立テルノ(専門家)

組立テルノ

最大にして読み込めないなら、無理に押し通さないでね。まず小さなモデルか、短いContext Lengthで動く条件を探そう。

Context Lengthは、会話や入力をどこまで扱うかに関わる長さです。長くするとメモリの負担も増えるため、今回は短い動作確認用に2,048へ下げました。普段の長文処理にも2,048が最適、という意味ではありません。

設定を変えたら、モデルをその条件で読み直します。ロード済みのモデルが、入力欄を変えただけで切り替わったと思い込まないようにしてください。

3. 応答が終わる前に、GPU負荷を確認する

先に監視画面を開き、それからLM Studioへ質問を送ります。短すぎる返事では見逃すので、数百文字程度の説明を頼むと確認しやすくなります。

まずはタスクマネージャー

  1. Ctrl + Shift + Escで開き、「パフォーマンス」から使うGPUを選びます。
  2. GPU 0・GPU 1という番号だけでなく、表示された製品名を確かめます。
  3. 「3D」のグラフだけで判断せず、グラフ名から切り替えられるCompute・CUDAなどの計算用エンジンも確認します。名称はドライバーによって異なります。
  4. 生成中のグラフの変化と、専用GPUメモリの使用量を合わせて見ます。

グラフとGPUエンジンの意味:Microsoft公式:タスクマネージャーのGPU表示。この手順の画面写真は今回撮影していません。

NVIDIAなら、nvidia-smiでも確認できる

コマンドを使える場合は、PowerShellで次を実行すると1秒ごとに状態を表示できます。読み取り専用の確認で、電力制限などの設定は変えません。

nvidia-smi --query-gpu=index,name,memory.used,utilization.gpu --format=csv -l 1

nameはGPU名、memory.usedはGPUメモリ使用量、utilization.gpuはGPU使用率です。確認が済んだらCtrl + Cで監視を止めます。AMDやIntelのGPUには使えません。

コマンドの公式資料:NVIDIA System Management Interface

選部マヨ子(初心者)

選部マヨ子

メモリが増えていれば、それだけでGPUを使ってるって言っていいの?

メモリの確保と、計算中の負荷は別です。ほかのアプリの使用分も含むので、ロード前後の変化と、生成開始・終了に合わせた変化をセットで見てください。

画像生成やゲームを同時に動かしていると見分けにくくなります。作業を保存してから一時停止し、VRAMを使うモデルも必要に応じて解放すると切り分けやすくなります。

4. 実機では、生成後すぐ0%へ戻っていた

今回は画像生成を止め、手元に保存してあったQwenモデルで日本語の応答を2回生成しました。新しいモデルのダウンロードや、CPU専用実行との速度比較はしていません。

確認日・アプリ
2026年9月8日 / LM Studio 0.4.23(Build 1)
モデル
Qwen3.6 35B A3B / Q4_K_M / 約22.07GB(20.55GiB)
GPU
RTX 5080 16GB + RTX 4080 SUPER 16GB
電力上限
RTX 5080:250W / RTX 4080 SUPER:160W
ロード設定
GPU Offload 40 / Context Length 2048 / Parallel 4 / KV CacheのGPU配置オン
生成条件
Thinkオフ / Speculative Decodingオフ / NVIDIAドライバー596.36
LM StudioでCPUとGPUの役割について日本語の応答が生成された画面
生成確認用の質問と応答。回答の内容を、実際にどの機器で処理したかの根拠にはしていません。 画像を押すと拡大できます。

2回目の生成に合わせて、約0.85秒間隔でGPUを監視しました。以下はその抜粋です。

生成前後のGPU使用率の実測抜粋
時刻(JST)状態RTX 5080RTX 4080 SUPER
21:21:33生成前13%0%
21:21:34生成中55%81%
21:21:35生成中56%37%
21:21:36生成後12%0%

値は採取時点のGPU全体の使用率です。真の瞬間最大値ではなく、画面表示などの処理も含みます。

組立テルノ(専門家)

組立テルノ

4080 SUPERは生成中に81%まで上がったのに、終わると0%。返事を読んでから見に行くと、動いていないように見えるね。

生成中のGPUメモリは、RTX 5080が約13,200MiB、RTX 4080 SUPERが11,883MiBでした。前者にはデスクトップの使用分も含まれます。両GPUの負荷変化と合わせ、CPUだけではない実行を確認できました。

実行ログの生成速度は初回141.64、2回目131.14 tokens/s。ただし、短い応答で、2回目には入力のキャッシュもあります。この数字をGPU同士の性能比較や、誰でも出る速度の目安には使いません。

5. まだ動かない・遅いときは、症状ごとに分ける

ロードに失敗するなら、まずメモリの条件

今回の約22GBのモデルは、16GBのGPU 1枚には丸ごと収まりません。モデル本体だけでなく、会話を保持する領域などにもメモリが必要です。

まずは小さなモデルと短いContext Lengthで試します。それで動くなら、元のモデルの容量・割り当てを見直す手がかりになります。部分的なGPU割り当ては、全部載らないモデルを使う選択肢です。

LM Studioには複数GPUの制御や、専用GPUメモリに合わせた割り当ての機能があります。ただ、16GBを2枚挿せば、常に1枚の32GB GPUと同じになるわけではありません。使う実行環境の対応と実際の割り当てを確認してください。

機能の公式説明:LM Studio:複数GPUの制御(0.3.14での導入時の資料。現在の画面位置を示すものではありません)

GPU自体が認識されないなら、対応環境を確認

WindowsでGPUが認識されているか、LM Studioの対応条件を満たすか、GPUに対応した実行エンジンが利用できるかを確認します。CPU専用の実行環境なら、GPU Offloadの指定だけでは解決しません。

アプリやドライバーを見直す際は現在のバージョンとエラーを控え、一度に全部変えないでください。いきなりGPUの買い替えや、手当たり次第のツール追加へ進む必要はありません。

対応条件:LM Studio公式:System Requirements

GPUは動くのに遅いなら、別の切り分けへ

GPUの負荷が確認できたら、「GPUが無効」という話から離れます。モデルサイズ、入力の長さ、Thinkの有無、CPUとの分担、ほかのアプリによるメモリ使用を順に見ます。

選部マヨ子(初心者)

選部マヨ子

電力制限をかけているのも、外さないとダメ?
組立テルノ(専門家)

組立テルノ

GPUが動いているかを見るだけなら、そのままで確認できたよ。今回は250Wと160Wのまま。速度の比較をするなら、その条件も一緒に記録しよう。

電力制限は動作クロックや性能に影響しますが、GPU Offloadとは別の設定です。詳しくは電力制限と低電圧化の実測記事へ。今回、制限なしとの速度差は測っていません。

電力上限の説明:NVIDIA公式 nvidia-smiドキュメント

まとめ:設定と実動作を、同じタイミングで見る

  • 使うモデルがロード済みかを確認する。
  • GPU Offloadとメモリの余裕を確認し、変更後は読み直す。
  • 生成している最中のGPU負荷とメモリ使用量を見る。
  • GPUが動いているなら、「遅い理由」は別に切り分ける。
組立テルノ(専門家)

組立テルノ

確認するときは、モデル名・設定・生成中の数字を残しておこう。0%だった、だけより次に調べる場所がずっと分かりやすくなるよ。

モデルを大きくしたいなら、速度だけでなくVRAMとメインメモリの配分も重要です。必要容量の考え方はローカルLLMのメモリ解説にまとめています。

ジサラボではGPUのVRAM容量や価格を比較できます。ただし、シミュレーターの互換性判定は、特定のAIモデルが収まることやLM Studioでの動作を保証するものではありません。

FAQ

よくある質問

GPU使用率が100%にならないと、GPUで動いていないの?

選部マヨ子(初心者)

選部マヨ子

Q1

GPU使用率が100%にならないと、GPUで動いていないの?
組立テルノ(専門家)

組立テルノ

100%である必要はないよ。短い生成や2枚への分担では、使用率が上がる時間も変わるんだ。生成開始と一緒に負荷が上がるか、ロード後にGPUメモリが増えるかを合わせて確認しよう。

GPUを使っているのにCPU使用率も上がるのはおかしい?

選部マヨ子(初心者)

選部マヨ子

Q2

GPUを使っているのにCPU使用率も上がるのはおかしい?
組立テルノ(専門家)

組立テルノ

それだけなら異常とは言えないよ。GPUへ任せてもCPUの仕事がゼロになるわけではないし、モデルの一部をCPUで処理する構成もあるんだ。CPUの数字だけで判断せず、GPU側も同時に見よう。

GPUが1枚しかないけど、この記事の確認はできる?

選部マヨ子(初心者)

選部マヨ子

Q3

GPUが1枚しかないけど、この記事の確認はできる?
組立テルノ(専門家)

組立テルノ

できるよ。今回のモデルは約22GBなので2枚を使ったけれど、2枚挿しが必須という話じゃないんだ。自分のGPUメモリに収まる小さなモデルから、同じ順番で確認しよう。

nvidia-smiが見つからないと表示されたら?

選部マヨ子(初心者)

選部マヨ子

Q4

nvidia-smiが見つからないと表示されたら?
組立テルノ(専門家)

組立テルノ

NVIDIA用の道具なので、AMDやIntelのGPUでは使わないよ。NVIDIAでも、コマンドの場所やドライバーの状態が原因のことがあるんだ。まずタスクマネージャーとLM Studioの表示を確認して、コマンドが見つからないだけでGPU故障と決めつけないようにしよう。

参考にした公式情報と検証範囲

確認日:2026年9月8日。実画面はJisaLabのWindows実機で撮影。GPUによる日本語応答生成を確認した記事であり、CPU専用実行との比較・全GPUや全モデルの動作検証ではありません。