ChatGPTのような生成AIを、クラウドではなく自分のPCだけで動かしたい。そんなニーズに応える方法の一つが、LM StudioでローカルLLMを実行する方法です。
今回は、Core i7-7700HQ・RAM 8GB・GeForce GTX 1050 4GBという2017年世代のノートPCで、Qwen3.5 4Bを実際に動かしました。最初にBionicを入れ、その後LM Studio本体でも同じモデルを試しています。
結論からいうと、8GBのPCでもローカルLLMは動き、Windowsを機内モードにしても回答できました。 ただし、ThinkをONにしたままでは17分50秒考え続け、OFFにすると約21.5秒相当で回答するなど、設定によって体感が大きく変わりました。
この記事では、インストールの流れだけでなく、メモリ使用率、生成速度、回答の誤り、オフライン動作まで、実機スクリーンショットを使って紹介します。
初めて使う方は、まず「LM Studio本体を入れる → Discoverでモデルを取得する → Chatで読み込んで日本語で質問する」の流れを押さえてください。Bionicを先に入れる必要はありません。この記事の前半では8GB PCの実測結果を、後半の「LM Studioの使い方」では公式手順に沿った8ステップを紹介します。
検証日:2026年9月29日

結論:8GBでもローカルLLMは動いた。ただし「動く」と「快適」は別
今回の実測結果を先にまとめます。
| 確認項目 | 実測・結果 |
|---|---|
| ローカルLLMの起動 | 成功 |
| 使用モデル | Qwen3.5 4B GGUF(Q4_K_M、約3.38GB) |
| Bionic・思考「中」 | 表示上の作業時間3分3秒。モデル読み込み時間を含む |
| LM Studio・Think ON | 17分50秒推論。確認できる範囲では最終回答本文なし |
| LM Studio・Think OFF | 約21.5秒相当(9.72 tok/s、203 tokens、初回応答0.61秒) |
| メモリ | Bionic読み込み中にシステム全体98%、LM Studio回答後91% |
| オフライン | 機内モードでも計算・文章生成に回答 |
| 回答品質 | 日本語で回答できたが、誤読や不自然な断定も確認 |
LM Studio公式のWindows x64要件は、AVX2対応CPUが必須、RAM 16GB以上と専用VRAM 4GB以上が推奨です。今回のPCはCPU要件とVRAM推奨値を満たしますが、RAMは推奨値の半分です。実際に動いた一方、メモリ使用率はかなり高くなりました。
ローカルLLMとは?ChatGPTとの違い
ChatGPTなどのクラウドAIは、入力内容をインターネット経由でサービス側へ送り、クラウド上のモデルが処理します。一方のローカルLLMは、モデルファイルをPCへ保存し、自分のCPU・GPU・RAMを使って推論します。
LM Studio公式によると、モデルを事前にダウンロードしておけば、ローカルモデルとのチャット、文書との対話、ローカルサーバーなどはインターネット接続なしで利用できます。ローカルモデルとのチャット入力はデバイス外へ送信されない、とも案内されています。モデル検索やダウンロード、アプリ更新にはネット接続が必要です。
今回の検証PC
| 項目 | 仕様 |
|---|---|
| CPU | Intel Core i7-7700HQ 2.80GHz(4コア8スレッド、AVX2対応) |
| RAM | 8.00GB(7.86GB使用可能) |
| ストレージ | 477GB M.2 PCIe SSD |
| 専用GPU | NVIDIA GeForce GTX 1050 4GB |
| 内蔵GPU | Intel HD Graphics 630 |
| OS | 64ビット Windows、x64ベース |
| モデル | Qwen3.5 4B GGUF |
| 量子化 | Q4_K_M |
| モデルファイル | 約3.38GB |
Core i7-7700HQはIntel公式ではQ1 2017登場の第7世代Core i7で、4コア8スレッド、AVX2対応です。新しいPCではありませんが、LM Studioのx64必須条件は満たします。
なぜQwen3.5 4Bを選んだのか
今回は8GB RAMでも試せそうな小型モデルを優先しました。Qwen3.5 4Bは4B(約40億)パラメータのモデルで、Qwen公式モデルカードでは201の言語・方言をサポートするとされています。今回選んだQ4_K_M版は約3.38GBで、実際に日本語で入出力できました。
Q4_K_Mのような表記は量子化の種類です。LM Studio公式も、量子化はモデルを小さくする代わりに一定の品質低下を伴う圧縮手法と説明しており、対応できるPCでは4bit以上を一つの目安にしています。
Bionicで先にローカルLLMを試した
BionicはLM Studioとは別アプリ
私は最初、LM Studio公式サイトからBionicをインストールしました。


LM Studio公式は、BionicをLM Studioとは別のアプリと説明しています。Bionicは、ローカル・クラウド・別デバイス上のモデルを選びながら、コーディングや文書処理などのエージェント作業を進める用途を重視したアプリです。
Qwen3.5 4Bをダウンロード
Bionicの「ローカルモデル」→「探索」からQwen3.5 4Bを検索しました。


検索結果には派生モデルも多く出ます。今回は lmstudio-community/Qwen3.5-4B-GGUF のQ4_K_M、3.38GBを選びました。

Bionicは3分3秒。8GB RAMはかなり厳しかった
日本の都道府県を北から10個挙げてください。
Bionicでは思考レベルを「中」にして実行しました。最終画面には「3m3s 作業しました」と表示されました。ただし、実行途中には「モデルを読み込み中:73%」と表示されていたため、この3分3秒は純粋な生成時間ではなく、初回のモデル読み込みも含む作業時間として扱っています。

この時点で、システム全体のメモリ使用率は98%、ディスク使用率は92%でした。他のアプリも動いていたためBionic単体の使用量ではありませんが、8GB環境にほとんど余裕がないことは分かります。

回答は文章として成立していましたが、山形県・福島県を飛ばしたうえ、栃木県を「はたけむりけん」、千葉県を「しべんけん」と読むなど、明らかな誤りもありました。小型モデルは、もっともらしい形で間違えることがあります。
なお、「北から」という質問は、県域の最北端、県庁所在地の緯度、地方区分順など解釈に幅があります。そのため、この1問だけで地理能力を厳密評価するのではなく、今回は待ち時間と挙動を見るためのテストとして使っています。
LM Studio本体で同じモデルを実機検証
Bionicで取得したQwen3.5 4Bをそのまま認識
その後、LM Studio本体もインストールしました。Bionicでダウンロード済みだったQwen3.5 4Bは、LM Studio側でもモデル一覧に表示されました。


モデル読み込み画面では、Context Length 8192、GPU Offload 26、推定GPUメモリ3.15GB、推定総メモリ3.73GBと表示されました。

LM Studio公式では、GPU Offloadはモデル層の一部をGPU側へ回すための設定として案内されています。今回の画面には「26」と表示されましたが、このUI上の数値の単位までは公式資料で確認できなかったため、記事では「26レイヤー」とは断定しません。
最初は細かな設定を変えず、画面に表示された値のままLoad Modelを押しました。
LM Studioの回答が終わらない?Think ONで17分50秒、OFFで約21.5秒
同じ質問をLM Studioで実行すると、最初は画面下のThinkがONになっていました。

保存した推論ログでは、新潟県を入れるか、関東各県をどう扱うかを何度も比較し続け、画面には「Thought for 17 minutes 50 seconds」と表示されました。確認できる範囲では、その後の最終回答本文は確認できませんでした。

そこで新しいチャットを作り、ThinkをOFFにして同じ質問を実行しました。今度は長い推論ループに入らず、回答が出ました。


画面の生成統計は9.72 tok/s、203 tokens、初回トークンまで0.61秒でした。203 ÷ 9.72 ≒ 20.9秒なので、初回応答0.61秒を加えると概算約21.5秒です。Think ONの17分50秒と比べると、今回の経過時間には約50倍の差が出ました。
ただし、Think ON側は最終回答まで到達しておらず、処理内容も同一ではありません。したがって「Think OFFなら常に50倍速い」という意味ではなく、今回のPC・モデルではThink設定が待ち時間に大きく影響したという実測結果です。
Think OFFの回答はBionic時より整っていましたが、「厳密には北から10番目は群馬県」と断定しながら「地理的な連続性を考慮」と補足しており、曖昧な条件を確認せず断定する点は残りました。
機内モードでも回答できた
次にWindowsを機内モードへ切り替えました。

この画面に残っている都道府県の回答は機内モードへ切り替える前のものです。そこで、オフラインになった後に別の質問を実行しました。
15 × 17を計算してください。計算結果だけ答えてください。
回答は255。機内モードのまま返ってきました。

さらに「パソコンのメモリとは何か」を初心者向けに100文字程度で説明するよう依頼すると、こちらもオフラインのまま文章を生成できました。これは、ダウンロード済みモデルならオフラインでチャットでき、ローカルチャットの入力はデバイス外へ出ないというLM Studio公式の説明とも一致します。

このときは10.92 tok/s、36 tokens、初回トークンまで0.96秒でした。オンライン時とは質問が違うため速度比較はできません。また、回答は句読点を含めて約68文字で、「100文字程度」という指定より短めでした。オフラインで生成できることと、指示どおりの品質になることは別です。
BionicとLM Studioは何が違う?
| Bionic | LM Studio |
|---|---|
| エージェントとして作業を任せる用途を重視 | ローカルモデルの実行・検証をしやすい |
| ローカル・クラウド・別デバイス上のモデルを選べる | モデルの読み込み設定や生成統計を確認しやすい |
| プロジェクト、文書、コーディングなどの作業向け | チャット、ローカルAPI、モデル検証向け |
| 今回の3分3秒にはモデル読み込み時間が混在 | tok/sや初回応答時間を画面で確認できた |
Bionicが劣っているわけではなく、目的が違います。自分のPCでローカルLLMがどの程度動くかをまず確かめたい人には、LM Studio本体の方が挙動を確認しやすいと感じました。
LM Studioの使い方:初めてならこの8ステップ
今回私はBionicで先にモデルをダウンロードしたため、LM Studio本体のDiscover画面からモデルを取得する操作は実機では行っていません。 以下のダウンロード部分はLM Studio公式手順をもとに整理しています。モデル読み込み、Thinkの切り替え、オフライン確認は今回実際に試した流れです。
- LM Studio公式サイトからWindows版をインストールする
- PCがAVX2対応か確認し、RAM・VRAMに余裕があるかを見る
- LM Studio公式手順どおり、Discoverから小型モデルを検索する
- 最初は4B前後、4bit級(Q4など)のモデルから試す
- Chatでモデルを選び、表示された読み込み設定を確認してロードする
- まずThinkをOFFにして短い日本語質問を試す
- タスクマネージャーでRAM・GPU使用量を確認する
- 必要なら機内モードにして、本当にオフラインで動くか確認する
LM Studio公式は、初めてローカルモデルを動かす場合の入口としてデスクトップアプリを案内し、DiscoverタブからHugging Face上のモデルを検索・ダウンロードできるとしています。
情シス目線:ローカルなら「何でも安全」ではない
ローカルLLMの大きな利点は、入力した文書やプロンプトをクラウドAIへ送らず、端末内で処理できる構成を選べることです。個人情報や内部資料を扱う組織では、検討価値があります。
一方で、ローカルだから自動的に安全になるわけではありません。端末の紛失・マルウェア対策、アクセス権、ディスク暗号化、モデルの配布元とライセンス、改変版かどうか、そして回答精度の確認は別に必要です。Bionicでクラウドモデルを選んだ場合も、今回の完全ローカル実行とはデータの流れが変わります。
今回の誤読や断定からも分かるとおり、ハルシネーションはローカルLLMでも残ります。 「外部送信を減らせること」と「正しい回答が得られること」は分けて考える必要があります。
よくある質問
LM Studioは無料で使える?
LM Studioは公式に、デスクトップアプリを自宅だけでなく仕事でも無料で利用できると案内しています。現在の利用規約でも、個人利用または社内業務での利用が認められています。Bionicにも無料プランがあり、ローカルLLMはクラウド推論クレジットを使わず実行できます。なお、クラウド推論や一部のチーム・企業向け機能は別料金です。また、ダウンロードするAIモデル自体のライセンスはモデルごとに確認してください。
RAM 8GBでもLM Studioは動く?
今回のPCではQwen3.5 4BのQ4_K_M版を動かせました。ただし、Bionicのモデル読み込み中にシステム全体のメモリ使用率が98%まで上がりました。LM Studio公式はWindowsで16GB以上のRAMを推奨しているため、8GBでの動作は「可能な場合がある」が、余裕は小さいと考えた方がよいです。
日本語でも使える?
今回のQwen3.5 4Bは日本語で質問・回答できました。Qwen公式モデルカードでは201の言語・方言への対応を掲げています。ただし、Bionicではふりがなの誤りも出たため、日本語が使えることと、内容が正確であることは別です。
インターネットを切っても使える?
モデルと必要なランタイムを事前に取得しておけば、LM Studio公式はローカルチャットをオフラインで利用できると案内しています。今回もWindowsを機内モードにして、計算と文章生成の両方を確認できました。モデル検索・新規ダウンロード・アプリ更新などにはネット接続が必要です。
まとめ:ローカルLLMは簡単に試せるが、PC性能と設定の影響は大きい
今回、8GB RAMの2017年世代ノートPCでも、LM StudioとQwen3.5 4Bを使ってローカルLLMを実際に動かし、オフライン回答まで確認できました。導入自体は想像していたより難しくありません。
一方で、Think ONでは17分50秒の推論ループに入り、Think OFFでは約21.5秒相当で回答するなど、設定による差は非常に大きくなりました。Bionicではメモリ使用率が98%まで上がり、小型モデルでも回答に誤りが混ざりました。
LM Studioを初めて試すなら、小型モデル+Think OFFから始め、タスクマネージャーでメモリ使用量を確認するのが現実的です。今回の検証ではRAM 16GBへの増設比較は行っていないため、その効果についてはこの記事では断定しません。 音声を文字にするローカルAIを探している方は、Whisper Desktopの導入方法と実際の文字起こし結果をご覧ください。この記事で試したQwen3.5 4Bの文章生成とは用途が異なります。
参考情報
- LM Studio公式:System Requirements
- LM Studio公式:Get started with LM Studio
- LM Studio公式:Download an LLM
- LM Studio公式:Offline Operation
- LM Studio公式:Bionic
- LM Studio公式:Bionicのモデル選択
- LM Studio公式:Bionic Pricing
- LM Studio公式:LM Studio is free for use at work
- LM Studio公式:App Terms of Service
- LM Studio公式:lms load / GPU Offload
- LM Studio公式:reasoning設定
- Intel公式:Core i7-7700HQ仕様
- Qwen公式モデル:Qwen3.5-4B

