【無料】自分のPCで生成AIを動かす!メモリ8GBのWindowsでLM Studio実機検証

当ページのリンクには広告が含まれています。
無料で自分のPCに生成AIを導入できるLM Studioを、ノートパソコンで試す男性のイラスト。メモリ8GBで実機検証。
PR Amazon.co.jp 10/16〜 Amazonセールです。

ChatGPTのような生成AIを、クラウドではなく自分のPCだけで動かしたい。そんなニーズに応える方法の一つが、LM StudioでローカルLLMを実行する方法です。

今回は、Core i7-7700HQ・RAM 8GB・GeForce GTX 1050 4GBという2017年世代のノートPCで、Qwen3.5 4Bを実際に動かしました。最初にBionicを入れ、その後LM Studio本体でも同じモデルを試しています。

結論からいうと、8GBのPCでもローカルLLMは動き、Windowsを機内モードにしても回答できました。 ただし、ThinkをONにしたままでは17分50秒考え続け、OFFにすると約21.5秒相当で回答するなど、設定によって体感が大きく変わりました。

この記事では、インストールの流れだけでなく、メモリ使用率、生成速度、回答の誤り、オフライン動作まで、実機スクリーンショットを使って紹介します。

初めて使う方は、まず「LM Studio本体を入れる → Discoverでモデルを取得する → Chatで読み込んで日本語で質問する」の流れを押さえてください。Bionicを先に入れる必要はありません。この記事の前半では8GB PCの実測結果を、後半の「LM Studioの使い方」では公式手順に沿った8ステップを紹介します。

検証日:2026年9月29日

クラウドAIは外部サーバー、ローカルLLMは自分のPC内で処理する違いを示した図
クラウドAIとローカルLLMの処理場所の違い
目次

結論:8GBでもローカルLLMは動いた。ただし「動く」と「快適」は別

今回の実測結果を先にまとめます。

確認項目実測・結果
ローカルLLMの起動成功
使用モデルQwen3.5 4B GGUF(Q4_K_M、約3.38GB)
Bionic・思考「中」表示上の作業時間3分3秒。モデル読み込み時間を含む
LM Studio・Think ON17分50秒推論。確認できる範囲では最終回答本文なし
LM Studio・Think OFF約21.5秒相当(9.72 tok/s、203 tokens、初回応答0.61秒)
メモリBionic読み込み中にシステム全体98%、LM Studio回答後91%
オフライン機内モードでも計算・文章生成に回答
回答品質日本語で回答できたが、誤読や不自然な断定も確認

LM Studio公式のWindows x64要件は、AVX2対応CPUが必須、RAM 16GB以上と専用VRAM 4GB以上が推奨です。今回のPCはCPU要件とVRAM推奨値を満たしますが、RAMは推奨値の半分です。実際に動いた一方、メモリ使用率はかなり高くなりました。

ローカルLLMとは?ChatGPTとの違い

ChatGPTなどのクラウドAIは、入力内容をインターネット経由でサービス側へ送り、クラウド上のモデルが処理します。一方のローカルLLMは、モデルファイルをPCへ保存し、自分のCPU・GPU・RAMを使って推論します。

LM Studio公式によると、モデルを事前にダウンロードしておけば、ローカルモデルとのチャット、文書との対話、ローカルサーバーなどはインターネット接続なしで利用できます。ローカルモデルとのチャット入力はデバイス外へ送信されない、とも案内されています。モデル検索やダウンロード、アプリ更新にはネット接続が必要です。

今回の検証PC

項目仕様
CPUIntel Core i7-7700HQ 2.80GHz(4コア8スレッド、AVX2対応)
RAM8.00GB(7.86GB使用可能)
ストレージ477GB M.2 PCIe SSD
専用GPUNVIDIA GeForce GTX 1050 4GB
内蔵GPUIntel HD Graphics 630
OS64ビット Windows、x64ベース
モデルQwen3.5 4B GGUF
量子化Q4_K_M
モデルファイル約3.38GB

Core i7-7700HQはIntel公式ではQ1 2017登場の第7世代Core i7で、4コア8スレッド、AVX2対応です。新しいPCではありませんが、LM Studioのx64必須条件は満たします。

なぜQwen3.5 4Bを選んだのか

今回は8GB RAMでも試せそうな小型モデルを優先しました。Qwen3.5 4Bは4B(約40億)パラメータのモデルで、Qwen公式モデルカードでは201の言語・方言をサポートするとされています。今回選んだQ4_K_M版は約3.38GBで、実際に日本語で入出力できました。

Q4_K_Mのような表記は量子化の種類です。LM Studio公式も、量子化はモデルを小さくする代わりに一定の品質低下を伴う圧縮手法と説明しており、対応できるPCでは4bit以上を一つの目安にしています。

Bionicで先にローカルLLMを試した

BionicはLM Studioとは別アプリ

私は最初、LM Studio公式サイトからBionicをインストールしました。

LM Studio公式サイトに表示されたBionicの案内ページ
LM Studio公式のBionic案内ページ
Bionic 1.1.6+3のセットアップでインストールが進行している画面
Bionicのインストール画面

LM Studio公式は、BionicをLM Studioとは別のアプリと説明しています。Bionicは、ローカル・クラウド・別デバイス上のモデルを選びながら、コーディングや文書処理などのエージェント作業を進める用途を重視したアプリです。

Qwen3.5 4Bをダウンロード

Bionicの「ローカルモデル」→「探索」からQwen3.5 4Bを検索しました。

Bionicの探索画面でローカルモデル一覧を表示しているところ
Bionicのローカルモデル探索画面
BionicでQwen3.5 4Bを検索し複数の派生モデルが表示された画面
BionicでQwen3.5 4Bを検索

検索結果には派生モデルも多く出ます。今回は lmstudio-community/Qwen3.5-4B-GGUF のQ4_K_M、3.38GBを選びました。

Bionicのチャット画面でQwen3.5 4B GGUFを選択しているところ
BionicでQwen3.5 4Bを選択

Bionicは3分3秒。8GB RAMはかなり厳しかった

日本の都道府県を北から10個挙げてください。

Bionicでは思考レベルを「中」にして実行しました。最終画面には「3m3s 作業しました」と表示されました。ただし、実行途中には「モデルを読み込み中:73%」と表示されていたため、この3分3秒は純粋な生成時間ではなく、初回のモデル読み込みも含む作業時間として扱っています。

BionicでQwen3.5 4Bを読み込み中にメモリ98%とディスク92%を確認した画面
Bionicでモデル読み込み中の負荷

この時点で、システム全体のメモリ使用率は98%、ディスク使用率は92%でした。他のアプリも動いていたためBionic単体の使用量ではありませんが、8GB環境にほとんど余裕がないことは分かります。

Bionicが都道府県を回答し栃木県や千葉県のふりがなを誤っている画面
Bionicの回答結果

回答は文章として成立していましたが、山形県・福島県を飛ばしたうえ、栃木県を「はたけむりけん」、千葉県を「しべんけん」と読むなど、明らかな誤りもありました。小型モデルは、もっともらしい形で間違えることがあります。

なお、「北から」という質問は、県域の最北端、県庁所在地の緯度、地方区分順など解釈に幅があります。そのため、この1問だけで地理能力を厳密評価するのではなく、今回は待ち時間と挙動を見るためのテストとして使っています。

LM Studio本体で同じモデルを実機検証

Bionicで取得したQwen3.5 4Bをそのまま認識

その後、LM Studio本体もインストールしました。Bionicでダウンロード済みだったQwen3.5 4Bは、LM Studio側でもモデル一覧に表示されました。

LM Studioを起動した直後のチャット画面
LM Studioのチャット画面
LM Studioのモデル選択メニューにQwen3.5 4Bが表示された画面
LM Studioでモデルを選択

モデル読み込み画面では、Context Length 8192、GPU Offload 26、推定GPUメモリ3.15GB、推定総メモリ3.73GBと表示されました。

LM StudioでQwen3.5 4Bを読み込む際のメモリ見積もりとGPU Offload設定
Qwen3.5 4Bの読み込み設定

LM Studio公式では、GPU Offloadはモデル層の一部をGPU側へ回すための設定として案内されています。今回の画面には「26」と表示されましたが、このUI上の数値の単位までは公式資料で確認できなかったため、記事では「26レイヤー」とは断定しません。

最初は細かな設定を変えず、画面に表示された値のままLoad Modelを押しました。

LM Studioの回答が終わらない?Think ONで17分50秒、OFFで約21.5秒

同じ質問をLM Studioで実行すると、最初は画面下のThinkがONになっていました。

LM StudioでThinkを有効にして推論中のCPU・メモリ・GPU負荷を確認している画面
Think有効で推論中

保存した推論ログでは、新潟県を入れるか、関東各県をどう扱うかを何度も比較し続け、画面には「Thought for 17 minutes 50 seconds」と表示されました。確認できる範囲では、その後の最終回答本文は確認できませんでした。

LM StudioでQwen3.5 4BがThink ONのまま17分50秒推論した画面
Think ONで17分50秒推論した画面

そこで新しいチャットを作り、ThinkをOFFにして同じ質問を実行しました。今度は長い推論ループに入らず、回答が出ました。

Thinkを無効にしたLM Studioの回答とタスクマネージャーの負荷
Think無効で回答したときの負荷
LM StudioのThink OFFで9.72トークン毎秒、203トークン、初回応答0.61秒と表示された画面
Think OFF時の回答と生成統計

画面の生成統計は9.72 tok/s、203 tokens、初回トークンまで0.61秒でした。203 ÷ 9.72 ≒ 20.9秒なので、初回応答0.61秒を加えると概算約21.5秒です。Think ONの17分50秒と比べると、今回の経過時間には約50倍の差が出ました。

ただし、Think ON側は最終回答まで到達しておらず、処理内容も同一ではありません。したがって「Think OFFなら常に50倍速い」という意味ではなく、今回のPC・モデルではThink設定が待ち時間に大きく影響したという実測結果です。

Think OFFの回答はBionic時より整っていましたが、「厳密には北から10番目は群馬県」と断定しながら「地理的な連続性を考慮」と補足しており、曖昧な条件を確認せず断定する点は残りました。

機内モードでも回答できた

次にWindowsを機内モードへ切り替えました。

LM Studioを開いたままWindowsを機内モードに切り替えた画面
Windowsを機内モードに切り替えた画面

この画面に残っている都道府県の回答は機内モードへ切り替える前のものです。そこで、オフラインになった後に別の質問を実行しました。

15 × 17を計算してください。計算結果だけ答えてください。

回答は255。機内モードのまま返ってきました。

オフライン状態のLM Studioが15×17に255と回答した画面
オフラインで計算に回答

さらに「パソコンのメモリとは何か」を初心者向けに100文字程度で説明するよう依頼すると、こちらもオフラインのまま文章を生成できました。これは、ダウンロード済みモデルならオフラインでチャットでき、ローカルチャットの入力はデバイス外へ出ないというLM Studio公式の説明とも一致します。

機内モードのLM Studioでパソコンのメモリについて文章生成し10.92トークン毎秒と表示された画面
オフラインで文章生成

このときは10.92 tok/s、36 tokens、初回トークンまで0.96秒でした。オンライン時とは質問が違うため速度比較はできません。また、回答は句読点を含めて約68文字で、「100文字程度」という指定より短めでした。オフラインで生成できることと、指示どおりの品質になることは別です。

BionicとLM Studioは何が違う?

BionicLM Studio
エージェントとして作業を任せる用途を重視ローカルモデルの実行・検証をしやすい
ローカル・クラウド・別デバイス上のモデルを選べるモデルの読み込み設定や生成統計を確認しやすい
プロジェクト、文書、コーディングなどの作業向けチャット、ローカルAPI、モデル検証向け
今回の3分3秒にはモデル読み込み時間が混在tok/sや初回応答時間を画面で確認できた

Bionicが劣っているわけではなく、目的が違います。自分のPCでローカルLLMがどの程度動くかをまず確かめたい人には、LM Studio本体の方が挙動を確認しやすいと感じました。

LM Studioの使い方:初めてならこの8ステップ

今回私はBionicで先にモデルをダウンロードしたため、LM Studio本体のDiscover画面からモデルを取得する操作は実機では行っていません。 以下のダウンロード部分はLM Studio公式手順をもとに整理しています。モデル読み込み、Thinkの切り替え、オフライン確認は今回実際に試した流れです。

  1. LM Studio公式サイトからWindows版をインストールする
  2. PCがAVX2対応か確認し、RAM・VRAMに余裕があるかを見る
  3. LM Studio公式手順どおり、Discoverから小型モデルを検索する
  4. 最初は4B前後、4bit級(Q4など)のモデルから試す
  5. Chatでモデルを選び、表示された読み込み設定を確認してロードする
  6. まずThinkをOFFにして短い日本語質問を試す
  7. タスクマネージャーでRAM・GPU使用量を確認する
  8. 必要なら機内モードにして、本当にオフラインで動くか確認する

LM Studio公式は、初めてローカルモデルを動かす場合の入口としてデスクトップアプリを案内し、DiscoverタブからHugging Face上のモデルを検索・ダウンロードできるとしています。

情シス目線:ローカルなら「何でも安全」ではない

ローカルLLMの大きな利点は、入力した文書やプロンプトをクラウドAIへ送らず、端末内で処理できる構成を選べることです。個人情報や内部資料を扱う組織では、検討価値があります。

一方で、ローカルだから自動的に安全になるわけではありません。端末の紛失・マルウェア対策、アクセス権、ディスク暗号化、モデルの配布元とライセンス、改変版かどうか、そして回答精度の確認は別に必要です。Bionicでクラウドモデルを選んだ場合も、今回の完全ローカル実行とはデータの流れが変わります。

今回の誤読や断定からも分かるとおり、ハルシネーションはローカルLLMでも残ります。 「外部送信を減らせること」と「正しい回答が得られること」は分けて考える必要があります。

よくある質問

LM Studioは無料で使える?

LM Studioは公式に、デスクトップアプリを自宅だけでなく仕事でも無料で利用できると案内しています。現在の利用規約でも、個人利用または社内業務での利用が認められています。Bionicにも無料プランがあり、ローカルLLMはクラウド推論クレジットを使わず実行できます。なお、クラウド推論や一部のチーム・企業向け機能は別料金です。また、ダウンロードするAIモデル自体のライセンスはモデルごとに確認してください。

RAM 8GBでもLM Studioは動く?

今回のPCではQwen3.5 4BのQ4_K_M版を動かせました。ただし、Bionicのモデル読み込み中にシステム全体のメモリ使用率が98%まで上がりました。LM Studio公式はWindowsで16GB以上のRAMを推奨しているため、8GBでの動作は「可能な場合がある」が、余裕は小さいと考えた方がよいです。

日本語でも使える?

今回のQwen3.5 4Bは日本語で質問・回答できました。Qwen公式モデルカードでは201の言語・方言への対応を掲げています。ただし、Bionicではふりがなの誤りも出たため、日本語が使えることと、内容が正確であることは別です。

インターネットを切っても使える?

モデルと必要なランタイムを事前に取得しておけば、LM Studio公式はローカルチャットをオフラインで利用できると案内しています。今回もWindowsを機内モードにして、計算と文章生成の両方を確認できました。モデル検索・新規ダウンロード・アプリ更新などにはネット接続が必要です。

まとめ:ローカルLLMは簡単に試せるが、PC性能と設定の影響は大きい

今回、8GB RAMの2017年世代ノートPCでも、LM StudioとQwen3.5 4Bを使ってローカルLLMを実際に動かし、オフライン回答まで確認できました。導入自体は想像していたより難しくありません。

一方で、Think ONでは17分50秒の推論ループに入り、Think OFFでは約21.5秒相当で回答するなど、設定による差は非常に大きくなりました。Bionicではメモリ使用率が98%まで上がり、小型モデルでも回答に誤りが混ざりました。

LM Studioを初めて試すなら、小型モデル+Think OFFから始め、タスクマネージャーでメモリ使用量を確認するのが現実的です。今回の検証ではRAM 16GBへの増設比較は行っていないため、その効果についてはこの記事では断定しません。 音声を文字にするローカルAIを探している方は、Whisper Desktopの導入方法と実際の文字起こし結果をご覧ください。この記事で試したQwen3.5 4Bの文章生成とは用途が異なります。

参考情報

よかったらシェアしてね!
  • URLをコピーしました!
  • URLをコピーしました!

この記事を書いた人

はじめまして、「ぴろりん」です。
社会福祉法人で総務を担当しながら、IT運用管理・情報セキュリティ対応など、いわゆる「ひとり情シス」業務も兼務しています。
このブログでは、IT運用管理・PC修理・情報セキュリティ対応・資格学習など、実務で直面した課題とその解決策を発信しています。
同じような悩みを抱える方のお役に立てれば幸いです。

目次