Capability Survey — Local AI Models
クラウドのAIサービスを一切使わず、自分のPCだけで動かす「ローカルAI」でできることは、対話や画像・動画生成にとどまらない。調べ物やプログラム作成、自分のファイルへの質問応答、会議の文字起こし、古い写真の修復、3Dモデル生成まで、意外と知られていない用途を含めて8つの利用シーンに整理した。必要なPCスペックとライセンスの注意点も合わせてまとめる。
出典は各セクション本文中および末尾の情報源一覧を参照。
この記事で扱う8つの利用シーン
「ローカルAIのチャット」と聞くと雑談や質問応答を想像しがちだが、実際には調べ物のリサーチとプログラム作成の2つで特に実用性が高い。用途別に見ていく。
Qwen3(Alibaba)はApache 2.0ライセンスで商用利用の制約が少なく、多言語対応も強いため「まず何を選べばいいか迷ったらQwen3」という評価が定着している。DeepSeekは複雑な推論タスクに強く、Llama 4(Meta)は長文脈処理に、Gemma 3(Google)は画像入力も扱えるマルチモーダル用途に向く。実行にはOllamaやLM Studioのようなランナーソフトを使うのが一般的だ。
意外と知られていないが、ローカルAIは「検索して要約する」ところまで完全にオフラインの構成で実現できる。PerplexicaはPerplexityの動作を模した自前の検索エンジンを内蔵し、ローカルモデルと組み合わせてCPUのみでも動く。SearXNG(複数の検索エンジンを横断するメタサーチエンジン)とOpen WebUIを組み合わせれば、ローカルLLMが実際にWebを検索し、出典付きで回答を合成する「プライベート版Perplexity」のような構成も作れる。プロンプトも検索クエリも一切外部に送信されない。
コーディング用途はローカルAIの中でも特に実用段階が進んでいる分野だ。Qwen3-Coderは24GB級のGPU1枚でSWE-bench Verifiedのスコア58.7%を記録し、25万トークンの長いコンテキストにも対応する。エージェント的なソフトウェア開発に特化したDevstral Small(24B、Apache 2.0)も同ベンチマークで約53%と高スコアだ。モデルだけでなく、それを使うエージェント側のツールも充実しており、VS Code拡張のCline(ファイル操作・ターミナル・MCP対応)や、ターミナルで動くAider(gitと連携したペアプログラミング)はいずれもOllama・LM Studio経由でローカルモデルを指定できる。
| 規模 | VRAM目安(Q4量子化) | 該当モデル例 |
|---|---|---|
| 4B〜8B | 6〜7GB | Qwen3 8B、Gemma 3 4B、Phi-4-mini |
| 12B前後 | 10〜12GB | Gemma 3 12B |
| 24B〜32B | 18〜24GB | Qwen3-Coder、Devstral Small、Qwen3 32B |
| 70B | 140GB(FP16、非現実的) | Llama 4 Scout ※量子化やMac統合メモリが前提 |
手元のPDFや議事録、研究資料をAIに読ませて質問できる「ローカルRAG(検索拡張生成)」は、チャット単体よりも知られていない使い方だが実用性は高い。契約書や医療記録のような機密文書でも、内容が一切外部に送信されないまま検索・要約できる。
GPT4Allの「LocalDocs」機能は、指定フォルダ内のPDFを自動でインデックス化し、出典付きで回答する仕組みをプライバシー重視で設計している。Open WebUIもPDF・Word・Markdown・CSVなど複数形式の文書を非同期に処理でき、Ollama経由のローカルモデルと組み合わせて「自分の資料だけを参照するAI」を構築できる。ネットワーク接続が一切不要なため、GDPR等のデータ処理契約も原則不要になる。
Note
ローカルRAGは要求スペックがチャット単体とほぼ同じで、追加のGPU負荷は文書の検索インデックス作成時のみ。8GB前後のGPUでも十分実用になるため、「大容量GPUが無いと何もできない」というイメージとは裏腹に、実は導入のハードルが低い分野だ。
会議や講義の録音をテキスト化する用途は、実は最も手軽にローカルAIの恩恵を受けられる分野の一つだ。OpenAIが公開したWhisperモデルをC/C++に移植したwhisper.cppは、依存関係ゼロの5MBのバイナリだけで動作し、Mac(Metal)・NVIDIA(CUDA)・CPUのみの環境まで幅広く対応する。M5 Pro搭載Macでは1時間の音声を約6分で文字起こしできる、実時間の約10倍速というスピードが報告されている。NVIDIA環境で速度を優先するならfaster-whisperが適する。医療の口述記録や法律関係の録音、社内会議など、機密性の高い音声ほどローカル処理の恩恵は大きい。
音声合成・声のクローンは他分野に比べて要求スペックが軽く、8GB前後のGPUでも実用的に動く。XTTS v2(Coqui)はわずか6秒の音声サンプルから声をクローンでき17言語に対応する、Hugging Face上で最もダウンロードされているTTSモデルだが、ライセンスは非商用利用限定である点に注意が必要。商用利用も見据えるならFish Speech(Apache 2.0、8言語対応)が実務的な選択肢になる。英語ネイティブの自然さを軽量に求めるならF5-TTSも有力だが、こちらもCC-BY-NC 4.0で商用利用は制限される。
画像生成ではFLUX.2(Black Forest Labs)がテキスト描画品質で開発モデル最高峰と評価されている一方、商用利用には別途ライセンス契約が必要という制約がある。Stable Diffusion 3.5 Large(Stability AI)はコミュニティが作った追加学習データ(LoRA)の蓄積が最も厚く、当面「使い勝手重視ならSD系」という位置づけは変わらない。どちらもComfyUIのようなノードベースのツールで動かすのが標準的。
| モデル | 開発元 | ライセンス | 必要VRAM目安 |
|---|---|---|---|
| FLUX.2 dev | Black Forest Labs | 商用は別途契約 | 19GB〜(Q4)/64GB(FP16) |
| Stable Diffusion 3.5 Large | Stability AI | Community License | 12〜14GB(FP8) |
画像「生成」ではなく画像「修復」も、実はローカルAIの得意分野として意外と知られていない。要求スペックが非常に軽く、ノートPC内蔵GPUでも試せる点が特徴だ。
Real-ESRGANは低解像度画像・繰り返し圧縮された画像を高画質化する超解像モデルで、写真・2Dイラスト・アニメ絵それぞれに特化したモデルが用意されている。顔の破損が激しい古い写真には、Tencent ARCのGFPGANを組み合わせるのが定番の構成で、Real-ESRGANの全体的な高画質化とGFPGANの顔専用修復を両方適用することで、単体を使うより大きく品質が改善する。どちらも必要VRAMは2〜4GB程度で、専用の高性能GPUがなくても実用になる。
動画生成は要求スペックの差が最も激しい分野だ。LTX-Video(Lightricks)は速度と効率を優先した設計で、12GB VRAMのコンシューマGPUから動く。HunyuanVideo(Tencent)は軽量版の1.5(8.3Bパラメータ)であれば14GB以上のGPUで動作するが、無印の13B版は事実上A100・H100級が必要になる。Wan(Alibaba)はテキストから動画・画像から動画・動画編集まで幅広い用途をカバーするが、高品質な出力にはやはり40GB以上が現実的な水準となる。
LTX-2は音声とビデオを同時生成する初のオープンモデルであり、動画生成の使い勝手を一段引き上げた。 LTX Blog の分析より
ボーカル付きの楽曲もローカルで生成できるところまで来ている。YuE(7B、Apache 2.0)はSuno相当のフル楽曲+ボーカル生成に対応する一方、大型GPUを要する。より手軽なのはACE-Step(3.5B、Apache 2.0)で、ボーカル・楽器の両方を扱いながら最大4分程度の楽曲をコンシューマGPUでも高速に生成できる。効果音・環境音のような楽曲以外の音作りにはStable Audio Openが向く(最大47秒までの制約あり)。MusicGen(Meta)は手軽に試せる定番だが、CC-BY-NC 4.0のため商用利用はできない。
Note
チャット・画像分野に比べると、音楽生成はまだ「無料で試せるが商用利用には別モデルを選ぶ必要がある」ものが多い。用途が商用か個人利用かで、選ぶべきモデルが変わる点は他分野以上に意識したほうがよい。
画像・動画・音楽ほど知られていないが、テキストや1枚の画像から立体的な3Dモデルを生成する技術もローカルで動く段階まで来ている。3Dプリントやゲーム開発の素材づくりに関心があるなら押さえておきたい分野だ。
Hunyuan3D-2(Tencent)はPBRテクスチャ生成まで含めて完全にオープンソース化されており、学習コードも公開されている。TRELLISはメッシュ・3Dガウシアン・放射輝度場など複数の出力形式に対応し、ローカルでの3D編集機能も備える。1枚の画像から素早くメッシュを作りたい場合は、フィードフォワード方式で高速なTripoSRが向いている。いずれもコンシューマGPU上での動作を想定して設計されている。
ローカルAIで最大のボトルネックはGPUのVRAM容量だ。分野ごとに要求は大きく異なるが、おおまかな目安は次の通り。
画像のアップスケール・写真修復(Real-ESRGAN、GFPGAN)が実用範囲。ノートPC内蔵GPUでも試せる、最も敷居が低い分野。
音声合成・文字起こし・軽量チャット(4B〜8Bモデル)、自分のファイルへの質問(RAG)が実用範囲。画像・動画生成は量子化を強くかけないと厳しい。
SD3.5・LTX-Videoなど「効率重視」設計の画像・動画生成モデルが動き始める水準。RTX 4070 Ti系、RTX 5070系が該当。
RTX 4090・RTX 5080相当。32B級チャットモデル、コーディング特化モデル(Qwen3-Coder)、FLUX.2のQ4量子化版まで扱える、コンシューマGPUの現実的な上限。
RTX 5090(32GB)でも高品質な動画生成(40GB以上)には届かない場合がある。この帯域は業務用途向け。
「ローカルAI=NVIDIA一択」というイメージは2026年時点ではやや古い。AMDは2026年3月公開のROCm 7.2で、Ollama・LM Studio・llama.cpp・vLLMがCUDA環境と遜色なく動くようになり、Radeon RX 7900 XTX(24GB)はLlama 3.1 8Bで秒間約96トークン、RTX 4090比75%の速度をより安い価格で出せる。仕事用途ではRadeon AI PRO R9700(32GB)という選択肢もある。Intelも本気で参入しており、入門機のArc B580は12GB・249ドルで7Bモデルを実用速度で動かせる価格破壊的な存在、上位のArc Pro B70は32GBを949ドルで実現し、RTX 5090の実売価格の半額程度で32GB帯に手が届く。
| ベンダー | 製品例 | VRAM | 参考価格 | 特徴 |
|---|---|---|---|---|
| NVIDIA | RTX 5080 / RTX 4090 | 16GB / 24GB | 約15〜25万円 | 対応ソフトが最も豊富。事実上の標準 |
| AMD | Radeon RX 7900 XTX | 24GB | 約13万円台〜 | ROCm 7.2でCUDA同等に。VRAM単価が良い |
| AMD | Radeon AI PRO R9700 | 32GB | 業務向け | ワークステーション向け、ROCm対応 |
| Intel | Arc B580 | 12GB | 約249ドル | 7B級モデルの入門機として価格破壊的 |
| Intel | Arc Pro B70 | 32GB | 約949ドル | 1,000ドル以下で32GBに届く唯一の選択肢 |
Apple Silicon搭載Macは、CPU・GPU・Neural Engineでメモリを共有する「統合メモリ」方式のため、M4 Max搭載モデルなら最大128GBまで構成でき、70B級のLLMをフル精度のまま動かせる数少ない選択肢になる。ただし帯域幅(メモリの転送速度)はNVIDIAの専用GPUに劣り、生成速度そのものはRTX 5090の方が1.6〜2.5倍速いという報告もある。
もう一つの選択肢がNVIDIA DGX Sparkだ。Mac mini程度の筐体にGrace Blackwell GB10スーパーチップと128GBの統合メモリを積んだ「デスクに置ける個人用スーパーコンピュータ」で、70B級モデルもQ4量子化なら動く。ただし2026年2月時点の価格は4,699ドルまで上昇しており、メモリ帯域(273GB/s)がボトルネックになるため、単純な生成速度自体はRTX 5090に劣る。「省スペースで大きなモデルを試したい開発・研究用途」に向いた製品という位置づけだ。
「速さ重視ならNVIDIAのデスクトップGPU、大きなモデルを場所を取らずそのまま動かしたいならMacやDGX Spark」という住み分けが実態に近い。一方、文字起こし・画像修復・RAGのような軽量な用途は、高価な専用GPUを持たない一般的なノートPCでも十分に実用段階にある点は見落とされがちだ。
Caution — プロ向けGPUのコスト感
96GBのVRAMを積むRTX PRO 6000 Blackwellのような業務用GPUは、個人が気軽に手を出せる価格帯ではない。発売時のMSRPは8,565ドルだったが、AIによるメモリ需要の高まりで2026年8月時点では16,000ドル前後まで実売価格が高騰しており、1年余りで約87%の値上がりになる。個人・小規模チームがこの規模のVRAMを試したい場合は、GPUを購入せずクラウドで時間単位に借りる方法も現実的で、2026年8月時点の相場は1GPU時間あたり2.20ドル前後(月額換算で約1,600ドル)となっている。「常時大量に使うなら購入、たまに大きなモデルを試すだけならクラウドレンタル」という判断基準になる。