Tech Collect特集
トップへ →

Capability Survey — Local AI Models

ローカルAIで、実際どこまでできるか(2026年8月時点)

クラウドのAIサービスを一切使わず、自分のPCだけで動かす「ローカルAI」でできることは、対話や画像・動画生成にとどまらない。調べ物やプログラム作成、自分のファイルへの質問応答、会議の文字起こし、古い写真の修復、3Dモデル生成まで、意外と知られていない用途を含めて8つの利用シーンに整理した。必要なPCスペックとライセンスの注意点も合わせてまとめる。

2026年8月31日時点 調査テーマ:ローカルAIモデルの現在地
整理した利用シーン
8つ
相談〜3Dモデル生成まで
文字起こしの速度目安
実時間の10倍速
whisper.cpp/Mac M5 Pro
写真アップスケールの必要VRAM
2〜4GB〜
Real-ESRGAN。ノートPCでも十分
コーディング特化モデルの実力
SWE-bench 58.7%
Qwen3-Coder-Next/24GB GPU

出典は各セクション本文中および末尾の情報源一覧を参照。

この記事で扱う8つの利用シーン

  1. チャット(相談・調べ物・プログラム作成)
  2. 自分のファイルに質問する
  3. 声を文字に、文字を声に
  4. 画像を作る
  5. 古い写真・低画質画像を直す
  6. 動画を作る
  7. 音楽を作る
  8. (番外)3Dモデルを作る

01チャット(相談・調べ物・プログラム作成)

「ローカルAIのチャット」と聞くと雑談や質問応答を想像しがちだが、実際には調べ物のリサーチとプログラム作成の2つで特に実用性が高い。用途別に見ていく。

日常の相談・文章の校正や要約・翻訳

Qwen3(Alibaba)はApache 2.0ライセンスで商用利用の制約が少なく、多言語対応も強いため「まず何を選べばいいか迷ったらQwen3」という評価が定着している。DeepSeekは複雑な推論タスクに強く、Llama 4(Meta)は長文脈処理に、Gemma 3(Google)は画像入力も扱えるマルチモーダル用途に向く。実行にはOllamaやLM Studioのようなランナーソフトを使うのが一般的だ。

調べ物・リサーチ(Web検索と組み合わせる)

意外と知られていないが、ローカルAIは「検索して要約する」ところまで完全にオフラインの構成で実現できる。PerplexicaはPerplexityの動作を模した自前の検索エンジンを内蔵し、ローカルモデルと組み合わせてCPUのみでも動く。SearXNG(複数の検索エンジンを横断するメタサーチエンジン)とOpen WebUIを組み合わせれば、ローカルLLMが実際にWebを検索し、出典付きで回答を合成する「プライベート版Perplexity」のような構成も作れる。プロンプトも検索クエリも一切外部に送信されない。

プログラム作成

コーディング用途はローカルAIの中でも特に実用段階が進んでいる分野だ。Qwen3-Coderは24GB級のGPU1枚でSWE-bench Verifiedのスコア58.7%を記録し、25万トークンの長いコンテキストにも対応する。エージェント的なソフトウェア開発に特化したDevstral Small(24B、Apache 2.0)も同ベンチマークで約53%と高スコアだ。モデルだけでなく、それを使うエージェント側のツールも充実しており、VS Code拡張のCline(ファイル操作・ターミナル・MCP対応)や、ターミナルで動くAider(gitと連携したペアプログラミング)はいずれもOllama・LM Studio経由でローカルモデルを指定できる。

チャット系モデルの規模別・必要VRAM目安
規模VRAM目安(Q4量子化)該当モデル例
4B〜8B6〜7GBQwen3 8B、Gemma 3 4B、Phi-4-mini
12B前後10〜12GBGemma 3 12B
24B〜32B18〜24GBQwen3-Coder、Devstral Small、Qwen3 32B
70B140GB(FP16、非現実的)Llama 4 Scout ※量子化やMac統合メモリが前提

02自分のファイルに質問する

手元のPDFや議事録、研究資料をAIに読ませて質問できる「ローカルRAG(検索拡張生成)」は、チャット単体よりも知られていない使い方だが実用性は高い。契約書や医療記録のような機密文書でも、内容が一切外部に送信されないまま検索・要約できる。

GPT4Allの「LocalDocs」機能は、指定フォルダ内のPDFを自動でインデックス化し、出典付きで回答する仕組みをプライバシー重視で設計している。Open WebUIもPDF・Word・Markdown・CSVなど複数形式の文書を非同期に処理でき、Ollama経由のローカルモデルと組み合わせて「自分の資料だけを参照するAI」を構築できる。ネットワーク接続が一切不要なため、GDPR等のデータ処理契約も原則不要になる。

Note

ローカルRAGは要求スペックがチャット単体とほぼ同じで、追加のGPU負荷は文書の検索インデックス作成時のみ。8GB前後のGPUでも十分実用になるため、「大容量GPUが無いと何もできない」というイメージとは裏腹に、実は導入のハードルが低い分野だ。

03声を文字に、文字を声に

音声認識・文字起こし

会議や講義の録音をテキスト化する用途は、実は最も手軽にローカルAIの恩恵を受けられる分野の一つだ。OpenAIが公開したWhisperモデルをC/C++に移植したwhisper.cppは、依存関係ゼロの5MBのバイナリだけで動作し、Mac(Metal)・NVIDIA(CUDA)・CPUのみの環境まで幅広く対応する。M5 Pro搭載Macでは1時間の音声を約6分で文字起こしできる、実時間の約10倍速というスピードが報告されている。NVIDIA環境で速度を優先するならfaster-whisperが適する。医療の口述記録や法律関係の録音、社内会議など、機密性の高い音声ほどローカル処理の恩恵は大きい。

読み上げ・声のクローン

音声合成・声のクローンは他分野に比べて要求スペックが軽く、8GB前後のGPUでも実用的に動く。XTTS v2(Coqui)はわずか6秒の音声サンプルから声をクローンでき17言語に対応する、Hugging Face上で最もダウンロードされているTTSモデルだが、ライセンスは非商用利用限定である点に注意が必要。商用利用も見据えるならFish Speech(Apache 2.0、8言語対応)が実務的な選択肢になる。英語ネイティブの自然さを軽量に求めるならF5-TTSも有力だが、こちらもCC-BY-NC 4.0で商用利用は制限される。

04画像を作る

画像生成ではFLUX.2(Black Forest Labs)がテキスト描画品質で開発モデル最高峰と評価されている一方、商用利用には別途ライセンス契約が必要という制約がある。Stable Diffusion 3.5 Large(Stability AI)はコミュニティが作った追加学習データ(LoRA)の蓄積が最も厚く、当面「使い勝手重視ならSD系」という位置づけは変わらない。どちらもComfyUIのようなノードベースのツールで動かすのが標準的。

画像生成モデルの比較
モデル開発元ライセンス必要VRAM目安
FLUX.2 devBlack Forest Labs商用は別途契約19GB〜(Q4)/64GB(FP16)
Stable Diffusion 3.5 LargeStability AICommunity License12〜14GB(FP8)

05古い写真・低画質画像を直す

画像「生成」ではなく画像「修復」も、実はローカルAIの得意分野として意外と知られていない。要求スペックが非常に軽く、ノートPC内蔵GPUでも試せる点が特徴だ。

Real-ESRGANは低解像度画像・繰り返し圧縮された画像を高画質化する超解像モデルで、写真・2Dイラスト・アニメ絵それぞれに特化したモデルが用意されている。顔の破損が激しい古い写真には、Tencent ARCのGFPGANを組み合わせるのが定番の構成で、Real-ESRGANの全体的な高画質化とGFPGANの顔専用修復を両方適用することで、単体を使うより大きく品質が改善する。どちらも必要VRAMは2〜4GB程度で、専用の高性能GPUがなくても実用になる。

06動画を作る

動画生成は要求スペックの差が最も激しい分野だ。LTX-Video(Lightricks)は速度と効率を優先した設計で、12GB VRAMのコンシューマGPUから動く。HunyuanVideo(Tencent)は軽量版の1.5(8.3Bパラメータ)であれば14GB以上のGPUで動作するが、無印の13B版は事実上A100・H100級が必要になる。Wan(Alibaba)はテキストから動画・画像から動画・動画編集まで幅広い用途をカバーするが、高品質な出力にはやはり40GB以上が現実的な水準となる。

LTX-2は音声とビデオを同時生成する初のオープンモデルであり、動画生成の使い勝手を一段引き上げた。 LTX Blog の分析より

07音楽を作る

ボーカル付きの楽曲もローカルで生成できるところまで来ている。YuE(7B、Apache 2.0)はSuno相当のフル楽曲+ボーカル生成に対応する一方、大型GPUを要する。より手軽なのはACE-Step(3.5B、Apache 2.0)で、ボーカル・楽器の両方を扱いながら最大4分程度の楽曲をコンシューマGPUでも高速に生成できる。効果音・環境音のような楽曲以外の音作りにはStable Audio Openが向く(最大47秒までの制約あり)。MusicGen(Meta)は手軽に試せる定番だが、CC-BY-NC 4.0のため商用利用はできない。

Note

チャット・画像分野に比べると、音楽生成はまだ「無料で試せるが商用利用には別モデルを選ぶ必要がある」ものが多い。用途が商用か個人利用かで、選ぶべきモデルが変わる点は他分野以上に意識したほうがよい。

08(番外)3Dモデルを作る

画像・動画・音楽ほど知られていないが、テキストや1枚の画像から立体的な3Dモデルを生成する技術もローカルで動く段階まで来ている。3Dプリントやゲーム開発の素材づくりに関心があるなら押さえておきたい分野だ。

Hunyuan3D-2(Tencent)はPBRテクスチャ生成まで含めて完全にオープンソース化されており、学習コードも公開されている。TRELLISはメッシュ・3Dガウシアン・放射輝度場など複数の出力形式に対応し、ローカルでの3D編集機能も備える。1枚の画像から素早くメッシュを作りたい場合は、フィードフォワード方式で高速なTripoSRが向いている。いずれもコンシューマGPU上での動作を想定して設計されている。

必要なPCスペックの目安

ローカルAIで最大のボトルネックはGPUのVRAM容量だ。分野ごとに要求は大きく異なるが、おおまかな目安は次の通り。

GPUはNVIDIA以外の選択肢も広がっている

「ローカルAI=NVIDIA一択」というイメージは2026年時点ではやや古い。AMDは2026年3月公開のROCm 7.2で、Ollama・LM Studio・llama.cpp・vLLMがCUDA環境と遜色なく動くようになり、Radeon RX 7900 XTX(24GB)はLlama 3.1 8Bで秒間約96トークン、RTX 4090比75%の速度をより安い価格で出せる。仕事用途ではRadeon AI PRO R9700(32GB)という選択肢もある。Intelも本気で参入しており、入門機のArc B580は12GB・249ドルで7Bモデルを実用速度で動かせる価格破壊的な存在、上位のArc Pro B70は32GBを949ドルで実現し、RTX 5090の実売価格の半額程度で32GB帯に手が届く。

GPUベンダー別・ローカルAI向け選択肢の比較(コンシューマ〜準業務用)
ベンダー製品例VRAM参考価格特徴
NVIDIARTX 5080 / RTX 409016GB / 24GB約15〜25万円対応ソフトが最も豊富。事実上の標準
AMDRadeon RX 7900 XTX24GB約13万円台〜ROCm 7.2でCUDA同等に。VRAM単価が良い
AMDRadeon AI PRO R970032GB業務向けワークステーション向け、ROCm対応
IntelArc B58012GB約249ドル7B級モデルの入門機として価格破壊的
IntelArc Pro B7032GB約949ドル1,000ドル以下で32GBに届く唯一の選択肢

デスクトップGPU以外の選択肢

Apple Silicon搭載Macは、CPU・GPU・Neural Engineでメモリを共有する「統合メモリ」方式のため、M4 Max搭載モデルなら最大128GBまで構成でき、70B級のLLMをフル精度のまま動かせる数少ない選択肢になる。ただし帯域幅(メモリの転送速度)はNVIDIAの専用GPUに劣り、生成速度そのものはRTX 5090の方が1.6〜2.5倍速いという報告もある。

もう一つの選択肢がNVIDIA DGX Sparkだ。Mac mini程度の筐体にGrace Blackwell GB10スーパーチップと128GBの統合メモリを積んだ「デスクに置ける個人用スーパーコンピュータ」で、70B級モデルもQ4量子化なら動く。ただし2026年2月時点の価格は4,699ドルまで上昇しており、メモリ帯域(273GB/s)がボトルネックになるため、単純な生成速度自体はRTX 5090に劣る。「省スペースで大きなモデルを試したい開発・研究用途」に向いた製品という位置づけだ。

「速さ重視ならNVIDIAのデスクトップGPU、大きなモデルを場所を取らずそのまま動かしたいならMacやDGX Spark」という住み分けが実態に近い。一方、文字起こし・画像修復・RAGのような軽量な用途は、高価な専用GPUを持たない一般的なノートPCでも十分に実用段階にある点は見落とされがちだ。

Caution — プロ向けGPUのコスト感

96GBのVRAMを積むRTX PRO 6000 Blackwellのような業務用GPUは、個人が気軽に手を出せる価格帯ではない。発売時のMSRPは8,565ドルだったが、AIによるメモリ需要の高まりで2026年8月時点では16,000ドル前後まで実売価格が高騰しており、1年余りで約87%の値上がりになる。個人・小規模チームがこの規模のVRAMを試したい場合は、GPUを購入せずクラウドで時間単位に借りる方法も現実的で、2026年8月時点の相場は1GPU時間あたり2.20ドル前後(月額換算で約1,600ドル)となっている。「常時大量に使うなら購入、たまに大きなモデルを試すだけならクラウドレンタル」という判断基準になる。