ローカルLLM徹底比較|文章・画像・動画・音声モデルの必要スペックとライセンスまとめ【2026年8月版】

概要

今回はローカルLLM(自分のPCやサーバーだけで動かす生成AI)について、文章生成・画像生成・動画生成・音声処理の4分野を横断して紹介していきます。

クラウドの生成AIはどんどん便利になっていますが、入力内容を外部に送りたくない場面や、使った分だけ課金されるのが気になる場面では、ローカルLLMがよいですよね。

ただ実際に調べてみると、モデルごとに必要なVRAMやライセンス条件がバラバラで、どれを選べばいいのか訳がわかりません(- -

そこで今回、汎用テキスト・画像・動画・音声の4分野について、必要スペックの目安とライセンスの扱いを整理してみました。

ノートPCでどこまで動くかも合わせてまとめているので、導入前の参考にしてもらえると嬉しいです。

それではやっていきましょう!

目次

先に結論だけ知りたい方向け

細かい数値は本文でじっくり見ていきますが、時間がない方向けに分野横断の早見表だけ先に出しておきます。

分野 「まず試す」定番 商用利用で無難な選択 必要VRAM目安 ノートPCでの現実度
汎用テキスト Qwen3系(日本語も強い) Apache 2.0(Qwen)/独自ライセンス商用可(Gemma) 8B: 6〜8GB/14B: 16GB/32B: 24GB ◎(8B以下)/△(14B超)
画像生成 FLUX.1 schnell / SDXL FLUX.1 schnell(Apache 2.0) SDXL: 8〜12GB/FLUX: 12〜16GB △(ゲーミングノート限定)
動画生成 Wan 2.2 Wan 2.2(Apache 2.0) 軽量版: 12GB/フル版: 24GB以上 △(ハイエンドノートのみ)
音声認識 Whisper(faster-whisper) Whisper(オープンソース) CPUのみでも可 ◎ 問題なし
音声合成 VOICEVOX(お試し)/ Piper(軽量・組み込み) ライセンス要確認が多い分野 CPUのみでも可 ◎ 問題なし

ここからは、各分野の必要スペックとライセンスの根拠を1つずつ掘り下げていきます。

そもそも「ローカルLLM」とは

クラウドの生成AI(ChatGPTやClaudeなど)は、インターネット経由で企業のサーバー上のAIを使う仕組みです。

一方でローカルLLMは、AIモデルのファイル(重み=パラメータ)を自分のPCやサーバーにダウンロードして、自分のマシンの中だけで動かす方式になります。

メリットは大きく3つあります。

  • 秘密が守れる
    • 入力した文章や画像が外部に送信されない
  • 通信不要でオフラインでも動く
    • ネットがない環境でも使える
  • 使い放題
    • クラウドAPIのように使った分だけ課金される、ということがない(電気代とPC代のみ)

逆にデメリットは次の3つです。

  • そこそこ良いPCが必要
    • 特にGPUのVRAM容量がボトルネックになりやすい
  • セットアップに知識がいる
    • 量子化やツールの選定など、覚えることが多い
  • 最新のクラウドAIには性能で劣ることが多い
    • 最先端モデルはやはりクラウド版

以下では用途別に、「①汎用(文章生成)」「②画像生成」「③動画生成」「④音声(読み上げ・文字起こし)」の4分野で整理していきます。

1. 汎用系(テキスト生成LLM)

DenseとMoE、まず知っておきたい仕組みの違い

  • Dense(密)型
    • モデルの全パラメータを毎回フル稼働させる方式で、パラメータ数がそのまま必要メモリ量の目安になるシンプルなタイプです
  • MoE(Mixture of Experts/専門家混合)型
    • モデルの中に複数の「専門家」を用意しておき、質問ごとに一部の専門家だけを呼び出して計算する方式です

MoE型は動作(計算)は軽いのに、モデル全体は結局メモリに載せておく必要があるので、「動作は速いのにメモリはたくさん食う」という特徴を持っています。

実際に使うパラメータ数だけを見てメモリを見積もると、実際にはロードできなかったという事故は見るに耐えないので要注意です。

必要スペック早見表(GPU・VRAM・メモリ)

用語を先に補足しておきます。

VRAMはGPU専用のメモリで、LLMの動作可否を決める最重要要素です。

RAMはPC本体のメインメモリ、量子化はモデルを軽量化する圧縮技術で、数値が小さいほど軽いものの精度がわずかに下がります。

以下は最も一般的な「Q4量子化」を前提とした目安です。

モデルサイズ 必要VRAM目安 目安GPU例 システムRAM目安
1B〜4B(超軽量) 4GB前後 内蔵GPU/古めのノートPCでも可 8〜16GB
7B〜8B 6〜8GB RTX 3060/RTX 4060/MacBook Air(16GB統合メモリ) 16GB
12B〜14B 10〜16GB RTX 4070/RTX 4060 Ti 16GB 32GB
30B〜32B 20〜24GB RTX 4090/RTX 5090 32〜64GB
70B 40〜48GB以上 RTX 4090×2、またはMac 64GB以上 64〜128GB
100B超のMoE系(DeepSeek V4等) 96GB以上 Mac Studio(統合メモリ128GB)、DGX Spark等 128GB以上

計算の目安としては、「モデルのパラメータ数(B)×約0.6=必要VRAM(GB)」となります。

GPUの選び方としては、ローカルLLMでは演算性能(コア数など)よりVRAM容量が最も重要で、同じ予算ならVRAMが大きいGPUを優先すべきとされています。

ノートPCでも動く?

結論から言うと、「小型モデルなら動くが、本格運用は厳しい」というのが複数の専門メディアで一致した見解でした。

ノート用GPUはVRAMが少なめ(〜16GBが多い)で、メモリも増設不可のモデルが多いため、7B〜13Bクラスを軽く試す程度なら現実的ですが、30B以上を本格的に使うのはほぼ非現実的とされています。

ノートPCで妥協するなら、「RTX 4070 Laptop+メモリ32GB」あたりが上限ラインです。

GPUを搭載していない一般的なノートPCでも、CPUだけで小さめのモデルを使った短文生成や要約は試せますが、応答は遅くなりやすいです。

ちなみにMacは「統合メモリ(GPU/CPUで共有するメモリ)」を採用しているため、メモリ容量がそのまま動かせるモデルサイズに直結します。

例えば32GB統合メモリのMacBook Proなら、専用GPU搭載のゲーミングノートより大きなモデルを動かせることがあります。

ノートPCでの目安は次の通りです。

ノートPCのタイプ 動かせる目安
GPUなし・内蔵グラフィックのみ 1B〜4B(要約・簡単なチャット程度)
ゲーミングノート(RTX 4060 Laptop 8GB等) 7B〜8B
ハイエンドゲーミングノート(RTX 4090 Laptop 16GB等) 14B前後
MacBook Air/Pro(統合メモリ16〜36GB) 7B〜14B(メモリ次第で32B級も可能、ただし速度は遅め)
Mac Studio等の据置Apple Silicon(64〜128GB) 70B級も視野に入る

主要な汎用モデルの性能(ベンチマークスコア)

以下は各社公式モデルカードやベンチマーク集計ブログの数値をまとめて整理したものです。

測定方法はベンダーごとに異なるので、「どちらが何点上」という細かい差よりも、大まかな序列の参考として見てもらえればと思います!

先にベンチマーク用語を補足しておきます。

  • MMLU / MMLU-Pro
    • 大学レベルの幅広い知識を問うテストで、総合的な「地頭の良さ」の指標としてよく使われます
  • GPQA Diamond
    • 博士課程レベルの理系専門問題で、難易度がかなり高いテストです
  • HumanEval / SWE-bench
    • プログラミング能力を測るテストで、特にSWE-bench Verifiedは「実際のGitHubのバグを直せるか」を問う実務に近い内容です
  • AIME
    • 数学オリンピック相当の難問テストで、数学的推論力を測ります
モデル 規模 MMLU-Pro GPQA Diamond コーディング(SWE-bench等) 数学(AIME等) 備考
Gemma 4 31B(Dense) 31B 85.2% 84.3% HumanEval 76.8% AIME 2026: 89.2% Codeforces ELO 2150、数学・競プロに強い
Gemma 4 26B-A4B(MoE) 総26B/有効3.8B AIME 2026: 89% 有効パラメータあたりの効率が高い
Qwen3.5 27B 27B 86.1% 85.5% Gemma 4 31Bをやや上回る知識・科学スコア
Qwen3.6 27B(Dense) 27B 86.2% Gemma超え(数値非公開) SWE-bench Verified: 77% MATH等で優位 2026年7月時点でコーディング最強クラスの声も
Qwen3.6-35B-A3B(MoE) 総35B/有効3B SWE-bench Verified: 73.4% 「35Bの賢さを3Bのコストで」がウリ、ローカル運用の定番
Qwen3.5 397B-A17B(フラグシップMoE) 総397B/有効17B SWE-bench Verified: 76.4% オープンウェイトの中でも最上位級。動作要件はかなり重い
Llama 4 Scout 総109B/有効17B 上位2モデルにやや劣る 超長文コンテキスト(〜10M)が最大の強み
Llama 4 Maverick 総400B/有効17B 大規模MoE、サーバー級ハードが前提
Kimi K2.5 1T級 SWE-bench: 76.8% 中国系の大型MoE、コーディングに強い
MiniMax M2.5 中〜大型 SWE-bench: 80.2% クローズドモデル(Claude Opus級)に迫る評価も

日本語性能について

日本語ベンチマーク(JGLUE、JCommonsenseQA、日本語MT-Bench等)では、2026年6月時点でQwen3系(Alibaba)が総合トップ、続いてLlama 4、DeepSeek V3という序列が報告されています。

ただしベンチマークはタスク次第で順位が変わるので、自社業務での実測はやった方が良いです。

国産モデル(ELYZA、Swallow、PLaMo、Sarashinaなど)はベンチマークの総合首位ではないものの、語彙や敬語表現の自然さで評価されるケースが多く見られました。

主要な汎用モデル一覧(ライセンス)

モデル 開発元 ライセンス(概要) 特徴
Llama 4 / 3.x Meta Llama Community License(独自・条件付き無償) 月間アクティブユーザー(MAU)が7億以下であれば無料で商用利用可能。巨大モデルはサーバー向け
Qwen3 / Qwen3.5 / Qwen3.6 Alibaba Cloud 多くがApache 2.0(一部モデルは独自ライセンス) Alibaba Cloudが開発するオープンモデル群で、多くはApache 2.0のもとで配布。日本語ベンチマークでも強く、サイズ展開が豊富
Gemma 3 / 4 Google Gemma Terms of Use(独自・商用可) Gemma Terms of Useのもとで提供。軽量版は数GBのRAMでも動作し、スマホや小型端末向けも用意
DeepSeek V3/V4、GLM、Kimi K2系 中国系各社 Apache/MIT系が多い MoE構成の大型モデル。ベンチマーク上位だが動作要件は重い
ELYZA / Swallow / PLaMo / Sarashina 国内各社 ベースモデルに準拠+追加条件 日本語の語彙・敬語表現に強い国産ファインチューニングモデル

Metaの公式ライセンス文書では、Llama 4のコミュニティライセンスにおいて、月間アクティブユーザー数が7億を超える場合はMetaへの個別ライセンス申請が必須になり、承認が下りるまでその権利を行使できないと明記されています。

個人利用や小規模なサービスであれば気にする必要はほぼありませんが、事業として大きく展開する予定がある場合は、この条件だけは押さえておく必要があります。

選び方の考え方

専門家向けブログの整理によると、ローカルLLMは1モデルに絞るのではなく、速度重視なら小型モデル、品質重視なら30B級のMoEモデル、超長文が必要なら専用モデルというように、用途ごとに複数モデルを使い分けるのが2026年時点の実践的なアプローチとされています。

商用利用する場合は、Apache 2.0のような寛容なライセンスか、Meta・GoogleのようにMAU上限や独自条項がある「条件付き無償」ライセンスかを、必ずモデルごとに確認する必要があります。

2. 画像生成系

代表モデルと系譜

ローカルで動く画像生成AIで有名なのは、Stable Diffusion系FLUX系です。

モデル 開発元 ライセンス VRAM目安
Stable Diffusion 1.5 / SDXL Stability AI CreativeML Open RAIL-M(商用利用可・禁止用途あり) 4〜8GB
Stable Diffusion 3.5 Stability AI Stability Community License(個人・年商100万ドル未満の法人は無償) 8〜16GB
FLUX.1 [schnell] Black Forest Labs Apache 2.0(商用利用に制限なし) 6〜12GB
FLUX.1 [dev] / FLUX.2 [dev] Black Forest Labs FLUX.1-dev Non-Commercial License(研究・非商用限定。商用利用は別途契約が必要) 12〜16GB
Illustrious-XL等 コミュニティ SDXL派生(アニメ表現特化) 8GB前後

FLUXの公式リポジトリを確認したところ、FLUX.1 [schnell]はApache 2.0でHugging Faceに公開されている一方、FLUX.1 [dev]系(Fill/Canny/Depthなど)はいずれも「FLUX.1-dev Non-Commercial License」が適用されていました。

この非商用ライセンスの「非商用目的」は、個人的な研究・実験・テストや、商用組織による本番環境外での評価利用などに限定されています。

商用で使いたい場合は、Apache 2.0のschnellを使うか、Black Forest Labsの商用ライセンスプログラムを別途契約する必要があります。

ライセンス周りが複雑なので、1次情報の確認は必ずやってから使用しましょう!

必要スペック・ノートPCでの動作

画像生成は文章生成(LLM)よりVRAM消費が複雑です。

モデルの重みに加えて、ノイズ除去処理・画像の圧縮復元処理・テキストエンコーダーが同時に動くため、VRAM使用量が増えます。

モデル 最低VRAM 快適な動作のVRAM ノートPCでの可否
SD 1.5 4GB 6GB 内蔵GPU以外のノートならほぼ動作
SDXL 8GB 12GB ゲーミングノート(RTX 4060以上)で可
SD 3.5 Large 11〜18GB 16GB以上 ハイエンドゲーミングノート推奨
FLUX.1 schnell(Apache 2.0・軽量版) 6〜12GB 12GB RTX 4070 Laptop以上で実用的
FLUX.1 dev / FLUX.2 dev 12〜16GB 16〜24GB 高VRAMノート(16GB以上)が望ましい

2026年時点の一般的な目安として、SDXLにはVRAM8GB以上(快適には12GB)、SD1.5は4GBあれば動作、SD3.5 Largeは約11GB以上が必要とされています。

Fluxについては2026年時点の標準としてVRAM16GB(RTX 5060 Ti 16GBやRTX 5070 Ti相当)が目安とされ、8GB級のGPUはメモリ不足エラーや処理のオフロードで動作が遅くなりがちだと指摘されています。

ノートPCの話に戻すと、Stable Diffusionを快適に使うにはVRAM12GB以上・メモリ16〜32GBが推奨環境とされていて、これを満たすノートPCは必然的にゲーミングPCやクリエイター向けPCに限られます。

一般的な事務用ノートPCでの快適な動作は難しく、非力なノートPCの場合はクラウドGPU(RunPod等のレンタルGPUサービス)を併用する方法も紹介されていました。

実務での使い分け

複数のブログ記事で一致していたのは、「商用利用の自由度だけで選ぶならFLUX.1 schnell(Apache 2.0)が現実的」という評価でした。

またLoRA(追加学習による作風カスタマイズ)のエコシステムはStable Diffusion系が最も充実しているとされていて、ControlNet等と組み合わせた精密な構図制御が必要な場合は、SD系+ComfyUIが良いという意見がありました。

3. 動画生成系

ローカルで動く動画生成AIは2025年後半〜2026年にかけて急速に整備された、比較的新しい分野です。

2026年8月時点で主に使われているのは次の3系統でした。

モデル 開発元 ライセンス 特徴・VRAM目安
Wan 2.2 Alibaba Apache 2.0 品質重視。最軽量版(TI2V-5B)は約24GB、量子化で16GB級でも動作報告あり
HunyuanVideo 1.5 Tencent Tencent Hunyuan Community License(独自・MAU制限あり) 高品質・ストーリー一貫性に強い。14GB〜が目安(軽量化版で緩和)
LTX-2 / LTX-2.3 Lightricks モデルにより異なる 速度最速クラス。音声とのシンクロ生成にも対応
FramePack コミュニティ コード自体はApache 2.0だがベースのHunyuanVideoライセンス条件を実質継承 低VRAM(6GB程度)でも動作

ライセンス面で注意したいのは、「オープンソース」と呼ばれていても、Wan 2.2・LTX-2.3のようにApache 2.0で完全に自由なグループと、HunyuanVideo・FramePack・SkyReelsのように商用利用に条件が付く独自ライセンスのグループに分かれている点です。

「オープンソース」という言葉だけでは商用可否を判断できないので、ここは注意しておきたいところです。

選び方の目安としては、品質最優先はWan 2.2、速度・音声同期を重視するならLTX-2.3、VRAMが少ない環境ならFramePackという住み分けが、多くの記事で共通していました。

必要スペック・ノートPCでの動作

動画生成は画像生成よりさらにVRAM・システムRAM要求が重い分野です。

モデル/VRAM 8GB 12GB 16GB 24GB以上
Wan 2.2 5B軽量版のみ(量子化必須) 5B版 14B量子化版 14Bフル版
HunyuanVideo 1.5 動作困難 動作困難 軽量化版で可 快適
FramePack 6GB版で動作 快適 余裕 余裕
LTX-2.3 動作困難 快適 余裕 余裕

2026年8月時点の目安として、VRAM16GBならWan 2.2の量子化版かLTX-2.3、VRAM12GBならWan 2.2の軽量5B版、VRAM8GB以下や長尺動画を作りたい場合はFramePack(7B版が6GB程度で動作)という評価がされていました。

ノートPCでの動作については、動画生成は画像生成よりもさらに要求スペックが高いため、一般的なノートPC(VRAM8GB以下)での快適な動作は基本的に厳しいです。

ゲーミングノート(RTX 4090 Laptop 16GB等)であれば、FramePackや軽量化されたWan 2.2 5B版なら動作が期待できますが、HunyuanVideoのような高品質モデルはデスクトップGPU(VRAM24GB以上)が必要になります。

4. 音声系(TTS=読み上げ/STT=文字起こし)

音声認識(STT)

Whisper / faster-whisperは、OpenAIが公開したオープンソースの音声認識モデルです。

クラウドに音声を送信せず、PCやサーバー上だけで文字起こしが完結するため、会議の議事録や個人情報を含む音声の処理に向いています。

多言語対応で、モデルサイズ(small/medium/large等)をPCスペックに応じて選べます。

whisper.cppは、Whisperを軽量な実装に移植したもので、省電力なノートPCやミニPCでも動作します。

音声合成(TTS)

日本語話者向けの代表的な選択肢は次の通りです。

ツール 特徴 ライセンス傾向
VOICEVOX 「ずんだもん」等のキャラクターボイスで有名。GUIで手軽、商用利用可だがキャラクターごとのクレジット表記義務あり 独自(無料・要クレジット)
Style-Bert-VITS2 感情表現が豊か。自分の声で学習させるカスタマイズも可能 オープンソース系
AivisSpeech VOICEVOXと互換API、ONNX Runtimeで軽量動作 独自
Piper 超軽量(1ボイス10〜75MB)、Raspberry Piでも動作。オフライン音声アシスタント向け MIT/GPL系
Qwen3-TTS / CosyVoice 3.0 多言語・ゼロショット音声クローン対応の新世代モデル Apache 2.0

必要スペック・ノートPCでの動作

音声系(TTS/STT)は画像・動画生成と比べてかなり軽量で、多くのツールがノートPC・CPUのみでも実用的に動作します。

ツール 目安スペック ノートPCでの可否
Whisper(small/medium) CPUのみでも可、GPUがあれば高速化 ◎ 問題なく動作
Whisper(large)/ faster-whisper GPU推奨(VRAM4〜6GB) ○ 軽めのGPUノートで実用的
VOICEVOX / AivisSpeech CPUのみで動作、GPU不要 ◎ 事務用ノートPCでも快適
Piper 数百MBのメモリのみ、Raspberry Piでも動作 ◎ 最も軽量。組み込み用途にも
Style-Bert-VITS2 GPUメモリ4GB以上が必要で、環境構築のハードルはVOICEVOXより高い ○ 一般的なゲーミングノートで可

音声分野は「ノートPCで動くか」という点ではほぼ心配不要で、むしろモデルのライセンスや商用利用条件の確認の方が実務上の課題になりやすい分野です。

注意点

音声クローン系のツールは、本人の同意なく声を複製すると法的・倫理的にアウトなためそこは注意した方が良いです!

商用ナレーションで使う場合は、モデルごとのライセンス(特にキャラクターボイスのクレジット義務や、非商用限定の条項)を必ず確認してください。

5. 分野横断の選び方まとめ

分野 「まず試す」定番 商用利用で無難な選択 必要VRAM目安 ノートPCでの現実度
汎用テキスト Qwen3系(日本語も強い) Apache 2.0(Qwen)/独自ライセンス商用可(Gemma) 8B: 6〜8GB/14B: 16GB/32B: 24GB ◎(8B以下)/△(14B超)
画像生成 FLUX.1 schnell / SDXL FLUX.1 schnell(Apache 2.0) SDXL: 8〜12GB/FLUX: 12〜16GB △(ゲーミングノート限定)
動画生成 Wan 2.2 Wan 2.2(Apache 2.0) 軽量版: 12GB/フル版: 24GB以上 △(ハイエンドノートのみ)
音声認識 Whisper(faster-whisper) Whisper(オープンソース) CPUのみでも可 ◎ 問題なし
音声合成 VOICEVOX(お試し)/ Piper(軽量・組み込み) ライセンス要確認が多い分野 CPUのみでも可 ◎ 問題なし

文章生成・音声系は一般的なノートPC(特にApple Silicon Mac)でも実用範囲に入りますが、画像・動画生成は依然としてデスクトップ級のGPU(VRAM16GB以上)が現実的なラインです。

ノートPCで画像・動画生成を試したい場合は、まず軽量モデル(SDXL、FLUX schnellの量子化版など)から始めるか、クラウドGPUのレンタルサービスを併用するのが選択肢になりそうです。

共通する注意点として、「オープンソース=完全に自由に商用利用できる」とは限りません

特に画像・動画分野では「無料で公開されているが商用利用には別条件がある」モデルが主流の一角を占めているため、導入前には必ず公式ライセンスを確認することをお勧めします。

出典について

この記事の中でも特に商用利用に関わるライセンス条件(FLUX.1のApache 2.0/非商用ライセンスの区分、Llama 4のMAU条件)は、Black Forest Labsの公式リポジトリとMetaの公式ライセンス文書を自分で直接確認した上で書いています。

FLUX.1のライセンス区分(公式リポジトリ)
https://github.com/black-forest-labs/fluxgithub.com

Llama 4コミュニティライセンス(Meta公式)
https://developer.meta.com/ai/llama4/license/developer.meta.com

OpenAI Whisper公式リポジトリ
https://github.com/openai/whispergithub.com

一方でPCスペックの目安やベンチマークスコア、動画生成AIのライセンス条件の一部(Tencent Hunyuanなど)は、専門メディアやブログ記事を参考にした二次情報です。

ベンダーや測定条件によって数値の出方が変わるので、導入を検討する際は公式のモデルカードやライセンス文書を必ず自分でも確認することをお勧めします。

締め

いかがでしたか?

ローカルLLMはお金を使いたくない自分にとって良い選択肢だと思いましたが、
動かすためのPCがないので、導入は厳しいかもですね…

ただ使えれば便利なことこの上ないので、手元によいPCがある方はぜひ試してみてください!

以上となります。
無料は熱いけど、導入ハードルは高い…
それではお疲れさまでした!