← ホームへ戻る
LESSON 025AI開発10 分

Local LLMとは?Cloud APIではなく、自分のPCやServerでModelを動かす

Local LLMは自分が管理するHardware上で動く言語モデルです。第025回ではWeight、VRAM、Quantization、Privacy、Performance、APIとのTrade-offを解説します。

今日のたとえ毎回Restaurantへ注文するのではなく、自分のKitchenで料理すること

AI APIを使うと、DataをProviderのInfrastructureへ送り、Modelは相手側のServerで動きます。

**Local Large Language Model (Local LLM)**は、自分で管理するLaptop、Desktop、Workstation、Serverなどで動く言語モデルです。

毎回Restaurantへ料理を注文するか、自宅Kitchenで作るか、という違いに少し似ています。

Controlが増える分、Responsibilityも増えます。

Model Weightが必要

Localで動かすには、Trainingで学習された数値ParameterであるWeightへアクセスできる必要があります。

WeightをDownloadできるModelはOpen-weight Modelと呼ばれることがあります。

ただしOpen-weightとOpen Sourceは完全に同じ意味ではありません。Training DataやCodeが非公開だったり、Licenseに制限があったりします。

Commercial Useでは必ずLicenseを確認します。

最初のHardware壁はMemory

大規模Modelは数十億Parameterを持ちます。

GPU Inferenceでは**VRAM (Video Random Access Memory)**が大きな制約になります。

単純計算で8B Parameterを16-bitで保持すると、Weightだけで約16 GBが必要です。実際にはKV CacheやRuntime Memoryも必要になります。

そこでLocal Inferenceでは**Quantization(量子化)**がよく使われます。

Quantizationとは?

Modelの値を少ないBit数で表現する方法です。

16-bitから8-bit、4-bitなどへ小さくすると、Memory使用量を大幅に減らせます。

その代わりMethodやModelによってはAccuracyやGeneration Qualityが落ちることがあります。

「4-bitだから使えない」と決めつけず、自分のTaskで評価します。

Localで動かす理由

などがあります。

Local = 自動的にPrivate / Freeではない

Local AppがTelemetryや外部Search APIを使えばDataは外へ出る可能性があります。

またAPI料金がなくても、GPU、電気、Maintenance、Engineering TimeにはCostがあります。

SpeedはModel Sizeだけでは決まらない

Tokens per secondは、

などに左右されます。

Memoryぎりぎりの巨大Modelより、小さく最適化されたModelの方が実用上快適な場合もあります。

APIとLocal、どちらが正解?

Hosted APIはHardwareを管理せず強いModelを使えるのが便利です。

LocalはControl、Privacy、Offline、固定Infrastructureが重要なときに魅力があります。

両方を組み合わせるSystemも多くあります。

今日の一文

Local LLMとは、Model Weightを自分のHardwareへLoadして実行する言語モデルで、Cloudの便利さと引き換えにより大きなControlを得る方法です。

次の第026回では、AI ExperimentやAutomationでよく使われるPythonへ進みます。

参考資料

たとえは直感をつかむ入口です。正式な定義や技術詳細は原典をご確認ください。

  1. Ollama — Documentation ↗
  2. llama.cpp — LLM inference in C/C++ ↗
← 前の章024Fine-tuningとは?追加学習で、繰り返すBehaviorをModel側へ覚えさせる
次の章 →026なぜAIでPythonがよく使われる?Model、Data、Experimentをつなぐ「作業台」だから
COMMUNITY

コメント

質問、感想、補足したいことがあれば、ここに残せます。

0 / 1200