自分のAIコンパニオンをローカルで動かす - 必要なものと現実

選び方

ホスト型のコンパニオンアプリとの会話は、すべて他人のサーバーにあります。自宅で動かすことは、それを根本から変えられる唯一の方法です。無料で、初期状態で規制もなく、今では品質も十分に高い。ただし、多くのガイドが書いている以上に手間がかかります。

当サイトのリンク経由でご登録いただいた場合、報酬を受け取ることがあります。評価や順位には影響しません。

「自分だけのAI彼女を動かす」と聞くと一つのプログラムのように思えます。実際には、互いにやり取りする三つの部品で成り立っていて、どの部品が何をするかが分かれば、つまずきの大半は避けられます。

三つの部品

ローカルAIコンパニオンの構成図: ブラウザ上のSillyTavernというフロントエンドがプロンプトをKoboldCppやOllamaなどのバックエンドに送り、バックエンドがグラフィックスカード上でGGUFモデルファイルを動かす

一般的なローカル環境で、何が何とつながっているか。

フロントエンドは目に見える部分です。チャット画面、キャラクター、アバター、設定がここにあたります。キャラクターチャットではSillyTavernが標準的な選択肢です。ブラウザ上で動き、キャラクターとチャットをファイルとしてディスクに保存し、ほぼどんなバックエンドにも接続できます。文章そのものは生成しません。

バックエンドはモデルを読み込んで返信を生成します。KoboldCppはインストール不要の単体プログラムで、生成設定をすべて公開しているためロールプレイ用途で人気です。Ollamaは数個のコマンドでモデルを動かせる、いちばん手軽な方法です。LM Studioは、使いやすいモデル検索画面を備えたデスクトップアプリです。どれも、フロントエンドがつなぎに来るローカルのアドレスでモデルを提供します。

モデルはHugging Faceからダウンロードする大きなファイルで、多くはGGUF形式です。パラメータ数(8B、12B、24B)と量子化の方式が、品質と必要なハードウェアを決めます。

ハードウェアの問題

モデルが快適に動くかどうかを左右するのは、グラフィックスメモリ(VRAM)です。モデル本体に加えて、会話そのものの分の余裕も要ります。量子化はモデルを小さくして収める技術で、「Q4_K_M」はサイズと品質の折衷案としてよく使われます。

モデルサイズQ4での目安メモリ典型的なハードウェア期待できること
7-8B5-6GB8GBのグラフィックスカード筋は通り、速い。長い場面では細部を忘れる
12-14B9-10GB12GBのカードキャラクターと文章が目に見えて良くなる
22-24B14-16GB16-24GBのカードロールプレイでは優れたホスト型アプリに近い
70B40GB以上カード2枚、または大容量メモリのMac非常に優秀だが、遅く高価

この数字はあくまで目安です。コンテキストを長くすると、さらにメモリが必要になります。Apple SiliconのMacはプロセッサとグラフィックスでメモリを共有するため、32GBのMacBookなら12GBのグラフィックスカードでは動かせないモデルも動かせます。モデルが収まらないと、メインのプロセッサにあふれて極端に遅くなります。返信が1秒に数語しか出ないときは、量子化をきつくする前に、まず小さいモデルに替えてください。品質の良い小さなモデルは、無理に圧縮した大きなモデルより優れていることが多いからです。

得られるもの

  • 規約に頼らないプライバシー。 データはマシンの外に出ません。保存期間も、学習への利用も、スタッフによる閲覧もなく、あとで削除するものもありません。
  • モデル自身以外のフィルターがない。 ロールプレイ向けに調整されたものを含め、モデルは自分で選べます。コンテンツに関する法律上の下限は自分にも適用されますが、運営が独自の規則を上乗せすることはありません。
  • サブスクリプションもクレジットもない。 好きなだけ生成できます。
  • 自分のものになるキャラクター。 キャラクターカードは、キャラクターシートを埋め込んだ普通のPNG画像です。フロントエンド間で持ち運べ、アップデートで取り上げられることもありません。
  • 安定性。 今日動くモデルは、五年後も同じように動きます。誰かに途中で差し替えられることはありません。AIコンパニオンが一夜にして変わるリスクとは無縁です。

手放すもの

  • セットアップの時間。 最初のチャットが動くまでに一晩はかかり、凝るのが好きなら何週間もいじり続けることになります。
  • 記憶の管理は自分の仕事。 ホスト型アプリは、あなたに関する事実を裏で要約して保存してくれます。ローカルでは、SillyTavernのロアブック、要約、キャラクターノートで自分で管理します。AIコンパニオンの記憶の仕組みで説明した三つの仕組みと同じもので、操作が表に出ているだけです。
  • 画像と音声は別プロジェクト。 画像生成には専用のモデルと、たいていはより多くのグラフィックスメモリが必要です。音声には音声認識と音声合成のツールが要ります。どれも可能ですが、自動ではありません。
  • モバイルは不便。 自宅のWi-Fiなら、スマートフォンからフロントエンドを開けます。外出先で使うにはパソコンをインターネットに公開することになり、注意が必要です。
  • 品質の上限。 最良のホスト型モデルは、特に長期の一貫性という点で、ほとんどの人が自宅で動かせるものより大きいのが実情です。

中間の道と、その落とし穴

SillyTavernは自分のマシンで動かしつつ、ローカルモデルではなく有料のクラウドAPIにつなぐ人も多くいます。フロントエンドの細かな制御とキャラクターファイルを保ったまま、はるかに大きなモデルを使え、従量課金なので軽い利用なら安く済みます。

ただし、プライベートではありません。すべてのメッセージがAPI提供元に送られ、そのログ、保存期間、コンテンツ規則に従うことになります。ロールプレイ内容については、専用のコンパニオンアプリより厳しいことも珍しくありません。これは別のトレードオフであって、ローカル環境ではありません。

安全の基本

  • ソフトウェアは、GitHub上の公式プロジェクトページか、プロジェクト自身のサイトからだけダウンロードしてください。
  • モデルはHugging Face上の信頼できるアップロード元から入手し、コードではなくモデルデータだけを含むGGUFファイルを選んでください。
  • モデルのライセンスを読んでください。商用利用を制限するものや、一部の内容を制限するものがあります。
  • パスワードを設定し、何を公開することになるかを理解していない限り、SillyTavernは自分のマシンか家庭内ネットワークに限定してください。

GitHub上のSillyTavernのプロジェクトページ

SillyTavernはGitHub上でオープンに開発されています。

向いている人

ローカルで動かすのに向いているのは、プライバシーを最優先にしたい人、すでに十分な性能のハードウェアを持っている人、使うのと同じくらい設定いじりが好きな人です。音声、画像、長い記憶を最初からそのまま使いたい人や、おもにスマートフォンでチャットする人は、ホスト型アプリのほうが合います。そちらの道は最初のアプリの選び方ガイドで扱っています。両方を使う人も多く、手軽さにはホスト型アプリ、どこにも残したくない会話にはローカル環境、という使い分けです。

よくある質問

AIコンパニオンをローカルで動かすのは無料ですか?

ソフトウェアは無料のオープンソースで、サブスクリプションもありません。かかるのはハードウェア、主に十分なメモリを積んだグラフィックスカードと、電気代です。ゲーミングPCや最近のMacをすでにお持ちなら、追加費用はほぼゼロで済むこともあります。

ローカルのAIコンパニオンをスマートフォンで使えますか?

モデル自体をスマートフォンで動かすのは現実的ではありません。ただ、すべてをパソコンで動かし、同じ家庭内ネットワークにつないだスマートフォンのブラウザからチャット画面を開くことはできます。SillyTavernは設定を変えればこれに対応します。

ローカル環境なら完全にプライベートですか?

モデルが自分のマシン上で動いている場合に限ります。SillyTavernを有料のクラウドAPIにつないで使う人も多く、その場合はすべてのメッセージがAPI提供元に送られ、提供元独自のログ保存とコンテンツ規則が適用されます。