「自分だけのAI彼女を動かす」と聞くと一つのプログラムのように思えます。実際には、互いにやり取りする三つの部品で成り立っていて、どの部品が何をするかが分かれば、つまずきの大半は避けられます。
三つの部品

一般的なローカル環境で、何が何とつながっているか。
フロントエンドは目に見える部分です。チャット画面、キャラクター、アバター、設定がここにあたります。キャラクターチャットではSillyTavernが標準的な選択肢です。ブラウザ上で動き、キャラクターとチャットをファイルとしてディスクに保存し、ほぼどんなバックエンドにも接続できます。文章そのものは生成しません。
バックエンドはモデルを読み込んで返信を生成します。KoboldCppはインストール不要の単体プログラムで、生成設定をすべて公開しているためロールプレイ用途で人気です。Ollamaは数個のコマンドでモデルを動かせる、いちばん手軽な方法です。LM Studioは、使いやすいモデル検索画面を備えたデスクトップアプリです。どれも、フロントエンドがつなぎに来るローカルのアドレスでモデルを提供します。
モデルはHugging Faceからダウンロードする大きなファイルで、多くはGGUF形式です。パラメータ数(8B、12B、24B)と量子化の方式が、品質と必要なハードウェアを決めます。
ハードウェアの問題
モデルが快適に動くかどうかを左右するのは、グラフィックスメモリ(VRAM)です。モデル本体に加えて、会話そのものの分の余裕も要ります。量子化はモデルを小さくして収める技術で、「Q4_K_M」はサイズと品質の折衷案としてよく使われます。
| モデルサイズ | Q4での目安メモリ | 典型的なハードウェア | 期待できること |
|---|---|---|---|
| 7-8B | 5-6GB | 8GBのグラフィックスカード | 筋は通り、速い。長い場面では細部を忘れる |
| 12-14B | 9-10GB | 12GBのカード | キャラクターと文章が目に見えて良くなる |
| 22-24B | 14-16GB | 16-24GBのカード | ロールプレイでは優れたホスト型アプリに近い |
| 70B | 40GB以上 | カード2枚、または大容量メモリのMac | 非常に優秀だが、遅く高価 |
この数字はあくまで目安です。コンテキストを長くすると、さらにメモリが必要になります。Apple SiliconのMacはプロセッサとグラフィックスでメモリを共有するため、32GBのMacBookなら12GBのグラフィックスカードでは動かせないモデルも動かせます。モデルが収まらないと、メインのプロセッサにあふれて極端に遅くなります。返信が1秒に数語しか出ないときは、量子化をきつくする前に、まず小さいモデルに替えてください。品質の良い小さなモデルは、無理に圧縮した大きなモデルより優れていることが多いからです。
得られるもの
- 規約に頼らないプライバシー。 データはマシンの外に出ません。保存期間も、学習への利用も、スタッフによる閲覧もなく、あとで削除するものもありません。
- モデル自身以外のフィルターがない。 ロールプレイ向けに調整されたものを含め、モデルは自分で選べます。コンテンツに関する法律上の下限は自分にも適用されますが、運営が独自の規則を上乗せすることはありません。
- サブスクリプションもクレジットもない。 好きなだけ生成できます。
- 自分のものになるキャラクター。 キャラクターカードは、キャラクターシートを埋め込んだ普通のPNG画像です。フロントエンド間で持ち運べ、アップデートで取り上げられることもありません。
- 安定性。 今日動くモデルは、五年後も同じように動きます。誰かに途中で差し替えられることはありません。AIコンパニオンが一夜にして変わるリスクとは無縁です。
手放すもの
- セットアップの時間。 最初のチャットが動くまでに一晩はかかり、凝るのが好きなら何週間もいじり続けることになります。
- 記憶の管理は自分の仕事。 ホスト型アプリは、あなたに関する事実を裏で要約して保存してくれます。ローカルでは、SillyTavernのロアブック、要約、キャラクターノートで自分で管理します。AIコンパニオンの記憶の仕組みで説明した三つの仕組みと同じもので、操作が表に出ているだけです。
- 画像と音声は別プロジェクト。 画像生成には専用のモデルと、たいていはより多くのグラフィックスメモリが必要です。音声には音声認識と音声合成のツールが要ります。どれも可能ですが、自動ではありません。
- モバイルは不便。 自宅のWi-Fiなら、スマートフォンからフロントエンドを開けます。外出先で使うにはパソコンをインターネットに公開することになり、注意が必要です。
- 品質の上限。 最良のホスト型モデルは、特に長期の一貫性という点で、ほとんどの人が自宅で動かせるものより大きいのが実情です。
中間の道と、その落とし穴
SillyTavernは自分のマシンで動かしつつ、ローカルモデルではなく有料のクラウドAPIにつなぐ人も多くいます。フロントエンドの細かな制御とキャラクターファイルを保ったまま、はるかに大きなモデルを使え、従量課金なので軽い利用なら安く済みます。
ただし、プライベートではありません。すべてのメッセージがAPI提供元に送られ、そのログ、保存期間、コンテンツ規則に従うことになります。ロールプレイ内容については、専用のコンパニオンアプリより厳しいことも珍しくありません。これは別のトレードオフであって、ローカル環境ではありません。
安全の基本
- ソフトウェアは、GitHub上の公式プロジェクトページか、プロジェクト自身のサイトからだけダウンロードしてください。
- モデルはHugging Face上の信頼できるアップロード元から入手し、コードではなくモデルデータだけを含むGGUFファイルを選んでください。
- モデルのライセンスを読んでください。商用利用を制限するものや、一部の内容を制限するものがあります。
- パスワードを設定し、何を公開することになるかを理解していない限り、SillyTavernは自分のマシンか家庭内ネットワークに限定してください。

SillyTavernはGitHub上でオープンに開発されています。
向いている人
ローカルで動かすのに向いているのは、プライバシーを最優先にしたい人、すでに十分な性能のハードウェアを持っている人、使うのと同じくらい設定いじりが好きな人です。音声、画像、長い記憶を最初からそのまま使いたい人や、おもにスマートフォンでチャットする人は、ホスト型アプリのほうが合います。そちらの道は最初のアプリの選び方ガイドで扱っています。両方を使う人も多く、手軽さにはホスト型アプリ、どこにも残したくない会話にはローカル環境、という使い分けです。