あなたの最初の会話 locale
ローカルLLMにクエリを送るには、ollama runでモデルを起動し、処理対象のテキストを含む完全なリクエストを1、2文で入力し、回答を読み取った後、最初からやり直すのではなく、具体的な指示で修正します。入力した内容はすべてあなたのマシンから外に出ません。約15分で、要約、メール作成、コードの作成を行い、失敗した回答を修正する方法を理解できます。
Ollamaのインストールが済み、目の前でカーソルが点滅しています。この初日のチュートリアルでは、実際にモデルと会話しながら、マシンのメモリ容量に合ったモデルを起動する方法、効果的な依頼の仕方、セッションコマンドの使い方、モデルの応答が的外れになったときの見分け方、そしてコンテキストやメモリに関する落とし穴を避ける方法を学びます。
#このチュートリアルで学べること
これから、要約を依頼し、メールを書いてもらい、短いスクリプトを生成してもらい、モデルの対応範囲外の質問を試し、最後に意図と違う方向に進んだ回答を修正します。こうした操作を身につけることで、自分で使いこなせるようになります。このガイドはOllamaがすでにインストールされていることを前提としています。まだの場合は、まずお使いのOS向けのインストールガイドから始めてください。指示の書き方をさらに学びたい場合は、プロンプトの基礎を扱うガイドに進んでください。
#自分のマシンに収まるモデルを選択
お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。
- 永久に利用できるオンラインスペース
- PDF + ファイル
- 30日間返金対応
モデルは数ギガバイトのファイルです。グラフィックカードのVRAM、またはMacや専用グラフィックカードのないPCのRAMに収まる必要があります。OllamaのライブラリにあるGemma 4のページには、各バリエーションとそのダウンロードサイズが掲載されています。マシンに対して大きすぎるバリエーションも動作しますが、一部の処理がCPUに回るため、遅くなります。
| ラベル | ダウンロードサイズ | 必要なメモリ容量 |
|---|---|---|
| gemma4:e2b | 4.6 から 7.5 GB | 8GBのマシン |
| gemma4 (e4b、デフォルト) | 6.6 から 9.5 GB | 12GBから16GBのマシン |
| gemma4:12b | 7.7~8.0 GB | 16GB以上のマシン |
| gemma4:26b | 16〜19GB | 24GB以上のカード |
| gemma4:31b | 19から20GB | 24〜32GBのGPUカード、コンテキストは短めに設定 |
右側の列は、私たちが慎重に見積もった値です。上記のサイズに、コンテキスト用のメモリとシステム用の余裕を加えてください。迷った場合は、最も小さいバリエーションを選んでください。小さなモデルから素早く返ってくる応答のほうが、大きなモデルから非常に遅く返ってくる応答よりも多くを学べます。モデルはいつでも変更できます。
#最初のセッションをステップごとに進める
続く8つの手順を確認するには、15分ほど見込んでください。起動から回答の確認までを扱います。各手順は独立しているため、2番目の手順の後で中断し、後で再開できます。セッションを閉じると失われるのは、ターミナルに保存されない会話履歴だけです。
#1. モデルを起動
Ollamaのドキュメントには、モデルを実行する例としてollama run gemma4コマンドが記載されています。初回起動時にはモデルがダウンロードされ、所要時間はモデルのサイズとインターネット接続によって異なります。その後、入力プロンプトが表示され、モデルはメッセージの入力を待ちます。入力するまでは何も起こりません。
#2. 完全な文で話してください
よくある間違いの1つ目は、検索エンジンを使うときのようにキーワードを入力することです。言語モデルは文書を検索するのではなく、テキストの続きを生成します。そのため、背景や期待する結果とともに、何をしてほしいのかを説明してください。
ほぼいつでもうまくいく構成は、タスク、処理するデータ、期待する出力形式です。練習のための課題は4つあります。個人的なメモの要約を依頼すること、キャンセルのメールを3行で書くこと、ファイル内の単語数を数えるPython関数を依頼すること、そして、渡していない文書の内容など、モデルには答えられない質問をすることです。
#3. モデルが知らないことをテストする
最後の演習が最も学びの多いものです。ツールが接続されていない限り、モデルはインターネットも利用者のファイルも参照しません。知っているのは、学習で得た知識と会話のテキストだけです。架空の文書の内容や最近の出来事について尋ね、その反応を観察してみてください。良いモデルは「分かりません」と答えますが、信頼性の低いモデルはもっともらしい回答を作り上げます。この挙動をハルシネーションと呼びます。ここから導かれる原則は、情報が具体的で、新しく、あるいは利用者個人に関わるものであるほど、プロンプトに含めるか、内容を確認する必要があるということです。当サイトのハルシネーションに関するガイドでは、対策を詳しく説明しています。
#4. 最初からやり直さずに修正する
モデルの回答が的外れですか?単に「違います。やり直してください」と入力するだけでは、モデルの理解は深まりません。何が問題で、どのような回答を求めているのかが伝わる具体的な制約を追加してください。
- 長さ
- 箇条書きの項目数、行数、または単語数。
- Ton
- フォーマルな口調、くだけた口調、報道調、教育的な口調。
- 形式
- リスト、テーブル、JSON、メール、コード
- 禁止事項を肯定形で表現する
- 「『こちらです』と言わないでください」よりも、「回答から直接始めてください」という指示を使ってください。
#5. セッションコマンド
セッション中にスラッシュで始まる行はモデルに送信されません。これらは Ollama を制御します。/? コマンドで完全なリストを表示できます。
- /set parameter num_ctx 8192
- セッションのコンテキストサイズを設定します。OllamaのFAQでは、コンテキストウィンドウを変更するためのコマンドとして紹介されています。
- /set system
- システムメッセージを設定し、セッション中ずっと維持される役割を指定します。
- /show info
- ロードされたモデルの情報を表示します:アーキテクチャ、サイズ、コンテキスト長、量子化情報。
- /clear
- モデルをメモリから解放せずに、現在の会話のコンテキストを消去します。
- /bye
- セッションを終了します。Ctrl+Dでも終了できます。
OllamaのFAQによると、セッションを閉じた後も、デフォルトではモデルがメモリに5分間保持されるため、次回の起動が速くなります。すぐにアンロードするには、`ollama stop`の後にモデル名を指定して実行してください。`ollama ps`はロードされているモデルを一覧表示し、GPUとCPUでそれぞれ実行されている割合を示します。
#6. 複数ターンにわたる会話をする
モデルはコンテキストウィンドウ内の内容だけを記憶します。各ターンごとにアプリケーションが全履歴を返すため、相互に依存するリクエストを連続して送ることができます。
制約となるのはコンテキストのサイズです。Ollamaのドキュメントによると、デフォルト値はVRAMが24 GiB未満の場合は約4,000トークン、24〜48 GiBでは32k、それを超える場合は256kです。履歴がウィンドウを超えると、最も古いやり取りが失われます。モデルが長いセッションの冒頭を「忘れる」場合は、num_ctxコマンドでウィンドウを拡大してください。その際、コンテキストの各トークンがメモリを消費することを念頭に置いてください。
#7. コードを要求し、検証する
コードは良い試行錯誤の場です。なぜなら、結果を検証できるからです。言語、入力、期待される出力、制約を指定します。「テキストファイルのパスを受け取り、単語数を返す Python 関数を書いてください。コードのみを返し、その後で説明の一文を付けてください。」コードをファイルにコピーし、答えが既知のケースで実行します。エラーが発生した場合は、エラーメッセージ全体を会話に貼り付け、修正を依頼します。この「依頼、実行、修正」のサイクルは、最初から完璧なコードを要求するよりも効果的です。
#8. 回答を批判的に読みましょう
流暢な回答が正確な回答とは限りません。モデルはもっともらしい文章を生成しますが、検証はしません。回答を使う前に、重要な内容を確認する習慣をつけてください。
- 数字と日付
- 出典と照らし合わせて確認してください。これらは、モデルが最も容易にでっち上げてしまう情報です。
- 名前、参照情報、引用
- 実在するか確認してください。モデルは、もっともらしい書籍のタイトルや法律の条文をでっち上げることがあります。
- コード
- そのコードを信頼する前に実行し、ファイルに対して何を行うのかもコードを読み返して確認してください。
- 一貫性
- 同じ質問を2通りの言い方で尋ねてください。回答が食い違う場合は、どちらも疑ってかかってください。
参照用のテキストを自分で提供し、各主張の根拠となる箇所を引用するようモデルに求める習慣をつけるとよいでしょう。そうすれば、すべてを調べ直す代わりに、数秒で確認できます。
#ターミナルに留まるか、インターフェースに移行するか?
| 経路 | 利点 | 制限 |
|---|---|---|
| ターミナル (ollama run) | 追加のインストールが不要で、初めて試す際に最適です | 履歴が整理されず、長文を扱う際の使い勝手もいまひとつ |
| チャットインターフェース(Open WebUI、LM Studio、Jan) | 履歴、添付ファイル、読みやすいフォーマット | 追加のインストール |
| API(スクリプト) | 自動化、ツールとの統合 | 少しコードを書く必要がある |
まずターミナルで仕組みを理解し、長いテキストを貼り付けたり、過去の会話を見返したくなったりしたら、インターフェースに切り替えてください。両者は併用できます。Ollamaで一度ダウンロードしたモデルは、同じローカルサーバーを使う限りインターフェースからも利用でき、再ダウンロードは不要です。
#何かがうまくいかない場合
| 症状 | 考えられる原因 | 解決策 |
|---|---|---|
| 応答が非常に遅い | モデルの一部の処理がCPUに回っている | ollama psを実行し、その後、より小さいモデルのバリエーションを選ぶか、コンテキストを短くしてください |
| モデルが最初の部分を忘れる | コンテキストウィンドウがいっぱい | num_ctxを増やすか、要約を使って会話をやり直してください |
| 英語での回答 | 英語向けの指示またはモデル | 要求または/set systemに「フランス語で回答してください」と記載してください |
| 事実に基づかない作り話の文章 | プロンプトに含まれていない情報 | 元のテキストを提示し、該当箇所を引用するよう求めてください。 |
| モデルが見つかりません | 不正な名前またはラベル | Ollama ライブラリ内のモデルページで、表記が正しいか確認してください。 |
創造性をより細かく調整するうえで、Ollama の Modelfile ドキュメントは温度の効果を次のようにまとめています。温度が高いほどモデルは創造的になり、低いほど一貫性が高まります。温度と top-p に関するガイドでは、試すとよい値を詳しく説明しています。
#そしてこの最初の会話の後は?
- 永続的な役割
- システムプロンプトに関するガイドでは、モデルに安定したルールを設定する方法を示しています。
- より快適なインターフェース
- Open WebUI または LM Studio は履歴、添付ファイル、読みやすいレイアウトを追加します。
- 自分の文書
- RAGを使えば、毎回ファイルを貼り付けなくても、その内容について質問できます。
初めてLLMに質問するにはどうすればよいですか?+
ローカルモデルと話すためにインターネット接続は必要ですか?+
Ollamaの会話を終了するにはどうすればよいですか?+
モデルが会話の開始部分を忘れる理由は?+
初学者向けにどのモデルを選ぶべきですか?+
モデルは私のファイルやインターネット上の情報を読めますか?+
#さらに詳しく
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。