初心者 10 分Prompting

あなたの最初の会話 locale

端的な回答

ローカルLLMにクエリを送るには、ollama runでモデルを起動し、処理対象のテキストを含む完全なリクエストを1、2文で入力し、回答を読み取った後、最初からやり直すのではなく、具体的な指示で修正します。入力した内容はすべてあなたのマシンから外に出ません。約15分で、要約、メール作成、コードの作成を行い、失敗した回答を修正する方法を理解できます。

Ollamaのインストールが済み、目の前でカーソルが点滅しています。この初日のチュートリアルでは、実際にモデルと会話しながら、マシンのメモリ容量に合ったモデルを起動する方法、効果的な依頼の仕方、セッションコマンドの使い方、モデルの応答が的外れになったときの見分け方、そしてコンテキストやメモリに関する落とし穴を避ける方法を学びます。

著者 Mohamed Meguedmi·更新 2026-09-30·Windows・macOS・Linuxでテスト済み

#このチュートリアルで学べること

これから、要約を依頼し、メールを書いてもらい、短いスクリプトを生成してもらい、モデルの対応範囲外の質問を試し、最後に意図と違う方向に進んだ回答を修正します。こうした操作を身につけることで、自分で使いこなせるようになります。このガイドはOllamaがすでにインストールされていることを前提としています。まだの場合は、まずお使いのOS向けのインストールガイドから始めてください。指示の書き方をさらに学びたい場合は、プロンプトの基礎を扱うガイドに進んでください。

#自分のマシンに収まるモデルを選択

ローカルAIキット

お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 30日間返金対応

モデルは数ギガバイトのファイルです。グラフィックカードのVRAM、またはMacや専用グラフィックカードのないPCのRAMに収まる必要があります。OllamaのライブラリにあるGemma 4のページには、各バリエーションとそのダウンロードサイズが掲載されています。マシンに対して大きすぎるバリエーションも動作しますが、一部の処理がCPUに回るため、遅くなります。

OllamaライブラリのGemma 4の各バリエーション(サイズはOllamaの表示値)
ラベルダウンロードサイズ必要なメモリ容量
gemma4:e2b4.6 から 7.5 GB8GBのマシン
gemma4 (e4b、デフォルト)6.6 から 9.5 GB12GBから16GBのマシン
gemma4:12b7.7~8.0 GB16GB以上のマシン
gemma4:26b16〜19GB24GB以上のカード
gemma4:31b19から20GB24〜32GBのGPUカード、コンテキストは短めに設定

右側の列は、私たちが慎重に見積もった値です。上記のサイズに、コンテキスト用のメモリとシステム用の余裕を加えてください。迷った場合は、最も小さいバリエーションを選んでください。小さなモデルから素早く返ってくる応答のほうが、大きなモデルから非常に遅く返ってくる応答よりも多くを学べます。モデルはいつでも変更できます。

#最初のセッションをステップごとに進める

続く8つの手順を確認するには、15分ほど見込んでください。起動から回答の確認までを扱います。各手順は独立しているため、2番目の手順の後で中断し、後で再開できます。セッションを閉じると失われるのは、ターミナルに保存されない会話履歴だけです。

#1. モデルを起動

初回起動
ollama run gemma4:e2b

Ollamaのドキュメントには、モデルを実行する例としてollama run gemma4コマンドが記載されています。初回起動時にはモデルがダウンロードされ、所要時間はモデルのサイズとインターネット接続によって異なります。その後、入力プロンプトが表示され、モデルはメッセージの入力を待ちます。入力するまでは何も起こりません。

i
メッセージは手元のマシンに留まります
OllamaのFAQには、モデルをローカルで実行する場合、Ollamaはプロンプトもデータも見ることができないと記載されています。クラウドモデルにはこれは当てはまりません。メッセージが提供元のサーバーに送信されるためです。モデル名がcloudで終わっていないことを確認してください。

#2. 完全な文で話してください

よくある間違いの1つ目は、検索エンジンを使うときのようにキーワードを入力することです。言語モデルは文書を検索するのではなく、テキストの続きを生成します。そのため、背景や期待する結果とともに、何をしてほしいのかを説明してください。

曖昧な依頼から、必要な情報をすべて含む依頼へ
# Trop vague
résumer réunion points importants

# Précis
Voici des notes de réunion. Résume-les en 5 puces : d'abord les décisions
prises, puis les actions à faire avec leur responsable.

Notes :
- Alice propose de migrer vers Postgres d'ici juin
- Bob rappelle qu'il faut finir l'audit sécurité avant
- Décision : on migre, mais l'audit passe avant (fin mai)
- Charles s'occupe de l'audit
- Alice s'occupe de la migration

ほぼいつでもうまくいく構成は、タスク、処理するデータ、期待する出力形式です。練習のための課題は4つあります。個人的なメモの要約を依頼すること、キャンセルのメールを3行で書くこと、ファイル内の単語数を数えるPython関数を依頼すること、そして、渡していない文書の内容など、モデルには答えられない質問をすることです。

#3. モデルが知らないことをテストする

最後の演習が最も学びの多いものです。ツールが接続されていない限り、モデルはインターネットも利用者のファイルも参照しません。知っているのは、学習で得た知識と会話のテキストだけです。架空の文書の内容や最近の出来事について尋ね、その反応を観察してみてください。良いモデルは「分かりません」と答えますが、信頼性の低いモデルはもっともらしい回答を作り上げます。この挙動をハルシネーションと呼びます。ここから導かれる原則は、情報が具体的で、新しく、あるいは利用者個人に関わるものであるほど、プロンプトに含めるか、内容を確認する必要があるということです。当サイトのハルシネーションに関するガイドでは、対策を詳しく説明しています。

#4. 最初からやり直さずに修正する

モデルの回答が的外れですか?単に「違います。やり直してください」と入力するだけでは、モデルの理解は深まりません。何が問題で、どのような回答を求めているのかが伝わる具体的な制約を追加してください。

要点を絞った追加の問いかけ
Refais, mais en 3 puces maximum et sans jargon technique.
Chaque puce doit tenir sur une ligne.
長さ
箇条書きの項目数、行数、または単語数。
Ton
フォーマルな口調、くだけた口調、報道調、教育的な口調。
形式
リスト、テーブル、JSON、メール、コード
禁止事項を肯定形で表現する
「『こちらです』と言わないでください」よりも、「回答から直接始めてください」という指示を使ってください。

#5. セッションコマンド

セッション中にスラッシュで始まる行はモデルに送信されません。これらは Ollama を制御します。/? コマンドで完全なリストを表示できます。

/set parameter num_ctx 8192
セッションのコンテキストサイズを設定します。OllamaのFAQでは、コンテキストウィンドウを変更するためのコマンドとして紹介されています。
/set system
システムメッセージを設定し、セッション中ずっと維持される役割を指定します。
/show info
ロードされたモデルの情報を表示します:アーキテクチャ、サイズ、コンテキスト長、量子化情報。
/clear
モデルをメモリから解放せずに、現在の会話のコンテキストを消去します。
/bye
セッションを終了します。Ctrl+Dでも終了できます。

OllamaのFAQによると、セッションを閉じた後も、デフォルトではモデルがメモリに5分間保持されるため、次回の起動が速くなります。すぐにアンロードするには、`ollama stop`の後にモデル名を指定して実行してください。`ollama ps`はロードされているモデルを一覧表示し、GPUとCPUでそれぞれ実行されている割合を示します。

#6. 複数ターンにわたる会話をする

モデルはコンテキストウィンドウ内の内容だけを記憶します。各ターンごとにアプリケーションが全履歴を返すため、相互に依存するリクエストを連続して送ることができます。

3ターン続ける
Je dois écrire un courriel pour annuler une réservation au restaurant.
Fais-le en 3 lignes, poli mais pas guindé.

[réponse du modèle]

Bien. Refais la même, mais plus chaleureuse, et précise que je
reprogrammerai dans 15 jours.

[réponse du modèle]

Parfait. Traduis-la en anglais.

制約となるのはコンテキストのサイズです。Ollamaのドキュメントによると、デフォルト値はVRAMが24 GiB未満の場合は約4,000トークン、24〜48 GiBでは32k、それを超える場合は256kです。履歴がウィンドウを超えると、最も古いやり取りが失われます。モデルが長いセッションの冒頭を「忘れる」場合は、num_ctxコマンドでウィンドウを拡大してください。その際、コンテキストの各トークンがメモリを消費することを念頭に置いてください。

#7. コードを要求し、検証する

コードは良い試行錯誤の場です。なぜなら、結果を検証できるからです。言語、入力、期待される出力、制約を指定します。「テキストファイルのパスを受け取り、単語数を返す Python 関数を書いてください。コードのみを返し、その後で説明の一文を付けてください。」コードをファイルにコピーし、答えが既知のケースで実行します。エラーが発生した場合は、エラーメッセージ全体を会話に貼り付け、修正を依頼します。この「依頼、実行、修正」のサイクルは、最初から完璧なコードを要求するよりも効果的です。

#8. 回答を批判的に読みましょう

流暢な回答が正確な回答とは限りません。モデルはもっともらしい文章を生成しますが、検証はしません。回答を使う前に、重要な内容を確認する習慣をつけてください。

数字と日付
出典と照らし合わせて確認してください。これらは、モデルが最も容易にでっち上げてしまう情報です。
名前、参照情報、引用
実在するか確認してください。モデルは、もっともらしい書籍のタイトルや法律の条文をでっち上げることがあります。
コード
そのコードを信頼する前に実行し、ファイルに対して何を行うのかもコードを読み返して確認してください。
一貫性
同じ質問を2通りの言い方で尋ねてください。回答が食い違う場合は、どちらも疑ってかかってください。

参照用のテキストを自分で提供し、各主張の根拠となる箇所を引用するようモデルに求める習慣をつけるとよいでしょう。そうすれば、すべてを調べ直す代わりに、数秒で確認できます。

#ターミナルに留まるか、インターフェースに移行するか?

ローカルモデルと対話する3つの方法
経路利点制限
ターミナル (ollama run)追加のインストールが不要で、初めて試す際に最適です履歴が整理されず、長文を扱う際の使い勝手もいまひとつ
チャットインターフェース(Open WebUI、LM Studio、Jan)履歴、添付ファイル、読みやすいフォーマット追加のインストール
API(スクリプト)自動化、ツールとの統合少しコードを書く必要がある

まずターミナルで仕組みを理解し、長いテキストを貼り付けたり、過去の会話を見返したくなったりしたら、インターフェースに切り替えてください。両者は併用できます。Ollamaで一度ダウンロードしたモデルは、同じローカルサーバーを使う限りインターフェースからも利用でき、再ダウンロードは不要です。

#何かがうまくいかない場合

よく見られる症状とその解決策
症状考えられる原因解決策
応答が非常に遅いモデルの一部の処理がCPUに回っているollama psを実行し、その後、より小さいモデルのバリエーションを選ぶか、コンテキストを短くしてください
モデルが最初の部分を忘れるコンテキストウィンドウがいっぱいnum_ctxを増やすか、要約を使って会話をやり直してください
英語での回答英語向けの指示またはモデル要求または/set systemに「フランス語で回答してください」と記載してください
事実に基づかない作り話の文章プロンプトに含まれていない情報元のテキストを提示し、該当箇所を引用するよう求めてください。
モデルが見つかりません不正な名前またはラベルOllama ライブラリ内のモデルページで、表記が正しいか確認してください。

創造性をより細かく調整するうえで、Ollama の Modelfile ドキュメントは温度の効果を次のようにまとめています。温度が高いほどモデルは創造的になり、低いほど一貫性が高まります。温度と top-p に関するガイドでは、試すとよい値を詳しく説明しています。

#そしてこの最初の会話の後は?

永続的な役割
システムプロンプトに関するガイドでは、モデルに安定したルールを設定する方法を示しています。
より快適なインターフェース
Open WebUI または LM Studio は履歴、添付ファイル、読みやすいレイアウトを追加します。
自分の文書
RAGを使えば、毎回ファイルを貼り付けなくても、その内容について質問できます。
FAQ
初めてLLMに質問するにはどうすればよいですか?+
ollama run の後にモデル名を指定してモデルを起動し、入力プロンプトが表示されるまで待ってから、タスク、処理対象のテキスト、期待する形式を含む完整な依頼を入力してください。回答を読み、最初からやり直すのではなく、具体的な指示で修正してください。数回やり取りすれば、モデルに何ができるかを理解できます。
ローカルモデルと話すためにインターネット接続は必要ですか?+
インターネット接続が必要なのは、モデルをダウンロードするときだけです。その後の会話は、接続なしでご自身のマシン上で行われます。OllamaのFAQでは、モデルをローカルで実行する場合、Ollamaはプロンプトもデータも見ることがないと明記されています。一方、名前にcloudという接尾辞が付いたモデルはリモートサーバー上で動作するため、接続が必要です。
Ollamaの会話を終了するにはどうすればよいですか?+
/bye を入力するか、Ctrl+D を使用してセッションを閉じます。デフォルトでは、モデルはメモリに5分間保持され、次の起動が高速化されます。すぐにアンロードするには、ollama stop にモデル名を続けて実行し、ollama ps でまだ読み込まれているものを確認してください。
モデルが会話の開始部分を忘れる理由は?+
会話履歴がコンテキストウィンドウを超えているためです。Ollamaは、VRAMが24 GiB未満の場合、デフォルトで約4,000トークンを使用します。セッション内で /set parameter num_ctx を使って値を増やし、モデルが引き続きGPUに収まることを確認してください。または、会話を要約してから続けてください。
初学者向けにどのモデルを選ぶべきですか?+
試したいモデルファミリーの中から、メモリ容量に収まり、十分な品質を備えた最小のモデルを選んでください。応答が速いモデルを使うほうが、非常に遅い大規模モデルを使うよりも多くを学べます。メモリが8GBの場合、Gemma 4のe2b版の容量は約4.6〜7.5GBです。品質に満足できなければ、その後でモデルのサイズを大きくしてください。
モデルは私のファイルやインターネット上の情報を読めますか?+
初期状態ではできません。モデルが知っているのは、学習で得た知識と会話のテキストだけです。自分のドキュメントを読ませたり、ウェブを検索させたりするには、ツールを接続する必要があります。たとえば、RAGやウェブ検索を備えたOpen WebUIのようなインターフェースを使います。それ以外の場合は、テキストをプロンプトに貼り付けてください。

#さらに詳しく

このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。