事前学習とはLLMが言葉の基礎を身につける段階と、その後の調整
事前学習は、大量の文章から次のトークンを予測する形で、LLMが言語の一般的なパターンを学ぶ段階です。学習データ、自己教師あり学習、必要な計算資源、事前学習後の調整(指示チューニング・RLHF)、データに関する論点を整理します。
公的機関・公式資料などの一次情報と照合して作成しています。このサイトについて
事前学習とは
事前学習(pre-training)は、大規模言語モデル(LLM)を作る最初の大きな段階で、大量の文章データから、言語の一般的なパターンや世界についての知識を学ばせることです。この段階を経たモデルを土台に、追加の調整を行って、対話や特定の作業に使えるようにします(大規模言語モデル(LLM)とは、基盤モデル)。
何を学習するのか
多くのLLMの事前学習では、「文章の次に来るトークンを予測する」という課題が使われます。文章の一部を隠して当てさせる方式もあります。このように、データ自体から正解が作れるため、人間が一つ一つラベルを付ける必要がなく、「自己教師あり学習」と呼ばれます(AI・機械学習・ディープラーニングの違い)。
次のトークンを正確に予測するには、文法、語彙、文脈、事実関係、ある程度の推論の型など、多様な知識が必要になります。そのため、単純な課題から、幅広い能力が獲得されると考えられています。
学習に使われるデータ
| データの種類(例) | 内容 |
|---|---|
| ウェブ上の文章 | 多様なウェブページ |
| 書籍・論文 | まとまった知識や、長い文脈 |
| プログラムコード | コードの書き方・構造 |
| 百科事典・ニュース | 事実に関する情報 |
| 多言語のデータ | 複数の言語の能力 |
データは、重複や品質の低い内容、有害な内容などを除く前処理(フィルタリング)を経て使われます。データの具体的な内訳は、モデルによって公開の程度が異なります。
必要な計算資源
事前学習には、大量のデータと、多数のGPUなどの計算資源、長い時間が必要です。モデルの規模(パラメータ数)、データ量、計算量を増やすほど性能が向上するという「スケーリング則」の傾向が、研究で報告されています(Kaplan et al., 2020 など)(パラメータ数とモデルサイズ)。そのため、最先端のモデルの事前学習を行える主体は限られます。
事前学習のあとに行う調整
事前学習だけを終えたモデルは、「文章の続きを書く」ことは得意でも、ユーザーの指示に従って会話するようには作られていません。そこで、次のような追加の調整が行われます。
| 段階 | 内容 |
|---|---|
| 指示チューニング(教師ありファインチューニング) | 「指示と望ましい回答」の例で追加学習し、指示に従えるようにする(ファインチューニングの考え方) |
| 人間のフィードバックによる強化学習(RLHF)など | 人間の好みや安全性の基準に沿うよう、回答の質を調整する(RLHF(人間のフィードバックによる強化学習)) |
| 安全性の調整 | 有害な依頼に適切に断れるようにする |
対話型AIが丁寧に応答できるのは、この調整の成果です。
事前学習に関する論点
| 論点 | 内容 |
|---|---|
| 著作権・データの権利 | 学習データに含まれる著作物の扱い(AIと著作権(日本)) |
| 個人情報 | 学習データ内の個人情報の扱い |
| 偏り | データの偏りがモデルの出力に反映される(AIのバイアスと公平性) |
| 知識の古さ | 学習データの時点以降の情報は含まれない(知識のカットオフ) |
| 環境負荷 | 大規模な計算に伴うエネルギー消費 |
利用者として知っておきたいこと
- モデルの知識は、学習データの時点で止まっている。最新情報は検索や資料の提供で補う。
- モデルの得意・不得意は、学習データの性質に左右される(日本語の量、専門分野の量など)。
- 事前学習を自分で行うことは通常なく、既存のモデルを利用・調整するのが一般的。
事前学習のFAQ(よくある質問)
Q. 事前学習とファインチューニングの違いは?
A. 事前学習は大規模データで一般的な能力を学ぶ段階、ファインチューニングは、それを特定の目的に合わせて追加調整する段階です。
Q. 個人や企業が事前学習を行えますか?
A. 小規模なモデルなら可能ですが、最先端の大規模モデルは膨大な資源が必要で、現実的には限られます。
Q. 入力した内容は、事前学習に使われますか?
A. サービスや契約により異なります。利用規約と設定を確認してください(学習へのデータ利用とオプトアウト)。
利用者への実務的な示唆
事前学習の仕組みを知っておくと、次のような判断がしやすくなります。
- 日本語の専門的な内容で精度が低いときは、学習データ中の量が少ない可能性があり、資料を与えて補うと改善することがあります。
- 最近の出来事に弱いのは、学習時点で知識が止まっているためで、検索や資料の提供で補えます。
- 回答の文体や丁寧さが安定しているのは、事前学習後の調整の成果であり、事実の正確さとは別の性質です。
「得意・不得意の理由」が分かると、AIへの頼み方を、状況に合わせて変えられるようになります。
筆者の見解(事前学習)
事前学習は、「AIが大量の読書を通じて教養を身につける段階」であり、利用者から直接見えないところで、品質の大きな部分が決まる段階だと筆者は捉えています。だからこそ、モデルを選ぶときは、性能だけでなく、どのようなデータでどう学習・調整されたか(透明性)にも目を向ける価値があると考えます。
事前学習の関連項目
出典(一次情報)
本記事は一般的な情報の提供を目的としています。AIのサービス・機能・料金・仕様は頻繁に更新されるため、最新の内容は各社の公式ドキュメントでご確認ください。「筆者の見解」は一つの考え方です。