生成AIの仕組み

事前学習とはLLMが言葉の基礎を身につける段階と、その後の調整

事前学習は、大量の文章から次のトークンを予測する形で、LLMが言語の一般的なパターンを学ぶ段階です。学習データ、自己教師あり学習、必要な計算資源、事前学習後の調整(指示チューニング・RLHF)、データに関する論点を整理します。

公的機関・公式資料などの一次情報と照合して作成しています。このサイトについて

事前学習とは

事前学習(pre-training)は、大規模言語モデル(LLM)を作る最初の大きな段階で、大量の文章データから、言語の一般的なパターンや世界についての知識を学ばせることです。この段階を経たモデルを土台に、追加の調整を行って、対話や特定の作業に使えるようにします(大規模言語モデル(LLM)とは、基盤モデル)。

何を学習するのか

多くのLLMの事前学習では、「文章の次に来るトークンを予測する」という課題が使われます。文章の一部を隠して当てさせる方式もあります。このように、データ自体から正解が作れるため、人間が一つ一つラベルを付ける必要がなく、「自己教師あり学習」と呼ばれます(AI・機械学習・ディープラーニングの違い)。

次のトークンを正確に予測するには、文法、語彙、文脈、事実関係、ある程度の推論の型など、多様な知識が必要になります。そのため、単純な課題から、幅広い能力が獲得されると考えられています。

学習に使われるデータ

データの種類(例) 内容
ウェブ上の文章 多様なウェブページ
書籍・論文 まとまった知識や、長い文脈
プログラムコード コードの書き方・構造
百科事典・ニュース 事実に関する情報
多言語のデータ 複数の言語の能力

データは、重複や品質の低い内容、有害な内容などを除く前処理(フィルタリング)を経て使われます。データの具体的な内訳は、モデルによって公開の程度が異なります。

必要な計算資源

事前学習には、大量のデータと、多数のGPUなどの計算資源、長い時間が必要です。モデルの規模(パラメータ数)、データ量、計算量を増やすほど性能が向上するという「スケーリング則」の傾向が、研究で報告されています(Kaplan et al., 2020 など)(パラメータ数とモデルサイズ)。そのため、最先端のモデルの事前学習を行える主体は限られます。

事前学習のあとに行う調整

事前学習だけを終えたモデルは、「文章の続きを書く」ことは得意でも、ユーザーの指示に従って会話するようには作られていません。そこで、次のような追加の調整が行われます。

段階 内容
指示チューニング(教師ありファインチューニング) 「指示と望ましい回答」の例で追加学習し、指示に従えるようにする(ファインチューニングの考え方)
人間のフィードバックによる強化学習(RLHF)など 人間の好みや安全性の基準に沿うよう、回答の質を調整する(RLHF(人間のフィードバックによる強化学習))
安全性の調整 有害な依頼に適切に断れるようにする

対話型AIが丁寧に応答できるのは、この調整の成果です。

事前学習に関する論点

論点 内容
著作権・データの権利 学習データに含まれる著作物の扱い(AIと著作権(日本))
個人情報 学習データ内の個人情報の扱い
偏り データの偏りがモデルの出力に反映される(AIのバイアスと公平性)
知識の古さ 学習データの時点以降の情報は含まれない(知識のカットオフ)
環境負荷 大規模な計算に伴うエネルギー消費

利用者として知っておきたいこと

  • モデルの知識は、学習データの時点で止まっている。最新情報は検索や資料の提供で補う。
  • モデルの得意・不得意は、学習データの性質に左右される(日本語の量、専門分野の量など)。
  • 事前学習を自分で行うことは通常なく、既存のモデルを利用・調整するのが一般的。

事前学習のFAQ(よくある質問)

Q. 事前学習とファインチューニングの違いは?
A. 事前学習は大規模データで一般的な能力を学ぶ段階、ファインチューニングは、それを特定の目的に合わせて追加調整する段階です。

Q. 個人や企業が事前学習を行えますか?
A. 小規模なモデルなら可能ですが、最先端の大規模モデルは膨大な資源が必要で、現実的には限られます。

Q. 入力した内容は、事前学習に使われますか?
A. サービスや契約により異なります。利用規約と設定を確認してください(学習へのデータ利用とオプトアウト)。

利用者への実務的な示唆

事前学習の仕組みを知っておくと、次のような判断がしやすくなります。

  • 日本語の専門的な内容で精度が低いときは、学習データ中の量が少ない可能性があり、資料を与えて補うと改善することがあります。
  • 最近の出来事に弱いのは、学習時点で知識が止まっているためで、検索や資料の提供で補えます。
  • 回答の文体や丁寧さが安定しているのは、事前学習後の調整の成果であり、事実の正確さとは別の性質です。

「得意・不得意の理由」が分かると、AIへの頼み方を、状況に合わせて変えられるようになります。

筆者の見解(事前学習)

事前学習は、「AIが大量の読書を通じて教養を身につける段階」であり、利用者から直接見えないところで、品質の大きな部分が決まる段階だと筆者は捉えています。だからこそ、モデルを選ぶときは、性能だけでなく、どのようなデータでどう学習・調整されたか(透明性)にも目を向ける価値があると考えます。

事前学習の関連項目

出典(一次情報)

本記事は一般的な情報の提供を目的としています。AIのサービス・機能・料金・仕様は頻繁に更新されるため、最新の内容は各社の公式ドキュメントでご確認ください。「筆者の見解」は一つの考え方です。