生成AIの仕組み

Transformerとは現在のLLMの土台となるモデル構造をやさしく解説

Transformerは、2017年に提案された、アテンション機構を中心にしたニューラルネットワークの構造です。従来のRNNとの違い、エンコーダ・デコーダ、GPTのようなデコーダ型、並列処理のしやすさ、現在の生成AIへの影響を整理します。

公的機関・公式資料などの一次情報と照合して作成しています。このサイトについて

Transformerとは

Transformer(トランスフォーマー)は、2017年に Google の研究者らが論文「Attention Is All You Need」で提案した、アテンション(注意)機構を中心に据えたニューラルネットワークの構造です。もともとは機械翻訳のために提案されましたが、文章の理解・生成で高い性能を示し、現在の大規模言語モデル(LLM)のほとんどの土台になっています(大規模言語モデル(LLM)とは)。画像や音声の処理にも応用されています。

登場以前:RNNの課題

Transformer以前、文章の処理には、RNN(再帰型ニューラルネットワーク)やその改良版が主に使われていました。RNNは単語を先頭から1つずつ順番に処理します。

課題 内容
並列処理しにくい 前の単語の処理が終わらないと次に進めず、学習に時間がかかる
長い文脈の保持が難しい 文章が長いと、最初のほうの情報が薄れやすい

Transformerの特徴

特徴 内容
アテンション機構 文章中の各単語が、他のどの単語にどれだけ注目するかを計算する(アテンション機構)
並列処理 文章全体を一度に処理でき、GPUでの学習に向いている
長距離の関係を捉えやすい 離れた単語同士の関係も直接結びつけられる
位置の情報 語順を表す情報(位置エンコーディング)を別途加える
規模の拡大に強い 層やパラメータを増やすほど性能が向上する傾向(パラメータ数とモデルサイズ)

基本的な構成

要素 役割
入力の埋め込み トークンを数値のベクトルに変換する(埋め込み(Embedding))
セルフアテンション層 文脈内の各トークン同士の関係を計算する
フィードフォワード層 各トークンの表現を非線形に変換する
層の積み重ね これらを何層も重ねる(元の論文では6層、大規模なLLMでは数十層以上)
出力層 次のトークンの確率を計算する

エンコーダとデコーダ

元の論文のTransformerは、入力を読み取るエンコーダと、出力を生成するデコーダの組み合わせでした。その後、用途に応じた派生が生まれました。

型 特徴 例
エンコーダのみ 文章の理解(分類・検索)に向く BERT系
デコーダのみ 次のトークンを予測し、文章を生成する GPT系などの、多くの対話型LLM
エンコーダ・デコーダ 翻訳・要約など、入力から別の文章を作る T5系

現在の対話型AIの多くは、デコーダのみの構造を採用しているとされています。

生成AIへの影響

Transformerは、大量のデータで事前学習し、規模を大きくするほど能力が伸びるという開発の流れを後押ししました(事前学習)。この流れが、多様な課題を一つのモデルで扱う基盤モデルの考え方につながっています(基盤モデル)。

具体例:文脈によって意味が変わる

英語の “bank” は、”walked along the river bank”(川の土手を歩いた)と “deposited money in the bank”(銀行に預金した)で意味が異なります。アテンション機構は、周囲の “river”(川)や “deposited”(預金した)などの単語との関係から、”bank” がどちらの意味かを文脈に応じて判断する手がかりを作ります。Transformerは、このような文脈依存の意味を、文章全体を見渡して捉えられる点が強みです。

課題

課題 内容
計算量 文章が長いほどアテンションの計算量が増える(長文対応の工夫が続けられている)
メモリ 長い文脈や大規模なモデルは、多くのメモリを必要とする
解釈の難しさ 内部の動きが人間には分かりにくい

TransformerのFAQ(よくある質問)

Q. Transformerと映画のトランスフォーマーは関係ありますか?
A. 関係はありません。「変換する」という意味の言葉から名付けられたとされます。

Q. Transformerを理解するのに、数学は必要ですか?
A. 使うだけなら不要です。仕組みを深く理解するには線形代数や確率の基礎が役立ちます。

Q. 今後もTransformerが主流ですか?
A. 現時点では主流ですが、計算効率を改善する新しい構造の研究も進んでいます。

学習を進めるときのおすすめ

Transformerを学ぶときは、数式から入るよりも、次の順に進めると理解しやすくなります。

  1. 「文脈の中の、どの言葉に注目するか」というアテンションの考え方を、例文で確かめる。
  2. 層を重ねると、より複雑な関係を捉えられることを知る。
  3. 余裕があれば、原論文や、図解付きの解説記事(The Illustrated Transformer など)を読む。

細部を理解しきれなくても、「文脈全体を見て、重要な部分を拾う」という骨格をつかんでおくだけで、プロンプトを工夫するときの発想が広がります。

筆者の見解(Transformer)

Transformerは、AIの歴史の中で「ある発明が、一つの時代の標準になる」ことを体現した技術だと思います。仕組みの細部を完全に理解する必要はありませんが、「文脈全体を見渡して、重要な部分に注目する」という発想を知っておくと、LLMの得意・不得意(長い文脈の扱い、離れた情報の参照など)を理解しやすくなります。

Transformerの関連項目

出典(一次情報)

本記事は一般的な情報の提供を目的としています。AIのサービス・機能・料金・仕様は頻繁に更新されるため、最新の内容は各社の公式ドキュメントでご確認ください。「筆者の見解」は一つの考え方です。