生成AIの仕組み
18 項目
生成AIの仕組みとは|このカテゴリで分かること
「生成AIの仕組み」は、ChatGPTやClaudeのようなLLM(大規模言語モデル)が、どうやって文章を作っているのかを理解するためのカテゴリです。数式は使わず、「なぜ長い資料を渡すと精度が落ちるのか」「なぜもっともらしい嘘をつくのか」といった、使う人が実際に困る場面と結びつけて説明します。
対象は、生成AIをある程度使い始めた人と、APIや業務への組み込みを検討している人です。トークン、Transformer、事前学習、コンテキストウィンドウ、温度などの用語がつながり、ハルシネーション対策を自分で考えられるところまでを目指します。
読む順番(おすすめの順路)
- トークンとは|AIが文章を数える単位・文字数との違い・料金と上限への影響 … AIが文章を数える単位。上限・料金・速度のすべてに関わる最重要の基礎です。
- 日本語とトークン数|日本語が英語よりトークンを多く使う理由と費用・上限への影響 … 日本語は英語よりトークンを使いやすい理由を知り、費用感をつかみます。
- Transformerとは|現在のLLMの土台となるモデル構造をやさしく解説 … 今のLLMの土台となる構造を、全体像だけ押さえます。
- アテンション機構とは|文脈のどこに注目するかを計算する仕組み … Transformerの中心である「どこに注目するか」の仕組みを理解します。
- 事前学習とは|LLMが言葉の基礎を身につける段階と、その後の調整 … 大量の文章で言葉の基礎を身につける段階。性格づけの前の土台です。
- RLHF(人間のフィードバックによる強化学習)とは|AIを人に役立つ回答へ導く調整手法 … 人のフィードバックで「役に立つ回答」に調整する段階を知ります。
- ファインチューニングの考え方|追加学習で何が変わるか・RAGやプロンプトとの使い分け … 追加学習とRAG・プロンプトの使い分けを整理します。
- パラメータ数とモデルサイズ|「70B」「8B」の意味と性能・必要メモリの関係 … 「70B」などの数字の意味と、性能・必要メモリの関係を押さえます。
- MoE(専門家混合)とは|巨大モデルを効率よく動かす仕組みと注意点 … 巨大モデルを効率よく動かす工夫を知り、モデル名の見方を広げます。
- 推論(インファレンス)とは|学習済みAIが回答を作る処理と速度・費用の関係 … 学習済みモデルが回答を作る処理と、速度・費用の関係を理解します。
- コンテキストウィンドウとは|AIが一度に扱える情報量の上限と付き合い方 … 一度に扱える量の上限。長い会話や資料で品質が落ちる理由がわかります。
- temperature(温度)とは|AIの回答のランダムさを調整する設定とサンプリング … 回答のランダムさを決める設定。創作と事実確認で使い分けます。
- top_p・top_kとは|次のトークンの候補を絞るサンプリング設定の使い方 … 温度とセットで出てくるサンプリング設定を補足します。
- 推論モデル(思考するAI)とは|答える前に考えるLLMの仕組みと使いどころ … 答える前に考えるモデルの仕組みと、使いどころを知ります。
- 埋め込み(Embedding)とは|文章を数値ベクトルで表して意味の近さを測る技術 … 文章を数値で表す技術。検索やRAGを学ぶ前の準備になります。
- 拡散モデルとは|ノイズから画像を作る生成AIの仕組みと代表的な応用 … 画像生成AIの仕組み。文章系との違いを比べられます。
- 知識のカットオフとは|AIが知らない最新情報への対処法 … AIが最新情報を知らない理由と対処法を確認します。
- ハルシネーションとは|AIがもっともらしい嘘を出す理由と見抜き方・減らし方 … もっともらしい誤りが生まれる理由を、ここまでの知識でまとめて理解します。
- ハルシネーション対策|誤りを減らす方法と確認の手順 … 最後に、誤りを減らす工夫と確認の手順を実践に落とし込みます。
押さえておきたいポイント(リサーチ)
原典と公式ドキュメントで確認できた事実です。モデルの仕様は頻繁に更新されるため、最新は公式で確認してください。
| 項目 | 確認できた内容 |
|---|---|
| Transformerの登場 | 2017年6月の論文「Attention Is All You Need」で提案。再帰や畳み込みを使わず、アテンションの仕組みだけで構成するモデル |
| コンテキストウィンドウの定義 | Anthropicのドキュメントでは「回答を生成するときにモデルが参照できるすべてのテキスト(回答そのものを含む)」と説明。学習データとは別の「作業用の記憶」にあたる |
| 長ければよいわけではない | 同ドキュメントは、トークン数が増えると正確さや想起が落ちる現象(context rot)に触れ、何を入れるかの選別が重要だとしている |
| 思考のトークン | 拡張思考(thinking)のトークンも上限に数えられ、出力トークンとして課金されると説明されている |
| サンプリング設定 | Googleのプロンプト設計ガイドは、temperature・topK・topP・最大トークン数の役割を説明し、温度が低いほど決定的、高いほど多様な結果になりやすいとしている。一方でGemini 3系のモデルでは既定値のまま使うことを強く推奨し、温度を1.0より下げるとループや性能低下が起きうると注意している |
よくある疑問
Q. 生成AIはどうやって文章を作っているのですか? A. 直前までの文脈から「次に来そうなトークン」を確率的に選ぶ処理を繰り返しています。入口はトークンとは|AIが文章を数える単位・文字数との違い・料金と上限への影響、構造はTransformerとは|現在のLLMの土台となるモデル構造をやさしく解説で解説しています。
Q. ハルシネーション対策として、まず何をすればよいですか? A. 根拠となる資料を渡し、「資料にない場合は分からないと答えて」と指示し、数字・固有名詞は一次情報で照合することです。手順はハルシネーション対策|誤りを減らす方法と確認の手順にまとめています。
Q. 長い資料を渡すと、途中の内容を無視されるのはなぜ? A. 一度に扱える量に上限があり、量が増えるほど注意が分散しやすいためです。コンテキストウィンドウとは|AIが一度に扱える情報量の上限と付き合い方を参照してください。
Q. 温度は低いほうが正確になりますか? A. ばらつきは減りますが、正しさを保証するものではありません。モデルによっては既定値のまま使うよう推奨されているため、各社の公式ドキュメントも確認してください。temperature(温度)とは|AIの回答のランダムさを調整する設定とサンプリングで使い分けを説明しています。
編集部の見解
生成AIの仕組みは、研究者のように数式で理解する必要はなく、「トークン」「上限」「確率で選ぶ」の3つがつながれば、日々の使い方は大きく変わると考えます。特にハルシネーションは「AIの欠陥」ではなく、次の言葉を確率で選ぶ仕組みから自然に生じる性質と捉えるほうが、対策を立てやすいと考えます。つまずきやすいのは、TransformerやMoEなどの専門用語に深入りしすぎて、実務との接点を見失うことです。まずはトークンとは|AIが文章を数える単位・文字数との違い・料金と上限への影響とコンテキストウィンドウとは|AIが一度に扱える情報量の上限と付き合い方を押さえ、困った場面が出てきたら該当する記事に戻る、という往復の学び方をおすすめします。
出典(一次情報)
生成AIの仕組みの項目一覧
- トークンとは|AIが文章を数える単位・文字数との違い・料金と上限への影響トークンは、生成AIが文章を扱うときの最小の単位です。文字数や単語数との違い、日本語と英語での数え方の差、入力・出力の上限と料金への影響、ト…
- Transformerとは|現在のLLMの土台となるモデル構造をやさしく解説Transformerは、2017年に提案された、アテンション機構を中心にしたニューラルネットワークの構造です。従来のRNNとの違い、エンコ…
- アテンション機構とは|文脈のどこに注目するかを計算する仕組みアテンション機構は、文章中の各単語が他のどの単語にどれだけ注目すべきかを計算する仕組みです。Query・Key・Valueの考え方、セルフア…
- 事前学習とは|LLMが言葉の基礎を身につける段階と、その後の調整事前学習は、大量の文章から次のトークンを予測する形で、LLMが言語の一般的なパターンを学ぶ段階です。学習データ、自己教師あり学習、必要な計算…
- ファインチューニングの考え方|追加学習で何が変わるか・RAGやプロンプトとの使い分けファインチューニングは、学習済みモデルに追加のデータで再学習を行い、振る舞いや出力の形式を調整する手法です。目的、メリットと限界、必要なデー…
- RLHF(人間のフィードバックによる強化学習)とは|AIを人に役立つ回答へ導く調整手法RLHFは、人間の評価をもとにLLMの回答を好ましい方向へ調整する手法です。報酬モデル・強化学習の流れ、指示追従や安全性への効果、課題(評価…
- コンテキストウィンドウとは|AIが一度に扱える情報量の上限と付き合い方コンテキストウィンドウは、LLMが一度に参照できる入力と出力の合計量の上限です。トークンとの関係、会話が長くなると起こること、長文を扱う際の…
- temperature(温度)とは|AIの回答のランダムさを調整する設定とサンプリングtemperatureは、LLMが次のトークンを選ぶときのランダムさを調整する設定値です。低い値と高い値での出力の違い、サンプリングの仕組み…
- top_p・top_kとは|次のトークンの候補を絞るサンプリング設定の使い方top_p(nucleus sampling)とtop_kは、LLMが次のトークンを選ぶときの候補を絞るサンプリング設定です。それぞれの仕組…
- 埋め込み(Embedding)とは|文章を数値ベクトルで表して意味の近さを測る技術埋め込み(Embedding)は、文章・画像などを意味を反映した数値のベクトルに変換する技術です。意味の近さの測り方(コサイン類似度)、検索…
- ハルシネーションとは|AIがもっともらしい嘘を出す理由と見抜き方・減らし方ハルシネーションは、生成AIが事実と異なる内容を、もっともらしく出力する現象です。起こる理由、起きやすい場面、見抜き方、プロンプト・RAG・…
- 知識のカットオフとは|AIが知らない最新情報への対処法知識のカットオフ(学習データの期限)は、LLMの知識が止まっている時点のことです。カットオフが生じる理由、起こりうる誤り、確認方法、検索機能…
- 推論(インファレンス)とは|学習済みAIが回答を作る処理と速度・費用の関係推論(インファレンス)は、学習済みのモデルに入力を与えて出力を得る処理です。学習との違い、LLMが1トークンずつ生成する流れ、応答速度・費用…
- パラメータ数とモデルサイズ|「70B」「8B」の意味と性能・必要メモリの関係パラメータは、AIモデルの内部にある調整可能な数値で、学習によって決まります。「7B」「70B」の表記の意味、パラメータ数と性能・費用・必要…
- 推論モデル(思考するAI)とは|答える前に考えるLLMの仕組みと使いどころ推論モデル(リーズニングモデル)は、回答の前に内部で段階的に考える処理を行うLLMです。通常のモデルとの違い、得意な課題、費用と速度のトレー…
- MoE(専門家混合)とは|巨大モデルを効率よく動かす仕組みと注意点MoE(Mixture of Experts)は、モデル内に複数の「専門家」を持ち、入力ごとに一部だけを使う構造です。仕組み、総パラメータ数…
- 日本語とトークン数|日本語が英語よりトークンを多く使う理由と費用・上限への影響日本語の文章は、同じ内容でも英語よりトークン数が多くなる傾向があります。トークナイザーの仕組み、日本語で分割が増える理由、費用・上限・速度へ…
- 拡散モデルとは|ノイズから画像を作る生成AIの仕組みと代表的な応用拡散モデルは、画像にノイズを加える過程を学習し、逆にノイズから画像を復元することで生成を行うモデルです。仕組みの流れ、テキストからの画像生成…