カテゴリ

生成AIの仕組み

18 項目

生成AIの仕組みとは|このカテゴリで分かること

「生成AIの仕組み」は、ChatGPTやClaudeのようなLLM(大規模言語モデル)が、どうやって文章を作っているのかを理解するためのカテゴリです。数式は使わず、「なぜ長い資料を渡すと精度が落ちるのか」「なぜもっともらしい嘘をつくのか」といった、使う人が実際に困る場面と結びつけて説明します。

対象は、生成AIをある程度使い始めた人と、APIや業務への組み込みを検討している人です。トークン、Transformer、事前学習、コンテキストウィンドウ、温度などの用語がつながり、ハルシネーション対策を自分で考えられるところまでを目指します。

読む順番(おすすめの順路)

  1. トークンとは|AIが文章を数える単位・文字数との違い・料金と上限への影響 … AIが文章を数える単位。上限・料金・速度のすべてに関わる最重要の基礎です。
  2. 日本語とトークン数|日本語が英語よりトークンを多く使う理由と費用・上限への影響 … 日本語は英語よりトークンを使いやすい理由を知り、費用感をつかみます。
  3. Transformerとは|現在のLLMの土台となるモデル構造をやさしく解説 … 今のLLMの土台となる構造を、全体像だけ押さえます。
  4. アテンション機構とは|文脈のどこに注目するかを計算する仕組み … Transformerの中心である「どこに注目するか」の仕組みを理解します。
  5. 事前学習とは|LLMが言葉の基礎を身につける段階と、その後の調整 … 大量の文章で言葉の基礎を身につける段階。性格づけの前の土台です。
  6. RLHF(人間のフィードバックによる強化学習)とは|AIを人に役立つ回答へ導く調整手法 … 人のフィードバックで「役に立つ回答」に調整する段階を知ります。
  7. ファインチューニングの考え方|追加学習で何が変わるか・RAGやプロンプトとの使い分け … 追加学習とRAG・プロンプトの使い分けを整理します。
  8. パラメータ数とモデルサイズ|「70B」「8B」の意味と性能・必要メモリの関係 … 「70B」などの数字の意味と、性能・必要メモリの関係を押さえます。
  9. MoE(専門家混合)とは|巨大モデルを効率よく動かす仕組みと注意点 … 巨大モデルを効率よく動かす工夫を知り、モデル名の見方を広げます。
  10. 推論(インファレンス)とは|学習済みAIが回答を作る処理と速度・費用の関係 … 学習済みモデルが回答を作る処理と、速度・費用の関係を理解します。
  11. コンテキストウィンドウとは|AIが一度に扱える情報量の上限と付き合い方 … 一度に扱える量の上限。長い会話や資料で品質が落ちる理由がわかります。
  12. temperature(温度)とは|AIの回答のランダムさを調整する設定とサンプリング … 回答のランダムさを決める設定。創作と事実確認で使い分けます。
  13. top_p・top_kとは|次のトークンの候補を絞るサンプリング設定の使い方 … 温度とセットで出てくるサンプリング設定を補足します。
  14. 推論モデル(思考するAI)とは|答える前に考えるLLMの仕組みと使いどころ … 答える前に考えるモデルの仕組みと、使いどころを知ります。
  15. 埋め込み(Embedding)とは|文章を数値ベクトルで表して意味の近さを測る技術 … 文章を数値で表す技術。検索やRAGを学ぶ前の準備になります。
  16. 拡散モデルとは|ノイズから画像を作る生成AIの仕組みと代表的な応用 … 画像生成AIの仕組み。文章系との違いを比べられます。
  17. 知識のカットオフとは|AIが知らない最新情報への対処法 … AIが最新情報を知らない理由と対処法を確認します。
  18. ハルシネーションとは|AIがもっともらしい嘘を出す理由と見抜き方・減らし方 … もっともらしい誤りが生まれる理由を、ここまでの知識でまとめて理解します。
  19. ハルシネーション対策|誤りを減らす方法と確認の手順 … 最後に、誤りを減らす工夫と確認の手順を実践に落とし込みます。

押さえておきたいポイント(リサーチ)

原典と公式ドキュメントで確認できた事実です。モデルの仕様は頻繁に更新されるため、最新は公式で確認してください。

項目 確認できた内容
Transformerの登場 2017年6月の論文「Attention Is All You Need」で提案。再帰や畳み込みを使わず、アテンションの仕組みだけで構成するモデル
コンテキストウィンドウの定義 Anthropicのドキュメントでは「回答を生成するときにモデルが参照できるすべてのテキスト(回答そのものを含む)」と説明。学習データとは別の「作業用の記憶」にあたる
長ければよいわけではない 同ドキュメントは、トークン数が増えると正確さや想起が落ちる現象(context rot)に触れ、何を入れるかの選別が重要だとしている
思考のトークン 拡張思考(thinking)のトークンも上限に数えられ、出力トークンとして課金されると説明されている
サンプリング設定 Googleのプロンプト設計ガイドは、temperature・topK・topP・最大トークン数の役割を説明し、温度が低いほど決定的、高いほど多様な結果になりやすいとしている。一方でGemini 3系のモデルでは既定値のまま使うことを強く推奨し、温度を1.0より下げるとループや性能低下が起きうると注意している

よくある疑問

Q. 生成AIはどうやって文章を作っているのですか? A. 直前までの文脈から「次に来そうなトークン」を確率的に選ぶ処理を繰り返しています。入口はトークンとは|AIが文章を数える単位・文字数との違い・料金と上限への影響、構造はTransformerとは|現在のLLMの土台となるモデル構造をやさしく解説で解説しています。

Q. ハルシネーション対策として、まず何をすればよいですか? A. 根拠となる資料を渡し、「資料にない場合は分からないと答えて」と指示し、数字・固有名詞は一次情報で照合することです。手順はハルシネーション対策|誤りを減らす方法と確認の手順にまとめています。

Q. 長い資料を渡すと、途中の内容を無視されるのはなぜ? A. 一度に扱える量に上限があり、量が増えるほど注意が分散しやすいためです。コンテキストウィンドウとは|AIが一度に扱える情報量の上限と付き合い方を参照してください。

Q. 温度は低いほうが正確になりますか? A. ばらつきは減りますが、正しさを保証するものではありません。モデルによっては既定値のまま使うよう推奨されているため、各社の公式ドキュメントも確認してください。temperature(温度)とは|AIの回答のランダムさを調整する設定とサンプリングで使い分けを説明しています。

編集部の見解

生成AIの仕組みは、研究者のように数式で理解する必要はなく、「トークン」「上限」「確率で選ぶ」の3つがつながれば、日々の使い方は大きく変わると考えます。特にハルシネーションは「AIの欠陥」ではなく、次の言葉を確率で選ぶ仕組みから自然に生じる性質と捉えるほうが、対策を立てやすいと考えます。つまずきやすいのは、TransformerやMoEなどの専門用語に深入りしすぎて、実務との接点を見失うことです。まずはトークンとは|AIが文章を数える単位・文字数との違い・料金と上限への影響とコンテキストウィンドウとは|AIが一度に扱える情報量の上限と付き合い方を押さえ、困った場面が出てきたら該当する記事に戻る、という往復の学び方をおすすめします。

出典(一次情報)

生成AIの仕組みの項目一覧