パラメータ数とモデルサイズ「70B」「8B」の意味と性能・必要メモリの関係
パラメータは、AIモデルの内部にある調整可能な数値で、学習によって決まります。「7B」「70B」の表記の意味、パラメータ数と性能・費用・必要メモリの関係、スケーリング則、小型モデルの価値、数だけで性能を判断できない理由を整理します。
公的機関・公式資料などの一次情報と照合して作成しています。このサイトについて
パラメータ数とモデルサイズとは
パラメータ(parameter)は、ニューラルネットワークの内部にある学習で調整される数値(重みなど)のことです。モデルの「知識」や「能力」は、膨大な数のパラメータの値として保存されています。モデルの大きさは、パラメータの数で表されることが多く、「7B」「70B」といった表記がよく使われます(大規模言語モデル(LLM)とは)。
「B」「M」の意味
| 表記 | 意味 | パラメータ数 |
|---|---|---|
| M(Million) | 100万 | 例:125M = 1億2,500万 |
| B(Billion) | 10億 | 例:7B = 70億、70B = 700億 |
| T(Trillion) | 1兆 | 例:1T = 1兆 |
2020年に発表されたGPT-3は、1,750億パラメータ(175B)として知られています。現在は、数十億〜数千億、あるいはそれ以上のモデルがあります。商用のモデルの多くは、パラメータ数が公表されていません。
パラメータ数と性能の関係
一般に、パラメータ数が多いほど、より複雑なパターンを学習でき、性能が高くなる傾向があります。ただし、それだけでは決まりません。
| 要素 | 影響 |
|---|---|
| パラメータ数 | 表現力の大きさ |
| 学習データの量と質 | 学ぶ内容の質 |
| 計算量(学習の長さ) | 学習の十分さ |
| 学習手法・調整 | 指示への従順さ、安全性(RLHF(人間のフィードバックによる強化学習)) |
| モデルの構造 | MoEなど(MoE(専門家混合)) |
スケーリング則
研究では、パラメータ数・データ量・計算量を増やすと、性能が予測可能な形で向上するという「スケーリング則」が報告されています(2020年のKaplanらの研究など)。その後、パラメータ数だけを増やすより、データ量とのバランスを取るほうが効率的であることを示す研究(2022年のChinchilla論文)も出ており、小さめのモデルを、より多くのデータで学習する流れも生まれました。
パラメータ数と必要メモリ
モデルを動かすには、パラメータをメモリに載せる必要があります。目安として、1パラメータあたり、精度に応じたバイト数がかかります。
| 精度 | 1パラメータあたり | 7Bモデルの目安 | 70Bモデルの目安 |
|---|---|---|---|
| 16ビット(FP16/BF16) | 2バイト | 約14GB | 約140GB |
| 8ビット | 1バイト | 約7GB | 約70GB |
| 4ビット | 約0.5バイト | 約3.5〜4GB | 約35〜40GB |
上記は重みだけのおおまかな目安です。実際には、入力の長さに応じたメモリなども必要になります。量子化により、精度を下げて必要メモリを減らせます(量子化、GPUとVRAMの選び方)。
規模ごとの特徴(目安)
| 規模 | 特徴 | 用途の例 |
|---|---|---|
| 小型(〜数B) | 軽く動く。能力は限定的 | 端末内での動作、簡単な分類・要約 |
| 中型(〜数十B) | バランスがよい | ローカルでの実用的な利用、業務用途 |
| 大型(数百B〜) | 高い能力。計算資源が大きい | クラウドでの高度な処理 |
小型モデルでも、特定の用途に絞って調整すれば、高い実用性を示すことがあります(ファインチューニングの考え方)。
パラメータ数とモデルサイズの注意点
| 注意点 | 内容 |
|---|---|
| 数だけで判断できない | 同じパラメータ数でも、設計・データ・調整で性能が大きく異なる |
| 世代による違い | 新しい世代の小型モデルが、古い世代の大型モデルを上回ることがある |
| MoEの表記 | 総パラメータ数と、実際に使う(アクティブな)パラメータ数が異なる |
| 公表されない | 商用モデルは、パラメータ数が非公開の場合が多い |
パラメータ数とモデルサイズの具体例
自分のPCで動かせるモデルを選ぶとき、「8B」と「70B」が選択肢にあるとします。70Bは性能が高い傾向にありますが、4ビット量子化でも約40GB程度のメモリが目安となり、一般的なPCでは動かしにくいことがあります。8Bなら、比較的少ないメモリで動き、日常的な用途には十分な場合も多いです。目的と手元の環境に合わせて選ぶのが現実的です(ローカルLLMとは)。
パラメータ数とモデルサイズのFAQ(よくある質問)
Q. パラメータ数が多いほど賢いですか?
A. 傾向としてはそうですが、データや調整の質も大きく影響するため、数だけでは判断できません。
Q. 商用モデルのパラメータ数は分かりますか?
A. 多くは非公開です。
Q. パラメータとは何ですか?
A. モデルが入力を処理するときの計算に使う、学習で調整される数値です。
筆者の見解(パラメータ数とモデルサイズ)
パラメータ数は、「エンジンの排気量」のようなものと捉えています。大きいほどパワーはありますが、燃費(費用)や車体の大きさ(必要メモリ)も増えます。排気量だけでなく、設計や整備(データと調整)が走りを決めるため、数字だけで優劣を決めず、実際の用途で試すことをおすすめします。
パラメータ数とモデルサイズの関連項目
- 量子化
- GPUとVRAMの選び方
- MoE(専門家混合)
- ローカルLLMとは
出典(一次情報)
本記事は一般的な情報の提供を目的としています。AIのサービス・機能・料金・仕様は頻繁に更新されるため、最新の内容は各社の公式ドキュメントでご確認ください。「筆者の見解」は一つの考え方です。