LLMはいつから登場したのか
LLM(Large Language Model:大規模言語モデル)は、ある年に突然登場した技術ではありません。
現在のLLMにつながる研究の源流は、1940年代の情報理論や確率的な言語研究まで遡ることができます。
その後、統計的言語モデル、ニューラルネットワーク、RNN、LSTM、Transformer、大規模事前学習などの技術が発展し、現在のLLMへとつながりました。
特に大きな転換点となったのが、2017年に発表されたTransformerです。
さらに、2018年にはGPTやBERTなどの事前学習モデルが登場し、2020年のGPT-3によって大規模言語モデルの汎用性が広く注目されるようになりました。
そして、2022年以降はChatGPTをはじめとする対話型AIが普及し、LLMは研究分野だけでなく一般社会でも広く利用される技術になっています。
そのため、現代的なLLMの歴史を見る場合は、2017~2018年ごろを重要な出発点として考えると理解しやすいでしょう。
LLMとは
LLMとは「Large Language Model」の略で、日本語では「大規模言語モデル」と呼ばれます。
大量の文章データを使って学習し、文章中に含まれる単語やトークンの関係を統計的に学習するAIモデルです。
文章生成だけでなく、要約、翻訳、質問応答、情報整理、プログラミングなど、さまざまな自然言語処理に利用されています。
生成型LLMでは次のトークンを予測する
GPT系をはじめとする自己回帰型の生成LLMでは、基本的にそれまでの文脈をもとに「次にどのトークンが続く可能性が高いか」を予測します。
例えば、
「今日は天気が」
という文章が入力された場合、
「良い」
「悪い」
「いい」
など、文脈上続きやすいトークンの確率を計算しながら文章を生成します。
ただし、すべてのLLMがまったく同じ方法で学習されているわけではありません。
例えばBERTのように、文章の一部を隠し、その単語を前後の文脈から予測する方式を採用したモデルもあります。
そのため、「すべてのLLMが次トークン予測だけで学習される」と考えるのは正確ではありません。
1940年代:言語モデルにつながる理論的な基礎が生まれる
情報理論が言語を確率的に扱う基礎になる
現在のLLMそのものが1940年代に存在していたわけではありません。
しかし、LLMにつながる考え方の源流は、この時代まで遡ることができます。
特に重要なのが、クロード・シャノンによって体系化された情報理論です。
情報理論では、情報を数学的・確率的に扱う方法が研究されました。
その中には、ある記号列において次にどの記号が現れやすいのかを確率的に考える発想も含まれています。
この考え方は、後に発展する統計的言語モデルの基礎の一つになりました。
したがって、1940年代は「LLMが登場した時代」というよりも、「LLMにつながる理論的な基礎が形成された時代」と考えるのが適切です。
1980~2000年代:統計的言語モデルが広く使われる
n-gramモデルが自然言語処理で普及する
コンピューターの性能向上やデジタル文章データの増加に伴い、統計的言語モデルが広く利用されるようになりました。
代表的なものがn-gramモデルです。
n-gramでは、直前に登場したいくつかの単語をもとに、次にどの単語が現れやすいかを計算します。
例えば、
「私は学校へ」
という文章の後に、
「行く」
「通う」
「向かった」
などのどの単語が続きやすいのかを、過去の文章データから求めます。
2つの単語の組み合わせを利用するものはbigram、3つならtrigramなどと呼ばれます。
n-gramには長い文脈を扱いにくい問題があった
n-gramは実用的な言語モデルとして広く利用されましたが、大きな弱点もありました。
参照する単語数を増やすほど、単語の組み合わせが急激に増えるためです。
語彙数が多い場合、長い単語列のすべての組み合わせを十分な回数観測することは困難です。
そのため、長い文章全体の意味や、離れた位置にある単語同士の関係を扱うことには限界がありました。
この問題を改善するために、ニューラルネットワークを利用した言語モデルが研究されるようになります。
2000年代:ニューラル言語モデルが発展する
単語をベクトルとして表現する方法が発展する
2000年代になると、ニューラルネットワークを使って言語を扱う研究が本格的に発展します。
特に重要な研究の一つが、Yoshua Bengioらによる2003年のニューラル確率的言語モデルです。
この方法では、単語を単なる記号として扱うのではなく、多次元のベクトルとして表現します。
これを分散表現と呼びます。
例えば、
「犬」
「猫」
「動物」
など意味的に近い単語は、ベクトル空間でも比較的似た表現として学習されます。
未知の単語列にも一般化しやすくなる
従来のn-gramでは、学習データに存在しない単語の組み合わせを適切に扱うことが難しいという問題がありました。
ニューラル言語モデルでは、単語同士の意味的な類似性を利用できるため、完全に同じ単語列を学習していなくても、似たパターンから推測できる可能性が高まります。
こうした考え方は、現在のLLMでも重要な基盤となっています。
2010年代前半:RNNやLSTMが自然言語処理で普及する
RNNによって文章の流れを扱いやすくなる
2010年代になると、ディープラーニングの発展とともに、RNN(Recurrent Neural Network)が自然言語処理で広く利用されるようになりました。
RNNは、それ以前に処理した情報を内部状態として保持しながら、文章を順番に処理できるニューラルネットワークです。
そのため、n-gramよりも長い文脈を扱いやすくなりました。
LSTMによって長期的な情報を保持しやすくなる
通常のRNNでは、文章が長くなるにつれて過去の情報を保持しにくくなる問題があります。
代表的な問題が勾配消失です。
その改善策として重要になったのが、LSTM(Long Short-Term Memory)です。
LSTMそのものは1990年代に提案された技術ですが、2010年代のディープラーニングの発展によって、機械翻訳、音声認識、文章生成などで広く利用されるようになりました。
RNN系モデルには並列化しにくい問題があった
RNNやLSTMは、基本的に文章を先頭から順番に処理します。
前の時点の計算結果を利用して次の単語を処理するため、大規模な並列処理には向いていません。
モデルを巨大化し、膨大な文章データを学習するには、この逐次的な処理が大きな制約になります。
この課題を大きく変えたのがTransformerです。
2017年:Transformerが登場する
現代LLMにつながる大きな転換点になる
2017年、Googleの研究者らによって「Attention Is All You Need」という論文が発表されました。
この論文で提案されたのがTransformerです。
Transformerは、RNNのような再帰構造を基本とせず、Attentionを中心に構成されています。
現在の主要なLLMの多くがTransformerをベースにしているため、2017年はLLMの歴史における非常に重要な年といえます。
Self-Attentionでトークン同士の関係を捉える
Transformerの中心的な仕組みの一つがSelf-Attentionです。
Self-Attentionでは、文章内のあるトークンと、ほかのトークンがどの程度関連しているのかを計算できます。
例えば、
「太郎はリンゴを買った。彼はそれを食べた。」
という文章では、
「彼」と「太郎」
「それ」と「リンゴ」
のような離れた位置にある表現同士の関係を扱うことが重要です。
Self-Attentionによって、このような関係を直接計算しやすくなりました。
Transformerは大規模学習と相性がよかった
Transformerの重要な特徴として、RNNよりも計算を並列化しやすいことが挙げられます。
文章を完全に1単語ずつ順番に処理する必要がないため、GPUやTPUなどの計算資源を有効活用しやすくなりました。
この特徴が、大量のデータと巨大なモデルを使う現在のLLMの発展を大きく後押ししました。
ただし、標準的なSelf-Attentionは系列長が長くなるほど計算量やメモリ使用量が大きくなるため、長文を無制限に効率よく扱えるわけではありません。
2018年:GPTやBERTによって事前学習が大きく発展する
GPTが登場する
2018年、OpenAIがGPTを発表しました。
GPTは「Generative Pre-trained Transformer」の略です。
大量の文章を使ってモデルを事前学習し、その後、特定の用途へ適応させるという考え方を本格的に示しました。
従来の自然言語処理では、
翻訳用モデル
文章分類用モデル
質問応答用モデル
のように、タスクごとに個別のモデルを用意することが一般的でした。
GPTのような事前学習モデルでは、まず大量の文章から汎用的な言語パターンを学習し、その能力をさまざまな用途へ活用できます。
この考え方は、現在のLLMにも受け継がれています。
BERTも同じ年に登場する
2018年にはGoogleからBERTも発表されました。
BERTは「Bidirectional Encoder Representations from Transformers」の略です。
前後両方向の文脈を利用して、文章の表現を学習できることが大きな特徴です。
GPTとBERTはいずれもTransformerを利用した事前学習モデルですが、仕組みは同じではありません。
GPTは生成に適した自己回帰型モデルであるのに対し、BERTはEncoderを中心に構成され、文章分類や質問応答などの理解系タスクで広く利用されました。
2018年は事前学習モデルの転換点となる
2018年前後には、GPTやBERTだけでなく、ELMoやULMFiTなどの重要な研究も登場しました。
これらの研究によって、
「特定のタスクごとにゼロからモデルを学習する」
方法から、
「大量のデータで事前学習したモデルを、さまざまなタスクへ転用する」
方法へ自然言語処理の中心が移っていきます。
この流れが現在のLLMへとつながっています。
2019~2020年:LLMの大規模化が加速する
スケーリングが重視されるようになる
Transformerと事前学習の有効性が明らかになると、モデルをさらに巨大化する研究が進みました。
そこで重要になったのがスケーリングです。
言語モデルの研究では、
モデルサイズ
学習データ量
計算量
などを増やすことで、一定の条件下ではモデルの損失や性能に予測可能な改善傾向が現れることが研究されました。
そのため、より大規模なモデル、大量のデータ、巨大な計算資源を使った開発競争が進むことになります。
ただし、単純にパラメータ数だけを増やせばよいわけではありません。
データ量やデータ品質、学習方法、計算量などとのバランスが重要です。
2020年:GPT-3でLLMの汎用性が注目される
GPT-3は1750億パラメータのモデルとして登場する
2020年にOpenAIが発表したGPT-3は、1750億パラメータを持つ大規模な自己回帰型言語モデルです。
GPT-3によって、モデルを大規模化することで多様なタスクへ対応できる可能性が広く注目されました。
特に重要なのが、タスクごとにモデルを再学習しなくても、プロンプトとして指示や例を与えることでさまざまな問題に対応できたことです。
Few-shotやZero-shotが注目される
GPT-3では、Few-shot、One-shot、Zero-shotといった利用方法が広く知られるようになりました。
Few-shotとは、少数の例をモデルに提示してタスクを実行させる方法です。
例えば、
「英語を日本語に翻訳してください。
apple → りんご
dog → 犬
cat →?」
のように、数個の例を与えることで、モデルにタスクのパターンを理解させます。
一方、Zero-shotでは具体的な例を示さず、
「次の英文を日本語に翻訳してください」
のような指示だけでタスクを実行します。
こうした能力によって、LLMは単なる文章生成モデルではなく、さまざまな用途へ応用できる汎用的な基盤として注目されるようになりました。
2022年:ChatGPTによってLLMが一般社会へ普及する
対話形式でLLMを利用できるようになる
2022年11月にはChatGPTが公開され、LLMの存在が一般ユーザーにも急速に知られるようになりました。
それ以前にも高性能なLLMは存在していましたが、多くの人が自然な対話形式でLLMを利用できるようになったことが大きな転換点です。
これによって、
文章作成
要約
翻訳
アイデア出し
学習支援
プログラミング
など、幅広い用途で生成AIが使われるようになりました。
事後学習の重要性が高まる
高性能な対話型AIを作るためには、事前学習だけでは十分ではありません。
大量の文章から一般的な言語能力を身につけた後、人間の指示に従いやすくするための事後学習が重要になります。
代表的な方法には、
教師ありファインチューニング
人間のフィードバックを利用した学習
Preference Optimization
安全性を高めるための調整
などがあります。
RLHFも代表的な事後学習手法の一つですが、事後学習そのものとRLHFが同じ意味というわけではありません。
2023年以降:マルチモーダルAIへ発展する
テキストだけでなく画像なども扱うようになる
2023年以降は、LLMを中心としたAIモデルのマルチモーダル化が急速に進みました。
マルチモーダルとは、複数種類の情報を扱えることを意味します。
例えば、
テキスト
画像
音声
動画
などを組み合わせて処理するAIが登場しています。
その結果、文章だけを扱う言語モデルから、複数の情報形式を統合して扱う基盤モデルへと発展しています。
すべてをLLMと呼ぶとは限らない
テキストだけでなく、画像や音声なども扱うモデルをすべて厳密にLLMと呼ぶとは限りません。
このようなモデルは、
大規模マルチモーダルモデル
基盤モデル
Foundation Model
などと呼ばれることもあります。
そのため、LLMという言葉とマルチモーダルAIは関連していますが、完全に同じ概念ではありません。
LLMが急速に発展した理由
Transformerが登場したため
LLMの発展を大きく加速させた要因の一つがTransformerです。
Self-Attentionによって、離れたトークン同士の関係を扱いやすくなりました。
さらに、RNNと比較して計算を並列化しやすいため、大規模な学習にも適しています。
大量のデジタルデータを利用できるようになったため
インターネットやデジタル出版の普及によって、膨大な文章データが利用できるようになったことも重要です。
LLMの学習では、
Webページ
書籍
論文
ニュース
プログラムコード
など、さまざまなデータが利用されます。
一方で、データ品質、著作権、プライバシー、偏りなどは現在も重要な課題です。
GPUなどの計算能力が向上したため
LLMの学習には膨大な行列計算が必要です。
GPUやTPUをはじめとするAI向け計算資源、高速ネットワーク、大規模データセンターなどの発展によって、巨大なモデルを学習できる環境が整いました。
大規模化の効果が明らかになったため
研究の進展によって、モデルサイズ、データ量、計算量などを適切に拡大すると、言語モデルの性能が向上する傾向が確認されました。
そのため、LLM開発ではスケーリングが重要な研究テーマとなりました。
ただし、大きければ必ず優れているわけではなく、学習データの質や効率的な設計も重要です。
LLMの歴史を年代順に整理
LLMの発展を簡単にまとめると、以下のようになります。
1940年代
情報理論や確率的な言語研究が発展し、言語モデルにつながる理論的な基礎が形成されました。
1980~2000年代
n-gramをはじめとする統計的言語モデルが、音声認識や機械翻訳などで広く利用されました。
2000年代
ニューラルネットワークを利用した言語モデルが発展し、単語の分散表現などの考え方が広がりました。
2010年代前半
RNNやLSTMを利用した自然言語処理が急速に発展しました。
2017年
Transformerが登場し、現在のLLMにつながる中心的なアーキテクチャが確立されました。
2018年
GPT、BERT、ELMo、ULMFiTなどによって、大規模事前学習と転移学習が大きく発展しました。
2020年
GPT-3が登場し、Few-shotやZero-shotによる汎用的なタスク対応能力が注目されました。
2022年
ChatGPTが公開され、対話型LLMが一般社会へ急速に普及しました。
2023年以降
テキストだけでなく画像や音声などを扱うマルチモーダルAIへと発展しています。
LLMはいつ誕生したと考えるべきか
LLMの「誕生年」を一つに決めるのは難しいといえます。
どの技術をLLMの始まりと考えるかによって、答えが異なるためです。
言語モデルの源流なら1940年代まで遡る
確率的に情報や言語を扱うという考え方まで含めれば、その源流は1940年代まで遡ることができます。
ただし、この時代に現在のLLMが存在していたわけではありません。
ニューラル言語モデルなら2000年代が重要
ニューラルネットワークを利用して言語をモデル化する研究は、現在のLLMへ直接つながる重要な段階です。
特に2000年代には、単語の分散表現を利用したニューラル言語モデルが大きく発展しました。
現代的なLLMなら2017~2018年が重要
現在主流となっているTransformerベースのLLMという意味では、2017年のTransformer登場が最大の転換点です。
さらに2018年にはGPTやBERTが登場し、「大量のデータで事前学習したモデルを幅広い用途へ利用する」という現在のLLMにつながる方向性が確立されました。
そのため、一般的には2017~2018年ごろを現代LLMの重要な出発点と考えると分かりやすいでしょう。
まとめ
LLMは突然誕生した技術ではなく、数十年にわたる自然言語処理や機械学習研究の積み重ねによって発展してきました。
その源流には、1940年代から続く情報理論や確率的言語モデルの研究があります。
その後、n-gram、ニューラル言語モデル、RNN、LSTMなどが発展し、2017年のTransformerによって現在のLLMにつながる大きな転換が起こりました。
2018年にはGPTやBERTによって大規模な事前学習が広がり、2020年のGPT-3ではFew-shotやZero-shotを含む汎用的な能力が注目されました。
さらに2022年以降はChatGPTなどの対話型AIが一般社会へ普及し、2023年以降は画像や音声なども扱うマルチモーダルAIへと発展しています。
したがって、LLMの歴史を理解するうえでは、「1940年代から続く言語モデル研究を基礎として、2017~2018年ごろに現代的なLLMの形が確立され、2020年代に急速に実用化・普及した」と整理すると分かりやすいでしょう。
以上、LLMはいつから登場したのか、歴史や発展についてでした。
最後までお読みいただき、ありがとうございました。
