LLMと英語にはどのような関係があるのか
LLM(Large Language Model:大規模言語モデル)は、大量のテキストデータを学習することで、文章の理解や生成、要約、翻訳、質問応答などを行うAIモデルです。
現在使われている生成系LLMの多くは、入力された文章をトークンと呼ばれる単位に分割し、それまでの文脈をもとに次に続くトークンの確率を予測する仕組みを基本としています。
LLMは英語専用の技術ではありません。
日本語、中国語、スペイン語、フランス語など、さまざまな言語を扱うことができます。
一方で、これまで開発されてきた多くのLLMでは、英語の処理能力が比較的高い傾向が見られてきました。
その理由は、英語そのものがAIにとって特別に理解しやすいからというより、学習データの量や質、トークナイザー、技術情報、評価環境など、英語を取り巻くさまざまな条件が有利だったためと考えられています。
LLMが英語を得意とされる最大の理由は学習データの豊富さ
インターネット上には大量の英語データが存在する
LLMの性能を左右する重要な要素の一つが、学習に利用できるデータの量と質です。
英語では、Webサイト、書籍、ニュース、論文、Wikipedia、技術文書、Q&Aサイト、ソフトウェアのドキュメントなど、非常に多くのデジタルコンテンツが存在します。
そのため、LLMは英語について、日常表現から専門知識まで幅広いパターンを学習しやすい環境にあります。
単純にデータ量が多ければ必ず性能が高くなるわけではありませんが、高品質で多様なデータが豊富に存在することは、英語性能が高くなりやすい重要な要因の一つです。
英語はデータの種類も豊富
英語の強みは、単純な文章量だけではありません。
英語では、さまざまな分野の文章が大量に公開されています。
たとえば、以下のような情報です。
- 日常会話
- ニュース
- 文学
- 科学論文
- 医学文献
- 法律文書
- ビジネス文書
- プログラミング関連情報
- 教育コンテンツ
- 数学や物理学の解説
LLMはこうした多様な文章を学習することで、語彙や文法だけではなく、専門知識や論理的な文章構成なども同時に学習できます。
そのため、英語は単なる「言語データ」としてだけではなく、多くの知識を取得するための入り口としても重要な役割を果たしてきました。
トークナイザーの違いも英語性能に影響する
LLMは文章をトークンに分割して処理する
LLMは、入力された文章をそのまま理解しているわけではありません。
文章は最初に「トークン」と呼ばれる単位へ分割されます。
この処理を担当する仕組みがトークナイザーです。
たとえば英語では、
「artificial intelligence」
という表現が、比較的少ないトークンに分割される場合があります。
一方、日本語では、同じ程度の情報量を持つ文章でも、トークナイザーによってはより細かく分割されることがあります。
英語中心のトークナイザーでは他言語が不利になる場合がある
過去の一部のLLMでは、英語データを中心としてトークナイザーが設計されていました。
その場合、英語では頻繁に使われる単語や文字列が効率よくトークン化される一方、日本語やその他の言語では細かく分割されることがあります。
同じ内容を表現する場合でも必要なトークン数が増えると、コンテキストウィンドウをより多く消費する可能性があります。
また、処理するトークン数が増えれば、計算量や生成時間、トークン課金型サービスでは利用料金にも影響する場合があります。
ただし、トークン化の効率はモデルごとに大きく異なります。
近年の多言語LLMでは、英語以外の言語でも効率的に処理できるよう、トークナイザーの設計が改善されています。
プログラミングと英語の結び付きもLLMに影響する
プログラミング言語では英語由来の単語が多い
多くのプログラミング言語では、英語由来のキーワードが使われています。
たとえば、
「if」
「else」
「return」
「class」
「import」
などです。
さらに、変数名、関数名、API名、エラーメッセージ、ライブラリの説明なども英語で書かれるケースが多くあります。
技術情報も英語中心になりやすい
プログラミング関連では、公式ドキュメント、GitHub、技術ブログ、Q&Aサイトなどにも大量の英語情報があります。
そのため、LLMがコードや技術情報を学習するときには、英語と同時に学習するケースが多くなります。
ただし、「コードを学習すれば自動的に英語能力が高くなる」という単純な関係ではありません。
英語とコードのデータが強く結び付いていることが、英語を取り巻く学習環境をさらに充実させていると考えるのが適切です。
AIや科学分野で英語が広く使われていることも理由の一つ
研究論文や技術資料には英語が多い
AI、コンピューターサイエンス、物理学、生物学、医学などでは、英語による論文や技術資料が数多く公開されています。
そのため、LLMは英語データを通じて、言語能力だけでなく科学や技術に関する専門知識も大量に学習できます。
特に最新技術や海外サービスに関する情報では、一次情報が英語で公開されるケースも少なくありません。
その結果、モデルや分野によっては、英語で質問したほうがより詳細な回答を得られる場合があります。
ただし、現在の高性能な多言語LLMでは、日本語のまま質問しても十分な性能が得られることが多いため、すべての質問を英語にする必要はありません。
英語の評価環境が充実していたことも関係している
LLMはベンチマークを使って性能を評価される
LLMの開発では、学習後にさまざまなベンチマークを利用して性能を測定します。
評価対象には、一般知識、読解、数学、推論、科学、プログラミングなどがあります。
LLM研究の初期から、英語による評価データやベンチマークが数多く作られてきました。
そのため、英語については、
性能を測る
↓
問題点を発見する
↓
モデルを改善する
↓
再び性能を測る
という開発サイクルを繰り返しやすい環境がありました。
こうした評価環境の充実も、英語性能の改善につながった要因の一つと考えられます。
LLMは内部で英語に翻訳して考えているわけではない
「LLMは英語で考えている」という説明は単純化しすぎている
LLMについて、「内部では英語で考えている」と説明されることがあります。
しかし、一般的な多言語LLMについて、この説明は正確ではありません。
たとえば、日本語を入力すると、
日本語
↓
英語へ翻訳
↓
英語で思考
↓
日本語へ再翻訳
という固定的な処理が行われているわけではありません。
LLMでは、入力された文章がトークンに変換され、さらに数値的なベクトル表現として処理されます。
Transformerと呼ばれるニューラルネットワーク内部で文脈に応じた計算が行われ、最終的に次のトークンの確率分布が計算されます。
したがって、LLM内部で人間のように特定の自然言語を使って思考していると捉えるのは適切ではありません。
英語で学んだ知識を日本語で利用できることがある
クロスリンガル転移が起こる
多言語LLMでは、ある言語で学習した知識や能力を、別の言語でも利用できる現象があります。
これをクロスリンガル転移と呼びます。
たとえば、ある事実について英語の学習データが非常に多かったとしても、日本語でその内容を質問すると正しく回答できることがあります。
これは、多言語の表現がモデル内部で完全に独立して管理されているわけではなく、意味的な内部表現の一部が共有されるためだと考えられています。
ただし、すべての知識が完全に言語間で転移するわけではありません。
文化固有の表現、慣用句、言葉遊び、地域限定の知識などについては、それぞれの言語による十分な学習データが重要になります。
日本語はLLMにとって不利なのか
日本語だから性能が低いとは限らない
以前の英語中心のLLMでは、日本語を含む非英語言語で性能が低下するケースが多くありました。
しかし、現在では多言語学習データの充実やトークナイザーの改善により、日本語性能も大幅に向上しています。
そのため、
「LLMは英語しか得意ではない」
という説明は適切ではありません。
現在は、モデルによって日本語性能にも大きな違いがあります。
多言語対応を重視して開発されたLLMでは、日本語でも非常に自然な文章生成や高度な推論が可能になっています。
英語で質問するとLLMの精度は上がるのか
英語が有利になる場合はある
英語で質問することで性能が向上する場合はあります。
特に、
プログラミング
AI・機械学習
科学論文
海外サービス
英語圏の制度
最新技術
など、もともとの情報源が英語中心の分野では、英語プロンプトが有利になる場合があります。
必ず英語にする必要はない
ただし、
「LLMには必ず英語で質問したほうがよい」
という考え方は正しくありません。
最新の多言語LLMでは、日本語のプロンプトでも高い性能を発揮するモデルが増えています。
また、日本語表現、敬語、日本文化、日本国内の制度やサービスなどを扱う場合は、日本語で質問したほうが自然な結果になることもあります。
重要なのは、英語か日本語かを一律に決めるのではなく、使用するモデルや扱うテーマに合わせて選択することです。
英語で入力して日本語で出力させる方法もある
入力言語と出力言語は分けられる
LLMでは、質問に使う言語と回答に使う言語を変えることもできます。
たとえば、
「以下のSEO戦略を分析してください。回答は日本語で出力してください」
という指示を英語で入力することも可能です。
英語の専門資料や海外の一次情報を扱う場合には、この方法が役立つケースがあります。
ただし、多言語性能の高いLLMであれば、日本語の指示だけでも十分に高品質な回答が得られることがあります。
そのため、英語プロンプトを使うこと自体を目的にする必要はありません。
英語そのものがAI向きの言語とは限らない
英語が得意なのは言語構造だけが理由ではない
英語には、単語の間にスペースがあることや、ラテン文字を中心に使うことなど、日本語とは異なる特徴があります。
しかし、それだけを理由に、
「英語はLLMにとって理解しやすい言語」
と断定することはできません。
LLMの性能には、
学習データの量
学習データの品質
トークナイザー
モデルサイズ
モデル設計
学習方法
事後学習
評価方法
など、数多くの要素が影響しています。
そのため、英語性能が高い理由を英語の文法や文字体系だけで説明するのは適切ではありません。
LLMが英語を得意とされる理由をまとめる
LLMが英語を得意とされてきた背景には、複数の要因があります。
代表的なのは、高品質で多様な英語データが大量に存在することです。
さらに、英語中心のトークナイザーが歴史的に多かったことや、プログラミングや技術文書で英語が広く使われていること、英語の評価ベンチマークが充実していたことなども関係しています。
つまり、
「英語という言語そのものがAIに向いているからLLMが英語を得意としている」
と考えるより、
「LLMの開発や学習を取り巻くデータや技術環境が、歴史的に英語に有利だったため」
と考えるほうが正確です。
近年は多言語データセットやトークナイザー、学習手法が改善され、日本語を含む非英語言語の性能も向上しています。
そのため今後は、「LLMは英語が得意で他言語は苦手」という単純な構図ではなく、モデルごとの多言語性能を比較することがより重要になるでしょう。
以上、LLMと英語の関係や英語が得意とされる理由についてでした。
最後までお読みいただき、ありがとうございました。
