Skip to content
research

AIの解読:すべてを説明する16のアイデア

AIというバズワードの山には、実用的なシステムと、いくつかの高コストな誤解が隠されています。その仕組みのつながりが見えてくれば、誇大広告を疑うことも、ツールを使いこなすことも容易になるでしょう。

Aki Tanaka
AIの解読:すべてを説明する16のアイデア

「会話」とは、単なるトークンの繰り返しである

Large Language Models (LLMs) は、回答が完了するまで一度に1つのトークンを繰り返し予測することでテキストを生成します。このメカニズムは人間の理解とは根本的に異なりますが、驚くほど洗練された出力を可能にします。この「会話」は真の理解ではなく、統計的な関連性による確率的なダンスに過ぎません。

処理の前に、入力テキストはトークン化され、一般的な単語やサブワードの塊に分割されます。例えば、「unbelievable」は「un」、「believe」、「able」に分割される可能性があります。1トークンは平均して単語の約4分の3に相当します。トークン数は、APIコスト、コンテキストウィンドウの制限、そして時にはレイテンシに直接影響します。このプロセスについては、OpenAI’s TokenizerやHugging Faceのtokenizer summaryで確認できます。

LLMsは本質的にステートレスであり、リクエスト間で固有のメモリを持ちません。チャットインターフェースが過去のやり取りを「記憶」しているように見えるのは、新しいクエリごとに会話履歴全体(または関連する保存済みの事実)を再送信することで実現しています。これは貴重なコンテキストスペースを消費し、トークン使用量に直接影響します。

Transformerの内部:重み、アテンション、そしてトレーニング

トークン予測の表面下には、複雑なアーキテクチャが存在します。住宅価格の計算に例えてみましょう。広さ(1,000平方フィート)を入力し、重み(例えば300)を掛けて、出力(300,000ドル)を得るという仕組みです。LLMsはこれをスケールアップし、何百もの層と何千もの「ニューロン」を積み重ねて、より複雑なパターンを処理します。これらの数十億の重みは、総称してパラメータと呼ばれ、推論時には固定されますが、トレーニング中に調整されます。

GPTの「T」はTransformerの略であり、その重要な革新はアテンションです。「bank」という単語を想像してください。「川の土手(river bank)」と「銀行(financial bank)」では意味が劇的に異なります。アテンションにより、各トークンは入力シーケンス内の他のトークンの重要性を動的に重み付けし、「bank」を「river」や「money」と関連付けることで意味を明確化します。このメカニズムは、画期的な論文「Attention Is All You Need」で導入され、トークンが孤立して処理されるのを防ぎます。

学習パイプラインにはいくつかの段階があります。事前学習(Pre-training)はランダムな重みから始まり、モデルが欠落したトークンを予測し、誤差に基づいてバックプロパゲーションを通じて重みを調整します。この反復プロセスを数兆回繰り返すことで、予測が洗練されます。次に、ファインチューニングによって、より小さくキュレーションされたデータセットを使用して、事前学習済みモデルを特定のタスクに適応させます。最後に、強化学習により、モデルの出力をスコアリングし、高スコアの応答を優先するように重みを調整することで動作をさらに最適化します。これには多くの場合、人間のフィードバック(RLHF)や自動チェックが組み込まれます。

モデルを小型化し、最新の事実を与える

大規模モデルを特定のタスクに適応させるにはリソースが必要ですが、LoRA (Low-Rank Adaptation) のような手法は費用対効果の高い解決策を提供します。LoRAはモデルの元の重みの大部分を凍結し、その上に少数の追加パラメータのみをトレーニングします。これはベースモデルサイズの1%未満であることが多く、計算オーバーヘッドを大幅に削減し、単一のGPUでのファインチューニングを可能にします。

Quantization(量子化)は、これらの巨大なモデルのメモリフットプリントに対処する技術です。LLMの各ウェイトは通常16ビットの数値として保存されます。例えば、80億パラメータのモデルは約16GBを消費します。Quantizationは、ウェイトをより少ないビット数(例:8ビットや4ビット)で保存し、より精度の低い値に丸めることで、これを削減します。これによりモデルは縮小され、同じモデルの4ビット量子化版は約5GB程度となりノートPCでも実行可能になりますが、その一方で精度が多少犠牲になるというトレードオフが生じます。

モデルの知識をトレーニングデータ以外に拡張するために、Retrieval-Augmented Generation (RAG) は外部情報を活用します。このプロセスは、テキストをembeddings(意味的な意味を数値として捉える長い数値リスト)に変換することから始まり、類似性による比較を可能にします。これらのembeddingsは、元のテキストとともにベクトルデータベースに保存されます。

ユーザーが質問を投げかけると、アプリケーションはそのクエリをまずembeddingに変換します。次に、ベクトルデータベースから意味的に類似したパッセージを検索します。これらの取得されたパッセージは元のプロンプトに追加され、LLMは明示的にトレーニングされていない最新データや独自のデータに基づいた回答を生成できるようになります。テキストがどのようにトークンやembeddingsに変換されるかは、OpenAI Tokenizer Toolで確認してください。

この記事が気に入ったら、毎朝同じようなものをメールで受け取れます。

1日1通 · 2クリックで解除 · サードパーティのトラッキングなし

単なる返信から、アクションを実行するエージェントへ

モデルの本質はテキスト生成器です。モデル自身が独立してウェブ検索を行ったり、コマンドを実行したりすることはできません。ここでtool callingの出番です。モデルは外部機能が必要であると判断すると、構造化された形式で許可された特定のアクションを要求します。モデル自体ではなくアプリケーションコードがこの要求を受け取り、ツールを実行し、その結果をプレーンテキストとしてモデルに返します。

多くのサービスは、Model-Client Protocol (MCP) を通じてこれらのツールを公開しています。これは、互換性のあるAIアプリケーションが外部機能を検出し、対話することを可能にする一般的な接続パターンです。MCPはアプリケーションがツールとどのように通信するかを定義しますが、モデルの内部推論や機能については規定しません。モデルはMCPを使用してアクションを「要求」するのであり、アクションを「実行」するわけではありません。

これらの概念はagent loopで収束します。AIエージェントはタスクを受け取り、必要なツールを特定し、MCPを介してそれらを呼び出します。次に、ツールの出力を検査し、内部状態を更新し、タスクが完了するまでこのプロセスを繰り返します。この反復的なサイクルにより、フライトの予約からデータ分析まで、複雑なワークフローが可能になります。

強力ではありますが、これらの自律的なワークフローには慎重な管理が必要です。常にツールの出力を検証し、不正アクセスを防ぐために適切な権限を設定し、データ漏洩に十分注意してください。エージェントは構造化されたタスクに優れていますが、その自律性には限界があります。堅牢で安全な運用のために、人間の監視は依然として不可欠です。

よくある質問

LLMとは簡単に言うと何ですか?

大規模言語モデル(LLM)は、入力から次に続く可能性の高いトークンを予測し、そのプロセスを繰り返すことで回答を生成します。

AIチャットボットは過去の会話を覚えていますか?

モデル自体は一般的にステートレスです。チャットアプリは、新しいリクエストと一緒に会話履歴や保存された情報を送信することで、継続性を作り出すことができます。

RAGとファインチューニングの違いは何ですか?

RAGは回答時に適切な情報を取得してプロンプトに追加します。ファインチューニングは、追加のトレーニング例を使用してモデルのウェイトを調整します。

AIエージェントはチャットボットとどう違いますか?

エージェントは、一度だけ返信するのではなく、ツールを使用し、結果を確認し、タスクに向けて継続しながら、推論とアクションのループを実行することができます。

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$199 · AI tools & software only

ビルダーの方へ

このページは、他社のツールのために働いています。

AIエージェントが読み、購入検討層がたどり着きます。8言語とMCP経由で答えます。あなたのツールにも同じページを — 24時間以内に公開。