FMS 2026 | 全4回の第2回
1つの脳、2つのメモリシステム
パート1では、エージェント型AIが1つではなく2つのコンピューティングスタック上でどのように実行されるかを説明しました。端的に述べれば、GPUは推論し、生成し、計画を立てる一方で、CPUは制御し、行動し、計画を遂行します。どちらも、その役割に合わせて設計されたメモリなしでは機能しません。
そこで私は、この問題の規模を次のように強調しました。同時実行下ではコンテキストが数十テラバイトにまで増大する可能性があり、一方でエージェント型ワークフローは、インフラストラクチャのトラフィックを従来のベースラインの100倍にまで押し上げる可能性があります。パート2では、推論スタックがKVキャッシュをどのように管理するか、そして実行スタックが何を要求するかを詳しく説明します。
KVキャッシュのために最適化された階層
KVキャッシュは「場所」ではありません。デコードパイプラインの次の反復処理に供給するため、常に利用可能でなければならない重要な推論オブジェクトです。KVキャッシュが保持されている場合、システムは推論を滞りなく進めるのに十分な速さでそれを取得しなければいけません。破棄された場合、システムはそれを再計算する必要があり、すでに完了した作業を再現するために時間、エネルギー、計算リソースを費やすことになります。そのため、KVキャッシュの配置はシステムレベルの設計判断となります。何を保持するか、それをどこに保存するか、そして再計算よりも取得の方が効率的になるのはいつか、という判断です。2つのストレージ階層しか使用しないシステムもあります。ここに示されている5層アーキテクチャーは、各レベルで容量と取得時間のトレードオフが異なる、最適化された将来の姿を表しています。近接メモリ(つまり広帯域幅メモリ)は、最もアクティブなKVをGPUに最も近い場所に保持します。メインメモリは、アクティブなコンテキストのための容量を追加します。分散型メモリは、ノード以上に大きなワーキングセットをプールします。コンテキストメモリストレージは、再計算よりも早い呼び出しを実現し、持続性を提供します。ネットワーク接続されたKVレイクは、この階層をエクサバイト規模のロングコンテキストに拡張します。データセンターのアーキテクトは、独自のワークロードやアプリケーション基盤に最適化するようKVキャッシュ層を構成することになります。効率性は、KVキャッシュを適切なタイミングで適切な層に配置し、取得、退避、再計算を最適に調整することによって実現されます。
実行を担う側
推論は、仕事の半分に過ぎません。エージェント型AIには行動が不可欠であり、そこで運動皮質の出番となります。メインメモリは、リアルタイムでの推論、生成、意思決定といった実行処理を支えます。分散型メモリは、CPUのメモリ要件が制約を超えないよう、メモリフットプリントを拡張するために使用できます。これは、システムを十分に活用できないことよりも拡張する方が望ましいためです。コンテンツメモリストレージにより、アプリケーションの一時停止と再開が可能になり、ローカルデータを永続的に保存できるようになります。ネットワーク接続されたデータレイクは、データセンター全体でデータを収集・保存するために必要な大規模ストレージを提供します。エージェントは、CPU上で実行する際、あらゆる行動においてこれら4つの階層すべてを活用します。両方のスタックにおいて同様のメモリおよびストレージテクノロジーが登場しますが、そこにかかる負荷はそれぞれ異なる方向から生じます。推論側は、デコードパイプラインを常に稼働させ続けなければなりません。実行側は、状態を保持し、決定を行動に移さなければなりません。双方のスタックが、より大容量かつ高速なメモリとストレージへのニーズを押し上げています。
両スタックの全階層を最適化する設計
4つの階層からなる実行スタックと並行して、5つの階層まで拡張可能な最適化された推論階層、これこそが「メモリの壁」を打ち破るアーキテクチャーです。すべてのシステムがすべての階層を実装するわけではなく、最適な設計は、ワークロードの規模、レイテンシー目標、そして取得コストと再計算コストの比較によって決まります。両方のスタックにわたって意図をもって階層を設計すれば、この壁を取り崩すことが可能です。パート3では、両方のスタックのあらゆる階層におけるニーズに対して、マイクロン製品がどのように対応しているかを紹介します。