FMS 2026 | 全4回の第3回
メモリとストレージが制約のあるインフラストラクチャからより多くの有用なAI処理を引き出す仕組み
パート1では、エージェント型AI時代における「メモリの壁」について取り上げました。パート2では、その階層構造を示しました。推論向けに最適化された5層のスタック、実行向けの4層のスタック、そして異なる負荷の下でそれぞれ異なる役割を担うメモリとストレージの各技術です。今度は、この配置の考え方をKVキャッシュだけでなく、インフラストラクチャ全体へと広げる必要があります。つまり、データセンター内の限られたリソースを活用して、どうすればより多くの有用なAI処理を実現できるのかということです。そこで重要になるのが、製品ポートフォリオです。各階層に合わせて構成され、推論と実行の両方のスタックに対応する各製品が、それぞれ異なる課題を解決します。これらを組み合わせることで、システム全体のリソースをより有効に活用できるようになります。
ここで重要なのは、マイクロンが各カテゴリーに製品をそろえていること自体ではありません。今や各カテゴリーはそれぞれ独立して機能するのではなく、互いに依存し合いながらシステム全体を支えています。だからこそ、エージェント型AIの競争で優位に立つには、制約のあるデータセンターに、活用しきれるとは限らない演算能力をさらに追加するだけでは不十分です。鍵となるのは、既存のリソースをより有効に活用することです。つまり、すでにある電力、スペース、シリコンから、より多くの有用なAI処理を引き出すことです。HBMは、最も頻繁にアクセスされるコンテキストを高速に処理し続けます。SOCAMM2とRDIMMは、より大きなワーキングセットを、必要なときにすぐ利用できる位置に保持します。CXLプール型メモリは、使われていないメモリ容量を有効活用します。SSDは、処理状態を保持します。高密度データレイクストレージは、長期コンテキストをいつでも利用できる状態に保ちます。これは単なる部品の寄せ集めではありません。エージェント型AIに求められるアーキテクチャーそのものです。
飛躍はXPUに最も近いところから始まる
推論処理では、帯域幅がボトルネックになることが少なくありません。ここでは、GPUやTPU、カスタムAIシリコンなどのAIアクセラレーター全般をXPUと呼びますが、どれほど高速なXPUでも、データ待ちでアイドル状態になることがあります。演算能力を追加するだけでは、この問題は解決できません。必要なのは帯域幅です。だからこそ、HBMはトークンエコノミーにおいて極めて重要です。アクセス頻度の高いアクティブなコンテキストをアクセラレーターに近い高速なメモリ階層で保持し、デコードパイプラインへのデータ供給を途切れさせないからです。メモリ帯域幅がボトルネックとなる推論ワークロードでは、HBMの帯域幅を高めることで、帯域幅そのものの増加率を上回るトークンスループットの向上が得られる場合があります。これは、同じXPUからより高い処理能力を引き出せるためです。まさにそのために、マイクロンでは36GB、12層のHBM4を本格量産しています。スタックあたり2.8TB/秒を超える帯域幅を実現し、電力効率も前世代と比べて20%以上向上しています。今後の世代では、さらに進化します。カスタムHBMでは、一部のロジックをメモリスタックの近くに配置することもできます。これによりXPUへの負荷を軽減し、コスト、消費電力、システム全体をさらに最適化する余地が生まれます。これまでメモリは、XPUの隣で処理の順番を待つ存在でした。しかし今後は、処理そのものにより直接的な役割を果たすようになっていくでしょう。この変化こそ、まさに飛躍です。
見落とされがちなしきい値
長年、業界ではインフラストラクチャを演算能力中心に考えてきました。つまり、「プロセッサーはどれほど高速か」という視点です。しかし、今や問うべきなのはそこではありません。本当に重要なのは、必要なデータを必要な場所に保持できているかということです。AIでは、必要なメモリ容量にあと一歩届かない構成こそ、結果として最も高くつきます。必要な容量のしきい値を下回ると、パフォーマンスは緩やかに低下するのではなく、スピルやエビクション、再計算が発生して一気に落ち込みます。SOCAMM2は、まさにこの問題を解決するためのものです。XPUと同じシステム内でHBMのすぐ下の階層に位置し、大容量のメモリを提供します。実行スタックでも、同じ階層に同様の大容量メモリが必要ですが、接続先となるプロセッサーはXPUではなくCPUです。CPUに対してRDIMMが果たす役割は、XPUに対してSOCAMM2が果たす役割と同じです。つまり、階層も考え方も同じで、組み合わせるプロセッサーが異なるだけです。
エージェントに合わせてサーバーを拡張する
どれほど潤沢なメモリを搭載していても、1台のサーバー内に固定されていれば、その容量を柔軟に活用することはできません。そのサーバーで使われていないメモリは、隣のサーバーでどれほど必要とされていても、活用されないままです。目指すべきなのは、システムに収まるようエージェントを縮小することではありません。エージェントに合わせてシステムを拡張することです。ラック全体のメモリを動的にプールし、必要な場所で必要なときに利用できるようにします。単なるコールドな退避先ではなく、ワークロードに合わせて最適化されたアクティブメモリとして活用するのです。CXLベースのプール型メモリも、この考え方に基づいています。ラックスケールシステムでは、1台の4Uシャーシで最大40TBのDDR5メモリを利用でき、メモリ負荷の高いAI、HPC、データベースワークロード向けには、ラック全体で160TBを超える規模まで拡張できます。マイクロンとエコシステムパートナーによる実証では、リソースに制約のあるワークロードでも、メモリをディスアグリゲーションすることで、XPUの使用量を抑えながら、1秒あたりのトークン数を大幅に増やせることが示されています。これこそ、リソースの有効活用を端的に示す例です。XPUを増やすのではなく、既存のXPUに必要なデータをより効率よく供給するのです。実行スタックでも同じ理由から同じファブリックをプールすることで、CPUに必要なメモリを1台のサーバー内に固定する必要がなくなります。
まだ見ぬワークロードに備える
純粋な速度では、HBMとメインメモリに勝るものはありません。しかし実際には、そこに収まりきらないほどのデータが存在し、そのデータを1回のセッションが終わった後もどこかに保持しておく必要があります。その役割を担うのが、一段下のストレージ階層です。データを永続的に保持しながら高速にアクセスでき、将来のワークロードが登場する前から、そのニーズに備えて準備しておくことができます。
マイクロンは、PCIe® Gen6 SSDであるMicron 9650のサンプル提供を、量産開始の1年以上前に開始しました。この先行投入によってエコシステムには十分な準備期間が生まれ、今回の量産立ち上げを過去の世代交代よりも速いペースで進められる理由の一つとなっています。Micron 9650は、エージェント型AIプラットフォームの次の波が到来してから後追いで対応するのではなく、その到来に合わせて投入できるよう開発されました。マイクロンにとってリーダーシップとは、エコシステムが十分に準備できるよう、早い段階から製品をお客様の手元に届けることです。最新のXPUプラットフォームには、大量のデータ移動に追随できるストレージが必要です。PCIe Gen6ストレージは、まさにその役割を果たすために設計されています。
効率性のメリットも明確です。目標とする読み取り性能を実現するために従来はPCIe Gen5ドライブが8台必要だったシステムでも、Micron 9650なら4台で同等の性能水準に達する可能性があります。Micron 9650はGen5ドライブの最大2倍の読み取り性能を実現するとともに、ワットあたりの性能も大幅に向上しているためです。つまり、同じ電力やスペースなどの制約の中で、ドライブ数、消費電力、設置スペースを削減しながら、より多くの有用な処理を実行できます。Micron 9650はE1.Sフォームファクタで液冷にも対応しており、E1.SとE3.Sの両フォームファクタをラインアップしています。最新のAIデータセンターが直面する厳しい熱設計要件に対応しながら、既存のインフラストラクチャを最新ハードウェアに更新する必要がある空冷環境にも対応できる設計です。マイクロンのPCIe Gen5 SSDであるMicron 7600は、まだGen6を必要としないワークロードをカバーし、製品ポートフォリオを補完します。
実行スタックでも同じドライブを活用しますが、その目的は異なります。エージェントが毎回最初からやり直すのではなく、処理を一時停止し、その続きから再開できるようにするためです。最初からやり直すたびに、時間、演算リソース、コンテキストが無駄になります。ローカルに状態を永続的に保持することで、こうした無駄を減らし、その分を有用な処理に充てることができます。
データレイクの基盤が再構築される
階層の最下層に位置するのがデータレイクです。エージェント型AIはここにあらゆる情報を保存し、必要に応じて呼び出します。そして、従来よりもはるかに高い頻度でコールドデータを活用し、新たなインサイトへとつなげます。推論スタックは、長期コンテキストを利用するためにこのデータレイクを活用します。実行スタックも同じ基盤を利用し、すべてのアクションを実際のエンタープライズデータに基づいて実行します。データをより少数の高密度ドライブに集約すれば、同じ設置面積の中でデータセンターからより多くの処理能力を引き出すことができます。容量密度が高まり、ストレージ帯域幅への要求も増大する中、ストレージアーキテクチャーにはさらに高い耐障害性も求められます。その一例が、高速なパスフェイルオーバーに対応するデュアルポート構成です。ハードディスクでは、この時代に求められるスケールに対応できません。ワークロードがテラバイトあたりの性能をより必要とするまさにそのときに、その性能が低下してしまうからです。現在、その答えとなるのが245TBのMicron 6600 IONです。市販SSDとして世界最大容量を実現し、1ラックあたり176PBを超える容量を可能にします。マイクロンは、次なるデータ増大の波に向けて、クラウドストレージ最適化SSDを開発しています。ワットあたりの帯域幅を高め、ラックあたりの容量を増やし、より小さな設置面積からより多くの有用なAI処理を引き出します。
メモリの壁を、階層ごとに取り払う
推論側には5つの階層があります。実行側には4つの階層があります。同じようなメモリとストレージ技術が、それぞれ異なる負荷の下で異なる役割を担っています。それが、データセンターのあらゆる階層に対応するということです。メモリの壁を打ち破るとは、制約のあるインフラストラクチャから、より多くの有用なAI処理を引き出すことです。お客様が直面する電力やスペースの制約の中で、より多くのトークンを処理し、より多くのユーザーに対応し、より多くの状態を保持し、より多くの長期コンテキストを利用できるようにすることです。壁を取り払うには、その前に足元の基盤を築かなければなりません。パート4では、同じ問いをデータセンターの外へと広げます。AIがデータセンターを離れた先で、どこで動作するのかを見ていきます。