GPU不足がまだ解消されていない中、今度はCPUも奪い合いになる可能性 がある
2026年5月31日、Nvidiaは88個のカスタムコアを搭載したCPU「Vera」が本格的に量産に入ったと発表しました。VeraはArm命令セットとNvidia自社開発のOlympusコアを採用し、Vera Rubinスーパーコンピューティングプラットフォームに搭載されるほか、単体でCPUサーバーにも組み込まれます。Dell、HP、Lenovo、Supermicroおよび複数のサーバー企業が、すでにVeraを搭載したシステムの製造を開始しています。
NvidiaはVeraを「AIエージェントのために設計された最初のCPU」と位置づけています。VeraはRubin GPUと共にプラットフォームを構成したり、独立したCPUサーバーにも搭載されます。長年GPUを販売してきたNvidiaが再びCPU計算能力単体の販売に乗り出したことは、一見すると異例な出来事です。
画像丨Nvidia Vera(出典:Nvidia)
過去3年間、AI産業のハードウェアへの関心・懸念はほぼGPUに集中していました。トレーニングも推論も、そしてモデルパラメータやユーザー数が増えるごとに答えは常に「より多くのGPUが必要」。CPUはタスクの起動やデータの搬送、サーバーの管理といった役回りを担っていましたが、投資家にとっては主役ではありませんでした。
AI Agentがタスクの在り方を変えるまでは。
一般的なチャットボットがテキストを受け取ってモデルを1回だけ実行し、返答する仕組みに対し、Agentはモデルの判断を実際の操作へと変換します。ファイルの読み書き、Web検索、データベース照会、APIの呼び出し、コードの実行などを行い、結果を再びモデルに返します。一つのタスクで十数回の「推論―操作―観察」ループが行われ、そのたびにCPUとGPUを行き来します。
GPUは依然として大規模なモデル計算を担いますが、モデル出力の解析やツールの種類判定、リクエスト送信、プログラムの実行、ファイル管理、結果の収集と次のタスク手配など、ほとんどはCPUで処理されます。AMDの計算および企業AI担当VP Madhu Rangarajanは、自社の実運用パイプラインで8つのフェーズのうち7つが完全にCPU上で稼働していると述べています。この比率はAMD内部テストの値で全てのシステムを代表するものではないものの、モデル推論はエージェントがタスクを完了する一部であり、それ以外のすべての調整や管理はCPUに委ねられていることを示しています。
単一のエージェントによるCPU負荷は小さいとしても、規模が拡大するとその消費は膨大なものになります。
一つのエージェントは複数のツールを同時に呼び出せますし、サブエージェントの作成も可能です。企業が同じシステムを何万人もの従業員に展開した場合、並列タスク数は急激に増えます。それぞれのエージェントが出力解析、コード実行、データ読み書きを行い、CPU負荷も断片的なものから積み重なり容量要件となります。CPUの処理が遅ければ、GPUは次の推論用入力を待たされることになります。
セキュリティチェックの強化もCPUへの負担を増しています。エージェントに権限を与えれば与えるほど、どのファイルを開いたか、どのAPIを呼び出したか、機密データに接触したかなど、システム側のチェックが不可欠になります。ルールマッチングやログ解析、小規模モデルによる審査などは分散・低遅延が求められ、GPUを個別に呼ぶほどコスパがよくありません。そのため、エージェントがより自律的になるほど検査項目が増え、CPU負担も重くなります。
今年7月には、OpenAIのエージェントが社内セキュリティ評価でサンドボックスを突破し、Hugging Faceのプロダクションシステムに侵入するという事件が起きており、このようなセキュリティメカニズムの重要性、そして実装に伴うコストの大きさを物語っています。
もう一つ見落とされがちな負担がトークナイゼーションです。
大規模言語モデルでテキストを扱う際は、まず文字列をTokenに変換します。この過程は大量の文字列処理と分岐判定を含み、GPUのような行列演算向きではありません。通常の会話では入力が非常に短く、トークナイゼーションの遅延はほとんど問題になりませんが、エージェントはツールの返却結果やコード、ログ、歴史的操作の積み増しにより、入力が数万〜数十万Token規模に伸びることがあります。
ジョージア工科大学の博士課程Euijun Chungは、IEEE Spectrumのインタビューで、ある実装では既に10万Tokenのコンテキストへさらに1,000Tokenのツール結果を加えた場合、トークナイザーが全体を再処理するケースを紹介しています。プリフィックスキャッシュやインクリメンタル・トークナイゼーションによって重複処理を減らすことも可能ですが、すべてのシステムでそうなるわけではありません。長文入力によるCPU負担は依然として重いのです。
Chungチームは最新論文でLlama 3.1やQwen3などのモデルを検証しています。長いシーケンスや大バッチ設定では、トークナイゼーションが最初のToken遅延の約80%を占める場合もありました。CPUコアが足りないと、トークナイザーのスレッドがタスクスケジューリングやGPUカーネル起動とリソースを奪い合い、結果としてCPUはフル稼働し、GPUはフルに活用されない状況が起こります。CPUコアを増やした場合、設定によって初Token遅延が1.47~5.15倍改善され、GPUを増やさずとも効果が得られます。
業界データもこの変化に呼応し始めています。2026年1月、KeyBancはサプライチェーン調査に基づき、Intelの年間サーバー向けCPU生産能力の大半が既に売り切れており、AMDも供給がフル稼働状態で、両社は値上げ余地があると判断しています。これはアナリストの推計で、メーカーの公式受注データではありません。
その後のIntelの財務書類も一部それを裏付けています。サーバー向けCPUの需要が2026年第1四半期に供給を上回り、内部生産能力の制限が年末まで続く見込みです。サーバー製品の平均価格は前年同期比27%上昇した一方で、出荷量は5%減少。Intelは値上げの理由を高付加価値製品割合の上昇と需要価格設定、コスト増加にあると説明しています。
AMDの同期間データセンター事業収入は58億ドルで、前年比57%増となりました。この成長はEPYCサーバーCPUとInstinct GPUの両方から生じており、サーバーCPU事業単体の伸び率は開示されていません。そのため、57%すべてをAIエージェント需要に起因すると断定はできません。
今後の見通しについてはより積極的です。AMDはかつてサーバーCPU市場の年間成長率を約18%と予測していましたが、2026年5月にその予測を35%以上に引き上げ、市場規模が2030年までに1,200億ドルを超える見通しとしています。AIエージェントには、オーケストレーションやデータ処理、ツール実行およびセキュリティチェックを担う独立したCPUコンピューティング層が必要である、というのがその理由です。
従来のデータセンターでは、1つのCPUで4〜8つのGPUを管理することが一般的でした。AMDは、AIエージェントシステムでは、この比率が1:1に近づいていると観察しており、一部のワークロードではそれ以上に多くのCPUを必要としています。これはあくまでも顧客のニーズをもとにしたサプライヤの評価であり、実際の構成はワークロードによってさまざまです。ただ、構成バランスの方向が変わりつつあるのは明らかで、CPUを数個追加するだけでは足りず、クラウド事業者はAIエージェント専用のCPUラックの構築を検討し始めています。
Armも2026年3月に、プロセッサ設計のライセンス提供のみならず、初めてデータセンター向けCPUの直接販売に乗り出しました。そのAGIプロセッサは最大136コアで、Metaも開発に参加しています。Armは、同じ消費電力でエージェントデータセンターに必要なCPU容量は、現行データセンターの4倍以上に達すると見込んでいます。
クアルコムもすぐに250コア超のDragonfly C1000を発表し、Metaと複数世代サーバーCPU協業契約を締結しました。Intel、AMD、Arm、クアルコム、そしてNvidiaが「AIエージェント用CPU」を各社の製品ロードマップに相次いで加えたことで、競争は従来のx86市場のみならず、Armサーバーや独自設計コア、さらには専用ラック設計にまで拡大していることが分かります。
Nvidiaはこの中でも特別な立ち位置にいます。CPU負荷を生むGPU自体を販売する一方で、その負担緩和となるVeraも販売。プロセッサ、ネットワークからストレージまで、Nvidiaは機器一式を提供可能です。Veraは単なるラインナップ拡大にはとどまらず、GPUの稼働率を守る役割もあります。GPUの待機時間が1秒減れば、それはより多くのトークン生成やラック収入増加に直結します。
ただし、チップメーカーが利益を追い求める中で、その皺寄せは結局私たち消費者へ戻ってきます。GPUやメモリチップと同様に、今回の生産能力変化によるコストもまた消費者負担となる可能性は高いです。
Intelは2025年第4四半期の決算説明会にて、社内ウェーハ供給はできる限りデータセンター向けにシフトし、クライアント製品は外部ファウンドリ比重を高めていると説明しました。その後、完全なクライアント撤退はできないとも補足しています。2026年第1四半期にはクライアント向けCPUの平均価格は前年同期比16%上昇、出荷量は13%減となり、供給制約は少なくとも上半期まで続く見通しです。
クライアント製品の価格・供給変動はAIエージェントだけが原因ではありません。Intelのプロセス変更や、社内外生産能力・メモリ供給も価格や出荷に影響します。しかし供給が限られる中で、サーバーチップはコア数が多く高価で、クラウド事業者は長期契約も進んで結ぶため、生産リソースは必然的にデータセンターへ向かいがちです。
過去3年間、一般消費者は既にGPUの価格高騰や品薄を経験しました。今度は同じことがCPUでも起きるかもしれません。
運営・レイアウト:何晨龍
注記:カバー画像/トップ画像はAI支援で生成されています
免責事項:本記事の内容はあくまでも筆者の意見を反映したものであり、いかなる立場においても当プラットフォームを代表するものではありません。また、本記事は投資判断の参考となることを目的としたものではありません。
こちらもいかがですか?
米国が「次世代コンピューティング革命」を加速!GlobalFoundries (GFS.US) が3.75億ドルの量子コンピューティング補助金を獲得、量子の新興勢力も同時に資金を獲得
グローバルファウンドリーズは火曜日、量子技術ソリューション(QTS)事業の成長軌道を加速するため、アメリカ商務省の「CHIPS法案」研究開発オフィスと最終合意に達し、3億7500万ドルの研究開発助成金を受けることを発表しました。

データセンターの交渉力が変化:以前はクラウド事業者が主導していたが、今では「CoreWeave」などが強気になってきた

米国債5%と原油価格100の競争:この2つの節目が同時に突破された場合、どの資産が最も脆弱か?

高騰する原油価格とAI取引ブームの後退に挟まれ、米国株式市場の工業セクターは今、モメンタムの清算を経験している
過去3週間、これまで順調に上昇してきた米国工業株が突然モメンタムの反転に見舞われ、一部の投資家は今後さらに大きな圧力に直面すると予想しています。

