Morgan Stanley: Escassez de memória para IA deve durar vários anos; três caminhos para superar o impasse; armazenamento e computação heterogênea apresentam oportunidades estruturais
Morgan Stanley publicou um relatório de pesquisa sobre o setor de semicondutores, apontando que a escassez de memória DRAM irá persistir ao longo deste ciclo da indústria de IA, e a expansão da capacidade de processamento de IA não irá aguardar a construção e entrada em operação de novas fábricas de wafers.
De acordo com o aplicativo de notícias financeiras Zhihu Caijing em Brazilian Portuguese, o Morgan Stanley divulgou um relatório de pesquisa sobre o setor de semicondutores, destacando que a escassez de memória DRAM persistirá durante todo este ciclo da indústria de IA, e a expansão da capacidade de computação de IA não aguardará a construção de novas fábricas de wafers. O setor está contornando o gargalo de memória por meio de três principais caminhos tecnológicos: redução do hardware, desacoplamento da arquitetura de inferência e pool de memórias CXL, promovendo continuamente a construção da capacidade de computação sob restrições de oferta. O banco continua otimista em relação aos líderes em armazenamento, como Micron (MU.US) e SanDisk (SNDK.US), e também sobre as oportunidades crescentes nos segmentos de interconexão CXL e inferência heterogênea, recomendando Astera Labs (ALAB.US), Marvell (MRVL.US), Cerebras (CBRS.US) e Nvidia (NVDA.US).
Morgan Stanley enfatiza que a atual escassez de memória de IA não é uma perturbação de curto prazo, mas uma contradição estrutural em que o crescimento do desempenho computacional supera em muito a velocidade de oferta de memória. O tamanho dos principais modelos de IA dobra a cada seis meses, a janela de contexto dos principais modelos aumenta 5-6 vezes por ano, e isso, combinado com o aumento contínuo da demanda por inferência paralela, faz com que a capacidade e a largura de banda da memória explodam em demanda. Por outro lado, a construção de fábricas de DRAM leva anos e a elasticidade da oferta é extremamente baixa, então o cenário de escassez continuará por vários anos. O CEO da Nvidia, Jensen Huang, também afirmou publicamente que a indústria precisa mudar sua abordagem, enfrentando as restrições de memória com inovação em arquitetura, e não apenas esperando pela expansão de capacidade.
Frente à escassez de HBM e memória principal, a resposta mais direta do setor é reduzir seletivamente as especificações de memória por dispositivo (De-speccing). Tomando como exemplo a arquitetura Rubin da Nvidia, a capacidade LPDDR5 por nó foi reduzida de 54TB originalmente planejados para 28TB, e a capacidade HBM por GPU foi reduzida de 288GB para 192GB, garantindo assim a quantidade total de máquinas despachadas por meio da redução da altura de empilhamento da memória. Morgan Stanley aponta que a redução de especificações não elimina o gargalo da memória, apenas transfere a pressão entre diferentes níveis de memória: ao reduzir a memória local de alta velocidade, dados de baixa frequência, como caches KV, migram para armazenamento NAND, enquanto a interação de dados entre GPUs aumenta, impulsionando a demanda por largura de banda de interconexão de rede. Essencialmente, isso significa complementar a memória de alta largura de banda escassa com interconexão de rede mais rápida e recursos de armazenamento de menor custo.
O segundo caminho para contornar os desafios é o desacoplamento da arquitetura de inferência (Disaggregation). A inferência em IA inclui duas etapas distintas: pré-preenchimento (Prefill) e decodificação (Decode): o Prefill consome principalmente poder de computação, enquanto o Decode depende fortemente da largura de banda da memória. Arquiteturas tradicionais usam o mesmo acelerador para ambas as tarefas, resultando em baixa utilização de recursos. Atualmente, o setor está avançando rapidamente para a inferência heterogênea, subdividindo esses dois estágios em diferentes hardwares: tarefas intensivas em computação, como Prefill, ficam a cargo de GPUs genéricas, enquanto o Decode, que exige alta largura de banda de memória, é realizado por chips aceleradores dedicados com grandes quantidades de SRAM on-chip.
Exemplos típicos incluem o engine em escala de wafer da Cerebras e a arquitetura Groq LPU, adquirida pela Nvidia, ambos capazes de oferecer uma eficiência de largura de banda de memória muito superior à de GPUs tradicionais durante o estágio de decodificação. Morgan Stanley acredita que a inferência heterogênea se tornará uma direção importante para a evolução da infraestrutura de IA, e empresas especializadas em computação para a etapa de decodificação terão um mercado incremental claro.
O terceiro caminho é a reconstrução do sistema de memória usando tecnologia CXL. O CXL (Compute Express Link - Interconexão Computacional de Alta Velocidade) permite a expansão, compartilhamento e pooling de memórias através de alta velocidade, liberando a memória da associação exclusiva a um único processador, tornando-se assim um caminho essencial para superar as restrições de capacidade de memória. Morgan Stanley estima que a demanda de IA impulsionará o mercado de CXL e chips de memória relacionados para cerca de 6 bilhões de dólares até 2030, superando de longe o tamanho do mercado tradicional de expansão de memória para CPUs. Seu valor central reside na construção de uma arquitetura de memória em camadas: dados de frequência mais alta ficam no HBM, dados de média frequência vão para o pool de memórias CXL, e dados frios de baixa frequência descem para o NAND, alinhando o custo do recurso à frequência de acesso aos dados.
Em relação às principais linhas de investimento, Morgan Stanley reafirma três direções: primeiro, continuar com superalocação em Micron e SanDisk, já que a redução das especificações decorre da escassez de oferta e não da fraqueza da demanda; a demanda de IA por memória permanece em alta no longo prazo e o déficit de oferta continuará absorvendo a capacidade; segundo, posicionar-se nos líderes em CXL e interconexão scale-up, como Astera Labs e Marvell; e terceiro, observar os beneficiários da inferência heterogênea, como Cerebras, além da Nvidia, que aprimorou sua disposição heterogênea com a aquisição da Groq.
Riscos: O crescimento da demanda por capacidade computacional em IA pode ser inferior ao esperado; a implementação da tecnologia CXL pode ser mais lenta do que o previsto; a expansão da capacidade de memória pode superar as expectativas.
Aviso Legal: o conteúdo deste artigo reflete exclusivamente a opinião do autor e não representa a plataforma. Este artigo não deve servir como referência para a tomada de decisões de investimento.
Talvez também goste
Após liberar reservas junto ao G7, Trump planeja nova ação para conter preço do petróleo antes das eleições: supostamente pretende flexibilizar restrições ao uso do “diesel vermelho” isento de impostos
Segundo relatos, o governo Trump deverá anunciar as propostas relevantes já nesta segunda-feira, e o uso do diesel vermelho pode ser expandido para veículos rodoviários. Na última sexta-feira, o G7 anunciou a liberação de 100 milhões de barris de reservas emergenciais de petróleo e o lançamento de grandes quantidades de diesel nos primeiros 20 dias. Depois, Trump declarou que os Estados Unidos não irão mais implementar a proibição de exportação de diesel. A Europa possui grandes estoques de diesel, e os Estados Unidos também aumentarão o fornecimento.
Venda de títulos do Tesouro dos EUA impulsiona rendimentos a níveis mais altos em décadas; Citadel: crescimento econômico e investimentos em IA intensificam a competição por capital
A Citadel Securities acredita que a recente venda de títulos do governo dos EUA, com os rendimentos atingindo níveis máximos em décadas, não é impulsionada principalmente pela preocupação do mercado com a deterioração adicional da inflação. Em vez disso, é resultado do crescimento econômico contínuo dos EUA, dos investimentos em inteligência artificial (IA) e do aumento do déficit governamental, que intensificam a disputa por capital.
A incerteza fiscal e política na França abala o setor financeiro! Os principais indicadores de risco de crédito dos três maiores bancos sobem, com aumento significativo no custo do seguro contra inadimplência de títulos
À medida que as preocupações do mercado sobre a situação fiscal e o cenário político da França se espalham para o mercado de crédito, os indicadores de risco de crédito dos títulos de grandes bancos franceses aumentaram significativamente.
Os títulos soberanos europeus soam o alarme, mas o mercado de ações continua resiliente! O diferencial entre França e Alemanha registra o maior aumento semanal em mais de 30 anos, e o Deutsche Bank alerta que esse descompasso pode não durar.
O mercado de títulos soberanos europeus enfrentou uma pressão significativa na semana passada, mas os mercados acionários europeus e o mercado de crédito corporativo reagiram de forma discreta, resultando em uma rara divergência entre diferentes classes de ativos.
