Bitget App
Trade smarter
Kup kryptoRynkiHandelFuturesEarnAICentrumWięcej
Ming-Chi Kuo: Nvidia wznawia projekt optymalizacji chipów do wnioskowania Rubin CPX

Ming-Chi Kuo: Nvidia wznawia projekt optymalizacji chipów do wnioskowania Rubin CPX

华尔街见闻华尔街见闻2026/09/01 11:01
Pokaż oryginał
Przez:华尔街见闻

Znany analityk Ming-Chi Kuo przeprowadził badania, z których wynika, że Nvidia wznawia prace nad chipem do wstępnego ładowania AI "Rubin CPX", którego masowa produkcja planowana jest na początek 2027 roku. Nowa wersja będzie wyposażona w 168 GB pamięci HBM4, pobór mocy wyniesie 2300 watów, a wydajność obliczeniowa będzie zbliżona do standardowego Rubin GPU. Ten chip wykorzystuje niezależną, modułową ramę i warstwową architekturę połączeń; jest wdrażany w stosunku 1:1 z Rubin GPU, skupiając się na wstępnym ładowaniu oraz generowaniu KV Cache, co pozwala na obniżenie kosztów długiego kontekstowego wnioskowania.

Nvidia po cichu wznowiła projekt chipów, który wcześniej uznano za porzucony przez rynek, a jego celem jest bezpośrednie obniżenie kosztów AI w fazie prefillingu (Prefill).

Najświeższe badania branżowe znanego analityka Guo Mingchi pokazują, Nvidia wznowiła projekt GPU przyspieszających fazę prefillingu AI o nazwie „Rubin CPX”, dokonując znacznych zmian w projektowaniu produktu. Według obecnych planów, nowa wersja Rubin CPX ma wejść do produkcji w pierwszym kwartale 2027 roku.

Wznowienie projektu jasno sygnalizuje: Nvidia intensyfikuje działania mające na celu rozwiązanie problemów z wydajnością i kosztami fazy prefillingu w AI. Wraz z rosnącą długością kontekstu w dużych modelach, faza prefillingu musi przetwarzać ogromne ilości danych wejściowych i generować KV Cache, a jej efektywność bezpośrednio wpływa na całkowite koszty i opłacalność wdrożenia AI.

Guo Mingchi wskazuje, że obecnie ponad 50% obciążenia związanego z inferencją AI pochodzi z obsługi wejściowego kontekstu oraz budowy KV Cache.

Specyfikacja chipów znacznie zmodyfikowana, moc obliczeniowa zbliżona do standardowego Rubin

Rdzeń nowej wersji Rubin CPX znacznie różni się od wcześniejszego projektu.

Jeśli chodzi o moc obliczeniową i pobór energii, wydajność nowego CPX zbliża się do standardowego Rubin GPU, a maksymalny pobór prądu pojedynczej karty również sięga 2300 watów. W zakresie pamięci nowy CPX korzysta z 168GB pamięci HBM4, co stanowi wyraźny upgrade w stosunku do poprzednich 128GB GDDR7, choć nadal jest mniej niż 288GB HBM4 w standardowym Rubin GPU.

Według Guo Mingchi, całkowita pojemność HBM4 w tacce obliczeniowej z 8 kartami CPX wynosi około 1,34TB, co wystarcza do większości długich obciążeń prefillingu i odpowiadającym potrzebom KV Cache. To oznacza, że Rubin CPX nie dąży jedynie do wyższej uniwersalnej mocy obliczeniowej, lecz został specjalnie zaprojektowany pod kątem pojemności pamięci i efektywności prefillingu w scenariuszach z długim kontekstem.

Od wspólnego racka do niezależnej instalacji, elastyczność konfiguracji

Architektura racka to także główny punkt tej zmiany.

W poprzednim projekcie CPX miał dzielić rack z Rubin GPU; nowa wersja przewiduje niezależne racki MGX ETL, co umożliwia klientom samodzielną rozbudowę mocy obliczeniowej CPX w zależności od potrzeb.

Konkretnie klienci mają możliwość wyboru instalacji z 64, 128, 192 lub 256 GPU CPX. Każde 64 GPU CPX składają się na jeden moduł racka, obejmujący 8 tacek obliczeniowych, z których każda ma 8 GPU CPX wraz z tacą switcha.

Modułowa konstrukcja oznacza, że klienci nie muszą kupować dużych racków Rubin według stałych wymiarów, tylko mogą elastycznie powiększać moc CPX zgodnie z rzeczywistym zapotrzebowaniem prefillingu.

Warstwowa konstrukcja sieci, niższe koszty wdrożenia prefillingu

Rubin CPX zastosował warstwową architekturę interkoneksji, wybierając kompromis między wydajnością a kosztami.

Wewnątrz pojedynczej tacy obliczeniowej 8 GPU CPX rozbudowuje się poprzez NVLink (Scale-up). Każde GPU CPX oferuje przepustowość NVLink na poziomie 1–1,5TB/s, co jest niższe niż 3,6TB/s w standardowym Rubin GPU.

Na poziomie Scale-out między tacami oraz wewnątrz modułu racka CPX posługuje się Spectrum-6 Ethernet (L1, full copper); do połączeń między rackami służą switche Spectrum-6 oraz światłowodowe linki OSFP.

W porównaniu do całkowitego oparcia się na wysokiej przepustowości GPU, taka warstwowa architektura lepiej optymalizuje koszty dla scenariuszy prefillingu.

Synergia z Rubin GPU, cel: długie konteksty inferencji

Rubin CPX nie jest uniwersalnym GPU do samodzielnej pracy, lecz przyspieszaczem prefillingu przeznaczonym do współpracy z Vera Rubin NVL72.

Według Guo Mingchi, Nvidia poleca wdrażanie CPX i Rubin GPU w proporcji 1:1: CPX realizuje obliczenia prefillingu i generuje KV Cache, który jest następnie przesyłany przez Ethernet RDMA do Rubin GPU, gdzie następuje dalsze dekodowanie.

Pod względem pozycjonowania produktowego, Rubin CPX nie zastępuje standardowego Rubin GPU, lecz umożliwia dalszy podział procesu inferencji AI, delegując prefill i dekodowanie oddzielnym GPU.

Guo Mingchi określa to jako „najbardziej opłacalne rozwiązanie dla długich kontekstów prefillingu”. Wraz ze wzrostem okna kontekstu w modelach AI, rosną też obliczenia i wielkość KV Cache w fazie prefillingu. Restart projektu CPX przez Nvidia oznacza próbę dalszego obniżenia kosztów inferencji w długich kontekstach poprzez dedykowany sprzęt i heterogeniczne wdrożenia.

0
0

Zastrzeżenie: Treść tego artykułu odzwierciedla wyłącznie opinię autora i nie reprezentuje platformy w żadnym charakterze. Niniejszy artykuł nie ma służyć jako punkt odniesienia przy podejmowaniu decyzji inwestycyjnych.

PoolX: Stakuj, aby zarabiać
Nawet ponad 10% APR. Zarabiaj więcej, stakując więcej.
Stakuj teraz!

Może Ci się również spodobać

Samsung ogłasza plan rozwoju pamięci nowej generacji: wydajność HBM5 dwukrotnie wyższa niż HBM4E, zHBM przyspiesza wydajność ośmiokrotnie

Proces produkcji podstawowych chipów HBM5 został podniesiony do 2 nanometrów, celem jest osiągnięcie dwukrotnej wydajności względem HBM4E, zwiększenie wydajności na wat o 20%, a także zmniejszenie oporu cieplnego o 20%. Masowa produkcja przewidywana jest na 2028 rok. Całkowicie nowa architektura zHBM, docelowa wydajność to 8 razy wyższa niż HBM4E, wydajność na wat wzrosła trzykrotnie, opór cieplny zmniejszony od 75% do 90%, premiera przewidywana po 2029 roku.

华尔街见闻2026/09/01 20:51

Anthropic wprowadza Fable 5.1: ceny niższe nawet o 75%, wzmocnione możliwości programowania i badań naukowych

Kluczową zmianą w Fable 5.1 jest znaczne obniżenie opłaty za „trafienia w pamięci podręcznej” o 75%. Firma twierdzi, że przyniesie to „znaczny spadek” ogólnych kosztów. Oprócz obniżki cen, nowy model został również zoptymalizowany, aby do realizacji tych samych zadań używać mniej tokenów. Jednocześnie umożliwiono przechowywanie danych w chmurze klienta, aby odpowiedzieć na potrzeby firm, które mają rygorystyczne wymagania dotyczące suwerenności danych.

华尔街见闻2026/09/01 19:16

Basente spotyka się z prezesem Banku Japonii i wysyła silny sygnał: strona amerykańska wspiera umocnienie jena i podkreśla konieczność unikania nadmiernych wahań kursowych.

Według protokołu ze spotkania opublikowanego przez amerykański Departament Skarbu, podczas zeszłoniedzielnego spotkania z Kazuo Uedą, sekretarz skarbu USA, Bessent, „zdecydowanie poparł zdecydowane działania Japonii w zakresie polityki rynkowej i monetarnej w celu rozwiązania problemu wyraźnie niedowartościowanego kursu jena”, a także wskazał, że osłabienie jena potęguje presję inflacyjną w kraju. Według japońskich mediów, urzędnicy USA stwierdzili, że podczas spotkania Bessent wezwał Japonię do dalszych podwyżek stóp procentowych. Rynek spodziewa się, że prawdopodobieństwo podwyżki stóp przez Bank Japonii we wrześniu zbliża się do 100%.

华尔街见闻2026/09/01 18:31