Bezwentylatorowe chłodzenie cieczą CoolIT przesuwa szafy AI poza granice chłodzenia hybrydowego
CoolIT twierdzi, że jego bezwentylatorowe systemy chłodzenia cieczą mogą przechwytywać praktycznie całe ciepło generowane przez serwery AI, rozwiązując problem 75 kW wewnątrz szafy o mocy 250 kW.
Ta liczba pokazuje ograniczenia powszechnie stosowanego dziś podejścia hybrydowego. System, który odbiera cieczą 70 procent ciepła, nadal pozostawia 30 procent dla powietrza. Przy 250 kW wentylatory i urządzenia infrastruktury obiektu muszą odprowadzić pozostałe 75 kW.
CoolIT argumentuje, że takie obciążenie resztkowe coraz trudniej uzasadnić w systemach hybrydowych. Proponowana alternatywa rozszerza zastosowanie coldplate’ów poza procesory — na pamięć, sieć, pamięć masową i komponenty zasilania. Celem jest pozostawienie w powietrzu mniej niż 1 procent ciepła generowanego przez szafę.
Firma określa to niemal całkowitym przechwytywaniem ciepła, przyjmując 100 procent jako cel projektowy. To rozróżnienie jest istotne, ponieważ kable, płytki drukowane i inne powierzchnie nadal emitują niewielkie ilości ciepła.
Szersza historia nie dotyczy już tego, czy ciecz chłodzi procesory lepiej niż powietrze. W przypadku najgęściej upakowanego sprzętu AI ten spór w dużej mierze został rozstrzygnięty. Nowa rywalizacja toczy się między serwerami hybrydowymi, które zachowują warstwę chłodzenia powietrzem, a systemami bezwentylatorowymi, od początku projektowanymi pod kątem chłodzenia cieczą.
Argumentacja CoolIT pojawia się w czasie, gdy Nvidia i producenci serwerów przesuwają obliczenia na skalę szafy znacznie poza tradycyjne gęstości centrów danych. Według projektu szafy Nvidia GB200 NVL72 już wymaga około 120 kW mocy chłodniczej. Przyszłe systemy zmierzają w kierunku kilkuset kilowatów na szafę.
Przy takich wartościach samo chłodzenie procesora przestaje rozwiązywać problem cieplny.
CoolIT rozszerza chłodzenie cieczą poza procesor
Bezwentylatorowe chłodzenie cieczą CoolIT traktuje cały serwer jako system cieplny, a nie jako zbiór gorących procesorów otoczonych częściami chłodzonymi powietrzem.
Argument przedstawiony przez firmę we wrześniu 2026 roku zaczyna się od istotnej zmiany w miejscach powstawania ciepła. GPU i CPU pozostają jego największymi źródłami, ale nie stanowią już pełnego wyzwania dla chłodzenia.
Moduły pamięci znajdują się blisko wysokowydajnych procesorów i obsługują coraz intensywniejszy przepływ danych. Przełączniki sieciowe oraz komponenty interfejsów wspierają większe klastry dzięki szybszym połączeniom. Większe obciążenia przenoszą również pamięć masowa, regulatory napięcia i sprzęt do konwersji energii.
Komponenty te wcześniej działały komfortowo w strumieniu powietrza przepływającym już przez serwer. Taki układ pozwalał producentom montować coldplate’y na procesorach, zachowując wentylatory dla wszystkich pozostałych elementów.
Coldplate’y to metalowe wymienniki ciepła montowane bezpośrednio na pakietach elektronicznych. Chłodziwo przepływające przez wewnętrzne kanały pochłania ciepło, zanim przeniesie je do jednostki dystrybucji chłodziwa, czyli CDU.
CDU oddziela pętlę chłodzenia po stronie sprzętu od pętli wody obiektowej, jednocześnie kontrolując temperaturę, ciśnienie i przepływ. Jest centralnym elementem większości wdrożeń bezpośredniego chłodzenia cieczą.
Twierdzenie CoolIT dotyczące przechwytywania ciepła rozszerza tę pętlę na komponenty pomijane przez konstrukcje hybrydowe. Firma podaje, że buduje te systemy z modułowych bloków coldplate’ów, testowanych przez sześć generacji bezwentylatorowych konstrukcji.
To modularne podejście ma znaczenie, ponieważ komponenty peryferyjne są mniej jednolite niż procesory. CPU lub GPU zwykle ma płaski pakiet i określone punkty montażowe. Pamięć, komponenty zasilania, przełączniki i urządzenia pamięci masowej występują w różnych kształtach i lokalizacjach.
Każdy komponent ma również własny limit temperatury i ograniczenia mechaniczne. Kompletna pętla cieczy musi uwzględniać te różnice bez ograniczania dostępu serwisowego ani wywierania szkodliwej siły na płytkę drukowaną.
CoolIT przedstawia więc chłodzenie bezwentylatorowe jako problem projektowania serwera, a nie jedynie lepszy coldplate dla procesora. Ścieżka chłodziwa, złącza, kolektory, elementy sterujące i interfejsy komponentów muszą działać jako jeden system.
Firma twierdzi, że jej architektura może zmniejszyć udział chłodzenia powietrzem poniżej 1 procenta. Przyznaje też, że dosłowne przechwycenie 100 procent ciepła jest niemal niemożliwe, ponieważ część ciepła ucieka z powierzchni poza ścieżką cieczy.
To zastrzeżenie sprawia, że określenie „bez wentylatorów” jest bardziej precyzyjne niż „zero ciepła unoszonego przez powietrze”. Bezwentylatorowy serwer może tolerować minimalne pasywne oddawanie ciepła bez używania wewnętrznych wentylatorów do utrzymywania temperatur komponentów.
To bezpośrednia zmiana stojąca za tym ogłoszeniem. Chłodzenie cieczą rozszerza się z najgorętszych pakietów na niemal każde istotne źródło ciepła wewnątrz serwera AI.
Szafa o mocy 250 kW przełamuje równanie chłodzenia hybrydowego
Problem planu chłodzenia opartego na procentach polega na tym, że jego resztkowe obciążenie powietrzne rośnie z każdym wzrostem mocy szafy.
Podział 70/30 między ciecz i powietrze może wyglądać skutecznie, gdy wyraża się go jako proporcję. Oznacza to, że ciecz usuwa większość ciepła, a znane wentylatory i systemy pomieszczenia obsługują resztę.
Wartości bezwzględne pokazują jednak inną sytuację. Trzydzieści procent z szafy o mocy 50 kW to 15 kW. Trzydzieści procent z szafy o mocy 250 kW to 75 kW.
Takie obciążenie resztkowe jest porównywalne z całkowitą mocą kilku konwencjonalnych szaf. Znajduje się ono w jednej obudowie już wypełnionej procesorami, sprzętem sieciowym, półkami zasilającymi, kolektorami chłodziwa i kablami wysokiej prędkości.
Usunięcie tego ciepła wymaga znacznego przepływu powietrza. Operatorzy muszą dostarczać chłodne powietrze, prowadzić je przez wąskie kanały serwerów, zbierać powietrze wylotowe i zapobiegać jego ponownemu obiegowi do wlotów urządzeń.
Wentylatory również zużywają energię elektryczną i zajmują miejsce w serwerach. Większy przepływ powietrza zwiększa wymagania dotyczące ciśnienia, hałasu, konserwacji i filtracji. Wymagania te pozostają nawet po zainstalowaniu przez obiekt infrastruktury cieczowej dla procesorów.
Operator utrzymuje wówczas dwa systemy chłodzenia dla tej samej szafy. Pompy, wymienniki ciepła, kolektory i układy sterowania chłodziwem obsługują pętlę cieczową. Wentylatory, centrale wentylacyjne, systemy separacji strumieni powietrza i chłodzenie pomieszczenia obsługują pozostałe obciążenie powietrzne.
Główna teza CoolIT mówi, że ta dublująca się infrastruktura staje się komercyjnie nieatrakcyjna powyżej około 250 kW. Ten próg wynika z modelowania firmy, a nie z uniwersalnego standardu inżynieryjnego.
Wykonalność szafy zależy od geometrii serwerów, temperatur chłodziwa, klimatu, projektu obiektu, wymagań dotyczących redundancji i dopuszczalnych temperatur komponentów. Starannie zaprojektowany system hybrydowy nie przestaje nagle działać przy jednej dokładnej wartości.
Jednak podstawowej arytmetyki trudno podważyć. Stały procent szybko rosnącej całości staje się szybko rosnącym obciążeniem.
Model chłodzenia AI organizacji ASHRAE wskazuje, że gęstości szaf wzrosły z około 120 kW do kilkuset kilowatów. Przewiduje również, że w niedalekiej przyszłości pojawią się szafy klasy megawatowej.
Model opisuje bezpośrednie chłodzenie cieczą chipów jako standard branżowy dla AI i obliczeń wysokiej wydajności. Bezpośrednie chłodzenie chipów oznacza, że chłodziwo usuwa ciepło przez coldplate’y przymocowane do wybranych komponentów elektronicznych.
CoolIT idzie o krok dalej. Jeśli niemal każdy komponent o wysokim obciążeniu otrzyma interfejs cieczowy, pomieszczenie nie będzie już musiało przemieszczać dużych ilości powietrza przez serwery.
Może to uprościć projektowanie przestrzeni white space, czyli części hali danych, w której działają szafy. Może też przenieść większą część odprowadzania ciepła na systemy ciepłej wody i zewnętrzne wymienniki ciepła.
Samo zadanie chłodzenia jednak nie znika. Pompy muszą cyrkulować chłodziwo, CDU muszą przekazywać ciepło, a obiekt musi ostatecznie odprowadzić je na zewnątrz.
Bezwentylatorowe serwery AI zmieniają miejsce wykonywania tej pracy. Zastępują wewnętrzny przepływ powietrza o dużej objętości kontrolowaną ścieżką cieczy, która dostarcza ciepło do infrastruktury stworzonej dla skoncentrowanych obciążeń.
Dlatego wartość 250 kW należy odczytywać jako ostrzeżenie projektowe, a nie uniwersalną granicę. Wskazuje ona punkt, w którym zachowanie chłodzenia powietrzem może stworzyć drugie istotne obciążenie dla infrastruktury.
Bezwentylatorowe chłodzenie cieczą CoolIT podważa hybrydowy standard
Główna rywalizacja toczy się teraz między pełnym pokryciem chłodzeniem cieczą a chłodzeniem hybrydowym, a nie między cieczą i powietrzem na poziomie procesora.
Chłodzenie hybrydowe stało się praktycznym rozwiązaniem przejściowym, ponieważ zachowało znane konstrukcje serwerów i centrów danych. Operatorzy mogli dodać ciecz do układów o dużej mocy bez przebudowy każdego komponentu ani porzucania ustalonych praktyk przepływu powietrza.
Ten kompromis ograniczał ryzyko wdrożenia. Pozwalał też producentom korzystać ze sprawdzonych konstrukcji pamięci, pamięci masowej, sieci i zasilania chłodzonych powietrzem wokół nowo chłodzonych cieczą akceleratorów.
Nvidia GB200 NVL72 ilustruje tę transformację. Szafa łączy 72 GPU Blackwell i 36 CPU Grace za pośrednictwem wysokoprzepustowej sieci NVLink. Jej tace obliczeniowe i przełącznikowe obejmują połączenia chłodzenia cieczą, ale wdrożenie nadal wymaga szerokiej integracji szafy i infrastruktury obiektu.
Wymagane przez system 120 kW mocy chłodniczej już przekracza możliwości, dla których zaprojektowano wiele istniejących hal danych. Oczekuje się, że nowsze platformy umieszczą jeszcze więcej mocy w podobnej przestrzeni fizycznej.
CoolIT twierdzi, że flagowe systemy obliczeniowe w skali szafy będą do 2028 roku zmierzać w kierunku pełnego przechwytywania ciepła. Ta prognoza jest zgodna z kierunkiem rozwoju mocy procesorów, choć termin pozostaje oceną firmy.
Branża nie czeka, aż jeden dostawca ustanowi tę kategorię. Hewlett Packard Enterprise wprowadził własną architekturę w 100 procentach bezwentylatorowego bezpośredniego chłodzenia cieczą w październiku 2024 roku.
Projekt HPE obejmuje GPU, CPU, pamięć, pamięć masową, sieć, zasilanie, szafy, pody i CDU. Firma twierdzi, że jej architektura zmniejsza moc chłodzenia na pojedynczy moduł serwerowy o 37 procent w porównaniu z hybrydowym bezpośrednim chłodzeniem cieczą.
HPE deklaruje również 90-procentową redukcję mocy chłodzenia w porównaniu z tradycyjnymi systemami chłodzonymi powietrzem. Dane te pochodzą z testów dostawcy i nie powinny być traktowane jako uniwersalne wyniki eksploatacyjne.
Mimo to architektura bezwentylatorowa HPE potwierdza szerszy kierunek. Chłodzenie większej liczby komponentów cieczą staje się wyborem architektonicznym wśród głównych dostawców serwerów.
Inną drogę oferuje chłodzenie immersyjne. Umieszcza serwery lub wybrane zespoły w płynie dielektrycznym, który bezpośrednio pochłania ciepło z odsłoniętych komponentów.
Immersja może przechwytywać niemal całe ciepło urządzeń bez indywidualnych coldplate’ów. Zmienia jednak obudowy sprzętu, procedury konserwacji, obsługę płynu, gwarancje i kwalifikację komponentów.
Systemy coldplate’ów zachowują bardziej znane formaty szaf i serwerów. Technicy mogą uzyskać dostęp do suchych komponentów po odizolowaniu i odłączeniu odpowiednich przewodów chłodzenia.
Ta znajomość rozwiązań daje bezpośredniemu chłodzeniu cieczą przewagę we wdrożeniach w obiektach już przygotowujących się na systemy szafowe w stylu Nvidia. Pozostawia jednak wymagający problem integracji wewnątrz każdego serwera.
Dodanie coldplate’u do każdego istotnego komponentu zwiększa liczbę interfejsów. Projektanci muszą zarządzać oporem przepływu, różnicami temperatur, trasami przewodów, rozmieszczeniem złączy oraz ryzykiem, że jeden z komponentów otrzyma niewystarczające chłodzenie.
Modularność może w tym pomóc. CoolIT twierdzi, że jego wielokrotnego użytku moduły coldplate’ów skracają proces rozwoju, jednocześnie obsługując komponenty o różnych wymaganiach fizycznych i cieplnych.
Twierdzenie jest wiarygodne, lecz rozstrzygające dowody będą pochodzić z kompletnych systemów produkcyjnych. Operatorzy potrzebują danych dotyczących wydajności w realistycznych obciążeniach, warunkach chłodziwa, cyklach konserwacji i scenariuszach awarii.
W tym miejscu różnica staje się wyraźna. Chłodzenie hybrydowe umożliwia stopniowe wdrażanie i wykorzystanie znanych komponentów. Pełne pokrycie chłodzeniem cieczą obiecuje większą gęstość przy mniejszej zależności od przepływu powietrza przez serwer.
Przy niższych gęstościach mocy w szafach operatorzy nadal mogą preferować elastyczność konstrukcji hybrydowej. Przy kilkuset kilowatach pozostałe obciążenie powietrzne coraz częściej determinuje architekturę.
Bezwentylatorowość nie oznacza braku infrastruktury
Niemal całkowite przechwytywanie ciepła usuwa wentylatory serwerowe z krytycznej ścieżki, lecz przenosi większą odpowiedzialność na dostarczanie chłodziwa i inżynierię obiektu.
Serwer bez wentylatorów nie może kompensować słabego przepływu chłodziwa przez zwiększenie prędkości wentylatorów. Jego stabilność termiczna zależy od prawidłowego działania pomp, zaworów, kolektorów, układów sterowania, kontaktu coldplate’ów i wymienników ciepła.
Dlatego redundancja staje się niezbędna. Operatorzy muszą określić, które awarie pomp, CDU, czujników lub układów sterowania system może tolerować bez ograniczania wydajności procesorów albo wyłączania szaf.
Zarządzanie wyciekami również zbliża się do kosztownego sprzętu. Dobrze zaprojektowane systemy wykorzystują sprawdzone złącza, kontrolę ciśnienia, szybkozłącza bezwyciekowe, monitoring oraz procedury izolacji.
Celem nie jest twierdzenie, że ciecz nigdy nie wycieka. Chodzi o to, by awarie były wykrywalne, możliwe do ograniczenia i usunięcia, zanim chłodziwo dotrze do wrażliwej elektroniki.
Chemia chłodziwa tworzy kolejny wymóg operacyjny. Jakość wody, dodatki, metale, elastomery, przewody i temperatura wpływają zarówno na korozję, jak i rozwój biologiczny.
System złożony z niekompatybilnych materiałów może degradować się wewnętrznie, nawet jeśli nie wystąpi zewnętrzny wyciek. Długoterminowa niezawodność zależy od zweryfikowanych kombinacji materiałów i kontrolowanej konserwacji.
Wymagania coldplate’ów Open Compute Project odzwierciedlają tę złożoność. Wytyczne obejmują rodzaje chłodziw, metody połączeń, rozmieszczenie CDU, temperatury, ciśnienia i klasyfikacje chłodzenia.
Równie istotna jest serwisowalność. Technik wymieniający pamięć lub komponent sieciowy może potrzebować odłączyć elementy układu chłodzenia cieczą, których nie było w starszych serwerach.
Większa liczba interfejsów chłodzenia może wydłużać procedury naprawcze, jeśli producenci nie zaprojektują dostępu z należytą starannością. Obiekty potrzebują także przeszkolonego personelu, zapasowych podzespołów, sprzętu do obsługi chłodziwa oraz udokumentowanych kroków izolacji.
Systemy bezwentylatorowe stawiają nowe wymagania podczas uruchomienia. Inżynierowie muszą potwierdzić, że każda gałąź otrzymuje wymagany przepływ oraz że uwięzione powietrze nie pogarsza transferu ciepła.
Muszą również zweryfikować działanie układów sterowania przy częściowym obciążeniu. Klastry AI rzadko rozdzielają pracę idealnie, więc jedna tacka może pracować w wyższej temperaturze niż sąsiednie podczas zmieniającego się obciążenia.
Druga niewiadoma dotyczy istniejących budynków. Nowe obiekty AI można projektować wokół obiegów cieczy, cięższych szaf, większych rur i wysokowydajnego odprowadzania ciepła.
Modernizacja starszej hali centrum danych jest trudniejsza. Nośność podłogi, trasy rur, dystrybucja energii, przestrzenie serwisowe i lokalizacje CDU mogą ograniczać gęstość, jaką operatorzy są w stanie wdrożyć.
Niektóre obiekty będą korzystać z CDU ciecz-powietrze, które oddają ciepło chłodziwa do powietrza w pomieszczeniu. Podejście to może przyspieszyć wdrożenie tam, gdzie woda obiektowa nie jest dostępna.
Jednocześnie zachowuje ono obciążenie powietrzne na poziomie obiektu, które niemal całkowite przechwytywanie ciepła przez ciecz ma ograniczyć. Serwer jest chłodzony cieczą, ale budynek nadal odprowadza ciepło przez powietrze.
Zużycie wody również wymaga równie starannego podejścia. Bezpośrednie chłodzenie cieczą wykorzystuje zamknięty obieg urządzeń, lecz metoda końcowego odprowadzania ciepła w obiekcie determinuje całkowite zużycie wody.
Obieg ciepłej wody połączony z suchymi chłodnicami może ograniczyć lub wyeliminować wykorzystanie wody przez odparowanie w odpowiednich klimatach. System z wieżą chłodniczą nadal może zużywać znaczne ilości wody.
Właściwe porównanie musi obejmować całą drogę od krzemu do środowiska zewnętrznego. Same procentowe wskaźniki przechwytywania ciepła przez serwer nie określają całkowitego zużycia energii ani efektywności wykorzystania wody.
To najważniejszy sprawdzian narracji CoolIT. Niemal całkowite przechwytywanie rozwiązuje problem pozostałego ciepła serwerowego oddawanego do powietrza, ale nie eliminuje potrzeby inżynierii na poziomie całego systemu.
Firma przedstawiła wiarygodny kierunek i wyraźny próg gęstości wynikający z jej modelowania. Nie opublikowała jednak wystarczającej liczby danych wdrożeniowych, aby uznać 250 kW za uniwersalną granicę.
Operatorzy powinni żądać zweryfikowanych danych dotyczących spadków ciśnienia, temperatur komponentów, energii pomp, zachowania redundancji, czasu serwisowania i wymagań obiektu. Pomiary te określą, czy konstrukcja bezwentylatorowa rzeczywiście upraszcza eksploatację.
Argument efektywności zależy od całego łańcucha chłodzenia
Wyższy odsetek przechwytywania ciepła tworzy możliwość poprawy efektywności, ale to architektura i warunki pracy decydują, czy możliwość ta przełoży się na mierzalny zysk.
Wentylatory serwerowe nie są bezkosztowe. Zużywają energię, zajmują miejsce, generują hałas i przepychają powietrze przez coraz bardziej ograniczające układy komponentów.
ASHRAE zauważyło, że w niektórych konfiguracjach chłodzonych powietrzem moc wentylatorów może stanowić od 10 do 20 procent mocy serwera. Narzut ten staje się bardziej istotny, gdy tysiące serwerów działają nieprzerwanie.
Ciecz ma znacznie większą niż powietrze zdolność przenoszenia ciepła przez kompaktowy kanał. Coldplate’y zbierają też ciepło blisko jego źródła, eliminując konieczność przemieszczania dużych ilości powietrza przez całą płytę.
Właściwości te umożliwiają gęstsze upakowanie. Usunięcie wentylatorów i dużych kanałów powietrznych może uwolnić wewnętrzną przestrzeń dla zasobów obliczeniowych, sieci, zasilania lub bardziej bezpośredniego dostępu serwisowego.
Systemy cieczowe zużywają jednak energię pomp. Konstrukcja z wąskimi kanałami, długimi przewodami lub wieloma równoległymi gałęziami może wymagać wyższego ciśnienia, aby utrzymać wystarczający przepływ.
Wynik zależy od kompletnego projektu hydraulicznego. Niższe zużycie energii przez wentylatory serwera nie gwarantuje automatycznie niższego całkowitego zużycia energii na chłodzenie.
Temperatura chłodziwa jest kolejną kluczową zmienną. Cieplejsza ciecz może, zależnie od klimatu i wymagań obciążenia, umożliwiać więcej godzin odprowadzania ciepła bez użycia chillerów.
Wyższe temperatury chłodziwa mogą również zwiększać możliwości ponownego wykorzystania ciepła. Ciepło odpadowe staje się bardziej użyteczne, gdy jego temperatura jest wystarczająca dla pobliskich budynków lub procesów przemysłowych.
Ograniczenia komponentów zawężają tę możliwość. Procesory, pamięć, urządzenia optyczne, elektronika zasilająca i pamięć masowa mogą wymagać różnych temperatur na wejściu oraz marginesów pracy.
Pełny obieg cieczy musi spełniać wymagania najbardziej ograniczających komponentów, nie przechładzając jednocześnie wszystkich pozostałych. Wiele obiegów lub precyzyjnie sterowane gałęzie mogą uwzględnić te różnice, ale zwiększają złożoność.
ASHRAE opisuje klasy wody od obiegów niskotemperaturowych po warunki ciepłej wody przekraczające 45 stopni Celsjusza. Kompatybilność sprzętu decyduje, z której klasy operator może korzystać.
Planowanie pojemności musi uwzględniać także zachowanie przejściowe. Procesory AI mogą szybko przechodzić między okresami bezczynności a wysokim wykorzystaniem, zmieniając emisję ciepła w szafach.
Ciecz ma masę termiczną, która może pochłaniać krótkotrwałe zmiany, lecz układy sterowania nadal muszą reagować bez tworzenia niestabilnych warunków przepływu lub temperatury.
Efektywność energetyczna jest również nierozerwalnie związana z wykorzystaniem zasobów. Gęsto upakowana szafa, która działa konsekwentnie, może efektywnie wykorzystywać przestrzeń i infrastrukturę chłodzenia.
Szafa zbudowana pod kątem mocy szczytowej, lecz regularnie działająca znacznie poniżej tego poziomu, może pozostawiać niewykorzystane pompy i pojemność obiektu. Układy sterowania potrzebują wystarczającego zakresu, by dopasować się do zmiennego zapotrzebowania.
Dlatego wskaźniki procentowe dostawców wymagają kontekstu. Redukcja chłodzenia blade’ów o 37 procent deklarowana przez HPE i cel CoolIT zakładający mniej niż 1 procent ciepła oddawanego do powietrza mierzą różne części systemu.
Pierwszy wskaźnik porównuje moc chłodzenia w określonych konstrukcjach. Drugi opisuje udział ciepła sprzętu, który trafia do powietrza.
Żadna z tych liczb samodzielnie nie opisuje efektywności całego obiektu. Operatorzy nadal potrzebują danych o współczynniku efektywności wykorzystania energii, energii systemu chłodzenia, zużyciu wody, dostępnej pojemności i dostarczonej wydajności obliczeniowej.
Najmocniejszym argumentem za bezwentylatorowymi serwerami AI nie jest zatem pojedynczy procent efektywności. Jest nim możliwość uniknięcia skalowania oddzielnego systemu powietrznego równolegle z infrastrukturą cieczową.
Przy 250 kW i więcej zapobieganie przedostawaniu się dziesiątek kilowatów do powietrza w pomieszczeniu może ograniczyć wymagania dotyczące sprzętu, przepływu powietrza i separacji. Korzyść ta rośnie wraz ze wzrostem mocy szafy.
Zysk nadal musi zostać zweryfikowany dla każdego obiektu. Klimat, dostępność wody, redundancja, obciążenie i sprzęt do odprowadzania ciepła mogą zmienić końcowy rezultat.
Trzy sygnały pokażą, czy bezwentylatorowe serwery AI staną się standardem
Kolejnym sprawdzianem będzie to, czy niemal całkowite przechwytywanie ciepła przejdzie od architektury dostawców do powtarzalnych wdrożeń w powszechnych systemach rack-scale.
Pierwszym sygnałem będzie zakres chłodzenia cieczą w następnej generacji flagowych szaf AI. Nabywcy powinni sprawdzać, czy dostawcy chłodzą bezpośrednio pamięć, komponenty sieciowe, pamięć masową i elementy zasilania.
Chłodzenie cieczą wyłącznie procesorów zachowałoby model hybrydowy. Szerokie pokrycie komponentów wspierałoby twierdzenie CoolIT, że ciepło przestało być problemem ograniczonym do układu scalonego.
Przyszłe specyfikacje szaf Nvidia będą szczególnie ważne, ponieważ jej architektury referencyjne wpływają na producentów serwerów, dostawców chłodzenia i plany centrów danych.
Drugim sygnałem będzie niezależnie zmierzona wydajność obiektu. Operatorzy potrzebują wyników uwzględniających pompy, CDU, odprowadzanie ciepła, zużycie wody i wykorzystanie obciążeń.
Konstrukcja przechwytująca do cieczy ponad 99 procent ciepła serwera powinna istotnie zmniejszyć zapotrzebowanie na chłodzenie powietrzem w pomieszczeniu. Opublikowane dane operacyjne muszą pokazać, czy całkowite zużycie energii na chłodzenie spada zgodnie z oczekiwaniami.
Najbardziej użyteczne porównania ocenią podobne obciążenia w konstrukcjach hybrydowych i bezwentylatorowych. Powinny też ujawniać temperatury chłodziwa, warunki klimatyczne, redundancję i wykorzystanie zasobów.
Trzecim sygnałem będzie standaryzacja operacyjna. Branża potrzebuje interoperacyjnych złączy, specyfikacji chłodziw, procedur serwisowych, interfejsów monitoringu i wymogów bezpieczeństwa.
Wytyczne Open Compute Project stanowią fundament, lecz szerokie przyjęcie zależy od konsekwentnego wdrażania tych wymagań przez dostawców. Operatorzy nie mogą traktować każdej szafy jak niestandardowego systemu mechanicznego.
Standaryzacja ułatwiłaby również wymianę komponentów i zakupy od wielu dostawców. Bez niej obiekty ryzykują uzależnienie od zastrzeżonych kolektorów, płynów i procesów serwisowych.
Sponsorowana przez CoolIT analiza serwerów bezwentylatorowych opisuje rzeczywistą transformację, choć próg 250 kW pozostaje wnioskiem dostawcy.
Istotne odwrócenie jest już widoczne. Chłodzenie cieczą było kiedyś dodatkiem stosowanym dla procesorów, gdy chłodzenie powietrzem osiągało swoje granice. Powietrze staje się teraz dodatkiem pozostawionym po tym, jak ciecz przejmuje niemal wszystko.
Zmiana ta wywiera jednocześnie presję na producentów serwerów, projektantów obiektów i operatorów. Każda z tych grup musi zdecydować, czy utrzymywanie infrastruktury hybrydowej nadal zapewnia użyteczną elastyczność.
Dla nabywców planujących szafy o mocy kilkuset kilowatów natychmiastowym działaniem jest żądanie kompletnych map termicznych, a nie samych specyfikacji procesorów. Należy ustalić, które komponenty nadal są chłodzone powietrzem, i obliczyć ich bezwzględne obciążenie.
Następnie należy prześledzić każdy kilowat przez obieg cieczy, CDU, system obiektu i końcowe urządzenia odprowadzania ciepła. Ćwiczenie to pokaże, czy bezwentylatorowe chłodzenie cieczą CoolIT upraszcza budynek, czy jedynie przenosi złożoność w inne miejsce.
Przyszłość nie stanie się bezwentylatorowa dlatego, że to określenie brzmi efektywnie. Stanie się taka, gdy systemy produkcyjne pokażą, że pełne pokrycie chłodzeniem cieczą jest łatwiejsze w eksploatacji niż kieszeń powietrza o mocy 75 kW.



