Överhettning av hårdvaran i ett datacenter försämrar dess driftseffektivitet och minskar dess andrahandsvärde, samtidigt som det skapar förutsättningar för ett driftavbrott till följd av skadade komponenter.
Genom att övervaka temperaturen i ditt datacenter på rätt sätt kan du hantera värmen och skydda ditt datacenter mot dessa risker.
Med rätt metod för temperaturövervakning i datacentret kan man säkerställa att administratörerna har fullständig insyn i vad som händer i datacentret och var det sker.
I takt med att GPU-installationer ökar rackdensiteten till över 40 kW och ännu högre minskar utrymmet för fel i temperaturavläsningarna snabbt. Du måste kunna lita på rapporterna i din kontrollpanel, men de är inte det slutgiltiga beskedet.
Kortfattad information: Vad du behöver veta om temperaturövervakning i datacenter
- Oupptäckt termisk belastning förkortar hårdvarans livslängd och tvingar fram en tidigare utbytescykel, vilket sätter press på IT-inköpsbudgeten.
- Miljöproblem, däribland värmerelaterade problem, är enligt övervakningsleverantören AVTECH kopplade till nära 30% av oplanerade driftstopp i datacenter.
- En enskild insugssensor kan visa 70 °F, medan avgasidan på samma rack är mer än 20 grader varmare. Att beräkna ett genomsnitt av temperaturvärdena döljer istället felkällan, när man egentligen borde identifiera den.
- ASHRAE rekommenderar minst sex sensorer per rack: tre på framsidan (övre, mellersta och nedre) och tre på baksidan. Man bör inte sträva efter en sensor per rad.
- Det handlar inte bara om överhettning och för hög luftfuktighet. Överdriven kylning leder till höga elkostnader, och miljöer med låg luftfuktighet kan orsaka kondens och korrosion.
Varför är det viktigt att reglera och övervaka temperaturen i ett datacenter?
Överhettning märks inte direkt. Hårddiskarna går inte sönder så fort ett rack blir för varmt.
Överhettade komponenter kan gå sönder veckor eller månader efter att långvarig termisk belastning redan har slitit på komponenterna inuti. Övervakning finns till för att upptäcka problemet medan det fortfarande bara är en siffra på en instrumentpanel. Detta förhindrar att en rad komponenter i datacentret går sönder samtidigt.
En ofta citerad tumregel inom tillförlitlighet lyder att felfrekvensen ungefär fördubblas för varje 18 °F (10 °C) som temperaturen stiger över en komponents nominella driftstemperatur. Om du låter ett rack gå även några grader varmare än det borde under en längre tid ökar du risken för fel på varje hårddisk, GPU och strömförsörjning i det racket.
Temperaturövervakning i datacenter skyddar även mot fel som inte direkt beror på värme. En CRAC- eller CRAH-enhet som börjar fungera sämre går sällan sönder helt och hållet på en gång. Den försämras gradvis, och en anläggning utan detaljerade temperaturdata kommer inte att upptäcka denna försämring förrän ett rack redan har varit överhettat i flera timmar. Miljöproblem, inklusive värmeproblem, är kopplade till nära 30% av oplanerade driftstopp i datacenter, och de flesta av dessa incidenter kan spåras tillbaka till brister i övervakningen snarare än till ett hårdvarufel.
Det finns också en kostnadsaspekt i detta. En anläggning som inte litar på sina temperaturdata tenderar att som standard kyla ner för mycket, vilket innebär att rummet hålls kallare än nödvändigt för att uppfylla säkerhetskraven. Detta driver upp energiförbrukningen utan att ge något verkligt skydd. Tillförlitlig övervakning av temperaturen i datacentret eliminerar gissningarna, vilket gör att du kan hålla temperaturen närmare det intervall som ASHRAE rekommenderar och därmed uppnå de energibesparingar som detta medför.
Bästa praxis för övervakning av datacenter: Hur GPU:er förändrade allt
När du ställer in temperaturintervallen för övervakning är det här du behöver veta: ASHRAE rekommenderar ett torrtemperaturintervall på 64–81 °F (18–27 °C) och en relativ luftfuktighet mellan 40% och 60% för A1–A4-hårdvara. Denna kategori avser hårdvara för datacenter. ASHRAE:s tillåtna intervall för torrtemperatur är 59–90 °F (15–32 °C) även för hårdvara i klasserna A1–A4.
Det är inom dessa intervall du bör arbeta. Nästa steg är att utforma dina sensorer så att du får en så exakt bild av din omgivning som möjligt.
För tio år sedan var det fullt rimligt att använda en enda sensor per rad för temperaturövervakning i datacenter. De flesta rack hade en effektförbrukning på 4–6 kW, luftflödet var förutsägbart och skillnaden mellan en behaglig och en farlig omgivningstemperatur var stor. Infrastrukturen kunde klara av några få döda vinklar.
Storskalig GPU-implementering har tvingat IT-cheferna att ompröva arkitekturen. Moderna rack för accelererad databehandling överstiger lätt 40 kW, och i nyare installationer rapporteras täta AI-kluster ligga i intervallet över 100 kW. Varje ökning med 1 °F i omgivningstemperaturen ger ungefär en motsvarande ökning med 1 °F i CPU- och GPU-temperaturen, vilket innebär att den marginal som tidigare fanns på radnivå i stort sett har försvunnit på racknivå.
Överkylning är inte lösningen. Det slösar bort energi och pengar utan att skydda utrustningen. Kylningen står för en betydande del andelen av anläggningens totala strömförbrukning. De sensorer ni redan har måste placeras så att de registrerar faktiska avvikelser, inte de genomsnittliga förhållandena i hela datacentret.
Utmaningar vid temperaturövervakning i datacenter: döda vinklar och larmtrötthet
Genomsnittsberäkning är den största blinda fläcken när det gäller temperaturövervakning i datacenter. Ett rack med en sensor nära tilluftsöppningen och ingen nära frånluftsöppningen kommer alltid att framstå som mer välfungerande än det egentligen är.
Hinder i luftflödet medför en rad egna problem. En kabelbunt som blockerar ett bakre utlopp, en saknad täckplatta eller en golvplatta som ligger fel kan skapa en lokal överhettningspunkt som en sensor på radnivå aldrig kommer att registrera.
De perfekta inställningarna för sensorvarningar ska lyfta fram berättigade problem som kräver åtgärder från administratörerna och samtidigt begränsa antalet icke-väsentliga meddelanden. Även den bästa sensorinfrastrukturen kan undergrävas av meddelotrötthet. En konfiguration som genererar ständiga meddelanden med låg prioritet gör att personalen lär sig att bläddra förbi just den varning som faktiskt är viktig, vilket i grunden motverkar syftet med detaljerad övervakning.
Om temperaturen är för låg i en miljö med låg luftfuktighet kan det leda till kondens och korrosion. Om luften är för torr kan det uppstå statiska urladdningar som skadar känsliga komponenter. Temperaturövervakning i datacenter utan en kompletterande strategi för luftfuktighet och daggpunkt ger dig bara en ofullständig bild.
Trådlösa sensorer möjliggör kontinuerlig övervakning av temperatur och luftfuktighet
Utgå vid utformningen av din anläggning från sensortätheten, inte bara från antalet sensorer. ASHRAE:s regel om sex sensorer – tre på insugssidan och tre på utblåsningssidan per rack – finns därför att en enda mätpunkt inte räcker för att korrekt mäta ett racks tillstånd.
Trådlösa sensornätverk gör modellen med sex sensorer särskilt effektiv. Batterierna fungerar som fristående strömkällor för sensorerna, vilket gör att teknikerna kan installera dem på några minuter utan att behöva dra separata kablar.
DCIM-programvaran omvandlar enskilda sensoravläsningar till en termisk karta, vilket innebär skillnaden mellan att titta på en lista med siffror och att veta var ett problem håller på att uppstå. Detaljerade analyser av temperatur och luftfuktighet i datacentret kan också hjälpa teamen att identifiera problematiska delar av arkitekturen och vidta åtgärder innan hårdvaran skadas.
Tröskelvärdesbaserade varningar via SNMP, SMS eller e-post fungerar endast om tröskelvärdena är anpassade efter racket, inte efter rummet. En varning vid 90°F kan vara lämplig för ett äldre lagerställ och farligt försenat för ett GPU-kluster tre rack bort.
Koppla ihop varje temperaturgivare med en fukt- och daggpunktsgivare. Temperatur och fuktighet är två olika felkällor som påverkar varandra, men som har skilda orsaker och lösningar. Ert team måste så snabbt som möjligt ta reda på vilket problem det rör sig om och var det finns.
Övervakning av datacenter visar när hårdvaran överhettas och när den bör tas ur drift
Långvarig, oupptäckt överhettning i ett datacenter riskerar ett avbrott, men det går att åtgärda snabbt med rätt IT-personal och rätt verktyg. Det som däremot är mer bestående är skador på eller slitage av utrustningen. Denna typ av skador kan vara svåra att bedöma, och ibland får man först en uppfattning om hur hårt hårdvaran har drabbats flera veckor eller månader senare.
Hårdvaran i datacenter är utrustad med skyddsmekanismer mot överhettning. GPU:er och CPU:er har en funktion för termisk begränsning som sänker prestandan när enheten känner av för hög värme. Hårdvaran i datacenter är dock inte avsedd att utsättas för extrem värme under längre perioder. Det förkortar livslängden för all utrustning som befinner sig i den varma zonen.
Det är här som temperaturövervakningen i datacentret slutar vara enbart en fråga för anläggningsdriften och istället blir en fråga för tillgångshanteringen. När dina data visar på ett mönster av termisk belastning på vissa rack måste du bedöma om den hårdvaran fortfarande hör hemma i produktionsmiljön. Om det är dags att ta ur drift Hårdvaran – vad händer med utrustningen när den tas ur drift?
Sensorerna, gateways och DCIM-enheterna i din övervakningsmiljö är också IT-tillgångar, och de medför samma risk vid livslängdens slut som allt annat. Nätverksinloggningsuppgifter, konfigurationsdata för anläggningar och historiska temperaturloggar försvinner inte bara för att en sensor tas bort från ett rack. De kräver samma certifierad förstöring och dokumentation av spårbarhetskedjan som allt annat som lämnar er miljö.
exIT Technologies hanterar båda delarna av denna ekvation för datacenter som genomför hårdvaruuppdateringar: certifierad datadestruktion enligt NIST 800-88, med stöd av R2v3- och NAID-AAA-certifieringar, samt återvinning av tillgångar som återger utrustningen dess verkliga värde innan den blir en belastning som bara tar plats i ett skåp. Ta reda på vad din utrangerade hårdvara är värd.