Ditt GPU-kluster körde sitt första träningsjobb för 18 månader sedan.
På den tiden var det tillräckligt snabbt. Nu väntar ditt team i två dagar på en körning som din konkurrent gör på en natt, och du är inte säker på om problemet är hårdvaran, arkitekturen eller något helt annat.
Det är den osäkerheten som är det verkliga problemet.
Beslut om AI-infrastruktur brukade följa en förutsägbar rytm: uppdatering vart femte år, avskrivning enligt plan, upprepning. Den modellen är borta.
Komprimerade utvecklingscykler för AI innebär att hårdvara som var aktuell för 18 månader sedan redan kan vara en flaskhals. Kostnaden för att vänta med att ta reda på detta mäts i utbildningstid, energiåtgång och konkurrensposition.
Så här vet du när det faktiskt är hårdvaran som är problemet och vad du ska göra åt det.
Du behöver inte byta ut allt
Innan du specificerar ett komplett rackbyte, begränsa diagnosen. GPU:er, nätverksutrustning och minne skapar alla olika felsignaturer. En underpresterande NVMe SSD eller en InfiniBand-switch som körs med försämrad bandbredd kan dra ner en hel nod.
Börja med prestandadata på komponentnivå innan du bestämmer dig för en fullständig uppdatering. Problemet är oftast mer specifikt än det ser ut.
Flaskhalsar i prestanda
När träningstiderna har blivit oacceptabla är det något som är mättat. Minnesbandbredd, dataöverföring från nod till nod och termisk strypning är de vanliga misstänkta. Leta efter mätvärden för maskinvaruutnyttjande som konsekvent ligger på eller nära sina gränser.
Om VRAM är begränsningen kommer inte enskilda komponentbyten att fixa det. Om det är en enda komponent som underpresterar och drar ner resten av servern kan det göra det. Granska uppgifterna innan du bestämmer dig.
Vilken är er nuvarande baslinje för FLOPS (Floating Operations per Second) per dollar, och när jämförde ni den senast med tillgängliga alternativ?
Fördröjning
Latensen är bedräglig. Du distribuerar en större modell och inferens saktar ner, men är det nätverket, lagringsgenomströmningen eller själva GPU: n?
Med äldre hårdvara får du felsöka i blindo. Nyare arkitekturer ger dig bättre observerbarhet och, vanligtvis, en kortare väg till svaret.
Anpassning av arkitektur
Om din programvarustack är optimerad för nyare GPU-arkitekturer, som CUDA-kärnor kompilerade för Hopper och uppmärksamhetsmekanismer inställda för Blackwell, innebär det att du lämnar prestanda på bordet när du kör den på Ampere-hårdvara. Din programvara och maskinvara måste rikta in sig på samma arbetsbelastning. När de inte gör det betalar du för kapacitet som du inte kan använda.
Underhållskostnader
När underhållskostnaderna överstiger 20% av återanskaffningskostnaden för motsvarande ny utrustning har matematiken redan vänt emot dig. Du finansierar den gamla hårdvaran två gånger: en gång i samband med det ursprungliga köpet och en gång i samband med löpande reparationer. Du lämnar också driftsbesparingar på bordet, eftersom ny utrustning ger bättre prestanda per watt.
Beräkna din underhållskurva tre år framåt innan du bestämmer dig. Den felaktiga uppfattningen om sunk cost dödar fler beslut om uppdatering av hårdvara än vad budgetbegränsningar gör.
Effektivitet per watt
Moderna GPU:er - H100, B200 - levererar betydligt fler FLOPS per watt än sina föregångare. Men de drar också mer ström totalt sett. Din energiräkning kommer att öka även om din verkningsgrad förbättras.
Innan du uppgraderar ska du kontrollera att kylinfrastrukturen och strömförsörjningen kan hantera det nya termiska höljet. GPU:n är sällan den begränsning som sätter stopp för en uppdatering av datacentret. Det är byggnaden som är det.
Garantier och support vid livscykelns slut
Hårdvara som har passerat tillverkarens supportdatum medför två risker: avbrottsrisk (ingen leverantörssupport när något går sönder) och säkerhetsrisk (inga programvarupatchar). Båda är hanterbara tills de inte är det längre.
Om dina servrar börjar bli uttjänta är det ingen anledning till panik. Det är en anledning att ha en dokumenterad plan för vad som händer när nästa fel inträffar.
Ditt användningsfall formar tidslinjen
Edge inference-implementationer, som är mindre, distribuerade grupperingar av servrar, har andra uppdateringsekonomier än centraliserade utbildningskluster. Molnmiljöer ändrar kalkylen helt och hållet. Uppgradering innebär att man reserverar tid på en nyare instanstyp, inte att man köper hårdvara.
Bristen på GPU-minnen förväntas begränsa molnserverdistributionen fram till 2026, vilket innebär att priserna på AI-beräkningar sannolikt kommer att stiga oavsett vad du gör lokalt.
Om din verksamhet är tillräckligt stor för att köra hela spektrumet från träning till inferens, det finns en kapitaleffektiv modell som är värd att överväga.
Värdekaskaden: Hur hyperscalers förlänger hårdvarans livslängd
Använd den nyaste GPU-generationen för utbildning. När nästa generation anländer flyttar du den nuvarande utbildningshårdvaran till inferensarbetsbelastningar, som är mindre krävande. När den generationen inte längre kan användas för inferens, pensionera den och sälj den via en ITAD eller återförsäljare.
Det är så här hyperscalers stöder avskrivningstider på mer än 5 år utan att offra utbildningsprestanda. Det gör att varje generation av hårdvara förblir produktiv till slutet av sin livslängd.
Det fungerar bara om du har tillräckligt med intern arbetsbelastning för att absorbera varje nivå. Ett litet FoU-team som kör enstaka utbildningsjobb har inte den inferensvolym som gör att kaskaden lönar sig. Men om du gör det är det en av de få hårdvarustrategier som faktiskt blir billigare med tiden.
Frågan är inte om du ska uppgradera. Det är när.
En strikt, kalenderbaserad uppdateringscykel fungerar inte för AI-infrastruktur. Hårdvarulandskapet rör sig för snabbt och dina arbetsbelastningar ändras för ofta.
Det här är vad som fungerar: att behandla uppgraderingssamtalet som pågående snarare än periodiskt. Om en enda komponent är i riskzonen (en GPU vars garantitid har löpt ut, en switch som skapar latens som du inte kan förklara, en lagringsnivå som har blivit flaskhalsen) räcker det för att starta analysen.
Den hårdvara som ni behöver om sex månader har redan tilldelats. De team som pratar om det här nu kommer att ha alternativ. De som inte gör det, kommer inte att göra det.