Het parallelle bestandssysteem van IBM Storage Scale ondersteunt gedistribueerd KV-cachebeheer in combinatie met NVIDIA Dynamo, waarmee grootschalige AI-inferentiescenario's met enorme contextworkloads kunnen worden uitgevoerd.
IBM heeft een officieel Redbook uitgebracht met de titelContext zonder grenzen: een krachtig KV-cacheplatform voor grootschalige AI-inferentie, en levert een complete gevalideerde referentiearchitectuur voor deze gezamenlijke oplossing. De geïntegreerde stack combineert Supermicro Petascale Storage Servers, NVIDIA Spectrum-X Ethernet-netwerken en IBM Storage Scale Erasure Coding Edition (ECE) om een krachtige gedeelde opslaglaag voor AI-inferentie te bouwen. Als gezaghebbende technische documenten gepubliceerd door IBM ITSO (International Technical Support Organization), bieden IBM Redbooks praktische, diepgaande implementatierichtlijnen voor IBM-infrastructuurproducten op bedrijfsniveau.
Het Redbook is mede geschreven door technische teams van IBM, Supermicro en NVIDIA en behandelt een kernpijnpunt van AI-workloads met een lange context. Gebruiksscenario's, waaronder multi-turn dialoogassistenten, RAG-ophaaltoepassingen en autonome agentpijplijnen, genereren enorme KV-cachegegevens binnen GPU HBM. Zodra in de cache opgeslagen gegevens uit beperkte HBM-bronnen worden verwijderd, zal herhaalde herberekening ernstige latentiestijgingen veroorzaken, waardoor aanhoudende cross-request KV-cacheopslag onmisbaar wordt.
De oplossing maakt gebruik van een hiërarchische KV-cache-architectuur met vijf lagen die verschillende latentie- en capaciteitseisen dekt:
-
G1-laag: GPU-knooppunt lokale HBM
-
G2-laag: CPU-knooppuntsysteem DRAM
-
G3-laag: Direct aangesloten lokale SSD
-
G3.5-laag: Gedeelde flashopslag op podniveau, aangestuurd door NVIDIA BlueField DPU's met directe verbinding met GPU-server-DPU's
-
G4-laag: Externe gedeelde Ethernet-opslagpool verbonden met alle GPU-computerservers
Deze meerlaagse opstelling omvat end-to-end geheugen- en opslaghiërarchie en levert continue latentie- en capaciteitsgradiënten. Het stelt NVIDIA Dynamo in staat om intelligente cacheplaatsing, automatische verwijdering en dynamisch herladen van gegevens uit te voeren over de hele opslagstack, waarbij het zich flexibel aanpast aan gevarieerde toegangspatronen voor werkbelastingen en de totale infrastructuurkostenbudgetten.
Storage Scale ECE wordt ingezet op Supermicro Petascale Storage Servers en fungeert als de G4 cold cache-laag. Het is geoptimaliseerd voor niet-latentiegevoelige KV-cachegegevens, inclusief inactieve multi-turn gespreksstatussen, gedeelde agentcontextgegevens en historische queryrecords die geen onmiddellijke reactie vereisen.
Volgens testresultaten vastgelegd in het Redbook versnelt deze productieklare referentiearchitectuur effectief generatieve AI en agentische AI-inferentiediensten. In single-request TTFT (Time To First Token)-tests, vergeleken met stand-alone GPU-servers zonder externe Storage Scale KV-cache, handhaaft het geïntegreerde systeem een stabiele TTFT, ongeacht veranderingen in de promptlengte. Het bereikt een56x versnellingonder invoerreeksen van 130.000 tokens en elimineert volledig de fluctuaties in de latentie van gevolgtrekkingen veroorzaakt door langere promptlengtes.
Onder gelijktijdige inferentiedruk van meerdere gebruikers realiseert de oplossing een dramatische prestatieverbetering: de doorvoersnelheid van verzoeken stijgt van 0,19 RPS naar 4,26 RPS, wat een22x doorvoerverbetering. Ondertussen daalt de totale verwerkingstijd voor 200 inferentieverzoeken met 95%, waardoor de GPU-gebruiksefficiëntie en de algehele schaalbaarheid van het inferentiecluster aanzienlijk toenemen.
De stapel blijft ook robuust presteren onder zware stresstests bij buren. Omdat vier client-einden aanhoudend 200 GB/s concurrerend I/O-netwerkverkeer genereren, draait het geïntegreerde systeem nog steeds stabiel op 3,6 RPS, waarbij alle 200 inferentieverzoeken binnen 55,56 seconden worden afgehandeld. De doorvoer blijft18x hogerdan de basisarchitectuur voor herberekening met alleen GPU.
Het onderzoeksteam concludeerde in het Redbook: “Voor ondernemingen die de ROI op dure GPU-hardware-investeringen willen maximaliseren, biedt deze geverifieerde geïntegreerde architectuur een eenvoudige, productieklare aanpak om de inferentiedoorvoer te vergroten, de end-to-end latentie te verminderen, een hogere gelijktijdigheid van services te ondersteunen en een kosteneffectievere grootschalige AI-inferentie-infrastructuur op te bouwen.”
Trefwoorden: SUPERMICRO, IBM Storage Scale, NVIDIA Dynamo
Peking Qianxing Jietong Technologie Co., Ltd.
Sandy Yang/directeur mondiale strategie
WhatsApp / WeChat: +86 13426366826
E-mail: yangyd@qianxingdata.com
Website: www.qianxingdata.com/www.storagesserver.com
Zakelijke focus:
ICT-productdistributie/Systeemintegratie en -diensten/Infrastructuuroplossingen
Met meer dan 20 jaar ervaring in IT-distributie werken we samen met toonaangevende wereldwijde merken om betrouwbare producten en professionele diensten te leveren.
“Technologie gebruiken om een intelligente wereld te bouwen”Uw vertrouwde ICT-productdienstverlener!