WEKA NeuralMesh en Augmented Memory Grid-software draaien op Oracle Cloud Infrastructure (OCI) en leveren een 10x hogere tokendoorvoer, 10x meer gelijktijdige gebruikers en 7x meer tokens per GPU, vergeleken met standaard OCI-omgevingen die uitsluitend afhankelijk zijn van lokale DRAM.
WEKA's Augmented Memory Grid breidt het GPU-servergeheugen uit voor AI-inferentie door gebruik te maken van externe opslag via NeuralMesh, waardoor externe bronnen worden omgezet in een krachtige KV-cache. Het levert een latentie van microseconden en een bandbreedte van meerdere GB/s, en biedt tot petabytes aan extra geheugenadresruimte, met volledige compatibiliteit voor NVIDIA's SX KV-cachingarchitectuur. NeuralMesh is het krachtige AI-bestandssysteem van WEKA. Alle benchmarks zijn gevalideerd op een OCI bare-metal H100-cluster met 9 knooppunten en contextvensters met 100.000 tokens.
Pablo Salem, Senior Director Software Development bij OCI, merkte op: "Enterprise AI-workloads blijven contextvensters uitbreiden en het GPU-gebruik naar nieuwe limieten brengen. Deze benchmarks bewijzen dat WEKA's oplossing GPU-geheugenknelpunten op OCI elimineert, waardoor grotere, veeleisendere inferentie-workloads mogelijk worden zonder extra GPU-hardware-investeringen."
WEKA merkt op dat de groeiende vraag naar gevolgtrekkingen de inefficiëntie van de AI-infrastructuur vergroot. Frequente KV-cache-uitzettingen creëren verborgen overhead die GPU-cycli verspilt, de latentie verhoogt, de gebruikerservaring schaadt en de operationele kosten per token verhoogt. Voor lange-context en agentische AI-workloads met meer dan 100.000 token-inputs schaadt dergelijke overhead de eenheidseconomie van productie-AI-implementaties ernstig.
De benchmark is gebouwd op 9 knooppunten, 72 H100 GPU's, contextvensters met 100.000 tokens en duizenden gelijktijdige gebruikers, met hieronder duidelijke prestatieverschillen:
-
Gelijktijdige gebruikerscapaciteit: WEKA ondersteunde meer dan 5.000 gelijktijdige gebruikers, tegenover slechts 600 bij opstellingen met alleen DRAM. Het voorkomt cacheverzadigingsfouten door de actieve cache uit te breiden van 8,64 TiB DRAM naar 287 TiB NVMe-flashopslag, waardoor de ROI op bestaande GPU-hardware wordt gemaximaliseerd zonder extra GPU-aankopen.
-
Tokendoorvoer: De WEKA-stack bereikte ongeveer 2 miljoen tokens per seconde, 10 keer sneller dan de basislijn van minder dan 200.000 tokens/sec van systemen die alleen DRAM gebruiken.
-
Totaal tokenverwerkingsvolume: In een test van een uur met 2.400 gelijktijdige gebruikers verwerkte WEKA 5 miljard tokens, terwijl de DRAM-only opstelling slechts 700 miljoen tokens verwerkte.
Voor agentische AI-workflows zorgt onvoldoende DRAM voor een constante GPU-herberekening na cacheverzadiging, waardoor de kosten per token stijgen en de ROI wordt verlaagd. Met 7x verwerkte tokens per GPU verlaagt WEKA de totale tokenkosten voor productie-AI-services aanzienlijk.
Voor real-time AI-diensten, waaronder zoeken, samenvatten, code-assistentie en multi-turn agents, definieert tokendoorvoer servicelimieten voor gebruikerscapaciteit, reactiesnelheid en inkomstenpotentieel van de infrastructuur. Door de 10x hogere doorvoer wordt de native GPU-rekenkracht binnen het OCI-cluster volledig ontgrendeld.
Kortom, de geheugenuitbreidingssoftware van WEKA helpt cloudplatforms meer gebruikers te bedienen, meer tokens te verwerken en de operationele kosten effectief te verlagen.
Liran Zvibel, CEO van WEKA, zei: "Inferentieprestaties worden belemmerd door het beschikbare GPU-effectieve geheugen. Deze resultaten bewijzen dat hardware-upgrades alleen de economische problemen met AI-tokens niet kunnen oplossen. De echte beperking is de al lang bestaande geheugenmuur die de GPU-prestaties beperkt. WEKA's oplossing op OCI verhoogt de tokenverwerkingscapaciteit drastisch met geoptimaliseerde totale eigendomskosten."
OCI heeft de volledige benchmarkmethodologie, systeemconfiguraties en volledige testresultaten gepubliceerd op zijn officiële AI & Data Science-blog.
NeuralMesh met Augmented Memory Grid is nu algemeen beschikbaar voor WEKA-klanten en genoteerd op Oracle Marketplace, waarbij OCI optreedt als exclusieve cloudlanceringspartner. Bedrijven die lange-context-inferentie op OCI uitvoeren, kunnen deze productieklare, volledig gevalideerde architectuur meteen inzetten.
Peking Qianxing Jietong Technologie Co., Ltd.
Sandy Yang/directeur mondiale strategie
WhatsApp / WeChat: +86 13426366826
E-mail: yangyd@qianxingdata.com
Website: www.qianxingdata.com/www.storagesserver.com
Zakelijke focus:
ICT-productdistributie/Systeemintegratie en -diensten/Infrastructuuroplossingen
Met meer dan 20 jaar ervaring in IT-distributie werken we samen met toonaangevende wereldwijde merken om betrouwbare producten en professionele diensten te leveren.
“Technologie gebruiken om een intelligente wereld te bouwen”Uw vertrouwde ICT-productdienstverlener!