NetApp neemt DataPelago over, maker van de Nucleus Universal Data Processing Engine (UDPE) die heterogene rekenkracht voor analytics en generatieve AI versnelt.
Nucleus is gebouwd op open-source Gluten, Velox en Substrait en versnelt Spark en Trino drastisch om uitstekende kosten-prestaties te leveren. Het sluit naadloos aan op bestaande lakehouses, SQL, Python, Airflow, Tableau, Power BI en meer zonder datamigratie of leverancierlock-in. DataPelago, opgericht in 2021 door CEO Rajan Goyal en CPO Anand Iyer, verliet stealth in oktober 2024 en haalde in totaal meer dan $ 75 miljoen op, inclusief een financieringsronde van $ 47 miljoen in 2024.
CEO van NetApp, George Kurian, stelt dat de voortschrijdende AI-hardware een even capabele data-infrastructuur vereist om de waarde van bedrijfsdata te ontsluiten. De overname versterkt het vermogen van NetApp om flexibele dataverwerking te leveren voor concurrentiedifferentiatie.
In een blog van DataPelago werd opgemerkt dat Nucleus native zal worden ingebed in het dataplatform van NetApp, waardoor een veel bredere adoptie door ondernemingen mogelijk wordt gemaakt dan de startup zelfstandig zou kunnen bereiken. Eerder dit jaar stond DataPelago op de vierde plaats in Data Science op de lijst van 2026 World's Most Innovative Companies van Fast Company.
In tegenstelling tot traditionele architecturen die datasets naar externe CPU/GPU-clusters verplaatsen, voert Nucleus versnelde rekenkracht rechtstreeks op de opslaglaag uit. Benchmarks tegen Nvidia cuDF laten tot 10,5x snellere projecties, 10,1x snellere filters en 4,3x snellere aggregaties zien. Gepositioneerd tussen query-engines (Spark, Trino, Flink) en Python-frameworks (Ray, Dask), heeft de stapel drie modulaire lagen:
1.DataApp: plug-in integratiemodule om versnelling te injecteren in Spark, Trino en andere motoren.
2.DataOS: orkestratielaag die datataken dynamisch toewijst aan gemengde accelerators voor schaalbare afstemming van prestaties.
3.DataVM: aangepaste virtuele machine met domeinspecifieke ISA, die uniforme uitvoeringsabstractie biedt voor CPU's, GPU's, FPGA's en aangepast silicium.
Uitvoeringsstroom voor kerngegevens
1. Gegevenstoegang via framework-connectoren: geïmplementeerd als Spark JAR-plug-ins die compatibel zijn met standaard dataconnectoren en ondersteuning bieden voor Parquet, ORC, Iceberg, Delta Lake, JSON en opslagdoelen, waaronder S3, GCS, ADLS, HDFS en on-prem arrays. De versnelling strekt zich uit tot opslagintegraties, terwijl de native query-semantiek behouden blijft via standaard I/O-lagen van de engine.
2.Queryplanning en -optimalisatie: de hostengine genereert een fysiek plan; DataApp zet het via Gluten/Substrait om naar een tussenweergave. Een intelligente optimizer bouwt optimale gegevensstroomgrafieken en wijst CPU/GPU-bronnen toe voor de uitvoering van DataOS/DataVM.
3. Optimalisatie van gegevensoverdracht tussen hardware: Operator/kernelfusie en streaming-uitvoering elimineren volledige tussenliggende materialisatie om I/O-overhead te verminderen. Zero-copy gedeeld geheugen vermindert CPU-GPU-gegevensduplicatie, terwijl DataVM's ISA LLVM, CUDA en ROCm gebruikt om taken naar optimale hardware te routeren via kolomvormige gevectoriseerde verwerking. Deze aanpassingen verhogen het GPU-gebruik tot 80-90% door het shuffelen van gegevens tussen domeinen te minimaliseren.
Nucleus opereert op locatie en in grote publieke clouds. De Spark-accelerator levert een doorvoerwinst van 3 tot 4x ten opzichte van Databricks Photon; het integreert ook met Snowflake door de verwerking van open-tafelformaten en upstream/downstream Spark/Trino-pijpleidingen die het magazijn voeden, te versnellen. DataPelago stelt dat Nucleus de infrastructuurkosten tot 80% verlaagt en 10x snellere prestaties levert dan oudere pijpleidingen. Door verplichte gegevensduplicatie tussen operationele en AI-systemen te verwijderen, wordt het belangrijkste knelpunt dat de uitrol van AI in ondernemingen vertraagt, geëlimineerd, met live implementaties bij grote mondiale ondernemingen in alle branches.
DataPelago CEO Rajan Goyal zei dat de kernmissie van het bedrijf het oplossen van knelpunten in de gegevensverwerking is die AI-innovatie tegenhouden. Door de fusie met NetApp wordt de baanbrekende acceleratietechnologie gecombineerd met het uitgebreide data-infrastructuurportfolio van NetApp; Bedrijven hebben zwaar geïnvesteerd in GPU’s en modellen, maar hebben toch te kampen met gefragmenteerde datasilo’s waardoor hardware onderbenut blijft, en de gecombineerde stack stroomlijnt grootschalige AI-implementatie.
NetApp beschouwt de overname als een mijlpaal in de portfolio-upgrade, waardoor GPU-versnelde verwerking rechtstreeks in opslagworkflows wordt opgenomen om echte zero-copy bedrijfsdata-activatie voor AI te leveren. De financiële gegevens van transacties blijven geheim; Gezien de tractie van Nucleus op ondernemingsniveau, de nauwe synergie met NetApp AIDE en de stijgende vraag naar kunstmatige AI, komt de aankoopwaarde waarschijnlijk uit op een 4 tot 5x veelvoud van de totale financiering van DataPelago ter waarde van $75 miljoen. DataPelago zal opereren als een volledige dochteronderneming van NetApp.
Belangrijkste onderscheid: Nucleus versus KV Cache versus NetApp AIDE
1. Nucleus- en KV-cache-differentiatie: Nucleus optimaliseert de opname, transformatie en bevraging van pre-inferentiegegevens voordat gegevens GPU-servers bereiken. Nvidia's KV Cache is een in-GPU-geheugenoptimalisatie die alleen actief is na aankomst van gegevens op GPU-hardware om de efficiëntie van het genereren van tokens te vergroten. Nucleus versnelt de levering van gegevens aan computers; KV Cache optimaliseert de runtime van het model nadat gegevens op accelerators terechtkomen.
2.NetApp AIDE versus Nucleus UDPE: AIDE is ONTAP/AFX-vergrendelde AI-voorverwerking voor LLM's en agenten, functionerend als eigen ETL met ingebouwde vectordatabase, metadata-catalogisering, RAG-serving en Nvidia AI Enterprise-integratie (inclusief NIM-vectorisatie-microservices). Nucleus is storage-agnostisch en versnelt generieke Spark/Trino-workloads. De integratie van Nucleus met AIDE zou de transformatie-, training-, fine-tuning- en inferentiepijplijnen versterken, waardoor versnelde lakehouse-workloads rechtstreeks op NetApp AFX-opslag mogelijk worden; een end-to-end AIDE+Nucleus gebundelde oplossing is te verwachten.
NetApp CPO Syam Nair zegt dat Nucleus softwaregedefinieerde acceleratie bij opslag levert, waardoor zero-copy datavoorbereiding, governance en AI-activering op CPU's en GPU's mogelijk wordt gemaakt. NetApp beheert meer bedrijfsgegevens over meerdere omgevingen dan welke concurrent dan ook, en de volgende golf van AI-concurrentievermogen hangt af van de verwerking van gegevens bij de bron: het technische team van DataPelago versnelt deze strategische routekaart.
Beijing Qianxing Jietong Technologie Co., Ltd.
Sandy Yang/directeur mondiale strategie
WhatsApp / WeChat: +86 13426366826
E-mail: yangyd@qianxingdata.com
Website: www.qianxingdata.com/www.storagesserver.com
Zakelijke focus:
ICT-productdistributie/Systeemintegratie en -diensten/Infrastructuuroplossingen
Met meer dan 20 jaar ervaring in IT-distributie werken we samen met toonaangevende wereldwijde merken om betrouwbare producten en professionele diensten te leveren.
“Technologie gebruiken om een intelligente wereld te bouwen”Uw vertrouwde ICT-productdienstverlener!