NetApp va acquérir DataPelago, créateur du Nucleus Universal Data Processing Engine (UDPE) qui accélère le calcul hétérogène pour l'analyse et l'IA générative.
Construit sur Gluten, Velox et Substrait open source, Nucleus accélère considérablement Spark et Trino pour offrir un rapport coût/performance exceptionnel. Il se connecte de manière transparente aux Lakehouses existants, SQL, Python, Airflow, Tableau, Power BI et bien plus encore, sans migration de données ni dépendance vis-à-vis d'un fournisseur. Fondée en 2021 par le PDG Rajan Goyal et le CPO Anand Iyer, DataPelago a quitté la furtivité en octobre 2024 et a levé plus de 75 millions de dollars au total, dont un cycle de financement de 47 millions de dollars en 2024.
George Kurian, PDG de NetApp, a déclaré que les progrès du matériel d'IA nécessitent une infrastructure de données tout aussi performante pour libérer la valeur des données d'entreprise, et que l'acquisition renforce la capacité de NetApp à fournir un traitement de données agile pour une différenciation concurrentielle.
Un blog de DataPelago indique que Nucleus sera intégré de manière native à la plate-forme de données de NetApp, permettant ainsi une adoption par l'entreprise bien plus large que ce que la startup pourrait réaliser de manière indépendante. Plus tôt cette année, DataPelago s'est classée quatrième en science des données sur la liste 2026 des entreprises les plus innovantes au monde de Fast Company.
Contrairement aux architectures traditionnelles qui déplacent les ensembles de données vers des clusters CPU/GPU externes, Nucleus exécute un calcul accéléré directement au niveau du stockage. Les benchmarks par rapport à Nvidia cuDF montrent des projections jusqu'à 10,5 fois plus rapides, des filtres 10,1 fois plus rapides et des agrégations 4,3 fois plus rapides. Positionnée entre les moteurs de requêtes (Spark, Trino, Flink) et les frameworks Python (Ray, Dask), sa stack comporte trois couches modulaires :
1.DataApp : module d'intégration enfichable pour injecter de l'accélération dans Spark, Trino et d'autres moteurs.
2.DataOS : couche d'orchestration mappant dynamiquement les tâches de données à des accélérateurs mixtes pour un réglage des performances évolutif.
3.DataVM : machine virtuelle personnalisée avec ISA spécifique au domaine, offrant une abstraction d'exécution unifiée pour les CPU, les GPU, les FPGA et le silicium personnalisé.
Flux d'exécution des données de base
1. Accès aux données via des connecteurs de framework : déployés en tant que plugins Spark JAR compatibles avec les connecteurs de données standard, prenant en charge Parquet, ORC, Iceberg, Delta Lake, JSON et les cibles de stockage, notamment S3, GCS, ADLS, HDFS et les baies sur site. L'accélération s'étend aux intégrations de stockage tout en conservant la sémantique native des requêtes via les couches d'E/S du moteur standard.
2. Planification et optimisation des requêtes : le moteur hôte génère un plan physique ; DataApp le convertit en une représentation intermédiaire via Gluten/Substrait. Un optimiseur intelligent crée des graphiques de flux de données optimaux et alloue des ressources CPU/GPU pour l'exécution de DataOS/DataVM.
3.Optimisations du transfert de données entre matériels : la fusion opérateur/noyau et l'exécution en streaming éliminent la matérialisation intermédiaire complète pour réduire les frais d'E/S. La mémoire partagée sans copie réduit la duplication des données CPU-GPU, tandis que l'ISA de DataVM exploite LLVM, CUDA et ROCm pour acheminer les tâches vers un matériel optimal via un traitement vectorisé en colonnes. Ces ajustements portent l'utilisation du GPU à 80-90 % en minimisant le brassage des données entre domaines.
Nucleus fonctionne sur site et dans les principaux cloud publics. Son accélérateur Spark offre des gains de débit 3 à 4 fois supérieurs à ceux de Databricks Photon ; il s'intègre également à Snowflake en accélérant le traitement du format de table ouverte et les pipelines Spark/Trino en amont/en aval alimentant l'entrepôt. DataPelago déclare que Nucleus réduit les coûts d'infrastructure jusqu'à 80 % et offre des performances 10 fois plus rapides que les pipelines existants. En supprimant la duplication obligatoire des données entre les systèmes opérationnels et les systèmes d'IA, il élimine le principal goulot d'étranglement qui ralentit le déploiement de l'IA en entreprise, avec des déploiements en direct dans les grandes entreprises mondiales dans tous les secteurs verticaux.
Rajan Goyal, PDG de DataPelago, a déclaré que la mission principale de l'entreprise est de résoudre les goulots d'étranglement du traitement des données qui freinent l'innovation en matière d'IA. La fusion avec NetApp associe sa technologie d'accélération révolutionnaire au vaste portefeuille d'infrastructures de données de NetApp ; les entreprises ont investi massivement dans les GPU et les modèles, mais souffrent de silos de données fragmentés qui laissent le matériel sous-utilisé, et la pile combinée rationalise le déploiement de l'IA à grande échelle.
NetApp considère cette acquisition comme une mise à niveau historique de son portefeuille, intégrant le traitement accéléré par GPU directement dans les flux de stockage afin de fournir une véritable activation des données d'entreprise sans copie pour l'IA. Les données financières des transactions restent confidentielles ; Compte tenu de l'attrait de Nucleus pour l'entreprise, de la synergie étroite avec NetApp AIDE et de la demande croissante d'IA agentique, la valorisation de l'achat se situe probablement à un multiple de 4 à 5 fois le financement total de 75 millions de dollars de DataPelago. DataPelago fonctionnera comme une filiale à part entière de NetApp.
Distinction clé : Nucleus, KV Cache et NetApp AIDE
1. Différenciation Nucleus et KV Cache : Nucleus optimise l'ingestion, la transformation et l'interrogation des données avant l'inférence avant que les données n'atteignent les serveurs GPU. Le cache KV de Nvidia est une optimisation de la mémoire intégrée au GPU, active uniquement après l'arrivée des données sur le matériel GPU pour améliorer l'efficacité de la génération de jetons. Nucleus accélère la transmission des données vers le calcul ; KV Cache optimise le temps d'exécution du modèle une fois les données atterries sur les accélérateurs.
2.NetApp AIDE vs Nucleus UDPE : AIDE est un prétraitement d'IA verrouillé par ONTAP/AFX pour les LLM et les agents, fonctionnant comme un ETL propriétaire avec une base de données vectorielle intégrée, un catalogage de métadonnées, un service RAG et une intégration Nvidia AI Enterprise (y compris les microservices de vectorisation NIM). Nucleus est indépendant du stockage et accélère les charges de travail génériques Spark/Trino. L'intégration de Nucleus à AIDE renforcerait les pipelines de transformation, de formation, de réglage fin et d'inférence, permettant ainsi d'accélérer les charges de travail Lakehouse directement sur le stockage NetApp AFX ; une solution groupée AIDE+Nucleus de bout en bout est envisageable.
Syam Nair, CPO de NetApp, a commenté que Nucleus offre une accélération définie par logiciel au niveau du stockage, permettant la préparation des données sans copie, la gouvernance et l'activation de l'IA sur les CPU et les GPU. NetApp gère plus de données multi-environnements d'entreprise que n'importe quel rival, et la prochaine vague de compétitivité en matière d'IA dépend du traitement des données à la source : l'équipe d'ingénierie de DataPelago accélère cette feuille de route stratégique.
Pékin Qianxing Jietong Technology Co., Ltd.
Sandy Yang/Directrice de la stratégie mondiale
WhatsApp/WeChat : +86 13426366826
Courriel : yangyd@qianxingdata.com
Site Web : www.qianxingdata.com/www.storagesserver.com
Objectif commercial :
Distribution de produits TIC/Intégration et services de systèmes/Solutions d'infrastructure
Avec plus de 20 ans d'expérience dans la distribution informatique, nous collaborons avec de grandes marques mondiales pour fournir des produits et des services professionnels fiables.
« Utiliser la technologie pour construire un monde intelligent » Votre fournisseur de services de produits TIC de confiance !