Lors du sommet RAISE de Paris, DDN a présenté sa collaboration en cours avec Nebul, un fournisseur européen de cloud hybride souverain, axé sur l'amélioration de l'efficacité des déploiements d'inférence d'IA à grande échelle.Dévoilée la semaine dernière, l'initiative conjointe réunit la plateforme d'inférence de Nebul, l'architecture d'intelligence des données Infinia de DDN et l'informatique accélérée NVIDIA pour résoudre un goulot d'étranglement clé de la production d'IA:les coûts de déplacement des données et les limitations de performance lors des charges de travail d'inférence;.
DDN encadre la collaboration autour de mesures de production critiques: utilisation du GPU, débit de jetons, coût par jeton et latence.l'inférence définit ses rendements opérationnels et commerciauxL'adoption croissante de l'IA agentique, la génération augmentée par récupération (RAG),et l'inférence de haute concurrence signifie que l'infrastructure de stockage et de données a un impact direct sur l'efficacité de l'accélérateur et les vitesses de réponse de l'IA.
Ce projet actif de preuve de concept a donné des résultats prometteurs.Les partenaires ont enregistré des améliorations mesurables dans le temps de mise en œuvre du jeton avec le cache KV activé et ont terminé la validation de l'infrastructure basée sur RoCE.L'analyse comparative en cours couvre des longueurs de séquence d'inférence plus longues, libérant ainsi un potentiel d'optimisation supplémentaire pour la plateforme Infinia.La collaboration s'étend également aux efforts conjoints de NVIDIA sur les cadres de benchmarking, la vérification de l'évolutivité et les prochaines publications techniques.
La plateforme intégrée tire parti des services de cache KV distribués, du mouvement de données natif GPU, de l'orchestration intelligente des données et d'une architecture de stockage haute performance.L'accélération du cache KV offre des gains d'inférence notables en préservant et en récupérant rapidement les états d'attention précalculés, réduisant les calculs redondants et éliminant les retards de livraison de données qui provoquent le ralentissement du GPU.
Les dirigeants de DDN, Nebul et NVIDIA ont souligné un changement majeur de l'industrie: les priorités de l'infrastructure d'IA passent du déploiement brut de GPU à l'efficacité opérationnelle,maximiser les rendements du matériel d'accélérateur existant. DDN CEO Alex Bouzari and Nebul CEO Arnold Juffer noted that past focus on larger model scales has given way to optimizing inference economics to make production AI commercially viable via lower per-token costsRod Evans, vice-président de l'infrastructure cloud de NVIDIA, a ajouté que les charges de travail d'agents à grande échelle mesurent désormais le succès de l'infrastructure par l'utilisation et la latence du GPU, plutôt que par la puissance de calcul pure.
DDN souligne que l'infrastructure de l'IA doit évoluer au-delà des fonctions de stockage de base pour prendre activement en charge les flux de travail d'exécution de l'IA.Les plateformes d'infrastructure de l'entreprise alimentent actuellement plus d'un million de GPU dans le monde, au service des hypercalculateurs, des fournisseurs de cloud, des entreprises, des gouvernements et des institutions de recherche.
Les équipes d'infrastructure d'IA modernes accordent désormais la priorité à ces principales mesures de production:
Utilisation du GPU: mesure l'activité effective de l'accélérateur pendant l'inférence, maximisant la valeur du matériel GPU haut de gamme.
Coût par jeton: Lier directement les performances des infrastructures aux coûts opérationnels de sortie du modèle IA.
Tokens par watt: Évalue l'efficacité énergétique de la sortie d'inférence de l'IA.
Il est temps de faire le premier jeton.: Détermine la réactivité des applications IA interactives et l'expérience utilisateur.
Temps de production: Quantifie l'effort opérationnel de migration des services d'IA des tests vers un déploiement commercial évolutif.
Alors que l'inférence devient la charge de travail dominante de l'IA, livrant des données contextuelles et d'entreprise en cache aux GPU avec un faiblela latence stable sera essentielle pour maintenir une utilisation élevée des GPU et contrôler les coûts opérationnels à long terme.
La Commission a examiné les informations fournies par les autorités chinoises.
Sandy Yang, directeur de la stratégie mondiale
WhatsApp ou WeChat: +86 13426366826
Le courrier électronique: yangyd@qianxingdata.com
Le site Web est le suivant: www.qianxingdata.com/www.storagesserver.com
En ce qui concerne les affaires
Distribution de produits TIC/Intégration des systèmes et services/Solutions d'infrastructure
Avec plus de 20 ans d'expérience dans la distribution informatique, nous travaillons en partenariat avec des marques mondiales de premier plan pour fournir des produits fiables et des services professionnels.
Utiliser la technologie pour bâtir un monde intelligentVotre fournisseur de services de produits TIC de confiance!
Sandy Yang, directeur de la stratégie mondiale
WhatsApp ou WeChat: +86 13426366826
Le courrier électronique: yangyd@qianxingdata.com
Le site Web est le suivant: www.qianxingdata.com/www.storagesserver.com
En ce qui concerne les affaires
Distribution de produits TIC/Intégration des systèmes et services/Solutions d'infrastructure
Avec plus de 20 ans d'expérience dans la distribution informatique, nous travaillons en partenariat avec des marques mondiales de premier plan pour fournir des produits fiables et des services professionnels.
Utiliser la technologie pour bâtir un monde intelligentVotre fournisseur de services de produits TIC de confiance!



