logo
Aperçu Nouvelles

nouvelles de l'entreprise Livre rouge de Big Blue sur la gestion du cache KV à l'échelle du stockage

Certificat
Chine Beijing Qianxing Jietong Technology Co., Ltd. certifications
Chine Beijing Qianxing Jietong Technology Co., Ltd. certifications
Examens de client
Le personnel de vente de Beijing Qianxing Jietong Technology Co.,Ltd sont très professionnel et patient. Ils peuvent fournir des citations rapidement. La qualité et l'emballage des produits sont également très bons. Notre coopération est très lisse.

—— LLC de》 de Festfing DV de 《

Quand je recherchais l'unité centrale de traitement d'Intel et le disque transistorisé de Toshiba instamment, Sandy de Beijing Qianxing Jietong Technology Co., Ltd m'a donné beaucoup d'aide et m'a obtenu les produits que j'ai eus besoin rapidement. Je l'apprécie vraiment.

—— Kitty Yen

Sandy de Beijing Qianxing Jietong Technology Co.,Ltd est un vendeur très soigneux, qui peut me rappeler des erreurs de configuration à temps où j'achète un serveur. Les ingénieurs sont également très professionnels et peuvent rapidement compléter le processus de essai.

—— Strelkin Mikhail Vladimirovich

Nous sommes très satisfaits de notre expérience de travail avec Beijing Qianxing Jietong. La qualité du produit est excellente et la livraison est toujours à l'heure. Leur équipe de vente est professionnelle, patiente et très serviable pour toutes nos questions. Nous apprécions vraiment leur soutien et nous nous réjouissons d'un partenariat à long terme. Fortement recommandé !

—— Ahmad Navid

Qualité: “Grande expérience avec mon fournisseur. Le MikroTik RB3011 était déjà utilisé, mais il était en très bon état et tout fonctionnait parfaitement.et toutes mes préoccupations ont été traitées rapidementUn fournisseur très fiable, très recommandé.

—— Geran Colesio

Je suis en ligne une discussion en ligne
Société Nouvelles
Livre rouge de Big Blue sur la gestion du cache KV à l'échelle du stockage

Le système de fichiers parallèle IBM Storage Scale prend en charge la gestion distribuée du cache KV associée à NVIDIA Dynamo, répondant aux scénarios d'inférence d'IA à grande échelle avec des charges de travail contextuelles massives.

dernières nouvelles de l'entreprise Livre rouge de Big Blue sur la gestion du cache KV à l'échelle du stockage  0

IBM a publié un Redbook officiel intituléContexte sans limites : une plate-forme de cache KV hautes performances pour l'inférence d'IA à grande échelle, fournissant une architecture de référence complète et validée pour cette solution commune. La pile intégrée combine les serveurs de stockage Supermicro Petascale, le réseau Ethernet NVIDIA Spectrum-X et IBM Storage Scale Erasure Coding Edition (ECE) pour créer un niveau de stockage partagé hautes performances pour l'inférence d'IA. En tant que documents techniques faisant autorité publiés par IBM ITSO (International Technical Support Organization), les IBM Redbooks proposent des conseils de déploiement pratiques et approfondis pour les produits d'infrastructure IBM de niveau entreprise.

Co-écrit par les équipes d'ingénierie d'IBM, Supermicro et NVIDIA, le Redbook aborde un problème majeur des charges de travail d'IA à contexte long. Les cas d'utilisation, notamment les assistants de dialogue multi-tours, les applications de récupération RAG et les pipelines d'agents autonomes, génèrent d'énormes données de cache KV dans le GPU HBM. Une fois les données mises en cache supprimées des ressources HBM limitées, des recalculs répétés déclencheront de fortes augmentations de latence, rendant indispensable le stockage persistant du cache KV à requêtes croisées.

La solution adopte une architecture de cache KV hiérarchique à cinq niveaux couvrant différentes demandes de latence et de capacité :
  • Couche G1: HBM local du nœud GPU
  • Couche G2: DRAM système du nœud CPU
  • Couche G3: SSD local à connexion directe
  • Couche G3.5: stockage flash partagé au niveau du pod, piloté par des DPU NVIDIA BlueField avec interconnexion directe aux DPU du serveur GPU
  • Couche G4 : Pool de stockage partagé cross-Ethernet externe connecté à tous les serveurs de calcul GPU
Couvrant la mémoire et la hiérarchie de stockage de bout en bout, cette configuration multiniveau offre des gradients de latence et de capacité continus. Il permet à NVIDIA Dynamo d'effectuer un placement intelligent du cache, une expulsion automatique et un rechargement dynamique des données sur l'ensemble de la pile de stockage, en s'adaptant de manière flexible aux différents modèles d'accès aux charges de travail et aux budgets totaux de coûts d'infrastructure.

Déployé sur les serveurs de stockage Supermicro Petascale, Storage Scale ECE sert de niveau de cache froid G4. Il est optimisé pour les données de cache KV non sensibles à la latence, y compris les états de conversation multi-tours inactifs, les données contextuelles d'agent partagées et les enregistrements de requêtes historiques qui ne nécessitent pas de réponse instantanée.

Selon les résultats des tests enregistrés dans le Redbook, cette architecture de référence prête pour la production accélère efficacement les services d'inférence d'IA générative et d'IA agentique. Dans les tests TTFT (Time To First Token) à requête unique par rapport aux serveurs GPU autonomes sans cache KV Storage Scale externe, le système intégré maintient un TTFT stable indépendamment des changements de longueur d'invite. Il réalise unAccélération 56xsous des séquences d'entrée de 130 000 jetons et élimine complètement les fluctuations de latence d'inférence causées par des longueurs d'invite prolongées.

Sous la pression d'inférence multi-utilisateurs simultanée, la solution permet d'améliorer considérablement les performances : le débit des requêtes passe de 0,19 RPS à 4,26 RPS, marquant ainsi un record.Augmentation du débit 22x. Parallèlement, le temps de traitement total pour 200 requêtes d'inférence diminue de 95 %, ce qui améliore considérablement l'efficacité d'utilisation du GPU et l'évolutivité globale du cluster d'inférence.

La pile maintient également des performances robustes lors de tests de stress sévères en présence de voisins bruyants. Avec quatre extrémités client générant un trafic d'E/S réseau concurrent soutenu de 200 Go/s, le système intégré fonctionne toujours de manière stable à 3,6 RPS, terminant les 200 requêtes d'inférence en 55,56 secondes. Son débit reste18x plus élevéque l’architecture de recalcul de base uniquement GPU.

L'équipe de recherche a conclu dans le Redbook : « Pour les entreprises qui cherchent à maximiser le retour sur investissement sur des investissements coûteux en matériel GPU, cette architecture intégrée vérifiée fournit une approche simple et prête pour la production pour augmenter le débit d'inférence, réduire la latence de bout en bout, prendre en charge une plus grande concurrence de services et créer une infrastructure d'inférence d'IA à grande échelle plus rentable. »

Mots-clés : SUPERMICRO, échelle de stockage IBM, NVIDIA Dynamo

Pékin Qianxing Jietong Technology Co., Ltd.
Sandy Yang/Directrice de la stratégie mondiale
WhatsApp/WeChat : +86 13426366826
Courriel : yangyd@qianxingdata.com
Site Web : www.qianxingdata.com/www.storagesserver.com
Objectif commercial :
Distribution de produits TIC/Intégration et services de systèmes/Solutions d'infrastructure
Avec plus de 20 ans d'expérience dans la distribution informatique, nous collaborons avec de grandes marques mondiales pour fournir des produits et des services professionnels fiables.
« Utiliser la technologie pour construire un monde intelligent » Votre fournisseur de services de produits TIC de confiance !
Temps de bar : 2026-06-12 11:09:46 >> Liste de nouvelles
Coordonnées
Beijing Qianxing Jietong Technology Co., Ltd.

Personne à contacter: Ms. Sandy Yang

Téléphone: 13426366826

Envoyez votre demande directement à nous (0 / 3000)