VAST Data a étendu son partenariat avec AMD pour faire progresser l'infrastructure d'IA pour les plateformes cloud et d'entreprise exécutant l'entraînement de modèles, l'inférence, la génération augmentée par récupération (RAG) et les charges de travail d'IA agentiques. La pile intégrée unit le système d'exploitation VAST AI avec les processeurs AMD EPYC de 6e génération, les GPU AMD Instinct, le matériel réseau AMD et le logiciel ROCm.
Cette collaboration s'aligne sur un changement majeur de l'industrie : l'infrastructure d'IA évolue au-delà des clusters d'entraînement uniquement pour prendre en charge le contexte persistant, l'inférence à haute concurrence et les flux de travail d'agents multi-tours. Les déploiements d'IA modernes privilégient le mouvement efficace des données, la gestion optimisée du cache KV, une utilisation plus élevée des GPU et un accès à faible latence aux grands modèles et aux ensembles de données contextuels.
L'architecture DASE (Disaggregated Shared Everything) de VAST sert de couche de données partagée unifiée pour ces environnements d'IA modernes. Elle consolide le stockage de fichiers et d'objets, les bases de données, le streaming d'événements et les services de données de base sous un seul espace de noms global, tout en offrant la multi-location et l'isolation des charges de travail pour les clouds d'IA exécutant diverses tâches clients et applications concurrentes.
AMD EPYC 9006 alimente la prochaine génération de matériel VAST
VAST adopte les processeurs AMD EPYC 9006 de 6e génération (Venice) pour ses futurs systèmes CBox de 6e génération et EBox de 3e génération, qui forment la base matérielle du système d'exploitation VAST AI. La plateforme EPYC 9006 introduit la connectivité PCIe Gen6 dans la gamme matérielle de VAST, doublant la bande passante d'E/S par génération.
La mise à niveau augmente le débit du stockage de fichiers et d'objets et réduit la latence pour les charges de travail de bases de données, d'entrepôts de données et de streaming d'événements prises en charge par VAST DataBase et DataEngine. Pour l'infrastructure d'IA, la bande passante d'E/S améliorée atténue les goulots d'étranglement entre le calcul, le réseau et le stockage NVMe, bénéficiant au chargement des modèles, aux pipelines de récupération, à l'accès aux points de contrôle et aux flux de travail de cache KV externes qui dépassent les limites de la mémoire GPU native.
Architecture de référence à trois joueurs avec AMD et DriveNets
VAST, AMD et DriveNets construisent conjointement une architecture de référence d'infrastructure d'IA unifiée, combinant l'infrastructure d'IA à l'échelle du rack Helios d'AMD, le système d'exploitation VAST AI et le réseau AI Fabric de DriveNets. Le cadre fournit des directives de déploiement standardisées pour les charges de travail d'entraînement, d'inférence, d'apprentissage par renforcement et de cache KV d'IA, offrant des meilleures pratiques de dimensionnement et de disponibilité pour les entreprises construisant des usines d'IA avec une infrastructure de données partagée et un réseau haute performance.
VAST a également élargi ses liens écosystémiques avec les fournisseurs d'inférence TensorMesh et EmbeddedLLM, se concentrant sur les architectures d'inférence de qualité production pour les cas d'utilisation d'IA agentiques, avec des détails d'intégration et de lancement spécifiques encore à divulguer.
Déchargement optimisé du cache KV pour l'inférence à haute concurrence
La pièce maîtresse de la collaboration mise à jour est le déchargement amélioré du cache KV, tirant parti des GPU AMD Instinct, d'AMD Infinity Context, du logiciel ROCm et du système d'exploitation VAST AI. Le cache KV stocke les données d'état d'attention générées par l'inférence pour accélérer les interactions multi-tours et les charges de travail d'IA à contexte long, mais les grandes tailles de cache consomment rapidement la mémoire GPU limitée.
Le déchargement ou la hiérarchisation du cache KV vers un stockage partagé haute performance libère la mémoire GPU pour les tâches actives tout en préservant les données contextuelles pour les requêtes d'inférence ultérieures. Les premiers tests sur les GPU AMD Instinct MI355X ont permis un temps de premier jeton 9 fois plus rapide et un débit de jeton 9,7 fois plus élevé pour les charges de travail d'IA agentiques à haute concurrence via le déchargement du cache KV alimenté par VAST, les performances variant en fonction de la base matérielle, de la charge de travail et de la configuration de stockage.
De plus, les politiques de cycle de vie automatisées de VAST s'appliquent aux données du cache KV, permettant l'expiration et la suppression programmées du contenu mis en cache - une fonctionnalité critique pour la gestion des données d'inférence sensibles, personnelles ou réglementées.
Interconnexion GPU-stockage à haute vitesse via Pensando Pollara 400
L'architecture déploie les cartes réseau IA AMD Pensando Pollara 400 pour connecter les GPU AMD Instinct aux clusters de stockage VAST. Prenant en charge NFS sur TCP et RDMA, la carte réseau permet des transferts de données efficaces du GPU vers le stockage, offrant un accès à faible latence au stockage VAST basé sur NVMe pour le cache KV et les charges de travail d'inférence générales.
Cette conception découple la mise à l'échelle de la gestion du contexte des limites de la mémoire GPU physique. Plutôt que de traiter le stockage comme une persistance passive, VAST positionne sa plateforme comme une couche de données et d'exécution unifiée pour la gestion distribuée des modèles, les bases de données, le streaming, les actifs de fichiers et le contexte d'IA. Pour les fournisseurs de cloud d'IA, l'architecture améliore l'utilisation des GPU et l'efficacité opérationnelle, soutenant la transition de l'industrie de l'entraînement par lots et de la location de GPU vers l'inférence persistante et les services d'IA agentiques.
Beijing Qianxing Jietong Technology Co., Ltd.
Sandy Yang/Directeur de la stratégie mondiale
WhatsApp / WeChat : +86 13426366826
E-mail : yangyd@qianxingdata.com
Site Web : www.qianxingdata.com/www.storagesserver.com
Focus commercial :
Distribution de produits TIC / Intégration de systèmes et services / Solutions d'infrastructure
Avec plus de 20 ans d'expérience dans la distribution informatique, nous nous associons à des marques mondiales de premier plan pour fournir des produits fiables et des services professionnels.
« Utiliser la technologie pour construire un monde intelligent » Votre fournisseur de services de produits TIC de confiance !
Sandy Yang/Directeur de la stratégie mondiale
WhatsApp / WeChat : +86 13426366826
E-mail : yangyd@qianxingdata.com
Site Web : www.qianxingdata.com/www.storagesserver.com
Focus commercial :
Distribution de produits TIC / Intégration de systèmes et services / Solutions d'infrastructure
Avec plus de 20 ans d'expérience dans la distribution informatique, nous nous associons à des marques mondiales de premier plan pour fournir des produits fiables et des services professionnels.
« Utiliser la technologie pour construire un monde intelligent » Votre fournisseur de services de produits TIC de confiance !



