logo
Aperçu Les affaires

VAST Data et AMD revendiquent un temps de première token 9 fois plus rapide avec le déchargement du cache KV sur Instinct

Certificat
Chine Beijing Qianxing Jietong Technology Co., Ltd. certifications
Chine Beijing Qianxing Jietong Technology Co., Ltd. certifications
Examens de client
Le personnel de vente de Beijing Qianxing Jietong Technology Co.,Ltd sont très professionnel et patient. Ils peuvent fournir des citations rapidement. La qualité et l'emballage des produits sont également très bons. Notre coopération est très lisse.

—— LLC de》 de Festfing DV de 《

Quand je recherchais l'unité centrale de traitement d'Intel et le disque transistorisé de Toshiba instamment, Sandy de Beijing Qianxing Jietong Technology Co., Ltd m'a donné beaucoup d'aide et m'a obtenu les produits que j'ai eus besoin rapidement. Je l'apprécie vraiment.

—— Kitty Yen

Sandy de Beijing Qianxing Jietong Technology Co.,Ltd est un vendeur très soigneux, qui peut me rappeler des erreurs de configuration à temps où j'achète un serveur. Les ingénieurs sont également très professionnels et peuvent rapidement compléter le processus de essai.

—— Strelkin Mikhail Vladimirovich

Nous sommes très satisfaits de notre expérience de travail avec Beijing Qianxing Jietong. La qualité du produit est excellente et la livraison est toujours à l'heure. Leur équipe de vente est professionnelle, patiente et très serviable pour toutes nos questions. Nous apprécions vraiment leur soutien et nous nous réjouissons d'un partenariat à long terme. Fortement recommandé !

—— Ahmad Navid

Qualité: “Grande expérience avec mon fournisseur. Le MikroTik RB3011 était déjà utilisé, mais il était en très bon état et tout fonctionnait parfaitement.et toutes mes préoccupations ont été traitées rapidementUn fournisseur très fiable, très recommandé.

—— Geran Colesio

Je suis en ligne une discussion en ligne

VAST Data et AMD revendiquent un temps de première token 9 fois plus rapide avec le déchargement du cache KV sur Instinct

July 28, 2026
VAST Data a étendu son partenariat avec AMD pour faire progresser l'infrastructure d'IA pour les plateformes cloud et d'entreprise exécutant l'entraînement de modèles, l'inférence, la génération augmentée par récupération (RAG) et les charges de travail d'IA agentiques. La pile intégrée unit le système d'exploitation VAST AI avec les processeurs AMD EPYC de 6e génération, les GPU AMD Instinct, le matériel réseau AMD et le logiciel ROCm.

Cette collaboration s'aligne sur un changement majeur de l'industrie : l'infrastructure d'IA évolue au-delà des clusters d'entraînement uniquement pour prendre en charge le contexte persistant, l'inférence à haute concurrence et les flux de travail d'agents multi-tours. Les déploiements d'IA modernes privilégient le mouvement efficace des données, la gestion optimisée du cache KV, une utilisation plus élevée des GPU et un accès à faible latence aux grands modèles et aux ensembles de données contextuels.

L'architecture DASE (Disaggregated Shared Everything) de VAST sert de couche de données partagée unifiée pour ces environnements d'IA modernes. Elle consolide le stockage de fichiers et d'objets, les bases de données, le streaming d'événements et les services de données de base sous un seul espace de noms global, tout en offrant la multi-location et l'isolation des charges de travail pour les clouds d'IA exécutant diverses tâches clients et applications concurrentes.

AMD EPYC 9006 alimente la prochaine génération de matériel VAST

VAST adopte les processeurs AMD EPYC 9006 de 6e génération (Venice) pour ses futurs systèmes CBox de 6e génération et EBox de 3e génération, qui forment la base matérielle du système d'exploitation VAST AI. La plateforme EPYC 9006 introduit la connectivité PCIe Gen6 dans la gamme matérielle de VAST, doublant la bande passante d'E/S par génération.

dernière affaire concernant VAST Data et AMD revendiquent un temps de première token 9 fois plus rapide avec le déchargement du cache KV sur Instinct  0

La mise à niveau augmente le débit du stockage de fichiers et d'objets et réduit la latence pour les charges de travail de bases de données, d'entrepôts de données et de streaming d'événements prises en charge par VAST DataBase et DataEngine. Pour l'infrastructure d'IA, la bande passante d'E/S améliorée atténue les goulots d'étranglement entre le calcul, le réseau et le stockage NVMe, bénéficiant au chargement des modèles, aux pipelines de récupération, à l'accès aux points de contrôle et aux flux de travail de cache KV externes qui dépassent les limites de la mémoire GPU native.

Architecture de référence à trois joueurs avec AMD et DriveNets

VAST, AMD et DriveNets construisent conjointement une architecture de référence d'infrastructure d'IA unifiée, combinant l'infrastructure d'IA à l'échelle du rack Helios d'AMD, le système d'exploitation VAST AI et le réseau AI Fabric de DriveNets. Le cadre fournit des directives de déploiement standardisées pour les charges de travail d'entraînement, d'inférence, d'apprentissage par renforcement et de cache KV d'IA, offrant des meilleures pratiques de dimensionnement et de disponibilité pour les entreprises construisant des usines d'IA avec une infrastructure de données partagée et un réseau haute performance.

VAST a également élargi ses liens écosystémiques avec les fournisseurs d'inférence TensorMesh et EmbeddedLLM, se concentrant sur les architectures d'inférence de qualité production pour les cas d'utilisation d'IA agentiques, avec des détails d'intégration et de lancement spécifiques encore à divulguer.

Déchargement optimisé du cache KV pour l'inférence à haute concurrence

La pièce maîtresse de la collaboration mise à jour est le déchargement amélioré du cache KV, tirant parti des GPU AMD Instinct, d'AMD Infinity Context, du logiciel ROCm et du système d'exploitation VAST AI. Le cache KV stocke les données d'état d'attention générées par l'inférence pour accélérer les interactions multi-tours et les charges de travail d'IA à contexte long, mais les grandes tailles de cache consomment rapidement la mémoire GPU limitée.

dernière affaire concernant VAST Data et AMD revendiquent un temps de première token 9 fois plus rapide avec le déchargement du cache KV sur Instinct  1

Le déchargement ou la hiérarchisation du cache KV vers un stockage partagé haute performance libère la mémoire GPU pour les tâches actives tout en préservant les données contextuelles pour les requêtes d'inférence ultérieures. Les premiers tests sur les GPU AMD Instinct MI355X ont permis un temps de premier jeton 9 fois plus rapide et un débit de jeton 9,7 fois plus élevé pour les charges de travail d'IA agentiques à haute concurrence via le déchargement du cache KV alimenté par VAST, les performances variant en fonction de la base matérielle, de la charge de travail et de la configuration de stockage.

De plus, les politiques de cycle de vie automatisées de VAST s'appliquent aux données du cache KV, permettant l'expiration et la suppression programmées du contenu mis en cache - une fonctionnalité critique pour la gestion des données d'inférence sensibles, personnelles ou réglementées.

Interconnexion GPU-stockage à haute vitesse via Pensando Pollara 400

L'architecture déploie les cartes réseau IA AMD Pensando Pollara 400 pour connecter les GPU AMD Instinct aux clusters de stockage VAST. Prenant en charge NFS sur TCP et RDMA, la carte réseau permet des transferts de données efficaces du GPU vers le stockage, offrant un accès à faible latence au stockage VAST basé sur NVMe pour le cache KV et les charges de travail d'inférence générales.

Cette conception découple la mise à l'échelle de la gestion du contexte des limites de la mémoire GPU physique. Plutôt que de traiter le stockage comme une persistance passive, VAST positionne sa plateforme comme une couche de données et d'exécution unifiée pour la gestion distribuée des modèles, les bases de données, le streaming, les actifs de fichiers et le contexte d'IA. Pour les fournisseurs de cloud d'IA, l'architecture améliore l'utilisation des GPU et l'efficacité opérationnelle, soutenant la transition de l'industrie de l'entraînement par lots et de la location de GPU vers l'inférence persistante et les services d'IA agentiques.

Beijing Qianxing Jietong Technology Co., Ltd.
Sandy Yang/Directeur de la stratégie mondiale
WhatsApp / WeChat : +86 13426366826
E-mail : yangyd@qianxingdata.com
Site Web : www.qianxingdata.com/www.storagesserver.com
Focus commercial :
Distribution de produits TIC / Intégration de systèmes et services / Solutions d'infrastructure
Avec plus de 20 ans d'expérience dans la distribution informatique, nous nous associons à des marques mondiales de premier plan pour fournir des produits fiables et des services professionnels.
« Utiliser la technologie pour construire un monde intelligent » Votre fournisseur de services de produits TIC de confiance !
Coordonnées
Beijing Qianxing Jietong Technology Co., Ltd.

Personne à contacter: Ms. Sandy Yang

Téléphone: 13426366826

Envoyez votre demande directement à nous (0 / 3000)