logo
Aperçu Nouvelles

nouvelles de l'entreprise Le logiciel WEKA accélère l’inférence d’IA à long contexte sur le cloud public d’Oracle

Certificat
Chine Beijing Qianxing Jietong Technology Co., Ltd. certifications
Chine Beijing Qianxing Jietong Technology Co., Ltd. certifications
Examens de client
Le personnel de vente de Beijing Qianxing Jietong Technology Co.,Ltd sont très professionnel et patient. Ils peuvent fournir des citations rapidement. La qualité et l'emballage des produits sont également très bons. Notre coopération est très lisse.

—— LLC de》 de Festfing DV de 《

Quand je recherchais l'unité centrale de traitement d'Intel et le disque transistorisé de Toshiba instamment, Sandy de Beijing Qianxing Jietong Technology Co., Ltd m'a donné beaucoup d'aide et m'a obtenu les produits que j'ai eus besoin rapidement. Je l'apprécie vraiment.

—— Kitty Yen

Sandy de Beijing Qianxing Jietong Technology Co.,Ltd est un vendeur très soigneux, qui peut me rappeler des erreurs de configuration à temps où j'achète un serveur. Les ingénieurs sont également très professionnels et peuvent rapidement compléter le processus de essai.

—— Strelkin Mikhail Vladimirovich

Nous sommes très satisfaits de notre expérience de travail avec Beijing Qianxing Jietong. La qualité du produit est excellente et la livraison est toujours à l'heure. Leur équipe de vente est professionnelle, patiente et très serviable pour toutes nos questions. Nous apprécions vraiment leur soutien et nous nous réjouissons d'un partenariat à long terme. Fortement recommandé !

—— Ahmad Navid

Qualité: “Grande expérience avec mon fournisseur. Le MikroTik RB3011 était déjà utilisé, mais il était en très bon état et tout fonctionnait parfaitement.et toutes mes préoccupations ont été traitées rapidementUn fournisseur très fiable, très recommandé.

—— Geran Colesio

Je suis en ligne une discussion en ligne
Société Nouvelles
Le logiciel WEKA accélère l’inférence d’IA à long contexte sur le cloud public d’Oracle

Fonctionnant sur Oracle Cloud Infrastructure (OCI), les logiciels WEKA NeuralMesh et Augmented Memory Grid offrent un débit de jetons 10 fois plus élevé, 10 fois plus d'utilisateurs simultanés et 7 fois plus de jetons par GPU, par rapport aux environnements OCI standard reposant uniquement sur la DRAM locale.

dernières nouvelles de l'entreprise Le logiciel WEKA accélère l’inférence d’IA à long contexte sur le cloud public d’Oracle  0

La grille de mémoire augmentée de WEKA étend la mémoire du serveur GPU pour l'inférence d'IA en tirant parti du stockage externe via NeuralMesh, transformant les ressources externes en un cache KV hautes performances. Il offre une latence de l'ordre de la microseconde et une bande passante de plusieurs Go/s, offrant jusqu'à pétaoctets d'espace d'adressage mémoire supplémentaire, avec une compatibilité totale avec l'architecture de mise en cache SX KV de NVIDIA. NeuralMesh est le système de fichiers IA hautes performances de WEKA. Tous les tests ont été validés sur un cluster OCI H100 nu à 9 nœuds avec des fenêtres contextuelles de 100 000 jetons.

Pablo Salem, directeur principal du développement logiciel chez OCI, a commenté : "Les charges de travail d'IA d'entreprise continuent d'élargir les fenêtres de contexte et d'élever l'utilisation du GPU à de nouvelles limites. Ces tests prouvent que la solution de WEKA élimine les goulots d'étranglement de la mémoire GPU sur OCI, permettant ainsi des charges de travail d'inférence plus importantes et plus exigeantes sans investissements matériels GPU supplémentaires."

WEKA note que la demande croissante d’inférence amplifie les inefficacités des infrastructures d’IA. Les expulsions fréquentes du cache KV créent une surcharge cachée qui gaspille les cycles GPU, augmente la latence, nuit à l'expérience utilisateur et augmente les coûts opérationnels par jeton. Pour les charges de travail d’IA agentique et à contexte long avec plus de 100 000 jetons d’entrée, une telle surcharge nuit gravement à l’économie unitaire des déploiements d’IA en production.

Le benchmark a été construit sur 9 nœuds, 72 GPU H100, des fenêtres contextuelles de 100 000 jetons et des milliers d'utilisateurs simultanés, avec des écarts de performances évidents indiqués ci-dessous :
  • Capacité d'utilisateurs simultanés: WEKA a pris en charge plus de 5 000 utilisateurs simultanés, contre seulement 600 sur les configurations DRAM uniquement. Il évite les échecs de saturation du cache en étendant le cache actif de 8,64 TiB de DRAM à 287 TiB de stockage flash NVMe, maximisant ainsi le retour sur investissement sur le matériel GPU existant sans achat de GPU supplémentaire.
  • Débit des jetons: La pile WEKA a atteint environ 2 millions de jetons par seconde, 10 fois plus rapidement que la ligne de base inférieure à 200 000 jetons/s des systèmes uniquement DRAM.
  • Volume total de traitement des jetons: Au cours d'un test d'une heure avec 2 400 utilisateurs simultanés, WEKA a traité 5 milliards de jetons, tandis que la configuration DRAM uniquement n'a géré que 700 millions de jetons.
Pour les workflows d'IA agentique, une DRAM insuffisante déclenche un recalcul constant du GPU après saturation du cache, augmentant ainsi les coûts par jeton et réduisant le retour sur investissement. Avec 7x jetons traités par GPU, WEKA réduit considérablement les coûts globaux des jetons pour les services d'IA de production.

Pour les services d'IA en temps réel, notamment la recherche, la synthèse, l'assistance au code et les agents multi-tours, le débit des jetons définit les limites du service en termes de capacité utilisateur, de vitesse de réponse et de potentiel de revenus de l'infrastructure. L'amélioration du débit 10x libère pleinement la puissance de calcul GPU native au sein du cluster OCI.

En bref, le logiciel d'extension de mémoire de WEKA aide les plateformes cloud à servir davantage d'utilisateurs, à traiter plus de jetons et à réduire efficacement les coûts opérationnels.

Liran Zvibel, PDG de WEKA, a déclaré : "Les performances d'inférence sont entravées par la mémoire efficace disponible du GPU. Ces résultats prouvent que les mises à niveau matérielles à elles seules ne peuvent pas résoudre les problèmes économiques des jetons d'IA. La véritable limitation est le mur de mémoire de longue date qui restreint les performances du GPU. La solution de WEKA sur OCI augmente considérablement la capacité de traitement des jetons avec un coût total de possession optimisé."

OCI a publié une méthodologie de référence complète, des configurations système et des résultats de tests complets sur son blog officiel AI & Data Science.

NeuralMesh avec Augmented Memory Grid est désormais généralement disponible pour les clients WEKA et répertorié sur Oracle Marketplace, avec OCI agissant en tant que partenaire exclusif de lancement du cloud. Les entreprises exécutant une inférence de contexte long sur OCI peuvent déployer immédiatement cette architecture prête pour la production et entièrement validée.

Pékin Qianxing Jietong Technology Co., Ltd.
Sandy Yang/Directrice de la stratégie mondiale
WhatsApp/WeChat : +86 13426366826
Courriel : yangyd@qianxingdata.com
Site Web : www.qianxingdata.com/www.storagesserver.com
Objectif commercial :
Distribution de produits TIC/Intégration et services de systèmes/Solutions d'infrastructure
Avec plus de 20 ans d'expérience dans la distribution informatique, nous collaborons avec de grandes marques mondiales pour fournir des produits et des services professionnels fiables.
« Utiliser la technologie pour construire un monde intelligent » Votre fournisseur de services de produits TIC de confiance !
Temps de bar : 2026-06-12 10:54:05 >> Liste de nouvelles
Coordonnées
Beijing Qianxing Jietong Technology Co., Ltd.

Personne à contacter: Ms. Sandy Yang

Téléphone: 13426366826

Envoyez votre demande directement à nous (0 / 3000)