ინტერფეისის ეკონომიკა ახალ ნიშნულს აღწევს. MLCommons-ის მიერ გამოქვეყნებული MLPerf Inference v6.1-ის ტესტების შედეგებით, NVIDIA-მ თავისი შემდეგი თაობის Vera Rubin NVL72 რექის სისტემის პირველი წინასწარი შედეგები წარადგინა. ახალი არქიტექტურა აჩვენებს, რომ ტექნოლოგიური ნახტომი რეალურია და მონაცემთა დამუშავების სიჩქარეში უპრეცედენტო მაჩვენებლები ფიქსირდება.
Qwen3-VL მოდელზე ოფლაინ, სერვერულ და ინტერაქტიულ რეჟიმებში მუშაობისას Vera Rubin NVL72 სისტემამ GB300 NVL72-თან შედარებით 3,7-ჯერ მეტი გამტარუნარიანობა აჩვენა. ხოლო DeepSeek-R1 მოდელზე, TensorRT-LLM-ის გამოყენებით, უპირატესობამ 2,5-ჯერ მიაღწია. მსგავსი შედეგები ინფრასტრუქტურის ხარჯებს დრამატულად ამცირებს და ერთ რექში მეტი ტოკენის დამუშავების საშუალებას იძლევა.
მასშტაბირების კუთხითაც შთამბეჭდავი პროგრესია. DeepSeek-R1-ის ოფლაინ ტესტებში 72 გრაფიკული პროცესორიდან, ანუ ერთი რექიდან, 288 პროცესორამდე, ანუ ოთხ რექამდე, გადასვლისას სისტემამ 99-პროცენტიანი მასშტაბირების ეფექტურობა აჩვენა. ტექნიკური წარმატება განპირობებულია ახალი თაობის Tensor Cores კომპონენტებით, NVFP4 ფორმატითა და მე-6 თაობის NVLink ტექნოლოგიით, რომელიც სტანდარტულ Ethernet-თან შედარებით 10-ჯერ მაღალი პაკეტების სიხშირითა და 3-ჯერ დაბალი დაყოვნებით გამოირჩევა.
პროგრამული უზრუნველყოფის ოპტიმიზაციამაც მნიშვნელოვანი როლი ითამაშა. GB300 სისტემამ Qwen3-VL მოდელზე წინა v6.0 ვერსიასთან შედარებით 1,6-ჯერ მეტი პროდუქტიულობა აჩვენა, რაც KV-ქეშის სიზუსტის შემცირებითა და დისაგრეგირებული სერვერული არქიტექტურის გამოყენებით გახდა შესაძლებელი. მიუხედავად იმისა, რომ Vera Rubin-ის მიმდინარე შედეგები წინასწარი ტესტების სახითაა წარმოდგენილი, ინდუსტრიული ეკოსისტემა უკვე აქტიურად ემზადება ახალ აპარატურაზე გადასასვლელად.
წყარო: NVIDIA Blog – Vera Rubin NVL72 MLPerf, Wccftech MLPerf v6.1 roundup (AMD/NVIDIA/Intel), NVIDIA Vera Rubin NVL72 product
