Здатність Nvidia продавати графічні процесори зрештою обмежена тим, скільки потужності може забезпечити енергосистема. Через збільшення циклів амортизації центрам обробки даних знадобляться роки, щоб вивести з експлуатації застарілі системи Hopper або Blackwell. Більше GPU означає більше споживання енергії з мережі.
Nvidia не може змусити мережевих операторів додавати ємність швидше, але вона може полегшити своїм клієнтам створення трохи розумнішого та ефективнішого сховища.
«У масштабі центру обробки даних і заводського масштабу штучного інтелекту ми дійсно намагаємося подумати про те, як ми можемо отримати кожну частинку ефективності», — сказав Діон Харріс, старший директор Nvidia HPC і AI Hyperscale Infrastructure Solutions. El Reg в нещодавньому інтерв’ю.
Цього тижня на саміті AI Infra ми вперше познайомилися з системами, створеними Nvidia, щоб максимізувати обчислювальну потужність і зменшити вплив центрів обробки даних на локальну мережу.
Центри обробки даних, як правило, недостатньо використовуються поблизу пікової потужності. Центр обробки даних потужністю 100 мегават може використовувати максимум 80 відсотків для критичних обчислювальних навантажень. Фактичний коефіцієнт варіюється від біт-сховища до біт-сховища, але це забезпечує буфер для неефективності апаратного забезпечення, втрат конверсії та інших стрибків попиту. Недоліком, звичайно, є те, що це залишає 20 мегават або більше невикористаної потужності, яку центр обробки даних не може використати, а служба не може відновити.
Кожен кіловат потужності — це графічний процесор, який Nvidia може продати, тому платформа DSX від Nvidia має на меті вирішити обидві проблеми.
Зменшити накладні витрати
Перший, який Nvidia називає DSX MaxLPS, є розвитком старішої ідеї. Якщо лічильник і вся фізична інфраструктура – електричні шафи, батареї, блоки розподілу палива (CDU) і чиллери – можуть спілкуватися один з одним, оператори можуть досягти значної економії енергії.
Наприклад, якби кондиціонери знали, скільки електроенергії вони споживають, вони могли б підвищувати та зменшувати залежно від попиту, а не працювати весь час.
Проблема, як і можна було очікувати, полягає в тому, щоб системи від десятків різних постачальників розмовляли однією мовою. Отже, хоча ідея звучить чудово в теорії, звести всіх на одну сторінку було легше сказати, ніж зробити.
Гарріс пояснив, що це змінилося з широким розгортанням систем ШІ. Ефективніші сховища можуть випускати більше токенів, що означає більший дохід, якщо люди все одно готові платити за токени.
Однак Nvidia все ще має звернути увагу на комунікаційний рівень, що, безумовно, полегшується тим фактом, що її графічні процесори зараз є найпопулярнішим товаром у світі.
«DSX Exchange — це справді своєрідний API, який дозволяє нам отримувати інформацію не лише про основні системи», — сказав Гарріс. «Ми можемо отримувати дані від інших готових до DSX провайдерів, які надають активи. Це буде як Vertiv і Schneider Electric та всі системи управління будівлями».
Цього тижня на саміті AI Infra Summit компанії Nvidia та Lambda продемонстрували, як цей міст, який працює як частина ширшої пропозиції DSX MaxLPS, можна використовувати для об’єднання більшої обчислювальної потужності в єдину потужність. Під час тестування Lambda вдалося вмістити 19 вузлів у бюджет потужності, який зазвичай займав би 16, підвищивши пропускну здатність кластера на 24 відсотки та продуктивність на ват на подібний запас.
Результатом цього, як стверджує компанія, є те, що центрам обробки даних не потрібно надмірно ініціалізувати свої окремі сховища, оскільки вони мають більше видимості та контролю над центром обробки даних у цілому.
Демпінг
Окрім того, що Nvidia допомагає своїм клієнтам отримати більше від свого сховища, вона також показала, як її технологію керування центром обробки даних можна використовувати для зменшення впливу великого навчання ШІ та розгортання висновків у локальній мережі.
Працюючи з Emerald AI і Silicon Valley Power, Nvidia продемонструвала, як її платформу DSX Flex можна використовувати для звільнення енергії центру обробки даних, коли потреба в мережі зростає, не порушуючи критичні робочі навантаження.
Але, як і пропозиція Nvidia DSX MaxLPS, базова технологія не зовсім нова. Реагування на попит існує протягом багатьох років, дозволяючи комунальним підприємствам вимагати від енергоємних галузей економіки скоротити використання енергії в періоди пікового попиту.
Google та інші вже деякий час грають із цією технологією. Можливо, ви пам’ятаєте минулого року, коли було оголошено про припинення асинхронних навантажень штучного інтелекту, щоб запобігти перевантаженню мережі.
DSX Flex від Nvidia має на меті надати цю можливість усім, хто використовує її апаратне забезпечення. Але ця технологія може бути спрямована не стільки на запобігання штучному інтелекту, а більше на надання комунальним службам доступу до додаткової потужності зеленого світла, за умови, що вони можуть повернути частину цього в будь-який момент.
«Це в деяких випадках дозволяє мережевим провайдерам, власникам ліній електропередачі, бути трохи більш консервативними в тому, як вони розподіляють або надмірно надають, тому що тепер, знаючи, що у вас є можливість обмежити в певному вікні, їм не потрібно мати багато місця», — сказав Гарріс.
Але те, що служба не має можливості відновити роботу, не обов’язково означає, що робоче навантаження припиниться, зауважує він. Поки виконуються критичні робочі навантаження, глибока інтеграція зі стеком програмного забезпечення Nvidia означає, що некритичні робочі навантаження можна призупинити або перемістити до найближчих центрів обробки даних із надлишковою потужністю – концепція, яку іноді описують як гонитва за сонцем.
Ще один огороджений сад
Як ви, напевно, здогадалися, хоча платформа DSX від Nvidia створена для корпоративного штучного інтелекту з сертифікованим апаратним забезпеченням, все стає дещо складніше, оскільки до суміші додаються сторонні прискорювачі, такі як d-Matrix, SambaNova та інші.
Для таких партнерів, як d-Matrix, які вже живуть в екосистемі NVLink Fusion, Гарріс бачить шлях вперед у розширенні підтримки DSX на ці платформи, хоча він зазначає, що буде потрібен певний ступінь інтеграції програмного забезпечення, і не кожен чіп надаватиме такий же рівень детального контролю, як його власні чіпи.
Коли справа доходить до конкуруючих платформ, таких як графічні процесори AMD Instinct, розробникам невеликих сховищ, ймовірно, доведеться звернутися до альтернативних систем керування центрами обробки даних, щоб відтворити можливості DSX.
Таким чином, окрім максимального використання сьогоднішньої обмеженої потужності мережі, DSX від Nvidia є ще одним обгородженим садом, який спонукає клієнтів купувати його обладнання. ®