Корзина
  • Добавьте товары в корзину.

Технический обзор 5U GPU-серверов Supermicro с AMD Instinct MI350P

61
14 мин на чтение

Развертывание корпоративного искусственного интеллекта все чаще упирается не только в производительность ускорителей, но и в ограничения существующего ЦОД. Нужно разместить больше GPU, обеспечить их питанием и охлаждением, связать с процессорами, сетью и быстрым хранилищем — и при этом не перестраивать всю инфраструктуру.

Для таких сценариев Supermicro предлагает 5U PCIe-системы AS-5126GS-TNRT и AS-5126GS-TNRT2 с ускорителями AMD Instinct MI350P. Эти GPU-серверы Supermicro ориентированы на инференс больших языковых моделей, RAG, генеративный и агентный ИИ, а также задачи HPC.

Что дает сочетание Supermicro и AMD Instinct MI350P

AMD Instinct MI350P — PCIe-ускоритель на архитектуре AMD CDNA 4. Он оснащается 144 ГБ памяти HBM3e с пропускной способностью до 4 ТБ/с и поддерживает форматы пониженной точности MXFP4 и MXFP6.

Для ИИ-инфраструктуры это важно по двум причинам. Во-первых, большой объем локальной памяти позволяет размещать более крупные модели и работать с длинным контекстом. Во-вторых, вычисления с пониженной точностью способны ускорить инференс и сократить требования к памяти — при условии, что выбранная модель и допустимая точность позволяют использовать такие форматы.

Но ускоритель сам по себе не определяет производительность всей системы. Результат зависит от топологии PCIe, числа и характеристик процессоров, сетевого обмена, скорости подачи данных с накопителей, охлаждения и программного стека. Поэтому сервер нужно подбирать под реальную модель нагрузки, а не только по количеству GPU.

AS-5126GS-TNRT и TNRT2: в чем разница

Обе платформы выполнены в корпусе 5U, поддерживают два процессора AMD EPYC серии 9005 и рассчитаны на двухслотовые PCIe-ускорители. Однако их GPU-топология и предельная плотность различаются.

В AS-5126GS-TNRT восемь ускорителей получают прямое подключение PCIe x16 к процессорам. Это делает архитектуру понятной для задач, чувствительных к обмену между CPU и GPU. TNRT2 позволяет установить до десяти ускорителей за счет PCIe-коммутаторов. Такая компоновка повышает вычислительную плотность, но требует внимательнее оценивать характер обмена данными и фактическую загрузку шин. Большее число GPU не гарантирует пропорционального ускорения приложения: многое зависит от того, как программное обеспечение распределяет модель и запросы между ускорителями.

Подсистемы сервера: CPU, память, накопители и сеть

Оперативная память

Обе платформы имеют 24 слота DIMM и поддерживают серверную память DDR5 ECC RDIMM. Для конфигураций с AMD EPYC 9005 заявлена поддержка памяти с частотой до 6400 MT/s. Максимальный объем зависит от процессоров, используемых модулей и утвержденной спецификации конкретной поставки.

Для ИИ-сервера объем системной памяти нельзя определять только по размеру модели. RAM используется для загрузки и подготовки данных, работы операционной системы и контейнеров, CPU-части приложения, кэширования и промежуточных результатов. Недостаток RAM способен замедлить подачу данных на GPU даже при достаточном объеме HBM3e.

Локальные накопители

У TNRT базовая конфигурация предусматривает фронтальные отсеки для NVMe и SATA, а также накопитель M.2. У TNRT2 число отсеков может быть увеличено. Точная схема зависит от выбранного шасси, бэкплейна и опций.

NVMe-накопители полезны для локального кэша моделей, контейнеров, индексов и временных данных. Но при обучении или обработке больших массивов информации обычно требуется внешнее параллельное либо распределенное хранилище. Его скорость нужно рассчитывать так, чтобы GPU не ожидали данные.

Сетевое подключение

Платформы имеют базовые сетевые интерфейсы и допускают установку дополнительных адаптеров. Для одиночного узла инференса может быть достаточно Ethernet, подобранного под поток запросов. Для нескольких GPU-серверов, распределенного обучения или общего быстрого хранилища требования к задержке и пропускной способности будут значительно выше.

Нужную сеть выбирают после расчета обмена между узлами, а не по принципу «максимально быстрый адаптер». Следует учитывать топологию коммутаторов, резервирование, скорость хранилища и возможность масштабирования кластера.

Управление и отказоустойчивость

Серверы поддерживают удаленное управление через BMC/IPMI. Администратор может контролировать состояние оборудования, просматривать журналы, получать доступ к консоли и выполнять часть сервисных операций без физического присутствия возле стойки.

Высокопроизводительные конфигурации используют резервируемые блоки питания и набор производительных вентиляторов. Но резервирование внутри сервера должно поддерживаться схемой электропитания ЦОД: подключением блоков к независимым линиям, корректно рассчитанными PDU и доступным резервом мощности.

Supermicro_AS-5126GS-TNRT_TNRT2

Роль процессоров AMD EPYC

Серверы поддерживают два процессора AMD EPYC 9005. В предельных конфигурациях платформа может получить до 384 процессорных ядер суммарно, но точное количество зависит от выбранных CPU.

Процессоры отвечают не только за служебные операции. Они подготавливают данные, обслуживают сетевой стек, управляют накопителями и выполняют части приложения, которые не переносятся на GPU. Если CPU, память или подсистема ввода-вывода не соответствуют профилю нагрузки, дорогостоящие ускорители могут простаивать.

Поэтому процессоры AMD EPYC следует выбирать вместе с GPU, объемом оперативной памяти и сетевыми адаптерами. Для сервера инференса с большим числом параллельных запросов требования будут отличаться от узла HPC или системы подготовки данных.

Для каких задач подходят эти серверы

Ниже представлен список задач, для которых используется оборудование.

Инференс больших языковых моделей

Несколько MI350P позволяют разместить крупную модель в памяти одного узла или обслуживать несколько экземпляров модели параллельно. При проектировании важно учитывать не только размер весов, но и память под KV-кэш, длину контекста, размер пакета и требуемое число одновременных запросов.

RAG и корпоративные ассистенты

В системах Retrieval-Augmented Generation сервер выполняет генерацию ответа, но общая задержка зависит также от поиска по базе знаний, эмбеддингов, хранилища и сети. GPU-узел нужно рассматривать как часть контура, а не как изолированное устройство.

Агентные системы

Агентный ИИ создает большое количество последовательных или параллельных обращений к моделям и внешним инструментам. Здесь важны стабильная производительность инференса, достаточный запас памяти и корректное управление очередями.

HPC и инженерные расчеты

Архитектура CDNA 4 рассчитана не только на ИИ. Ускорители могут использоваться в научных и инженерных вычислениях, если применяемое программное обеспечение поддерживает AMD ROCm и нужные библиотеки.

Программный стек AMD ROCm

AMD ROCm — открытая программная платформа для вычислений на GPU. Она поддерживает распространенные фреймворки и инструменты, включая PyTorch, TensorFlow и vLLM.

Открытая экосистема упрощает перенос приложений и снижает зависимость от закрытого программного стека, но совместимость все равно нужно проверять заранее. До закупки оборудования полезно протестировать конкретную модель, версию фреймворка, контейнер, драйверы, библиотеки и режимы пониженной точности на пилотной конфигурации.

Если инфраструктура собирается поэтапно, отдельно можно подобрать GPU-ускорители и платы расширения, совместимые с выбранной платформой.

Что означает экономия на уровне сервера

Supermicro связывает высокую плотность MI350P с увеличением пропускной способности инференса и снижением совокупной стоимости владения. Такая логика обоснована: один плотный узел потенциально занимает меньше стоечного пространства и требует меньше внешних соединений, чем несколько менее производительных серверов.

Однако сравнивать решения нужно не по цене одного GPU или числу ускорителей, а по стоимости полезной работы. Для инференса это может быть стоимость миллиона токенов при заданной задержке и качестве ответа. Для HPC — стоимость завершенного расчета. В модель TCO входят:

  • стоимость сервера и ускорителей;
  • потребляемая мощность и охлаждение;
  • сетевое оборудование и хранилище;
  • лицензии и сопровождение программного обеспечения;
  • загрузка оборудования в течение суток;
  • трудозатраты на внедрение и эксплуатацию;
  • возможность масштабировать приложение на несколько GPU.

Если приложение плохо распределяется между ускорителями, установка десятого GPU может дать меньший эффект, чем оптимизация программного стека или ускорение подачи данных. Поэтому перед закупкой крупной конфигурации желательно провести пилотное тестирование на реальной модели и типичных запросах.

Воздушное охлаждение не отменяет инженерный расчет

Одно из преимуществ 5U-систем — возможность использовать воздушное охлаждение и стандартный стоечный формат. Это упрощает внедрение по сравнению с проектами, где требуется обязательный переход на жидкостное охлаждение.

Однако до десяти высокопроизводительных GPU и два серверных процессора создают значительную электрическую и тепловую нагрузку. До установки необходимо проверить:

  • доступную мощность на стойку и резервирование питания;
  • возможности PDU и электрических линий;
  • температуру и объем подаваемого воздуха;
  • отвод горячего воздуха и отсутствие рециркуляции;
  • глубину, грузоподъемность и монтажные условия стойки;
  • пропускную способность сети между GPU-узлами;
  • скорость локального и внешнего хранилища.

Именно эти параметры часто определяют реальную возможность внедрения. Формулировка «установка в стандартную стойку» описывает форм-фактор, но не заменяет аудит площадки.

Как выбрать между TNRT и TNRT2

AS-5126GS-TNRT подходит, если для приложения достаточно восьми ускорителей и в приоритете прямой путь PCIe x16 от CPU к каждому GPU. Это сбалансированный вариант для мощного автономного узла инференса, RAG или HPC.

AS-5126GS-TNRT2 стоит рассматривать, если главным ограничением является плотность оборудования и нужно разместить до десяти GPU в одном корпусе. Перед выбором желательно проверить масштабирование конкретной нагрузки на коммутируемой PCIe-топологии.

В обоих случаях спецификацию нужно начинать не с максимального количества комплектующих, а с требований приложения: размера модели, формата вычислений, числа пользователей, целевой задержки, объема данных и планируемого масштабирования.

Когда разумнее выбрать AS-5126GS-TNRT

  • приложению достаточно восьми GPU;
  • важна прямая связь PCIe x16 между CPU и каждым ускорителем;
  • требуется более простая и предсказуемая топология;
  • сервер используется как самостоятельный мощный узел;
  • плотность в десять ускорителей не является обязательным условием.

Когда рассматривать AS-5126GS-TNRT2

  • нужно максимально увеличить объем GPU-памяти в одном корпусе;
  • критична плотность вычислений на стойку;
  • приложение протестировано на PCIe-коммутаторах;
  • программное обеспечение эффективно использует девять или десять GPU;
  • инфраструктура выдерживает соответствующую электрическую и тепловую нагрузку.

Что проверить перед заказом

Правильно подобранный GPU-сервер начинается с технического задания. До согласования спецификации желательно зафиксировать:

  1. Название и версию модели либо прикладного программного обеспечения.
  2. Требуемый режим: инференс, дообучение, обучение или HPC.
  3. Формат вычислений и поддерживаемые режимы квантования.
  4. Размер модели, длину контекста и планируемый KV-кэш.
  5. Целевое число одновременных пользователей или задач.
  6. Допустимую задержку и требуемую пропускную способность.
  7. Объем оперативных и архивных данных.
  8. Требования к локальному и внешнему хранилищу.
  9. Необходимость объединения нескольких серверов в кластер.
  10. Доступную мощность, охлаждение и параметры стойки.

После этого можно определить количество MI350P, модель процессоров, объем RAM, состав NVMe-накопителей, сетевые адаптеры и схему резервирования.

Частые вопросы

Подходит ли MI350P только для инференса?

Нет. Ускоритель ориентирован на ИИ и HPC и может применяться для инференса, обучения и дообучения, если задача поддерживается выбранным программным стеком. В презентации Supermicro основной акцент сделан на инференсе, RAG и агентных сценариях, поскольку PCIe-формат удобен для внедрения в корпоративных ЦОД.

Можно ли установить такой сервер в обычную стойку?

Форм-фактор 5U рассчитан на стандартную серверную стойку, а охлаждение является воздушным. Но перед установкой нужно проверить глубину и грузоподъемность стойки, питание, PDU, доступный воздушный поток и отвод тепла. «Стандартная стойка» не означает «любая стойка без подготовки».

Всегда ли десять GPU лучше восьми?

Нет. TNRT2 обеспечивает большую плотность, но фактический выигрыш зависит от масштабирования приложения и характера обмена данными. Для части задач TNRT с восемью напрямую подключенными GPU может оказаться более рациональным вариантом.

Достаточно ли встроенных сетевых портов?

Для управления и некоторых одиночных задач — возможно. Для распределенных вычислений, быстрого общего хранилища или большого потока инференс-запросов обычно требуется отдельная высокоскоростная сеть. Ее параметры определяются после расчета нагрузки.

Вывод

5U GPU-серверы Supermicro с AMD Instinct MI350P позволяют построить плотный узел для корпоративного ИИ в привычном PCIe-формате. AS-5126GS-TNRT делает акцент на прямом подключении восьми GPU, а TNRT2 — на максимальной плотности до десяти ускорителей.

При выборе важно оценивать систему целиком: GPU, процессоры, память, PCIe-топологию, сеть, накопители, охлаждение и программную совместимость. Посмотреть другие варианты для сравнения можно в разделе готовых серверов Supermicro.

Запрос коммерческого предложения
Отправьте запрос — подготовим предложение за 15 минут с учетом персональных скидок
Вы можете добавить файлы с реквизитами компании, спецификацией или ТЗ
Официальный сайт SUPERMICRO в России