Когда организации закладывают бюджет на первое серьёзное внедрение ИИ, разговор обычно начинается—а иногда и заканчивается—на GPU. Такой фокус понятен: ускорители доминируют в заголовках и, часто, в заказах на закупку. Но GPU, которая не получает данные достаточно быстро, не охлаждается или не получает стабильное питание, реализует лишь часть своего потенциала. По нашим наблюдениям за рынком, проектам, которые испытывают трудности, редко не хватает вычислительной мощности. Им не хватает всего, что окружает вычислительную мощность.
Это руководство проходит по аппаратным слоям, из которых состоит работающий ЦОД для ИИ, объясняет, чем требования отличаются от традиционной корпоративной инфраструктуры, и даёт практические советы командам, планирующим первый или следующий этап ИИ-мощностей.
Аппаратные слои центра обработки данных для ИИ
Функциональная среда ИИ опирается на пять аппаратных слоёв. Недоинвестирование в любой из них создаёт узкое место, которое сводит на нет деньги, потраченные на остальные.
1. Вычисления: слой GPU-серверов.Ядро любого внедрения ИИ — платформа ускорителей: как правило, мульти-GPU серверы на базе плат класса NVIDIA HGX или сопоставимых альтернатив, в паре с многоядерными CPU и соединённые высокоскоростными межсоединениями, такими как NVLink, внутри узла. Правильноерешение на базе GPU-серверовзависит от нагрузки: обучение больших моделей требует максимальной пропускной способности межсоединений и объёма памяти на GPU, тогда как инференс-нагрузки часто работают экономичнее на меньшем числе ускорителей среднего класса с сильной поддержкой CPU и памяти. Частая ошибка — покупка оборудования класса для обучения под нагрузки, которые на самом деле доминируются инференсом.
Слой вычислений также включает оборудование, которое никогда не касается градиента: головные узлы и серверы только с CPU, выполняющие планирование задач, предобработку данных, мониторинг и службы хранения. Этим системам не нужны ускорители, но нужна надёжность—когда головной узел выходит из строя в середине запуска, обучающее задание падает вместе с ним. Стандартные двухпроцессорные платформы, такие как Dell PowerEdge или HPE ProLiant, хорошо справляются с этими ролями и являются основными кандидатами на оптимизированную по стоимости закупку.
2. Сеть: слой, который все недооценивают.Распределённое обучение постоянно синхронизирует градиенты между узлами; если сеть замирает, дорогие GPU простаивают. Серьёзные ИИ-кластеры используют выделенные высокоскоростные фабрики—InfiniBand или RoCE (RDMA over Converged Ethernet)—на 200G, 400G или всё чаще 800G на порт, с без потерь поведением и тщательно спланированной топологией. Это другая дисциплина по сравнению со стандартными корпоративными сетями, и она часто требует коммутаторов, оптики и кабелей, которые стоят дороже, чем ожидают покупатели. По нашему опыту работы с корпоративными покупателями, сеть — это статья, которую с наибольшей вероятностью недооценивают в первых черновиках плана ИИ-проекта.
3. Хранилище: питание конвейера.ИИ-нагрузки читают обучающие наборы данных и пишут контрольные точки со скоростью, которая перегружает традиционные архитектуры хранения. Практический базовый уровень сегодня — all-flash NVMe хранилище: корпоративные SSD с высоким устойчивым пропускным и ресурсным рейтингом, часто с параллельной или масштабируемой файловой системой перед ними. Поведение чекпоинтов важно не меньше, чем сырая скорость: обучающий запуск, который пишет чекпоинты на терабайты каждые несколько часов, нуждается в пропускной способности записи, которую традиционные SAN-архитектуры никогда не были созданы обеспечить.
4. Питание: плотность меняет всё.Традиционная корпоративная стойка может потреблять от 5 до 10 кВт. Стойка с мульти-GPU серверами текущего поколения может потреблять 40, 60 или даже более 100 кВт. Этот скачок имеет каскадные последствия: электрические цепи, мощность ИБП, выбор PDU и даже нагрузка на пол должны быть пересмотрены. Обеспечение электроэнергией — это также место, где прячутся сроки поставки: модернизация электрики объекта может занять больше времени, чем поставка самих серверов.
5. Охлаждение: физический предел.Воздушное охлаждение становится непрактичным примерно выше 20–30 кВт на стойку, в зависимости от конструкции помещения. За этим пределом прямое жидкостное охлаждение или заднедверные теплообменники переходят из опциональных в необходимые. Жидкостное охлаждение больше не экзотика—крупные серверные платформы теперь предлагают заводские интегрированные опции—но оно требует планирования объекта (распределение хладагента, подготовка воды, обнаружение утечек), которое должно начинаться за месяцы до прибытия оборудования.
Память: тихий множитель
Между громкими слоями находится компонент, который редко получает стратегическое внимание: системная память. ИИ-конвейеры данных, этапы предобработки и обслуживание инференса сильно опираются на DRAM хоста, а современные платформы зависят от пропускной способности памяти DDR5, чтобы кормить ускорители. Экономия на объёме памяти или неправильное заполнение каналов может измеримо снизить утилизацию GPU—дорогой способ сэкономить. Как правило, конфигурация памяти заслуживает такого же внимания, как выбор GPU, а не того, что окажется в конфигурации по умолчанию.
Новое, предыдущего поколения и восстановленное оборудование в ИИ-инфраструктуре
Не каждый слой ИИ-стека нужно покупать новым, и именно на продуманном сочетании бюджеты выигрываются или проигрываются.
Слой вычислений наиболее чувствителен к поколению. Оптимизации ИИ-фреймворков, улучшения межсоединений и прирост пропускной способности памяти приходят с каждым поколением ускорителей, поэтому организации, обучающие на переднем крае, обычно нуждаются в актуальных платформах. Но многие корпоративные ИИ-нагрузки—тонкая настройка небольших моделей, запуск инференса, поддержка команд data science—отлично работают на GPU-серверах предыдущего поколения, где цена за единицу вычислений значительно ниже. Тщательно подобранныйвосстановленный серверс ускорителями предыдущего поколения может быть рациональным выбором для инференс-ферм и кластеров разработки, при условии, что процесс тестирования поставщика проверяет здоровье памяти GPU и тепловое поведение под длительной нагрузкой.
Поддерживающие слои стареют гораздо изящнее. Корпуса хранения, сетевые коммутаторы на поколение назад и стандартные x86-серверы головных узлов для оркестрации, логирования и предобработки данных — всё это сильные кандидаты на закупку предыдущего поколения или восстановленного оборудования. Экономию здесь можно перенаправить в слои, где поколение действительно важно.
Именно здесь опытныйпоставщик корпоративных серверовзарабатывает свой хлеб: зная, какие компоненты ИИ-сборки терпят оборудование предыдущего поколения, какие нет, и где вторичный рынок в настоящее время предлагает реальную глубину.Закупка серверного оборудованиядля ИИ-проектов заключается не столько в поиске самой низкой цены на отдельную позицию, сколько в сборке целостного совместимого стека через новые и вторичные каналы—с проверенной документацией тестирования для всего, что не пришло напрямую с завода.
Практические советы: планирование инвестиций в ИИ-оборудование
Для команд, переходящих от планирования к закупкам, следующие шаги предотвращают самые распространённые и самые дорогие ошибки:
- Профилируйте нагрузку перед выбором оборудования.Обучение, тонкая настройка и инференс имеют радикально разные аппаратные профили. Сначала количественно оцените размеры моделей, объёмы данных, поведение батчей и целевые показатели параллелизма; пусть эти цифры определяют решения по GPU, памяти и сети.
- Бюджетируйте по слоям, а не по серверам.Заставьте бюджет показывать вычисления, сеть, хранилище, питание и охлаждение отдельными строками. Если сеть и хранилище вместе не составляют значимый процент расходов на вычисления, план, вероятно, несбалансирован.
- Подтверждайте готовность объекта заранее.Проверьте доступную мощность на стойку, ёмкость охлаждения и нагрузку на пол до размещения заказов на оборудование. GPU-кластер, который нельзя запитать или охладить по прибытии, — дорогостоящая проблема хранения.
- Проектируйте путь данных, а не только вычисления.Спланируйте, как обучающие данные перемещаются из хранилища к GPU и где размещаются чекпоинты. Явно выделите ёмкость корпоративных NVMe SSD и сетевую пропускную способность для этого пути.
- Соотносите стратегию закупок со слоем.Покупайте текущее поколение там, где этого требует нагрузка; используйте оборудование предыдущего поколения и восстановленное там, где нет. Каким бы ни был канал, требуйте документацию тестирования на уровне единицы—особенно для всего, что содержит ускорители.
- Планируйте расширение с первого дня.ИИ-мощности редко сокращаются. Выбирайте сетевые фабрики, питание стоек и подходы к охлаждению, которые масштабируются добавлением узлов, а не перепроектированием помещения.
- Относитесь к поставщикам как к долгосрочным партнёрам.ИИ-инфраструктура развивается поэтапно, и знающийпартнёр по ИТ-инфраструктурепонимающий ваш стек, может указывать на проблемы совместимости, доставать дефицитные компоненты и советовать по срокам—ценность, которая переживает любую отдельную сделку.
Заключение
Оборудование ЦОД для ИИ — это система, а не список покупок. GPU дают вычисления, но сеть держит их синхронизированными, хранилище держит их накормленными, а питание и охлаждение держат их в живых. Организации, которые бюджетируют и закупают все пять слоёв—и соотносят каждый слой с правильным поколением и каналом закупок—последовательно извлекают больше ценности из своих ИИ-инвестиций, чем те, кто сосредоточен только на ускорителях.
HKCHL поддерживает корпоративных покупателей, строящих ИИ-инфраструктуру на каждом уровне: GPU-серверы и вычислительные платформы предыдущего поколения, память DDR5, корпоративные NVMe SSD и закупку полных конфигураций через новые каналы и каналы вторичного рынка. Если вы планируете внедрение ИИ и хотите получить практическое второе мнение по выбору оборудования или стратегии закупок, наша команда с радостью обсудит ваши требования и предоставит котировку.Свяжитесь с намичтобы начать разговор.
