Что и как меняется в ИТ-инфраструктуре при внедрении ИИ?


Отвечая на вопрос, заявленный в заголовке, напрашивается короткий ответ — «всё». Но попробуем немного его детализировать.
Привет, Хабр!
Меня зовут Владислав Шершульский, я советник генерального директора Группы Rubytech по инновационным проектам и ИИ.
Новые приоритеты
Во-первых, меняются целевые метрики. Если раньше при оценке ЦОДа обычно говорили о пиковой производительности в FLOPS, емкости систем хранения в TByte, энергоэффективности PUE и стоимости вычислений в FLOPS на $ или ₽, то для ИИ этого уже недостаточно. Важнее становится, сколько токенов модель способна генерировать в секунду (tokens/s), как быстро она начинает отвечать (time-to-first-token), с какой скоростью выдает следующие токены (time-per-output-token), сколько токенов можно обработать на Ватт мощности (tokens/W) и во что обходится генерация одного токена ($/token).
Теперь нас интересует уже не абстрактная мощность вычислителя, а эффективность работы конкретной модели на конкретной инфраструктуре.
Новые процессоры
Меняются и сами процессоры. После нескольких десятилетий архитектурного затишья и почти тотального доминирования архитектуры x64, мы снова видим всплеск инженерного творчества. На рынке пока доминирует Nvidia, удачно оказавшаяся дважды в правильном месте и в нужное время: игровые GPU сначала неплохо подошли для майнинга, а затем еще лучше — для ИИ.
Но рядом быстро растет множество альтернативных архитектур: китайские Huawei Ascend, Cambricon MLU, Biren и др., собственные ускорители американских гиперскейлеров – Google TPU, Amazon Trainium и Inferentia, Microsoft Maia, Meta MTIA. Кстати, мы активно работаем с несколькими типами китайскимх GPU, умеем их программировать и, при необходимости, можем их использовать в дизайне нашего ПАКа Машина Искусственного Интеллекта Скала^р.
Есть и совсем необычные решения вроде Cerebras, которая вместо разрезания кремниевой пластины на множество отдельных чипов делает из нее один гигантский процессор (сколько себя помню, в мире всегда были компании, пытавшиеся создавать процессоры на пластине, но Cerebras наконец удалось превратить wafer-scale computing в практически работающий коммерческий продукт).
Архитектурный ажиотаж привел к тому, что ИТ-компании активно пытаются переманить университетских профессоров фундаментальной математики, в надежде улучшить реализуемые в кремнии алгоритмы.
Память и интерконнекты
Большим моделям приходится хранить сотни гигабайт и терабайты весов и кэшей и непрерывно передавать эти данные вычислительным устройствам. Поэтому возникла целая новая иерархия памяти и интерконнектов.
Чиплеты внутри одной микросборки связывает интерфейс UCIe, рядом с GPU располагается сверхбыстрая HBM-память. Новые поколения PCIe 6.0/7.0 обеспечивают обмен с ускорителями, сетевыми картами и накопителями, а CXL позволяет подключать и объединять в общие пулы дополнительную память. Когерентные интерконнекты вроде NVLink-C2C и AMD Infinity Fabric позволяют CPU и GPU совместно работать с памятью, все больше превращая ее в общий ресурс системы (знаете, такие архитектуры уже были популярны лет сорок назад в тогдашних суперкомпьютерах, но на скоростях в 1000 и более раз меньших, чем теперь). NVLink/NVSwitch и UALink связывают между собой десятки ускорителей, а InfiniBand и Ultra Ethernet объединяют серверы и стойки; технология RDMA позволяет обращаться к данным в памяти удаленных узлов практически напрямую, без лишнего копирования через CPU.
Граница между памятью и сетью постепенно размывается: общая производительность системы все сильнее зависит от того, насколько быстро данные перемещаются между вычислителями.
Определения используемых терминов
Чиплет — функциональный блок сложной микросхемы (например, процессора) физически размещенный на отдельном кристалле. Чиплеты могут быть как стандартными – компонентами типовых CPU и GPU, так и «кастомными» (заказными или полузаказными, которые интегрируются в микросборки с типовыми чиплетами для создания специализированных устройств).
Микросборка — корпус/модуль, объединяющий несколько чиплетов и/или других физических компонентов на общей подложке для решения некоторой функциональной задачи.
UCIe — открытый стандарт высокоскоростного соединения чиплетов внутри корпуса/микросборки.
HBM-память — High Bandwidth Memory, высокоскоростная DRAM с 3D-компоновкой, размещаемая рядом с основным блоком GPU/ускорителя.
PCIe — Peripheral Component Interconnect Express, стандартная высокоскоростная шина для подключения плат и устройств к процессору. Сейчас идет переход от актуальной версии PCIe 5.0 к PCIe 6.0/7.0 — новым поколениям PCIe с расширенной функциональностью, более высокой пропускной способностью и усовершенствованным кодированием.
CXL — Compute Express Link, открытый кэш-когерентный интерконнект для подключения памяти и ускорителей и их объединения в общие пулы.
Когерентный интерконнект — соединение, поддерживающее согласованность кэшей/памяти между несколькими процессорами/GPU и кастомными чиплетами.
NVLink-C2C — фирменный когерентный chip-to-chip интерконнект NVIDIA для связи GPU, CPU и чиплетов.
AMD Infinity Fabric — масштабируемая когерентная интерконнект-шина AMD для связи CPU-ядер, GPU, чиплетов и памяти.
InfiniBand — открытый стандарт высокоскоростной коммутируемой сети, традиционно используемый в суперкомпьютерах и дата-центрах для обмена данными между серверами и устройствами хранения с очень низкой задержкой и высокой пропускной способностью. Фактически контролируется Nvidia (после покупки ею компании Mellanox).
Ultra Ethernet —новый открытый стандарт на базе Ethernet, разрабатываемый консорциумом UEC для повышения производительности, масштабируемости и совместимости сетей в системах искусственного интеллекта и высокопроизводительных вычислений.
Электрический Ethernet на скоростях 800 Гбит/с и выше возможен только на очень короткие расстояния и сопряжен с большими энергопотерями, поэтому co-packaged optics (CPO, оптика, интегрированная в один корпус с сетевым чипом) и silicon photonics (то есть передача данных оптическими сигналами с использованием фотонных компонентов на кремнии) переносят оптические интерфейсы практически к самому сетевому процессору – switch ASIC (специализированной микросхеме сетевого коммутатора).
Стойка как компьютер (точнее, как ПАК)
Постепенно меняется и само понятие компьютера. Раньше его естественной единицей был сервер. Теперь десятки CPU и GPU внутри стойки соединяются столь быстрыми интерконнектами, что начинают работать практически как единая вычислительная машина. Следующим уровнем становится группа стоек, а в пределе — весь ЦОД. Поэтому процессоры, память, сеть, хранилища, питание и охлаждение больше нельзя проектировать независимо. Современные ЦОДы создаются уже не из «россыпи commodity компонентов», а из тщательно спроектированных и сбалансированных под типовые инфраструктурные задачи программно-аппаратных комплексов.
Инференс и агенты
Меняется характер типичной вычислительной нагрузки. Раньше (буквально еще год назад) огромный кластер был нужен прежде всего для обучения модели, а ее последующее использование в корпоративной среде казалось сравнительно дешевой задачей. С распространением reasoning-моделей и AI-агентов ситуация меняется. Модель при каждом запросе может выполнять множество промежуточных циклов вычислений, обращаться к другим моделям, инструментам и базам данных. В результате именно массовый inference — повседневная эксплуатация уже обученных моделей — становится одним из главных потребителей вычислительных ресурсов. Можно даже сказать, что в ближайшее время ИИ-агенты станут основными заказчиками и потребителями ресурсов ЦОДов.
Энергопотребление и охлаждение
Глубина изменений особенно заметна на электропитании и охлаждении. Мощность современной ИИ-стойки уже превышает 100 КВт, а в перспективе обсуждается Мегаватт на стойку. Вся эта энергия в итоге преобразуется в тепло. Обойтись воздушным охлаждением при таких плотностях невозможно, поэтому жидкостное direct-to-chip cooling становится частью архитектуры вычислительной системы. Одновременно приходится менять и схему электропитания: большие токи, многочисленные преобразования напряжения и сопутствующие потери становятся слишком дорогими. Показательно, что в 2026 году Google, Microsoft и NVIDIA через Open Compute Project (OCP) начали стандартизировать новую схему питания 800 VDC (800 В постоянного тока) для следующего поколения ИИ-ЦОДов.
География и энергетика
Меняется география ЦОДов. Если раньше место выбирали исходя из стоимости земли, связи и близости к пользователям, то для новых ЦОДов главным ограничением становится доступная электрическая мощность. ЦОДы размещают рядом с крупными источниками генерации, дополняют накопителями энергии и даже собственными энергосистемами.
Проекты вывода ИИ-ЦОДов в космос выглядят эффектно и, хотя являются технически реализуемыми, остаются пока проблемными и финансово, и технически. Одна размещенная в космосе перспективная стойка на Мегаватт потребует на оптимальной солнечно-ориентированной орбите 5,6 тыс. м² солнечных батарей и 2,5 тыс. м² радиаторов. Для сравнения, на МКС шесть радиаторов, каждый весом в тонну, и отводят они всего порядка 70 КВт тепла.
Лично мне, отчасти даже по собственному опыту, подводные ЦОДы нравятся больше. Особенно впечатляет, что надежность хорошо спроектированного и зарезервированного ПАКа в подводном контейнере оказывается в разы выше его аналога, размещенного в обычном ЦОДе (дело, вероятно, в том, что под водой его никто не беспокоит). Но нужно признать, что вопросы энергоснабжения для таких ЦОДов решаются довольно сложно, да и планово обновлять их дорого.
Реалистичнее сегодня выглядят ИИ-ЦОДы около крупных ГЭС (бонусом — бесплатное охлаждение), с компактными ядерными реакторами нового поколения, с собственными микрогридами на основе газотурбинных и газопоршневых генераторов.
Данные
Наконец, резко растут требования к данным. Еще недавно мы думали, что уже разобрались с архитектурой, оборудованием и программным обеспечением Big Data. Оказалось, что наши прежние большие данные — маленькие. Для промышленных ИИ-решений нужно куда больше данных. Необходимо хранить обучающие корпуса, изображения и видео, векторные представления документов, историю запросов и ответов, данные ИИ-агентов, телеметрию и разнообразные кэши. Похоже, теперь у корпораций вообще нет «мусорных данных» — ИИ потенциально способен сделать ценные выводы из любой информации. Поэтому хранилища данных, data lake и lakehouse, потоковые системы вроде Kafka, объектные хранилища и NVMe-кэши сопровождают ИИ-ПАКи как обязательный компонент инфраструктуры и постепенно складываются в единую многоуровневую систему данных. Без такой высоконагруженной системы управления данными самые лучшие GPU ускорители совершенно бесполезны.
Управление
Все это, конечно, усложняет программное управление инфраструктурой. Уже недостаточно просто найти свободный сервер и запустить на нем приложение. Нужно учитывать, где находится (хранится или запущена) нужная модель, сколько свободной памяти есть у ускорителя, сколько или какую долю GPU выделить под какую задачу инференса и на какой квант времени, каким интерконнектом соединены GPU, где расположен нужный кэш и какую задержку ответа необходимо обеспечить, где лежат подлежащие обработке данные, какова их структура и как оптимизировать скорость их извлечения. Поэтому рядом с традиционными средствами управления ЦОДом появляются специализированные планировщики и системы управления распределенным выполнением ИИ-нагрузок.
ПАК как итог
В итоге ИИ превращает ЦОД из помещения с большим количеством относительно независимых серверов в один огромный распределенный компьютер. Его процессоры, память, сеть, системы хранения, электропитание, охлаждение и программное обеспечение приходится проектировать совместно. Поэтому естественной формой организации и поставки такой инфраструктуры становятся программно-аппаратные комплексы (от Nvidia, Dell, Huawei — за рубежом, от Скала^р из группы Rubytech и других — в России): самостоятельно собрать даже из лучших по отдельности компонентов действительно сбалансированную ИИ-систему становится все труднее.
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.