CNN TürkElazığ’da öldürülen çiftin cinayetinde yeni gelişmePunch2027: Ekiti SDP senatorial candidate pledges better representationInquirerStudent wounded in stabbing at a Laoag schoolThe Jerusalem PostSide by Side: Helping people with disabilities connect sociallyBollywood HungamaShabana Azmi backs CJP’s Mumbai protest; says, “We don’t have to tolerate anything wrong”ZDF heuteEntdecken Sie das ZDF-NachrichtenstudioUOLApucarana e região têm 20 candidatos nas disputas para deputadoSky TG24Reggio Emilia, aggredì tre persone al distributore di benzina: muore suicida in carcereNU.nlIdentiteit van copiloot Flydubai bekend, viel piloot aan met bijlDaily MailBrooklyn Beckham and ab-flashing Nicola Peltz pack on the PDA during a night out in Paris after snubbing his mum Victoria's show as the designer gushes she feels 'so blessed' to have the rest of her family supporting herRai NewsFrancia, gli studenti non si fermano. A Marsiglia tentativo di ustione a una donna, arrestato 15enneFutura SciencesAnne-Sophie Pic cuisine pour Sophie Adenot dans l’espace : mais pourquoi le goût y change-t-il autant ?
The Daily Newsstand · Free, Always
Saturday, October 3, 2026

Что и как меняется в ИТ-инфраструктуре при внедрении ИИ?

Translate

Отвечая на вопрос, заявленный в заголовке, напрашивается короткий ответ — «всё». Но попробуем немного его детализировать.

Привет, Хабр!

Меня зовут Владислав Шершульский, я советник генерального директора Группы Rubytech по инновационным проектам и ИИ.

Новые приоритеты

Во-первых, меняются целевые метрики. Если раньше при оценке ЦОДа обычно говорили о пиковой производительности в FLOPS, емкости систем хранения в TByte, энергоэффективности PUE и стоимости вычислений в FLOPS на $ или ₽, то для ИИ этого уже недостаточно. Важнее становится, сколько токенов модель способна генерировать в секунду (tokens/s), как быстро она начинает отвечать (time-to-first-token), с какой скоростью выдает следующие токены (time-per-output-token), сколько токенов можно обработать на Ватт мощности (tokens/W) и во что обходится генерация одного токена ($/token).

Теперь нас интересует уже не абстрактная мощность вычислителя, а эффективность работы конкретной модели на конкретной инфраструктуре.

Новые процессоры

Меняются и сами процессоры. После нескольких десятилетий архитектурного затишья и почти тотального доминирования архитектуры x64, мы снова видим всплеск инженерного творчества. На рынке пока доминирует Nvidia, удачно оказавшаяся дважды в правильном месте и в нужное время: игровые GPU сначала неплохо подошли для майнинга, а затем еще лучше — для ИИ.

Но рядом быстро растет множество альтернативных архитектур: китайские Huawei Ascend, Cambricon MLU, Biren и др., собственные ускорители американских гиперскейлеров – Google TPU, Amazon Trainium и Inferentia, Microsoft Maia, Meta MTIA. Кстати, мы активно работаем с несколькими типами китайскимх GPU, умеем их программировать и, при необходимости, можем их использовать в дизайне нашего ПАКа Машина Искусственного Интеллекта Скала^р.

Есть и совсем необычные решения вроде Cerebras, которая вместо разрезания кремниевой пластины на множество отдельных чипов делает из нее один гигантский процессор (сколько себя помню, в мире всегда были компании, пытавшиеся создавать процессоры на пластине, но Cerebras наконец удалось превратить wafer-scale computing в практически работающий коммерческий продукт).

Архитектурный ажиотаж привел к тому, что ИТ-компании активно пытаются переманить университетских профессоров фундаментальной математики, в надежде улучшить реализуемые в кремнии алгоритмы.

Память и интерконнекты

Большим моделям приходится хранить сотни гигабайт и терабайты весов и кэшей и непрерывно передавать эти данные вычислительным устройствам. Поэтому возникла целая новая иерархия памяти и интерконнектов.

Чиплеты внутри одной микросборки связывает интерфейс UCIe, рядом с GPU располагается сверхбыстрая HBM-память. Новые поколения PCIe 6.0/7.0 обеспечивают обмен с ускорителями, сетевыми картами и накопителями, а CXL позволяет подключать и объединять в общие пулы дополнительную память. Когерентные интерконнекты вроде NVLink-C2C и AMD Infinity Fabric позволяют CPU и GPU совместно работать с памятью, все больше превращая ее в общий ресурс системы (знаете, такие архитектуры уже были популярны лет сорок назад в тогдашних суперкомпьютерах, но на скоростях в 1000 и более раз меньших, чем теперь). NVLink/NVSwitch и UALink связывают между собой десятки ускорителей, а InfiniBand и Ultra Ethernet объединяют серверы и стойки; технология RDMA позволяет обращаться к данным в памяти удаленных узлов практически напрямую, без лишнего копирования через CPU.

Граница между памятью и сетью постепенно размывается: общая производительность системы все сильнее зависит от того, насколько быстро данные перемещаются между вычислителями.

Определения используемых терминов
  • Чиплет — функциональный блок сложной микросхемы (например, процессора) физически размещенный на отдельном кристалле. Чиплеты могут быть как стандартными – компонентами типовых CPU и GPU, так и «кастомными» (заказными или полузаказными, которые интегрируются в микросборки с типовыми чиплетами для создания специализированных устройств).

  • Микросборка — корпус/модуль, объединяющий несколько чиплетов и/или других физических компонентов на общей подложке для решения некоторой функциональной задачи.

  • UCIe — открытый стандарт высокоскоростного соединения чиплетов внутри корпуса/микросборки.

  • HBM-память — High Bandwidth Memory, высокоскоростная DRAM с 3D-компоновкой, размещаемая рядом с основным блоком GPU/ускорителя.

  • PCIe — Peripheral Component Interconnect Express, стандартная высокоскоростная шина для подключения плат и устройств к процессору. Сейчас идет переход от актуальной версии PCIe 5.0 к PCIe 6.0/7.0 — новым поколениям PCIe с расширенной функциональностью, более высокой пропускной способностью и усовершенствованным кодированием.

  • CXL — Compute Express Link, открытый кэш-когерентный интерконнект для подключения памяти и ускорителей и их объединения в общие пулы.

  • Когерентный интерконнект — соединение, поддерживающее согласованность кэшей/памяти между несколькими процессорами/GPU и кастомными чиплетами.

  • NVLink-C2C — фирменный когерентный chip-to-chip интерконнект NVIDIA для связи GPU, CPU и чиплетов.

  • AMD Infinity Fabric — масштабируемая когерентная интерконнект-шина AMD для связи CPU-ядер, GPU, чиплетов и памяти.

  • InfiniBand — открытый стандарт высокоскоростной коммутируемой сети, традиционно используемый в суперкомпьютерах и дата-центрах для обмена данными между серверами и устройствами хранения с очень низкой задержкой и высокой пропускной способностью. Фактически контролируется Nvidia (после покупки ею компании Mellanox).

  • Ultra Ethernet —новый открытый стандарт на базе Ethernet, разрабатываемый консорциумом UEC для повышения производительности, масштабируемости и совместимости сетей в системах искусственного интеллекта и высокопроизводительных вычислений.

Электрический Ethernet на скоростях 800 Гбит/с и выше возможен только на очень короткие расстояния и сопряжен с большими энергопотерями, поэтому co-packaged optics (CPO, оптика, интегрированная в один корпус с сетевым чипом) и silicon photonics (то есть передача данных оптическими сигналами с использованием фотонных компонентов на кремнии) переносят оптические интерфейсы практически к самому сетевому процессору – switch ASIC (специализированной микросхеме сетевого коммутатора).

Стойка как компьютер (точнее, как ПАК)

Постепенно меняется и само понятие компьютера. Раньше его естественной единицей был сервер. Теперь десятки CPU и GPU внутри стойки соединяются столь быстрыми интерконнектами, что начинают работать практически как единая вычислительная машина. Следующим уровнем становится группа стоек, а в пределе — весь ЦОД. Поэтому процессоры, память, сеть, хранилища, питание и охлаждение больше нельзя проектировать независимо. Современные ЦОДы создаются уже не из «россыпи commodity компонентов», а из тщательно спроектированных и сбалансированных под типовые инфраструктурные задачи программно-аппаратных комплексов.

Инференс и агенты

Меняется характер типичной вычислительной нагрузки. Раньше (буквально еще год назад) огромный кластер был нужен прежде всего для обучения модели, а ее последующее использование в корпоративной среде казалось сравнительно дешевой задачей. С распространением reasoning-моделей и AI-агентов ситуация меняется. Модель при каждом запросе может выполнять множество промежуточных циклов вычислений, обращаться к другим моделям, инструментам и базам данных. В результате именно массовый inference — повседневная эксплуатация уже обученных моделей — становится одним из главных потребителей вычислительных ресурсов. Можно даже сказать, что в ближайшее время ИИ-агенты станут основными заказчиками и потребителями ресурсов ЦОДов.

Энергопотребление и охлаждение

Глубина изменений особенно заметна на электропитании и охлаждении. Мощность современной ИИ-стойки уже превышает 100 КВт, а в перспективе обсуждается Мегаватт на стойку. Вся эта энергия в итоге преобразуется в тепло. Обойтись воздушным охлаждением при таких плотностях невозможно, поэтому жидкостное direct-to-chip cooling становится частью архитектуры вычислительной системы. Одновременно приходится менять и схему электропитания: большие токи, многочисленные преобразования напряжения и сопутствующие потери становятся слишком дорогими. Показательно, что в 2026 году Google, Microsoft и NVIDIA через Open Compute Project (OCP) начали стандартизировать новую схему питания 800 VDC (800 В постоянного тока) для следующего поколения ИИ-ЦОДов.

География и энергетика

Меняется география ЦОДов. Если раньше место выбирали исходя из стоимости земли, связи и близости к пользователям, то для новых ЦОДов главным ограничением становится доступная электрическая мощность. ЦОДы размещают рядом с крупными источниками генерации, дополняют накопителями энергии и даже собственными энергосистемами.

Проекты вывода ИИ-ЦОДов в космос выглядят эффектно и, хотя являются технически реализуемыми, остаются пока проблемными и финансово, и технически. Одна размещенная в космосе перспективная стойка на Мегаватт потребует на оптимальной солнечно-ориентированной орбите 5,6 тыс. м² солнечных батарей и 2,5 тыс. м² радиаторов. Для сравнения, на МКС шесть радиаторов, каждый весом в тонну, и отводят они всего порядка 70 КВт тепла.

Лично мне, отчасти даже по собственному опыту, подводные ЦОДы нравятся больше. Особенно впечатляет, что надежность хорошо спроектированного и зарезервированного ПАКа в подводном контейнере оказывается в разы выше его аналога, размещенного в обычном ЦОДе (дело, вероятно, в том, что под водой его никто не беспокоит). Но нужно признать, что вопросы энергоснабжения для таких ЦОДов решаются довольно сложно, да и планово обновлять их дорого.

Реалистичнее сегодня выглядят ИИ-ЦОДы около крупных ГЭС (бонусом — бесплатное охлаждение), с компактными ядерными реакторами нового поколения, с собственными микрогридами на основе газотурбинных и газопоршневых генераторов.

Данные

Наконец, резко растут требования к данным. Еще недавно мы думали, что уже разобрались с архитектурой, оборудованием и программным обеспечением Big Data. Оказалось, что наши прежние большие данные — маленькие. Для промышленных ИИ-решений нужно куда больше данных. Необходимо хранить обучающие корпуса, изображения и видео, векторные представления документов, историю запросов и ответов, данные ИИ-агентов, телеметрию и разнообразные кэши. Похоже, теперь у корпораций вообще нет «мусорных данных» — ИИ потенциально способен сделать ценные выводы из любой информации. Поэтому хранилища данных, data lake и lakehouse, потоковые системы вроде Kafka, объектные хранилища и NVMe-кэши сопровождают ИИ-ПАКи как обязательный компонент инфраструктуры и постепенно складываются в единую многоуровневую систему данных. Без такой высоконагруженной системы управления данными самые лучшие GPU ускорители совершенно бесполезны.

Управление

Все это, конечно, усложняет программное управление инфраструктурой. Уже недостаточно просто найти свободный сервер и запустить на нем приложение. Нужно учитывать, где находится (хранится или запущена) нужная модель, сколько свободной памяти есть у ускорителя, сколько или какую долю GPU выделить под какую задачу инференса и на какой квант времени, каким интерконнектом соединены GPU, где расположен нужный кэш и какую задержку ответа необходимо обеспечить, где лежат подлежащие обработке данные, какова их структура и как оптимизировать скорость их извлечения. Поэтому рядом с традиционными средствами управления ЦОДом появляются специализированные планировщики и системы управления распределенным выполнением ИИ-нагрузок.

ПАК как итог

В итоге ИИ превращает ЦОД из помещения с большим количеством относительно независимых серверов в один огромный распределенный компьютер. Его процессоры, память, сеть, системы хранения, электропитание, охлаждение и программное обеспечение приходится проектировать совместно. Поэтому естественной формой организации и поставки такой инфраструктуры становятся программно-аппаратные комплексы (от Nvidia, Dell, Huawei — за рубежом, от Скала^р из группы Rubytech и других — в России): самостоятельно собрать даже из лучших по отдельности компонентов действительно сбалансированную ИИ-систему становится все труднее.

View the original on Хабр →

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.