Как на берегу жемчужной реки построили и разрушили Memory Wall


В конце сентября в Шэньчжэне проходила конференция GMIF 2026, посвященная вопросам развития AI и систем хранения. Так как я довольно плотно занимаюсь разработкой AI систем для автоматизации различных процессов в IT, то пройти мимо такой конференции, конечно же, не мог. Тем более, были заявлены довольно интересные темы: влияние памяти и систем хранения на токен-экономику; переосмысление архитектуры дата центров на основе AI сценариев; переосмысление глобальных производственных цепочек, исходя из вопросов управления данными, коллаборации и повышения устойчивости поставок.
Что из себя представляет IT конференция в Китае, чем может приятно удивить, на что можно расчитывать, почему главные акценты были на SSD, NAND и KV Cache и какой уровень владения китайским нужен для посещения подобных мероприятий, где авторы возвели Memory Wall, и как ее обойти - далее в материале.
Пара слов о самой конференции и формате проведения. Конференция проходит уже пятый год, и проводит ее Shenzhen Memory Industry Association совместно с School of Integrated Circuits Peking University. Скорее всего, ранее вы не часто слышали о этих организациях. И тут меня ждал первый приятный сюрприз - несмотря на локальный характер организаций, уровень организации сравним с крупными IT мероприятиями Сбербанка или Яндекса, а заявленые докладчики выступали в офлайн формате.
GMIF растянулось на несколько дней. В первый день проходила закрыта часть для инвесторов и бизнеса. Второй день - доклады и награждения за достижения в инновациях по разработке систем хранения. В этот же день были мероприятия, посвященные нетворкингу. Закрывало все соревнование по гольфу. Помимо размаха «гуляний» особо порадовали стенды. Множество компаний имели стенды, и, что приятно удивило, - это были не стенды в привычном для нас понимании, где демострируются опытные образцы (чаще всего существующие в единичном количестве). Нет, тут стенды преимущественно представляли из себя торговые площадки. Здесь можно ознакомиться с продукцией, ее характеристиками и, самое главное, с ценой за конкретное изделие. Так же заказать нужную вам партию устройств, договорившись о конкретной цене и дате поставки.

Но в основе открытой части GMIF все же были доклады. Конференция стартовала с экономической темы (если не считать вступительного слова от организаторов). В докладе Daniel Yen, исполнительного директора Morgan Stanley, прозвучала одна из главных тем всей конференции - Memory Wall. Это определение упоминали или косвенно описывали остальные участники, но первым его описал Daniel Yen как дисбаланс между ростом вычислительной мощности и пропускной способностью памяти. В качестве примера докладчик обратил внимание на Nvidia B200. GPU обрабатывает данные в 20 тысяч раз быстрее, чем память HBM3/HBM4 способна их поставлять. Но риски Memory Wall не сводятся только техническим вопросам. Экономическая составляющая Memory Wall не менее важна и суть ее в следующем:
Капитальные затраты. Глобальные облачные провайдеры резко наращивают затраты и по прогнозам они достигнут 1,2 трлн. долларов в 2027. Причем доля памяти в этих расходах уже сейчас около 48%, а к обозначенному 2027 может составить уже 53%.
Дефицит памяти становится структурным. Уже сейчас спрос по DRAM на 15% превышает предложение производителей, а дефицит NAND около 10%. Аналогично по HBM есть напряжение производственных мощностей, и это не учитывая прогнозируемого роста спроса до 44 млрд долларов в 2027.
Память становиться главной статей расходов не только у облачных провайдеров. По данным Daniel Yen память уже составляет 73% стоимости CPU-сервера, 41% стоимости ноутбук и 39% стоимости вашего смартфона.
Ограничения по техпроцессу. Например, для производства HBM требуется 2.5D-упаковка CoWoS от TSMC. Но мощности по выпуску у TSMC недостаточны, хотя и есть планы их удвоения к 2028 году. С учётом не-TSMC мощностей ситуация немного лучше, но всё равно недостаточна для покрытия спроса.
Что с этой стеной делать? Согласно предположению исполнительного директора Morgan Stanley, нужно ожидать развития и эволюции техпроцесса и, самое главное, - дизайна памяти, чипов и их упаковки. И именно эти векторы составили ядро докладов.
Конференция велась преимущественно на китайском языке с английскими субтитрами. Качество субтитров иногда оставляло желать лучшего. И тут есть небольшой лайфхак - дабы не плавать в контексте при проблемах с субтитрами, лучше занимать место ближе к динамикам. Это позволит вам с легкость перенести все проблемы, воспользовавшись Google переводчиком. Если же динамик будет далеко, в переводе могут всплывать детали перехваченных с стороны зала диалогов. По моим наблюдениям, уровень проникновения английского языка в китайском IT сравним с уровнем проникновения английского в нашем IT. Как минимум пара докладов, которые были на английском с китайскими субтитрами, вызывали большое оживление в зале, далеко не всегда связанное с темой доклада.
Одним из англоязычных докладчиков был представитель Samsung Kevin Yoon. Его доклад описывал следующие риски, связанные с тематикой конференции:
Рост KV Cache. И дело не просто в размере моделей, а в изменившейся природе нагрузки. Много шагов рассуждения, длинный контекст и циклы работы агентов превращают KV Cache в критический актив, который начинает требовать к себе больше внимания, чем просто буферное хранилище.
Samsung видит Memory Wall как три взаимосвязанных ограничения. Пропускная способность памяти катастрофически отстает от роста вычислительной мощности, но помимо этого еще и растет энергопотребление, приближаясь к физическим пределам.
Наращивание объемов HBM и DRAM упирается в экономику. Масштабирование решений становится невыгодным, не позволяя думать о массовом развертывании интересна.
В качестве решения Kevin Yoon предложил стратегию гетерогенной архитектуры. В ней данные должны распределяться по типам памяти в зависимости от температуры (частоты доступа). Для реализации этой стратегии Samsung представил проприетарную технологию Z-NAND. Эта высокоскоростная NAND память должна стать промежуточным звеном между DRAM и SSD. Ее можно будет использовать для хранения весов модели, предназначенных в основном для чтения, тем самым сократив стоимость конечного устройства в четыре раза, по сравнению с традиционным подходом хранения данных в DRAM. Помимо Z-NAND Samsung развивает Compute Express Link (CXL) и GDDR7 как взаимодополняющие элементы стратегии. CXL — для расширения памяти, а GDDR7 — для высокоскоростной графической памяти. Стратегия стратегий, но и непосредственно о технологиях не забыли, анонсировав запуск следующего поколения CXL 3.1/PCIe 6.0 CMM-D в 2026 году.

Не менее амбициозным был материал доклада декана Школы интегральных схем Пекинского университета. Cai Yimao представил технологию High Bandwidth Flash (HBF). Это будет новый класс памяти, промежуточный между HBM и SSD. Основной идеей этой технологии является совмещение высокой пропускной способности HBM с большой емкостью NAND. Для этого вместо DRAM-кристаллов как в HBM предложено использовать 3D NAND, сохранив ту же вертикальную упаковку и TSV-соединеиня. Согласно заявлениям, подобный подход позволит получить до 512 Гб памяти с пропускной способность до 0,4 ТБ/с до 3,0 ТБ/с.
С другой стороны, представители Solidigm и Sandisk освещали вопросы Quad-Level Cell как способа супер плотной упаковки данных на NAND памяти и создания самых дешевых хранилищ для KV Cache.
Также очень интересным показался проект компании Infplane совместно с Maxio. Они представили AI SSD с интеллектуальным управлением памятью, планированием и предвыборкой на стороне хранилища. Цель - динамическое разделения весов модели и KV Cache между DRAM и SSD. И пусть это еще не промышленный образец, но он очень хорошо демонстрировал общий вектор конференции.
Помимо описанных тем было еще много докладов, так или иначе сводившиеся к проблемам Memory Wall. Общей стратегий всех докладов можно назвать подход Memory Offloading. Этот инженерный консенсус по снижению стоимости AI-инференса сводится к тому, что данные не должны находиться в высоскоростной памяти постоянно (в DRAM/HBM), а должны вытесняться вниз по иерархии хранения (в плоть до SSD). Освобождая таким образом память для самых критичных задач. Но Memory Offloading не кеширование в привычном смысле. Этот подход требует нового дизайна памяти и осознанного перераспределения данных по уровням хранения на основе частоты их использования.
Подводя итог конференции, можно сказать, что память меняет свое влияние и роль в устройствах AI-инференса. Перенося хранение весов моделей и KV Cache на разные уровни памяти, мы частично снимаем нагрузку с GPU и снижаем стоимость инференса. Но надо отдать должное докладчикам GMIF, они честно показывали, что нет универсальных решений, и это всегда компромисс, каждое такое решение имеет свои ограничения. Что из докладов было маркетингом, каким планам суждено сбыться, а каким нет - сейчас сказать трудно. Но то, что для проектирования AI приложений наступает новая веха, то, что новая иерархия памяти для AI-инференса становится еще одним сложным архитектурным вопросом - это уж точно!
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.