Huawei предлагает хранить и повторно использовать KV кеш не только в памяти ускорителей и DRAM, но и в общем SSD кластере ёмкостью до 64 ПБ. «Терабайты на NPU» означают доступ к общей многоуровневой ёмкости, а не терабайты новой памяти внутри каждого ускорителя.
ОпубликовалОтредактировано с помощью GPT-6 SolИзображения созданы с помощью GPT Image 2
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: How does Huawei’s OceanStor M900 AI memory storage address the KV Cache memory wall in hyperscale, long-context and agentic inference SuperP. Article summary: Huawei positions OceanStor M900 as a shared, SSD-backed **KV-cache tier** for SuperPoD inference, not as a replacement for the NPU’s fast memory. Its aim is to keep and reuse more context across long-running and agentic . Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
При обработке длинных запросов и выполнении многошаговых задач ИИ-система накапливает KV-кеш — сохранённые данные, которые помогают не пересчитывать уже обработанный контекст. Если его больше, чем помещается рядом с ускорителями, сохранить и повторно использовать весь нужный контекст становится сложнее. Huawei предлагает OceanStor M900 как дополнительный, общий для SuperPoD уровень кеша на SSD. Он расширяет доступную ёмкость, но не заменяет самую быструю память NPU — нейропроцессоров, выполняющих вычисления. 8
10
12
По заявлению Huawei, сеть взаимосвязи Lingqu (UnifiedBus) объединяет KV-кеш в общий пул и распределяет данные между памятью на чипе, оперативной памятью DRAM и SSD. Компания указывает до 64 ПБ ёмкости на кластер и говорит, что объём KV-кеша, доступный одному NPU, увеличивается с гигабайтного до терабайтного уровня. Речь именно о доступе к общей многоуровневой системе, а не об увеличении физической памяти каждого чипа. 8
10
Таким образом, M900 — не новый вычислительный ускоритель и не замена сети, соединяющей компоненты SuperPoD. Это специализированная инфраструктура хранения контекста для инференса — работы уже обученной модели с запросами. Huawei ориентирует её, в частности, на задачи ИИ-агентов и длинный контекст; отраслевое издание Blocks & Files называет SuperPoD Atlas 960 одним из целевых окружений. 12
6
Компания описывает архитектуру, объединяющую функции CPU, сетевого и NAND-контроллеров. По её словам, она даёт NPU путь к SSD «за один переход», без пересылки через CPU и преобразования протоколов. Huawei заявляет о сокращении задержки доступа на 90% — до 60 мкс и совокупной пропускной способности кластера 40 ТБ/с, что, по её сравнению, в 1,5 раза выше показателя сопоставляемого решения. Последняя цифра относится ко всему кластеру, а не к каждому NPU отдельно. 8
Для «типичного сценария ИИ-программирования» Huawei также сообщает об удвоении скорости выдачи токенов кластером и сокращении вдвое времени до первого токена. Это результат, заявленный для конкретного сценария, а не обещание такого же ускорения для любого длинного запроса или ИИ-агента. 8
14
Технология KV-Aware, согласно Huawei, прогнозирует срок востребованности данных кеша и управляет их размещением на разных носителях. Компания заявляет поддержку нагрузки до 24 полных перезаписей накопителя в день (DWPD), увеличение срока службы SSD-носителей в 16 раз и три года стабильной работы. Huawei связывает это с более редкой заменой накопителей и меньшими затратами на обслуживание, однако приведённые материалы не содержат измеренной экономии в расчёте на один токен. 8
Ключевое различие — между ёмкостью кеша, к которой можно обратиться, и доказанным ускорением и удешевлением инференса в реальной эксплуатации. Независимые испытания должны показать полезную ёмкость и частоту попаданий в кеш на рабочих нагрузках, задержки и устойчивую пропускную способность при конкурирующих запросах, прирост скорости относительно чётко указанной базовой системы, а также износ SSD и совокупные затраты со временем. Доступные сторонние публикации пересказывают показатели Huawei, но не подтверждают их собственными тестами. 6
14
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
Huawei предлагает хранить и повторно использовать KV кеш не только в памяти ускорителей и DRAM, но и в общем SSD кластере ёмкостью до 64 ПБ.
Huawei предлагает хранить и повторно использовать KV кеш не только в памяти ускорителей и DRAM, но и в общем SSD кластере ёмкостью до 64 ПБ. «Терабайты на NPU» означают доступ к общей многоуровневой ёмкости, а не терабайты новой памяти внутри каждого ускорителя.
Цифры по задержке, скорости генерации и ресурсу SSD пока опираются на заявления Huawei; независимых замеров в приведённых материалах нет.