В марте 2026 года среднесуточное число обращений к ИИ моделям в Китае превысило 140 трлн против примерно 100 млрд в начале 2024 года. Оптимизация инференса позволяет направлять простые запросы на более дешёвые или отечественные ускорители, оставляя Nvidia GPU для сложного программирования, рассуждений и агентных задач.
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: Why are Chinese AI companies optimizing inference software and stretching scarce Nvidia GPU capacity as AI shifts from model training to lar. Article summary: Chinese AI companies are shifting effort from training ever-larger models to serving huge volumes of real-time requests. They are optimizing inference software—such as scheduling workloads across mixed hardware, improvin. Topic tags: general, news, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Китайская AI-индустрия сталкивается с дефицитом вычислительных ресурсов уже не только на этапе обучения моделей. По мере того как ИИ переходит от экспериментов к массовому использованию в потребительских сервисах, корпоративных системах и автономных агентах, главным ограничением становится инференс — обработка запросов и выдача ответов пользователям.
Агентные системы особенно требовательны к инфраструктуре: они рассуждают, вызывают внешние инструменты, выполняют несколько последовательных действий, проверяют результат и при необходимости переделывают его. В итоге компаниям нужно обслуживать не просто больше запросов, а гораздо более сложные вычислительные цепочки.
Обучение создаёт модель, а инференс — это последующий этап, на котором уже обученная модель отвечает на запросы. Часть инференс-нагрузки можно перенести на китайские ускорители. Но такая замена подходит не для всех сценариев: наиболее требовательным приложениям по-прежнему нужны высокая производительность, большой объём памяти, надёжность и зрелая программная экосистема.
Поэтому китайские компании работают со смешанной инфраструктурой. Отечественные чипы берут на себя часть задач, тогда как ограниченный запас высокопроизводительных процессоров Nvidia приходится сохранять для нагрузок, которые сложнее заменить. По данным отраслевых публикаций, особенно остро проблема проявляется в задачах, связанных со сложным программированием.
Обычный вопрос-ответ может потребовать сравнительно немного вычислений. Кодовый помощник или автономный агент способен нагрузить инфраструктуру значительно сильнее. Ему необходимо удерживать длинный контекст, генерировать код, обращаться к внешним инструментам, анализировать полученный результат и несколько раз корректировать ответ.
Это меняет саму экономику развертывания ИИ. Важен не столько общий парк чипов, сколько объём качественной и стабильной работы, который этот парк способен выполнить. Если отечественные процессоры работают менее эффективно на сложных задачах программирования и рассуждений, полный отказ от Nvidia может ухудшить качество или увеличить стоимость обслуживания. Поэтому дефицитные GPU приходится направлять туда, где разница особенно заметна.
Число токенов — базовых единиц текста или другой информации, обрабатываемых языковой моделью, — удобно для оценки спроса. Но токены возникают в очень разных сценариях.
Простой и недорогой ответ можно поручить менее мощному оборудованию. Напротив, результат от более сильной модели, длинной цепочки рассуждений или серии вызовов внешних инструментов требует больше вычислений и может иметь для клиента гораздо большую ценность.
Именно поэтому рост общего числа токенов способен скрывать ещё более острый дефицит «премиального» инференса. Рынок может производить больше токенов в целом, одновременно испытывая нехватку оборудования, необходимого для надёжных ответов на сложные задачи. На эту разницу указывает и интерес к системам, которые повышают выпуск качественных токенов и объединяют неоднородные вычислительные ресурсы.
В марте 2026 года среднесуточное число обращений к ИИ-моделям в Китае превысило 140 трлн. В начале 2024 года показатель составлял около 100 млрд — рост превысил 1 000 раз, согласно данным, опубликованным со ссылкой на Национальное управление данных Китая.
Эта динамика показывает, как меняется характер использования ИИ. Модели переходят от тестирования и отдельных промптов к помощникам, корпоративному программному обеспечению и агентам, которые выполняют реальные рабочие процессы. Поэтому инференс становится одним из главных источников потребления вычислительных мощностей, а не второстепенным этапом после обучения.
Нарастить парк передовых процессоров непросто: доступ к новейшим продуктам Nvidia ограничивают экспортные меры, поставки остаются ограниченными, а смена аппаратной платформы требует больших затрат. Кроме того, существующие модели, инструменты и рабочие процессы китайских разработчиков тесно связаны с уже используемыми программными платформами.
Оптимизация программного обеспечения не создаёт новые чипы, но позволяет получить больше полезной работы от каждого доступного процессора. На практике компании используют несколько подходов:
Такие меры помогают закрыть разрыв между растущим спросом и ограниченным предложением. Но они не являются полноценной заменой передовому оборудованию — особенно для чувствительных к качеству задач, которые зависят от более узкого набора процессоров.
Проблему трудно решить ещё и потому, что цены на инференс снижаются. По оценке аналитиков Jefferies, китайские модели в среднем стоят около одной шестой цены за токен по сравнению с предложениями крупных американских компаний.
Низкая стоимость ускоряет внедрение ИИ, но одновременно ограничивает выручку, которой можно оплачивать дефицитные вычислительные ресурсы. При этом кодовые помощники и агентные продукты способны потреблять значительно больше мощностей, чем обычный чат.
Китайские AI-компании оказываются в жёстком зажиме: спрос быстро растёт, пользователи ожидают дешёвого доступа, а наиболее производительные ресурсы для инференса нельзя легко расширить или заменить. На рынке уже появлялись признаки этого напряжения: крупные разработчики моделей и облачные провайдеры ограничивали производительность сервисов, дозировали доступ или повышали цены, когда спрос превышал доступные вычислительные мощности. Особенно сильно это затрагивало ресурсоёмких кодовых помощников.
Проблема Китая заключается не просто в нехватке чипов. Речь идёт о дефиците правильного сочетания передовых процессоров, совместимого программного обеспечения и экономически оправданной мощности для высокоценных задач инференса.
Отечественные ускорители смогут принять на себя большую долю нагрузки по мере развития программных инструментов и появления систем, спроектированных с учётом их сильных сторон. Но пока наиболее реалистичная стратегия выглядит переходной: оптимизировать каждый уровень инференса, использовать китайские чипы там, где они эффективны, и сохранять дефицитные Nvidia GPU для самых сложных задач.
Это позволит растянуть имеющиеся ресурсы, но не отменит фундаментального ограничения. Дальнейший рост агентного ИИ будет зависеть от того, сможет ли Китай одновременно увеличить поставки аппаратных ускорителей и развить программную экосистему, которая сделает разные процессорные архитектуры удобными для совместной работы.
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
В марте 2026 года среднесуточное число обращений к ИИ моделям в Китае превысило 140 трлн против примерно 100 млрд в начале 2024 года.
В марте 2026 года среднесуточное число обращений к ИИ моделям в Китае превысило 140 трлн против примерно 100 млрд в начале 2024 года. Оптимизация инференса позволяет направлять простые запросы на более дешёвые или отечественные ускорители, оставляя Nvidia GPU для сложного программирования, рассуждений и агентных задач.
Ситуацию осложняет коммерческое давление: токены китайских моделей в среднем оцениваются примерно в одну шестую стоимости предложений крупных американских компаний, тогда как качественный инференс требует всё больше в...