Китайские ИИ-ускорители вместо Nvidia: когда окупится перенос моделей

24 Авг    Новости
Вычислительный модуль у погрузочной площадки

MWS AI и Rubytech испытали комплекс с восемью китайскими GPU. В отдельных сценариях инференса — работы уже обученной модели — результат оказался сопоставим с Nvidia H100. Но первая версия комплекса рассчитана именно на инференс. Дообучение разработчики обещают добавить позднее, коммерческий запуск намечен на 2027 год.

Для финансового директора вывод короче: финансировать замену всего парка Nvidia рано. Китайскую платформу можно рассматривать под одну стабильную нагрузку, если собственный пилот подтвердит производительность, а перенос кода не съест экономию на оборудовании.

Сопоставимый результат не означает взаимозаменяемость

В испытаниях MWS AI и Rubytech модель при контексте около 27 000 токенов начинала ответ примерно через 8 секунд, затем выдавала до 9 токенов в секунду. Оптимизация драйверов и программного обеспечения подняла производительность отдельных задач в 2–2,2 раза.

Серверный блок расширения на мокром бетоне

Эти показатели относятся к конкретным моделям и настройкам. Они не доказывают, что восемь китайских ускорителей заменят восемь H100 в корпоративном контуре.

Граница проходит между инференсом и обучением. Китайские платформы уже можно испытывать на скоринге, антифроде, обработке речи и текста, персонализации. При дообучении крупных моделей и высокой нагрузке ограничения становятся заметнее. По предварительным результатам испытаний Ascend 910C, для моделей свыше 70 млрд параметров отставание от Nvidia A100 остаётся большим.

Поэтому бюджет стоит привязывать не к числу карт, а к рабочей нагрузке: сколько запросов система обработает, с какой задержкой и сколько часов выдержит без сбоя.

Цена единицы нагрузки может быть ниже на 36%

По опубликованной оценке, Ascend 910C стоит около половины цены Nvidia A100. В испытании GigaChat 3.5 Ultra ускоритель показал 78% производительности A100 на инференсе.

Медные радиаторы на мокрой бетонной площадке

Посчитаем стоимость оборудования на единицу пропускной способности:

0,50 ÷ 0,78 = 0,64

Получается около 64% уровня A100, или на 36% ниже. Это не рыночная котировка и не готовая экономия для Вашей компании. Расчёт опирается на два допущения: цена китайского ускорителя равна 50% цены A100, а Ваше программное обеспечение повторит результат испытания.

Для собственного пилота формула такая:

относительная стоимость нагрузки = 0,50 ÷ P

Здесь P — производительность китайской платформы относительно A100. Если пилот покажет 60%, единица нагрузки обойдётся в 83% стоимости A100. Запас на миграцию и риски составит 17%. При производительности 80% стоимость снизится до 63%, а запас вырастет до 37%.

Этот запас — предел расходов на перенос кода, простой и дополнительную поддержку. Если они дороже, более дешёвое оборудование не снижает бюджет проекта.

Перенос с CUDA может занять несколько месяцев

Большая часть корпоративного ИИ-кода рассчитана на программную среду Nvidia CUDA. При переходе на другую платформу команде придётся переносить библиотеки, проверять операции модели и переписывать кастомные ядра. Для части CUDA-ядер готовых аналогов нет.

Оптические кабели на мокром бетоне у стойки

Cloud.ru оценивает такой перенос в несколько месяцев. Дополнительные часы уйдут на документацию: часть материалов по Ascend доступна только на китайском языке.

В расходы проекта войдут зарплаты разработчиков и инженеров, параллельная инфраструктура для испытаний, повторная проверка моделей после обновлений и потери от сбоев. Сравнивать один ежемесячный платёж недостаточно — в бюджете нужна полная сумма выплат и запас денежного потока.

Операционный риск тоже требует денег. В одном из испытаний Т-Банк зафиксировал три сбоя за 200 часов, а время ответа поддержки оценивалось в 24–72 часа. Эти показатели нельзя переносить на каждую китайскую платформу. Их стоит превратить в условия Вашего пилота: длительность непрерывного прогона, допустимое число сбоев и срок восстановления.

Сначала пилот, затем отдельный контур инференса

Безопасная схема финансирования состоит из двух решений. Сначала компания оплачивает пилот на инфраструктуре поставщика или облачного провайдера. Затем, если тест пройден, покупает либо берёт в лизинг оборудование под подтверждённый инференс.

Парк Nvidia при этом остаётся для исследований, обучения крупных моделей и кода, который не удалось перенести. Смешанный контур снижает зависимость от одного производителя, но не заставляет компанию оплачивать полную миграцию сразу. Такую диверсификацию уже рассматривают российские банки и разработчики инфраструктуры.

До пилота зафиксируйте пять метрик:

  • производительность на Вашей корпоративной модели;
  • задержку при рабочем размере запроса;
  • стабильность непрерывного прогона;
  • долю перенесённого кода;
  • срок устранения сбоя.

Те же показатели нужно перенести в спецификацию, договор и акт. Формулировка «восемь ускорителей» не защищает покупателя: оборудование может включаться, но не выдерживать нужную нагрузку. Если согласованные метрики не достигнуты, расхождения следует зафиксировать до безусловной подписи акта. Порядок действий и расчёт потерь разобраны в материале о срыве приёмки-передачи оборудования.

Когда финансирование проходит проверку

Одобряйте покупку или лизинг отдельного инференс-контура, если собственный пилот подтвердил нагрузку, а расходы на миграцию, простой и поддержку укладываются в ценовой запас. При цене 50% от A100 этот запас составляет около 17% при производительности 60% и около 37% при производительности 80%.

Ограничьтесь пилотом, если поставщик показывает тесты только на чужой модели, критичные CUDA-ядра не перенесены или компании нужно обучать модели свыше 70 млрд параметров. В такой конфигурации финансирование всего парка оплачивает обещанную совместимость, а не измеримую вычислительную работу.

отМихаил Дорофеев

Финансист и экономист, эксперт по лизингу, налогам и корпоративным финансам. Разбирает экономику бизнес-решений на конкретных числах: лизинг или кредит, налоговая выгода по НК РФ, удорожание за весь срок, стоимость владения техникой «после всего». Пишет так, чтобы Вы могли повторить любой расчёт для своей компании — без консультанта и без калькулятора лизинговой компании.