Kimi K3 от Moonshot после запуска привлекла такую нагрузку, что компания за два дня приостановила новые подписки — яркий знак, что узкое место ИИ смещается с обучения на inference-мощности.
Moonshot выпустила Kimi K3, и спрос за 48 часов остановил новые подписки. Китайская ИИ-лаборатория приостановила регистрацию новых подписчиков после того, как нагрузка приблизилась к пределам доступной GPU-ёмкости, отдавая приоритет действующим клиентам, пока наращивается инфраструктура. Пауза ясно показывает: узкое место отрасли смещается с обучения frontier-моделей на их обслуживание в масштабе — особенно для длинных кодинговых и агентных рабочих нагрузок.
Примерно 2,8 трлн параметров делают Kimi K3 одной из крупнейших open-weight моделей, запланированных к публичному релизу; Moonshot наметила выкладку весов на 27 июля. В Frontend Code Arena на Arena.ai она обошла GPT-5.6 Sol от OpenAI и Claude Fable 5 от Anthropic; по более широкому Artificial Analysis Intelligence Index чуть отстаёт. Сильные результаты в коде важны: агентные задачи держат GPU занятыми гораздо дольше разового чата — модели непрерывно генерируют, читают и обрабатывают токены в многошаговых сценариях, из‑за чего низкая цена за токен может обернуться большим суммарным потреблением ресурсов и давлением на память серверов.
Цены агрессивны — около $3 за миллион входных токенов и $15 за миллион выходных, примерно на 40% дешевле Anthropic Opus 4.8 и примерно на 70% дешевле Claude Fable 5, по данным Bernstein Research. Сочетание возможностей и стоимости объясняет наплыв разработчиков. Moonshot заявила, что будет открывать слоты подписок партиями по мере роста ёмкости. Для китайских ИИ-лабораторий давление сильнее из‑за экспортных ограничений США на передовые чипы Nvidia: приходится опираться на более старый кремний, отечественные альтернативы, софтверную эффективность и облако Alibaba, Tencent и Huawei. Параллельно китайские гиперскейлеры вкладывают десятки миллиардов в ИИ-дата-центры.
Для разработчиков эпизод — архитектурное предупреждение: дешёвый безлимитный API может исчезнуть за ночь, когда inference-спрос взлетает. Планирование ёмкости, резервные провайдеры и эффективный дизайн агентов важны не меньше выбора модели. Подробнее: The New Stack.
Original Sources
Disclaimer
This is an AI-summarized article from authoritative sources. If you want your content removed, please .

