Trust in Rob
AI SummaryCurated from 1 authoritative sources

Moonshot Kimi K3 pēc palaišanas piesaistīja tik lielu slodzi, ka uzņēmums divu dienu laikā apturēja jaunas abonementu pieteikšanās, izceļot AI nozares pāreju no apmācības uz inference kapacitātes trūkumu.

Moonshot laidēja klajā Kimi K3, un pieprasījums 48 stundu laikā apturēja jaunas abonementus. Ķīnas AI laboratorija apturēja jaunu abonentu reģistrāciju pēc tam, kad lietojums pietuvojās pieejamās GPU kapacitātes robežām, prioritāti dodot esošajiem abonentiem, kamēr tiek steidzami pievienota infrastruktūra. Šī pauze skaidri parāda, ka nozares vājā vieta pāriet no robežmodeļu apmācības uz to apkalpošanu mērogā — īpaši garām koda un aģentu darba slodzēm.

Ar aptuveni 2,8 triljoniem parametru Kimi K3 ir viens no lielākajiem atvērto svaru modeļiem, ko plānots publiski izlaist; Moonshot svaru publicēšanu ieplānojusi 27. jūlijā. Arena.ai Frontend Code Arena testā tas pārspēja OpenAI GPT-5.6 Sol un Anthropic Claude Fable 5; plašākajā Artificial Analysis Intelligence Index tas nedaudz atpaliek. Spēcīgi koda rezultāti ir svarīgi, jo aģentu stila uzdevumi GPU noslogo daudz ilgāk nekā vienreizējs čats: modeļi nepārtraukti ģenerē, lasa un apstrādā tokenus daudzsoļu plūsmās, kas zemākas cenas par tokenu var pārvērst lielākā kopējā resursu patēriņā un spiedienā arī uz servera atmiņu.

Cenas ir agresīvas — apmēram 3 USD par miljonu ievades tokenu un 15 USD par miljonu izvades tokenu, aptuveni par 40 % lētāk nekā Anthropic Opus 4.8 un ap 70 % lētāk nekā Claude Fable 5, liecina Bernstein Research. Šī spēju un izmaksu kombinācija palīdz izskaidrot izstrādātāju pieplūdumu. Moonshot solīja atvērt abonementu vietas partijās, kad kapacitāte pieaugs. Ķīnas AI laboratorijām spiediens ir vēl lielāks ASV eksporta ierobežojumu dēļ pret modernākajiem Nvidia čipiem, kas spiež paļauties uz vecāku silīciju, vietējām alternatīvām, programmatūras efektivitāti un mākoņa jaudu no Alibaba, Tencent un Huawei. Vienlaikus Ķīnas hiperskalētāji iegulda desmitiem miljardu dolāru AI datu centros.

Izstrādātājiem šis epizodes ir arhitektūras brīdinājums: lēts, neierobežots API piekļuve var pazust vienas nakts laikā, kad inference pieprasījums strauji pieaug. Kapacitātes plānošana, vairāku piegādātāju rezerves un efektīvi aģentu dizaini ir tikpat svarīgi kā modeļa izvēle. Lasiet vairāk The New Stack.

Original Sources

Disclaimer

This is an AI-summarized article from authoritative sources. If you want your content removed, please .

WEEKLY DIGEST

Expert Insights Delivered Directly to Your Inbox.

Join thousands of readers who trust Rob for curated tech insights, practical automation tips, and strategies to reclaim your time.