Kimi K3 memukul batas GPU dalam 48 jam: frontier intelligence bertemu realitas infrastruktur
Moonshot mempause langganan konsumen baru setelah demand Kimi K3 mendekati batas cluster dalam 48 jam. Existing members diprioritaskan, API tetap terpisah, dan membership dipecah berdasarkan workload.
- 48 jam
- ke batas kapasitas
- Dipause
- langganan konsumen baru
- Prioritas
- member existing
Kimi K3 baru beberapa hari berada di tangan publik ketika Moonshot AI mengakui bahwa permintaan bergerak lebih cepat daripada kapasitasnya. Dalam 48 jam, request mendekati batas cluster yang tersedia. Perusahaan menghentikan sementara langganan konsumen baru, mempertahankan akses pelanggan aktif, dan berjanji membuka slot kembali secara bertahap setelah kapasitas bertambah.
Cerita ini lebih besar daripada sebuah model yang populer sampai servernya penuh. K3 dipakai untuk coding agent, Kimi Work, general Agent, Agent Swarm, API, dan aplikasi dengan context sampai satu juta token. Satu pengguna baru dapat memicu banyak model call, tool execution, long context, dan output token. Jumlah akun saja tidak lagi cukup untuk memperkirakan beban.
Yang dihentikan bukan seluruh Kimi K3
Moonshot secara spesifik menyebut penghentian sementara new consumer subscriptions. Existing paid users dinyatakan tidak terpengaruh dan mendapat prioritas compute. Slot baru akan dibuka dalam batch. Ini lebih tepat dibaca sebagai admission control daripada penghentian produk secara menyeluruh.
Pemisahan itu penting karena Kimi.com, App, Work, Code, Agent, dan API tidak memakai billing maupun quota yang sama. Pada 20 Juli, halaman Kimi API masih menampilkan kimi-k3, context satu juta token, dan harga $0,30 untuk cache-hit input, $3 untuk cache-miss input, serta $15 untuk output per satu juta token. Dokumentasi rate limit juga tetap tersedia.
| Jalur akses | Status publik 20 Juli | Batas kesimpulan |
|---|---|---|
| Langganan konsumen baru | Dipause sementara | Belum ada tanggal buka yang pasti |
| Existing subscribers | Dinyatakan tetap dilayani | Tidak ada telemetry latency publik |
| Kimi API pay-as-you-go | Docs dan pricing tetap live | Bukan bukti uptime tanpa gangguan |
| Full open weights | Dijanjikan paling lambat 27 Juli | Belum ditemukan saat pemeriksaan 20 Juli |
Satu coding task dapat menghabiskan banyak putaran inference
Chat sederhana mungkin selesai dengan satu input dan satu output. Coding agent perlu membaca repository, membuat rencana, memanggil terminal, mengubah file, menjalankan test, membaca error, lalu mengulangi proses. History, dokumentasi, log, dan hasil tool ikut terbawa ke putaran berikutnya.
Prefix caching dapat memangkas biaya input, tetapi reasoning dan output baru tetap harus dihitung. Reuters mencatat bahwa coding dan agent-style tasks lazimnya membutuhkan repeated model calls dan heavy inference capacity. Help Center Kimi bahkan menjelaskan skenario Agent Swarm dengan lebih dari 4.000 parallel tool calls dan sampai 300 sub-agent. Itu bukan penggunaan rata-rata, tetapi menunjukkan seberapa jauh satu task dapat melakukan fan-out.
Angka 2,8T menjelaskan skala, bukan biaya per request
Kimi K3 memiliki 2,8 triliun total parameter dan memakai Mixture of Experts. Blog teknis Moonshot menyebut 16 dari 896 experts diroute. Informasi itu menunjukkan sparsity, tetapi belum memberi active parameter count. Ukuran expert, shared components, attention, dan embeddings belum dirinci.
Membagi 16 dengan 896 lalu mengalikannya dengan 2,8T akan menghasilkan angka yang tampak rapi tetapi salah asumsi. Tanpa model card atau technical report, kebutuhan memori aktif dan hardware minimum belum dapat dihitung secara defensible. Rekomendasi resmi berupa supernode dengan 64 atau lebih accelerator memberi sinyal kelas infrastrukturnya, bukan jumlah GPU yang dimiliki Moonshot.
| Diketahui | Belum dipublikasikan |
|---|---|
| 2,8T total parameter | Active parameter count per token |
| 16 dari 896 experts diroute | Ukuran expert dan shared components |
| MXFP4 weights, MXFP8 activations | Ukuran final weight shards |
| Rekomendasi 64+ accelerator | Fleet size dan utilization Moonshot |
| Context window 1 juta token | Distribusi panjang context aktual |
Harga token murah tidak sama dengan biaya serving murah
Harga API K3 terlihat agresif: $0,30 per satu juta cache-hit input token, $3 untuk cache-miss input, dan $15 untuk output. Moonshot mengatakan official API mencapai cache hit rate di atas 90 persen pada coding workload. Klaim itu berguna, tetapi tidak harus berlaku pada setiap integrasi dan bentuk prompt.
Caching membantu saat prefix panjang dapat digunakan kembali. Ia tidak menghapus biaya output baru, tool calls, concurrency, atau accelerator time untuk request panjang. Model dengan harga token rendah masih dapat menghasilkan cost per task tinggi bila tugas berputar berkali-kali. Builder perlu mengukur biaya dan latency per task selesai, bukan terpaku pada baris input termurah.
Moonshot belum memublikasikan cost per inference, fleet size, utilization, atau margin K3. Jadi belum ada dasar untuk menyebut harga API pasti merugi. Fakta yang ada lebih sederhana: perusahaan membatasi demand baru dan mengubah packaging untuk melindungi pengalaman pelanggan aktif.
Membership split adalah mekanisme alokasi compute
Moonshot mengumumkan dua jalur. Kimi Membership melayani Web, App, dan Work, sementara Kimi Code Membership dikhususkan untuk coding workflow. Kedua kelompok punya demand curve berbeda. Coding membawa repository context, repeated tool execution, concurrent sessions, dan pilihan speed. General usage mencakup chat, search, dokumen, multimodal work, dan Agent.
Pemisahan plan membuat rate, quota, priority, dan concurrency dapat diatur menurut workload. Ini adalah compute segmentation melalui pricing dan packaging. Detail harga baru dan migrasi existing members belum lengkap pada dokumentasi publik 20 Juli, jadi entitlement lama tidak layak ditebak.
Open weights tidak memindahkan biaya inference secara otomatis
Moonshot berjanji merilis full model weights paling lambat 27 Juli 2026. Rilis lengkap akan memungkinkan provider lain membuat quantization, mengintegrasikan inference engine, dan menjual endpoint alternatif. Namun open weights adalah akses ke parameter, bukan subsidi hardware. Rekomendasi 64+ accelerator membuat deployment penuh tetap berada di luar jangkauan banyak tim.
Bobot juga belum sama dengan produk yang siap dilayani. Ekosistem memerlukan lisensi, model card, tokenizer, config, shards, inference code, kernel, dan dokumentasi deployment. Pada pemeriksaan 20 Juli, full K3 weights belum tampak pada Hugging Face atau organisasi GitHub Moonshot. FlashKDA sudah tersedia, tetapi kernel bukan bobot model.
Ujian berikutnya adalah stabilitas serving
Indikator terdekat adalah kecepatan Moonshot membuka kembali slot dan apakah dua membership mendapat aturan yang konsisten. Existing users perlu melihat latency, throughput, dan reliability yang stabil. API users sebaiknya mengukur rate limits serta cost per completed task pada workload mereka sendiri.
Pada 27 Juli, fokus beralih ke artefak full weights. Jumlah download menarik, tetapi throughput pada hardware nyata, ukuran shards, quantization, integrasi engine, dan harga provider lain akan memberi jawaban yang lebih berguna. K3 sudah membuktikan demand. Tantangan berikutnya adalah menjaga kualitas layanan agar harga murah dan agentic usage tidak mengubah keberhasilan produk menjadi tekanan infrastruktur yang berulang.
Sumber
- Moonshot AI, pernyataan kapasitas Kimi K3, 19 Juli 2026.
- Kimi K3: Open Frontier Intelligence, 16 Juli 2026.
- Kimi API Platform.
- Kimi API rate limits.
- Kimi overview.
- Kimi Agent overview.
- Kimi Code membership guide.
- Kimi Code docs.
- Reuters, Moonshot pauses Kimi subscriptions, 20 Juli 2026.
- AP, Moonshot halts new subscriptions, 20 Juli 2026.
- Business Insider, Kimi gates new users, 20 Juli 2026.
- South China Morning Post, Kimi compute constraints, 20 Juli 2026.
- Moonshot AI models on Hugging Face, diperiksa 20 Juli 2026.
- Moonshot AI on GitHub, diperiksa 20 Juli 2026.