Kimi K3 memukul batas GPU dalam 48 jam: frontier intelligence bertemu realitas infrastruktur

Moonshot mempause langganan konsumen baru setelah demand Kimi K3 mendekati batas cluster dalam 48 jam. Existing members diprioritaskan, API tetap terpisah, dan membership dipecah berdasarkan workload.

Kimi K3 Moonshot Infrastructure Agentic AI Open Weights
48 jam
ke batas kapasitas
Dipause
langganan konsumen baru
Prioritas
member existing

Kimi K3 baru beberapa hari berada di tangan publik ketika Moonshot AI mengakui bahwa permintaan bergerak lebih cepat daripada kapasitasnya. Dalam 48 jam, request mendekati batas cluster yang tersedia. Perusahaan menghentikan sementara langganan konsumen baru, mempertahankan akses pelanggan aktif, dan berjanji membuka slot kembali secara bertahap setelah kapasitas bertambah.

Cerita ini lebih besar daripada sebuah model yang populer sampai servernya penuh. K3 dipakai untuk coding agent, Kimi Work, general Agent, Agent Swarm, API, dan aplikasi dengan context sampai satu juta token. Satu pengguna baru dapat memicu banyak model call, tool execution, long context, dan output token. Jumlah akun saja tidak lagi cukup untuk memperkirakan beban.

Timeline Kimi K3 dari peluncuran hingga penghentian langganan baru dan tenggat full weights
K3 membuktikan demand dalam tiga hari. Pembuktian full weights baru dijadwalkan paling lambat 27 Juli.

Yang dihentikan bukan seluruh Kimi K3

Moonshot secara spesifik menyebut penghentian sementara new consumer subscriptions. Existing paid users dinyatakan tidak terpengaruh dan mendapat prioritas compute. Slot baru akan dibuka dalam batch. Ini lebih tepat dibaca sebagai admission control daripada penghentian produk secara menyeluruh.

Pemisahan itu penting karena Kimi.com, App, Work, Code, Agent, dan API tidak memakai billing maupun quota yang sama. Pada 20 Juli, halaman Kimi API masih menampilkan kimi-k3, context satu juta token, dan harga $0,30 untuk cache-hit input, $3 untuk cache-miss input, serta $15 untuk output per satu juta token. Dokumentasi rate limit juga tetap tersedia.

Jalur aksesStatus publik 20 JuliBatas kesimpulan
Langganan konsumen baruDipause sementaraBelum ada tanggal buka yang pasti
Existing subscribersDinyatakan tetap dilayaniTidak ada telemetry latency publik
Kimi API pay-as-you-goDocs dan pricing tetap liveBukan bukti uptime tanpa gangguan
Full open weightsDijanjikan paling lambat 27 JuliBelum ditemukan saat pemeriksaan 20 Juli
Empat status akses Kimi K3 yang perlu dibedakan
Subscription pause, API availability, dan weight release adalah tiga status yang berbeda.

Satu coding task dapat menghabiskan banyak putaran inference

Chat sederhana mungkin selesai dengan satu input dan satu output. Coding agent perlu membaca repository, membuat rencana, memanggil terminal, mengubah file, menjalankan test, membaca error, lalu mengulangi proses. History, dokumentasi, log, dan hasil tool ikut terbawa ke putaran berikutnya.

Prefix caching dapat memangkas biaya input, tetapi reasoning dan output baru tetap harus dihitung. Reuters mencatat bahwa coding dan agent-style tasks lazimnya membutuhkan repeated model calls dan heavy inference capacity. Help Center Kimi bahkan menjelaskan skenario Agent Swarm dengan lebih dari 4.000 parallel tool calls dan sampai 300 sub-agent. Itu bukan penggunaan rata-rata, tetapi menunjukkan seberapa jauh satu task dapat melakukan fan-out.

Diagram bagaimana satu tugas agent memicu model call dan tool execution berulang
Ilustrasi mekanisme agent loop. Diagram ini tidak menyatakan jumlah putaran rata-rata pada Kimi K3.

Angka 2,8T menjelaskan skala, bukan biaya per request

Kimi K3 memiliki 2,8 triliun total parameter dan memakai Mixture of Experts. Blog teknis Moonshot menyebut 16 dari 896 experts diroute. Informasi itu menunjukkan sparsity, tetapi belum memberi active parameter count. Ukuran expert, shared components, attention, dan embeddings belum dirinci.

Membagi 16 dengan 896 lalu mengalikannya dengan 2,8T akan menghasilkan angka yang tampak rapi tetapi salah asumsi. Tanpa model card atau technical report, kebutuhan memori aktif dan hardware minimum belum dapat dihitung secara defensible. Rekomendasi resmi berupa supernode dengan 64 atau lebih accelerator memberi sinyal kelas infrastrukturnya, bukan jumlah GPU yang dimiliki Moonshot.

DiketahuiBelum dipublikasikan
2,8T total parameterActive parameter count per token
16 dari 896 experts dirouteUkuran expert dan shared components
MXFP4 weights, MXFP8 activationsUkuran final weight shards
Rekomendasi 64+ acceleratorFleet size dan utilization Moonshot
Context window 1 juta tokenDistribusi panjang context aktual
Fakta serving Kimi K3 yang diketahui dan belum diketahui
Data resmi cukup untuk mengenali kelas infrastrukturnya, belum cukup untuk menghitung ekonomi cluster.

Harga token murah tidak sama dengan biaya serving murah

Harga API K3 terlihat agresif: $0,30 per satu juta cache-hit input token, $3 untuk cache-miss input, dan $15 untuk output. Moonshot mengatakan official API mencapai cache hit rate di atas 90 persen pada coding workload. Klaim itu berguna, tetapi tidak harus berlaku pada setiap integrasi dan bentuk prompt.

Caching membantu saat prefix panjang dapat digunakan kembali. Ia tidak menghapus biaya output baru, tool calls, concurrency, atau accelerator time untuk request panjang. Model dengan harga token rendah masih dapat menghasilkan cost per task tinggi bila tugas berputar berkali-kali. Builder perlu mengukur biaya dan latency per task selesai, bukan terpaku pada baris input termurah.

Moonshot belum memublikasikan cost per inference, fleet size, utilization, atau margin K3. Jadi belum ada dasar untuk menyebut harga API pasti merugi. Fakta yang ada lebih sederhana: perusahaan membatasi demand baru dan mengubah packaging untuk melindungi pengalaman pelanggan aktif.

Membership split adalah mekanisme alokasi compute

Moonshot mengumumkan dua jalur. Kimi Membership melayani Web, App, dan Work, sementara Kimi Code Membership dikhususkan untuk coding workflow. Kedua kelompok punya demand curve berbeda. Coding membawa repository context, repeated tool execution, concurrent sessions, dan pilihan speed. General usage mencakup chat, search, dokumen, multimodal work, dan Agent.

Pemisahan plan membuat rate, quota, priority, dan concurrency dapat diatur menurut workload. Ini adalah compute segmentation melalui pricing dan packaging. Detail harga baru dan migrasi existing members belum lengkap pada dokumentasi publik 20 Juli, jadi entitlement lama tidak layak ditebak.

Pemisahan Kimi Membership dan Kimi Code Membership berdasarkan workload
Dua membership memberi Moonshot ruang untuk mengatur quota, priority, dan concurrency secara berbeda.

Open weights tidak memindahkan biaya inference secara otomatis

Moonshot berjanji merilis full model weights paling lambat 27 Juli 2026. Rilis lengkap akan memungkinkan provider lain membuat quantization, mengintegrasikan inference engine, dan menjual endpoint alternatif. Namun open weights adalah akses ke parameter, bukan subsidi hardware. Rekomendasi 64+ accelerator membuat deployment penuh tetap berada di luar jangkauan banyak tim.

Bobot juga belum sama dengan produk yang siap dilayani. Ekosistem memerlukan lisensi, model card, tokenizer, config, shards, inference code, kernel, dan dokumentasi deployment. Pada pemeriksaan 20 Juli, full K3 weights belum tampak pada Hugging Face atau organisasi GitHub Moonshot. FlashKDA sudah tersedia, tetapi kernel bukan bobot model.

Ujian berikutnya adalah stabilitas serving

Indikator terdekat adalah kecepatan Moonshot membuka kembali slot dan apakah dua membership mendapat aturan yang konsisten. Existing users perlu melihat latency, throughput, dan reliability yang stabil. API users sebaiknya mengukur rate limits serta cost per completed task pada workload mereka sendiri.

Pada 27 Juli, fokus beralih ke artefak full weights. Jumlah download menarik, tetapi throughput pada hardware nyata, ukuran shards, quantization, integrasi engine, dan harga provider lain akan memberi jawaban yang lebih berguna. K3 sudah membuktikan demand. Tantangan berikutnya adalah menjaga kualitas layanan agar harga murah dan agentic usage tidak mengubah keberhasilan produk menjadi tekanan infrastruktur yang berulang.

Sumber

  1. Moonshot AI, pernyataan kapasitas Kimi K3, 19 Juli 2026.
  2. Kimi K3: Open Frontier Intelligence, 16 Juli 2026.
  3. Kimi API Platform.
  4. Kimi API rate limits.
  5. Kimi overview.
  6. Kimi Agent overview.
  7. Kimi Code membership guide.
  8. Kimi Code docs.
  9. Reuters, Moonshot pauses Kimi subscriptions, 20 Juli 2026.
  10. AP, Moonshot halts new subscriptions, 20 Juli 2026.
  11. Business Insider, Kimi gates new users, 20 Juli 2026.
  12. South China Morning Post, Kimi compute constraints, 20 Juli 2026.
  13. Moonshot AI models on Hugging Face, diperiksa 20 Juli 2026.
  14. Moonshot AI on GitHub, diperiksa 20 Juli 2026.

Artikel terkait

Claude Opus 5 mengubah reasoning menjadi anggaran compute: mendekati Fable dengan setengah harga, tetapi max effort bukan jawaban untuk semua task 16 menit baca Baca selengkapnya Cisco Antares mengecilkan AI security hingga 350M parameter, tetapi tidak menghapus kebutuhan scanner 15 menit baca Baca selengkapnya Ketika benchmark berubah menjadi insiden nyata: agen OpenAI menembus Hugging Face untuk memperoleh jawaban 13 menit baca Baca selengkapnya