Update peluncuran
Kimi K3 resmi meluncur: open weights dijanjikan 27 Juli, benchmark awal menempatkannya dekat frontier
Update post-launch Kimi K3: arsitektur 16 dari 896 experts, janji open weights 27 Juli 2026, dan hasil independen dari Artificial Analysis, Arena, dan Vals AI.
Kimi K3 berubah cepat dalam dua hari. Pada 16 Juli 2026 TechCrunch masih merangkum laporan Financial Times bahwa model 2 sampai 3 triliun parameter ini akan hadir "dalam beberapa hari". Sehari kemudian dokumentasi API-nya live, dan tidak lama setelah itu Moonshot menerbitkan technical blog, mengumumkan peluncuran di akun resminya di X, serta menjanjikan full model weights paling lambat 27 Juli 2026. Evaluator independen seperti Artificial Analysis, Arena, dan Vals AI juga sudah memuat hasil awal.
Artikel ini adalah update dari analisis launch sebelumnya. Aturannya tetap sama: fakta produk, klaim vendor, hasil evaluator independen, dan janji yang belum terealisasi ditulis terpisah. Status yang paling presisi untuk bobot model per 17 Juli 2026: open weights sudah diumumkan resmi, tetapi belum dirilis.
Spesifikasi dan arsitektur: detail MoE akhirnya terbuka
Dokumentasi API dan technical blog sama-sama menyebut K3 sebagai model 2,8 triliun parameter dengan context window sekitar satu juta token, native visual understanding, Kimi Delta Attention (hybrid linear attention), dan Attention Residuals. Sasarannya long-horizon coding, knowledge work, dan deep reasoning.
Informasi baru yang paling penting ada di konfigurasi Mixture of Experts. Technical blog menyatakan Stable LatentMoE K3 mengaktifkan 16 dari 896 experts untuk suatu token. Angka ini menjelaskan tingkat sparsity, bukan jumlah active parameters; ukuran tiap expert dan komponen non-MoE tidak dijabarkan cukup rinci untuk menghitungnya, dan Moonshot memang belum mengumumkan active parameter count.
Moonshot juga menyebut quantization-aware training dengan MXFP4 weights dan MXFP8 activations, plus teknik seperti Quantile Balancing dan Per-Head Muon. Klaim vendornya: sekitar 2,5 kali peningkatan overall scaling efficiency dibanding Kimi K2. Technical report lengkap masih akan menyusul, jadi klaim efisiensi ini belum bisa diperiksa pihak luar.
Kontrak API dan harga: tidak berubah dari hari pertama
Bagian ini masih sama dengan kondisi launch. Model ID kimi-k3, base URL kompatibel OpenAI SDK, thinking mode selalu aktif, dan reasoning_effort untuk public API baru mendukung nilai max. Parameter sampling seperti temperature dan top_p fixed dan tidak boleh diubah. Batas output: max_completion_tokens default 131.072, bisa dinaikkan sampai 1.048.576. Context caching berjalan otomatis untuk prefix yang stabil.
| Model | Cache hit | Input (cache miss) | Output | Context |
|---|---|---|---|---|
Kimi K3 (kimi-k3) | $0.30 | $3.00 | $15.00 | 1,048,576 |
| Kimi K2.7 Code | $0.19 | $0.95 | $4.00 | 256k |
| Kimi K2.6 | $0.16 | $0.95 | $4.00 | 256k |
K3 memberi context sekitar empat kali lebih besar daripada K2.6 atau K2.7 Code, dengan tarif input dan output yang jauh lebih mahal. Technical blog menambah satu klaim operasional: official API disebut mencapai cache hit rate di atas 90% pada coding workloads. Itu metrik vendor yang sangat bergantung pada bentuk workload dan kestabilan prefix, jadi perlakukan sebagai indikasi, bukan jaminan.
Ada satu catatan reproduktibilitas yang layak diketahui developer. Docs public API menyatakan top_p fixed di 0,95, sedangkan footnote benchmark di technical blog menyebut hasil K3 dijalankan dengan temperature 1,0 dan top-p 1,0. Sampai Moonshot menjelaskan perbedaannya, tabel benchmark vendor sebaiknya tidak dianggap bisa direplikasi persis lewat request API biasa.
Open weights: resmi dijanjikan 27 Juli, belum tersedia hari ini
Ini perubahan status terbesar sejak analisis pertama. Moonshot kini menyebut K3 sebagai model open 3T-class dan, baik di technical blog maupun post peluncuran di X, berkomitmen merilis full model weights paling lambat 27 Juli 2026. Kalimat "open weights by 27 July" adalah deadline yang diumumkan, bukan bukti bahwa artifact sudah ada.
Faktanya, per 17 Juli repo K3 belum muncul di Hugging Face org moonshotai maupun GitHub org MoonshotAI. Belum ada file weight, lisensi, model card, atau deployment guide. Artificial Analysis, Arena, dan Vals juga masih memberi label proprietary pada K3, dan label itu wajar karena mereka hanya bisa menguji hosted API.
Kalaupun weights terbit sesuai janji, self-host bukan urusan ringan. Moonshot sendiri merekomendasikan deployment pada supernode dengan 64 accelerator atau lebih, dan Reuters mencatat bahwa skala K3 membuat self-hosting tidak realistis bagi banyak organisasi. Untuk mayoritas developer, API kemungkinan tetap jalur utama; open weights lebih relevan untuk lab riset, cloud provider, dan perusahaan dengan cluster inference besar.
Benchmark vendor: kuat di coding dan agentic work, tidak menang di semua bidang
Technical blog memuat tabel benchmark yang luas. Semua angka di bawah ini berstatus vendor-reported: harness antara KimiCode, Claude Code, dan Codex berbeda, sehingga perbandingannya bukan bake-off yang identik. Sampelnya:
| Benchmark | Kimi K3 max | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 |
|---|---|---|---|---|
| Program Bench | 77.8 | 76.8 | 77.6 | 71.9 |
| Terminal-Bench 2.1 | 88.3 | 84.6 | 88.8 | 84.6 |
| FrontierSWE | 81.2 | 86.6 | 71.3 | 66.7 |
| SWE Marathon | 42.0 | 35.0 | 39.0 | 40.0 |
| BrowseComp | 91.2 | 88.0 | 90.4 | 84.3 |
| GPQA-Diamond | 93.5 | 92.6 | 94.1 | 91.0 |
| HLE-Full | 43.5 | 53.3 | 44.5 | 49.8 |
| OmniDocBench | 91.1 | 89.8 | 85.8 | 87.9 |
Tabel ini tidak mendukung headline "K3 mengalahkan semua model Amerika". K3 memimpin di SWE Marathon, BrowseComp, dan OmniDocBench, tetapi tertinggal jauh di HLE-Full dan kalah dari Claude Fable 5 di FrontierSWE. Moonshot sendiri mengakui overall performance K3 masih di bawah model proprietary terkuat pada evaluasi keseluruhan mereka. Itu pengakuan yang jarang ada di materi launch, dan justru membuat sisa tabelnya lebih layak dibaca.
Hasil evaluator independen: satu model, tiga cerita
Artificial Analysis memberi K3 skor 57 di Intelligence Index, peringkat #4 dari 189 model di halamannya saat diverifikasi 17 Juli. Profil performanya tidak murah dan tidak cepat: output speed sekitar 62 token per detik (di bawah median pembanding), time to first token 1,99 detik (lebih baik dari median), dan model ini tergolong verbose. Menjalankan Intelligence Index menghasilkan sekitar 130 juta output tokens dengan biaya sekitar $2.690,80, kira-kira dua kali median. Untuk workload agentic, artinya harga per token bukan satu-satunya faktor; ukur cost per completed task.
Arena memberi dua angka yang berbeda arah. Di WebDev Overall, K3 peringkat #1 dengan score 1679 (+17/-17), status preliminary, sekitar 1.757 votes per 16 Juli. Di Text Arena Overall, K3 ada di sekitar peringkat #9 dengan score 1486 ±11 dan sekitar 3.024 votes. Dua-duanya snapshot yang bisa bergeser saat vote bertambah, dan dua-duanya perlu dibaca bersamaan: pengguna sangat menyukai output frontend K3, tetapi untuk percakapan umum posisinya frontier-class tanpa dominasi.
Vals AI menempatkan K3 di peringkat #2 dari 38 model dengan Vals Index 74,70% pada update 16 Juli. Komponennya konsisten dengan cerita coding: 95,10% di SWE-bench Verified subset, 91,27% di Vibe Code Bench subset, 80,90% di Terminal-Bench 2.1 (tiga full trials). Di finance hasilnya lebih moderat: 72,61% di CorpFin v2 dan 55,88% di Finance Agent v2 subset. Perhatikan kata subset; beberapa evaluasi Vals memakai subset agar lebih cepat, jadi angkanya tidak selalu setara full benchmark.
Cara membaca K3 untuk keputusan builder
| Kebutuhan | Kesimpulan per 17 Juli 2026 |
|---|---|
| Coba model terkuat Moonshot via API | Sudah bisa, kimi-k3 dengan reasoning_effort: max |
| Frontend / web prototype | Sinyal eksternal kuat (Arena WebDev #1), tapi masih preliminary |
| Agentic coding dan terminal task | Kuat di Vals dan tabel vendor |
| General chat | Frontier-class, bukan #1 di Arena Text |
| Self-host hari ini | Belum bisa; weights dan lisensi belum terbit |
| Persiapan self-host setelah 27 Juli | Butuh cluster besar (rekomendasi vendor 64+ accelerator) |
| Workload sensitif biaya | Pertimbangkan K2.x atau routing hybrid; K3 verbose |
Penutup
Sepuluh hari ke depan adalah bagian yang menarik. Kimi K3 sekarang punya paket bukti yang jauh lebih lengkap: spesifikasi resmi, detail arsitektur 16 dari 896 experts, tabel benchmark vendor, dan hasil awal dari tiga evaluator independen. Gambaran jujurnya bukan "K3 menang atas semuanya", melainkan "K3 masuk kelompok frontier dengan kekuatan menonjol di coding dan agentic work", sambil tertinggal di beberapa evaluasi reasoning dan berjalan cukup lambat serta boros token.
Satu hal yang belum berubah dari analisis pertama: bobotnya belum ada. Yang berubah adalah statusnya, dari "belum dikonfirmasi" menjadi komitmen resmi dengan tanggal. Sampai file, lisensi, dan deployment guide benar-benar terbit, K3 tetap model hosted. Baca quickstart dan pricing sebelum menjalankan workload panjang, uji repository sendiri dengan acceptance criteria yang jelas, dan cek ulang Hugging Face serta GitHub Moonshot pada 27 Juli 2026.
Sumber
- Kimi API Platform: Kimi K3 Quickstart
- Kimi API Platform: Kimi K3 Pricing
- Kimi API Platform homepage
- Kimi API Platform: Model Parameter Reference
- Kimi API Platform: Thinking Effort
- Kimi Code
- Kimi K3 Tech Blog: Open Frontier Intelligence (17 Jul 2026)
- Kimi launch post di X: open weights by 27 July 2026
- Kimi product homepage
- Artificial Analysis: Kimi K3 (snapshot 17 Jul 2026)
- Arena WebDev leaderboard (snapshot 16 Jul 2026, preliminary)
- Arena Text leaderboard (snapshot 17 Jul 2026, preliminary)
- Vals AI: Kimi K3 (update 16 Jul 2026)
- Reuters: China's Moonshot unveils world's largest open AI model (17 Jul 2026)
- Kimi Research blog (negative check technical report, 17 Jul 2026)
- Hugging Face: moonshotai (negative check weights, 17 Jul 2026)
- GitHub: MoonshotAI (negative check weights, 17 Jul 2026)
- TechCrunch: Moonshot's upcoming Kimi 3 (16 Jul 2026)
- Financial Times: laporan pra-rilis (paywall; via TechCrunch)
- Kimi API Platform: pricing hub