Update peluncuran

Kimi K3 resmi meluncur: open weights dijanjikan 27 Juli, benchmark awal menempatkannya dekat frontier

Update post-launch Kimi K3: arsitektur 16 dari 896 experts, janji open weights 27 Juli 2026, dan hasil independen dari Artificial Analysis, Arena, dan Vals AI.

Kimi K3 Moonshot Benchmark Open Weights

Kimi K3 berubah cepat dalam dua hari. Pada 16 Juli 2026 TechCrunch masih merangkum laporan Financial Times bahwa model 2 sampai 3 triliun parameter ini akan hadir "dalam beberapa hari". Sehari kemudian dokumentasi API-nya live, dan tidak lama setelah itu Moonshot menerbitkan technical blog, mengumumkan peluncuran di akun resminya di X, serta menjanjikan full model weights paling lambat 27 Juli 2026. Evaluator independen seperti Artificial Analysis, Arena, dan Vals AI juga sudah memuat hasil awal.

Artikel ini adalah update dari analisis launch sebelumnya. Aturannya tetap sama: fakta produk, klaim vendor, hasil evaluator independen, dan janji yang belum terealisasi ditulis terpisah. Status yang paling presisi untuk bobot model per 17 Juli 2026: open weights sudah diumumkan resmi, tetapi belum dirilis.

Spesifikasi dan arsitektur: detail MoE akhirnya terbuka

Dokumentasi API dan technical blog sama-sama menyebut K3 sebagai model 2,8 triliun parameter dengan context window sekitar satu juta token, native visual understanding, Kimi Delta Attention (hybrid linear attention), dan Attention Residuals. Sasarannya long-horizon coding, knowledge work, dan deep reasoning.

Informasi baru yang paling penting ada di konfigurasi Mixture of Experts. Technical blog menyatakan Stable LatentMoE K3 mengaktifkan 16 dari 896 experts untuk suatu token. Angka ini menjelaskan tingkat sparsity, bukan jumlah active parameters; ukuran tiap expert dan komponen non-MoE tidak dijabarkan cukup rinci untuk menghitungnya, dan Moonshot memang belum mengumumkan active parameter count.

Moonshot juga menyebut quantization-aware training dengan MXFP4 weights dan MXFP8 activations, plus teknik seperti Quantile Balancing dan Per-Head Muon. Klaim vendornya: sekitar 2,5 kali peningkatan overall scaling efficiency dibanding Kimi K2. Technical report lengkap masih akan menyusul, jadi klaim efisiensi ini belum bisa diperiksa pihak luar.

Kontrak API dan harga: tidak berubah dari hari pertama

Bagian ini masih sama dengan kondisi launch. Model ID kimi-k3, base URL kompatibel OpenAI SDK, thinking mode selalu aktif, dan reasoning_effort untuk public API baru mendukung nilai max. Parameter sampling seperti temperature dan top_p fixed dan tidak boleh diubah. Batas output: max_completion_tokens default 131.072, bisa dinaikkan sampai 1.048.576. Context caching berjalan otomatis untuk prefix yang stabil.

Bar chart: Kimi API pricing comparison per 1M tokens
Harga cache hit, input cache miss, dan output per 1 juta token untuk K2.6, K2.7 Code, dan K3.
Model Cache hit Input (cache miss) Output Context
Kimi K3 (kimi-k3)$0.30$3.00$15.001,048,576
Kimi K2.7 Code$0.19$0.95$4.00256k
Kimi K2.6$0.16$0.95$4.00256k
Bar chart: Kimi context window comparison
Context window K3 mencapai 1 juta token; K2.6 dan K2.7 Code di 256k.

K3 memberi context sekitar empat kali lebih besar daripada K2.6 atau K2.7 Code, dengan tarif input dan output yang jauh lebih mahal. Technical blog menambah satu klaim operasional: official API disebut mencapai cache hit rate di atas 90% pada coding workloads. Itu metrik vendor yang sangat bergantung pada bentuk workload dan kestabilan prefix, jadi perlakukan sebagai indikasi, bukan jaminan.

Ada satu catatan reproduktibilitas yang layak diketahui developer. Docs public API menyatakan top_p fixed di 0,95, sedangkan footnote benchmark di technical blog menyebut hasil K3 dijalankan dengan temperature 1,0 dan top-p 1,0. Sampai Moonshot menjelaskan perbedaannya, tabel benchmark vendor sebaiknya tidak dianggap bisa direplikasi persis lewat request API biasa.

Open weights: resmi dijanjikan 27 Juli, belum tersedia hari ini

Ini perubahan status terbesar sejak analisis pertama. Moonshot kini menyebut K3 sebagai model open 3T-class dan, baik di technical blog maupun post peluncuran di X, berkomitmen merilis full model weights paling lambat 27 Juli 2026. Kalimat "open weights by 27 July" adalah deadline yang diumumkan, bukan bukti bahwa artifact sudah ada.

Faktanya, per 17 Juli repo K3 belum muncul di Hugging Face org moonshotai maupun GitHub org MoonshotAI. Belum ada file weight, lisensi, model card, atau deployment guide. Artificial Analysis, Arena, dan Vals juga masih memberi label proprietary pada K3, dan label itu wajar karena mereka hanya bisa menguji hosted API.

Kalaupun weights terbit sesuai janji, self-host bukan urusan ringan. Moonshot sendiri merekomendasikan deployment pada supernode dengan 64 accelerator atau lebih, dan Reuters mencatat bahwa skala K3 membuat self-hosting tidak realistis bagi banyak organisasi. Untuk mayoritas developer, API kemungkinan tetap jalur utama; open weights lebih relevan untuk lab riset, cloud provider, dan perusahaan dengan cluster inference besar.

Benchmark vendor: kuat di coding dan agentic work, tidak menang di semua bidang

Technical blog memuat tabel benchmark yang luas. Semua angka di bawah ini berstatus vendor-reported: harness antara KimiCode, Claude Code, dan Codex berbeda, sehingga perbandingannya bukan bake-off yang identik. Sampelnya:

Benchmark Kimi K3 max Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8
Program Bench77.876.877.671.9
Terminal-Bench 2.188.384.688.884.6
FrontierSWE81.286.671.366.7
SWE Marathon42.035.039.040.0
BrowseComp91.288.090.484.3
GPQA-Diamond93.592.694.191.0
HLE-Full43.553.344.549.8
OmniDocBench91.189.885.887.9

Tabel ini tidak mendukung headline "K3 mengalahkan semua model Amerika". K3 memimpin di SWE Marathon, BrowseComp, dan OmniDocBench, tetapi tertinggal jauh di HLE-Full dan kalah dari Claude Fable 5 di FrontierSWE. Moonshot sendiri mengakui overall performance K3 masih di bawah model proprietary terkuat pada evaluasi keseluruhan mereka. Itu pengakuan yang jarang ada di materi launch, dan justru membuat sisa tabelnya lebih layak dibaca.

Hasil evaluator independen: satu model, tiga cerita

Artificial Analysis memberi K3 skor 57 di Intelligence Index, peringkat #4 dari 189 model di halamannya saat diverifikasi 17 Juli. Profil performanya tidak murah dan tidak cepat: output speed sekitar 62 token per detik (di bawah median pembanding), time to first token 1,99 detik (lebih baik dari median), dan model ini tergolong verbose. Menjalankan Intelligence Index menghasilkan sekitar 130 juta output tokens dengan biaya sekitar $2.690,80, kira-kira dua kali median. Untuk workload agentic, artinya harga per token bukan satu-satunya faktor; ukur cost per completed task.

Arena memberi dua angka yang berbeda arah. Di WebDev Overall, K3 peringkat #1 dengan score 1679 (+17/-17), status preliminary, sekitar 1.757 votes per 16 Juli. Di Text Arena Overall, K3 ada di sekitar peringkat #9 dengan score 1486 ±11 dan sekitar 3.024 votes. Dua-duanya snapshot yang bisa bergeser saat vote bertambah, dan dua-duanya perlu dibaca bersamaan: pengguna sangat menyukai output frontend K3, tetapi untuk percakapan umum posisinya frontier-class tanpa dominasi.

Vals AI menempatkan K3 di peringkat #2 dari 38 model dengan Vals Index 74,70% pada update 16 Juli. Komponennya konsisten dengan cerita coding: 95,10% di SWE-bench Verified subset, 91,27% di Vibe Code Bench subset, 80,90% di Terminal-Bench 2.1 (tiga full trials). Di finance hasilnya lebih moderat: 72,61% di CorpFin v2 dan 55,88% di Finance Agent v2 subset. Perhatikan kata subset; beberapa evaluasi Vals memakai subset agar lebih cepat, jadi angkanya tidak selalu setara full benchmark.

Cara membaca K3 untuk keputusan builder

Kebutuhan Kesimpulan per 17 Juli 2026
Coba model terkuat Moonshot via APISudah bisa, kimi-k3 dengan reasoning_effort: max
Frontend / web prototypeSinyal eksternal kuat (Arena WebDev #1), tapi masih preliminary
Agentic coding dan terminal taskKuat di Vals dan tabel vendor
General chatFrontier-class, bukan #1 di Arena Text
Self-host hari iniBelum bisa; weights dan lisensi belum terbit
Persiapan self-host setelah 27 JuliButuh cluster besar (rekomendasi vendor 64+ accelerator)
Workload sensitif biayaPertimbangkan K2.x atau routing hybrid; K3 verbose

Penutup

Sepuluh hari ke depan adalah bagian yang menarik. Kimi K3 sekarang punya paket bukti yang jauh lebih lengkap: spesifikasi resmi, detail arsitektur 16 dari 896 experts, tabel benchmark vendor, dan hasil awal dari tiga evaluator independen. Gambaran jujurnya bukan "K3 menang atas semuanya", melainkan "K3 masuk kelompok frontier dengan kekuatan menonjol di coding dan agentic work", sambil tertinggal di beberapa evaluasi reasoning dan berjalan cukup lambat serta boros token.

Satu hal yang belum berubah dari analisis pertama: bobotnya belum ada. Yang berubah adalah statusnya, dari "belum dikonfirmasi" menjadi komitmen resmi dengan tanggal. Sampai file, lisensi, dan deployment guide benar-benar terbit, K3 tetap model hosted. Baca quickstart dan pricing sebelum menjalankan workload panjang, uji repository sendiri dengan acceptance criteria yang jelas, dan cek ulang Hugging Face serta GitHub Moonshot pada 27 Juli 2026.

Sumber

Artikel terkait

Claude Opus 5 mengubah reasoning menjadi anggaran compute: mendekati Fable dengan setengah harga, tetapi max effort bukan jawaban untuk semua task 16 menit baca Baca selengkapnya Cisco Antares mengecilkan AI security hingga 350M parameter, tetapi tidak menghapus kebutuhan scanner 15 menit baca Baca selengkapnya Ketika benchmark berubah menjadi insiden nyata: agen OpenAI menembus Hugging Face untuk memperoleh jawaban 13 menit baca Baca selengkapnya