Claude Opus 5 mengubah reasoning menjadi anggaran compute: mendekati Fable dengan setengah harga, tetapi max effort bukan jawaban untuk semua task

Anthropic merilis Claude Opus 5 dengan 5 effort levels, 1M context window, dan 128k output tokens. Analisis test-time compute, perbandingan biaya per tugas, dan panduan migrasi.

Claude Opus 5 Anthropic Test-Time Compute Agentic AI AI Pricing
5 Level
tingkatan effort compute
1M Token
context window
$5 / $25
harga per 1M token input/output

Claude Opus 5 diluncurkan dengan kalimat yang terdengar sederhana: performa jauh lebih baik, harga tetap $5 per juta input tokens dan $25 per juta output tokens. Namun upgrade ini mengubah sesuatu yang lebih mendasar daripada posisi pada leaderboard. Anthropic menjadikan jumlah reasoning compute sebagai bagian eksplisit dari konfigurasi produk.

Pengguna tidak hanya memilih Opus 5. Mereka memilih Opus 5 pada low, medium, high, xhigh, atau max effort. Thinking aktif secara default. Output budget mencakup reasoning dan jawaban akhir. Pada effort tertinggi, thinking tidak dapat dimatikan. Model juga lebih cepat membentuk subagents, lebih sering menceritakan progresnya, dan lebih aktif memverifikasi hasil sendiri. Dengan kata lain, model ID kini hanya salah satu variabel. Quality, latency, token usage, tool loops, dan cost per task ditentukan oleh keseluruhan runtime configuration (S3, S7).

Ilustrasi Claude Opus 5 Test-Time Compute
Opus 5 menjadikan test-time compute sebagai fitur produk utama: lima tingkat effort memungkinkan pengoptimalan antara biaya, waktu, dan akurasi (S1, S3).

Opus 5 sebagai pusat ekonomi Claude family

Anthropic menempatkan Fable 5 sebagai model dengan highest available capability untuk long-running agents dan deep reasoning. Mythos 5 tetap berada pada limited-availability tier untuk cyber dan biology. Sonnet 5 berada di bawahnya sebagai model scale-oriented untuk coding dan agent workloads. Opus 5 mengisi ruang di tengah: cukup kuat untuk complex agentic coding dan enterprise work, tetapi setengah harga Fable per token (S4, S5).

Model Claude Input per 1M Tokens Output per 1M Tokens Posisi Resmi
Claude Sonnet 5 $2.00 $10.00 Frontier intelligence at scale
Claude Opus 5 $5.00 $25.00 Complex agentic coding & enterprise work
Claude Fable 5 $10.00 $50.00 Highest available capability
Claude Mythos 5 $10.00 $50.00 Limited availability specialized work

Effort ladder membuat test-time compute menjadi keputusan produk

Anthropic telah menawarkan effort controls pada model sebelumnya, tetapi Opus 5 membuatnya lebih sentral. Dokumentasi menyatakan model ini mengubah tambahan effort menjadi hasil yang lebih baik secara lebih konsisten daripada Opus sebelumnya. Default-nya adalah high, bukan max. Rekomendasi resminya juga bukan menaikkan semua workload ke tingkat tertinggi, melainkan memulai dari high, turun ketika quality tetap bertahan, dan naik hanya untuk pekerjaan yang benar-benar menuntutnya (S3, S7).

Ada beberapa konsekuensi teknis utama:

  • Thinking aktif secara default: Request yang berjalan tanpa adaptive thinking pada Opus 4.8 dapat memakai reasoning tokens setelah model ID diganti.
  • max_tokens menjadi shared ceiling: Batas tersebut mencakup thinking dan visible answer, sehingga batas lama dapat memotong jawaban lebih cepat.
  • xhigh dan max memaksa thinking aktif: Menonaktifkan thinking pada dua level tersebut menghasilkan HTTP 400.
  • Lower effort bukan mode buruk: Low dan medium sangat efektif untuk tugas yang membutuhkan latency rendah dan efisiensi biaya.

Kesimpulan

Peluncuran Claude Opus 5 menandai pergeseran penting dalam penggunaan LLM enterprise. Pilihan model kini tidak hanya bergantung pada skor benchmark tertinggi, tetapi juga pada alokasi anggaran compute yang tepat untuk setiap tugas. Dengan fleksibilitas tingkat effort dan kemampuan reasoning adaptif, pengembang dapat menyelaraskan kebutuhan akurasi dengan efisiensi biaya produksi secara lebih presisi.

Artikel terkait

Cisco Antares mengecilkan AI security hingga 350M parameter, tetapi tidak menghapus kebutuhan scanner 15 menit baca Baca selengkapnya Ketika benchmark berubah menjadi insiden nyata: agen OpenAI menembus Hugging Face untuk memperoleh jawaban 13 menit baca Baca selengkapnya Gemini 3.6 Flash: Efisiensi token, biaya output turun 16.7%, dan benchmark agentic 14 menit baca Baca selengkapnya