Anthropic Luncurkan Opus 5 dengan Performa Lebih Baik dan Harga Lebih Murah
Anthropic meluncurkan model bahasa terbaru mereka, Opus 5, yang mengungguli Claude Fable 5 dalam delapan dari tiga belas tolok ukur utama dengan harga setengahnya.
Claude Fable 5 sebelumnya dianggap sebagai lompatan besar dalam kemampuan model bahasa sejak Opus 4.5 pada November 2025, terutama dalam performa agen dan tugas pemrograman. Namun, setelah peluncuran pada 9 Juni 2025, Fable mengalami penghentian sementara internasional selama tiga hari akibat pembatasan ekspor dari Departemen Perdagangan AS.
Model ini kembali tersedia pada 1 Juli, namun pada 22 Juli menjadi sorotan setelah tuduhan dari Gedung Putih terkait penyebaran ilegal oleh sebuah laboratorium di China. Beberapa ahli, termasuk Braden Hancock dari Laude Institute, menyatakan bahwa model sehebat itu tidak mungkin hanya berasal dari distilasi sederhana karena Fable baru dirilis publik pada 1 Juli.
Opus 5 dipatok dengan harga $5 per juta token input dan $25 per juta token output, harga yang sama dengan Opus 4.8 dan setengah dari harga Fable 5. Harga ini juga kompetitif dibandingkan model GPT-5.6 Sol dan Kimi K3 yang lebih mahal.
Dalam pengujian privat pada tugas pemetaan audio ke teks yang sempit, GPT-5.6 Sol berhasil menyamai atau mengungguli Opus 5 di hampir semua tingkat usaha yang diuji. Sol mencatat akurasi 100% pada dua unit, sementara Opus 5 mencapai 100% pada satu unit dan 88,4% pada unit lainnya, dengan akurasi transkripsi lebih tinggi untuk Sol.
Opus 5 mengenakan biaya lebih rendah per token output dibanding Sol dalam harga batch, tetapi biaya per unit lebih tinggi karena menghasilkan 1,5 hingga 2,5 kali lebih banyak token output. Fitur pemikiran adaptif yang aktif secara default dalam Opus 5 menyebabkan biaya per token kurang akurat sebagai indikator biaya per tugas.
Petunjuk migrasi dari Anthropic menyatakan bahwa penggunaan usaha maksimal pada Opus 5 dapat menyebabkan hasil yang menurun dan overthinking pada tugas yang lebih sederhana, termasuk modifikasi yang tidak diperlukan dan perubahan di luar cakupan.
Pengguna pilot eksternal juga melaporkan bahwa usaha yang lebih tinggi kadang membuat performa model memburuk. Selain itu, meskipun Opus 5 lebih akurat 11% dibanding Opus 4.8 pada tolok ukur AA-Omniscience tertutup, tingkat halusinasi meningkat 6%.