Menilai apakah sebuah AI benar-benar dapat ‘merancang’ perangkat lunak membutuhkan lebih dari sekadar teka-teki coding sederhana. Benchmark tradisional sering bergantung pada fungsi terisolasi atau masalah gaya LeetCode, yang gagal menangkap kompleksitas proses debug pada basis kode yang ada atau menganalisis laporan isu di berkas-berkas berbeda [5].
Untuk mengisi kesenjangan ini, industri telah beralih ke benchmark tingkat repositori. Framework ini menguji kemampuan AI untuk menavigasi seluruh basis kode, memahami konteks laporan isu yang dilaporkan, dan menghasilkan patch fungsional untuk menyelesaikannya [S1, S5].
Bagaimana SWE-bench Mensimulasi Teknik Nyata
SWE-bench menilai model bahasa besar (LLM) menggunakan isu perangkat lunak nyata yang dikumpulkan dari GitHub [1]. Proses ini dirancang agar deterministik dan dapat direproduksi. Untuk setiap tugas, benchmark memberikan AI sebuah basis kode dan deskripsi isu spesifik [1].
Untuk memverifikasi solusi, framework menggunakan sinyal “Fail-to-Pass” [3]. Sistem membangun lingkungan Docker di mana tes spesifik gagal sebelum patch diterapkan tetapi lulus setelah perubahan yang diusulkan AI digabungkan [3]. Hal ini memastikan AI sebenarnya menyelesaikan masalah, bukan hanya menulis kode yang terlihat wajar [5].
Meskipun SWE-bench asli hanya berfokus pada 12 repositori Python populer [S3, S4], ekosistem telah meluas. Iterasi terbaru mencakup SWE-bench Verified, yang berisi 500 masalah yang dikonfirmas dapat diselesaikan oleh insinyur manusia [S1, S2], dan SWE-bench Multimodal, yang menguji generalisasi AI dalam domain perangkat lunak visual [S1, S2].
Jebakan Memorisasi dalam Data Publik
Meski berguna, terdapat kelemahan struktural dalam benchmark yang didasarkan pada repositori publik: kontaminasi data [S4, S7]. Karena model frontier dilatih pada potongan besar GitHub, ada probabilitas tinggi bahwa mereka telah melihat bug yang tepat dan pull request yang sesuai yang memperbaikinya selama fase pra-pelatihan mereka [7].
Hal ini menciptakan risiko bahwa model memperoleh skor tinggi bukan karena ia dapat berpikir melalui masalah, tetapi karena ia mengingat solusi yang telah di-memorisasi [7]. Dengan kata lain, model mungkin melakukan pengenalan pola pada arsitektur sumber terbuka yang familiar, bukan menjalankan rekayasa perangkat lunak yang sejati [7].
Real-SWE dan Pengujian Out-of-Distribution
Untuk melawan memorisasi, benchmark Real-SWE diluncurkan pada September 2026 [7]. Tidak seperti pendahulunya, Real-SWE mengambil setiap tugas dari basis kode perusahaan pribadi yang out-of-distribution yang tidak mungkin telah ditemui model selama pelatihan [7].
Tugas-tugas ini mencerminkan lingkungan aktual tempat perusahaan menerapkan agen, seperti platform fintech yang memproses laporan bank atau alat penjualan perusahaan [7]. Sebuah tugas tipikal mungkin mengharuskan agen untuk memperbaiki logika penagihan invoice dengan menyimpulkan cara bisnis tertentu menangani pemajakan pajak hanya berdasarkan kode yang diberikan [7].
Pendekatan ini memaksa AI melakukan inferensi tingkat sistem [7]. Ia harus memahami logika bisnis yang ada dan menghubungkan integrasi yang tepat tanpa bergantung pada pola GitHub yang pernah dilihat sebelumnya [7].
Skalasi ke Kode Perusahaan Multibahasa
Seiring dengan kebutuhan evaluasi yang lebih luas meningkat, framework beralih dari Python. SWE-Bench++ adalah framework otomatis yang dirancang untuk menghasilkan tugas tingkat repositori di seluruh 11 bahasa berbeda [4].
Berbeda dengan kurasi manual, SWE-Bench++ menggunakan alur pemrograman untuk penyusunan sumber dan sintesis lingkungan guna memetik pull request langsung [4]. Ini memungkinkan benchmark untuk mencakup baik perbaikan bug maupun permintaan fitur, memberikan cara yang lebih skalabel untuk menguji cara agen AI menangani keberagaman linguistik dan struktural dari proyek sumber terbuka nyata [4].
Untuk tim yang menilai agen coding, tren jelas: patokan beralih dari ‘bisakah ia menulis fungsi’ menjadi ‘bisakah ia berpikir melalui sistem yang tidak dikenal’ [7].
Sumber
- Overview - SWE-bench
- SWE-bench
- GitHub - SWE-bench/SWE-bench: SWE-bench: Can Language Models Resolve …
- Real-SWE Benchmark: Coding Agents on Real Company Code - explainx.ai
- SWE-Bench++: A Framework for the Scalable Generation of Software …
- SWE-bench: A Comprehensive Review of its Fundamentals, Methodology …
- Awesome LLM SWE Research - GitHub
- Swe-bench: Can Language Models Resolve Real-world Github Issues?