• Tanggal Publikasikan
    Juli 13, 2026
  • Bagikan
Ekran Resmi 2026-07-10 15.13.39.png

Ringkasan Eksekutif

Membangun sistem Text-to-SQL yang siap produksi membutuhkan lebih dari sekadar menghasilkan SQL dengan model bahasa yang besar. Aplikasi perusahaan membutuhkan pemahaman skema yang akurat, pengambilan konteks, validasi, dan koreksi kesalahan untuk menghasilkan hasil yang andal pada basis data yang belum pernah dilihat sebelumnya.

Dalam studi ini, kami melakukan benchmark Data Agent kami pada Spider 1.0 dan mencapai Akurasi Eksekusi 88.15% menggunakan model Gemma 4 26B . Alih-alih hanya berfokus pada skor benchmark, artikel ini membahas keputusan arsitektur, pelajaran rekayasa, dan wawasan benchmarking di balik hasil tersebut.

Melampaui Generasi SQL

Melampaui Generasi SQL

Model bahasa yang besar telah secara signifikan meningkatkan pembuatan SQL, tetapi membangun sistem Text-to-SQL yang siap produksi membutuhkan lebih dari sekadar menerjemahkan bahasa alami ke dalam SQL. Aplikasi perusahaan harus memahami skema basis data yang kompleks, mengambil konteks yang tepat, memvalidasi kueri yang dihasilkan, dan menghasilkan hasil yang andal pada basis data yang belum pernah mereka lihat sebelumnya.

Untuk mengevaluasi kemampuan ini, kami melakukan benchmark Data Agent kami pada Spider 1.0, benchmark Text-to-SQL yang paling banyak digunakan. Dengan menggunakan model Gemma 4 26B , sistem kami mencapai Akurasi Eksekusi 88.15% , yang menunjukkan bahwa arsitektur dan manajemen konteks sama pentingnya dengan pemilihan model.

Mengapa Spider 1.0?

Memilih tolok ukur yang tepat sama pentingnya dengan memilih model yang tepat. Meskipun kumpulan data yang lebih baru seperti Spider 2.0 dan BIRD memperkenalkan skenario perusahaan yang lebih kompleks, Spider 1.0 tetap menjadi tolok ukur yang paling banyak diadopsi untuk mengevaluasi sistem Text-to-SQL dan membandingkan hasilnya di berbagai literatur.

Ekran Resmi 2026-07-13 15.13.56.png

Untuk evaluasi awal kami, kami memilih Spider 1.0 karena menyediakan tolok ukur yang terstandarisasi dan mapan. Ini memungkinkan kami untuk mengukur seberapa efektif Agen Data kami memahami skema basis data yang belum pernah dilihat sebelumnya dan menghasilkan SQL yang benar dalam kondisi realistis.

Gambar 2 merangkum perbandingan Spider 1.0 dengan benchmark Text-to-SQL lain yang umum digunakan.

Membangun Agen Data

Mencapai akurasi Text-to-SQL yang tinggi bukan hanya soal menggunakan model bahasa yang lebih besar. Sepanjang proses benchmarking kami, kami menemukan bahwa arsitektur dan manajemen konteks memiliki dampak yang lebih besar pada kinerja daripada pemilihan model saja.

Ekran Resmi 2026-07-10 15.31.28.png

Agen Data kami dirancang sebagai alur kerja multi-tahap yang secara progresif mempersempit masalah sebelum meminta LLM untuk menghasilkan SQL. Alih-alih mengekspos seluruh skema basis data ke model, sistem pertama-tama hanya mengambil skema dan informasi kontekstual yang relevan, kemudian menghasilkan kueri SQL, memvalidasi hasilnya, dan secara otomatis memperbaiki kesalahan umum sebelum dieksekusi.

Seperti yang diilustrasikan pada Gambar 3 , arsitektur tersebut terdiri dari tiga tahap utama:

  • Pengambilan Informasi – Pertanyaan pengguna dianalisis untuk mengidentifikasi objek basis data yang relevan, dan hanya informasi skema yang diperlukan yang diambil dari penyimpanan metadata.
  • Agen Pemurnian Diri – Model bahasa menghasilkan SQL, memvalidasi kueri terhadap skema yang diambil, dan secara otomatis memperbaikinya setiap kali validasi gagal.
  • Eksekusi & Respons – Setelah divalidasi, kueri SQL dieksekusi terhadap basis data target, dan hasilnya dikembalikan sebagai data terstruktur atau respons bahasa alami.

Arsitektur berorientasi produksi ini terinspirasi oleh ide-ide yang diperkenalkan dalam DIN-SQL dan DAIL-SQL , sekaligus diadaptasi untuk lingkungan perusahaan di mana keandalan, kemampuan menjelaskan, dan kekokohan sama pentingnya dengan akurasi tolok ukur.

Perjalanan Pembandingan Kinerja Kami

Ekran Resmi 2026-07-10 15.32.47.png

Memilih model bahasa yang tepat merupakan bagian penting dari proses benchmarking kami. Alih-alih mengevaluasi satu model saja, kami bereksperimen dengan berbagai macam LLM sumber terbuka, termasuk Llama 3.1, Qwen 2.5, DeepSeek, SQLCoder, CodeGemma, Mistral, GPT-OSS, dan Gemma 4.

Untuk memastikan perbandingan yang adil, kami mengevaluasi setiap model menggunakan Akurasi Eksekusi (EA) , metrik standar untuk benchmarking Text-to-SQL. Tidak seperti metrik berbasis sintaksis, Akurasi Eksekusi mengukur apakah SQL yang dihasilkan mengembalikan hasil yang sama dengan kueri referensi, menjadikannya indikator kinerja dunia nyata yang lebih baik.

Perjalanan benchmarking kami diilustrasikan pada Gambar 4. Kami memulai dengan bereksperimen pada workstation lokal yang dilengkapi dengan RTX 4060 (8 GB VRAM) , di mana model yang lebih kecil memungkinkan kami untuk melakukan iterasi dengan cepat dan memvalidasi pipeline kami. Setelah menetapkan baseline yang stabil menggunakan subset 233 pertanyaan Spider 1.0, kami beralih ke GPU cloud untuk mengevaluasi model yang lebih besar pada benchmark lengkap yang terdiri dari 2,147 pertanyaan . Pendekatan bertahap ini memungkinkan kami untuk mengoptimalkan arsitektur secara efisien sebelum berinvestasi dalam menjalankan benchmark skala besar.

Kami mengevaluasi model akhir pada pembagian data uji Spider 1.0 lengkap yang berisi 2,147 pertanyaan. Seperti yang ditunjukkan pada Tabel 1, Gemma 4 26B mencapai skor tertinggi (88.15%), diikuti oleh GPT-OSS 20B (86.63%). Hasil ini menunjukkan bahwa LLM sumber terbuka modern, bila dikombinasikan dengan alur kerja pengambilan dan validasi yang efektif, dapat mencapai kinerja Text-to-SQL yang sangat kompetitif. 

Ekran Resmi 2026-07-13 15.15.08.png

 

Bagaimana Perbandingan Hasil-hasil Ini?

Skor benchmark hanya bermakna jika dapat dibandingkan dengan karya yang telah dipublikasikan sebelumnya. Untuk lebih memahami signifikansi hasil kami, kami meninjau studi Text-to-SQL terbaru dan makalah benchmark yang banyak dirujuk.

Ekran Resmi 2026-07-13 13.07.55.png

Tabel 2: Tingkat akurasi model sumber tertutup yang dilaporkan dalam studi SQL-of-Thought pada subset dataset Spider; secara komparatif, hasil 88.15% yang diperoleh dalam penelitian ini berada di atas GPT-4o Mini (87%) dan mendekati GPT-5 (89%).

Penelitian terbaru seperti SQL-of-Thought [1] melaporkan bahwa model sumber tertutup terkemuka—termasuk Claude Opus 3, GPT-5, dan GPT-4o Mini —mencapai akurasi tinggi pada subset benchmark Spider. Meskipun perbandingan langsung harus ditafsirkan dengan hati-hati karena perbedaan dalam pengaturan evaluasi, perintah, dan subset benchmark, Akurasi Eksekusi 88.15% kami menunjukkan bahwa model sumber terbuka dapat mencapai kinerja dalam kisaran kompetitif yang sama.

Meskipun hasil ini berasal dari pengaturan evaluasi yang berbeda dan tidak boleh dibandingkan secara langsung, hasil ini memberikan konteks yang berguna untuk memahami lanskap kinerja sistem Text-to-SQL saat ini. Tolok ukur kami menunjukkan bahwa model sumber terbuka kini dapat bersaing dengan alternatif sumber tertutup terkemuka jika dikombinasikan dengan arsitektur yang dirancang dengan baik.

Ekran Resmi 2026-07-13 15.17.45.png

Kami juga membandingkan hasil kami dengan kerangka kerja Text-to-SQL yang berorientasi produksi seperti DIN-SQL [3] dan DAIL-SQL , yang menggabungkan model bahasa besar dengan teknik termasuk penautan skema, rekayasa prompt, konsistensi diri, dan koreksi kesalahan.

Ekran Resmi 2026-07-13 13.10.44.png

Tabel 3: Hasil Akurasi Eksekusi dari berbagai metode pada Spider 1.0 dalam studi "Text-to-SQL Empowered by Large Language Models: A Benchmark Evaluation" [2]; hal ini menunjukkan dampak pada akurasi tidak hanya dari pemilihan model tetapi juga dari teknik seperti rekayasa prompt, penautan skema, dan konsistensi diri.

Temuan kami memperkuat kesimpulan yang umum di literatur terkini: kinerja Text-to-SQL yang tinggi tidak hanya bergantung pada model bahasa, tetapi juga pada arsitektur di sekitarnya. Pengambilan skema yang efektif, manajemen konteks, validasi, dan koreksi diri seringkali sama pentingnya dengan model itu sendiri.

Apa yang Kami Pelajari

Benchmarking bukan hanya tentang mengukur akurasi—tetapi juga tentang memahami di mana dan mengapa suatu sistem gagal. Sepanjang evaluasi kami, kami menganalisis prediksi yang salah dan mengidentifikasi beberapa pola berulang yang memengaruhi skor akhir.

Beberapa kesalahan berasal dari benchmark itu sendiri. Dalam sejumlah kecil kasus, inkonsistensi dalam kueri SQL referensi (emas) menyebabkan prediksi yang secara logis benar ditandai sebagai salah. Kasus lain melibatkan pertanyaan bahasa alami yang ambigu atau skenario pemecahan kebuntuan, di mana beberapa kueri SQL dapat secara sah menghasilkan jawaban yang sama validnya.

Kami juga mengamati beberapa perilaku spesifik model, termasuk konversi tipe yang tidak perlu, penanganan sensitivitas huruf besar/kecil yang tidak konsisten, dan terkadang kerumitan yang berlebihan pada kueri SQL yang sebenarnya sederhana. Temuan ini memperkuat pentingnya memasukkan mekanisme validasi dan koreksi diri ke dalam alur kerja Data Agent.

Secara keseluruhan, analisis kami menunjukkan bahwa banyak kesalahan yang tersisa bukan disebabkan oleh keterbatasan model bahasa itu sendiri, tetapi oleh ambiguitas dalam benchmark atau kasus-kasus khusus dalam pembuatan SQL. Hal ini menunjukkan bahwa peningkatan lebih lanjut dalam pengambilan, validasi, dan manajemen konteks dapat mendorong sistem melampaui ambang batas Akurasi Eksekusi 90%.

Biaya dan Efisiensi

Akurasi tinggi hanyalah salah satu aspek dari sistem Text-to-SQL yang siap produksi. Di lingkungan perusahaan, biaya infrastruktur, privasi data, dan fleksibilitas penerapan sama pentingnya sebagai pertimbangan utama.

Salah satu keunggulan utama pendekatan kami adalah sepenuhnya bergantung pada model bahasa sumber terbuka. Sepanjang proses pengembangan, kami dapat melakukan sebagian besar eksperimen secara lokal menggunakan RTX 4060 kelas konsumen (8 GB VRAM) , memungkinkan kami untuk melakukan iterasi dengan cepat tanpa menimbulkan biaya API atau token apa pun. Pengujian benchmark yang lebih besar kemudian dijalankan pada GPU cloud khusus hanya setelah arsitektur divalidasi.

Kami menggunakan RunPod Secure Cloud untuk evaluasi Spider 1.0 secara penuh. Benchmark Gemma 4 26B dijalankan pada GPU A100 PCIe 80 GB, sedangkan GPT-OSS 20B dijalankan pada GPU RTX 6000 48 GB.

Biaya infrastruktur dirangkum dalam Tabel 4.

Ekran Resmi 2026-07-13 13.11.54.png

Meskipun pengujian benchmark terbesar membutuhkan infrastruktur cloud, keseluruhan proses pengembangan tetap hemat biaya berkat eksperimen lokal dan model open-source. Lebih penting lagi, arsitektur yang dihasilkan dapat diterapkan sepenuhnya dalam infrastruktur internal organisasi, menghilangkan ketergantungan pada API eksternal sekaligus memberikan kendali yang lebih besar atas privasi data, kepatuhan, dan biaya operasional.

Hal ini menjadikan arsitektur tersebut sangat cocok untuk organisasi yang beroperasi di lingkungan yang sensitif terhadap privasi, teregulasi, atau terisolasi dari jaringan internet (air-gapped), di mana keamanan data dan fleksibilitas penerapan merupakan persyaratan penting.

Melampaui Spider 1.0

Benchmark memberikan cara objektif untuk mengevaluasi sistem AI, tetapi bukan tujuan utama. Skor benchmark yang tinggi hanya berharga jika diterjemahkan ke dalam kinerja yang andal dalam aplikasi dunia nyata.

Sepanjang studi ini, kami menemukan bahwa membangun sistem Text-to-SQL yang siap produksi jauh lebih dari sekadar menghasilkan SQL. Memahami skema basis data, mengambil konteks yang tepat, memvalidasi kueri yang dihasilkan, dan memperbaiki keluaran yang salah terbukti sama pentingnya dengan model bahasa itu sendiri.

Akurasi Eksekusi 88.15% kami pada Spider 1.0 menunjukkan bahwa model sumber terbuka, dikombinasikan dengan arsitektur yang dirancang dengan baik, dapat memberikan kinerja yang sangat kompetitif untuk tugas Text-to-SQL perusahaan. Lebih penting lagi, ini memvalidasi prinsip-prinsip desain di balik Agen Data kami , yang dibangun untuk beroperasi secara andal pada basis data perusahaan yang kompleks, bukan hanya pada kumpulan data benchmark.

Spider 1.0 merupakan tonggak penting, tetapi ini hanyalah awal dari perjalanan kami. Langkah selanjutnya meliputi evaluasi Data Agent pada Spider 2.0 , tolok ukur skala perusahaan yang lebih besar, dan yang terpenting, lingkungan pelanggan nyata di mana skema basis data jauh lebih besar dan pertanyaan bisnis jauh lebih kompleks.

Visi jangka panjang kami bukan sekadar membangun generator SQL yang lebih baik. Kami bertujuan untuk membangun Agen Data cerdas yang memungkinkan organisasi berinteraksi dengan data perusahaan senatural mungkin seperti berkomunikasi dengan kolega—menggabungkan pengambilan, penalaran, validasi, dan AI yang dapat dijelaskan ke dalam platform pendukung keputusan yang andal.

Pelajaran Kunci

Benchmarking bukan hanya tentang mengukur akurasi—tetapi juga tentang memahami mengapa suatu sistem berhasil atau gagal.

Sepanjang evaluasi kami, kami mengidentifikasi beberapa pola kesalahan yang berulang. Beberapa berasal dari ambiguitas dalam benchmark itu sendiri, termasuk inkonsistensi dalam kueri SQL referensi dan kondisi pengurutan yang kurang spesifik. Yang lainnya mencerminkan perilaku LLM umum, seperti konversi tipe yang tidak perlu atau penanganan nilai peka huruf besar/kecil yang tidak konsisten.

Pengamatan ini memperkuat salah satu temuan utama dari penelitian kami: arsitektur sama pentingnya dengan pemilihan model. Pengambilan data, penautan skema, validasi, dan koreksi diri sama pentingnya dengan model bahasa yang mendasarinya dalam hal kinerja akhir.

Meskipun keterbatasan tolok ukur pasti memengaruhi skor akhir, analisis kami menunjukkan bahwa peningkatan lebih lanjut dalam manajemen konteks dan validasi dapat mendorong sistem melampaui angka Akurasi Eksekusi 90%.

Menatap ke Depan

Spider 1.0 memberikan dasar penting untuk mengevaluasi Agen Data kami, tetapi ini hanya merupakan langkah pertama menuju AI perusahaan yang siap produksi.

Fokus kami selanjutnya adalah mengevaluasi arsitektur pada benchmark yang lebih menantang seperti Spider 2.0 dan, yang lebih penting, pada basis data perusahaan nyata di mana skema jauh lebih besar, dokumentasi seringkali tidak lengkap, dan pertanyaan bisnis jauh lebih kompleks.

Tujuan kami bukan sekadar membangun sistem Text-to-SQL lainnya. Kami membangun Agen Data cerdas yang menggabungkan pengambilan, penalaran, validasi, dan kemampuan menjelaskan untuk membantu organisasi berinteraksi dengan data perusahaan secara alami dan andal.

Ekran Resmi 2026-07-10 15.41.38.png

Referensi

[1] Saumya Chaturvedi, Aman Chadha, Laurent Bindschaedler arXiv. “SQL-of-Thought: Multi-agentic Text-to-SQL with Guided Error Correction.” arXiv. Juni 2026 https://arxiv.org/abs/2509.00581

[2] Dawei Gao, Haibin Wang, Yaliang Li, Xiuyu Sun, Yichen Qian, Bolin Ding, Jingren Zhou “Teks-ke-SQL Diberdayakan oleh Model Bahasa Besar: Evaluasi Tolok Ukur” arXiv. Juni 2026

https://arxiv.org/pdf/2308.15363 

[3] Mohammadreza Pourreza, Davood Rafiei. “DIN-SQL: Pembelajaran Teks-ke-SQL dalam Konteks yang Terurai dengan Koreksi Diri” arXiv. Juni 2026

https://arxiv.org/pdf/2304.11015

 

Dilşen YILDAR HAVAYLAR, 

Insinyur Perangkat Lunak Senior, MSc.