• Megjelenési dátum
    July 13, 2026
  • Megosztás
Ekran Resmi 2026-07-10 15.13.39.png

Összefoglaló

Egy éles üzemre kész szöveg-SQL rendszer felépítése sokkal többet igényel, mint pusztán egy nagyméretű nyelvi modellel generált SQL-kódolást. A vállalati alkalmazások pontos séma-megértést, kontextus-visszakeresést, validálást és hibajavítást igényelnek ahhoz, hogy megbízható eredményeket produkáljanak korábban nem látott adatbázisokon.

Ebben a tanulmányban összehasonlítjuk a Adatügynök on Pók 1.0 és elérni 88.15%-os végrehajtási pontosság használatával Gemma 4 26B modell. Ahelyett, hogy kizárólag a benchmark pontszámokra összpontosítana, ez a cikk bemutatja az eredmények mögött rejlő építészeti döntéseket, mérnöki tanulságokat és benchmark elemzési meglátásokat.

Az SQL-generáláson túl

Az SQL-generáláson túl

A nagy nyelvi modellek jelentősen javították az SQL-generálást, de egy éles használatra kész szöveg-SQL rendszer felépítése sokkal többet igényel, mint a természetes nyelv SQL-re fordítása. A vállalati alkalmazásoknak meg kell érteniük az összetett adatbázis-sémákat, le kell kérniük a megfelelő kontextust, validálniuk kell a generált lekérdezéseket, és megbízható eredményeket kell produkálniuk olyan adatbázisokon, amelyeket korábban még nem láttak.

Ezen képességek értékeléséhez összehasonlító elemzést végeztünk Adatügynök a Spider 1.0-n, a legszélesebb körben használt Text-to-SQL benchmarkon. A Gemma 4 26B modell, a rendszerünk elérte 88.15%-os végrehajtási pontosság, ami azt mutatja, hogy az architektúra és a kontextuskezelés ugyanolyan fontos, mint a modellkiválasztás.

Miért a Pók 1.0?

A megfelelő benchmark kiválasztása ugyanolyan fontos, mint a megfelelő modell kiválasztása. Míg az újabb adatkészletek, mint például a Spider 2.0 és a BIRD, összetettebb vállalati forgatókönyveket vezetnek be, a Spider 1.0 továbbra is a legszélesebb körben elterjedt benchmark a Text-to-SQL rendszerek értékeléséhez és az eredmények összehasonlításához a szakirodalomban.

Ekran Resmi 2026-07-13 15.13.56.png

Kezdeti értékelésünkhöz a Spider 1.0-t választottuk, mert szabványosított és jól bevált alapot biztosít. Lehetővé teszi számunkra, hogy mérjük, mennyire hatékonyan érti meg az adatügynökünk a korábban nem látott adatbázis-sémákat, és generál helyes SQL-kódot valós körülmények között.

A 2. ábra összefoglalja, hogyan viszonyul a Spider 1.0 más, gyakran használt Text-to-SQL benchmarkokhoz.

Az adatügynök felépítése

A magas Text-to-SQL pontosság elérése nem egyszerűen egy nagyobb nyelvi modell használatáról szól. A benchmarking folyamat során azt tapasztaltuk, hogy az architektúra és a kontextuskezelés nagyobb hatással volt a teljesítményre, mint önmagában a modell kiválasztása.

Ekran Resmi 2026-07-10 15.31.28.png

termékeink Adatügynök többlépcsős folyamatként van kialakítva, amely fokozatosan szűkíti a problémát, mielőtt felkérné az LLM-et az SQL generálására. A teljes adatbázis-séma modellnek való kitétele helyett a rendszer először csak a releváns sémát és a kontextuális információkat kéri le, majd generál egy SQL-lekérdezést, validálja az eredményt, és a végrehajtás előtt automatikusan kijavítja a gyakori hibákat.

Amint az a ábra 3, az architektúra három fő szakaszból áll:

  • Információszerzés – A felhasználó kérdését elemzi a rendszer a releváns adatbázis-objektumok azonosítása érdekében, és csak a szükséges sémainformációkat kéri le a metaadat-tárolóból.
  • Önfinomító szer – A nyelvi modell SQL-t generál, érvényesíti a lekérdezést a lekérdezett sémával szemben, és automatikusan finomítja azt, ha az érvényesítés sikertelen.
  • Végrehajtás és válasz – Az érvényesítést követően a rendszer végrehajtja az SQL lekérdezést a céladatbázison, és az eredményeket strukturált adatként vagy természetes nyelvű válaszként adja vissza.

Ez a termelésorientált architektúra a ...-ban bevezetett ötletekből merít ihletet. DIN-SQL és a DAIL-SQL, miközben olyan vállalati környezetekhez igazodik, ahol a megbízhatóság, a magyarázhatóság és a robusztusság ugyanolyan fontos, mint a referenciaértékek pontossága.

Benchmarking utunk

Ekran Resmi 2026-07-10 15.32.47.png

A megfelelő nyelvi modell kiválasztása fontos része volt a benchmarking folyamatunknak. Egyetlen modell értékelése helyett számos nyílt forráskódú LLM-mel kísérleteztünk, beleértve a következőket: Llama 3.1, Qwen 2.5, DeepSeek, SQLCoder, CodeGemma, Mistral, GPT-OSS, és a Gemma 4.

A korrekt összehasonlítás érdekében minden modellt a következő módszerrel értékeltünk: Végrehajtási pontosság (EA), a szövegből SQL-be ​​konvertálás standard mérőszáma. A szintaxis alapú mérőszámokkal ellentétben a végrehajtási pontosság azt méri, hogy a generált SQL ugyanazt az eredményt adja-e vissza, mint a referencia lekérdezés, így jobban jelzi a valós teljesítményt.

A benchmarking folyamatunkat az alábbiakban szemléltetjük ábra 4Egy helyi munkaállomáson kezdtük a kísérletezést, amely egy RTX 4060 (8 GB VRAM), ahol a kisebb modellek lehetővé tették számunkra a gyors iterációt és a folyamat validálását. Miután egy részhalmaz segítségével stabil alapvonalat hoztunk létre 233 Pók 1.0 kérdés, felhőalapú GPU-kra váltottunk, hogy nagyobb modelleket értékelhessünk a teljes rendszeren 2,147 kérdés benchmark. Ez a szakaszos megközelítés lehetővé tette számunkra, hogy hatékonyan optimalizáljuk az architektúrát, mielőtt nagyszabású benchmark futtatásokba fektetnénk be.

A végső modelleket a teljes Spider 1.0 tesztrészen, 2,147 kérdéssel értékeltük. Amint az 1. táblázatban látható, a Gemma 4 26B érte el a legmagasabb pontszámot (88.15%), ezt követte a GPT-OSS 20B (86.63%). Ezek az eredmények azt mutatják, hogy a modern, nyílt forráskódú LLM-ek, hatékony visszakeresési és validációs folyamattal kombinálva, rendkívül versenyképes Text-to-SQL teljesítményt érhetnek el. 

Ekran Resmi 2026-07-13 15.15.08.png

 

Hogyan viszonyulnak ezek az eredmények?

A benchmark pontszámok csak akkor értelmesek, ha összehasonlíthatók korábban publikált munkákkal. Eredményeink jelentőségének jobb megértése érdekében áttekintettük mind a legújabb Text-to-SQL tanulmányokat, mind a széles körben hivatkozott benchmark cikkeket.

Ekran Resmi 2026-07-13 13.07.55.png

2. táblázat: A zárt forráskódú modellek pontossági arányai, amelyeket az SQL-of-Thought tanulmány jelentett a Spider adathalmaz egy részhalmazán; összehasonlító értelemben véve azt mutatja, hogy az ebben a munkában elért 88.15%-os eredmény a GPT-4o Mini (87%) felett és a GPT-5 (89%) szintjéhez közel helyezkedik el.

Legújabb munkái, mint például Gondolat SQL-je [1] arról számol be, hogy a vezető zárt forráskódú modellek – beleértve a Claude Opus 3, GPT-5, és a GPT-4o Mini—nagy pontosságot érjenek el a Spider benchmark részhalmazain. Bár a közvetlen összehasonlításokat óvatosan kell értelmezni az értékelési beállítások, a promptok és a benchmark részhalmazok közötti különbségek miatt, a mi… 88.15%-os végrehajtási pontosság azt mutatja, hogy a nyílt forráskódú modellek is képesek hasonló teljesítményt nyújtani a versenytartományban.

Bár ezek az eredmények különböző értékelési környezetekből származnak, és nem szabad közvetlenül összehasonlítani őket, hasznos kontextust nyújtanak a Text-to-SQL rendszerek jelenlegi teljesítménykörnyezetének megértéséhez. Benchmarkunk azt mutatja, hogy a nyílt forráskódú modellek ma már képesek versenyezni a vezető zárt forráskódú alternatívákkal, ha egy jól megtervezett architektúrával kombinálják őket.

Ekran Resmi 2026-07-13 15.17.45.png

Eredményeinket összehasonlítottuk olyan termelési környezetben is elérhető Text-to-SQL keretrendszerekkel, mint például a DIN-SQL[3] és DAIL-SQL, amely a nagy nyelvi modelleket olyan technikákkal ötvözi, mint a sémaösszekapcsolás, a gyors tervezés, az önkonzisztencia és a hibajavítás.

Ekran Resmi 2026-07-13 13.10.44.png

3. táblázat: A Spider 1.0-n alkalmazott különböző módszerek végrehajtási pontossági eredményei a „Text-to-SQL Empowered by Large Language Models: A Benchmark Evaluation” [2] tanulmányban; a táblázat nemcsak a modellválasztás, hanem olyan technikák pontosságra gyakorolt ​​hatását is feltárja, mint a prompt engineering, a sémaösszekapcsolás és az önkonzisztencia.

Eredményeink megerősítik a legújabb szakirodalomban elterjedt következtetést: A Text-to-SQL teljesítmény magas szintje nemcsak a nyelvi modelltől, hanem a környező architektúrától is függ. A hatékony séma-visszakeresés, a kontextuskezelés, az validáció és az önkorrekció gyakran ugyanolyan fontos, mint maga a modell.

Amit megtanultunk

A benchmarking nemcsak a pontosság méréséről szól, hanem annak megértéséről is, hogy egy rendszer hol és miért hibázik. Az értékelés során elemeztük a helytelen előrejelzéseket, és számos ismétlődő mintázatot azonosítottunk, amelyek befolyásolták a végeredményeket.

Néhány hiba magából a benchmarkból eredt. Néhány esetben a referencia (arany) SQL-lekérdezésekben található inkonzisztenciák miatt logikailag helyes predikciókat helytelenként jelöltek meg. Más esetekben kétértelmű természetes nyelvi kérdések vagy döntetlen-elhárító forgatókönyvek voltak, ahol több SQL-lekérdezés is eredményezhetett volna egyenlően érvényes válaszokat.

Számos modellspecifikus viselkedést is megfigyeltünk, beleértve a szükségtelen típuskonverziókat, a kis- és nagybetűk közötti különbségek következetlen kezelését, valamint az egyébként egyszerű SQL lekérdezések esetenkénti túlbonyolítását. Ezek a megállapítások megerősítették az érvényesítési és önkorrekciós mechanizmusok beépítésének fontosságát az adatügynök-folyamatba.

Összességében az elemzésünk kimutatta, hogy a fennmaradó hibák nagy részét nem magának a nyelvi modellnek a korlátai, hanem az SQL generálásának benchmark vagy él-eseteinek kétértelműségei okozták. Ez arra utal, hogy a visszakeresés, az validáció és a kontextuskezelés további fejlesztései a rendszert a meglévő határokon túlra is kiterjeszthetik. 90%-os végrehajtási pontosság küszöb.

Költség és Hatékonyság

A nagy pontosság csak egy szempont egy éles üzembe helyezhető szöveg-SQL rendszernél. Vállalati környezetekben az infrastruktúra költségei, az adatvédelem és a telepítési rugalmasság ugyanolyan fontos szempontok.

Megközelítésünk egyik fő előnye, hogy teljes mértékben támaszkodik nyílt forráskódú nyelvi modellek. A fejlesztési folyamat során a legtöbb kísérletet helyben, fogyasztói szintű szoftverrel tudtuk elvégezni. RTX 4060 (8 GB VRAM), lehetővé téve számunkra a gyors iterációt API- vagy tokenköltségek nélkül. A nagyobb benchmark futtatásokat ezután csak az architektúra validálása után hajtották végre dedikált felhőalapú GPU-kon.

A Spider 1.0 teljes körű kiértékeléséhez a RunPod Secure Cloud programot használtuk. A Gemma 4 26B benchmarkot egy A100 PCIe 80 GB-os GPU, míg GPT-OSS 20B futott egy RTX 6000 48 GB-os GPU.

Az infrastrukturális költségeket a következő táblázat foglalja össze: Táblázat 4.

Ekran Resmi 2026-07-13 13.11.54.png

Bár a legnagyobb benchmark futtatásokhoz felhőalapú infrastruktúrára volt szükség, a teljes fejlesztési folyamat költséghatékony maradt a helyi kísérletezésnek és a nyílt forráskódú modelleknek köszönhetően. Ami még fontosabb, az így létrejövő architektúra teljes egészében a szervezet saját infrastruktúráján belül telepíthető, kiküszöbölve a külső API-któl való függőséget, miközben nagyobb kontrollt biztosít az adatvédelem, a megfelelőség és az üzemeltetési költségek felett.

Ezáltal az architektúra különösen jól alkalmazható az adatvédelmi szempontból érzékeny, szabályozott vagy légréses környezetben működő szervezetek számára, ahol az adatbiztonság és a telepítési rugalmasság kritikus követelmény.

A Pókon túl 1.0

A benchmarkok objektív módot kínálnak a mesterséges intelligencia rendszerek értékelésére, de nem ezek a végső cél. Egy magas benchmark pontszám csak akkor értékes, ha megbízható teljesítményt nyújt valós alkalmazásokban.

A tanulmány során azt tapasztaltuk, hogy egy éles üzembe helyezhető Text-to-SQL rendszer felépítése sokkal több, mint SQL generálása. Az adatbázis-sémák megértése, a megfelelő kontextus lekérése, a generált lekérdezések validálása és a helytelen kimenetek finomítása ugyanolyan fontosnak bizonyult, mint maga a nyelvi modell.

termékeink 88.15%-os végrehajtási pontosság A Spider 1.0-n végzett kutatás azt mutatja, hogy a nyílt forráskódú modellek egy jól megtervezett architektúrával kombinálva rendkívül versenyképes teljesítményt nyújthatnak vállalati Text-to-SQL feladatokhoz. Ami még fontosabb, igazolja a mögöttünk álló tervezési elveket. Adatügynök, amelyet úgy terveztek, hogy megbízhatóan működjön összetett vállalati adatbázisokon, ne csak benchmark adatkészleteken.

A Spider 1.0 fontos mérföldkövet jelent, de ez csak az utunk kezdete. Következő lépéseink közé tartozik az Adatügynök kiértékelése a következőn: Pók 2.0, nagyobb, vállalati szintű benchmarkok, és ami a legfontosabb, valós ügyfélkörnyezetek, ahol az adatbázissémák jelentősen nagyobbak, az üzleti kérdések pedig sokkal összetettebbek.

Hosszú távú jövőképünk nem csupán egy jobb SQL-generátor létrehozása. Célunk intelligens adatügynökök létrehozása, amelyek lehetővé teszik a szervezetek számára, hogy ugyanolyan természetesen kommunikáljanak a vállalati adatokkal, mint egy kollégájukkal – a visszakeresést, az érvelést, a validálást és a magyarázható mesterséges intelligenciát egy megbízható döntéstámogató platformmá ötvözve.

Kulcsfontosságú leckék

A benchmarking nem csak a pontosság méréséről szól, hanem annak megértéséről is, hogy egy rendszer miért sikeres vagy kudarcot vall.

Az értékelésünk során számos visszatérő hibamintát azonosítottunk. Néhány a benchmarkban található kétértelműségekből eredt, beleértve a referencia SQL lekérdezések következetlenségeit és az aluldefiniált rendezési feltételeket. Mások az LLM gyakori viselkedéseit tükrözték, például a szükségtelen típusátalakítást vagy a kis- és nagybetűérzékeny értékek következetlen kezelését.

Ezek a megfigyelések megerősítették munkánk egyik központi megállapítását: Az architektúra ugyanolyan fontos, mint a modellválasztás. A visszakeresés, a sémacsatolás, az validáció és az önkorrekció ugyanolyan mértékben járult hozzá a végső teljesítményhez, mint az alapul szolgáló nyelvi modell.

Bár a referenciaértékek korlátai elkerülhetetlenül befolyásolják a végső pontszámot, elemzésünk azt sugallja, hogy a kontextuskezelés és -validáció további fejlesztései a rendszert a meglévő határokon túlra is kiterjeszthetik. 90%-os végrehajtási pontossági jel.

Előretekintve

A Spider 1.0 fontos alapot biztosított az adatügynökünk értékeléséhez, de ez csak az első lépést jelenti a termelésre kész vállalati mesterséges intelligencia felé.

Következő fókuszunk az architektúra értékelése lesz olyan kihívást jelentő referenciaértékeken, mint például Pók 2.0 és ami még fontosabb, valós vállalati adatbázisokon, ahol a sémák jelentősen nagyobbak, a dokumentáció gyakran hiányos, az üzleti kérdések pedig sokkal összetettebbek.

A célunk nem egyszerűen egy újabb szöveg-SQL rendszer létrehozása. Intelligens rendszereket építünk. Adatügynökök amelyek ötvözik a visszakeresést, az érvelést, az érvényesítést és a magyarázhatóságot, hogy segítsék a szervezeteket a vállalati adatokkal való természetes és megbízható interakcióban.

Ekran Resmi 2026-07-10 15.41.38.png

Referenciák

[1] Saumya Chaturvedi, Aman Chadha, Laurent Bindschaedler, arXiv. „SQL-a-Gondolat: Többágenses szöveg-SQL átalakítás irányított hibajavítással.” arXiv. 2026. június https://arxiv.org/abs/2509.00581

[2] Dawei Gao, Haibin Wang, Yaliang Li, Xiuyu Sun, Yichen Qian, Bolin Ding, Jingren Zhou „Szöveg-SQL-re a nagy nyelvi modellek által felhatalmazott: A benchmark értékelés” arXiv. június 2026

https://arxiv.org/pdf/2308.15363 

[3] Mohammadreza Pourreza, Davood Rafiei. „DIN-SQL: Text-to-SQL dekompozíciós, kontextuson belüli tanulása önkorrekcióval” arXiv. 2026. június

https://arxiv.org/pdf/2304.11015

 

Dilşen YILDAR HAVAYLAR, 

vezető szoftvermérnök, okl.