A benchmarkok objektív módot kínálnak a mesterséges intelligencia rendszerek értékelésére, de nem ezek a végső cél. Egy magas benchmark pontszám csak akkor értékes, ha megbízható teljesítményt nyújt valós alkalmazásokban.
A tanulmány során azt tapasztaltuk, hogy egy éles üzembe helyezhető Text-to-SQL rendszer felépítése sokkal több, mint SQL generálása. Az adatbázis-sémák megértése, a megfelelő kontextus lekérése, a generált lekérdezések validálása és a helytelen kimenetek finomítása ugyanolyan fontosnak bizonyult, mint maga a nyelvi modell.
termékeink 88.15%-os végrehajtási pontosság A Spider 1.0-n végzett kutatás azt mutatja, hogy a nyílt forráskódú modellek egy jól megtervezett architektúrával kombinálva rendkívül versenyképes teljesítményt nyújthatnak vállalati Text-to-SQL feladatokhoz. Ami még fontosabb, igazolja a mögöttünk álló tervezési elveket. Adatügynök, amelyet úgy terveztek, hogy megbízhatóan működjön összetett vállalati adatbázisokon, ne csak benchmark adatkészleteken.
A Spider 1.0 fontos mérföldkövet jelent, de ez csak az utunk kezdete. Következő lépéseink közé tartozik az Adatügynök kiértékelése a következőn: Pók 2.0, nagyobb, vállalati szintű benchmarkok, és ami a legfontosabb, valós ügyfélkörnyezetek, ahol az adatbázissémák jelentősen nagyobbak, az üzleti kérdések pedig sokkal összetettebbek.
Hosszú távú jövőképünk nem csupán egy jobb SQL-generátor létrehozása. Célunk intelligens adatügynökök létrehozása, amelyek lehetővé teszik a szervezetek számára, hogy ugyanolyan természetesen kommunikáljanak a vállalati adatokkal, mint egy kollégájukkal – a visszakeresést, az érvelést, a validálást és a magyarázható mesterséges intelligenciát egy megbízható döntéstámogató platformmá ötvözve.