构建一个可用于生产环境的文本到 SQL 系统,需要的远不止是用大型语言模型生成 SQL 语句。企业应用需要精确的模式理解、上下文检索、验证和纠错能力,才能在以前从未见过的数据库上生成可靠的结果。
在本研究中,我们对我们的基准进行了评估 数据代理 on 蜘蛛1.0 并实现 执行准确率 88.15% 使用 杰玛 4 26B 本文并非仅仅关注基准测试分数,而是分享这些结果背后的架构决策、工程经验和基准测试见解。

构建一个可用于生产环境的文本到 SQL 系统,需要的远不止是用大型语言模型生成 SQL 语句。企业应用需要精确的模式理解、上下文检索、验证和纠错能力,才能在以前从未见过的数据库上生成可靠的结果。
在本研究中,我们对我们的基准进行了评估 数据代理 on 蜘蛛1.0 并实现 执行准确率 88.15% 使用 杰玛 4 26B 本文并非仅仅关注基准测试分数,而是分享这些结果背后的架构决策、工程经验和基准测试见解。
大型语言模型显著提升了 SQL 生成能力,但构建一个可用于生产环境的文本到 SQL 系统远不止是将自然语言翻译成 SQL 那么简单。企业应用必须理解复杂的数据库模式,检索正确的上下文,验证生成的查询,并在从未接触过的数据库上生成可靠的结果。
为了评估这些能力,我们对我们的……进行了基准测试 数据代理 在 Spider 1.0(应用最广泛的文本到 SQL 基准测试工具)上进行测试。 杰玛 4 26B 模型,我们的系统实现了 执行准确率 88.15%这表明架构和上下文管理与模型选择同样重要。
选择合适的基准测试与选择合适的模型同等重要。虽然像 Spider 2.0 和 BIRD 这样的新数据集引入了更复杂的企业场景,但 Spider 1.0 仍然是评估文本到 SQL 系统以及比较不同文献结果最广泛采用的基准测试。

在初步评估中,我们选择了 Spider 1.0,因为它提供了一个标准化且成熟的基准。这使我们能够衡量我们的数据代理在实际条件下理解之前未见过的数据库模式并生成正确 SQL 的有效性。
图 2 总结了 Spider 1.0 与其他常用的文本到 SQL 基准测试的比较情况。
要实现高文本到 SQL 的准确率,并非仅仅使用更大的语言模型就能解决。在我们的基准测试过程中,我们发现架构和上下文管理对性能的影响远大于模型选择本身。

我们的 数据代理 该系统被设计成一个多阶段流水线,在请求LLM生成SQL之前逐步缩小问题范围。系统不会将整个数据库模式暴露给模型,而是首先仅检索相关的模式和上下文信息,然后生成SQL查询,验证结果,并在执行前自动纠正常见错误。
如图所示 图3该架构由三个主要阶段组成:
这种以生产为导向的架构受到了以下理念的启发: DIN-SQL 和 DAIL-SQL同时,它也适用于企业环境,在这些环境中,可靠性、可解释性和稳健性与基准准确性同样重要。

选择合适的语言模型是我们基准测试过程中的重要环节。我们没有评估单一模型,而是尝试了多种开源语言模型,包括…… Llama 3.1、Qwen 2.5、DeepSeek、SQLCoder、CodeGemma、Mistral、GPT-OSS、 和 杰玛 4.
为了确保公平比较,我们使用以下方法评估了每个模型: 执行准确率 (EA)这是文本到 SQL 基准测试的标准指标。与基于语法的指标不同,执行准确率衡量的是生成的 SQL 是否返回与参考查询相同的结果,因此它能更好地反映实际性能。
我们的标杆管理历程如图所示 图4我们首先在一台配备有……的本地工作站上进行了实验。 RTX 4060(8 GB 显存)其中,较小的模型使我们能够快速迭代并验证我们的流程。在使用子集建立稳定的基线后, 233 个 Spider 1.0 问题, 我们迁移到云端GPU,以便在完整的环境中评估更大的模型。 2,147 道题 基准测试。这种分阶段的方法使我们能够在投入大规模基准测试运行之前,高效地优化架构。
我们使用包含 2,147 个问题的完整 Spider 1.0 测试集对最终模型进行了评估。如表 1 所示,Gemma 4 26B 的得分最高(88.15%),其次是 GPT-OSS 20B(86.63%)。这些结果表明,现代开源语言学习模型 (LLM) 与有效的检索和验证流程相结合,可以实现极具竞争力的文本到 SQL 性能。

只有当基准测试结果能够与先前发表的研究成果进行比较时,其意义才得以体现。为了更好地理解我们研究结果的重要性,我们回顾了近期关于文本到SQL的研究以及被广泛引用的基准测试论文。

表 2:SQL-of-Thought 研究中报告的闭源模型在 Spider 数据集子集上的准确率;从比较的角度来看,这项工作获得的 88.15% 的结果高于 GPT-4o Mini (87%),并且接近 GPT-5 (89%)。
近期作品例如 SQL 的思考 [1] 报告称,领先的闭源模型——包括 Claude Opus 3,GPT-5, 和 GPT-4o 迷你—在 Spider 基准测试子集上实现了高精度。虽然由于评估设置、提示和基准测试子集的差异,直接比较结果应谨慎解读,但我们的 执行准确率 88.15% 这表明开源模型可以达到与同类产品相同的性能水平。
尽管这些结果来自不同的评估环境,不应直接比较,但它们为理解当前文本到 SQL 系统的性能格局提供了有用的背景信息。我们的基准测试表明,当与精心设计的架构相结合时,开源模型现在可以与领先的闭源替代方案相媲美。

我们还将我们的结果与面向生产的文本到 SQL 框架进行了比较,例如: DIN-SQL[3]和 DAIL-SQL 将大型语言模型与模式链接、提示工程、自洽性和纠错等技术相结合。

表 3:在“大型语言模型赋能的文本到 SQL:基准评估”[2] 研究中,不同方法在 Spider 1.0 上的执行准确率结果;它揭示了模型选择以及提示工程、模式链接和自一致性等技术对准确率的影响。
我们的研究结果强化了近期文献中普遍认同的结论: 高效的文本到 SQL 性能不仅取决于语言模型,还取决于周围的架构。 有效的模式检索、上下文管理、验证和自我纠正通常与模型本身同样重要。
基准测试不仅仅是衡量准确率,更重要的是了解系统失效的原因和失效位置。在整个评估过程中,我们分析了错误的预测,并识别出几个影响最终得分的常见模式。
部分错误源于基准测试本身。少数情况下,参考(黄金)SQL查询语句中的不一致导致逻辑上正确的预测被标记为错误。其他情况则涉及含义模糊的自然语言问题或需要打破僵局的场景,在这些场景中,多个SQL查询语句可能合法地产生同样有效的答案。
我们还观察到一些模型特有的行为,包括不必要的类型转换、大小写处理不一致,以及偶尔将原本简单的 SQL 查询复杂化。这些发现进一步强调了在数据代理管道中加入验证和自纠错机制的重要性。
总体而言,我们的分析表明,许多剩余的错误并非由语言模型本身的局限性造成,而是由基准测试中的歧义或 SQL 生成中的极端情况所致。这表明,进一步改进检索、验证和上下文管理可以使系统性能更上一层楼。 执行准确率 90% 阈。
高精度只是生产级文本转SQL系统的一个方面。在企业环境中,基础设施成本、数据隐私和部署灵活性同样重要。
我们方法的关键优势之一在于它完全依赖于 开源语言模型。 在整个开发过程中,我们能够使用消费级设备在本地完成大部分实验。 RTX 4060(8 GB 显存)这使我们能够快速迭代,而无需承担任何 API 或令牌费用。只有在架构验证完毕后,才在专用云 GPU 上执行更大规模的基准测试。
我们使用 RunPod Secure Cloud 对 Spider 1.0 进行了完整的评估。Gemma 4 26B 基准测试在……上执行。 A100 PCIe 80 GB GPU, 而 GPT-OSS 20B 运行于 RTX 6000 48 GB GPU。
基础设施成本汇总如下 表4。

尽管规模最大的基准测试需要云基础设施,但由于采用了本地实验和开源模式,整个开发过程仍然保持了成本效益。更重要的是,最终的架构可以完全部署在组织自身的基础设施中,从而消除对外部 API 的依赖,同时更好地控制数据隐私、合规性和运营成本。
这使得该架构特别适合在对隐私敏感、受监管或物理隔离的环境中运营的组织,在这些环境中,数据安全性和部署灵活性是至关重要的要求。
基准测试提供了一种客观评估人工智能系统的方法,但它们并非最终目的。只有当高基准测试得分能够转化为实际应用中可靠的性能时,它才具有价值。
在本研究中,我们发现构建一个可用于生产环境的文本到 SQL 系统远不止生成 SQL 语句那么简单。理解数据库模式、检索正确的上下文、验证生成的查询以及改进错误的输出,与语言模型本身同等重要。
我们的 执行准确率 88.15% Spider 1.0 的测试表明,开源模型与精心设计的架构相结合,可以为企业级文本到 SQL 任务提供极具竞争力的性能。更重要的是,它验证了我们设计理念背后的原理。 数据代理它旨在可靠地运行于复杂的企业数据库上,而不仅仅是基准数据集上。
Spider 1.0 是一个重要的里程碑,但这仅仅是我们征程的开始。接下来,我们将评估数据代理。 蜘蛛2.0更大规模的企业级基准测试,以及最重要的,真实的客户环境,其中数据库模式要大得多,业务问题也复杂得多。
我们的长远愿景不仅仅是构建一个更好的 SQL 生成器。我们的目标是构建智能数据代理,使组织能够像与同事交流一样自然地与企业数据交互——将检索、推理、验证和可解释人工智能结合到一个可靠的决策支持平台中。
基准测试不仅仅是衡量准确性,更是为了了解系统成功或失败的原因。
在整个评估过程中,我们发现了一些反复出现的错误模式。部分错误源于基准测试本身的不明确之处,例如参考 SQL 查询的不一致以及排序条件的不完善。其他错误则反映了 LLM 的常见行为,例如不必要的类型转换或对区分大小写值的处理不一致。
这些观察结果强化了我们研究的核心发现之一: 建筑设计与模型选择同样重要。 检索、模式链接、验证和自我纠正对最终性能的贡献与底层语言模型一样大。
虽然基准测试的局限性不可避免地会影响最终得分,但我们的分析表明,进一步改进上下文管理和验证可以使系统超越预期。 执行准确率达到90%。
Spider 1.0 为评估我们的数据代理提供了一个重要的基准,但这仅仅是迈向生产就绪型企业人工智能的第一步。
接下来,我们将重点评估该架构在更具挑战性的基准测试中的性能,例如: 蜘蛛2.0 更重要的是,在真正的企业数据库中,模式要大得多,文档往往不完整,业务问题也复杂得多。
我们的目标不仅仅是构建另一个文本转SQL系统,我们正在构建智能系统。 数据代理 结合检索、推理、验证和可解释性,帮助组织自然、可靠地与企业数据进行交互。

[1] Saumya Chaturvedi、Aman Chadha、Laurent Bindschaedler arXiv。“SQL-of-Thought:具有引导式纠错的多智能体文本到 SQL。” arXiv。 2026年6月 https://arxiv.org/abs/2509.00581
[2] 高大伟、王海滨、李亚良、孙秀宇、钱一尘、丁柏林、周静仁“大型语言模型赋能的文本到 SQL:基准评估”arXiv。 六月 2026
https://arxiv.org/pdf/2308.15363
[3] Mohammadreza Pourreza, Davood Rafiei. “DIN-SQL:具有自纠错功能的分解式上下文文本到 SQL 学习” arXiv. 2026 年 6 月
https://arxiv.org/pdf/2304.11015
Dilşen YILDAR HAVAYLAR,
高级软件工程师,理学硕士