실제 운영 환경에 적합한 텍스트-SQL 변환 시스템 구축: Spider 1.0에서 88.15%의 성능 달성
게시 날짜
2026 년 7 월 13 일
공유
개요
실제 운영 환경에 적합한 텍스트-SQL 변환 시스템을 구축하려면 단순히 방대한 언어 모델을 사용하여 SQL을 생성하는 것 이상의 작업이 필요합니다. 엔터프라이즈 애플리케이션은 이전에 접해보지 못한 데이터베이스에서도 신뢰할 수 있는 결과를 도출하기 위해 정확한 스키마 이해, 컨텍스트 검색, 유효성 검사 및 오류 수정 기능을 요구합니다.
본 연구에서는 Spider 1.0 환경에서 데이터 에이전트의 성능을 벤치마킹하여 Gemma 4 26B 모델을 사용해 88.15%의 실행 정확도를 달성했습니다 . 이 글에서는 단순히 벤치마크 점수만을 제시하는 것이 아니라, 이러한 결과의 배경이 되는 아키텍처 설계, 엔지니어링 과정에서 얻은 교훈, 그리고 벤치마킹에 대한 통찰력을 공유합니다.
SQL 생성 그 이상
대규모 언어 모델은 SQL 생성 성능을 크게 향상시켰지만, 실제 운영 환경에서 사용할 수 있는 텍스트-SQL 시스템을 구축하려면 자연어를 SQL로 변환하는 것 이상의 작업이 필요합니다. 엔터프라이즈 애플리케이션은 복잡한 데이터베이스 스키마를 이해하고, 필요한 컨텍스트를 검색하고, 생성된 쿼리를 검증하고, 이전에 접해본 적 없는 데이터베이스에서도 신뢰할 수 있는 결과를 도출해야 합니다.
이러한 기능을 평가하기 위해 가장 널리 사용되는 텍스트-SQL 벤치마크인 Spider 1.0에서 당사 데이터 에이전트의 성능을 벤치마킹했습니다 . Gemma 4 26B 모델을 사용한 결과, 당사 시스템은 88.15%의 실행 정확도를 달성했으며 , 이는 아키텍처 및 컨텍스트 관리가 모델 선택만큼 중요하다는 것을 보여줍니다.
스파이더 1.0을 선택하는 이유는 무엇일까요?
적절한 벤치마크를 선택하는 것은 적절한 모델을 선택하는 것만큼 중요합니다. Spider 2.0 및 BIRD와 같은 최신 데이터 세트는 더욱 복잡한 기업 시나리오를 제시하지만, Spider 1.0은 텍스트-SQL 변환 시스템을 평가하고 관련 연구 결과를 비교하는 데 가장 널리 사용되는 벤치마크입니다.
초기 평가를 위해 우리는 표준화되고 잘 확립된 기준선을 제공하는 Spider 1.0을 선택했습니다. 이를 통해 데이터 에이전트가 이전에 접하지 못한 데이터베이스 스키마를 얼마나 효과적으로 이해하고 실제 환경에서 올바른 SQL을 생성하는지 측정할 수 있습니다.
그림 2는 Spider 1.0이 다른 일반적인 텍스트-SQL 벤치마크와 어떻게 비교되는지 요약합니다.
데이터 에이전트 구축
텍스트를 SQL로 변환하는 정확도를 높이는 것은 단순히 더 큰 언어 모델을 사용하는 것만으로는 충분하지 않습니다. 벤치마킹 과정을 통해 아키텍처 및 컨텍스트 관리가 모델 선택만으로는 성능에 미치는 영향이 훨씬 크다는 것을 발견했습니다.
당사의 데이터 에이전트는 LLM(로컬 라이프 모델)에 SQL 생성을 요청하기 전에 문제를 점진적으로 좁혀가는 다단계 파이프라인으로 설계되었습니다. 전체 데이터베이스 스키마를 모델에 노출하는 대신, 시스템은 먼저 관련 스키마와 컨텍스트 정보만 가져온 다음 SQL 쿼리를 생성하고 결과를 검증하며 실행 전에 일반적인 오류를 자동으로 수정합니다.
그림 3 에서 보는 바와 같이 , 아키텍처는 크게 세 단계로 구성됩니다.
정보 검색 사용자의 질문을 분석하여 관련 데이터베이스 객체를 식별하고, 메타데이터 저장소에서 필요한 스키마 정보만 검색합니다.
자가정제제 – 언어 모델은 SQL을 생성하고, 검색된 스키마에 대해 쿼리의 유효성을 검사하며, 유효성 검사에 실패할 경우 자동으로 쿼리를 수정합니다.
실행 및 응답 유효성 검사가 완료되면 SQL 쿼리가 대상 데이터베이스에 대해 실행되고, 결과는 구조화된 데이터 또는 자연어 응답으로 반환됩니다.
이 생산 지향적 아키텍처는 DIN-SQL 및 DAIL-SQL 에서 소개된 아이디어에서 영감을 받았으며 , 벤치마크 정확도만큼 신뢰성, 설명 가능성 및 견고성이 중요한 엔터프라이즈 환경에 맞게 조정되었습니다.
우리의 벤치마킹 여정
적합한 언어 모델을 선택하는 것은 벤치마킹 과정에서 중요한 부분이었습니다. 단일 모델을 평가하는 대신, Llama 3.1, Qwen 2.5, DeepSeek, SQLCoder, CodeGemma, Mistral, GPT-OSS, Gemma 4 를 포함한 다양한 오픈 소스 LLM을 실험적으로 사용해 보았습니다.
공정한 비교를 위해 텍스트-SQL 벤치마킹의 표준 지표인 실행 정확도(EA)를 사용하여 모든 모델을 평가했습니다 . 구문 기반 지표와 달리 실행 정확도는 생성된 SQL이 참조 쿼리와 동일한 결과를 반환하는지 여부를 측정하므로 실제 성능을 더 잘 나타내는 지표입니다.
그림 4 는 저희의 벤치마킹 여정을 보여줍니다 . 먼저 RTX 4060(8GB VRAM) 이 장착된 로컬 워크스테이션에서 실험을 진행했습니다 . 소규모 모델을 사용하여 파이프라인을 신속하게 반복 검증할 수 있었습니다. Spider 1.0 문제 중 233개 문항으로 구성된 하위 집합을 사용하여 안정적인 기준선을 구축한 후, 클라우드 GPU로 이동하여 전체 2,147개 문항 벤치마크에서 더 큰 모델을 평가했습니다. 이러한 단계적 접근 방식을 통해 대규모 벤치마크 실행에 투자하기 전에 아키텍처를 효율적으로 최적화할 수 있었습니다.
2,147개의 질문으로 구성된 Spider 1.0 테스트 데이터셋 전체를 사용하여 최종 모델들을 평가했습니다. 표 1에서 볼 수 있듯이, Gemma 4 26B가 88.15%로 가장 높은 점수를 기록했으며, GPT-OSS 20B가 86.63%로 그 뒤를 이었습니다. 이러한 결과는 최신 오픈소스 LLM(언어 모델)이 효과적인 검색 및 검증 파이프라인과 결합될 때 매우 경쟁력 있는 텍스트-SQL 성능을 달성할 수 있음을 보여줍니다.
이 결과들을 비교해 보면 어떨까요?
벤치마크 점수는 기존에 발표된 연구 결과와 비교할 수 있을 때만 의미가 있습니다. 본 연구 결과의 중요성을 더 잘 이해하기 위해 최근의 텍스트-SQL 변환 연구와 널리 인용되는 벤치마크 논문들을 검토했습니다.
표 2: SQL-of-Thought 연구에서 Spider 데이터셋의 하위 집합에 대해 보고된 클로즈드 소스 모델의 정확도. 비교 측면에서 본 연구에서 얻은 88.15% 결과는 GPT-4o Mini(87%)보다 높고 GPT-5(89%)에 근접한 수준임을 보여줍니다.
SQL-of-Thought [1] 와 같은 최근 연구 에서는 Claude Opus 3, GPT-5, GPT -4o Mini 를 포함한 주요 폐쇄형 소스 모델이 Spider 벤치마크 하위 집합에서 높은 정확도를 달성했다고 보고했습니다. 평가 설정, 프롬프트 및 벤치마크 하위 집합의 차이로 인해 직접적인 비교는 신중하게 해석해야 하지만, 88.15%의 실행 정확도는 오픈 소스 모델도 동일한 경쟁력 있는 범위 내에서 성능을 달성할 수 있음을 보여줍니다.
이러한 결과는 서로 다른 평가 환경에서 나온 것이므로 직접 비교할 수는 없지만, 텍스트-SQL 변환 시스템의 현재 성능 현황을 이해하는 데 유용한 맥락을 제공합니다. 본 벤치마크는 잘 설계된 아키텍처와 결합될 경우 오픈 소스 모델이 주요 클로즈드 소스 대안들과 경쟁할 수 있음을 보여줍니다.
또한 우리는 대규모 언어 모델과 스키마 연결, 프롬프트 엔지니어링, 자체 일관성 및 오류 수정을 포함하는 기술을 결합한 DIN-SQL [3] 및 DAIL- SQL 과 같은 프로덕션 지향 텍스트-SQL 프레임워크와 결과를 비교했습니다 .
표 3: "대규모 언어 모델로 강화된 텍스트-SQL: 벤치마크 평가"[2] 연구에서 Spider 1.0에 대한 다양한 방법의 실행 정확도 결과; 이는 모델 선택뿐만 아니라 프롬프트 엔지니어링, 스키마 연결 및 자체 일관성과 같은 기술이 정확도에 미치는 영향을 보여줍니다.
본 연구 결과는 최근 문헌에서 공통적으로 제시되는 결론을 뒷받침합니다. 즉, 높은 텍스트-SQL 성능은 언어 모델뿐만 아니라 주변 아키텍처에도 달려 있다는 것입니다. 효과적인 스키마 검색, 컨텍스트 관리, 유효성 검사 및 자체 수정은 모델 자체만큼이나 중요합니다.
우리가 배운 것
벤치마킹은 단순히 정확도를 측정하는 것뿐만 아니라 시스템이 실패하는 지점과 이유를 이해하는 것도 중요합니다. 저희는 평가 과정에서 잘못된 예측을 분석하고 최종 점수에 영향을 미치는 몇 가지 반복적인 패턴을 파악했습니다.
일부 오류는 벤치마크 자체에서 발생했습니다. 소수의 경우, 참조(골드) SQL 쿼리의 불일치로 인해 논리적으로 올바른 예측이 잘못된 것으로 표시되었습니다. 다른 사례에서는 모호한 자연어 질문이나 여러 SQL 쿼리가 모두 유효한 답변을 생성할 수 있는 동점 상황과 관련된 오류가 발생했습니다.
또한 불필요한 데이터 유형 변환, 대소문자 구분 처리의 일관성 부족, 간단한 SQL 쿼리를 지나치게 복잡하게 만드는 경우 등 모델별로 몇 가지 특정 동작을 관찰했습니다. 이러한 결과는 데이터 에이전트 파이프라인에 유효성 검사 및 자체 수정 메커니즘을 통합하는 것이 중요하다는 점을 다시 한번 강조합니다.
전반적으로 분석 결과, 남아 있는 오류의 상당수는 언어 모델 자체의 한계 때문이 아니라 벤치마크의 모호성이나 SQL 생성 과정의 예외적인 경우에서 비롯된 것으로 나타났습니다. 이는 검색, 유효성 검사 및 컨텍스트 관리 기능을 더욱 개선하면 시스템의 실행 정확도를 90% 이상으로 끌어올릴 수 있음을 시사합니다.
비용 및 효율성
높은 정확도는 상용 텍스트-SQL 시스템의 여러 측면 중 하나일 뿐입니다. 기업 환경에서는 인프라 비용, 데이터 개인정보 보호 및 배포 유연성 또한 중요한 고려 사항입니다.
저희 접근 방식의 핵심 장점 중 하나는 오픈 소스 언어 모델에 전적으로 의존한다는 점입니다. 개발 과정 전반에 걸쳐 일반 소비자용 RTX 4060(8GB VRAM)을 사용하여 대부분의 실험을 로컬에서 수행할 수 있었기 때문에 API 또는 토큰 비용 없이 신속하게 반복 작업을 진행할 수 있었습니다. 아키텍처 검증이 완료된 후에야 전용 클라우드 GPU에서 대규모 벤치마크 테스트를 실행했습니다.
저희는 RunPod Secure Cloud를 사용하여 Spider 1.0 전체 평가를 진행했습니다. Gemma 4 26B 벤치마크는 A100 PCIe 80GB GPU에서 실행되었고, GPT-OSS 20B 는 RTX 6000 48GB GPU 에서 실행되었습니다 .
인프라 구축 비용은 표 4에 요약되어 있습니다.
가장 큰 규모의 벤치마크 실행에는 클라우드 인프라가 필요했지만, 로컬 실험과 오픈 소스 모델 덕분에 전체 개발 프로세스는 비용 효율적으로 진행되었습니다. 더욱 중요한 것은, 결과적으로 얻어진 아키텍처를 조직 자체 인프라 내에 완전히 배포할 수 있어 외부 API에 대한 의존성을 없애고 데이터 개인정보 보호, 규정 준수 및 운영 비용을 더욱 효과적으로 관리할 수 있다는 점입니다.
이러한 특징 덕분에 데이터 보안과 배포 유연성이 중요한 요구 사항인 개인 정보 보호에 민감하거나 규제를 받는 환경, 또는 네트워크와 단절된 환경에서 운영되는 조직에 이 아키텍처가 특히 적합합니다.
비욘드 스파이더 1.0
벤치마크는 AI 시스템을 객관적으로 평가하는 방법을 제공하지만, 궁극적인 목표는 아닙니다. 높은 벤치마크 점수는 실제 응용 분야에서 안정적인 성능으로 이어질 때에만 가치가 있습니다.
본 연구를 통해 우리는 실제 운영 환경에서 사용할 수 있는 텍스트-SQL 변환 시스템을 구축하는 것은 단순히 SQL 쿼리를 생성하는 것 이상의 의미를 지닌다는 것을 알게 되었습니다. 데이터베이스 스키마를 이해하고, 적절한 컨텍스트를 추출하고, 생성된 쿼리를 검증하고, 잘못된 출력을 수정하는 것이 언어 모델 자체만큼이나 중요하다는 것을 깨달았습니다.
Spider 1.0에서 88.15%의 실행 정확도를 달성 한 것은 잘 설계된 아키텍처와 결합된 오픈 소스 모델이 엔터프라이즈급 텍스트-SQL 변환 작업에서 매우 경쟁력 있는 성능을 제공할 수 있음을 보여줍니다. 더욱 중요한 것은, 이 결과가 벤치마크 데이터셋뿐 아니라 복잡한 엔터프라이즈 데이터베이스에서도 안정적으로 작동하도록 설계된 당사의 데이터 에이전트 의 핵심 설계 원칙을 입증한다는 점입니다.
Spider 1.0은 중요한 이정표이지만, 이는 여정의 시작일 뿐입니다. 향후 계획에는 Spider 2.0 에서 데이터 에이전트를 평가하고 , 더 큰 규모의 엔터프라이즈 벤치마크를 수행하며, 무엇보다 데이터베이스 스키마가 훨씬 더 크고 비즈니스 문제가 훨씬 더 복잡한 실제 고객 환경에서 테스트하는 것이 포함됩니다.
우리의 장기적인 비전은 단순히 더 나은 SQL 생성기를 만드는 데 그치지 않습니다. 우리는 조직이 동료와 소통하듯 자연스럽게 기업 데이터와 상호 작용할 수 있도록 지원하는 지능형 데이터 에이전트를 구축하는 것을 목표로 합니다. 이를 위해 검색, 추론, 검증 및 설명 가능한 AI를 결합하여 신뢰할 수 있는 의사 결정 지원 플랫폼을 제공하고자 합니다.
주요 강의
벤치마킹은 단순히 정확도를 측정하는 것만이 아니라, 시스템이 성공하거나 실패하는 이유를 이해하는 것입니다.
평가 과정에서 몇 가지 반복적인 오류 패턴을 발견했습니다. 일부는 참조 SQL 쿼리의 불일치 및 불완전하게 지정된 정렬 조건과 같은 벤치마크 자체의 모호성에서 비롯되었습니다. 다른 오류들은 불필요한 형변환이나 대소문자를 구분하는 값의 일관성 없는 처리와 같은 일반적인 LLM 동작을 반영했습니다.
이러한 관찰 결과는 우리 연구의 핵심적인 발견 중 하나를 다시 한번 확인시켜 주었습니다. 즉, 아키텍처는 모델 선택만큼이나 중요하다는 것입니다. 검색, 스키마 연결, 유효성 검사 및 자체 수정은 기본 언어 모델만큼이나 최종 성능에 큰 영향을 미쳤습니다.
벤치마크의 한계로 인해 최종 점수에 불가피한 영향이 있지만, 저희 분석에 따르면 컨텍스트 관리 및 유효성 검사를 더욱 개선하면 시스템의 실행 정확도를 90% 이상으로 끌어올릴 수 있을 것으로 예상됩니다.
미래를 내다보다
Spider 1.0은 당사의 데이터 에이전트를 평가하는 데 중요한 기준점을 제공했지만, 이는 실제 운영 환경에 적용 가능한 엔터프라이즈 AI를 향한 첫걸음에 불과합니다.
다음 목표는 Spider 2.0 과 같은 더욱 까다로운 벤치마크에서 아키텍처를 평가하고 , 더 중요하게는 스키마 규모가 훨씬 크고, 문서가 불완전한 경우가 많으며, 비즈니스 질문이 훨씬 더 복잡한 실제 엔터프라이즈 데이터베이스에서 평가하는 것입니다.
우리의 목표는 단순히 또 다른 텍스트-SQL 변환 시스템을 구축하는 것이 아닙니다. 우리는 검색, 추론, 유효성 검사 및 설명 가능성을 결합하여 기업이 엔터프라이즈 데이터와 자연스럽고 안정적으로 상호 작용할 수 있도록 지원하는 지능형 데이터 에이전트를 구축하고 있습니다.
참고자료
[1] Saumya Chaturvedi, Aman Chadha, Laurent Bindschaedler arXiv. “SQL-of-Thought: 가이드 오류 수정 기능을 갖춘 다중 에이전트 텍스트-SQL 변환.” arXiv. 2026년 6월 https://arxiv.org/abs/2509.00581
[2] Dawei Gao, Haibin Wang, Yaliang Li, Xiuyu Sun, Yichen Qian, Bolin Ding, Jingren Zhou "대규모 언어 모델로 강화된 텍스트-SQL: 벤치마크 평가" arXiv. 2026년 6월