NL2SQL 准确率是怎么做上去的:语义层、召回硬化与 100 题评测 「用自然语言问数」是这两年 ChatBI 的标配卖点,但 demo 和生产之间隔着一个断层:同一个大模型,在学术评测集 Spider 1.0 上准确率 86%,换到贴近真实企业库的 Spider 2.0 上,初始只有10.1%。这篇讲清楚一件事:一个可以私有化部署的数据平台(「我的数据空间」,datastudiohappy.cn)里,NL2SQL 模块是怎么把准确率做到生产可用的。不谈概念,只讲架构和实测数字。一、裸 LLM 写 SQL 的三个死穴1. 死穴不在语法,在语义。公开研究统计,NL2SQL 失败案例里 81.2% 是选错列、理解错语义,语法错误只占 18.8%。大模型写 SQL 的语法能力早就过关了,过不了关的是「理解你的库」。2. 最危险的是静默错误。SQL 能跑、行数列名都对、数值是错的。典型如多表 join 的扇出:客户连订单再连明细,SUM 之前一行被膨胀成 50 行,营收虚高 5 倍,外观与正确查询一模一样。再如幻觉过滤值:WHERE channel自营,而库里渠道字段根本没有这个枚举——语法全对,永远查出 0 行。3. 业务口径不在 schema 里。「营收」对市场、财务、销售是三种算法;「成交额」含不含运费、剔不剔退款——表结构推不出来,LLM 只能挑一种,而且不告诉你它挑了哪种。这也是为什么 Snowflake、Looker、Power BI、ThoughtSpot 以及国内主流 ChatBI 清一色要求先建语义模型,没有一家敢做「对着裸库随便问」。二、总体架构:双路,语义层优先核心设计一句话:别让 LLM 直接写 SQL——语义层优先做确定性编译,不适用时回退到硬化过的检索兜底,歧义则反问用户。三、主路:语义层 NL2MQL2SQL语义模型把口径钉死:基表、join 关系、指标(带聚合口径和过滤条件)、维度、同义词,一次定义:在这条路上,LLM 的全部职责是把「上月各渠道 GMV」翻译成一份结构化意图(指标 维度 时间 过滤),它不碰 SQL。SQL 由确定性编译器从模型定义机械生成:join 按引用按需纳入(杜绝扇出)、操作符只认白名单且过滤值一律转义(防注入)、时间统一半开区间。同样的问题,永远得到同样的 SQL,GMV 的含义永远只有一个:这个设计的本质是缩小 LLM 的责任面:「NL→SQL」这个大难题,被缩成「NL→意图」这个小得多的问题。对照实验的数字很直接:同一批问题,语义路径 8/8 全对;撤掉语义模型退回裸生成,掉到 5/8,两道口径题全错。模型、指标或取值说不清时,不硬猜,反问用户,选项可点:四、兜底:召回硬化过的 schema linking用户总会问到没建模的表,这时回落到检索路:从元数据里召回相关表列,再交给 LLM 生成。这条路的生死在召回质量,两个关键决定:召回单元用「富卡片」,不用表名。用户嘴里说的是列和指标(「各渠道的成交额」),而表名往往是dwd_order_detail这种缩写,两者在向量空间里对不上。把表名、表注释、列名列注释拼成一张卡片整体向量化后,原来排第 6 名的目标表升到第 1,分数分布从「挤在一条缝里不可分」变成明显拉开。交叉编码精排默认开启。向量召回解决「找得到」,精排解决「排得对」——尤其抗宽表稀释:一张 199 列、整表语义都相近的干扰宽表,精排能读出「谁真的有目标列」,把它压到目标表得分的七分之一。对抗评测组 5/5 全部正确。生成的 SQL 还要过一道引擎级校验:引用了不存在的列会被拦下并据错重新生成,可疑的过滤值会给出提示——不让幻觉 SQL 悄悄流到用户手里。五、评测驱动:数字说了算以上每个设计决策,都由一套持续维护的评测体系裁决,而不是「跑几个例子感觉不错」。做法上有三条纪律,做同类系统可以直接抄:问句取自真实 schema 的真实命名(拼音、缩写、前缀),不编利于自己的样本;分类别报数,不用混比加权的总分——混比是可操纵的自由度;每次改动前后跑同一基线,diff 数字拍板,包括推翻自己:一版理论上更精细的双通道召回,就是被对抗评测证伪后回退的。检索类评测集目前 100 题(30 题人工精选 70 题合成,含 24 题对抗性难题),外加意图、澄清、安全等共 6 类 108 题全量回归。关键实测:项数字语义路径 vs 裸生成(同题对照)8/8vs 5/8,口径题全对 vs 全错端到端执行准确率(限定库作用域)12/12富卡片召回(列语义类)8/8,分数明显拉开对抗宽表干扰5/5目标表全部压过干扰表文档检索 Hit3 / MRR93% / 0.93问出来的数,一键就能执行拿结果,全程带权限校验:六、三句话总结裸 LLM 写 SQL 的死穴是静默错误,不是语法;准确率的杠杆在语义层和召回,不在换更大的模型;没有评测集,一切优化都是玄学。以上截图均来自线上产品「我的数据空间」——一套可私有化部署的数据平台,NL2SQL 能力也可作为组件单独集成(OEM 合作)。产品介绍与在线体验:https://datastudiohappy.cn/。