AI圈内卷到数据系统了!LLM4Data VS Data4L
LLM4Data与Data4LLM:大语言模型与数据管理系统双向奔赴的原理、架构与未来
走向未来
大语言模型(LLM)的出现,标志着人工智能领域从执行特定任务的辅助工具,演变为具备广泛理解和生成能力的通用任务求解器。这一转变正在对众多行业产生深远影响,其中最核心的领域之一便是数据管理。传统的数据系统擅长处理结构化查询和事务,但在理解非结构化信息、处理语义模糊性以及自动化复杂分析流程方面存在局限。
大语言模型带来了根本性的变化。它们不仅提供了处理文本语义的新途径,还将能力从简单的信息检索扩展到了复杂的推理与规划。这种能力使得数据系统的应用范围从封闭的垂直领域扩展到开放的现实世界任务。
然而,这种关系并非单向。大语言模型本身是数据密集型技术的产物。正如资深人工智能专家王文广在其《知识增强大模型》一书中所指出的,大模型存在“幻觉”和“知识陈旧”两大固有特性。这决定了其强大能力必须建立在与外部知识高效协同的基础之上。它们的训练、微调、部署和推理,每一步都依赖于高效、可靠和可扩展的数据管理。没有先进的数据处理管线、存储架构和查询优化技术,大语言模型的开发和运维将难以为继。
因此,一个深刻的双向共生关系正在形成:大语言模型为数据管理系统(LLM4Data)注入了前所未有的智能,而数据管理技术则为大语言模型(Data4LLM)的整个生命周期提供了关键支撑,特别是通过知识增强手段来克服其固有缺陷。本文将深入剖析这份SIGMOD教程所揭示的两个方向,探讨其核心技术、演进脉络、关键挑战以及未来的融合趋势。对本教程报告原文及更多前沿技术解读感兴趣的读者,可以从“走向未来”知识星球中获取。

添加图片注释,不超过 140 字(可选)
第一部分:LLM4Data - 智能重塑数据管理
大语言模型正通过其独特的能力,从根本上改变数据系统的交互方式、分析能力和运维模式。这不仅仅是功能增强,更是一种范式转移。
1.1 LLM赋予数据系统的新能力
大语言模型为数据管理带来了四项关键的新能力,这些能力是传统数据库技术所不具备的。
首先是语义处理能力。传统数据管理系统依赖精确的语法和模式,例如SQL查询,它们只能返回数据库中明确存在的结果。而大语言模型能够理解自然语言的细微差别、上下文和模糊语义。例如,面对一个分析型查询,如“SIGMOD 2025上与数据和AI相关的论文百分比”,模型不仅能解析查询意图,还能理解“相关”这一语义概念,从而处理数据湖中异构的结构化表格和非结构化文本。
其次是推理能力。大语言模型具备多步推理和逻辑推导的能力,使其能够处理复杂的逻辑、数学或程序性任务。这种能力超越了自然语言的范式, 延伸到形式语言推理,如定理证明、程序验证和AI规划。在数据领域,这意味着模型可以分解复杂的数据分析请求,制定执行计划。
再次是强大的适应性与知识广度。大语言模型通过在包含维基百科、书籍、期刊和海量网页的多样化数据集上进行预训练,积累了广泛的世界知识。这种适应性使其能够理解和处理来自不同领域的查询和任务,打破了传统垂直领域模型的局限。
最后是理解与生成能力。大语言模型不仅能理解输入,还能生成符合要求的输出。在数据管理中,这项能力的应用极其广泛,包括根据自然语言请求生成SQL查询(Text2SQL)、自动生成数据文档、撰写分析报告,甚至在数据库诊断(Diagnosis)和查询重写(Query Rewrite)等专业任务中提供见解和解决方案。例如,模型可以分析一个低效的SQL子查询,并将其重写为更高效的INNER JOIN形式。
1.2 LLM4Data的核心机遇
这些新能力为数据管理带来了三大机遇,涵盖了数据生命周期的关键阶段。
在数据操控层面,大语言模型有望实现数据准备流程的自动化规划。这包括复杂的数据发现、数据清洗、数据集成、模式匹配和数据标准化任务。模型可以理解不同数据源的语义,并生成执行这些转换所需的代码或指令。
在数据分析层面,大语言模型正在推动语义数据分析的发展,尤其是在非结构化数据、结构化数据和混合数据湖上。用户可以使用自然语言进行查询(NL2SQL),模型则负责将其转换为可执行的代码(NL2Code)或图查询(NL2GQL),并进行语义层面的分析。
在系统优化层面,大语言模型为数据库系统本身的优化提供了新工具。这包括配置调优、查询优化和异常诊断。例如,一个“D-Bot”形态的智能体可以理解系统异常,检索相关知识,调用数据库工具进行分析,并生成诊断报告,极大降低了数据库管理员(DBA)的工作负担。
1.3 核心挑战:解锁非结构化数据湖的价值
LLM4Data面临的最大挑战和机遇,在于如何分析数据湖中海量的非结构化和半结构化数据。这些数据(如电子邮件、文档、PDF、JSON、XML)缺乏固定的模式,难以用传统SQL进行分析;同时,数据语义难以理解,导致无法制定有效的分析计划。

添加图片注释,不超过 140 字(可选)
为了应对这一挑战,业界探索了四种主要的分析方法,展现了一条清晰的演进路径,即从“僵化的结构化”走向“灵活的自主智能”。
方法一:结构化信息提取 (SIE)
这是最早的尝试。其核心思想是首先利用大语言模型将非结构化或半结构化数据“降维”处理,离线提取出结构化表格,然后再使用传统的SQL进行查询分析。
具体技术包括:利用模型生成代码来提取模板化文本中的特定字段;利用模型理解文档的层级结构(如报告的章节标题)来切分数据;或者利用模型识别文档的视觉模式(如表单的固定位置)来提取键值对。
这种方法的深度分析表明,它是一种妥协的方案。它的主要问题在于通用性低,高度依赖数据遵循某种模板。更严重的是,提取过程是“有损”的,大量原始数据中的丰富语义在转换为僵化表格时丢失了。此外,对海量数据进行离线提取的成本依然高昂。
方法二:手动编写代码(语义算子)
为了克服SIE方法的局(限,第二种方法转向了“专家模式”。它不再试图提前转换所有数据,而是在查询时,由人类专家手动编写代码来编排执行流程,并通过代码中的特定提示(Prompt)来调用大语言模型执行语义操作。
这种方法催生了“语义算子”的概念,类似于Pandas库的DataFrame操作。用户可以编写例如sem_filter(语义过滤)、sem_join(语义连接)或sem_map(语义映射)这样的函数。例如,一个sem_join操作可以连接一个“论文”表和一个“项目”表,其连接条件是自然语言描述的“论文摘要与我的研究领域高度相关”。
这种方法的分析显示,它极大地提高了分析的灵活性和准确性,但代价是将复杂性完全转移给了用户。它严重依赖用户的专业知识,不仅要懂数据,还要擅长编写和调试复杂的分析代码。这种高昂的“人力成本”使其难以规模化。为了降低大语言模型的调用成本,研究人员开发了多种优化技术,如使用轻量级模型进行近似处理、通过采样进行聚合估计,或构建基于成本的优化器。但这些优化技术本身又增加了系统的复杂性,且成本估算在语义空间中极其困难。
方法三:自然语言到管线 (NL2Pipeline)
为了解决手动编码的高昂人力成本,第三种方法尝试实现“自动化”。其核心思想是提供一个自然语言(NL)接口,让用户用自然语言提问,然后系统自动将该查询转换为一个由预定义语义算子组成的执行管线(Pipeline)。
实现这种自动转换的技术路径包括:使用静态的、预定义的执行流程(例如,TAG系统将NL查询转换为带LLM UDF的SQL);或者在提示中向大语言模型提供可用算子的描述,指示模型生成一个执行计划(例如,CAESURA系统处理多模态数据);或者通过渐进式匹配,将自然语言短语与特定的算子表达式进行匹配(例如,Unify系统)。
对这种方法的深入洞察是,它虽然降低了使用门槛,但本质上是“新瓶装旧酒”。系统预定义的“算子集合”成为了新的“模式”(Schema)。用户的自然语言查询必须能够被完美地映射到这些固定的算子上,这限制了自然语言的 flexibility。如果查询稍微复杂或模糊,模型生成的管线可能逻辑错误或效率低下。它解决了“谁来写”的问题,但没有解决“写什么”的灵活性问题。
方法四:数据智能体 (Data Agent)
这是当前最具前瞻性的方法。它不再试图将自然语言“翻译”成受限的管线,而是将大语言模型构建为一个“自主智能体”。数据智能体被设计用来自主地执行数据相关任务,它具备知识理解、自动规划、工具调用和自我反思的能力。

添加图片注释,不超过 140 字(可选)
面对一个自然语言查询,数据智能体首先进行“感知”(Perception),理解查询意图、数据环境和优化目标。然后,它进行“推理与规划”(Reasoning & Planning),将复杂任务分解为一系列子任务。接着,它“调用工具”(Tool Invocation),自主选择和执行所需的工具(如SQL查询、Python脚本、向量索引)。在执行过程中,它利用“记忆”(Memory)来存储上下文和中间结果,并通过“持续学习”(Continuous Learning)和反思来优化其行为。

添加图片注释,不超过 140 字(可选)
数据智能体的深度价值在于其“灵活性”和“自主性”。它不再被固定的算子束缚,而是可以根据任务动态地组合和使用工具。例如,一个数据智能体框架可以包含用于数据探索、数据访问、引擎调度和数据处理的多个专业智能体,它们协同工作来完成复杂的分析请求。
这一理念与《知识增强大模型》一书中(第8章)提出的“图模互补”范式不谋而合。数据智能体的自主性如果缺乏事实的锚点,极易产生“幻觉”。而知识图谱(Knowledge Graph)正提供了这种锚点。正如王文广所论述的,知识图谱具备知识的确定性、一致性和可追溯性,能够进行可解释的演绎推理。当数据智能体将其强大的通用理解和规划能力,与知识图谱提供的确定性知识(作为其调用的核心“工具”之一)相结合时,其分析的可靠性和深度将发生质变,使其自主性既强大又安全。
1.4 LLM4Data的实施原则与挑战
尽管前景广阔,但将大语言模型应用于数据管理仍面临严峻挑战。模型可能产生“幻觉”(Hallucination),生成看似合理但事实错误的SQL或分析;模型推理能力有限,难以处理超复杂的多步逻辑;模型调用成本高昂,可能导致大量API调用。
为了克服这些挑战,成功的LLM4Data系统需要遵循四个关键原则:引入领域知识(如通过R-Bot进行主动学习,或如上文所述,接入知识图谱),确保验证和可靠性(通过自我反思和校验),优化成本效益(如通过Plan Optimization),以及增强推理和自我反思能力(如通过D-Bot进行诊断)。
第二部分:Data4LLM - 驱动模型的关键数据引擎
大语言模型的强大能力并非凭空而来,它们完全建立在数据管理的基础之上。Data4LLM的核心议题,就是研究如何利用数据管理技术,来优化大语言模型从训练到推理的整个生命周期。
2.1 数据在LLM生命周期中的核心地位
大语言模型的生命周期涵盖多个阶段:预训练(Pretraining)、微调(Finetuning,包括SFT和RLHF)、提示工程(Prompting)、检索增强生成(RAG)以及智能体(Agent)应用。

添加图片注释,不超过 140 字(可选)
在所有这些阶段中,有效的数据管理都是其可扩展开发和部署的基石。这包括数据准备(发现、选择、清洗、增强、标注、合成)、数据处理(存储、优化)以及在训练和推理期间的数据高效利用。
其中,检索增强生成(RAG)是连接Data4LLM和LLM4Data的关键桥梁。它是一种在推理时,通过从外部知识库(如向量数据库或知识图谱)检索信息来“喂养”模型的范式。在《知识增强大模型》(第4章)中,王文广详细阐述了RAG作为核心“知识增强”手段的价值。它不仅是Data4LLM(数据管理赋能LLM)的直接体现,更是解决LLM“知识陈旧”和“幻觉”问题的关键实践。它将LLM从一个封闭的、静态的知识系统,转变为一个开放的、动态的、与实时数据联动的“知识运营”(Ch 10.3)系统。
2.2 LLM训练的基石:数据准备
大语言模型训练的起点是将海量、肮脏的原始数据转化为小规模、高质量的“好数据”。这个数据准备管线是决定模型质量和效率的关键,它主要包括数据选择、去重和混合。

添加图片注释,不超过 140 字(可选)
2.2.1 数据选择:从“量”到“质”的转变
数据选择的目标是获取一个体积虽小,但能产生相同甚至更好训练效果的数据子集。这是实现“数据高效”的第一步。
传统的数据选择依赖于简单的“基于规则”的启发式方法,例如根据语言过滤、限制单词数量、控制符号比例或要求包含停用词来保证文本的基本质量。
然而,更先进的方法是“基于内容”的选择。这需要更深的语义理解。一种方法是“基于分类”,即训练一个分类器来识别那些与已知高质量语料(如维基百科、学术文章)分布相似的数据。另一种方法是“基于困惑度(Perplexity)”,即使用一个辅助模型来评估数据,低困惑度通常意味着数据更符合模型的“预期”分布,质量更高。
最具创新性的方法是“基于标准(Criteria)”的选择。这种方法试图量化人类对“质量”的直观感受。例如,定义多个质量维度,如写作风格(是否优美)、专业性(难度级别)、事实密度(是否包含长尾知识)和教育价值(是否有清晰解释)。然后,使用一个大语言模型(如GPT-3.5)对数据对进行两两比较打分,再用这些判断数据训练一个专门的“质量评估模型”(QuRater Model),最后用这个模型为海量的网页数据赋分,从而筛选出真正高质量的数据。
2.2.2 数据去重:消除冗余的必要性
在重复的数据上训练会拖慢训练速度,并可能损害模型性能。因此,数据去重至关重要。
“精确匹配”去重技术使用MD5哈希或布隆过滤器(Bloom Filters)来识别完全相同的文档,这种方法高效但只能处理字面重复。
“近似匹配”去重技术则更为复杂。例如,使用MinHash算法来估计文档间的Jaccard相似度,通过比较n-grams(N元组)的哈希签名来发现高度相似的文本。
“语义匹配”去重则进入了LLM4Data的范畴。它利用预训练模型将文档转换为嵌入向量(Embeddings),然后在向量空间中进行聚类。这一步的实现,与《知识增强大模型》中(第3章)论述的“向量数据库”技术息息相关。通过向量索引(如HNSW)进行高效的近似最近邻(ANN)检索,不仅是RAG的核心,也成为了实现大规模“语义去重”的基础设施。
2.2.3 数据增强与混合:设计最优“配方”
数据准备的最后一步是设计训练数据的“配方”。数据增强技术,如领域特定选择,旨在从通用数据集中找到与特定领域(如医学、法律)分布最相似的辅助数据。
数据混合(Data Mixing)则负责确定不同数据来源(如代码、书籍、网页)在训练语料中的最佳权重比例。这直接影响模型的最终性能和训练效率。早期的混合比例依赖“经验确定法”,例如通过在小型模型上测试不同组合来确定。而“模型确定法”(如Doremi)则尝试通过优化一个代理模型,使其在所有数据域上的“最大损失最小化”,来自动计算出最优的领域权重,然后再将这些权重用于训练大型模型。
2.3 LLM训练的加速:并行化策略
处理大型模型和海量数据,分布式训练是必需的。Data4LLM在训练阶段的贡献主要体现在并行策略上,包括数据并行(每个工作节点处理一部分数据)、模型并行(将模型的不同层切分到不同节点)和张量并行(将模型内部的张量切分到不同节点)。
2.4 LLM推理的核心:类数据库的查询优化
Data4LLM最深刻、最具创新性的贡献,体现在对大语言模型“推理(Inference)”阶段的优化。这是一个新兴的、关键的系统问题。
从系统角度看,LLM推理服务与数据库查询处理(DB Query Processing)惊人地相似。两者有共同的目标:最小化延迟(Latency)和最大化吞吐量(Throughput)。数据库引擎接收SQL,LLM推理引擎接收Prompt;数据库返回结果集,LLM返回生成的文本。
更进一步看,对于RAG等知识增强型应用,推理优化是一个“检索”和“生成”并重的两阶段过程。因此,数十年来在数据库和操作系统中积累的优化技术,正被创造性地应用于LLM推理的各个环节。
首先,在“检索”阶段,优化的核心是向量数据库。正如《知识增强大模型》全书(第3章)所强调的,高效的向量索引与检索(如HNSW、量化)是决定RAG应用响应速度的第一道门槛。对这一阶段的优化,等同于传统数据库对索引和查询计划的优化。
其次,在“生成”阶段,优化的核心是GPU显存管理和计算。
2.4.1 优化单查询延迟(Q1)
为了减少单个请求的响应时间,核心技术是引入KV缓存(KV Cache)。在Transformer模型中,Attention机制需要依赖先前所有Token的键(K)和值(V)。通过将这些计算结果缓存起来,可以避免在生成每个新Token时重复计算,极大提升解码阶段的速度。但这带来了新的挑战:KV缓存会消耗海量的GPU显存。
其他优化技术包括:量化(Quantization),即将模型的权重从高精度(如FP32)压缩到低精度(如INT8),以减少内存占用和加速计算;优化模型结构,如使用稀疏注意力(Sparse Attention)或专家混合(MoE)来减少计算量;以及推测解码(Speculative Decoding),即使用一个更小、更快的“草稿模型”并行生成多个Token,然后由大型模型一次性“验证”这些Token,从而变相实现并行解码。
2.4.2 优化多查询吞吐量(单GPU)(Q2)
在服务场景中,GPU需要同时处理多个并发请求。这使得KV缓存管理成为一个核心的系统问题,类似于操作系统的内存管理。

添加图片注释,不超过 140 字(可选)
一个关键的挑战是内存碎片。如果为每个请求预先分配一块连续的KV缓存空间,由于无法预知每个请求的输出长度,会导致大量内存预留(Reservation)、内部碎片(Internal Fragmentation)和外部碎片(External Fragmentation)。
解决方案是引入“基于页面的内存分配”(Page-based Memory Allocation)。VLLM等系统将GPU显存划分为非连续的“块”(Block),类似于操作系统的虚拟内存和分页。KV缓存按需分配这些块,从而消除了外部碎片,并将内部碎片限制在最后一个块内,极大提高了显存利用率。
在此基础上,一系列经典的系统优化技术得以应用:KV缓存驱逐/卸载(Eviction/Offloading),当显存不足时,将不活跃的缓存(如按LRU策略)换出到CPU内存;缓存共享(Cache Sharing),如前缀共享(Prefix Sharing),如果多个请求有相同的前缀(如系统提示),它们可以共享同一份KV缓存;请求批处理(Request Batching),将多个请求打包(Batch)在一起,提高GPU利用率。特别是“连续批处理”(Continuous Batching)允许在批处理执行过程中动态插入新请求,消除了静态批处理的GPU空闲;请求调度(Request Scheduling),例如采用“最短作业优先”(Shortest Job First, SJF)策略,优先处理预估生成长度较短的请求,以最小化平均延迟。
2.4.3 优化多查询吞吐量(多GPU)(Q3)
当扩展到多GPU集群时,优化重点转向了负载均衡(Load Balancing)。系统需要决定将新来的请求分配给哪个工作节点。这需要综合考虑缓存重用率(避免冷启动的预填充)和节点负载(避免排队)。先进的系统还支持“重均衡”(Rebalancing),即在不同GPU之间迁移KV缓存,以动态调整负载。
更进一步的优化是“分离式预填充与解码”(Disaggregated Prefilling and Decoding)。预填充(处理输入Prompt)是计算密集型任务,而解码(生成Token)是内存带宽密集型任务。将这两部分解耦,分配给不同的硬件集群,可以实现更精细的资源优化。
第三部分:未来展望 - 数据与AI的协同设计
LLM4Data和Data4LLM两个方向的演进,最终将汇聚于一点:数据与AI的协同设计(Data + LLM Co-design)。这代表了数据系统和人工智能的未来。
在LLM4Data方向,未来的突破点将是“数据专用基础模型”(Foundation Models for Data)。这意味着不再是为每个数据库任务微调通用LLM,而是预训练专门用于数据领域的LLM。这将通过收集海量的数据库领域语料(如教科书、查询日志)来实现,使其原生具备强大的SQL理解、诊断和调优能力。同时,“数据智能体”将无处不在,涵盖数据分析、数据科学乃至数据库开发和运维(DBA)。
在Data4LLM方向,未来的核心是构建“数据编织”(Data Fabric)和“数据飞轮”(Data Flywheel)。数据编织提供一个统一的数据访问接口和语义目录,使AI能够无缝、实时地访问异构数据源。数据飞轮则构建一个持续改进的反馈闭环,通过数据增强、特征增强和反馈优化,使模型和数据共同迭代进化。
最终,数据系统与AI模型将不再是两个独立的实体。它们将在一个统一的“数据+AI基础设施”上被共同设计和运维(Data+AI Ops)。这一愿景,正是王文广在《知识增强大模型》一书(第8章、第9章)中所倡导的“图模互补”应用范式和“GraphRAG”的终极体现。这种协同设计不再是单向的“增强”,而是一个深度迭代的闭环:LLM的通用智能被用于加速知识图谱的构建和补全(Ch 8.5);而知识图谱的结构化、可追溯和可推理的特性,则反过来作为最可靠的“外部知识”,通过GraphRAG等高级形式(Ch 9),为LLM的生成提供事实锚点和深度洞察(Ch 8.6)。

添加图片注释,不超过 140 字(可选)
这一“协同设计”的理念,正是当前行业探索的核心。对于这一前沿领域,我们强烈推荐加入最具价值的知识星球“走向未来”。在那里,你可以获取AI相关的各类市场分析报告、技术论文书籍、应用实践指南等等,主题涵盖生成式AI、大模型、AIGC、AI芯片和机器人等技术、应用和市场,并与同侪一起深入探讨如何使用人工智能大模型和智能体来为工作增效,为生活添彩。立即加入“走向未来”知识星球,将是您与我们一起走向AGI未来的绝佳途径。
这种迭代式的协同设计,辅以强大的“知识运营”(Ch 10.3)体系,将数据的高效管理与AI的强大智能深度融合,共同推动下一代智能数据系统的发展。
