在企业数字化转型中,数据分析和SQL查询成为业务人员的痛点。DataAgent作为基于Spring AI Alibaba构建的虚拟AI数据分析师,通过智能体架构将确定性流程与模型推理结合,解决了传统Text-to-SQL的局限性,为企业数据分析提供了完整的解决方案。
智能速览
DataAgent通过Graph编排与Agent推理实现智能数据分析
支持人类反馈机制确保AI执行安全性
集成深度RAG与混合检索提升业务理解能力
容器化Python执行引擎支持复杂统计分析
多数据源接入打破数据孤岛限制
提供流式输出与多轮对话交互体验
精华内容
DataAgent的核心突破在于将工程化数据处理与大模型推理能力深度融合,通过10项技术创新构建了企业级数据分析智能体。
架构设计
DataAgent基于Spring AI Alibaba生态构建,采用Graph & Agent Framework架构,将确定性流程与模型推理有机结合。通过graph、multi-agent模式实现自我规划、工具调用、反思纠错及人类干预能力,形成兼具流程确定性与智能化的数据智能体产品。这种架构设计使其能够像专家一样思考、规划、纠错,最终输出带图表、带逻辑、带深度洞察的行业级报告。
安全机制
人类反馈机制(Human-In-The-Loop)是DataAgent的核心安全保障。通过runtime请求参数humanFeedback=true启用,PlanExecutorNode检测HUMAN_REVIEW_ENABLED后转入HumanFeedbackNode,支持暂停与恢复执行。用户可以对AI执行计划进行同意、修改或驳回,给AI穿上约束衣,让AI既有速度又懂规矩,有效防止错误执行计划拖垮生产库。
智能检索
深度RAG与混合检索增强解决了纯向量检索召回不准的问题。EvidenceRecallNode将多轮上下文与用户问题组装为检索指令,生成standaloneQuery避免歧义。支持向量+关键词混合检索,通过DynamicFilterService按agentId/type元数据过滤,分为business_knowledge和agent_knowledge两类文档。配置spring.ai.alibaba.data-agent.vector-store.enable-hybrid-search即可开启混合检索,让AI拥有老员工的业务直觉。
执行引擎
容器化Python执行引擎赋予DataAgent科学家级建模能力。PythonGenerateNode根据计划与SQL结果生成Python代码,PythonExecuteNode使用CodePoolExecutorService(Docker/Local/AI模拟)执行。默认使用Docker镜像continuumio/anaconda3:latest,执行结果写回PYTHON_EXECUTE_NODE_OUTPUT后汇总。这使得DataAgent不仅能提取数据,还能输出带图表、带算法、带深度预测的高质量产出,突破了纯SQL只能算数的局限。
交互体验
流式输出(SSE)与多轮对话管理大幅提升用户体验。GraphController使用SSE技术实现流式处理,通过TextType标记SQL/JSON/HTML/Markdown等不同类型内容,前端据此渲染。MultiTurnContextManager记录用户问题与规划结果,注入后续请求。配置spring.ai.alibaba.data-agent.llm-service-type可切换STREAM/BLOCK模式,让用户亲眼看到AI思考与推演过程,每一秒都有获得感。
系统集成
MCP服务器发布与多数据源接入让DataAgent具备强大的集成能力。McpServerService提供NL2SQL与Agent列表工具,支持集成到Claude或IDE。多数据源接入通过元数据存储管理MySQL、PostgreSQL等各类数据源,BizDataSourceTypeEnum定义类型,对应的Accessor负责不同数据库协议访问。同一智能体同一时间仅启用一个数据源,但能纵览全司数据,成为数据孤岛的终结者。