一天,222次转发。
8月17日,一条微博在数据圈传开。帖子原文写道:“微软悄悄开源了市面上最好的AI数据分析工具之一。它叫做data-formulator。”微博222次转发、近300个赞,更扎眼的是评论区——清一色的"@我的印象笔记",大家默默收藏,准备回去上手试。
这是什么工具,值得这么热闹吗?我把微博、知乎、小红书和GitHub相关资料翻了一遍,今天一次说清。
一、Data Formulator是什么
Data Formulator是微软研究院开源的AI数据分析与可视化工具,2025年初首次发布,MIT协议,免费。当时它的定位更偏"AI可视化小工具",有过一波关注,但没出圈。
变化发生在这一年,三个节点:
5月底,0.7版本发布,定位从"可视化工具"升级为"企业级数据分析系统",数据连接、智能体引导探索、可视化优化三件事打包。知乎
8月初,微软研究院和中国人民大学团队发布可视化中间语言Flint,成为Data Formulator的核心能力之一;
8月17日,一条微博让它出圈,收藏、转发激增。

二、它和"把Excel丢给聊天AI"有什么不同
用ChatGPT、DeepSeek、Kimi分析过表格的人,都懂三个痛:
第一,文件不敢传。公司销售数据、用户名单,发到聊天框就出了自己的手,用不用来训练另说,心理上先输一阵;
第二,会忘。好不容易让它把数据清洗干净,换个角度再问,它可能退回原始数据从头算,前面的工白做;
第三,图改不了。AI给的是一张图或一段代码,换个配色、调个坐标轴,就得重新生成一遍。
Data Formulator的设计,基本是冲着这三个痛来的:
数据可以不出你的电脑。CSV文件、Postgres、BigQuery,甚至实时URL都能接,数据留在本地或自己的库里。微博
有"固定"(pin)功能:把清洗后的结果钉住,后续操作都基于它继续,不会退回原点;
给你的不是图片,而是"可编辑的图表"。把字段拖到x轴、y轴、颜色上,图表就出来了;想试不同版本,给任意图表拉个分支单独探索,像图表的"另存为"。
背后的机制是:AI代理在底层写SQL、做数据转换,但递到你手里的不是代码,而是可编辑结果。微博这正是Flint要解决的问题——过去AI生成图表是直接写底层绘图参数,容易出错、你也不好改;现在你只说"想画什么",编译器自动补齐坐标、刻度、布局、配色的设计细节,还能同时编译到Vega-Lite、ECharts、Chart.js,一份规格多端输出。知乎

三、实际上手是什么样
有知乎用户发过一篇完整实测,场景很有代表性:医院运营管理,接入的是国产模型MiniMax。
数据是一份41430条住院记录、32个字段的CSV。知乎提问全部用中文,直接发问:
“分析2023年各月份医疗总费用和DRG付费总额的趋势对比”——响应约30秒;
“哪个科室平均住院天数最长,各科室DRG付费总额分布如何”——约35秒;
“找出病例数最多的前10个DRG分组”——约28秒,自动选了横向条形图。

最后,系统把历次图表自动拼成一份完整报告,支持导出PDF。知乎从环境搭建到7个问题,全流程一气呵成。

四、三个自检,决定你该不该装
自检一:你是不是每周都要碰表格、但不写代码的人?运营、电商、财务、产品、行政。前面说的三个痛你全中,这个工具基本是照着你的场景做的。
自检二:你的数据能不能出你的手?Data Formulator支持本地部署,带上自己的模型密钥就能跑,公司数据不必上传给聊天AI。微博这一条,就把很多云端聊天工具排除在外了。
自检三:你能不能接受"装一个Python包、填一个API Key"这两步操作?工具本身免费,成本在你接入的大模型API上,接国产模型比较便宜。但如果你完全没碰过命令行、也不打算碰,别硬上——它现阶段不是零门槛工具,偶尔看一次表格的需求,聊天AI反而更省事。
上手路径,实测过的两行:
pip install data_formulator 安装,python -m data_formulator --port 5567 启动(装了uv也可以直接 uvx data_formulator --port 5567),在.env文件里配好大模型API Key,浏览器打开就能开始提问。
五、两个值得继续盯的信号
一是Flint发布了MCP服务器(flint-chart-mcp),意味着这套出图能力能被其他AI助手直接调用,未来你在用的办公AI可能直接喊它画图;
二是0.7的企业级方向。它会不会出免安装的网页版,决定它能否真正触达不碰命令行的打工人。在那之前,它还是一个有点极客味的开源工具。
一句话总结:Data Formulator不是"Excel替代品",而是一个介于"聊天AI"和"BI软件"之间的AI原生数据分析工作台。如果你早就受够了在聊天框里让AI分析表格,它是目前最值得试的开源选项之一。