“21亿只白鹭”混进Science论文:拍鸟提交记录的人,这份自检清单比段子重要

源自20位全网作者

08:27

上周末,观鸟圈炸了。一篇8月20日发表在《Science》上的研究文章,几天内被统计学者、中国动物学会鸟类学分会和全网观鸟者连番质问:它使用的观鸟数据里,混着一条"2,147,483,647只白鹭"的记录。微博这个数字,恰好是32位带符号整数的上限2^31−1。也就是说,混进数据库的不是鸟群,而是一个计算机变量的天花板。

很多人当段子看。但如果你是拍鸟、观鸟、往"中国观鸟记录中心"提交过记录的人——或者正打算提交——这个段子和你有直接关系:这篇论文的鸟类数据,全部来自这个大家日常上传记录的公民科学数据库,你提交的每一条记录,都可能成为下一篇顶刊论文的原材料。

这篇内容把事件时间线、几个异常数字的解码讲清楚,最后留一份提交自检清单。

十天里发生了什么:从顶刊发表到全圈质疑

  • 8月20日:《Science》第393卷第6813期发表这篇研究文章,第一作者张惠明(南京信息工程大学),通讯作者包括蔡银寅、斯坦福大学李善军等,题目即"中国的太阳能扩张政策降低了鸟类多样性"。Science论文的核心结论,是光伏政策强度每提高一个标准差,当地鸟类的Shannon多样性指数平均下降约2.1%。知乎

  • 8月21日:南京信息工程大学、中央财经大学金融学院等公众号先后宣传这项成果,强调"Science正刊研究长文"。

  • 8月23日:赖江山、张霜等学者发表《关切》,直指论文核心变量PSI(光伏政策强度指数)的独立解释贡献Within R²只有0.0007,论文却只在表1里给出整个模型的R²=0.2715;和观测时长(Duration)比起来,PSI的效应几乎可以忽略。

  • 8月25日:中国动物学会鸟类学分会组织专家发声,从数据质量、时间变化、空间分布、异常值处理、指标解释五个方面提出质疑,结论相当明确:现有数据使用缺陷与统计偏差,不能支撑"中国的光伏扩张政策降低了鸟类多样性"。

  • 8月26日至今:社交媒体上讨论破圈,网友顺着数据库扒出一条条异常记录,"21亿只白鹭"成了这周最出圈的科研梗。

“21亿只白鹭”混进Science论文:拍鸟提交记录的人,这份自检清单比段子重要

那三个数字:不是鸟群,是计算机的"原形"

鸟类学分会发声里最实锤的部分,是点出了论文数据集中三条明显的错误记录:

  1. 白鹭,数量2,147,483,647只,观测时间2015-03-21 23:59:45,广东江门新会区银湖湾湿地;

  2. 白鹭,数量6,111,141只,2022-04-14 11:59:21,广州荔湾区增埗公园;

  3. 红嘴蓝鹊,数量1,333,333,333只,2022-05-03 10:00:28,广州越秀区雕塑公园。

细节很说明问题:第一个数字就是INT_MAX,程序员一眼认出的整数上限;13.3亿这种整齐数字,也是典型的占位值。更离谱的是时间——白鹭是昼行性鸟类,记录时间却是23:59:45,深夜零点前一秒,同样是"系统默认值"的味道。

更不可思议的是,这三条记录没有被作为异常值剔除,原封不动流进了分析。后果是论文附表S5里,"非特有、留鸟、非保护、树巢、肉食/杂食、小群活动"等类别的鸟类总个体数全部超过30亿只。鸟类学分会的原话很直接:在进行数据分析之前未剔除如此明显的错误数值,表明作者未进行有效的数据质控。微博

别白看段子:这不是"观鸟数据没用"

这里要泼一盆冷水,免得大家把方向看反。

鸟类学分会质疑的是"这篇论文对数据的用法",不是观鸟数据本身的价值——发声里明确说,审查的是现有数据和识别策略是否足以支撑较强的因果结论,并非否定观鸟数据的研究价值。统计学者的关切同样指向回归表的解释方式。问题出在"原始数据没做质控就进了论文",而不是"社区记录没有意义"。

事实恰恰相反:这次事件本身证明,公民科学数据已经直接进入顶刊研究的视野。一个由观鸟者、拍鸟者一条条记录堆出来的数据库,如今和《Science》级别的研究、和新能源政策的学术争论直接挂钩。数据的地位变高了,"随手一填"的成本也就变高了。

而拍鸟的人,正是这个数据库最重要的供给者之一:你每条记录里的鸟种、地点、时间、数量,你按下快门留下的取证照片,共同构成数据库的原材料。论文里最重要的控制变量Duration,就是你提交记录时填写的观测时长。知乎

“21亿只白鹭”混进Science论文:拍鸟提交记录的人,这份自检清单比段子重要

事件之后,提交一条记录先做这几项自检

结合这次暴露的异常值类型,和观鸟社区讨论多年的记录规范,整理一份提交前的自检清单。花不了多少时间,但能让你的记录不成为下一个"21亿":

  1. 数量:宁可估,不要瞎填。大群用网格法、分块估读给出数量级(比如"300—500只"),不填未经核实的精确大数,更别让输入框停在系统默认值上;实在估不了,记清楚鸟种、在备注里说明,也比留一个离谱数量强。

  2. 时间和时长:提交前多看一眼。昼行性鸟配23:59、单日时长超过24小时、一个月累计上千小时,都是这次被扒出来的异常值类型;记录再真实,时间不合逻辑,也会让整条记录在研究者眼里变成"噪声"。

  3. 地点要和数量互相印证。"13.3亿只红嘴蓝鹊"之所以离谱,一半原因在地点是一个几十公顷的城市公园。真拍到大群或罕见鸟,把地点落在实际观察点,别让一个湿地级的大数挂在一个公园级的点上。

  4. 罕见鸟、大群附上取证照片。照片是公民科学里最有说服力的质控材料:鸟种、数量级、时间和环境,一张照片就能交叉验证。拍鸟的人在这里有天然优势——你的快门,本来就是记录的一部分。

  5. 定期回看自己的记录。每次提交前扫一眼数量级和时间逻辑,一分钟的自查,比事后被当成异常值剔除体面得多。数据库没有义务替每个数字背书,但提交者有。

“21亿只白鹭”混进Science论文:拍鸟提交记录的人,这份自检清单比段子重要

还没完:值得继续观察的三个信号

这件事还没到大结局,建议盯住三个后续信号:论文作者团队是否对异常值作出更正或回应;《Science》是否会发布编辑关切或更正;中国观鸟记录中心会不会启动一轮数据清理、收紧提交校验。

无论结果如何,有一点已经确定:公民科学数据"随手填"的时代过去了,你提交的记录,离"科学"从来没有这么近。下次按下快门、提交记录的时候,把它当回事一点——这既是对那只鸟的尊重,也是对每一个会用这份数据库的人的负责。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章