先说三个数字,你大概都刷到过。
C罗的“身体年龄28.9岁”,是去年5月他跟WHOOP创始人对谈时亮出来的,今年世界杯期间被顶上热搜。但同一件事,另一批笔记和截图里给出的读数是29.8岁。同一个人,同一次测试,流传出两个版本。小红书微博

再看普通人的。有博主晒出WHOOP界面:戴了一个月,身体年龄从28.9岁变成32.4岁,不仅凭空老了3.5岁,还正在以1.4倍速持续衰老,而App上同时挂着一行提示——你的健康寿命读数仍在校准中。她的原话是:“第一次通过可穿戴设备直面生命的流逝。”小红书

还有更长的时间尺度。一位博主晒出自己的生理年龄报告:去年2月22.8岁,今年6月31.1岁,16个月“老了8.3岁”。她在笔记里问的那句话特别实在:“是我真衰老了,还是年龄测得不准?”小红书
也有换了设备就换了结论的:有人戴WHOOP年龄读数减了8岁、“衰老速度”那栏却在加速,以为手环出bug;有人抱怨佳明手表说自己27岁、WHOOP却把她算老了好几岁,“对女生很不友好”;还有人晒出-14.3岁、衰老速度-0.7、号称top0.1%,然后自己补了一句:“首先,这只是个算法。”
这几组数字放在一起,问题就浮出来了:不是你不会看报告,是“生物年龄”这四个字,现在被四种完全不同的东西共用着。而在你没搞清楚手上这个数是哪一种之前,任何“年轻X岁”的结论、任何一次几千块的复测、任何一个基于它卖给你的干预方案,都可能是空的。
这篇文章想帮你把这件事一次理清:这个数怎么来的、噪声有多大、哪些流传的“年轻X岁”根本不能横向比、9月那篇让圈里兴奋了一阵的Nature子刊到底证明了什么、以及你的钱该不该花、花在哪个环节。
第一件事:先分清你手上这个数字属于哪一类
今年“生物年龄”的供给端,扩张速度快得有点夸张。它已经从实验室下沉到了你的手腕、戒指、体检套餐、化验单结账页,甚至护肤柜台和宠物医院。按数据源分,市面上你能拿到的读数基本是四类,成本和能回答的问题差着数量级。
第一类,穿戴设备的估算值。 WHOOP的Age Coach、部分智能手表和智能戒指的“身体年龄”“生物年龄”功能,数据源是心率变异性、静息心率、睡眠、活动量,加上你自己填的问卷。它的优势是天天在算、边际成本为零(你已经付了年费),劣势是它测的其实是“生活方式与自主神经状态”,跟细胞层面的衰老不是一回事。这也是为什么同一个人换块表就换个数——佳明和WHOOP用的模型、权重、人群基准都不同。
第二类,常规血检的表型算法。 用白蛋白、肌酐、空腹血糖、超敏C反应蛋白、血压、血脂这些体检本来就有的项目,套PhenoAge这类算法算出一个数。门槛极低,有临床科普回答提到,简化到只用血糖、肌酐、超敏CRP三项的模型已经在数十万社区人群里做过验证,而且这个“生物学年龄减实际年龄”的差值,本身就是心血管疾病和全因死亡的独立危险因素。知乎
第三类,组学时钟。 DNA甲基化时钟(Horvath、Hannum、PhenoAge、GrimAge、DunedinPACE)、蛋白质组时钟、转录组时钟、糖组学的GlycanAge。这是科研精度最高的一档,但需要专项测序芯片检测,成本高,而且缺少统一检测标准。国内的微基因悦龄Bio⁺、各类长寿诊所的甲基化套餐、美国的Function Health、TruAge走的是这条路。它的输出形态也和前两类不一样:给你的不是一个总数,而是一组分器官、分系统的读数。知乎

第四类,局部与图像类。 护肤柜台的“肌肤生物年龄”检测仪就是典型——兰蔻在上海兴业太古汇做的Cell-Bioprint,深度解析5大肌肤长寿生物指标,然后给你定制护肤方案。同一类里还有AI看面部照片读年龄、AI听你说话30秒估年龄,以及宠物端粒检测。它们的共同点是:测的是某个局部或某个代理信号,然后被包装成“你的年龄”。小红书
分清类别为什么重要?因为四类读数之间不可换算,也不可互相打脸。手环说你老了,不代表甲基化时钟也这么说;甲基化时钟说你年轻5岁,也不代表你的皮肤检测仪同意。
第二件事:噪声有多大,决定了多少“效果”是假的
这是最容易被跳过、却最要命的一环。
前面提到的那个数十万社区人群验证里,有一个数字值得你记住:表型生物学年龄与实际年龄的差值,标准差是8.37岁。标准差8.37岁意味着什么?意味着在这个测量体系下,两个人差值相差三五岁,很可能压根不构成信息;同一个人隔几个月复测差出三四岁,也大概率落在波动范围内。知乎
随便翻一份晒在社交平台上的商业端粒检测报告:生物年龄25.6岁,自然年龄30.00岁,“年轻4.4岁”。看着挺鼓舞人心,但这4.4岁完整落在一个标准差之内。你花几千块测出“比实际年龄小4岁”,然后调整了半年作息、复测变成“小6岁”——这2岁的改善,从统计上讲,你没法证明它不是噪声。

那位16个月“老了8.3岁”的博主,恰好卡在这个量级上。她的困惑之所以无解,是因为波动可能来自至少四个完全不同的源头:技术噪声(采样、批次、芯片差异)、算法版本更新(服务商换模型,你的历史数据就失去可比性)、真实生理状态变化(生病、极端压力、体重剧烈波动),以及一个统计上很常见的陷阱——回归均值。第一次测出极端年轻值的人,第二次天然会往中间回,看起来就像“突然老了”。
穿戴设备那一侧还多了一层:WHOOP这类功能的读数本身有生成和更新周期,需要一段时间的数据积累才会首次出数,之后按周更新,而且不同窗口(30天、6个月)算出来的口径不一样。设备自己都在说“我还在校准”,你却拿它的两次读数当疗效对比,这一步就跳得太快了。
所以第一条实用建议:任何短于6个月的复测,基本是白花钱。有意思的是,市场自己也是这么设计的——Humanity的用户调研里,80%的人打算6到12个月复测。这个周期不是拍脑袋,是行业里少数几个诚实的数字。小红书
第三件事:feed里那些“年轻X岁”,用的是不同的尺子
今年微博和小红书上,“生物年龄”成了一个万能单位,什么东西都能折算成“年轻几岁”。我把刷到最多的几条摆在一起,你会发现它们根本不能横向比较:
“每周3小时力量训练,生物年龄直接年轻7.8岁”。微博
“每周进行90分钟力量训练,生物衰老可减缓3.9年”“每周三次、每次一小时,生物年龄甚至可比实际年龄小近8岁”。微博
“每周至少参加一次艺术活动的人,生物年龄要比不参加这类活动的同龄人平均年轻1岁”——伦敦大学的研究,还被解读成“逛画展比运动还有效”。微博
“高质量碳水,生物年龄最多年轻1.2岁”
“睡眠习惯不规律,生物年龄老了9个月”
看到问题了吗?同一类干预(力量训练),在同类内容里能给出3.9年、8岁、7.8岁三个数字,有的还是“大脑年龄”。这不是造假,这是不同研究用了不同的时钟、不同的人群、不同的暴露定义:有的用甲基化时钟,有的用表型年龄,有的用器官特异性时钟,有的测的是大脑影像年龄;有的是横断面比较(爱运动的人本来就更年轻),有的是干预试验(练了之后确实回退);效应量的置信区间也从来没被写进标题。
《Nature Medicine》今年有一项工作把这件事摆到了台面上:研究者把51项纵向干预研究、16种表观遗传年龄时钟和94项DNA甲基化指标放在一起比较,发现不同年龄时钟的训练目标根本就不一样——有的更接近日历年龄,有的侧重疾病与死亡风险,有的估计的是衰老速度。同一份样本,完全可能得到不同答案。这不是某家厂商测得不准,这是这个领域当前状态的准确描述。小红书
横断面研究和干预研究的差别尤其致命。“爱逛画展的人生物年龄年轻1岁”,很可能只是说明受教育程度高、收入稳定、社交活跃的人本身衰老更慢——画展是结果的相关物,不是原因。把它读成“我去逛画展就能年轻1岁”,是把观察性证据当因果用了。

而“衰老时钟之父”Steve Horvath自己的表态,比这些标题保守得多。他的核心观点是:衰老时钟应该被看作衡量工具,而不是最终结论。指标变化不等于生命质量改善——如果肌肉没增强、认知没改善、疾病风险没降低,那个下降的读数可能只是个伴随变化。知乎
顺便说一句,网上流传一份据称来自Horvath播客的整理,里面有很具体的说法:他们没用饮食问卷,而是直接测血液里的类胡萝卜素浓度,得到的相关性是蔬菜-0.3、吸烟+0.4、每日步数仅-0.1;补剂部分则提到omega-3是唯一单独使用就有效的,维生素D只对本来就缺的人有用。这些数字方向上与他一贯的观点一致,但属于二手转述,我没能在论文原文里逐条核到,你如果要拿它当行动依据,得自己去找原始出处。这里只提醒一个反直觉的点:如果“步数”与衰老速度的关联真的只有-0.1,那“日行万步”作为抗衰处方的强度,可能远低于我们以为的水平——真正有效的运动干预,量得大到能改变心肺功能。小红书
时钟多到什么程度?今年9月《Nature Communications》发表的OmniAge工具包,一口气整合了413种衰老组学生物标志物、覆盖12个不同类别,并在3个独立大队列中验证。从传统表观遗传时钟、有丝分裂时钟、克隆性造血代理标志物,到因果时钟、细胞类型特异性时钟、单细胞转录组时钟,全都在里面。研究者自己的定位很克制:OmniAge作为探索性工具,用来评估大量衰老生物标志物、辅助发现新假设。小红书

413种。而你手上那份报告,只用了一种。
第四件事:9月那篇Nature子刊,值得高兴,但高兴的点跟标题不一样
9月上旬,《Nature Biotechnology》登了一篇让整个圈子都转了一轮的研究,主角是英矽智能的AI设计药物Rentosertib——它锁定的TNIK激酶是一个同时调控肺纤维化与衰老通路的双效靶点,药物首要适应症是特发性肺纤维化,目前已进III期。研究把它此前IIa期试验的血清样本重新拿出来,用6种方法学各不相同的蛋白质组衰老时钟(ProtAge、OrganAgechrono、OrganAgemortality、PAC、ipfP3GPT、PAOPAC)同时算了一遍。知乎
结果是:研究纳入了42名参与2a期试验的IPF患者,平均年龄67.1岁,在用药前、2周、4周、12周分别采血,检测近三千种蛋白;所有时钟下治疗组的生物学年龄相比基线都呈下降趋势,幅度在3到4年之间,最高降低了6岁,而安慰剂组几乎没有变化,甚至出现轻微上升。研究者还发现一个耐人寻味的错位:60mg 每日一次组的患者肺功能改善最明显;而衰老时钟中,30mg 每日两次组的抗衰信号最稳定,一致性也最高。这提示抗衰效应可能不完全是疾病改善的副产品。知乎
这六套时钟的分量在于它们互相独立:这六套模型互不共享特征、互不共享训练数据,能在同一个患者群体上同时指向“更年轻”。这比绝大多数“单一时钟年轻几岁”的宣传更有说服力。今日头条
有报道还提到,研究团队把患者给药后的蛋白变化轨迹,和英国生物银行5.5万余名老年人的自然衰老轨迹做了对比,部分蛋白的变化方向恰好与自然衰老相反。但真正值得高兴的不是“人变年轻了”,而是衰老时钟第一次被正儿八经地装进了正规临床试验。过去抗衰研究最大的困境是:衰老本身并非常规药物注册适应症。你没法拿“变年轻”去申请上市。今日头条知乎
Rentosertib走的是另一条路:按正规临床试验的要求推进、评估肺纤维化疗效,同时在试验中预设衰老相关的生物标志物作为探索终点,在治病的同时收集抗衰老数据。这个模式如果能跑通,比任何一款补剂都重要。知乎
所以看这类新闻,记住三个不等式就够了:时钟读数下降 ≠ 人变年轻;六个时钟结论一致 ≠ 六份独立证据(模型各自独立,但跑的是同一批42个人的同一批血样);AI设计出药物 ≠ AI攻克了衰老。生物学年龄下降不等同于实际寿命延长,目前支撑抗衰相关结论的仍是IIa期的小样本探索性分析,III期临床才是真正决定能否上市的试金石。知乎
第五件事:反证这边,有三条你可能没刷到
第一条,今年7月被广泛转述的一项芬兰研究,结论对检测行业很不友好。坦佩雷大学团队在Aging Cell上报告:对1108名34-49岁中年人随访7-9年发现,传统风险因素(年龄、性别、吸烟、饮酒、腰臀比、BMI)组合模型在预测非传染性疾病发病率方面优于任何包含表观遗传时钟(Horvath、Hannum、PhenoAge、GrimAge、DunedinPACE)的模型。更关键的是后半句:在调整传统风险因素后,表观遗传时钟均不再具有显著预测价值。这句话翻译成消费决策就是:如果你的目的是预测自己会不会得病,一支卷尺加一份常规体检,可能比一次几千块的甲基化检测更有用。研究者自己的措辞也很克制——表观遗传时钟若要应用于临床或个人健康监测,需明确其相对于简单、低成本传统风险因素的附加价值。知乎
第二条,监管这边没有捷径。FDA 并未将衰老归类为一种疾病,没有疾病分类,企业就没法用替代标志物去加速药物研发进度。而一个合格的替代终点,得像糖化血红蛋白之于糖尿病、LDL-C之于心血管事件那样,既有机制合理性,又有临床证据证明“指标变化能预测临床获益”。知乎
目前的生物年龄检测普遍还没到这一档:该领域仍缺乏共识性的验证标准、跨人群的普遍适用性以及作为替代终点进行临床转化的充分证据。而钱已经先进来了:仅在2026年第一季度,该领域就获得了约37.4亿美元的融资金额,同比飙升56%。知乎
估值建立在一个尚未被证实的治疗应用假设上,这个脱节不是第一次出现。在 UBX0101 用于骨关节炎的 II 期临床试验中未表现出优于安慰剂的效果后,UNITY 的市值大幅下跌,2020年那波senolytics热潮就是这么退掉的。知乎
第三条,商业模式本身有利益结构问题。8月25日,英国长寿科技公司Humanity和美国检验巨头Quest Diagnostics宣布合作:你在Quest约2000个采样点做完指定的血检套餐,结账时多勾一个框、加29美元,就能拿到生物年龄和各系统拆解,不用二次抽血。用户必须先购买399至500美元的指定套餐,而市面上同类生物年龄检测多在249至499美元。29美元能成立,是因为抽血和化验成本已经被套餐覆盖了,这29美元装的只是一次计算。这个定价很聪明,也很说明问题:稀缺的从来不是模型,是渠道和挂载率。小红书
国内的路子是另一种。2025年11月,美年健康在上海发布“生物学年龄评估—血液学时钟”,官方口径是基于常规体检数据、依托亿级健康大数据与AI算法,突破了传统衰老评估依赖高成本组学检测的技术壁垒。用户侧的说法是上传三个月内的体检报告就能评估,同时还会拿到AI生成的营养、运动、补剂干预方案——评估与干预出自同一家。这在商业上很顺,在证据上是个需要你自己打折扣的结构。36氪小红书

民间那一端的捆绑更直接。有人在小红书分享自己被安利的服务:交一笔会员费,里面包含两次抽血测生物年龄,测完根据结果出一套改善方案,怎么吃、怎么动、补什么都安排好,然后每天打卡。她的结论是最后算下来只花了一顿饭钱。这套模式的有效性可能真来自打卡和陪伴,但你要清楚自己付的钱买的是哪一部分:是那个数字,还是数字后面那套你本来也可以自己执行的方案。长寿诊所那端也有类似观察:检测卖得很贵、报告很厚、第一次成交不难,难的是客户不愿意再来。小红书
顺便,产品声明本身也值得看一眼。这类产品明确写着:这是一项“一般健康类产品”,不是诊断工具,不构成医/疗建议。渠道长得像正规医疗基础设施,产品却主动声明成非医疗——这是它能在现行监管下跑通的前提,也是你解读结果时该有的心态。小红书
第六件事:钱到底怎么花,分三种人
先说结论:对绝大多数人,“生物年龄检测”目前是个研究工具,不是疗效证书。但“不值得”不等于“全都别碰”,分人群看差别很大。
如果你只是想知道自己老得快不快、该改什么——先做免费的,这一步能覆盖80%的价值。
拿出最近一次体检报告,把白蛋白、肌酐、空腹血糖、超敏CRP、血压、血脂这几项找出来,套公开的PhenoAge类算法算一遍,成本0元,而且用的是有大样本验证的表型体系。
量腰围、算腰臀比、称体重。就是芬兰研究里那套赢过所有甲基化时钟的指标。
记录睡眠规律性(入睡时间的波动比总时长更容易被忽略)、测静息心率与HRV趋势——这些你手上的设备已经在收了,不用额外买。
有条件加一项握力或步速,这是老年医学里公认的“内在能力”指标,便宜、可重复、临床意义明确。
把这四项做齐,你对自己衰老速度的判断精度,很可能已经高于一次单点的组学检测——因为它们是可持续追踪的趋势,而检测是一次性的快照。
如果你是这几种情况,花钱测一次基线是合理的:
40岁以上,正在计划一项大额、长周期的干预(比如准备长期吃某类补剂、开始系统训练、调整饮食结构),需要一个可对比的起点;
有明确的慢性病家族史,想在自己的常规体检之外多一层分子信息,并且愿意把这个结果拿给医生看、而不是拿给销售看;
你本身就是数据型人格,清楚自己在买“研究工具”,不会因为一个数字焦虑或加购。
这种情况下,选型比省钱重要:优先选明确告诉你用的是哪个时钟、哪一版算法、什么样本类型、什么检测平台的服务;问清楚复测是否用同一套流程;避免那种只给你一个漂亮总分、不披露方法的“专有黑盒”——行业里被批评最多的恰恰是这一点,因为黑盒算法之间无法跨试验对比。
如果你是这几种情况,建议先别花这笔钱:
指望检测结果告诉你“下一步该买什么方案”,尤其是评估和干预来自同一家的时候;
想用它验证一个刚做了几周的干预,6个月内复测基本被噪声吃掉;
把手环上的“身体年龄”当成疗效证据去调整用药或补剂;
准备做端粒长度检测。很多人做抗衰体检,大概率都被安利过「端粒长度检测」,宣传词往往是测细胞年龄、预判寿命、逆转衰老。但外周血端粒长度和真实衰老状态的关系很弱,而它给你的产出,往往就是这么一页:检测方法、T/S比值、两个百分位排名,然后是一个“生物学年龄”数字。你很难据此做出任何具体决定。小红书

价格锚点,方便你判断报价合不合理: 美国市场同类生物年龄检测的常见区间是249到499美元;Quest渠道的加购价是29美元,但前提是你先买了399到500美元的套餐——算总账其实是429到529美元。国内的甲基化衰老检测套餐多在数千元级别,具体报价随项目和解读服务浮动较大,下单前一定要问清包含几个时钟、是否含医生解读、复测是否打折。
至于复测:6到12个月一次,同一家、同一时钟、同一采样条件(尽量固定季节、避开急性疾病和剧烈减重期),否则你比的是流程差异,不是身体差异。
最后,值得继续盯的四个信号
这个领域今年最大的变化,不是出现了某个更准的时钟,而是“证明”这件事开始被认真要求了。接下来这几条,比任何一次检测报告都更能改变你的决策:
Rentosertib的III期结果——如果它成了,“把衰老时钟作为探索性终点嵌进疾病试验”就会变成行业标准动作,抗衰研究第一次有了合规的证据生产线。
监管态度——FDA会不会在某个具体疾病(心血管、代谢、神经退行)上接受衰老时钟作为替代终点。一旦有一个适应症跑通,通用健康寿命宣称的路径就打开了;反之,这个行业大概率要经历一次估值修正。
标准化框架能不能落地——OmniAge这类把413种标志物放进同一坐标系的工作,如果真被广泛采用,“我测的这个数”才有跨机构可比性。目前还是碎片化的专有算法互相打架。
国内检测会不会走向规范披露——你什么时候能在下单页看到时钟名称、算法版本、验证队列和复测标准,这个市场才算从卖故事进入卖证据。
回到最开头那个问题:C罗到底28.9岁还是29.8岁?说实话,这个不重要。重要的是那个数字来自一只运动手环,来自生理信号和自评问卷的模型估算,它能说明这位41岁的运动员身体状态极好,但它不能证明任何补剂、任何训练法、任何一台检测仪对你也有效。
你的生物年龄今年几岁,可能真的没那么要紧。你手上这把尺子是什么做的、误差有多大、下一次还是不是同一把——这才是要紧的事。