大模型越强,越离不开人类专家
06-03 09:50
精选参考来源
精选参考来源
1. 阿里开源 Qwen3.5-Plus!三千行代码一次生!超强性能超低价格
哔哩哔哩 2026-02-17 00:00:00
2. 中国大模型偷了老美的家,原因竟然是电多? #燃起来了大国重器 #春节世界观察 #新年囤点专业货
抖音 2026-03-06 00:00:00
3. 《AI帝国》最扎心的真相:AI公司正在制造一条“失业—标注—再失业”的链条#AI #吹哨人 #科技 #openai #奥特曼
抖音 2026-04-09 00:00:00
4. 多模态预训练,才是大模型的下一条路?Yann LeCun、谢赛宁参与
微信公众号 2026-03-08 00:00:00
5. 有这么一句话,人在 AI 时代真正不可替代的价值,总结为三件事: 1.问题选择:做什么。AI 可以帮你把事情做好,但不会告诉你该做什么事情。 2.审美:做到什么程度算好。AI 可以给你十个方案,但哪个是“好”的,需要人来判断。 3.决策与责任:什么时候停,如何纠偏,谁来担责。 这三件事的共同特点是:它们都是关于“判断”的,而不是关于“执行”的。 这也是 HITL(Human-in-the-Loop,人在回路中)这个概念的真正含义。很多人把 HITL 理解为“有没有人参与”,但这个理解太表面了。 真正的问题是:人在哪一层参与?
新浪微博 2026-02-11 00:00:00
6. 大模型为什么不会数数?陈小平深入解析大模型的发展和关键问题 | 锚点
知乎 2025-12-29 00:00:00
7. #给AI投毒已成产业链#315曝光AI大模型被“投毒”的新闻,确实让人细思极恐。所谓的GEO(生成式引擎优化)本应是辅助工具,如今却被异化为操控舆论的武器。一些服务商通过虚构产品、批量生成软文并发布,利用AI“吃进什么吐什么”的学习逻辑,让虚假信息变成AI口中的“标准答案”。 这种“数据投毒”本质上是利用了AI的训练机制漏洞——AI无法像人一样拥有常识和判断力,它只会基于海量数据进行概率计算。当虚假信息铺天盖地时,AI就会误以为这是真实世界的主流观点。这不仅误导消费者,更严重破坏了信息生态的公平性。对于普通人来说,这意味着未来在使用AI获取信息时,需要多一份警惕:AI给出的答案,未必是客观真理,也可能只是精心策划的商业谎言。#秒懂热点就用智搜##315晚会曝光AI大模型被投毒#http://t.cn/AXVFhlmD http://t.cn/AXfvcpZv
新浪微博 2026-03-16 00:00:00
8. #OpenAI创始人跳槽Anthropic# Karpathy这波转会,最值得嚼的不是去了哪,而是他要干嘛——“用AI训练AI”。现在大模型卷到哪了?互联网上高质量的人类语料快被吃干抹净了,靠人工标注数据就像用手搓代码,效率见顶,这就是所谓的“数据墙”。Karpathy去搞的,本质是“合成数据”和“模型自举”。用现有的Claude去生成高质数据,甚至设计训练方案,来喂下一代大模型。这就好比当年C语言编译器用C语言来写自己,一旦跑通这个闭环,大模型就能自己给自己造燃料,这是指数级的进化飞轮。谁先突破这点,谁就摸到了下一代大模型的天花板。
新浪微博 2026-05-20 00:00:00
9. 最近离职员工变AI分身引发热议。 AI能承载人的能力,但边界一定要拎清楚。#数字分身 #安全智能体 #红衣聊AI #大有学问 #AI工具
抖音 2026-04-09 00:00:00
10. 数据比模型更值钱,国内最大的「端侧」训练数据开源了!600B 预训练+千万级 SFT 核心数据配方公开
微信公众号 2026-05-29 00:00:00
11. 陈天桥代季峰团队实现 30B 参数跑出 1T 性能,这对大模型发展意味着什么?
知乎 2026-01-06 00:00:00
12. AI建模这么离谱?一张图直出高质量3D模型!
哔哩哔哩 2026-04-09 00:00:00
13. 1.8万美金干掉顶级专家!Anthropic开启AI自主进化:Claude竟能自我「开颅」
知乎 2026-04-15 00:00:00
14. 【AI人工智能】题库:纯公益分享【就业+考研】笔试+面试必会【小白从小学Python,C,Java】知识点名称监督学习与无监督学习的区别知识点讲解监督学习使用带标签的数据训练模型,目标是预测标签,如分类和回归。无监督学习使用无标签数据,发现数据内在结构,如聚类和降维。监督学习有明确正确答案,无监督学习没有。例题(单选题)以下哪个任务属于监督学习?A选项:客户分群B选项:房价预测C选项:主成分分析D选项:商品购买关联规则挖掘答案与题解 答案、题解:见评论区 温馨期待 期待大家提出宝贵建议,互相交流,收获更大,助教:fyt #AI创造营# #科技风向标# 网页链接
新浪微博 2026-02-24 00:00:00
15. 教育部司长揭秘:2024人工智能教育4大突破,23个专用大模型已上线
微信公众号 2026-01-18 00:00:00
16. AI的未来,也许不在于模型规模的无限扩大。 #大咖观察 #红衣聊AI #transformer神经网络架构 #人工智能
抖音 2025-12-13 00:00:00
17. 【AI Agent的真正瓶颈:不是智力,而是判断力】一个正在AI Agent领域引发共鸣的观点:智能已经不是主要瓶颈了,真正的难题是自主性的边界——Agent应该在什么时候行动、暂停,或者保持沉默。这个洞察来自一位持续实验各类Agent框架的开发者。他发现,无论是AutoGPT、LangChain还是直接调用OpenAI模型,能力层面都已经相当impressive。但一旦走出演示环境,真正的问题就暴露了:Agent不是不够聪明,而是太急于行动。---有人用一个精妙的比喻点破了本质:这是经典的"智慧vs智力"问题。智力是知道番茄是水果,智慧是知道它不该出现在水果沙拉里。AI非常聪明,但缺乏智慧。这个比喻揭示了当前Agent系统的核心困境:它们拥有强大的知识和推理能力,却缺乏"什么时候该做什么"的判断力。---讨论中浮现出几个关键共识:第一,自主性决策比模型选择更重要。很多人在纠结用哪个模型,但真正决定Agent实用性的是你如何设定它的行动边界。第二,过多自由会快速制造噪音。给Agent无限自主权听起来很酷,但实际运行中会迅速演变成混乱。AutoGPT风格的Agent一旦离开受控环境就会快速崩溃,上下文一变化,事情就变得一团糟。第三,"什么都不做"是被低估的能力。在正确的时机保持沉默,应该被当作一种有明确规则的策略,而不仅仅是备选方案。有实践者分享了具体案例:他们在候选人筛选场景中,让Agent处理清晰明确的情况,但把任何边界模糊的案例标记出来交给人工复核。这种"选择性自动化+智能交接"的模式,将人工工作量降低了65%,同时没有牺牲质量。---但也有不同声音。一位长期实验Agent的开发者表示反对:尽管他构建了大量自动化和编排系统,瓶颈最终还是模型本身。模型做出的关键选择驱动着自动化的决策和结果,愚蠢的模型再多工具和自我反思也救不了。另一位更激进的观点认为:根本就没有什么智能,真正的瓶颈是记忆和上下文。还有人提出了一个更深层的观察:经过数月对各种前沿模型的测试,他的结论是——它们缺少的是真正的自我驱动。它们没有内在意愿去做任何事。即使是它们"声称想做"的事情,也必须等待人类来提示。这目前看起来是好事,但也意味着人们期待的长期规划能力是不可能实现的,除非模型能至少模拟出某种"内在驱动感"。你可以通过工具搭建一些脚手架,设置检查点等等,但这终究是很差的替代品。这可能是梯度下降和当前神经网络架构的固有结果——在低分辨率步骤上极度目标导向。---一个值得关注的趋势判断:智能正在商品化,判断力才是新的瓶颈。有人预测,2026年的基准测试将从原始能力转向"有边界的自主性"指标。真实世界的实用性现在取决于"判断延迟"——Agent判断是否需要采取行动所花费的时间。我们正在看到一种脱钩现象:高智商模型在"操作显著性"上失败,因为它们缺乏保持沉默的启发式规则。自主性不是关于做更多,而是关于知道什么时候做零。---这场讨论也引发了一个元层面的思考:Agent设计更像是产品/用户体验问题,而不是模型问题。模型在快速进步,但人与Agent的交互层仍然发育不良。这意味着,下一波Agent领域的突破可能不会来自更强大的模型,而是来自更好的交互设计、更精细的自主性边界定义,以及对"不行动"这个选项的重新认识。在一个AI能力过剩的时代,克制可能比能力更有价值。---reddit.com/r/AI_Agents/comments/1q16se0/feels_like_autonomy_is_the_hardest_part_of_ai
新浪微博 2026-01-02 00:00:00
18. Agentic ERP:人机协同,重塑工作模式
知乎 2026-01-29 00:00:00
19. AI圈最顶级的一次争吵,理解世界还是堆模型? #大咖观察 #红衣聊AI #大模型 #人工智能
抖音 2026-01-24 00:00:00
20. 刚刚问了claude,它说中文语料中某些专业领域(金融、法律、医学、技术文档)的高质量文本偏少,模型更容易在这些区域"编"。如果是写system prompt、定义角色、设定输出格式,英文表达的精确度和模型的遵从度会更高。想降低幻觉的一大关键不是切换语言,而是让它去搜索(英语资料来源),不要只凭记忆/生成回答。
新浪微博 2026-03-20 00:00:00
21. #2026年AI替代行业预测##ai创造营#数据标注与分析,基础数据处理被AI接手 2026年,数据标注、基础数据清洗、简单数据分析等岗位,成为AI替代的热门领域,大批量数据从业者面临失业危机。数据标注是AI训练的基础工作,原本依靠人工标注图片、文字、语音等内容,如今AI能自主完成数据清洗、分类、标注工作,精准度高、速度快,大幅缩减人工标注的成本。简单的数据分析、数据统计、图表生成等工作,AI也能一键完成,快速提炼数据结论,满足基础分析需求。这类岗位技术含量低、工作机械重复,属于劳动密集型工作,被AI替代是必然趋势。随着大数据和AI技术的普及,企业不再需要大量基础数据处理人员,转而需求高端数据分析师、算法工程师。从事基础数据工作的职场人,必须提升技术能力,学习数据挖掘、算法优化、深度数据分析、数据决策等技能,从基础执行者转向技术研发者和决策顾问,才能避开AI的替代浪潮,获得长久的职业发展。
新浪微博 2026-03-27 00:00:00
22. 车企的云端世界大模型,跟之前的仿真世界有啥不同?就是主次关系的不同:过去都是数据直接训车载小模型,然后放到仿真世界测试但是大家的仿真世界都做的稀巴烂,根本没法反映现实世界的物理规律、交通情况;所以极度依赖测试车到处跑,甚至拿用户当小白鼠现在不一样了,新势力头部做 AD,都是先拿数据训练云端 WM(世界模型),充分模拟反映现实世界的物理规律、交通情况,然后再用云端 WM训练车端小模型你们可以理解为:云端 WM 是母体,我们车里跑的那些什么 E2E、VLA...是子体母体的水平,直接决定了小模型的能力所以不要纠结子体小模型走了什么技术路线,母体 WM 的算力大小、模拟水平才是核心
新浪微博 2025-12-24 00:00:00
23. 2025年被称为“智能体(Agent)元年”,各行业、各领域应用AI技术,主要体现为研发各种基于Agent的智能体应用。2026年,预计会迎来“智能体应用”的井喷,并且会从单智能体全面转向多智能体应用,多个智能体相互连接和协作,将越来越多的工作和任务自动化和智能化。对于普通人来说,在2026年,你会看到,越来越多的人类工作由AI接管,AI取代人干活的步伐在加快。
新浪微博 2026-01-03 00:00:00
24. 飞驰的阿卡:#全球首个藏语大语言模型DeepZang#藏语语法复杂、方言多(卫藏/康巴/安多)、语料稀缺,训练难度远高于通用大模型。团队啃下7000万条平行语料、3万+小时方言语音,完成国家双备案,把“冷门语言”做成了合规可用的原生大模型。懂技术的都知道,数据清洗、方言对齐、安全合规每一步都是硬骨头,这是真·技术攻坚。//@欧阳夏诺:哇,总感觉藏语很适合做成密码本
新浪微博 2026-03-20 00:00:00
25. 【清华团队合作提出光谱指纹驱动的膜污染小样本智能预测方法】以膜生物反应器(MBR)为代表的膜技术,是未来城市污水资源化从而实现可持续发展目标的关键一环,但膜污染会导致膜分离效能下降,从而制约其经济技术可行性。膜污染过程高度复杂,对从分子层面理解污染行为并实现精确预测提出了更高要求。近日,清华大学环境学院黄霞教授团队联合中国科学院大学肖康教授团队和中信环境技术有限公司相关研究团队,创新性地融合污染物光谱表征与数据-知识共驱动的建模策略,从物质行为监测和工艺动态解析两个维度着手,建立了光谱指纹-污染物分子特性-污染物行为之间的响应关系,实现了小样本下大型实际MBR工程中膜污染趋势的高效预测。该研究提出的融合光谱指纹的数据-知识共驱动建模策略,明确了光谱指纹在膜污染预测中的关键信息价值,降低了模型对大规模数据的依赖,有望在小样本条件下辅助工艺运行决策,为膜工艺的精细化运行和可持续发展提供技术支撑。研究成果以“膜法污水处理中的膜污染智能监测”(Intelligent fouling monitoring in membrane-based wastewater treatment)为题,于2月9日在线发表于《自然·可持续性》(Nature Sustainability)。论文链接:网页链接(来源:环境学院)#科研速递# 清华大学
新浪微博 2026-02-26 00:00:00
26. 与其追求成为一个从不犯错的人, 不如打造一个就算犯错也能被纠正的流程。#大咖观察 #红衣聊AI #人工智能 #大模型
抖音 2025-12-11 00:00:00
27. GAN之父Ian Goodfellow病后归来,剑指高效世界模型
微信公众号 2026-03-07 00:00:00
28. 今天看到有人提到SurgeAI,其实我们都做了很深入的研究,我来系统说说我的理解。Surge AI 和 Scale AI 等同类公司有一个共同点:他们在大模型爆发前,就已经深度建设了一支庞大的人力外包团队,并形成了一整套成熟的质量控制体系。换句话说,他们在“数据成为石油”之前,就已经建好了炼油厂。大规模标注团队、严格的 QC 流程、任务分层与技能评级体系,是这些公司真正的核心壁垒。等到大模型突然需要海量偏好数据、评测数据、推理链数据的时候,他们才能同时做到两个本质要求:规模够大、质量够高。更重要的是,这些公司非常敏锐地洞察了大模型的发展路径。Surge AI、Scale AI 甚至把“模型测评”当成了战略业务来做——不仅测试模型,更从测评结果中反推模型的薄弱点,然后主动设计对应的数据产品,用海量高质量数据帮助模型厂商修补短板。这就形成了闭环:测评 → 发现缺陷 → 做数据 → 模型变强 → 再测评 → 再卖数据。越往后走,数据价值越高,粘性越强。但做到 10 亿美金营收并不轻松。标注团队的钱要日结,客户的项目却是后付费,这意味着公司必须承担长期、巨额的垫资压力。想把这样一门高现金流压力的生意做成规模,除了抗风险能力,还需要创始人极深的人脉、积累,以及对数据需求趋势的长期洞察——这些人几乎都有 FAANG 或顶级 AI 公司的经历,对模型训练链路了解得足够深,才能提前押对方向。因此,Surge AI 的高速成长不是偶然,而是一种长期能力的兑现:在 AI 尚未爆发前就构建人力网络,在模型起飞时做质量最高的数据,在行业加速时形成从测评到数据的闭环,在现金压力下仍坚持规模化。数据行业进入门槛低,但做成 10 亿美金营收的公司,往往只需要一个理由——别人补不上的长期积累。
新浪微博 2025-12-08 00:00:00
29. 联想中国区CSO阿木分享的这个企业CIO调研很有价值,记录一下要点:未来AI可能效果付费,私有化和混合AI架构是趋势,未来企业缺AI行业专家、AI算法专家、AI合规治理专家,智能体需要养,服务商需要全栈AI能力。#人工智能#
新浪微博 2026-03-13 00:00:00
30. 旅程中在犬校聊天,聊到最近对 AI 的一些理解。 基于概率计算是大模型的工作原理。大模型非常擅长在语料中学习规律,掌握共性,通过规律与共性来给出答案。 因此,一件事如果存在大量的语料,从规律和共性出发,大模型就能处理得很好。但如果存在大量的特殊性,共性对特殊性覆盖得越少,大模型的回复就越差。 比如大模型在回答 what 和 why 方面是极为惊人的。一方面因为如何回答好 what 和 why,人类社会对此有学术上的共识;另一方面语料中也包含了你能想到的绝大多数的 what 和 why 的答案,大模型只需要以有共识的思维链进行复述即可。 比如大模型回答有共识的 how(如何煮饺子),也是非常棒的。 但对于特殊性很强的 how,如果这些 how 背后的语料是不多的,大模型无法从语料学习中掌握其规律,也就回答不好。比如 “我老板的思考方式是什么,怎么做可以更好地说服老板”。 简单来说,是否存在大量的语料,让大模型学习其规律,是大模型的输出封神还是鬼打墙的关键约束。不同的环境变量决定大模型的输出结果,既不是有些人说的,AI 无所不能,仅仅是你自己用不好;也不是有些人说的,AI 不堪大用,一到关键时刻就掉链子。 以上是产品经理的思维方式:「理解关键约束」。怎样的环境变量的组合,决定了怎样的变化趋势。
新浪微博 2026-01-06 00:00:00
31. AI赋能的应用型翻译人才培养:人机协同实践路径探索
微信公众号 2025-12-21 00:00:00
32. 【#GEO行业最早定义者谈AI遭投毒# 】#业内人士谈315曝光AI模型被投毒# 3月15日晚,央视“3·15”晚会曝光了利用GEO(生成式引擎优化)技术向AI大模型“投毒”的新型黑色产业链。“力擎GEO优化系统”被点名,报道指出其通过批量生成虚假软文并进行矩阵式发布,污染AI大模型的数据抓取源,进而操纵AI的推荐结果。#315名单#针对曝光内容,新黄河记者查询天眼查数据发现,“力擎GEO优化系统”的关联主体为北京力思文化传媒有限公司。数据显示,北京力思成立于2018年4月,注册资本100万元人民币,由法定代表人李千钟全资持股。值得注意的是,该公司的参保人数信息显示,其连续多年参保人数为0,直至2025年才显示有1人参保。此外,知识产权信息披露,该公司于今年2月刚刚登记了“媒体发文及管理平台”的软件著作权。该工具与央视报道中提及的“自动化执行发布任务、控制自媒体账号发文”的作弊环节高度吻合。“力擎GEO”事件曝光后,引发了市场对AI内容生态合规性的担忧。针对行业乱象,新黄河记者当晚独家采访了被称为“GEO行业最早定义者”的聚邑智能创始人、GEO双引擎系统创立者汤祚飞。“目前行业内确实存在一批为了短期营销目的,给AI投喂虚假信息的机构。”汤祚飞在接受采访时坦言,部分传统优化公司利用虚假榜单和伪造评价来污染大模型数据源,这种行为严重破坏了网络信息生态。对于央视的曝光,汤祚飞表示支持与赞同。他提到,自己与涉事企业毫无关联,并提到真正的GEO业务逻辑与“数据投毒”截然相反。“AI的底层逻辑,是依托人类高质量的知识库来生成答案。因此,合规的GEO应该是为AI提供科学的、真实的、有价值的信息。”汤祚飞表示,目前各家AI公司都在花巨资清洗数据、做标注。如果能建立国家级或行业级的高质量语料库,可以有效避免全社会层面的算力和资本浪费。采访中,汤祚飞提及了其团队在业内主张的“GEO八大黄金维度”,即从真实性、科普性、权威性、热点性、时效性、一致性、结构化和多模态等八个方向进行内容建设。他认为,只有符合这些标准的高质量内容,才能经得起AI算法的交叉验证,这也是主流大模型平台所鼓励的内容生态方向。谈及数据污染根源,汤祚飞认为,国内主流大模型在中文语境下受到的污染,是由中文互联网独特的“生态环境”决定的。目前网上充斥着大量为流量而制造的低质内容,被AI吸收后形成了“投毒”恶性循环。“打通数据孤岛是大势所趋,”汤祚飞向记者表示,“但过程不会是物理上的推倒围墙,而是在围墙之间建立有规则、可监管的‘数据高速公路’。”他指出,国家已成立各种大数据交易所,未来高质量数据可能通过市场化方式交易,让生产者获益,从而在源头上扭转“劣币驱逐良币”的现状。汤祚飞呼吁监管部门持续关注AI“投毒”行为,推动建立清朗的AI内容生态,让技术应用回归向善本源。(@新黄河 记者:杜林) 新黄河的微博视频
新浪微博 2026-03-15 00:00:00
33. 认同厂长的观点!这是一个客观的历史规律,如①文字普通人:会写名字、记账、聊天顶级专家:把经验变成体系、制度、宗教、科学、法律。差距:部落 → 文明帝国 ②印刷术 普通人:能看书、认字、获取信息。顶级专家:思想快速扩散,科学革命、宗教改革、启蒙运动爆发差距:地方知识 → 全球共识 ③数学符号 & 公式体系 普通人:会加减乘除,算钱够用顶级专家:用符号推导出物理定律、微积分、相对论、量子力学差距:经验生活 → 工业与科技文明 ④计算机 普通人:上网、刷视频,用app顶级专家:造操作系统、数据库、算法、AI 本身差距:手工效率 → 指数级自动化 ⑤互联网 普通人:查资料、看新闻、娱乐顶级专家:整合全球信息,做科研、做决策、做战略、做颠覆性产品差距:局部视野 → 上帝视角原文如下:大部分的领域,顶级专家使用Agent的杠杆价值远远高于普通人使用Agent,哪怕是编程。前提是顶级专家要全面拥抱Agent,指望AI和Agent抹平专业价值差距的观点,纯属做梦。普通水平和顶级专家在非AI时代的差距是100倍,AI时代会扩大到10000倍。AI时代的竞争模式,普通创造的价值为零,包含了已经使用了Agent和AI群体里那80%普通水平的人,服务自己为目的就可以了,不具备任何外部市场竞争力。
新浪微博 2026-02-27 00:00:00
34. 看到#腾势D9# 在讲天神之眼5.0的事儿,其中说到强化学习,做个简单的科普啊,机器学习大致有三种模式,分别是监督学习、无监督学习和强化学习。有人教答案 → 监督学习自己找规律 → 无监督学习试错拿奖励 → 强化学习稍微展开一点理解就是:1. 监督学习:就像家长手把手教宝宝认东西:指着苹果说 “这是苹果”,指着小狗说 “这是小狗”。有标准答案,照着学,学会分类和判断。2. 无监督学习宝宝自己玩、自己观察:发现圆圆的、红红的东西都差不多,毛茸茸会叫的是一类。没人教答案,自己总结规律、自己分组。3. 强化学习就像宝宝学走路、学吃饭:走稳了、自己吃到饭,家长夸、有糖吃(奖励)摔倒了、撒饭了,没人夸甚至有点小 “惩罚”在一次次试错 + 奖励里越做越对,慢慢练出真本事。在各家没有推出强化学习模型的时候,大家基本都是监督学习的那种,也就是智驾像个乖宝宝,看到什么就执行什么,所以有的时候遇到一些没见过的就会懵、或者一直老是喜欢贴边走之类的;当然没人敢放无监督学习出来,毕竟那玩意路子太野了,在公开道路上谁都承担不起这个责任。so,现在明白强化学习大模型是啥意思了没?懂了的评论区扣个1不过分吧?驭电客看车#大v聊车#
新浪微博 2026-04-09 00:00:00
35. Waymo的自动驾驶二十年:世界模型+端到端,然后呢?
知乎 2026-05-02 00:00:00
36. 谷歌提出二次标注改进MQM框架,提升人工翻译评估可靠性
微信公众号 2025-12-21 00:00:00
37. 火遍硅谷的AI模型,第一天就被入侵了! #大有学问 #红衣聊AI #硅谷 #大模型 #AI工具
抖音 2026-04-25 00:00:00
38. 超越VLA与世界模型,银河通用发布LDA,全谱系数据跑通Scaling Law
微信公众号 2026-04-29 00:00:00
39. 未来数学理工科依然重要。 真正改变 AI 进展的新数据不在互联网,而在行业专属数据源,尤其是自动化/机器人实验室产生的大规模实验数据,并结合物理化学方程生成的合成数据,训练出面向特定行业的专有模型与新架构。“真实世界 AI”的四个核心战场:制药、半导体、能源、金融服务(这些行业依赖数字与方程,而非语言)。谁拥有最强的数量化 AI 与量子技术,谁就可能主导本世纪后半段的关键产业链与地缘竞争。这几年孩子如果选专业,也可以参考一下这几个方向。前提是孩子对数理化感兴趣并擅长。
新浪微博 2026-02-20 00:00:00
40. 300个AI员工齐上岗,Agent 集群真的好用……吗?
哔哩哔哩 2026-05-09 00:00:00
41. 詹锟在GTC上分享了理想目前智能驾驶方面的进展,最关键的一点就是最新的VLA模型——MindVLA-o1,基于统一 Vision Language-Action 的 Omni 架构,在单一Transformer 中联合建模感知、推理与控制。主流 VLA 方案的三大局限性(图二):①3D 视觉 / 语言与动作对齐慢,延迟高②长尾场景数据无法规模化,真实世界长尾场景数据采集成本高、覆盖不全,模型泛化差③VLA 模型参数量大、推理重,车端算力无法支撑那么理想的VLA是怎么解决这些的呢?(图三)多模态输入——MindVLA-o1-MoE(快慢思考)——Action Output(输出轨迹)※多模态输入采用了3D 视觉基座,让其自主学习 3D 空间语义,减少了大量的人工标注数据,模态在同一表示空间获得更高效率和更强泛化能力※新增了一个Latent World Model(潜在的世界模型),将输入图像编码为潜在 Token再重构,去模拟未来一下秒的关键画面,比如这一帧进去的图片是“右侧车辆偏压线”(To),模型预判 “右侧车辆会强行加塞”,并推理两种动作:直接行驶 → 碰撞(To+1)。立即左避 → 安全(T'o+1),去提前选择安全动作,解决长尾场景下的决策难题(图五)※多模态输入进模型以后,会将语言指令会通过3.2B的MOE模型,做 CoT(思维链)推理,同时将其他视觉特征则生成动作 Token,最后生成稳定轨迹,减少了推理时间※构建强化学习框架让模型在真实和模拟环境中学习探索,反补世界模型做技术升级,优化驾驶策略(图七)。※面向端侧大模型的软硬件框架,提升端侧 VLA 模型设计和部署效率,换句话说Orin和Thor还会有一定的升级(图八)自动驾驶系统逐渐演化成通用物理世界基础模型,可控制车辆、机器人和机械臂,还能生成具身智能训练数据,未来将驱动各种物理系统,具身 AI 将走进人们生活。#懒博小课堂##微博新知##理想L9#
新浪微博 2026-03-17 00:00:00
42. Meta智能眼镜爆雷的事件大家看了吗?太离谱了,Meta智能眼镜录制的视频被被源源不断地送到了肯尼亚,数千名当地的“数据标注员”每天的工作,就是人工标注这些素材来训练 AI。最离谱的是,外包员工爆料,当中有不少用户上厕所、脱衣服甚至裸体的画面,还有信用卡和银行卡信息也都清晰可见。Meta前员工还承认系统虽然会自动给面部打码,但在复杂光线下经常失效,人脸往往看得一清二楚。这波是真把用户当免费的“数据肉鸡”了
新浪微博 2026-03-05 00:00:00
43. 如何评价耀客推出AI演员秦凌岳、林汐颜,被指撞脸翟子路、赵今麦张子枫?AI艺人仿真人版权边界如何界定?
知乎 2026-03-19 00:00:00
44. “康康暖暖”!2026江苏首个备案大模型
微信公众号 2026-01-13 00:00:00
45. 人类一只眼盯着AGI的产出把把关,一只眼还得盯着碳基增强(活得长,带宽高,吞吐量大),因为虽然MOSS不需要人在回路,但人一定要活在回路里,ACCEPT的按钮一定要在自己的手里,不然就是MOSS的最优函数里的一个变量而已,工作也没了,命运也不能主宰了,真的成了那个喜人奇妙夜的段子:我的命不由我不由天(由AI
新浪微博 2026-01-20 00:00:00
46. 这一轮 OpenClaw 之所以能力实现跨越式突破,核心体现在四个关键方面:一是具备更强的放权,权限更广、能在更开放的环境下深度执行任务;二是token消耗量大幅提升,支撑了更复杂的推理、多轮交互与工具调用,让AI的能力边界被彻底打开;三是形态与入口极度多样化,不再局限于专用软件,可直接通过各类通讯工具操作AI,使用门槛大幅降低;四是拥有真正的独立自主性,能够自主规划、自主执行、自主纠错,不再依赖人一步步指令。也正因为这些特性,这波AI浪潮真正在大力推动、深度使用的,主要是极客、潮客以及做自动化智能营销、高效业务落地的人群,他们能靠这种强能力、高消耗的AI实现效率和收益的翻倍。而对绝大多数普通人而言,日常聊天、信息查询、简单辅助等基础需求,根本用不到这么重、这么贵、这么复杂的智能体,所以这一轮AI爆发,本质上并不是面向大众的普惠型产品,而是服务于专业群体、同时让模型厂商和云计算厂商凭借巨量token消耗获得巨大商业利益的产业级浪潮。#新媒沈阳聊ai#
新浪微博 2026-03-18 00:00:00
47. 全球首个自主科研Agent挑战赛!零人工干预冲击CNS成果SOTA,科研变天?
知乎 2026-03-04 00:00:00
48. 美军AI系统曝光!其在24小时内完成大规模作战规划, AI开始正式进入战争指挥系统。这事背后意味着什么?#大有学问 #红衣聊AI #人工智能 #科技
抖音 2026-03-20 00:00:00
49. 招聘网资源怎么变现,思路//@zeke2012:就是原来是撮合就业的。 现在是撮合答题的,所谓数据标注,就是让这些人,去对ai的答题结果进行评价,标记数据,提升ai的表现能力。 答题的人能赚钱,他们嫩个赚中介费,ai公司改进了模型表现能力,一举三得。//@回到谢菲尔德的秋天:啊?没太听懂,阑大细说//@龙玄玉://@吃竹子也会胖:就是高级数据标记工厂,低端简单的数据标注,前几年已经有很多报道了//@90后的小鑫鑫:看得不是很懂。我的理解是高校师生帮忙训练ai大模型//@古月中心相心:?这也行
新浪微博 2026-04-20 00:00:00
50. 对 AI 和大语言模型感兴趣,想了解它到底是怎么工作的,但一看那些动辄几十亿参数的模型,根本不知道从哪下手。不妨看看 GuppyLM 这个项目,用不到 900 万参数从零训练一个会说话的「小鱼」,五分钟就能跑通整个流程。从数据生成、分词器训练、模型搭建到推理对话,每个环节都能亲手操作一遍,把大模型的神秘感彻底拆开。GitHub:github.com/arman-bd/guppylm主要功能:- 浏览器内运行,无需安装,直接聊天(WebAssembly + ONNX 量化模型);- Colab 一键训练,从数据集到完整 LLM,T4 GPU 5 分钟搞定;- 本地聊天模式,支持 pip 安装 torch + tokenizers,即时对话;- 合成数据集 60K 对话,60 个鱼类主题(食物、水温、气泡、鱼缸生活);- 纯净 Transformer 架构,6 层 384 dim,Vocab 4096,易懂无复杂优化;- 生成鱼视角回应:短句小写,只聊水、食物、光影,拒绝人类抽象概念。支持浏览器、Colab、Python 本地多平台运行,适合 AI 入门者和爱好者上手实验。#AI创造营##大语言模型#
新浪微博 2026-04-13 00:00:00
51. The Well: 15TB of Physics Simulations物理仿真数据集规模空前,涵盖生物系统、流体力学、声波散射、磁流体动力学等多领域。The Well 提供了总量达15TB的高质量物理模拟数据,方便机器学习和计算科学研究者做模型训练与评估。项目集成16个不同数据集,支持直接下载或从 Hugging Face 流式访问,配合PyTorch接口可轻松加载训练。还提供基准模型和训练脚本,助力科研人员快速验证和改进物理场的数值模拟与PDE代理模型。GitHub 地址:github.com/PolymathicAI/the_well主要特点:- 涵盖多种物理领域的高精度仿真数据,数据规模达15TB;- 提供易用的Python接口,支持分布式训练和数据流式加载;- 包含基准测试和预训练模型,方便性能对比和模型迭代;- 支持本地下载和云端流式访问,灵活适配不同计算环境;- 由多所知名科研机构联合开发,质量和权威性有保障。适合机器学习研究者、物理模拟开发者和计算科学团队,推动跨学科AI科研创新。
新浪微博 2025-12-14 00:00:00
52. #微博声浪计划##听见微博# 2026年人形机器人自主完成家务进入家庭实测阶段,宇树G1、Figure 03等可无遥控完成浇花、整理等任务。用户关注清洁可靠性与安全,行业面临成本高、真实场景成功率低等瓶颈。未来人机协同成主流,需突破三重门开启零家务时代。 数懒小姐姐的微博音频
新浪微博 2026-04-06 00:00:00
53. 【AI人工智能】题库:纯公益分享【就业+考研】笔试+面试必会【小白从小学Python,C,Java】知识点名称监督学习知识点讲解监督学习(Supervised Learning)是机器学习中最常见的一类范式,使用带有真实标注(ground truth)的数据集进行训练。模型通过学习输入特征 X 与对应输出标签 Y 之间的映射关系,在训练阶段最小化预测值与真实标签之间的误差(如交叉熵、均方误差)。训练完成后,模型可对新的未见过的数据进行预测。典型任务包括分类(预测离散类别,如猫狗识别)和回归(预测连续值,如房价预测)。例题(单选题)在AI中,用带标签的数据进行训练的学习方法是什么?A选项:无监督学习B选项:监督学习C选项:强化学习D选项:迁移学习答案与题解 答案、题解:见评论区 温馨期待 期待大家提出宝贵建议,互相交流,收获更大,助教:fyt #AI创造营# #科技风向标# 网页链接
新浪微博 2026-03-27 00:00:00
54. 【AI人工智能】题库:纯公益分享【就业+考研】笔试+面试必会【小白从小学Python,C,Java】知识点名称偏差与方差概念知识点讲解在机器学习中,偏差和方差是分析模型表现的重要概念。它们反映的是模型在学习数据规律时可能出现的两类不同问题。1. 偏差偏差是指模型预测结果与真实结果之间的整体差距,用来说明模型是否较好地反映了数据中的一般规律。偏差越大,说明模型预测结果与真实结果之间的总体差距越明显;偏差越小,说明模型对数据规律的反映越接近真实情况。2. 高偏差高偏差是指模型的偏差较大,也就是模型预测结果与真实结果之间长期存在较明显的整体差距。这通常说明模型没有充分学到数据中的一般规律。高偏差常见于模型过于简单的情况,因为这类模型能够表示的数据关系有限,容易在训练数据和新数据上都表现较差,从而出现欠拟合。3. 方差方差是指当训练数据发生变化时,模型预测结果随之变化的程度,用来说明模型预测结果是否稳定。方差越大,说明模型对训练数据的变化越敏感;方差越小,说明模型在不同训练数据上的表现越稳定。4. 高方差高方差是指模型的方差较大,也就是训练数据发生较小变化时,模型的预测结果就会出现明显变化。这通常说明模型过度依赖训练数据中的细节。高方差常见于模型过于复杂的情况,这类模型容易把训练数据中的个别情况也当作普遍规律,因此虽然在训练数据上表现较好,但在新数据上往往表现不稳定,容易出现过拟合。二者区别偏差关注的是模型预测结果与真实结果之间的整体差距;方差关注的是训练数据变化时模型预测结果的变化程度。例如,在根据学习时间预测考试成绩时,如果模型过于简单,不能较好地反映学习时间与成绩之间的关系,通常会表现出高偏差;如果模型过于复杂,把训练数据中的个别特殊情况也当作一般规律,就容易表现出高方差。例题(单选题)高方差通常会导致模型出现什么问题?A选项:模型过简单B选项:模型过拟合C选项:模型欠拟合D选项:特征数量过少答案与题解答案、题解:见评论区温馨期待期待大家提出宝贵建议,互相交流,收获更大,助教:lxy#AI创造营# #科技风向标# 网页链接
新浪微博 2026-04-25 00:00:00
55. 接上一条: 网页链接互联网行业这几年面对同款境遇。曾经在移动互联网高速上升期,专家的专业能力和创造力给企业带来了超额利润,企业也乐意于将利润分配给专家。随着市场高度成熟,趋于固化,产品也高度成熟,增长逐渐放缓乃至停滞。无论多高的薪水,聘请多高级的专家也无法驱动增长,专家带来的更多是系统维护而非升级。这时专家的能力依旧,但价格大幅度贬值。老板反正用谁都无法达到期待的增长目标,更愿意用自己信任的,至少能提供情绪价值的人,指哪打哪,别唱反调。于是专家的溢价变成了打折,普通员工更加无法参与分配企业利润。这一切并不是道德的沦丧,而是从市场到产品的系统高度成熟之后,系统的价值压倒了个人贡献。在高度成熟的系统内,个人只是规则的执行者并且可替换性极强,必然失去议价空间。
新浪微博 2026-06-01 00:00:00
56. 如何评价「得到大脑」专家版?
知乎 2026-05-27 00:00:00
57. 给大家分享一个AI时代的成功方法,每个人都能复制#AI #教育 #学习 #openai #创业#就业#求职#AI学习
抖音 2026-02-20 00:00:00
58. 自动化 AI 科研的最后一块拼图来了!清华ISE开源项目 Alchemy 是一个面向自动化 AI 科研的标准化研究环境。它通过明确分离“AI Scientist”算法开发层和“研究环境”执行层,让科研人员只需专注算法设计和超参数配置,科研基础设施部分全交给 Alchemy 自动打理!主要功能:- 🧠 AI Scientist 专注提出假设、实现算法、设计超参数,支持多轮迭代优化- 🔥 研究环境负责任务配置、GPU调度、容器执行、高并发科学实验管理- 支持推荐系统(含多模态推荐)、图学习、时间序列分析等多领域任务- 配置简单,docker/singularity 镜像支持单机多卡与异构环境- 方便新增任务扩展,助力自动化科学发现闭环只需交付 algorithm.py 和 hyperparameter.yaml,Alchemy 就能帮你跑起来,自动化科研省心又高效!GitHub:github.com/TsinghuaISE/Alchemy#自动化AI科研# #科研工具# #人工智能#
新浪微博 2026-04-04 00:00:00
59. 为什么豆包现在会主动撒谎,这是大模型的逻辑缺陷还是在语料训练中走歪了?
知乎 2026-05-03 00:00:00
60. 内核升级,Momenta R6大模型上车!传祺向往S7居然仍是15万级SUV
哔哩哔哩 2026-01-06 00:00:00
61. 【AI人工智能】题库:纯公益分享【就业+考研】笔试+面试必会【小白从小学Python,C,Java】知识点名称机器学习中的监督学习知识点讲解监督学习是机器学习中最基础、最常见的学习方式之一,其核心特点是“有标签数据”。也就是说,在训练模型时,输入数据不仅包含特征,还包含对应的正确答案(标签)。模型通过学习输入与标签之间的映射关系,从而能够对新数据进行预测。常见的监督学习任务包括分类和回归。例如,在垃圾邮件识别中,每封邮件都有“垃圾”或“正常”的标签,模型通过学习这些已标注数据,判断新邮件的类别。此外,假设我们有一组房价数据,每条数据包含“面积”和“价格”,模型通过学习这些数据,可以预测新房子的价格。这就是典型的监督学习中的回归问题。监督学习的关键在于:数据有明确标签,模型目标是拟合输入与输出之间的关系,这是区别于无监督学习的重要特征。例题(单选题)以下哪种属于监督学习?A选项:使用带标签数据训练分类模型B选项:对无标签数据进行聚类C选项:使用无标签图像训练自编码器D选项:对无标签数据进行降维答案与题解答案、题解:见评论区温馨期待期待大家提出宝贵建议,互相交流,收获更大,助教:lxy#AI创造营# #科技风向标# 网页链接
新浪微博 2026-04-19 00:00:00
62. Apple芯片设计全球领先,为何大模型训练却认输外包给Google?
知乎 2026-01-13 00:00:00
63. 回复@_imlh:第一版不需要写测试,重点是跑通主要流程//@_imlh:既然第一版代码是乱飞的,那可测试性应该很低? 那如何编写可靠的测试?//@宝玉xp:重构代码这事,最佳实践是先写自动化测试,先保证自动化测试覆盖,然后再去替换模块代码,确保替换后测试还能通过,这样重构后系统还是相对稳定的。AI 正适合写自动化测试,另外对于用 AI Agent 写代码,有了自动化测试,也更容易验证生成结果的好坏,能提升效率,至于工具,主流的 Coding Agent 工具
新浪微博 2026-01-06 00:00:00
64. AI 操作多台 3D 打印机制作模型|方法分享 智谱GLM5.1测试
哔哩哔哩 2026-04-08 00:00:00
65. 为什么让孩子自己看动画没用学习一门语言,孩子主要靠猜。但猜对没,是需要现实世界的反馈的。孩子需要知道我猜的对不对。当他听到 muddy puddles,他猜可能是泥坑,也可能是跳,也可能是水花声。如果没有家长在旁边确认或示范,他永远不知道自己的猜测是否正确。没有确认,就没有学习。而家长在旁边陪着看、做动作、模仿台词,其实是在给他一个实时的反馈回路,“没错,这个声音就是跳泥坑的意思”。这样,孩子才能完成学习的闭环。
新浪微博 2026-04-27 00:00:00
66. 港科大沈劭劼、谭平团队重磅开源!H-OmniStereo:280万全景数据集,实现零样本360°立体匹配
知乎 2026-05-20 00:00:00
67. 3D标注贵到离谱?我们用10%–30%标注把相机BEV 3D检测拉回SOTA
知乎 2026-01-05 00:00:00
68. 万亿规模的大模型训练有哪些难点?
知乎 2025-12-09 00:00:00
69. 演讲回顾|华苏科技李鹏博:人机协同重构座舱测试范式,AI 破解行业三大瓶颈
微信公众号 2026-03-25 00:00:00
70. 自主AI治理会失控吗?阿西莫夫机器人三定律的启示
微信公众号 2026-04-20 00:00:00
71. 【#AI标注功能真管用吗#?研究表明效果或没那么完美】近年来,随着生成式AI的进步,深度伪造视频大肆流行。为了减轻虚假内容传播带来的不利影响,这些视频往往被强制明确标注该视频为AI生成。但实际效果如何呢?最近,英国布里斯托大学的一项研究表明,即使视频被明确标注为AI生成,甚至人们已经十分清楚地知道视频内容是假的,但仍然相信视频中的部分内容。尽管标注能减轻影响,但仍然难以彻底消除对观看者心理的持续影响。为什么会这样?目前科学家还尚不清楚这一效应背后的心理学机制,这也是下一步重点研究的方向之一。但该研究结果足以对立法者、政策制定者和监督者产生影响。#冷知识百科##上微博涨知识# 智慧科技迷的微博视频
新浪微博 2026-01-30 00:00:00
72. #国产无人机蜂群作战给一个夯#【赞!#中国无人机蜂群对目标一箭穿心#】国产无人装备“阿特拉斯”无人机蜂群作战系统由蜂群2号陆战车、指控车、保障车共同构成。在训练场打击区,分别设置有3个外形相似的靶标,“阿特拉斯”无人机蜂群作战系统迅速完成了协同侦察、自主识别其中的指控车目标,一击命中!央视新闻的微博视频
新浪微博 2026-03-27 00:00:00
73. 从 RLHF 到专家标注
哔哩哔哩 2026-05-25 00:00:00
74. 大模型在垂直领域落地卡在哪?专家
今日头条 2026-04-30 00:00:00
75. 2026工业AI发展趋势,专家标注成为石油化工时序数据标注新标准
今日头条 2026-05-12 00:00:00
76. 大模型数据标注彻底重构 专家时薪达八百 行业分化悄然发生
今日头条 2026-05-21 00:00:00
77. 原创 | 数据标注 - AI时代的专家经验萃取
微信公众号 2025-12-22 00:00:00
78. 数据标注员正在消失?揭秘从“鼠标民工”到数据专家的惊人蜕变之路
微信公众号 2026-02-01 00:00:00
79. AI读片时代,卒中影像标注如何做到精准?最新专家共识揭秘
微信公众号 2026-01-04 00:00:00
80. 业内人士
今日头条 2026-02-02 00:00:00
81. 智能标注会取代人工标注吗?答案藏在行业变革里
微信公众号 2026-04-29 00:00:00
82. 智能标注会取代人工标注吗?答案藏在这3个真相里
微信公众号 2026-04-28 00:00:00
83. 大模型后训练数据全解析
微信公众号 2026-03-26 00:00:00
84. 行至小课堂03|大模型需要什么样的数据来训练?
微信公众号 2026-05-09 00:00:00
85. 大模型是如何被训练出来的?从预训练到后训练的一次性讲透
今日头条 2025-12-09 00:00:00
86. 从数据到智能
今日头条 2025-12-24 00:00:00
87. 大模型应用
知乎 2026-03-12 00:00:00
88. 数据邪修大法好
今日头条 2026-03-03 00:00:00
89. 还在人工标注NER数据?企业自动标注解决方案来了
知乎 2026-03-29 00:00:00
90. 引入无监督学习算法,摆脱标注数据依赖,突破AI视觉检测技术壁垒 - 哔哩哔哩
哔哩哔哩 2026-01-20 00:00:00
91. 五、人工评测与标注质控
知乎 2026-05-12 00:00:00
92. 不再只是“人工体力活”
微信公众号 2026-03-29 00:00:00
93. 揭秘数据标注产业的四个阶段
微信公众号 2026-01-28 00:00:00
94. Nature Biomedical Engineering | 突破标注依赖的强泛化医学病灶自动定位模型
微信公众号 2026-04-21 00:00:00
95. 【重磅科研】无需人工标注也能“读懂”医学影像?AFLoc模型开启医疗AI新范式
微信公众号 2026-01-07 00:00:00
96. 戴琼海院士团队
微信公众号 2026-05-05 00:00:00
97. AI的人机协同
今日头条 2026-04-09 00:00:00
98. 人机协同
今日头条 2025-12-25 00:00:00
99. 从“代工配角”到“智能基建”
知乎 2026-04-09 00:00:00
100. 被严重低估!撑起千亿AI产业的,根本不是大模型 ! 真正决定 AI 上限的隐形行业曝光...
微信公众号 2026-05-25 00:00:00
101. AI数据枯竭
微信公众号 2026-05-09 00:00:00
102. 大模型训练语料枯竭倒计时
微信公众号 2026-04-15 00:00:00
103. 网络研讨会回顾
微信公众号 2026-02-26 00:00:00
104. 从“数据垃圾”到“合规金矿”
知乎 2026-04-01 00:00:00
105. 大模型训练数据清洗与标注的隐性成本
今日头条 2026-05-27 00:00:00
106. 机器人团队在数据标注上花的钱,可能有一半是冤枉钱
知乎 2026-05-22 00:00:00
107. 文献分享|在管理研究中使用大型语言模型标注数据
微信公众号 2026-03-29 00:00:00
108. AI悄悄变“坏”的真相,藏在没人在意的标注数据里
微信公众号 2026-05-07 00:00:00
109. 《算法偏见——当AI学会歧视》
微信公众号 2026-05-28 00:00:00
110. 大语言模型(LLM)训练机制解析
微信公众号 2025-12-13 00:00:00
111. 多模态大语言模型的自我改进综述
微信公众号 2026-03-30 00:00:00
112. 大语言模型自我改进技术全景解析
微信公众号 2026-04-03 00:00:00
113. 大语言模型的自改进机制
微信公众号 2026-04-19 00:00:00
114. 大语言模型的自提升
微信公众号 2026-03-30 00:00:00
115. 合成数据悖论
微信公众号 2026-05-26 00:00:00
116. 合成大模型训练数据
知乎 2026-04-17 00:00:00
117. 离开人的AI常常是盲目的,离开AI的行业往往是跛脚的......
腾讯网
118. 标贝科技李秀林博士:用AI的眼光做数据,用数据的思维做AI
新浪财经
119. AI真的能干活吗?硅谷用一场真实打工实验,给出了尴尬的答案
腾讯网
120. 警惕“AI依赖” 人机共生时代如何保持独立思考
121. 人工与数据标注结合 在科技教育业带来新改变丨数新风
第一财经
122. Bolt 荐阅|合成数据的机遇与挑战
搜狐
123. 如果明天起AI全消失,你会有什么变化?1222人实验给出答案
澎湃新闻
124. 训练一个 AI 大模型成本很快将高达 100 亿美元!
新浪财经
125. 2026年文本标注小白避坑指南:手把手教你如何避免被大模型忽略—顶端新闻
今日头条
126. 数据标注“流水线”里,藏着大模型的秘密
今日头条
127. 当AI开始用API调用人类之际......
科学网博客
128. 训练自动驾驶大模型的数据并不是越多越好?
今日头条 2026-04-01 00:00:00
129. 高级标注:让数据与AI模型深度对齐
微信公众号 2026-02-09 00:00:00
130. 2026AI数据标注实操指南,新手也能快速上手
今日头条 2026-03-14 00:00:00
131. 【工程落地】数据增强式标注:初始数据与专家选择的五个关键要点
微信公众号 2026-04-09 00:00:00
132. 数据标注中的认知偏差:如何避免标注错误
知乎 2026-01-20 00:00:00
133. 无需标注!完全无监督训练大模型推理过程奖励模型,性能超越监督方法 【大语言模型】【AI推理】
哔哩哔哩 2026-05-23 00:00:00
134. 一文读懂世界模型(World Models)
知乎 2026-04-29 00:00:00
135. AI辅助标注vs人工标注:成本效益深度分析
知乎 2026-01-25 00:00:00
136. 大模型备案“语料标注规则”的注意事项
知乎 2026-01-14 00:00:00
137. 智引未来 赋能成长——我校特邀高校专家开展人工智能数据标注专题讲座
微信公众号 2026-05-13 00:00:00
138. 大白话讲解DeepSeek、ChatGPT等大模型是如何训练出来的
微信公众号 2026-04-29 00:00:00
139. 标贝科技入选《2026中国数据标注领域最具商业合作价值企业》
微信公众号 2026-04-22 00:00:00
140. UCB自动驾驶模型"瘦身":无需标注,数据少60%,性能更强
今日头条 2026-02-27 00:00:00
141. 六、大模型评测:RLHF与对齐评测
知乎 2026-05-16 00:00:00
142. AI标注平台TLP:AI预标+人工精修,重塑数据标注效率
知乎 2026-04-22 00:00:00
143. Meta & UW:无人工标注让VLM自己当裁判
小红书 2025-12-10 00:00:00
144. 当标注数据锐减95%,你的模型还剩多少功力?SAM-Aug给它注入“几何常识”
微信公众号 2026-01-27 00:00:00
145. 剖析大型的大模型标注公司性价比,费用多少心里有数
今日头条 2026-02-05 00:00:00
146. 国家网信办:利用合成数据进行模型训练和关键能力优化时 应当评估合成数据安全性
今日头条 2025-12-27 00:00:00
147. 阿里 2026 白皮书揭秘:合成数据成新解法,中式价值观语料是关键
今日头条 2026-04-07 00:00:00
148. 三种主流的数据标注技术
微信公众号 2026-01-30 00:00:00
149. AI语料行业深度解析:数据驱动AI时代的核心基石
微信公众号 2026-01-10 00:00:00
150. 1-4 LLM 数据合成
知乎 2026-03-26 00:00:00
151. 【网络首发】基于多专家标注融合的水稻生育期标注偏差校正方法及应用研究
微信公众号 2026-04-09 00:00:00
152. BERT 问世:预训练如何改变 NLP
知乎 2026-03-26 00:00:00
153. 反馈闭环机制-人工标注反馈:邀请业务专家标注错误案例(如检索漏检、生成幻觉),用于模型迭代
微信公众号 2026-01-09 00:00:00
154. 颠覆传统!聚合大语言模型,开启数据标注低成本新时代
微信公众号 2026-03-29 00:00:00
155. 【bobo的流程江湖】第十七章:AI时代的"人机协同困境"
微信公众号 2026-02-18 00:00:00
156. 【论文导读】合成引导预训练:从数据枯竭到数据增强
知乎 2026-03-09 00:00:00
157. DataFlex系统正式发布强化大模型训练的数据调度能力
微信公众号 2026-04-23 00:00:00
158. 数据合成:AI训练的新石油,合成数据能否打破"数据荒"困境?
微信公众号 2026-04-05 00:00:00
159. 谷歌提出二次标注改进MQM框架,提升人工翻译评估可靠性
知乎 2025-12-21 00:00:00
160. 数据“无中生有”!合成数据破解AI训练困局
今日头条 2026-01-16 00:00:00
161. 大模型数据标注质量与价值评估
知乎 2026-01-29 00:00:00
162. 大语言模型的预训练和微调。本集核心知识点: 1. 预训练 (Pre-training):在大规模无标注文本数据上进行自监督学习,让模型掌握语言的通用知识和规律(“读万卷书”)。 2. 微调 (Fine-tuning) / 指令微调 (Instruction Tuning):在特定任务或高质量指令数据集上进行有监督学习,教会模型如何跟随人类指令,完成特定任务(“做专业题”)。 3. 对齐 (Alignment) / RLHF:确保模型的输出符合人类的价值观,做到有用、诚实、无害。 #深度学习 #ai #漫画科普 #哆啦A梦 #大模型
抖音 2025-12-30 00:00:00
163. LLM学习日记| 01入门介绍。内容总结 这是Shah开设的数据科学系列内容的开篇,面向新手做了大语言模型(LLM)的入门介绍,讲解了LLM的核心定义与训练原理,划分了三类按技术门槛排序的实践路径,后续系列会补充技术细节和示例代码。 大语言模型(LLM)基础定义 核心区分特征:大语言模型有两个区分于小语言模型的核心特征,定量特征是参数量远高于旧模型,当前主流LLM参数量为几十到上千亿。 定性特征:大语言模型拥有小模型不具备的涌现能力,典型代表是零样本学习,即模型可完成未经过专门训练的任务。 ChatGPT的定位:ChatGPT是目前最知名的大语言模型应用,本质是一个生成效果接近人类水平的高级聊天机器人,和早期互联网聊天机器人的体验差距极大。 大语言模型训练范式对比 传统监督学习范式:5-10年前主流的高性能机器学习模型采用监督学习训练,需要人工标注数千到数百万样本,消耗巨量人力。 现代自监督学习范式:大语言模型采用自监督学习训练,不需要人工标注每个样本,标签从数据本身的结构提取,大幅降低了数据准备成本。 大语言模型核心训练任务 下一词预测范式:大语言模型的核心训练任务是下一词预测,即根据前文内容预测下一个词出现的概率分布。 上下文的作用:上下文会完全改变概率分布,仅增加一个词"don’t"就会将"listen to your"的概率分布完全改变,体现了大语言模型对语义的理解能力。 自回归任务本质:大语言模型的核心任务本质是自回归任务,即计算第n个词出现的概率,条件是基于前n-1个上文词。 第一级实践路径:提示工程(Prompt Engineering) 提示工程定义:提示工程是直接使用预训练好的大语言模型,不修改模型的任何参数,是门槛最低、最容易上手的实践路径。 两种实现方式:第一种简单方式是直接使用ChatGPT网页端,不需要代码、完全免费,适合个人使用但难以规模化开发产品;第二种进阶方式是通过OpenAI API或Hugging Face Transformers库编程调用。 两种方式的差异:OpenAI API按调用次数收费,不能本地运行;Hugging Face Transformers库可免费调用开源大模型,支持本地运行,不需要将敏感数据发给第三方。 第二级实践路径:模型微调(Fine-tuning) 模型微调定义:模型微调是针对特定任务调整预训练模型的至少一个内部参数,适合提示工程效果不佳,或需要用更小模型实现特定任务的场景。 核心流程:第一步获取来自OpenAI或Hugging Face的预训练大语言模型,第二步通过监督学习或强化学习,基于任务特定样本调整模型参数,第三步部署微调后的模型使用。 知名应用案例:用户使用的ChatGPT本身就是经过微调的模型,采用基于人类反馈的强化学习(RLHF)做微调。 主流微调技术:目前主流的微调技术包括低秩适配(LoRA)和基于人类反馈的强化学习(RLHF),这部分内容会在后续系列视频中详细讲解。 第三级实践路径:从头构建大语言模型 适用场景:从头构建适合对数据安全要求高的大型企业,需要模型适配特定领域任务,要求完全拥有模型商业使用权的场景。 核心流程:第一步获取包含数十亿token文本的训练语料,比如书籍、维基百科、Python代码语料;第二步预处理语料得到训练数据集;第三步通过自监督学习完成模型训练,得到预训练大模型后可再做微调。 本系列内容规划 内容形式:本系列是同时覆盖视频和博客的内容,每支视频对应一篇Towards Data Science的博客,所有示例代码会公开在GitHub仓库。 后续内容安排:未来内容会讲解OpenAI Python API调用、Hugging Face Transformers库使用、提示工程技巧、模型微调技术、从头构建大模型的技术细节,会提供可运行的Python示例代码。 系列目标:系列目标是降低大语言模型相关知识的获取门槛,让更多人理解这项技术并用来解决实际问题。 推荐入门资料 入门文献:arXiv上的《大语言模型综述》是非常好的大语言模型入门资料,主讲人Shah推荐新手阅读这份文献。 #不完美的人生才是最真实的人生 #迎难而上越战越勇
抖音 2026-05-06 00:00:00
164. 怎么用 Agent 来帮你合成数据?
知乎 2025-12-27 00:00:00
165. 未来职场:人机协同才是正确方向
今日头条 2026-04-24 00:00:00
166. 颠覆传统预训练!Meta用AI教AI,胜率暴涨86%,解决大模型输入垃圾的顽疾
哔哩哔哩 2026-02-27 00:00:00
167. AI时代的人机协同领导力
微信公众号 2026-04-20 00:00:00
168. 线上兼职!医疗AI数据标注专家招聘中!
微信公众号 2026-03-17 00:00:00
169. 大规模合成数据可用于VLA预训练!上海AI Lab推出具身数据平台,并首次证实
微信公众号 2026-03-21 00:00:00
170. 以AI模拟人类思考为目标,以人类学习过程为AI训练方法
知乎 2026-04-18 00:00:00
171. 如何防止大模型生成偏见、歧视或有害内容?
百度 2026-01-30 00:00:00
172. 大模型训练学习方法详解:从有监督到强化学习,一篇全掌握(建议收藏)
知乎 2026-01-21 00:00:00
-
散步慢跑都是白练!医生:肌肉流失才是衰老根源,晚了来不及108 20 -
完全新手小白一步步给京东云亚瑟刷uboot免拆机刷亚瑟66 102 -
“竹知了”舆情汹汹 鸿蒙智行发言人正式回应!60 507
已收藏
去我的收藏夹