能力越强,责任越重。谷歌给AI更多思考时间提升性能,这步子迈得不小,可安全警报也亮了红灯。就像实验室里造出高效燃料,既能驱动火箭也能带来隐患,技术往前冲的时候,得把防护网织得更密才行
全文概述
谷歌发布了升级版的Gemini人工智能模型——Deep Think,通过增加思考时间来解决复杂问题。该模型在数学奥林匹克竞赛中表现出色,但也提出了新的安全风险,特别是在CBRN领域。新功能提升了代码生成和知识推理能力,但需谨慎使用。
Deep Think的核心技术
Deep Think利用平行思维技术,允许模型同时从多个方向处理复杂问题。通过并行生成、评估和结合多个想法,模型能够提供更长、更详细的回复。此外,Deep Think引入了新的强化学习方法,以提高其解决问题的能力。
性能提升与基准测试
在LiveCodeBench V6(代码生成)和Humanity's Last Exam(知识和逻辑推理)等基准测试中,Gemini 2.5 Deep Think表现优异,分别达到了87.6%和34.8%的成绩。尽管如此,它在某些任务上仍面临挑战,尤其是在不使用外部工具的情况下。
安全风险与应对措施
尽管Deep Think在技术上取得了显著进步,但它也带来了新的安全风险,特别是在化学、生物、放射学和核领域。谷歌已采取多层保护措施,包括过滤危险输出、多级监控和阻止滥用账户,以应对这些潜在威胁。
应用场景与用户限制
Deep Think特别适用于需要创造力和战略规划的任务,如网页设计、科学研究和编程挑战。然而,由于其强大的功能,每日请求次数受到限制,并且仅对特定用户开放。
已收藏
去我的收藏夹