大家知道,搜索是一个互联网金矿,谷歌就是靠搜索大赚特赚的。在AI时代,搜索出现了一个质的变化,就是可以完成深度搜索。只要一个提示词,就可以帮你整合很多内容,形成非常详实的研究报告。以咨询公司来说,他们就是要出各种报告,非常耗时耗力。几乎每个大一点的公司,都有marketing部门,也是要整这种分析的。而以自媒体来说,你要写深度文章,往往要搜集大量的资料,才能写出来。成本惊人。深度搜索就是来解决这些问题的,所以几乎各个模厂都有深度搜索的产品。往往叫什么DeepResearch。但是这个东西是怎么做出来的,具体有哪些过程,以前很多人是不清楚的。昨天,阿里通义实验室开源了通义的DeepResearch,把这整个过程公布了。在这其中,还是需要一个小模型的,他们用的是一个叫Tongyi-DeepResearch-30B-A3B的小模型。30B参数,3B激活参数。然后就是智能体框架,他们也开源了。从开源的情况来看,一个中小型公司也能有资源做一个不错的深度搜索。难怪perplexity选择了这个赛道,成本没那么高,效果也不错。perplexity开始真的就是套壳,后来也训练了自己的小模型 sonar,大概就等于是Tongyi-DeepResearch-30B-A3B。现在阿里通义已经开源了整个过程,模型也可以直接用,大家可以参考学习。主要特征:⚙️ 全自动合成数据生成流水线:我们设计了高度可扩展的数据合成流水线,全自动赋能智能体预训练、监督微调、强化学习。🔄 对智能体数据进行大规模持续预训练:利用多样化、高质量的智能体交互数据来扩展模型能力,保持新鲜度,并加强推理性能。🔁 端到端强化学习:我们采用基于定制的Group Relative Policy Optimization框架的严格策略性RL方法,通过token级策略梯度、留一优势估计和负样本选择性过滤,以稳定非平稳环境中的训练。🤖 代理推理范式兼容性:在推理时,通义 DeepResearch 与两种推理范式兼容:ReAct,用于严格评估模型的核心内在能力,以及基于 IterResearch 的“重”模式,该模式使用测试时间扩展策略来解锁模型的最大性能上限。论文:tongyi-agent.github.io/blog/introducing-tongyi-deep-research/代码:github.com/Alibaba-NLP/DeepResearch/模型:huggingface.co/Alibaba-NLP/Tongyi-DeepResearch-30B-A3B