当主Agent化身指挥官,Subagents分头执行长周期爬取任务,Clawdbot在TrustMRR网站完成了一次高可靠性、可中断续跑的结构化数据采集。整个过程暴露了API限流与浏览器自动化之间的策略权衡,也验证了多智能体架构在真实数据工程场景中的实用边界。
智能速览
主Agent不直接执行耗时任务,而是动态创建21个Subagents分工协作
遭遇TrustMRR接口429限流后,主动回退至Playwright模拟点击LoadMore方案
全程20分钟完成32个分类、800余家Startup的收入数据采集与结构化存储
自动生成进度追踪文件和可交互数据看板,支持断点续跑机制
Subagents间通过统一纲领文件同步状态,主Agent仅负责调度与汇报
精华内容
多智能体不是概念玩具,而是解决真实数据采集瓶颈的工程选择——它把‘卡住’变成可诊断、可回滚、可分工的确定性过程。
任务拆解逻辑
主Agent首先解析TrustMRR网站的32个分类结构,生成总纲领文件(/clawd/trustmrr/category_enrichment_status.json),随后按分类粒度创建21个Subagents。每个Subagent独立运行专属Pipeline,如trustmrr_category_pipeline_impl负责具体爬取,trustmrr_category_discovery负责发现新子类。所有Subagent均向同一JSON文件写入状态,实现轻量级协同,避免资源竞争。
限流应对策略
尝试直调API获取全量数据时,触发TrustMRR服务端429响应,平均请求失败率达100%。系统随即切换至Playwright驱动Chromium模拟用户行为:自动滚动、点击LoadMore按钮、等待动态加载。该方案将单分类平均耗时控制在9分32秒,且未再触发限流,证实浏览器自动化在反爬较严站点中具备更高鲁棒性。
可靠性设计细节
所有Subagents均内置断点续跑能力:每次成功完成一个分类后,自动标记为done并跳过后续重试。进度文件实时更新,主Agent可在任意时刻查询剩余未完成分类数量。实测中10分钟检查节点显示‘小翻车+已经稳住’,指代一次Playwright会话异常中断后的自动恢复,恢复耗时小于8秒,未丢失已采集数据。
交付成果形态
最终输出包含两部分:一是结构化JSON数据集,存于/clawd/trustmrr/categories/路径下,每个文件对应一个分类,含startup名称、月营收区间、成立年份、技术栈等12项字段;二是基于这些数据生成的可交互看板,支持按营收规模、成立年限、分类热度三维度筛选与图表联动。全部交付物在20分17秒内完成生成。
这次实践表明,多智能体架构的价值不在炫技,而在于将不可控的长任务转化为可观测、可干预、可复用的工程模块。当每个Subagent都带着明确目标、失败回退策略与状态同步机制运行时,AI工具才真正开始承担起数据工程师的日常职责。下一步值得追问:这种模式能否适配更复杂的ETL流水线?