两个工业资料库同步工具:横河和施耐德

2026-07-24 13:44:14 0点赞 0收藏 0评论

最近整理自动化项目资料时,又遇到一个老问题:产品手册、技术规格书、证书、软件包分散在厂商资料库里。网页搜索能用,但如果想围绕一个关键词系统性备份,比如 prosafe-rsM580,就会很痛苦。

我这次把这个流程做成了两个开源小工具:

  • Schneider Download Library:施耐德电气下载中心搜索、清单导出、增量下载

  • Yokogawa Download Library:横河电机资料库搜索、清单导出、直链资料下载

这两个工具都是普通 Python 命令行脚本,不绑定某个 AI 工具。Claude Code、Cursor、Codex、自动化脚本,或者自己在终端里跑都可以。

解决的不是“下载一个 PDF”,而是“资料库同步”

如果只是下载一份说明书,手动点网页当然够了。麻烦的是这些场景:

  • 想按型号或系统关键词一次性拉出全量清单

  • 想知道资料库后来新增了什么

  • 下载中断后不想从头再来

  • 文件名想统一成“文档类型 + 文档号 + 名称 + 版本”

  • 不想靠浏览器自动点击,最好能用稳定接口

这两个工具就是按这个思路做的。

横河:Yokogawa Download Library

仓库地址:

https://github.com/crytomato529/yokogawa-download-library

它会调用横河资料库页面背后的公开 JSON 接口,按关键词生成完整清单。比如测试关键词 prosafe-rs,可以搜索到 273 条结果,其中 135 条是公开直链文件。

常用命令:

python scripts/yokogawa_library.py search --keyword "prosafe-rs" --out prosafe-rs_manifest.json --csv prosafe-rs_manifest.csv

正式全量同步:

python scripts/yokogawa_library.py sync --keyword "prosafe-rs" --manifest prosafe-rs_manifest.json --csv prosafe-rs_manifest.csv --dir prosafe-rs_downloads

我这里真实下载验证过一份 PDF:

Technical Information - TI 32S01J30-01E - Explosion Protection (ProSafe-RS) - Edition 26.pdf

文件约 4.1 MB,文件头是 %PDF-,是真 PDF。

有一个注意点:横河的详情页经常会被 AWS WAF 拦截,所以这个工具默认只下载公开直链文件。详情页会保留在清单里,但不默认存 HTML,避免保存到 0 字节文件还误判完成。

施耐德:Schneider Download Library

仓库地址:

https://github.com/crytomato529/schneider-download-library

它面向施耐德电气中国下载中心,适合按 M580 这类关键词查资料。脚本会导出 JSON/CSV 清单,并把公开文件增量下载下来。

常用命令:

python scripts/schneider_download_library.py search --keyword "M580" --out m580_manifest.json --csv m580_manifest.csv

正式全量同步:

python scripts/schneider_download_library.py sync --keyword "M580" --manifest m580_manifest.json --csv m580_manifest.csv --dir m580_downloads

真实下载验证过一份:

Instruction sheet - NAT31609 - X80 _ M580 _ M340, 说明书 - v00.pdf

文件约 794 KB,文件头也是 %PDF-

施耐德这边还处理了一个小坑:同一个文件有时会通过不同下载域名返回,工具会尽量按文件名去重,避免把镜像链接重复下载成两份。

我比较在意的几个细节

第一是清单。下载前先生成 manifest,比直接下载更稳。以后再跑一次,可以看到新增、删除、变更,不只是本地多了几个文件。

第二是断点续传。两个工具都会在下载目录里保存状态文件:

.schneider_download_state.json .yokogawa_download_state.json

中断后重新运行同一条命令,已经完成的文件会跳过。

第三是文件命名。比如横河会保存成:

Technical Information - TI 32S01J30-01E - Explosion Protection (ProSafe-RS) - Edition 26.pdf

施耐德会保存成:

User guide - HRB65322 - Modicon M580 system planning guide - v13.pdf

这种命名后续放进 NAS、知识库或全文检索工具里会舒服很多。

后面真正想接的是 AI / RAG 知识库

我做这个工具时最在意的,其实不是“多下几份 PDF”,而是后续能不能把这些资料变成可审核、可追溯的竞品知识库。

比如做一套 SIS 或自动化方案时,里面会涉及控制器冗余、I/O 诊断、通信协议、工程站权限、版本管理等内容。过去审核方案,很多时候靠工程师翻手册、凭经验查漏。资料少的时候还能扛,资料一多就很容易漏。

如果先把横河、施耐德这类公开资料全量归档,再放进本地 AI / RAG 知识库里,后面就可以让 AI 先帮忙做一轮对照:

  • 方案里有没有漏掉竞品手册里明确提到的功能?

  • 某个参数有没有和公开资料冲突?

  • 同类产品在文档里通常怎么命名、怎么解释?

  • 新版本资料出来后,哪些地方可能影响原来的横评?

我不认为 AI 能替工程师拍板,尤其工控、安全系统这类场景更不能这么用。但 AI 很适合先把证据摊开,把“我印象里”变成“哪份资料、哪个版本、哪一段内容”。

所以这两个工具更像是前置管道:先把资料拿全、命名清楚、状态留住,后面的知识库、RAG 问答、方案审核才有干净的数据源。

适合谁用

我觉得它更适合这些人:

  • 自动化、电气、DCS/SIS 相关工程师

  • 经常整理厂商手册、规格书、证书、软件包的人

  • 想把资料库定期同步到 NAS 或本地资料库的人

  • 想把竞品资料接入本地 AI / RAG 知识库,用于方案审核和横评的人

  • 想让 AI Agent 帮忙查资料,但又不想让它模拟浏览器点击网页的人

如果只是偶尔下载一两份 PDF,网页搜索就够了,这两个工具没有必要。

局限

这不是绕过登录或协议确认的工具。需要登录、被锁定、或有软件协议确认的内容,脚本会跳过或放进清单里提示,不会硬抓。

另外,厂商网页和 API 可能调整,所以这种工具最好保留 manifest 和日志。万一接口变了,至少能知道是哪一步失效。

总结

这两个小工具主要解决一个很实际的问题:把厂商资料库从“网页搜索 + 手动点下载”变成“关键词搜索 + 清单 + 增量同步”。

项目已经公开:

如果你也经常整理工控、自动化、仪表、安全系统相关资料,应该会有用。

创作说明:这是我自己整理并开源的小工具,文章主要记录实现思路、测试结果和适用场景。

两个工业资料库同步工具:横河和施耐德

作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松