端侧 7B 大模型实测 100 TPS RK3588 + RK1828 双模组 AI算力盒子
各位值友,最近折腾端侧大模型部署的朋友一定绕不开一个灵魂拷问:7B 模型到底能不能在盒子本地跑得飞起?
,
今天给大家带来的这台 AIBOX PRO 给了我一个相当硬核的回答 —— 它用 RK3588 做主模组,再外挂一片 RK1828 端侧生成式 AI 协处理器,实测 Qwen2.5-3B 跑到 100.15 TPS,Qwen2.5-7B 跑到 69.37 TPS,推理输出速度约为竞品 3 倍。下面把这台"端侧大模型 AI 算力盒子"掰开揉碎讲清楚。
,
▍ 一、产品定位:为什么要做"双模组"?
,
传统边缘 AI 盒子往往只有一颗 SoC,既要跑系统、做视频解码,又要扛模型推理,结果就是 "什么都做,但什么都不强"。AIBOX PRO 的思路很直接 —— 主模组 + 副模组异构分体式:
主模组(Core-3588JD4 / RK3588):负责系统调度、视频解码、图像预处理、HDMI 输出,相当于"指挥中心 + 视频前处理"。
副模组(RK1828 加速卡):专门跑大模型推理,相当于"AI 算力心脏",片内 5GB DRAM、20 TOPS (INT8) 算力,流畅运行 7B 以内大模型。
两片模组之间通过 M.2 PCIe 高速互联,主模组把预处理好的数据/Token 喂给副模组,副模组专注把推理算力拉满。这种架构在边缘侧非常聪明 —— 视频/图像处理交给生态成熟的 RK3588,Transformer 推理交给专精的 RK1828,各司其职,效率最大化。
【配图2】

▲ RK1828 实测 Qwen2.5-3B:100.15 TPS vs 竞品 35 TPS(约 3 倍领先)▍ 二、核心亮点:7 大卖点一次看懂
双模组异构 —— RK3588 主控 + RK1828 加速卡,PCIe 互联,模型并行、多任务协作
大算力模组 —— 支持 RK1820 / RK1828 / 后摩 LQ50 等高算力模组,LLM/VLM/MoE/AI Agent 通用底座
8K 编解码 —— 主模组集成 VPU,8K 硬编解码 + 多通道 4K 并行处理
毫秒级响应 —— 本地推理,免上云,免网络抖动,毫秒级时延 + 数据隐私合规
工业级丰富接口 —— 双千兆网口、USB3.0、HDMI、M.2、Mini PCIe、RS485、CAN-FD、光耦 DI/DO
全铝散热 —— 工业级全铝合金外壳 + 内置风扇,7×24h 不间断稳定运行
PCIe NVMe —— 板载 M.2 PCIe,NVMe SSD 扩容至 TB 级,大模型权重本地常驻
▍ 三、硬核实测:RK1828 LLM 性能跑分
光说不练假把式,先放一组 RK1828 在 LLM 实测中相对竞品的对比。从下图可以看到,AIBOX PRO 搭载的 RK1828 模组在 Qwen2.5-3B 上跑出 100.15 TPS,而对比的 O*** NX 仅 35 TPS,领先约 3 倍。
【配图4】

▲ LLM 性能对比:Qwen2.5-3B / Qwen2.5-7B(TTFT + TPS,RK182X vs O*** NX 8GB)
放到 7B 模型上,差距更明显。RK1828 实测 Qwen2.5-7B 输出 69.37 TPS,而竞品仅 18.4 TPS,速度差距接近 4 倍。TTFT(首字时延)方面,7B 模型 RK1828 仅 158 ms,竞品高达 282 ms,几乎只有对手的一半。
【配图5】

▲ 7B 大模型:TTFT 158ms vs 282ms;TPS 69.37 vs 18.4,速度差距接近 4 倍
下面这张表给出了 RK1828 跑不同尺寸 Qwen 模型的实测性能汇总:
▍模型名称:
Qwen 2.5-3B:128 | 128 | 83.09 | 100.75
Qwen 2.5-7B:128 | 128 | 158.28 | 69.37
Qwen 3-4B:128 | 128 | 106.58 | 86.87
【配图6】

▲ RK1828 领先的 LLM 性能表现:Qwen2.5-3B/7B/3-4B 实测 TPS 与 TTFT
3B 模型已经可以跑出 100+ TPS,7B 模型也能稳跑 69+ TPS,日常做摘要、问答、对话机器人完全够用。
7B 模型在长文本生成质量上,RK1828 同样明显占优,行文流畅度、逻辑连贯性都比竞品更稳定,这得益于其针对 Transformer 架构优化的片内带宽。
【配图3】

▲ 7B 大模型实测文本生成质量:RK1828(左) vs 竞品(右)
💡 一句话总结 RK1828 的 LLM 性能:"3B 跑出百级 TPS,7B 跑出近 4 倍速度差,端侧大模型不再卡顿。"
▍ 四、视觉天花板:端侧 VLM & 多路视频分析既然是 AIBOX PRO,那 VLM(视觉语言模型) 能力也是必须看的。RK1828 跑 Qwen3-VL 系列的表现同样惊艳:
▍模型:
Qwen3-VL-2B:384 × 384 | 155.32 | 53.24 | 136.32
Qwen3-VL-4B:384 × 384 | 166.02 | 107.71 | 86.52
【配图7】

▲ RK182X 端侧 VLM 性能天花板:Qwen3-VL-2B/4B 实测
VLM 跑得动还不够,能不能同时分析多路视频?AIBOX PRO 给出的答案是 —— "四路同时分析,毫无压力"。下面这张官方 demo 演示了 RK1828 同时对 4 路监控视频做 VLM 推理:
通道 1:仓储盗窃识别(可疑人员聚众,触发"人员异常"告警)
通道 2:园区烟火识别(车辆起火,触发"烟火检测"告警)
通道 3:道路交通(车辆违停/正常通行,识别车辆类型与行为)
通道 4:室内入侵检测(人形识别)
【配图8】

▲ 端侧多路视频 VLM 监控系统:四路同时分析(盗窃 / 烟火 / 交通 / 入侵)
这种 "多路 VLM + 单台设备 + 离线运行" 的能力,过去基本只能靠云端算力集群才能做到,现在一台巴掌大的盒子就能搞定,对智慧安防、园区运营这类场景是真·降维打击。
▍ 五、横向对比:与 Hailo-8 / DeepX 的定位差异
很多人会问:"Hailo-8 / DeepX 不也是端侧 AI 芯片吗?RK182X 凭什么?" 我直接引用官方的一张对比图来回答 —— 它们走的是完全不同的技术路线:▍芯片型号:
**瑞芯微 RK182X**:端侧生成式 AI 协处理器 | Transformer (LLM, VLM) | 极高访存带宽
Hailo-8(以色列):工业级纯视觉 AI 加速器 | CNN(YOLO、ResNet 等) | 26 TOPS @ 2.5W
DeepX DX-M1(韩国):高通用性机器视觉 NPU | CNN、早期 Transformer | 22 TOPS @ < 5W
【配图1】

▲ 核心竞品定位对比:RK182X 专攻 LLM/VLM,其它两家主打 CNN 视觉结论很清晰:
如果你的场景是传统 CV(目标检测、分类、分割),Hailo-8 / DeepX 已经很成熟。
如果你的场景是大模型本地推理(LLM 对话、VLM 视觉问答、AI Agent),RK182X 是当下为数不多能跑出 100+ TPS 的国产方案。
换句话说,RK182X 不是 Hailo-8 的替代品,而是面向生成式 AI 时代的全新品类。
▍ 六、规格参数 & 接口一览▍ 6.1 基本参数(RK3588 + 1 × RK1828 配置)
▍项目:
主模组:Core-3588JD4(RK3588) · LPDDR4/x 4/8/16/32GB · eMMC 32~256GB · 6 TOPS (INT8)
副模组:RK1828 模组 · 片内 5GB DRAM · 20 TOPS (INT8) · ≤ 7B 大模型
视频编码:RK3588:8K@30fps H.265 / H.264
视频解码:RK3588:8K@60fps H.265/VP9/AVS2、8K@30fps H.264、4K@60fps AV1
扩展存储:1 × M.2 PCIe 4.0 ×4 NVMe 2280 SSD · 1 × SATA 3.0 · 1 × TF Card
主板电源:DC 12V/5A(5.5×2.1mm,支持 9V~36V 宽压)
加速卡电源:2 × 12V(4Pin-1.25mm Wafer 座)
典型功耗:9.6 W(12V/800mA) · 最大 16.8 W · 最小 0.84 W
操作系统:Linux
尺寸:160 × 111 × 61 mm
工作温度:-20℃ ~ 60℃
▍ 6.2 接口一览▍类别:
网络:2 × 千兆以太网(RJ45) · Wi-Fi/蓝牙(2.4G/5G 双频,蓝牙 5.2,M.2 E-KEY) · 4G/5G(Mini PCIe / M.2 B-KEY)
视频输出:1 × HDMI 2.1(最高 4K@60Hz)
音频:1 × Line In(3.5mm) · 1 × Line Out(3.5mm)
USB:2 × USB 3.0(限流 1A) · 1 × Type-C(USB 2.0 OTG) · 1 × Type-C(Debug)
按键 / 指示:电源键 · 升级键 · 电源指示灯 · 网口指示灯 · 自定义指示灯
天线:2 × Wi-Fi 天线 · 1 × 4G 天线 · 1 × SIM Card
凤凰端子:8Pin-3.5mm:1 × RS485 · 1 × CAN-FD · 2 × 光耦隔离 DI/DO
TF Card:1 × TF Card 槽
▍ 七、典型应用场景
🤖 机器人 / 多模态感知:7B 多模态模型本地实时推理,导航、避障、语音对话一体化
🛡 智能安防 / 多路 VLM:4 路视频同时做 VLM 分析(盗窃/烟火/交通/入侵),离线可跑
🏭 工业自动化:工厂车间视觉检测 + 工艺对话助手,工业级宽温、宽压、抗干扰
🧠 AI 边缘计算网关:本地大模型网关:金融、医疗、政务等数据不出园区的合规场景
🚗 车载 / 智能驾驶:车内多模态助手、DMS 驾驶员监测、9V~36V 宽压直接接车载电源
🏪 零售 / 智慧城市:无人门店导购、城市运营事件挖掘,本地低延迟响应▍ 八、总结:谁该买?怎么买?
▍ ✅ 推荐购买
需要在本地跑 7B 以内大模型,对 TPS / TTFT 有较高要求(智能客服、AI Agent、问答系统)。
需要 多路视频 VLM 实时分析,且数据不能上云(园区/工厂/政务)。
需要 工业级 部署(宽温、宽压、抗干扰、7×24h 运行)。
已经有 RK3588 / Linux 生态积累,希望在原平台上无缝叠加 AI 推理算力。
▍ ⚠️ 需要权衡
副模组上限是 7B 模型,如果需要跑 13B / 35B 大模型,建议选配 后摩 LQ50 模组版本(48GB LPDDR5 / 160 TOPS)—— 我另外写了一篇实测文,可站内搜索。
默认 Linux 系统,如果一定要 Android,建议确认具体型号支持情况。
作者提示含AI生成内容。作者声明本文存在利益相关性,请大家尊重作者及分享的内容,友善沟通,理性决策~
