端侧 7B 大模型实测 100 TPS RK3588 + RK1828 双模组 AI算力盒子

2026-07-30 10:45:18 0点赞 0收藏 0评论

各位值友,最近折腾端侧大模型部署的朋友一定绕不开一个灵魂拷问:7B 模型到底能不能在盒子本地跑得飞起?

,

今天给大家带来的这台 AIBOX PRO 给了我一个相当硬核的回答 —— 它用 RK3588 做主模组,再外挂一片 RK1828 端侧生成式 AI 协处理器,实测 Qwen2.5-3B 跑到 100.15 TPS,Qwen2.5-7B 跑到 69.37 TPS,推理输出速度约为竞品 3 倍。下面把这台"端侧大模型 AI 算力盒子"掰开揉碎讲清楚。

,

▍ 一、产品定位:为什么要做"双模组"?

,

传统边缘 AI 盒子往往只有一颗 SoC,既要跑系统、做视频解码,又要扛模型推理,结果就是 "什么都做,但什么都不强"。AIBOX PRO 的思路很直接 —— 主模组 + 副模组异构分体式

  • 主模组(Core-3588JD4 / RK3588):负责系统调度、视频解码、图像预处理、HDMI 输出,相当于"指挥中心 + 视频前处理"。

  • 副模组(RK1828 加速卡):专门跑大模型推理,相当于"AI 算力心脏",片内 5GB DRAM、20 TOPS (INT8) 算力,流畅运行 7B 以内大模型

两片模组之间通过 M.2 PCIe 高速互联,主模组把预处理好的数据/Token 喂给副模组,副模组专注把推理算力拉满。这种架构在边缘侧非常聪明 —— 视频/图像处理交给生态成熟的 RK3588,Transformer 推理交给专精的 RK1828,各司其职,效率最大化

【配图2】

端侧 7B 大模型实测 100 TPS RK3588 + RK1828 双模组 AI算力盒子

▲ RK1828 实测 Qwen2.5-3B:100.15 TPS vs 竞品 35 TPS(约 3 倍领先)▍ 二、核心亮点:7 大卖点一次看懂

  1. 双模组异构 —— RK3588 主控 + RK1828 加速卡,PCIe 互联,模型并行、多任务协作

  2. 大算力模组 —— 支持 RK1820 / RK1828 / 后摩 LQ50 等高算力模组,LLM/VLM/MoE/AI Agent 通用底座

  3. 8K 编解码 —— 主模组集成 VPU,8K 硬编解码 + 多通道 4K 并行处理

  4. 毫秒级响应 —— 本地推理,免上云,免网络抖动,毫秒级时延 + 数据隐私合规

  5. 工业级丰富接口 —— 双千兆网口、USB3.0、HDMI、M.2、Mini PCIe、RS485、CAN-FD、光耦 DI/DO

  6. 全铝散热 —— 工业级全铝合金外壳 + 内置风扇,7×24h 不间断稳定运行

  7. PCIe NVMe —— 板载 M.2 PCIe,NVMe SSD 扩容至 TB 级,大模型权重本地常驻

▍ 三、硬核实测:RK1828 LLM 性能跑分

光说不练假把式,先放一组 RK1828 在 LLM 实测中相对竞品的对比。从下图可以看到,AIBOX PRO 搭载的 RK1828 模组在 Qwen2.5-3B 上跑出 100.15 TPS,而对比的 O*** NX 仅 35 TPS,领先约 3 倍

【配图4】

端侧 7B 大模型实测 100 TPS RK3588 + RK1828 双模组 AI算力盒子

▲ LLM 性能对比:Qwen2.5-3B / Qwen2.5-7B(TTFT + TPS,RK182X vs O*** NX 8GB)

放到 7B 模型上,差距更明显。RK1828 实测 Qwen2.5-7B 输出 69.37 TPS,而竞品仅 18.4 TPS,速度差距接近 4 倍。TTFT(首字时延)方面,7B 模型 RK1828 仅 158 ms,竞品高达 282 ms,几乎只有对手的一半。

【配图5】

端侧 7B 大模型实测 100 TPS RK3588 + RK1828 双模组 AI算力盒子

▲ 7B 大模型:TTFT 158ms vs 282ms;TPS 69.37 vs 18.4,速度差距接近 4 倍

下面这张表给出了 RK1828 跑不同尺寸 Qwen 模型的实测性能汇总:

▍模型名称:

  • Qwen 2.5-3B:128 | 128 | 83.09 | 100.75

  • Qwen 2.5-7B:128 | 128 | 158.28 | 69.37

  • Qwen 3-4B:128 | 128 | 106.58 | 86.87

    【配图6】

端侧 7B 大模型实测 100 TPS RK3588 + RK1828 双模组 AI算力盒子
  • ▲ RK1828 领先的 LLM 性能表现:Qwen2.5-3B/7B/3-4B 实测 TPS 与 TTFT

    3B 模型已经可以跑出 100+ TPS7B 模型也能稳跑 69+ TPS,日常做摘要、问答、对话机器人完全够用。

    7B 模型在长文本生成质量上,RK1828 同样明显占优,行文流畅度、逻辑连贯性都比竞品更稳定,这得益于其针对 Transformer 架构优化的片内带宽。

  • 【配图3】

端侧 7B 大模型实测 100 TPS RK3588 + RK1828 双模组 AI算力盒子
  • ▲ 7B 大模型实测文本生成质量:RK1828(左) vs 竞品(右)

    💡 一句话总结 RK1828 的 LLM 性能:"3B 跑出百级 TPS,7B 跑出近 4 倍速度差,端侧大模型不再卡顿。"

    ▍ 四、视觉天花板:端侧 VLM & 多路视频分析既然是 AIBOX PRO,那 VLM(视觉语言模型) 能力也是必须看的。RK1828 跑 Qwen3-VL 系列的表现同样惊艳:

    ▍模型:

    • Qwen3-VL-2B:384 × 384 | 155.32 | 53.24 | 136.32

    • Qwen3-VL-4B:384 × 384 | 166.02 | 107.71 | 86.52

    【配图7】

端侧 7B 大模型实测 100 TPS RK3588 + RK1828 双模组 AI算力盒子
  • ▲ RK182X 端侧 VLM 性能天花板:Qwen3-VL-2B/4B 实测

    VLM 跑得动还不够,能不能同时分析多路视频?AIBOX PRO 给出的答案是 —— "四路同时分析,毫无压力"。下面这张官方 demo 演示了 RK1828 同时对 4 路监控视频做 VLM 推理:

    • 通道 1:仓储盗窃识别(可疑人员聚众,触发"人员异常"告警)

    • 通道 2:园区烟火识别(车辆起火,触发"烟火检测"告警)

    • 通道 3:道路交通(车辆违停/正常通行,识别车辆类型与行为)

    • 通道 4:室内入侵检测(人形识别)

    【配图8】

端侧 7B 大模型实测 100 TPS RK3588 + RK1828 双模组 AI算力盒子
  • ▲ 端侧多路视频 VLM 监控系统:四路同时分析(盗窃 / 烟火 / 交通 / 入侵)

    这种 "多路 VLM + 单台设备 + 离线运行" 的能力,过去基本只能靠云端算力集群才能做到,现在一台巴掌大的盒子就能搞定,对智慧安防、园区运营这类场景是真·降维打击。

    ▍ 五、横向对比:与 Hailo-8 / DeepX 的定位差异

    很多人会问:"Hailo-8 / DeepX 不也是端侧 AI 芯片吗?RK182X 凭什么?" 我直接引用官方的一张对比图来回答 —— 它们走的是完全不同的技术路线▍芯片型号:

    • **瑞芯微 RK182X**端侧生成式 AI 协处理器Transformer (LLM, VLM) | 极高访存带宽

    • Hailo-8(以色列):工业级纯视觉 AI 加速器 | CNN(YOLO、ResNet 等) | 26 TOPS @ 2.5W

    • DeepX DX-M1(韩国)高通用性机器视觉 NPU | CNN、早期 Transformer | 22 TOPS @ < 5W

    【配图1】

端侧 7B 大模型实测 100 TPS RK3588 + RK1828 双模组 AI算力盒子
  • ▲ 核心竞品定位对比:RK182X 专攻 LLM/VLM,其它两家主打 CNN 视觉结论很清晰:

    • 如果你的场景是传统 CV(目标检测、分类、分割),Hailo-8 / DeepX 已经很成熟。

    • 如果你的场景是大模型本地推理(LLM 对话、VLM 视觉问答、AI Agent),RK182X 是当下为数不多能跑出 100+ TPS 的国产方案。

    换句话说,RK182X 不是 Hailo-8 的替代品,而是面向生成式 AI 时代的全新品类

    ▍ 六、规格参数 & 接口一览▍ 6.1 基本参数(RK3588 + 1 × RK1828 配置)

    ▍项目:

    • 主模组:Core-3588JD4(RK3588) · LPDDR4/x 4/8/16/32GB · eMMC 32~256GB · 6 TOPS (INT8)

    • 副模组:RK1828 模组 · 片内 5GB DRAM · 20 TOPS (INT8) · ≤ 7B 大模型

    • 视频编码:RK3588:8K@30fps H.265 / H.264

    • 视频解码:RK3588:8K@60fps H.265/VP9/AVS2、8K@30fps H.264、4K@60fps AV1

    • 扩展存储:1 × M.2 PCIe 4.0 ×4 NVMe 2280 SSD · 1 × SATA 3.0 · 1 × TF Card

    • 主板电源:DC 12V/5A(5.5×2.1mm,支持 9V~36V 宽压

    • 加速卡电源:2 × 12V(4Pin-1.25mm Wafer 座)

    • 典型功耗9.6 W(12V/800mA) · 最大 16.8 W · 最小 0.84 W

    • 操作系统:Linux

    • 尺寸:160 × 111 × 61 mm

    • 工作温度:-20℃ ~ 60℃

    ▍ 6.2 接口一览▍类别:

    • 网络:2 × 千兆以太网(RJ45) · Wi-Fi/蓝牙(2.4G/5G 双频,蓝牙 5.2,M.2 E-KEY) · 4G/5G(Mini PCIe / M.2 B-KEY)

    • 视频输出:1 × HDMI 2.1(最高 4K@60Hz)

    • 音频:1 × Line In(3.5mm) · 1 × Line Out(3.5mm)

    • USB:2 × USB 3.0(限流 1A) · 1 × Type-C(USB 2.0 OTG) · 1 × Type-C(Debug)

    • 按键 / 指示:电源键 · 升级键 · 电源指示灯 · 网口指示灯 · 自定义指示灯

    • 天线:2 × Wi-Fi 天线 · 1 × 4G 天线 · 1 × SIM Card

    • 凤凰端子:8Pin-3.5mm:1 × RS485 · 1 × CAN-FD · 2 × 光耦隔离 DI/DO

    • TF Card:1 × TF Card 槽

    ▍ 七、典型应用场景

    • 🤖 机器人 / 多模态感知:7B 多模态模型本地实时推理,导航、避障、语音对话一体化

    • 🛡 智能安防 / 多路 VLM:4 路视频同时做 VLM 分析(盗窃/烟火/交通/入侵),离线可跑

    • 🏭 工业自动化:工厂车间视觉检测 + 工艺对话助手,工业级宽温、宽压、抗干扰

    • 🧠 AI 边缘计算网关:本地大模型网关:金融、医疗、政务等数据不出园区的合规场景

    • 🚗 车载 / 智能驾驶:车内多模态助手、DMS 驾驶员监测、9V~36V 宽压直接接车载电源

    • 🏪 零售 / 智慧城市:无人门店导购、城市运营事件挖掘,本地低延迟响应▍ 八、总结:谁该买?怎么买?

      ▍ ✅ 推荐购买

      • 需要在本地跑 7B 以内大模型,对 TPS / TTFT 有较高要求(智能客服、AI Agent、问答系统)。

      • 需要 多路视频 VLM 实时分析,且数据不能上云(园区/工厂/政务)。

      • 需要 工业级 部署(宽温、宽压、抗干扰、7×24h 运行)。

      • 已经有 RK3588 / Linux 生态积累,希望在原平台上无缝叠加 AI 推理算力。

      ▍ ⚠️ 需要权衡

    • 副模组上限是 7B 模型,如果需要跑 13B / 35B 大模型,建议选配 后摩 LQ50 模组版本(48GB LPDDR5 / 160 TOPS)—— 我另外写了一篇实测文,可站内搜索。

    • 默认 Linux 系统,如果一定要 Android,建议确认具体型号支持情况。

作者提示含AI生成内容。作者声明本文存在利益相关性,请大家尊重作者及分享的内容,友善沟通,理性决策~

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
相关好价
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松