一、大模型从云端走向端侧,算力与内存成为两道硬门槛
大语言模型和多模态模型的快速发展,正在推动AI推理从云端向端侧迁移。在机器人、工业控制、智能终端等场景中,将大模型部署在本地而非依赖云端API,意味着更低延迟、更高隐私保护和更稳定的可用性。

但端侧部署并非“把模型塞进主板”那么简单。不同参数规模的大模型对NPU算力和内存的需求差异巨大——1B模型与7B模型之间的资源消耗差距,可能相差数倍甚至十倍以上。选型不当,轻则推理卡顿、响应迟缓,重则模型根本无法加载运行。
本文将从算力需求和内存占用两个维度,拆解1B-3B与7B大模型在端侧部署时的硬件要求,以及瑞迅科技基于RK3588、RK3576、RK3568平台的嵌入式工控主板方案如何分级匹配这些需求。
二、算力需求:不同参数模型对NPU算力的要求
大模型在端侧运行的算力消耗,主要取决于模型参数量、量化精度和推理任务类型。
行业普遍认知是:参数量越大,对NPU算力的要求越高。瑞芯微作为端侧AI芯片的主要厂商,已将自研NPU划分为1TOPS以下轻量算力、1-3TOPS中等算力、3-16TOPS中高算力以及16TOPS以上高算力四个层级,分别对应1.5B、3B、7B等不同参数模型的本地化部署。
具体而言:
1B-3B参数模型属于轻量级端侧模型。这类模型经过量化后可在3-6TOPS算力的NPU平台上流畅运行。以瑞芯微RK3576和RK3588为例,两者均配备6TOPS NPU,官方资料显示可支持端侧高达3B参数级别的模型部署。实测中,RK3576部署3B参数大模型可实现语音交互、多模态搜索等功能,响应延迟低于200ms。
7B参数模型对算力的要求显著提升。单颗6TOPS NPU运行7B模型会较为吃力。要流畅运行7B模型,通常需要更高算力或专用AI协处理器。瑞芯微推出的RK182X系列端侧AI协处理器,集成多核高算力NPU,峰值算力达20TOPS,可流畅支持7B参数大模型的本地运行。实测Gemma4模型在RK3588+RK1828双芯架构下首Token延迟低至169.93ms。
一个值得关注的趋势是:随着模型量化与蒸馏技术的进步,2026年接近1B体量的模型已可达到商用门槛,端侧大模型部署正在从“能不能跑”走向“跑得好不好”。
三、内存需求:模型加载与推理的“隐形瓶颈”
算力之外,内存容量与带宽是端侧部署大模型的第二道硬门槛,也是最容易被忽视的瓶颈。
大模型推理过程中,模型权重、KV Cache和中间激活数据需要持续占用大量内存。内存不足的直接后果是模型无法加载——而不是运行变慢。
不同参数模型的内存占用量级差异显著:
1B-3B模型在INT4量化后,模型权重占用约1.8-2.2GB。加上操作系统和推理框架的开销,建议设备配备4GB以上内存,推荐8GB以获得更流畅的体验。RK3588平台在运行1.5B模型时,建议配置8GB LPDDR4X以上内存。
7B模型的内存需求大幅跃升。FP16精度下,7B模型权重约需14GB,已超过大多数嵌入式设备的内存上限。即便经过INT4量化,7B模型权重仍需要约4-5gB。加上系统开销,运行7B模型通常需要16GB以上内存。RK3588平台跑7B模型时,16GB内存是基本门槛,否则模型文件都无法加载。
内存带宽同样关键。大模型推理是内存密集型任务,带宽不足会直接限制token生成速度。RK182X协处理器采用3D堆叠封装集成高带宽DRAM,理论带宽达1TB/s,运行Qwen2.5-3B模型时输出速度突破100 token/s。
四、量化技术:在精度与资源之间找到平衡
端侧部署大模型之所以成为可能,模型量化起到了决定性作用。
INT4量化已成为端侧部署的事实标准。经验法则显示,4-bit量化后模型内存占用约为参数量×0.6GB——即3B模型约1.8GB、7B模型约4.2GB。相比FP16精度,INT4量化可将模型体积压缩至原来的四分之一左右,使大模型能够在内存有限的嵌入式设备上运行。
但量化需要在精度和资源之间做权衡。INT8量化精度损失更小,但内存占用约为INT4的两倍;INT4量化内存效率最高,但在某些任务上可能存在精度下降。开发者需要根据具体应用场景选择合适的量化精度。
五、瑞迅科技RK3588/3576/3568:分级匹配端侧大模型部署需求
针对端侧大模型部署的差异化需求,瑞迅科技基于瑞芯微平台推出了分级化的嵌入式工控主板方案:
瑞迅科技RK3568核心板平台:四核Cortex-A55架构,内置1TOPS NPU算力,功耗控制在3.5W以内。主要面向轻量级AI推理场景,如语音唤醒、关键词识别等,不适合运行大语言模型。
瑞迅科技RK3576核心板平台:六核CPU架构(双核Cortex-A72+四核Cortex-A53),内置6TOPS NPU算力,支持INT4/INT8/INT16/FP16等多精度运算。可支撑1B-3B参数级别的端侧大模型部署,适用于需要本地翻译、总结、问答等功能的机器人及智能终端场景。
瑞迅科技RK3588核心板平台:旗舰级八核异构架构(四核Cortex-A76+四核Cortex-A55),内置三核架构6TOPS NPU算力。同样支持3B以下参数模型部署,同时可通过PCIe扩展RK182X端侧AI协处理器,将整机算力提升至20TOPS以上,支撑7B参数级别大模型的端侧流畅运行。实测运行DeepSeek-R1 7B模型时吞吐量可达每秒12 token左右。
瑞迅科技 RK3588/RK3576主控+RK1828协处理器双芯协同方案面向7B及以上大模型端侧部署。主控SoC负责系统调度与运动控制,协处理器专职AI推理,两者通过PCIe高速互联,各司其职、互不抢占资源。该方案已针对Gemma4、Qwen3.5等主流大模型完成深度底层调优,2B-7B主流模型均可流畅本地运行。

结语:端侧大模型部署,选型需算力与内存并重
端侧部署大模型不是“选一颗算力最高的芯片”那么简单。算力决定推理速度,内存决定模型能否加载,两者的匹配程度决定最终体验。
瑞迅科技以RK3568、RK3576、RK3588三大平台配合RK182X端侧AI协处理器的灵活扩展能力,为端侧大模型部署提供了从1B到7B的分级算力与内存方案。无论是轻量级语音交互的智能终端,还是需要7B大模型推理的机器人与边缘计算设备,都能在瑞迅科技的产品矩阵中找到匹配的硬件底座。
审核编辑 黄宇
推荐阅读:







