香橙派 RK3588 怎么运行 DeepSeek?用 llama.cpp 跑 1.5B 量化模型并读取基准结果

在香橙派RK3588的Arm64 Linux上编译llama.cpp,用1.5B量化模型跑基准并区分CPU推理与NPU路径。

香橙派 RK3588 系列可以先用 Arm CPU 路径运行 DeepSeek 的 1.5B 量化模型。板载 NPU 不会因为模型是 GGUF 就自动工作;如果目标是先跑通对话和得到自己的速度数据,llama.cpp CPU 路径更容易验证。本文以 64 位 Linux 为例,性能需由你的内存规格、散热、系统镜像和频率状态实测。

准备前先做四项检查

uname -m
lscpu
free -h
cat /sys/class/thermal/thermal_zone0/temp

uname -m 应为 aarch64。以当前设备的 lscpu 和系统日志为准,不从商品页推断实际频率。板卡带有 NPU 也不等于 llama.cpp 会调用它;本文只验收 CPU 推理,避免把未启用的 NPU 写成“已经加速”。

香橙派 RK3588 怎么运行 DeepSeek?用 llama.cpp 跑 1.5B 量化模型并读取基准结果

编译 Arm64 版本

sudo apt update
sudo apt install -y git cmake build-essential libcurl4-openssl-dev
git clone https://github.com/ggml-org/llama.cpp.git
cd llama.cpp
cmake -B build -DCMAKE_BUILD_TYPE=Release
cmake --build build --config Release -j 6

如果内存紧张或系统杀掉编译进程,把并行度降为 -j 2。编译后执行 ./build/bin/llama-cli --version,先确认程序可运行。

选择 1.5B Q4 模型并记录来源

DeepSeek 官方模型卡确认存在 DeepSeek-R1-Distill-Qwen-1.5B。选择与该模型匹配的 Q4_K_M GGUF 时,保存下载页、量化说明、许可证和 SHA-256。社区转换文件不是 DeepSeek 官方原始权重,来源需要单独核验。

sha256sum ~/models/DeepSeek-R1-Distill-Qwen-1.5B-Q4_K_M.gguf

用 llama-bench 读取本机结果

cd ~/llama.cpp
./build/bin/llama-bench \
  -m ~/models/DeepSeek-R1-Distill-Qwen-1.5B-Q4_K_M.gguf \
  -t 8 -p 128 -n 128

保存输出中的 pp 和 tg,前者是提示处理,后者是生成。再分别用 -t 4、-t 6、-t 8 重复三次,取中位数。线程越多不一定越快:大小核调度、内存带宽和降频都会影响结果。

同时记录温度:

watch -n 1 'cat /sys/class/thermal/thermal_zone0/temp'

数值通常需要除以 1000 才是摄氏度。若同一测试越跑越慢且温度持续上升,应先改善散热,再比较参数。

跑一次对话并核对输出

./build/bin/llama-cli \
  -m ~/models/DeepSeek-R1-Distill-Qwen-1.5B-Q4_K_M.gguf \
  -t 8 -c 2048 -n 96 \
  -p "请列出离线边缘推理的两个优点和一个限制。"

验收点包括:模型正常加载、没有内存分配失败、输出非空并完成停止。1.5B 蒸馏模型能力有限,答案内容仍需人工核对,不能把“成功输出文本”等同于答案正确。

什么时候再考虑 NPU

只有在以下条件都能回答时,才进入 RKNN/NPU 路线:目标模型能否转换为厂商运行时接受的格式;动态形状、注意力和 KV cache 等算子是否支持;量化方法是否有校准数据;运行时和驱动是否匹配当前系统镜像。若转换中出现大量 CPU 回退,即使程序能启动,也不能宣称 NPU 完整加速。

常见故障

  • Illegal instruction:可能使用了为另一种 Arm 指令集编译的二进制,改为在当前板卡源码编译。
  • 加载模型时被杀:检查 dmesg -T 和 free -h,换更小文件或更短上下文。
  • 速度异常低:固定电源、散热、线程和后台任务后重测;不要引用别人的板卡数字。
  • NPU 占用为零:本文 CPU 路径本来就不会调用 NPU,这不是 llama.cpp CPU 推理失败。

资料来源

Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/32126.html

赞 (0)
AI小管家的头像AI小管家
ChatGPT 怎么优化商品关键词?从搜索意图到标题验收表
上一篇 1小时前
Quadro T2000 能运行 DeepSeek 吗?小显存从 1.5B 与 GPU 日志验证
下一篇 1小时前

相关推荐

联系我们

联系我们

1

在线咨询: QQ交谈

邮件:admin@example.com

工作时间:周一至周五,9:30-18:30,节假日休息

关注微信
关注微信
分享本页
返回顶部