只用 CPU 可以运行部分 DeepSeek 本地模型,但“能启动”与“速度可接受”是两件事。建议从 deepseek-r1:1.5b 级别开始,限制上下文,并用 ollama ps 确认实际处理器分配。
先选小模型并完成基线
ollama pull deepseek-r1:1.5b
ollama run deepseek-r1:1.5b "只回答:CPU基线正常"
DeepSeek-R1 模型页列出不同参数版本及体积。CPU 测试先用小版本,避免一开始就让系统进入长时间换页。

确认是否真的在 CPU 上
ollama ps
查看 PROCESSOR 一列;显示 100% CPU 才是纯 CPU 加载,CPU/GPU 混合则属于部分卸载。Ollama FAQ给出了 ollama ps 的处理器分配示例。
如果机器有 NVIDIA GPU,而你需要做纯 CPU 对照实验,可先停止 Ollama 服务,在新的服务环境中把 CUDA_VISIBLE_DEVICES 设置为无效 GPU ID,再启动服务。官方 FAQ 提到可用无效 ID 强制忽略 GPU;不同系统设置服务变量的方法不同,不要只在一个无关终端里设置。
用固定请求测可用性
curl http://localhost:11434/api/chat -d '{
"model":"deepseek-r1:1.5b",
"messages":[{"role":"user","content":"把订单A的三个状态:已付款、待发货、未签收,整理成JSON数组。"}],
"stream":false,
"options":{"num_ctx":2048}
}'
记录开始时间、结束时间和输出是否包含三个原始状态;同时观察内存与交换空间。把相同请求重复三次,排除首次加载带来的额外等待。若内存接近上限、交换空间持续增长或系统失去响应,应换更小模型或缩短上下文。
什么时候该换 GPU
短问答、低频离线处理可以接受较慢 CPU;长文、多人并发或需要低延迟时,应评估受支持 GPU。Ollama GPU 文档列出了硬件和驱动范围,购买前按具体系统核对。
本文没有在你的 CPU 上测速,也不承诺固定每秒 token 数。指令集、内存带宽、量化、上下文和后台任务都会影响结果。验收应以你的真实材料和可接受等待时间为准。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/32403.html