CPU推理
-
只用 CPU 能跑 DeepSeek 吗?用 Ollama 启动小模型并检查处理器占用
用 Ollama 小模型建立纯 CPU 基线,通过固定请求、ollama ps 和重复测速判断 DeepSeek 是否可用。
-
纯 CPU 运行 DeepSeek 太慢怎么办?用 llama.cpp 测生成速度并调整线程和上下文
用llama-bench拆分提示处理和生成速度,逐项调整CPU线程、OpenBLAS、上下文与并发并复测。
-
CPU 跑 AI 推理有多快?用固定模型测延迟和吞吐量
固定逻辑回归模型、输入与线程设置,预热后用 perf_counter_ns 统计 CPU 推理 P50/P95 和样本吞吐;保存模型参数指纹和环境,说明与在线服务及 LLM 测速的区别。