llama.cpp
-
本地 AI 模型部署工具怎么选?Ollama、LM Studio、llama.cpp 与 vLLM 对比
按个人聊天、图形界面、GGUF精细控制和GPU并发服务,对比Ollama、LM Studio、llama.cpp与vLLM。
-
DeepSeek-R1-Distill-Qwen-7B 怎么量化?转换 GGUF、生成 Q4_K_M 并校验模型
把DeepSeek-R1-Distill-Qwen-7B从BF16转换为GGUF并量化成Q4_K_M,再用固定业务样本比较质量和性能。
-
DeepSeek GGUF 怎么用?不装 Ollama,直接用 llama.cpp 启动命令行和本地 API
不经过Ollama,直接用llama.cpp加载DeepSeek GGUF,验证命令行、健康检查、模型列表和聊天API。
-
纯 CPU 运行 DeepSeek 太慢怎么办?用 llama.cpp 测生成速度并调整线程和上下文
用llama-bench拆分提示处理和生成速度,逐项调整CPU线程、OpenBLAS、上下文与并发并复测。
-
香橙派 RK3588 怎么运行 DeepSeek?用 llama.cpp 跑 1.5B 量化模型并读取基准结果
在香橙派RK3588的Arm64 Linux上编译llama.cpp,用1.5B量化模型跑基准并区分CPU推理与NPU路径。
-
Jetson 怎么运行 DeepSeek?编译 llama.cpp 启用 CUDA,并用日志确认 GPU 加速
在Jetson Orin上启用llama.cpp CUDA后端,通过卸载日志、tegrastats和CPU/GPU对照基准确认加速。
-
树莓派 5 怎么部署 DeepSeek?用 llama.cpp 运行 1.5B 模型并验证本地 API
在树莓派5上编译llama.cpp,运行DeepSeek 1.5B量化模型,并用命令行和本地API验证结果与故障边界。