用户工具

站点工具


p104-100-local-llm

P104-100 跑本地大模型 — 实测性能数据

P104-100 虽然是矿卡,但才 79 块钱包邮一张,8GB 显存,两张组合就是 16GB,可以用 Ollama 跑 14B~20B 的大模型,性价比极高!

来源:矿渣再就业:双卡 P104-100 运行大语言模型可行性报告 · Reddit 讨论


硬件环境

  • 显卡:P104-100 × 2(8GB GDDR5 × 2 = 16GB)
  • 主板:H61 + E3-1220v2
  • 内存:8GB DDR3
  • 连接:第一张 PCIe 1.0 x4,第二张通过矿卡延长线跑 PCIe 1.0 x1
  • 软件:Ollama 0.11.10,Ubuntu Linux

即使第二张卡只跑在 PCIe 1.0 x1(理论带宽 250MB/s),对推理速度也没有明显影响!因为 LLM 推理时 PCIe I/O 带宽占用普遍在 100MB/s 以下。


部署 Ollama

1. 下载安装

mkdir ollama
mv ollama-linux-amd64.tgz ollama/
cd ollama/
tar -xzvf ollama-linux-amd64.tgz
rm ollama-linux-amd64.tgz

2. 指定模型存储位置

mkdir data

创建启动脚本 run.sh:

export HOME=/path/to/ollama/data/
./bin/ollama serve

3. 启动并运行模型

./run.sh
./ollama run qwen3:8b --verbose

单卡 P104-100 速度测试

模型 速度 (tokens/s)
gemma3:270m 118.22
qwen3:0.6b 64.24
qwen3:1.7b 59.84
deepseek-r1:1.5b 51.62
gemma3:1b 51.38
gemma3:4b 38.83
qwen3:4b 30.29
deepseek-r1:7b 27.77
llama3.1:8b 26.34
qwen3:8b 22.05
deepseek-r1:8b 22.68

单卡 8GB 适合跑 8B 以下模型,小模型可达 50~118 t/s,7B~8B 在 22~27 t/s


双卡 P104-100 速度测试

模型 速度 (tokens/s)
gpt-oss:20b 28.14
gemma3:12b 16.53
deepseek-r1:14b 14.44
qwen3:14b 14.32

两张 79 元的卡组合就能跑 20B 模型,速度 28 t/s,性价比极高!


结论

配置 价格 适合模型
单卡(8GB) 79元 8B 以下,22~64 t/s
双卡(16GB) 158元 14B~20B,14~28 t/s

优点

  • 79 元一张,两张 158 元 = 16GB 显存
  • PCIe 延长线不影响推理速度
  • 20B 模型可达 28 t/s,日常可用

注意事项

  • Pascal 架构即将被 CUDA 抛弃,预计 CUDA 12.9 是最后支持版本
  • 部分模型长文本可能复读循环
  • 需要主板有足够 PCIe 插槽
  • 建议 Ubuntu 22.04 + NVIDIA 驱动 550+ + Ollama
p104-100-local-llm.txt · 最后更改: 2026/07/19 23:25 由 admin