p104-100-local-llm
目录
P104-100 跑本地大模型 — 实测性能数据
P104-100 虽然是矿卡,但才 79 块钱包邮一张,8GB 显存,两张组合就是 16GB,可以用 Ollama 跑 14B~20B 的大模型,性价比极高!
来源:矿渣再就业:双卡 P104-100 运行大语言模型可行性报告 · Reddit 讨论
硬件环境
- 显卡:P104-100 × 2(8GB GDDR5 × 2 = 16GB)
- 主板:H61 + E3-1220v2
- 内存:8GB DDR3
- 连接:第一张 PCIe 1.0 x4,第二张通过矿卡延长线跑 PCIe 1.0 x1
- 软件:Ollama 0.11.10,Ubuntu Linux
即使第二张卡只跑在 PCIe 1.0 x1(理论带宽 250MB/s),对推理速度也没有明显影响!因为 LLM 推理时 PCIe I/O 带宽占用普遍在 100MB/s 以下。
部署 Ollama
1. 下载安装
mkdir ollama mv ollama-linux-amd64.tgz ollama/ cd ollama/ tar -xzvf ollama-linux-amd64.tgz rm ollama-linux-amd64.tgz
2. 指定模型存储位置
mkdir data
创建启动脚本 run.sh:
export HOME=/path/to/ollama/data/ ./bin/ollama serve
3. 启动并运行模型
./run.sh ./ollama run qwen3:8b --verbose
单卡 P104-100 速度测试
| 模型 | 速度 (tokens/s) |
|---|---|
| gemma3:270m | 118.22 |
| qwen3:0.6b | 64.24 |
| qwen3:1.7b | 59.84 |
| deepseek-r1:1.5b | 51.62 |
| gemma3:1b | 51.38 |
| gemma3:4b | 38.83 |
| qwen3:4b | 30.29 |
| deepseek-r1:7b | 27.77 |
| llama3.1:8b | 26.34 |
| qwen3:8b | 22.05 |
| deepseek-r1:8b | 22.68 |
单卡 8GB 适合跑 8B 以下模型,小模型可达 50~118 t/s,7B~8B 在 22~27 t/s
双卡 P104-100 速度测试
| 模型 | 速度 (tokens/s) |
|---|---|
| gpt-oss:20b | 28.14 |
| gemma3:12b | 16.53 |
| deepseek-r1:14b | 14.44 |
| qwen3:14b | 14.32 |
两张 79 元的卡组合就能跑 20B 模型,速度 28 t/s,性价比极高!
结论
| 配置 | 价格 | 适合模型 |
|---|---|---|
| 单卡(8GB) | 79元 | 8B 以下,22~64 t/s |
| 双卡(16GB) | 158元 | 14B~20B,14~28 t/s |
优点
- 79 元一张,两张 158 元 = 16GB 显存
- PCIe 延长线不影响推理速度
- 20B 模型可达 28 t/s,日常可用
注意事项
- Pascal 架构即将被 CUDA 抛弃,预计 CUDA 12.9 是最后支持版本
- 部分模型长文本可能复读循环
- 需要主板有足够 PCIe 插槽
- 建议 Ubuntu 22.04 + NVIDIA 驱动 550+ + Ollama
p104-100-local-llm.txt · 最后更改: 2026/07/19 23:25 由 admin