目录

P104-100 跑本地大模型 — 实测性能数据

P104-100 虽然是矿卡,但才 79 块钱包邮一张,8GB 显存,两张组合就是 16GB,可以用 Ollama 跑 14B~20B 的大模型,性价比极高!

来源:矿渣再就业:双卡 P104-100 运行大语言模型可行性报告 · Reddit 讨论


硬件环境

即使第二张卡只跑在 PCIe 1.0 x1(理论带宽 250MB/s),对推理速度也没有明显影响!因为 LLM 推理时 PCIe I/O 带宽占用普遍在 100MB/s 以下。


部署 Ollama

1. 下载安装

mkdir ollama
mv ollama-linux-amd64.tgz ollama/
cd ollama/
tar -xzvf ollama-linux-amd64.tgz
rm ollama-linux-amd64.tgz

2. 指定模型存储位置

mkdir data

创建启动脚本 run.sh:

export HOME=/path/to/ollama/data/
./bin/ollama serve

3. 启动并运行模型

./run.sh
./ollama run qwen3:8b --verbose

单卡 P104-100 速度测试

模型 速度 (tokens/s)
gemma3:270m 118.22
qwen3:0.6b 64.24
qwen3:1.7b 59.84
deepseek-r1:1.5b 51.62
gemma3:1b 51.38
gemma3:4b 38.83
qwen3:4b 30.29
deepseek-r1:7b 27.77
llama3.1:8b 26.34
qwen3:8b 22.05
deepseek-r1:8b 22.68

单卡 8GB 适合跑 8B 以下模型,小模型可达 50~118 t/s,7B~8B 在 22~27 t/s


双卡 P104-100 速度测试

模型 速度 (tokens/s)
gpt-oss:20b 28.14
gemma3:12b 16.53
deepseek-r1:14b 14.44
qwen3:14b 14.32

两张 79 元的卡组合就能跑 20B 模型,速度 28 t/s,性价比极高!


结论

配置 价格 适合模型
单卡(8GB) 79元 8B 以下,22~64 t/s
双卡(16GB) 158元 14B~20B,14~28 t/s

优点

注意事项