P104-100 虽然是矿卡,但才 79 块钱包邮一张,8GB 显存,两张组合就是 16GB,可以用 Ollama 跑 14B~20B 的大模型,性价比极高!
来源:矿渣再就业:双卡 P104-100 运行大语言模型可行性报告 · Reddit 讨论
即使第二张卡只跑在 PCIe 1.0 x1(理论带宽 250MB/s),对推理速度也没有明显影响!因为 LLM 推理时 PCIe I/O 带宽占用普遍在 100MB/s 以下。
mkdir ollama mv ollama-linux-amd64.tgz ollama/ cd ollama/ tar -xzvf ollama-linux-amd64.tgz rm ollama-linux-amd64.tgz
mkdir data
创建启动脚本 run.sh:
export HOME=/path/to/ollama/data/ ./bin/ollama serve
./run.sh ./ollama run qwen3:8b --verbose
| 模型 | 速度 (tokens/s) |
|---|---|
| gemma3:270m | 118.22 |
| qwen3:0.6b | 64.24 |
| qwen3:1.7b | 59.84 |
| deepseek-r1:1.5b | 51.62 |
| gemma3:1b | 51.38 |
| gemma3:4b | 38.83 |
| qwen3:4b | 30.29 |
| deepseek-r1:7b | 27.77 |
| llama3.1:8b | 26.34 |
| qwen3:8b | 22.05 |
| deepseek-r1:8b | 22.68 |
单卡 8GB 适合跑 8B 以下模型,小模型可达 50~118 t/s,7B~8B 在 22~27 t/s
| 模型 | 速度 (tokens/s) |
|---|---|
| gpt-oss:20b | 28.14 |
| gemma3:12b | 16.53 |
| deepseek-r1:14b | 14.44 |
| qwen3:14b | 14.32 |
两张 79 元的卡组合就能跑 20B 模型,速度 28 t/s,性价比极高!
| 配置 | 价格 | 适合模型 |
|---|---|---|
| 单卡(8GB) | 79元 | 8B 以下,22~64 t/s |
| 双卡(16GB) | 158元 | 14B~20B,14~28 t/s |