Cheap inference.
Mid-range GPUs that run quantized 7B–13B models at the lowest hourly rates.
| GPU | Tier | Architecture | VRAM | From | |
|---|---|---|---|---|---|
| consumer | 12GB | $0.038/hr | Compare → | ||
| workstation | 16GB | $0.048/hr | Compare → | ||
| consumer | 16GB | $0.068/hr | Compare → | ||
| consumer | 12GB | $0.076/hr | Compare → | ||
| consumer | 24GB | $0.082/hr | Compare → | ||
| consumer | 12GB | $0.091/hr | Compare → | ||
| consumer | 12GB | $0.12/hr | Compare → | ||
| consumer | 16GB | $0.12/hr | Compare → | ||
| workstation | 12GB | $0.12/hr | Compare → | ||
| consumer | 16GB | $0.13/hr | Compare → | ||
| consumer | 16GB | $0.13/hr | Compare → | ||
| consumer | 12GB | $0.16/hr | Compare → | ||
| workstation | 24GB | $0.16/hr | Compare → | ||
| consumer | 12GB | $0.17/hr | Compare → | ||
| consumer | 16GB | $0.17/hr | Compare → | ||
| workstation | 20GB | $0.18/hr | Compare → | ||
| workstation | 20GB | $0.19/hr | Compare → | ||
| consumer | 12GB | $0.19/hr | Compare → | ||
| workstation | 20GB | $0.20/hr | Compare → | ||
| consumer | 24GB | $0.21/hr | Compare → | ||
| consumer | 32GB | $0.21/hr | Compare → | ||
| consumer | 24GB | $0.26/hr | Compare → | ||
| consumer | 16GB | $0.28/hr | Compare → | ||
| workstation | 32GB | $0.29/hr | Compare → | ||
| consumer | 24GB | $0.30/hr | Compare → | ||
| workstation | 48GB | $0.32/hr | Compare → | ||
| workstation | 24GB | $0.38/hr | Compare → | ||
| consumer | 32GB | $0.41/hr | Compare → | ||
| workstation | 32GB | $0.49/hr | Compare → | ||
| workstation | 16GB | $0.50/hr | Compare → | ||
| workstation | 48GB | $0.54/hr | Compare → | ||
| workstation | 48GB | $0.63/hr | Compare → | ||
| workstation | 96GB | $0.86/hr | Compare → | ||
| workstation | 96GB | $0.91/hr | Compare → | ||
| workstation | 96GB | $0.93/hr | Compare → | ||
| workstation | 96GB | $0.99/hr | Compare → | ||
| workstation | 96GB | $1.15/hr | Compare → | ||
| workstation | 96GB | $1.69/hr | Compare → | ||
| workstation | 96GB | $1.69/hr | Compare → |
Ad