Model catalog snapshot 2025-08-20
Frozen snapshot taken 2025-08-20. The current lineup is in the model catalog. Prices are per million tokens, in US dollars (USD), and reflect the proprietary Merki serving stack: every hosted price sits 25–35% below the cheapest published list price for the same model. Usage draws down credits. Cache hits are billed at 50% of the listed input rate. See Pricing and Caching.
Cells that are not available read n/a.
| Model | Quant | Context | Input $/M | Output $/M | Modalities | Tok/s | TTFT | Uptime | Model card |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek-V3 (0324) | FP8 | 128K | $0.200 | $0.800 | Text | 68.4 | 0.92 s | 99.9% | Model card · Speed benchmark |
| DeepSeek-R1 | FP8 | 128K | $0.400 | $1.600 | Text | 41.2 | 1.45 s | 99.9% | Model card · Speed benchmark |
| GLM-4.5 | BF16 | 128K | $0.300 | $1.200 | Text | 72.8 | 0.88 s | 99.9% | Model card · Speed benchmark |
| GLM-4.5 | FP8 | 128K | $0.300 | $1.200 | Text | 88.5 | 0.71 s | 99.9% | Model card · Speed benchmark |
| Kimi-K2 | BF16 | 256K | $0.400 | $1.600 | Text | 52.3 | 1.10 s | 99.9% | Model card · Speed benchmark |
| Kimi-K2 | FP8 | 256K | $0.400 | $1.600 | Text | 64.7 | 0.95 s | 99.9% | Model card · Speed benchmark |
| MiniMax-M1 | BF16 | 1M | $0.450 | $1.800 | Text | 48.9 | 1.25 s | n/a | Model card · Speed benchmark |
| MiniMax-M1 | FP8 | 1M | $0.450 | $1.800 | Text | 59.1 | 1.02 s | n/a | Model card · Speed benchmark |
| Mistral Large 2 | BF16 | 128K | $1.500 | $4.500 | Text | 55.6 | 0.98 s | n/a | Model card · Speed benchmark |
| Mistral Small 3.1 | BF16 | 128K | $0.300 | $0.900 | Text, image | 96.3 | 0.62 s | n/a | Model card · Speed benchmark |
| Qwen3-235B-A22B | BF16 | 128K | $0.250 | $1.000 | Text | 44.8 | 1.38 s | n/a | Model card · Speed benchmark |
| Qwen3-235B-A22B | FP8 | 128K | $0.250 | $1.000 | Text | 58.2 | 1.05 s | n/a | Model card · Speed benchmark |
| Qwen3-235B-A22B | INT4 | 128K | $0.250 | $1.000 | Text | 71.5 | 0.89 s | n/a | Model card · Speed benchmark |
| Qwen3-32B | BF16 | 128K | $0.120 | $0.480 | Text | 82.4 | 0.74 s | 99.9% | Model card · Speed benchmark |
| Qwen3-32B | INT4 | 128K | $0.120 | $0.480 | Text | 104.6 | 0.58 s | 99.9% | Model card · Speed benchmark |
| Qwen3-32B | GGUF | 128K | $0.120 | $0.480 | Text | 97.8 | 0.63 s | 99.9% | Model card · Speed benchmark |
| Llama-4-Scout | BF16 | 10M | $0.152 | $0.544 | Text, image | 94.0 | 0.84 s | n/a | Model card · Speed benchmark |
| Llama-4-Scout | GGUF | 10M | $0.152 | $0.544 | Text, image | 94.0 | 0.84 s | n/a | Quantized models · Speed benchmark |
| Gemma-3-27B | BF16 | 128K | $0.100 | $0.400 | Text, image | 89.2 | 0.66 s | 99.9% | Model card · Speed benchmark |
| Gemma-3-27B | GGUF | 128K | $0.100 | $0.400 | Text, image | 101.5 | 0.55 s | 99.9% | Model card · Speed benchmark |
| Phi-4 | BF16 | 128K | $0.100 | $0.400 | Text | 105.3 | 0.51 s | 99.9% | Model card · Speed benchmark |
| Phi-4 | FP8 | 128K | $0.100 | $0.400 | Text | 118.7 | 0.44 s | 99.9% | Model card · Speed benchmark |
Snapshots
This is a frozen snapshot. For the current lineup, see the model catalog.