CUDA llama.cpp server with TurboQuant KV cache and speculative decoding support.
8.0K
Sort by
| Digest | OS/ARCH | Compressed size |
|---|---|---|
0bc516c11db2 | linux/amd64 | 3.93 GB |
| Digest | OS/ARCH | Compressed size |
|---|---|---|
0bc516c11db2 | linux/amd64 | 3.93 GB |
| Digest | OS/ARCH | Compressed size |
|---|---|---|
0bc516c11db2 | linux/amd64 | 3.93 GB |