aivrar / vllm-windows-build Sponsor Star 33 Code Issues Pull requests Native Windows vLLM 0.25.1—prebuilt Python 3.13/CUDA 12.8 wheels for RTX 30/40/50 GPUs, no WSL or Docker. OpenAI-compatible serving with Triton/FlashAttention, 10 KV-cache compression formats, Multi-TurboQuant, and experimental persistent CPU/NVMe KV offload. windows gpu cuda pytorch nvidia triton msvc quantization kv-cache awq llm llm-serving vllm llm-inference flash-attention qwen kv-cache-compression turboquant vllm-windows multi-turboquant Updated Jul 19, 2026 Python
palatalised-chancellorsville108 / turboquant-pytorch Star 1 Code Issues Pull requests Accelerate LLM KV cache compression with a PyTorch TurboQuant implementation for efficient, high-quality vector quantization. windows machine-learning deep-learning cpp retrieval gpu cuda transformers pytorch triton attention mlx libtorch kv-cache apple-silicon llm-inference kv-cache-compression vector-compression multi-turboquant Updated Jul 27, 2026