From 22356ee2b3407074c28bbcae8a543c2eafca43db Mon Sep 17 00:00:00 2001 From: velaraptor-runpod Date: Thu, 30 Apr 2026 18:39:07 -0500 Subject: [PATCH] feat: upgrade vLLM to 0.20.0 - Bump vllm[flashinfer] to 0.20.0 in Dockerfile - Remove io_processor param from OpenAIServingRender (dropped in 0.20.0) Co-Authored-By: Claude Sonnet 4.6 --- Dockerfile | 2 +- src/engine.py | 1 - 2 files changed, 1 insertion(+), 2 deletions(-) diff --git a/Dockerfile b/Dockerfile index 1f05b31..6e55e64 100644 --- a/Dockerfile +++ b/Dockerfile @@ -10,7 +10,7 @@ RUN ldconfig /usr/local/cuda-12.9/compat/ # Install vLLM with FlashInfer - use CUDA 12.9 PyTorch wheels RUN uv pip install --system "packaging>=24.2" && \ - uv pip install --system "vllm[flashinfer]==0.19.1" --extra-index-url https://download.pytorch.org/whl/cu129 + uv pip install --system "vllm[flashinfer]==0.20.0" --extra-index-url https://download.pytorch.org/whl/cu129 # Install additional Python dependencies (after vLLM to avoid PyTorch version conflicts) COPY builder/requirements.txt /requirements.txt diff --git a/src/engine.py b/src/engine.py index 80bf72b..0fa60c9 100644 --- a/src/engine.py +++ b/src/engine.py @@ -285,7 +285,6 @@ class OpenAIvLLMEngine(vLLMEngine): self.openai_serving_render = OpenAIServingRender( model_config=self.llm.model_config, renderer=self.llm.renderer, - io_processor=self.llm.io_processor, model_registry=self.serving_models.registry, request_logger=None, chat_template=chat_template,